26.03. 3แแ ฎแแ ก | Microsoft Research, Google, Tencent, Meta, Alibaba, Meituan

๊ธ์ฃผ ์บ์นํ์ดํผ๋ Microsoft Research, Google, Tencent, Meta, Alibaba, Meituan๊ณผ ํจ๊ปํฉ๋๋ค. 3๋ถ๋ง ํฌ์ํด ์ฑ ๋๋ฌ๋ณด๊ณ , ๋น ๋ฅด๊ฒ ๋ฐ๋๋ ๊ธฐ์ ์ ๋ฐฉํฅ์ฑ์ ๋์น์ง ๋ง์ธ์!
๐ ๋น๋์ค ์์ฑ ๋ชจ๋ธ์ ์ถ๋ก ๋ฅ๋ ฅ๊ณผ ์๋ ์๋ฎฌ๋ ์ด์
์ด ์ด๋ฒ ์ฃผ์ ํต์ฌ ํค์๋์
๋๋ค
๐ฅ LLM ์์ด์ ํธ์ '๊ฒฝํ ํ์ต'๊ณผ '์๊ธฐ ์งํ'๊ฐ ์๋ก์ด ์ฐ๊ตฌ ํ๋ฆ์ผ๋ก ๋ถ์ํ๊ณ ์์ต๋๋ค
๐ 1,600๊ฐ ์ธ์ด ๋ฒ์ญ๋ถํฐ ์คํ
๋ ์ค VR ๋ ๋๋ง๊น์ง, AI๊ฐ ์ปค๋ฒํ๋ ๋ฒ์๊ฐ ๊ทน์ ์ผ๋ก ํ์ฅ๋๊ณ ์์ต๋๋ค
Demystifing Video Reasoning
๐๏ธ ์์: SenseTime, CUHK, NTU
๐ท๏ธ ํต์ฌ ํค์๋: Video Reasoning, Chain-of-Steps, Diffusion Transformers
๐ญ ์ด๋ฐ ์ง๋ฌธ์ ํด๋ณธ ์ ์๋์?
๋น๋์ค ์์ฑ ๋ชจ๋ธ์ด ์ ๋ง๋ก '์ถ๋ก '์ ํ ์ ์์๊น?
์์ ์ ๋ ผ๋ฆฌ์ ์ ๊ฐ๋ ํ๋ ์ ์์๋๋ก ๋ง๋ค์ด์ง๋ ๊ฑธ๊น?
๋ํจ์ ๋ชจ๋ธ ๋ด๋ถ์์ ์ค์ ๋ก ๋ฌด์จ ์ผ์ด ๋ฒ์ด์ง๊ณ ์์๊น?
์ ฐํ๊ฐ ์๋ฆฌ๋ฅผ ํ ๋, ๊ฐ์ ๋ณด๊ณ ์กฐ์ ํ๊ณ ๋๋ก ์ฒ์๋ถํฐ ๋ค์ ์์ํ์ฃ . ๋น๋์ค ๋ํจ์ ๋ชจ๋ธ๋ ๋ง์ฐฌ๊ฐ์ง์์ต๋๋ค. ์ด ์ฐ๊ตฌ๋ ๊ธฐ์กด์ 'ํ๋ ์ ์์๋๋ก ์ถ๋ก ํ๋ค(Chain-of-Frames)' ๊ฐ์ ์ ๋ค์ง๊ณ , ์ค์ ๋ก๋ ๋๋ ธ์ด์ง ๋จ๊ณ๋ฅผ ๋ฐ๋ผ ์ถ๋ก ์ด ์ ๊ฐ๋๋ค๋ Chain-of-Steps(CoS) ๋ฉ์ปค๋์ฆ์ ๋ฐ๊ฒฌํ์ต๋๋ค. ์ด๊ธฐ ๋จ๊ณ์์ ์ฌ๋ฌ ํ๋ณด ํด๋ต์ ํ์ํ๊ณ , ์ ์ง์ ์ผ๋ก ์ต์ข ๋ต์ ์๋ ดํ๋ ๊ณผ์ ์ด ๊ด์ฐฐ๋ฉ๋๋ค.
ํนํ ์ฃผ๋ชฉํ ์ :
์ํน ๋ฉ๋ชจ๋ฆฌ, ์๊ธฐ๊ต์ , ์ธ์ง ํ ํ๋ ๋ฑ 3๊ฐ์ง ์ฐฝ๋ฐ์ ์ถ๋ก ํ๋์ ์ต์ด๋ก ๊ท๋ช
Diffusion Transformer ๋ด๋ถ์์ ์ด๊ธฐ ๋ ์ด์ดโ์ง๊ฐ, ์ค๊ฐโ์ถ๋ก , ํ๊ธฐโํตํฉ์ด๋ผ๋ ๊ธฐ๋ฅ์ ๋ถํ ๋ฐ๊ฒฌ
๋์ผ ๋ชจ๋ธ์ ๋ค๋ฅธ ์๋ ์ ์ฌ ๊ฒฝ๋ก๋ฅผ ์์๋ธํ๋ ๊ฒ๋ง์ผ๋ก ์ถ๋ก ์ฑ๋ฅ ํฅ์ (ํ์ต ์์ด!)
๐ฏ ์ ์ด๊ฒ์ด ๊ฒ์ ์ฒด์ธ์ ์ธ๊ฐ? : ๋น๋์ค ๋ชจ๋ธ์ ์ถ๋ก ์ '๋ธ๋๋ฐ์ค'๋ก ์ทจ๊ธ โ ๋๋ ธ์ด์ง ์คํ ๋จ์์ ์ฒด๊ณ์ ์ดํด์ ํ์ต-์๋ ๊ฐ์ ์ ๋ต ์ ์
Online Experiential Learning for Language Models
๐๏ธ ์์: Microsoft Research
๐ท๏ธ ํต์ฌ ํค์๋: Online Learning, Experience Distillation, Context Distillation
๐ญ ์ด๋ฐ ์ง๋ฌธ์ ํด๋ณธ ์ ์๋์?
LLM์ด ๋ฐฐํฌ ํ์๋ ๊ณ์ ๋ฐ์ ํ ์๋ ์์๊น?
์ค์ ์ฌ์ฉ์์์ ์ํธ์์ฉ ๋ฐ์ดํฐ๋ฅผ ํ์ต์ ํ์ฉํ ๋ฐฉ๋ฒ์?
์คํ๋ผ์ธ ํ๋ จ์ ํ๊ณ๋ฅผ ์ด๋ป๊ฒ ๋์ด์ค ์ ์์๊น?
์ด์ ๋ฉดํ๋ฅผ ๋ธ ๋, ์ด๋ก ์ํ๊ณผ ์ค์ ๋๋ก ์ฃผํ ๊ฒฝํ์ ์ฐจ์์ด ๋ค๋ฆ ๋๋ค. ์ง๊ธ๊น์ง์ LLM์ '๋ฉดํ ์ํ'๊น์ง๋ง ์ค๋น๋ ์ํ์์ฃ . Microsoft Research๊ฐ ์ ์ํ OEL ํ๋ ์์ํฌ๋ ์ค์ ๋ฐฐํฌ ํ๊ฒฝ์์ ์ถ์ ๋ ๊ฒฝํ์ ์ถ์ถํ๊ณ , ์ด๋ฅผ on-policy context distillation์ผ๋ก ๋ชจ๋ธ์ ํตํฉํฉ๋๋ค. ์ฌ์ฉ์ ํ๊ฒฝ์ ์ ๊ทผํ์ง ์๊ณ ๋ ์ง์์ ๊ฐ์ ์ด ๊ฐ๋ฅํ ๊ฒ์ด ํต์ฌ์ ๋๋ค.
ํนํ ์ฃผ๋ชฉํ ์ :
๋ฐ๋ณต ๋ผ์ด๋๋ง๋ค ์์ ์ ํ๋์ ํ ํฐ ํจ์จ์ฑ ๋ชจ๋ ์ผ๊ด์ ์ผ๋ก ํฅ์
์์ trajectory ๋๋น ์ถ์ถ๋ ๊ฒฝํ ์ง์์ด ํ์ ํ ๋ ํจ๊ณผ์
๋น์ ํ(OOD) ํ๊ฒฝ ์ฑ๋ฅ๋ ์ ์ง๋์ด ์ผ๋ฐํ ๋ฅ๋ ฅ ๋ณด์กด
๐ฏ ์ ์ด๊ฒ์ด ๊ฒ์ ์ฒด์ธ์ ์ธ๊ฐ? : ์คํ๋ผ์ธ ์ ์ ํ์ต โ ๋ฐฐํฌ ํ์๋ ์๊ธฐ ๊ฒฝํ์ผ๋ก ์งํํ๋ ์จ๋ผ์ธ ํ์ต ๋ฃจํ
WorldCam: Interactive Autoregressive 3D Gaming Worlds with Camera Pose as a Unifying Geometric Representation
๐๏ธ ์์: KAIST
๐ท๏ธ ํต์ฌ ํค์๋: World Model, Camera Pose, 3D Consistency
๐ญ ์ด๋ฐ ์ง๋ฌธ์ ํด๋ณธ ์ ์๋์?
AI๊ฐ ์์ฑํ ๊ฒ์ ์๋๋ฅผ ์์ ๋กญ๊ฒ ํํํ ์ ์์๊น?
์ด์ ์ ๋ฐฉ๋ฌธํ ์ฅ์๋ฅผ ๋ค์ ๊ฐ์ ๋ ๋๊ฐ์ด ๋ณด์ผ๊น?
์ฌ์ฉ์์ ์ ๋ฐํ ์ก์ ์ปจํธ๋กค์ด ๊ฐ๋ฅํ ๊น?
VR ๊ฒ์์์ ๋ค๋์๋ดค๋๋ ๋ฐฉ๊ธ ๋ณธ ๊ฑด๋ฌผ์ด ์ฌ๋ผ์ ธ ์๋ค๋ฉด? ๊ธฐ์กด ์๋ ๋ชจ๋ธ๋ค์ ์ฌ์ฉ์ ์ก์ ์ ์ถ์์ ์ ํธ๋ก ์ฒ๋ฆฌํด ์ด๋ฐ ๋ฌธ์ ๊ฐ ๋น๋ฒํ์ต๋๋ค. KAIST ์ฐ๊ตฌ์ง์ ์นด๋ฉ๋ผ ํฌ์ฆ๋ฅผ ๊ธฐํํ์ ํตํฉ ํํ์ผ๋ก ์ค์ ํ์ฌ ์ฆ๊ฐ์ ์ก์ ์ ์ด์ ์ฅ๊ธฐ์ 3D ์ผ๊ด์ฑ์ ๋์์ ํด๊ฒฐํ์ต๋๋ค. 6-DoF ์นด๋ฉ๋ผ ํฌ์ฆ๋ฅผ ๋ฆฌ ๋์(Lie algebra)๋ก ํํํ๊ณ , ๊ธ๋ก๋ฒ ํฌ์ฆ๋ฅผ ๊ณต๊ฐ ์ธ๋ฑ์ค๋ก ํ์ฉํ์ฌ ๊ณผ๊ฑฐ ๊ด์ธก์ ๊ธฐํํ์ ์ผ๋ก ์ผ๊ด๋๊ฒ ์ฌ๋ฐฉ๋ฌธํฉ๋๋ค.
ํนํ ์ฃผ๋ชฉํ ์ :
3,000๋ถ ๋ถ๋์ ์ค์ ๊ฒ์ํ๋ ์ด ๋ฐ์ดํฐ์ ๊ตฌ์ถ (์นด๋ฉ๋ผ ๊ถค์ + ํ ์คํธ ์ด๋ ธํ ์ด์ )
์ก์ ์ ์ด ๊ฐ๋ฅ์ฑ, ์ฅ๊ธฐ ์๊ฐ ํ์ง, 3D ๊ณต๊ฐ ์ผ๊ด์ฑ ๋ชจ๋์์ SOTA ๋๋น ํฌ๊ฒ ์ฐ์
๋ฌผ๋ฆฌ ๊ธฐ๋ฐ ์ฐ์ ์ก์ ๊ณต๊ฐ์ผ๋ก ์ ๋ฐํ 6-DoF ์ ์ด ๊ตฌํ
๐ฏ ์ ์ด๊ฒ์ด ๊ฒ์ ์ฒด์ธ์ ์ธ๊ฐ? : ์ถ์์ ์ก์ ์ ํธ ๊ธฐ๋ฐ ์๋ ๋ชจ๋ธ โ ์นด๋ฉ๋ผ ํฌ์ฆ ๊ธฐ๋ฐ์ ๊ธฐํํ์ ์ผ๋ก ์ ํํ ์ธํฐ๋ํฐ๋ธ 3D ์๋
MosaicMem: Hybrid Spatial Memory for Controllable Video World Models
๐๏ธ ์์: Georgia Tech
๐ท๏ธ ํต์ฌ ํค์๋: Spatial Memory, Video World Model, Hybrid 3D Memory
๐ญ ์ด๋ฐ ์ง๋ฌธ์ ํด๋ณธ ์ ์๋์?
๋น๋์ค ์๋ ๋ชจ๋ธ์ด ์นด๋ฉ๋ผ๋ฅผ ๋๋ ค๋ ์ฅ๋ฉด์ ๊ธฐ์ตํ ์ ์์๊น?
๋ช ์์ 3D์ ์๋ฌต์ ๋ฉ๋ชจ๋ฆฌ์ ์ฅ๋จ์ ์ ๋์์ ๊ฐ์ ธ์ฌ ๋ฐฉ๋ฒ์?
๋ถ ๋จ์์ ๊ธด ํ์์์๋ ์ผ๊ด์ฑ์ ์ ์งํ ์ ์์๊น?
ํผ์ฆ ์กฐ๊ฐ์ ๋ง์ถ๋ฏ, MosaicMem์ ์์ ํจ์น๋ฅผ 3D๋ก ๋ค์ด์ฌ๋ ค ์ ํํ ์์น ์ถ์ ๊ณผ ํ๊ฒ ๊ฒ์์ ์ํํ๋ฉด์๋, ๋ชจ๋ธ ๊ณ ์ ์ ์ปจ๋์ ๋์ ํ์ฉํด ํ๋กฌํํธ ๋ฐ๋ฅด๊ธฐ ๋ฅ๋ ฅ์ ๋ณด์กดํฉ๋๋ค. ์ฟผ๋ฆฌ๋ ๋ทฐ์์ ๊ณต๊ฐ ์ ๋ ฌ๋ ํจ์น๋ฅผ ํฉ์ฑํ๊ณ , ๋ณํด์ผ ํ ๋ถ๋ถ์ ๋ชจ๋ธ์ด ์ธํ์ธํ ํ๋ patch-and-compose ๋ฐฉ์์ด ํต์ฌ์ ๋๋ค.
ํนํ ์ฃผ๋ชฉํ ์ :
์๋ฌต์ ๋ฉ๋ชจ๋ฆฌ ๋๋น ํฌ์ฆ ์ค์๋ ฅ ํฅ์, ๋ช ์์ ๋ฒ ์ด์ค๋ผ์ธ ๋๋น ๋์ ๋ชจ๋ธ๋ง ๊ฐํ
๋ถ ๋จ์ ๋ด๋น๊ฒ์ด์ , ๋ฉ๋ชจ๋ฆฌ ๊ธฐ๋ฐ ์ฌ ํธ์ง, ์คํ ๋ฆฌ๊ทธ๋ ์๋ธ ๋กค์์๊น์ง ์ง์
PRoPE ์นด๋ฉ๋ผ ์ปจ๋์ ๋๊ณผ 2๊ฐ์ง ์๋ก์ด ๋ฉ๋ชจ๋ฆฌ ์ ๋ ฌ ๊ธฐ๋ฒ ๋์
๐ฏ ์ ์ด๊ฒ์ด ๊ฒ์ ์ฒด์ธ์ ์ธ๊ฐ? : ๋ช ์์ 3D vs ์๋ฌต์ ๋ฉ๋ชจ๋ฆฌ ํ์ผ โ ํ์ด๋ธ๋ฆฌ๋ ๊ณต๊ฐ ๋ฉ๋ชจ๋ฆฌ๋ก ๋ ๊ฐ์ง ์ฅ์ ์ ๋์ ํ๋ณด
MetaClaw: Just Talk -- An Agent That Meta-Learns and Evolves in the Wild
๐๏ธ ์์: UCSC, UNC
๐ท๏ธ ํต์ฌ ํค์๋: Meta-Learning, Continual Learning, LLM Agent
๐ญ ์ด๋ฐ ์ง๋ฌธ์ ํด๋ณธ ์ ์๋์?
๋ฐฐํฌ๋ AI ์์ด์ ํธ๊ฐ ์ฌ์ฉ์ ๋์ฆ ๋ณํ์ ์ค์ค๋ก ์ ์ํ ์ ์์๊น?
๋ค์ดํ์ ์์ด ์์ด์ ํธ ๋ฅ๋ ฅ์ ์ ๊ทธ๋ ์ด๋ํ ๋ฐฉ๋ฒ์?
์คํฌ ๋ผ์ด๋ธ๋ฌ๋ฆฌ์ ๊ธฐ๋ณธ ์ ์ฑ ์ ๋์์ ์งํ์ํฌ ์ ์์๊น?
์๋์ฐจ์ ์ํํธ์จ์ด ์ ๋ฐ์ดํธ๊ฐ ์ฃผํ ์ค์ ์ด๋ฃจ์ด์ง๋ค๊ณ ์์ํด๋ณด์ธ์. MetaClaw๊ฐ ๋ฐ๋ก ๊ทธ ๊ฐ๋ ์ ๋๋ค. ์คํจ ๊ฒฝํ์์ ์๋ก์ด ์คํฌ์ ํฉ์ฑํ์ฌ ์ฆ๊ฐ์ ๊ฐ์ (๋ค์ดํ์ ์ ๋ก)์ ๋ฌ์ฑํ๊ณ , ์ฌ์ฉ์ ๋นํ์ฑ ์๊ฐ์ RL-PRM ๊ธฐ๋ฐ ์ ์ฑ ์ต์ ํ๋ฅผ ์ํํฉ๋๋ค. ๋ ๋ฉ์ปค๋์ฆ์ด ์ํธ ๊ฐํ๋์ด ์์ด์ ํธ๊ฐ ์ง์์ ์ผ๋ก ๋ฐ์ ํฉ๋๋ค.
ํนํ ์ฃผ๋ชฉํ ์ :
์คํฌ ๊ธฐ๋ฐ ๋น ๋ฅธ ์ ์์ผ๋ก ์ ํ๋ ์ต๋ 32% ์๋ ํฅ์
Kimi-K2.5 ์ ํ๋ 21.4% โ 40.6%๋ก ๊ฐ์ , ๋ณตํฉ ๊ฐ๊ฑด์ฑ 18.3% ์ฆ๊ฐ
ํ๋ก์ ๊ธฐ๋ฐ ์ํคํ ์ฒ๋ก ๋ก์ปฌ GPU ์์ด๋ ๋ํ LLM ์ค์ผ์ผ๋ง ๊ฐ๋ฅ
๐ฏ ์ ์ด๊ฒ์ด ๊ฒ์ ์ฒด์ธ์ ์ธ๊ฐ? : ์ ์ ์ผ๋ก ๋ฐฐํฌ๋๋ ์์ด์ ํธ โ ์ค์ ์์ ์คํฌ๊ณผ ์ ์ฑ ์ด ๊ณต์งํํ๋ ๋ฉํ๋ฌ๋ ์์ด์ ํธ
SparkVSR: Interactive Video Super-Resolution via Sparse Keyframe Propagation
๐๏ธ ์์: Google
๐ท๏ธ ํต์ฌ ํค์๋: Video Super-Resolution, Keyframe Propagation, Interactive Editing
๐ญ ์ด๋ฐ ์ง๋ฌธ์ ํด๋ณธ ์ ์๋์?
์์ ์ดํด์๋์์ ์์น ์๋ ์ํฐํฉํธ๋ฅผ ์ฌ์ฉ์๊ฐ ์ง์ ์์ ํ ์ ์์๊น?
๋ชจ๋ ํ๋ ์์ด ์๋ ํต์ฌ ํ๋ ์๋ง ์ฒ๋ฆฌํด๋ ๋ ๊น?
์๋ ์ํ ๋ณต์์ด๋ ์คํ์ผ ๋ณํ์๋ ๊ฐ์ ๋ชจ๋ธ์ ์ธ ์ ์์๊น?
์ฌ์ง ํธ์ง์์ 'ํฌ์ธํธ' ๋ช ๊ฐ๋ง ์ฐ์ผ๋ฉด ์ ์ฒด ์ด๋ฏธ์ง๊ฐ ๋ณํ๋ ๊ฒ์ฒ๋ผ, SparkVSR์ ์์์ ํคํ๋ ์๋ง ์ดํด์๋๋ก ์ฒ๋ฆฌํ ๋ค ๊ทธ ์ ๋ณด๋ฅผ ์ ์ฒด ์์์ ์ ํํฉ๋๋ค. ๊ธฐ์กด VSR์ด ๋ธ๋๋ฐ์ค์ฒ๋ผ ๊ฒฐ๊ณผ๋ฅผ ๋ฐ์๋ค์ฌ์ผ ํ๋ค๋ฉด, ์ด ์์คํ ์ ํคํ๋ ์ ์ ํ๊ณผ ๊ฐ์ด๋์ค ์กฐ์ ์ ํตํด ์ฌ์ฉ์ ์ ์ด๋ฅผ ๊ฐ๋ฅํ๊ฒ ํฉ๋๋ค.
ํนํ ์ฃผ๋ชฉํ ์ :
CLIP-IQA 24.6%, DOVER 21.8%, MUSIQ 5.6% ๋ฒ ์ด์ค๋ผ์ธ ๋๋น ํฅ์
๋ ํผ๋ฐ์ค ํคํ๋ ์์ด ์๊ฑฐ๋ ๋ถ์์ ํด๋ ๊ฐ๊ฑดํ๊ฒ ์๋ํ๋ ๊ฐ์ด๋์ค ๋ฉ์ปค๋์ฆ
ํ์ต ์์ด old-film restoration, video style transfer์ ์ฆ์ ์ ์ฉ ๊ฐ๋ฅ
๐ฏ ์ ์ด๊ฒ์ด ๊ฒ์ ์ฒด์ธ์ ์ธ๊ฐ? : ๋ธ๋๋ฐ์ค VSR โ ํคํ๋ ์ ๊ธฐ๋ฐ ์ธํฐ๋ํฐ๋ธ ์ ์ด๋ก ์ฌ์ฉ์๊ฐ ๊ฒฐ๊ณผ๋ฅผ ์ฃผ๋ํ๋ ์ดํด์๋
Stereo World Model: Camera-Guided Stereo Video Generation
๐๏ธ ์์: Tencent, Meituan, HKU
๐ท๏ธ ํต์ฌ ํค์๋: Stereo Video, Binocular Generation, VR Rendering
๐ญ ์ด๋ฐ ์ง๋ฌธ์ ํด๋ณธ ์ ์๋์?
VR ์ฝํ ์ธ ๋ฅผ ์ํด ์์ ์คํ ๋ ์ค ์์์ ์๋ ์์ฑํ ์ ์์๊น?
๋ชจ๋ ธ RGB ์์์์ ๊น์ด ์ถ์ ์์ด 3D๋ฅผ ๋ง๋ค ์ ์์๊น?
๊ธฐ์กด ๋จ์ ๋ชจ๋ธ ํ์ดํ๋ผ์ธ์ ์๋ ๋ณ๋ชฉ์ ๊นฐ ์ ์์๊น?
3D ์ํ๋ฅผ ๋ง๋ค๋ ค๋ฉด ๋ณดํต ํ์ชฝ ๋ ์์์ ๋จผ์ ๋ง๋ ๋ค ๊น์ด ์ถ์ โ์ธํ์ธํ ์ผ๋ก ๋ค๋ฅธ ์ชฝ์ ํฉ์ฑํฉ๋๋ค. StereoWorld๋ ์ด ๋ฒ๊ฑฐ๋ก์ด ๊ณผ์ ์ ๊ฑด๋๋ฐ๊ณ , ์์ ์์์ End-to-End๋ก ๋์์ ์์ฑํฉ๋๋ค. ์นด๋ฉ๋ผ ์ธ์ RoPE์ ์ํผํด๋ผ prior๋ฅผ ํ์ฉํ ์คํ ๋ ์ค ์ดํ ์ ๋ถํด๊ฐ ํต์ฌ ์ค๊ณ์ ๋๋ค.
ํนํ ์ฃผ๋ชฉํ ์ :
๊ธฐ์กด ๋จ์โ๋ณํ ํ์ดํ๋ผ์ธ ๋๋น 3๋ฐฐ ๋น ๋ฅธ ์์ฑ ์๋
๋ทฐํฌ์ธํธ ์ผ๊ด์ฑ 5% ์ถ๊ฐ ํฅ์
๋ณ๋ ๊น์ด ์ถ์ ์ด๋ ์ธํ์ธํ ์์ด End-to-End VR ๋ ๋๋ง ๊ฐ๋ฅ
๐ฏ ์ ์ด๊ฒ์ด ๊ฒ์ ์ฒด์ธ์ ์ธ๊ฐ? : ๋จ์ ์์ฑ โ ๊น์ด ์ถ์ โ ์ธํ์ธํ ์ ๋ค๋จ๊ณ ํ์ดํ๋ผ์ธ โ ์์ ๋์ ์์ฑ์ผ๋ก ๋จ์ผ ์คํ VR ์์ ์ ์
Complementary Reinforcement Learning
๐๏ธ ์์: Alibaba
๐ท๏ธ ํต์ฌ ํค์๋: Reinforcement Learning, Experience Learning, Complementary Learning Systems
๐ญ ์ด๋ฐ ์ง๋ฌธ์ ํด๋ณธ ์ ์๋์?
RL ์์ด์ ํธ์ ๋ฎ์ ์ํ ํจ์จ์ฑ์ ์ด๋ป๊ฒ ํด๊ฒฐํ ์ ์์๊น?
๊ณผ๊ฑฐ ์ํผ์๋ ๊ฒฝํ์ ํ์ฌ ํ์ต์ ํจ๊ณผ์ ์ผ๋ก ๋ฐ์ํ๋ ๋ฐฉ๋ฒ์?
๊ฒฝํ๊ณผ ์ ์ฑ ์ด ์๋ก ๋ฐ๋ก ๋์ง ์๊ฒ ํ ์ ์์๊น?
์ธ๊ฐ์ ๋์๋ ํด๋ง(๋น ๋ฅธ ํ์ต)์ ์ ํผ์ง(๋๋ฆฐ ํตํฉ)์ด ์๋ณด์ ์ผ๋ก ์๋ํ๋ ํ์ต ์์คํ ์ด ์์ต๋๋ค. Alibaba์ Complementary RL์ ์ด ์๋ฆฌ๋ฅผ ์ฐจ์ฉํด ๊ฒฝํ ์ถ์ถ๊ธฐ์ ์ ์ฑ ์กํฐ๊ฐ RL ๋ฃจํ ์์์ ํจ๊ป ์งํํฉ๋๋ค. ์ถ์ถ๋ ๊ฒฝํ์ด ์กํฐ์ ์ฑ๊ณต์ ๊ธฐ์ฌํ๋์ง ์ฌ๋ถ์ ๋ฐ๋ผ ๊ฒฝํ ๊ด๋ฆฌ ์ ๋ต ์์ฒด๊ฐ ์ต์ ํ๋ฉ๋๋ค.
ํนํ ์ฃผ๋ชฉํ ์ :
๋จ์ผ ์์ ์๋๋ฆฌ์ค์์ ๊ฒฝํ ๋ฏธํ์ฉ RL ๋๋น 10% ์ฑ๋ฅ ํฅ์
๋ฉํฐํ์คํฌ ํ๊ฒฝ์์๋ ๊ฐ๊ฑดํ ํ์ฅ์ฑ ํ์ธ
๊ฒฝํ ์ถ์ถ๊ธฐ-์กํฐ ๊ณต์งํ๋ก '๊ฒฝํ-์ ์ฑ ๋ถ์ผ์น' ๋ฌธ์ ๊ทผ๋ณธ ํด๊ฒฐ
๐ฏ ์ ์ด๊ฒ์ด ๊ฒ์ ์ฒด์ธ์ ์ธ๊ฐ? : ์ ์ ๊ฒฝํ ์ ์ฅ or ์ ์ฑ ๊ณผ ๋ฌด๊ดํ ๊ฒฝํ โ ๊ฒฝํ๊ณผ ์ ์ฑ ์ด ์ค์๊ฐ์ผ๋ก ๊ณต์งํํ๋ ์๋ณด์ ํ์ต
Omnilingual MT: Machine Translation for 1,600 Languages
๐๏ธ ์์: Meta
๐ท๏ธ ํต์ฌ ํค์๋: Machine Translation, Multilingual, Low-Resource Languages
๐ญ ์ด๋ฐ ์ง๋ฌธ์ ํด๋ณธ ์ ์๋์?
์ธ๊ณ 7,000๊ฐ ์ธ์ด ์ค AI๊ฐ ๋ฒ์ญํ ์ ์๋ ๊ฑด ์ผ๋ง๋ ๋ ๊น?
๋ฐ์ดํฐ๊ฐ ๊ฑฐ์ ์๋ ์ธ์ด๋ ๊ณ ํ์ง ๋ฒ์ญ์ด ๊ฐ๋ฅํ ๊น?
70B ๋ชจ๋ธ ์์ด๋ ๊ฐ๋ ฅํ ๋ค๊ตญ์ด ๋ฒ์ญ์ ํ ์ ์์๊น?
๋ฐ๋ฒจํ ์ดํ ์ธ๋ฅ์ ์์์ด์๋ ๋ณดํธ ๋ฒ์ญ. Meta๊ฐ ๊ทธ ๊ฟ์ ํ ๋ฐ ๋ ๋ค๊ฐ๊ฐ์ต๋๋ค. Omnilingual MT๋ ์ต์ด๋ก 1,600๊ฐ ์ด์ ์ธ์ด๋ฅผ ์ง์ํ๋ ๋ฒ์ญ ์์คํ ์ ๋๋ค. ๋๊ท๋ชจ ๊ณต๊ฐ ์ฝํผ์ค์ ์์์ ํ๋ ์ด์ ๋ MeDLEY ๋ณ๋ ฌ ํ ์คํธ๋ฅผ ํตํฉํ๊ณ , LLM์ ๋์ฝ๋ ์ ์ฉ(OMT-LLaMA) ๋๋ ์ธ์ฝ๋-๋์ฝ๋(OMT-NLLB) ๋ฐฉ์์ผ๋ก ํนํ์์ผฐ์ต๋๋ค.
ํนํ ์ฃผ๋ชฉํ ์ :
1B~8B ํ๋ผ๋ฏธํฐ ๋ชจ๋ธ์ด 70B LLM ๋ฒ ์ด์ค๋ผ์ธ๊ณผ ๋๋ฑํ๊ฑฐ๋ ์ํํ๋ ๋ฒ์ญ ํ์ง
๊ธฐ์กด ๋ชจ๋ธ์ด '์ดํด'๋ ํ์ง๋ง '์์ฑ'์ ์คํจํ๋ ์ ์์ ์ธ์ด์์ ์ผ๊ด๋ ์์ฑ ๋ฌ์ฑ
BOUQuET, Met-BOUQuET ๋ฑ ์ธ๊ฐ ์์ฑ ํ๊ฐ ๋ฐ์ดํฐ์ ๊ณต๊ฐ
๐ฏ ์ ์ด๊ฒ์ด ๊ฒ์ ์ฒด์ธ์ ์ธ๊ฐ? : ~200๊ฐ ์ธ์ด ํ๊ฒ ๋ฒ์ญ์ ํ๊ณ โ 1,600๊ฐ ์ธ์ด๋ก ํ์ฅ, ์ ์์ ์ธ์ด์ '์์ฑ ์ฅ๋ฒฝ' ๋ํ
AdaMem: Adaptive User-Centric Memory for Long-Horizon Dialogue Agents
๐๏ธ ์์: Tencent, Tsinghua
๐ท๏ธ ํต์ฌ ํค์๋: Dialogue Memory, User Modeling, Adaptive Retrieval
๐ญ ์ด๋ฐ ์ง๋ฌธ์ ํด๋ณธ ์ ์๋์?
AI ์ฑ๋ด์ด ํ ๋ฌ ์ ๋ํ ๋ด์ฉ์ ์ ํํ ๊ธฐ์ตํ ์ ์์๊น?
์๋ฏธ์ ์ ์ฌ์ฑ๋ง์ผ๋ก ์ถฉ๋ถํ ์ ๋ณด๋ฅผ ๊ฒ์ํ ์ ์์๊น?
์ฌ์ฉ์์ ์ฑ๊ฒฉ๊ณผ ์ต๊ด๊น์ง ํ์ ํ๋ ๋ฉ๋ชจ๋ฆฌ ์์คํ ์ด ๊ฐ๋ฅํ ๊น?
์ค๋๋ ์น๊ตฌ์ ๋ํํ ๋ ์ฐ๋ฆฌ๋ ์ต๊ทผ ์ด์ผ๊ธฐ, ๊ณผ๊ฑฐ ์ํผ์๋, ์๋์ ์ฑ๊ฒฉ์ ์์ฐ์ค๋ฝ๊ฒ ์ค๊ฐ๋ฉฐ ๊ธฐ์ต์ ํ์ฉํฉ๋๋ค. AdaMem์ ์ด ์ธ๊ฐ์ ๊ธฐ์ต ๊ตฌ์กฐ๋ฅผ ์์ ๋ฉ๋ชจ๋ฆฌ, ์ํผ์๋ ๋ฉ๋ชจ๋ฆฌ, ํ๋ฅด์๋ ๋ฉ๋ชจ๋ฆฌ, ๊ทธ๋ํ ๋ฉ๋ชจ๋ฆฌ์ 4๊ฐ์ง๋ก ์ฒด๊ณํํ์ต๋๋ค. ์ง๋ฌธ์ ๋ฐ๋ผ ์๋ฏธ ๊ฒ์๊ณผ ๊ด๊ณ ์ธ์ ๊ทธ๋ํ ํ์ฅ์ ๋์ ์ผ๋ก ์กฐํฉํ๋ ์ ์ํ ๊ฒ์ ๋ผ์ฐํ ์ด ํต์ฌ์ ๋๋ค.
ํนํ ์ฃผ๋ชฉํ ์ :
LoCoMo ๋ฐ PERSONAMEM ๋ฒค์น๋งํฌ ๋ชจ๋์์ SOTA ๋ฌ์ฑ
์ญํ ์ ๋ฌธํ ํ์ดํ๋ผ์ธ์ผ๋ก ์ฆ๊ฑฐ ํฉ์ฑ๊ณผ ์๋ต ์์ฑ์ ๋ถ๋ฆฌ
์ ์ ๋ฉ๋ชจ๋ฆฌ ์ธ๋ถํ๊ฐ ์๋ ์ง๋ฌธ ์กฐ๊ฑด๋ถ ์ ์ํ ๊ฒ์ ๊ฒฝ๋ก ๊ตฌ์ถ
๐ฏ ์ ์ด๊ฒ์ด ๊ฒ์ ์ฒด์ธ์ ์ธ๊ฐ? : ์๋ฏธ ์ ์ฌ์ฑ ๊ธฐ๋ฐ ๋จ์ผ ๋ฉ๋ชจ๋ฆฌ โ 4๊ฐ์ง ๋ฉ๋ชจ๋ฆฌ + ์ง๋ฌธ ๋ง์ถคํ ์ ์์ ๊ฒ์์ผ๋ก ์ง์ ํ ์ฌ์ฉ์ ์ดํด
๋งค์ผ ๋ชฉ์์ผ ์ค์ 8์,
๋ฐ์ ๋น์ ์ ๊ธฐ์ ๋ฐ์ ์ ๋ค์ณ์ง์ง ์๊ฒ ๋ง๋ค์ด์ค
์ต์ AI ํธ๋ ๋ ์์ฝ๋ณธ์ด ์ ๋ฌ๋ฉ๋๋ค! ๐