25.11. 3แแ ฎแแ ก | ByteDance, Meta, Alibaba, NYU, CMU, Princeton, UT Austin

๊ธ์ฃผ ์บ์นํ์ดํผ๋ ByteDance, NYU, Meta, Alibaba, CMU, Princeton ๊ณผ ํจ๊ปํฉ๋๋ค. 3๋ถ๋ง ํฌ์ํด ์ฑ ๋๋ฌ๋ณด๊ณ , ๋น ๋ฅด๊ฒ ๋ฐ๋๋ ๊ธฐ์ ์ ๋ฐฉํฅ์ฑ์ ๋์น์ง ๋ง์ธ์!
๐ ์ต๊ทผ AI ์ฐ๊ตฌ์์๋ ์๊ธฐ ์งํ ์์ด์ ํธ์ ์๋ ๋ชจ๋ธ์ ํ์ฉํ ์ฅ๊ธฐ ์๋ฎฌ๋ ์ด์ ์ด ๋๋๋ฌ์ง๊ณ ์์ผ๋ฉฐ, ๋ฌผ๋ฆฌ ๋ฒ์น์ ๊ณ ๋ คํ ๋ก๋ด ์ ์ด์ 3D ๊ณต๊ฐ ์ธ์ ๊ธฐ์ ์ด ๊ธ์๋๋ก ๋ฐ์ ํ๊ณ ์์ต๋๋ค.
๐ LLM์ ์ถ๋ก ๋ฅ๋ ฅ ํฅ์์ ์ํ ์๊ธฐ ๊ฐ์ ํ๋ ์์ํฌ์ ๊ฐํํ์ต ๊ธฐ๋ฒ์ด ํ๋ฐํ ์ฐ๊ตฌ๋๊ณ ์์ผ๋ฉฐ, ํนํ ์ด๋ก ์ ๊ธฐ๋ฐ์ ๊ฐ์ถ ์๊ธฐ์ง๋ ํ์ต๊ณผ ์ธ๋ฐํ ์ค๋ฅ ์์ ๋ฉ์ปค๋์ฆ์ด ์ฃผ๋ชฉ๋ฐ๊ณ ์์ต๋๋ค.
๐ ์ด๋ค ์์ ์์๋ 3D ๊ณต๊ฐ์ ์๋ฒฝํ๊ฒ ์ฌ๊ตฌ์ฑํ๋ค.
๐๏ธ ์์: ByteDance
๐ท๏ธ ํต์ฌ ํค์๋: Depth-Ray Representation, Any-View Geometry, Unified Transformer
๐ญ ์ด๋ฐ ์ง๋ฌธ์ ํด๋ณธ ์ ์๋์?
"๋จ์ผ ์ด๋ฏธ์ง๋ง์ผ๋ก๋ ์ ํํ 3D ๊ณต๊ฐ์ ๋ณต์ํ ์ ์์๊น?"
"์นด๋ฉ๋ผ ์์น ์ ๋ณด ์์ด๋ ์ฌ๋ฌ ์์ ์ ํตํฉํ ์ ์์๊น?"
"๋ณต์กํ ๊ตฌ์กฐ ์์ด ํ๋์ ๋ชจ๋ธ๋ก ๋ชจ๋ 3D ์์ ์ ์ฒ๋ฆฌํ ์ ์์๊น?"
๋ชจ๋ ๊ฐ๋์์ ๋์์ ์ธ์์ ๋ฐ๋ผ๋ณด๋ ๊ฒ์ฒ๋ผ, Depth Anything 3๋ ๋จ์ผ transformer๋ก ์์ ๊ฐ์์ ์์ ์์ ์ผ๊ด๋ 3D ๊ณต๊ฐ์ ์ฌ๊ตฌ์ฑํฉ๋๋ค. ์นด๋ฉ๋ผ ํฌ์ฆ ์ ๋ณด ์ ๋ฌด์ ๊ด๊ณ์์ด ์๋ํ๋ฉฐ, depth-ray ํํ๋ง์ผ๋ก ๋ณต์กํ ๋ค์ค ์์ ํ์ต์ ํ์์ฑ์ ์ ๊ฑฐํ์ต๋๋ค. ํนํ ์ฃผ๋ชฉํ ์ :
๊ธฐ์กด SOTA์ธ VGGT ๋๋น ์นด๋ฉ๋ผ ํฌ์ฆ ์ ํ๋ 44.3%, ๊ธฐํํ์ ์ ํ๋ 25.1% ํฅ์
Depth Anything 2๋ฅผ ๋ฅ๊ฐํ๋ ๋จ์ ๊น์ด ์ถ์ ์ฑ๋ฅ
๋จ์ํ vanilla transformer๋ก ๊ตฌ์กฐ์ ํน์ํ ์์ด ๋ฌ์ฑํ ์ต์ฒจ๋จ ์ฑ๋ฅ
๐ฏ ์ ์ด๊ฒ์ด ๊ฒ์ ์ฒด์ธ์ ์ธ๊ฐ? : ์ ๋ฌธํ๋ 3D ์ํคํ ์ฒ โ ํตํฉ๋ plain transformer ๊ธฐ๋ฐ any-view ์ฌ๊ตฌ์ฑ์ ์ ํ์ ๊ฐ์กฐ
๐ ๋ ์์ธํ ๋ด์ฉ์ด ๊ถ๊ธํ๋ค๋ฉด : https://arxiv.org/abs/2511.10647
๐ง "ํด๋ฆฌ์คํฑ ์๋ ์๊ธฐ์ง๋ ํ์ต์ด ๊ฐ๋ฅํ ๊น?"
๐๏ธ ์์: Brown University, New York University, Meta
๐ท๏ธ ํต์ฌ ํค์๋: Joint-Embedding Predictive Architecture, SIGReg, Isotropic Gaussian
๐ญ ์ด๋ฐ ์ง๋ฌธ์ ํด๋ณธ ์ ์๋์?
"์๊ธฐ์ง๋ ํ์ต์์ ํํ ๋ถ๊ดด๋ฅผ ์ด๋ก ์ ์ผ๋ก ๋ฐฉ์งํ ์ ์์๊น?"
"stop-gradient๋ teacher-student ์์ด๋ ์์ ์ ์ธ ํ์ต์ด ๊ฐ๋ฅํ ๊น?"
"๋จ์ผ ํ์ดํผํ๋ผ๋ฏธํฐ๋ง์ผ๋ก ๋ค์ํ ์ํคํ ์ฒ์ ์ ์ฉํ ์ ์์๊น?"
๋ณต์กํ ํธ๋ฆญ ์์ด ์์ํ ์ด๋ก ์ผ๋ก ์๋ฒฝํจ์ ์ถ๊ตฌํ๋ฏ, LeJEPA๋ ๋ฑ๋ฐฉ์ฑ ๊ฐ์ฐ์์ ๋ถํฌ๋ฅผ ๊ฐ์ ํ์ฌ ํํ ๋ถ๊ดด๋ฅผ ๊ทผ๋ณธ์ ์ผ๋ก ํด๊ฒฐํ์ต๋๋ค. Sketched Isotropic Gaussian Regularization(SIGReg)์ ๋์ ํ์ฌ stop-gradient, teacher-student, ํ์ดํผํ๋ผ๋ฏธํฐ ์ค์ผ์ค๋ฌ ๋ฑ ๋ชจ๋ ํด๋ฆฌ์คํฑ์ ์ ๊ฑฐํ์ต๋๋ค. ํนํ ์ฃผ๋ชฉํ ์ :
ImageNet-1k์์ ViT-H/14๋ก 79% ์ ํ๋ ๋ฌ์ฑ
๋จ ํ๋์ trade-off ํ์ดํผํ๋ผ๋ฏธํฐ๋ก ResNets, ViTs, ConvNets ๋ชจ๋ ์ง์
ํ์ต ์์ค๊ณผ ๋ค์ด์คํธ๋ฆผ ์ฑ๋ฅ ๊ฐ 99% ์๊ด๊ด๊ณ๋ก ๋ผ๋ฒจ ์๋ ๋ชจ๋ธ ์ ํ ๊ฐ๋ฅ
๐ฏ ์ ์ด๊ฒ์ด ๊ฒ์ ์ฒด์ธ์ ์ธ๊ฐ? : ํด๋ฆฌ์คํฑ ์์กด ์๊ธฐ์ง๋ ํ์ต โ ์ด๋ก ์ ์ผ๋ก ์ฆ๋ช ๊ฐ๋ฅํ ์์น ๊ธฐ๋ฐ ํ์ต์ ์ ํ์ ๊ฐ์กฐ
๐ ๋ ์์ธํ ๋ด์ฉ์ด ๊ถ๊ธํ๋ค๋ฉด : https://arxiv.org/abs/2511.08544
๐ค ์ค์ค๋ก ํ์ต ๋ชฉํ๋ฅผ ์ค์ ํ๋ AI ์์ด์ ํธ์ ํ์
๐๏ธ ์์: Alibaba Group, Tongyi Lab
๐ท๏ธ ํต์ฌ ํค์๋: Self-Evolving Agent, Curiosity-Driven, Fine-Grained Credit Assignment
๐ญ ์ด๋ฐ ์ง๋ฌธ์ ํด๋ณธ ์ ์๋์?
"AI ์์ด์ ํธ๊ฐ ์ค์ค๋ก ํ์ต ๋ชฉํ๋ฅผ ์์ฑํ ์ ์์๊น?"
"์์์ ๋ฐ์ดํฐ์ ์์ด๋ ํจ์จ์ ์ธ ํ์์ด ๊ฐ๋ฅํ ๊น?"
"์์ด์ ํธ๊ฐ ๊ฐ ํ๋์ ๊ธฐ์ฌ๋๋ฅผ ์ธ๋ฐํ๊ฒ ํ๊ฐํ ์ ์์๊น?"
์ค์ค๋ก ์ฑ์ฅํ๋ ์๋ช ์ฒด์ฒ๋ผ, AgentEvolver๋ ํธ๊ธฐ์ฌ ์ฃผ๋ ์์ ์์ฑ๊ณผ ๊ฒฝํ ์ฌ์ฌ์ฉ์ ํตํด ์์จ์ ์ผ๋ก ์งํํฉ๋๋ค. Self-questioning์ผ๋ก ์์ ์ ์์ฑํ๊ณ , Self-navigating์ผ๋ก ํ์ ํจ์จ์ ๋์ด๋ฉฐ, Self-attributing์ผ๋ก ๋จ๊ณ๋ณ ๋ณด์์ ํ ๋นํฉ๋๋ค. ํนํ ์ฃผ๋ชฉํ ์ :
7B ๋ชจ๋ธ๋ก ํ๊ท 29.4% ํฌ์ธํธ ์ฑ๋ฅ ํฅ์
ํ๋ จ ๋จ๊ณ๋ฅผ ์ต๋ 67%๊น์ง ๋จ์ถํ์ฌ ์๋ ด ์๋ ๊ฐ์
์์์ ๋ฐ์ดํฐ์ ์์กด๋ ๋ํญ ๊ฐ์
๐ฏ ์ ์ด๊ฒ์ด ๊ฒ์ ์ฒด์ธ์ ์ธ๊ฐ? : ์๋์ ๋ฐ์ดํฐ ์์กด ์์ด์ ํธ โ ์์จ์ ์งํ ์์ด์ ํธ ์์คํ ์ ์ ํ์ ๊ฐ์กฐ
๐ ๋ ์์ธํ ๋ด์ฉ์ด ๊ถ๊ธํ๋ค๋ฉด : https://arxiv.org/abs/2511.10395
๐ง ์ธ๊ฐ์ฒ๋ผ, ๋ง์ ๊ธฐํํ์ ์ ๋ณด๋ฅผ ํ๋ฒ์ ํตํฉํ๋ ์ง๋ฅ์ ์ถํ
๐๏ธ ์์: Alibaba Group, Sun Yat-Sen University, NUS, NTU, HKUST
๐ท๏ธ ํต์ฌ ํค์๋: Geometric Modalities, GeoAdapter, Stochastic Multimodal Fusion
๐ญ ์ด๋ฐ ์ง๋ฌธ์ ํด๋ณธ ์ ์๋์?
"๊น์ด ๋งต, ์นด๋ฉ๋ผ ๋ด๋ถ ํ๋ผ๋ฏธํฐ, ํฌ์ฆ ์ ๋ณด๋ฅผ ๋์์ ํ์ฉํ ์ ์์๊น?"
"์ถ๊ฐ ์ ๋ ฅ ์์ด๋ RGB๋ง์ผ๋ก SOTA ์ฑ๋ฅ์ ๋ผ ์ ์์๊น?"
"์ถ๋ก ์๋ ์ ํ ์์ด ์ฌ๋ฌ ๊ธฐํํ์ ์ ๋ณด๋ฅผ ํตํฉํ ์ ์์๊น?"
์ฌ๋ฌ ๊ฐ๊ฐ์ ๋์์ ํ์ฉํ๋ ๊ฒ์ฒ๋ผ, OmniVGGT๋ ์์ ๊ฐ์์ ๋ณด์กฐ ๊ธฐํํ์ ๋ชจ๋ฌ๋ฆฌํฐ๋ฅผ seamlessly ํตํฉํฉ๋๋ค. zero-initialized convolution์ ์ฌ์ฉํ๋ GeoAdapter๋ก ์์ ์ ์ต์ ํ๋ฅผ ๋ณด์ฅํ๊ณ , ํ๋ฅ ์ ๋ค์ค๋ชจ๋ฌ ์ตํฉ์ผ๋ก ๊ณผ์ ํฉ์ ๋ฐฉ์งํฉ๋๋ค. ํนํ ์ฃผ๋ชฉํ ์ :
๋ณด์กฐ ์ ๋ ฅ ํ์ฉ ์ ๊ธฐ์กด ๋ฐฉ๋ฒ ๋๋น ์ฐ์ํ ์ฑ๋ฅ
RGB๋ง ์ฌ์ฉํด๋ state-of-the-art ๊ฒฐ๊ณผ ๋ฌ์ฑ
๋ก๋ด ์กฐ์ ์์ ์์ vanilla ํฌ์ธํธํด๋ผ์ฐ๋ ๊ธฐ๋ฐ ๋๋น ์ผ๊ด๋ ์ฑ๋ฅ ํฅ์
๐ฏ ์ ์ด๊ฒ์ด ๊ฒ์ ์ฒด์ธ์ ์ธ๊ฐ? : RGB ์ ์ฉ ๋ชจ๋ธ โ ์ ์ฐํ ๋ค์ค๋ชจ๋ฌ 3D foundation ๋ชจ๋ธ์ ์ ํ์ ๊ฐ์กฐ
๐ ๋ ์์ธํ ๋ด์ฉ์ด ๊ถ๊ธํ๋ค๋ฉด : https://arxiv.org/abs/2511.10560
๐ "๊ฐํํ์ต์ด ์ค์ ๋ก ์ด๋ป๊ฒ ์๋ํ๋์ง ํ๋ผ๋ฏธํฐ ์์ค์์ ์ดํดํ๋ค"
๐๏ธ ์์: Meta, The University of Texas at Austin
๐ท๏ธ ํต์ฌ ํค์๋: RLVR, Three-Gate Theory, Off-Principal Learning
๐ญ ์ด๋ฐ ์ง๋ฌธ์ ํด๋ณธ ์ ์๋์?
"๊ฐํํ์ต์ด ์ ์์์ ํ๋ผ๋ฏธํฐ๋ง ์์ ํ๋ ๊ฒ์ฒ๋ผ ๋ณด์ผ๊น?"
"RL๊ณผ SFT๊ฐ ํ๋ผ๋ฏธํฐ ๊ณต๊ฐ์์ ์ด๋ป๊ฒ ๋ค๋ฅด๊ฒ ์๋ํ ๊น?"
"RLVR์ ์ฑ๋ฅ ํฅ์์ ๊ธฐํํ์ ์ผ๋ก ์ค๋ช ํ ์ ์์๊น?"
์จ๊ฒจ์ง ๊ฒฝ๋ก๋ฅผ ๋ฐ๋ผ๊ฐ๋ฏ, RLVR์ ์ฃผ์ ๋ฐฉํฅ(principal directions)์ ํผํ๊ณ ๋ฎ์ ๊ณก๋ฅ ์ off-principal ๋ถ๋ถ๊ณต๊ฐ์์ ์ ๋ฐ์ดํธ๋ฅผ ์ํํฉ๋๋ค. Three-Gate Theory๋ฅผ ํตํด KL ์ ์ฝ, ๋ชจ๋ธ ๊ธฐํํ, ์ ๋ฐ๋๊ฐ ์ด๋ป๊ฒ ์ํธ์์ฉํ๋์ง ๋ฐํ์ต๋๋ค. ํนํ ์ฃผ๋ชฉํ ์ :
RLVR์ 36-92%์ ์ ๋ฐ์ดํธ ํฌ์์ฑ์ ๋ณด์ด๋ ๋ฐ๋ฉด SFT๋ 0.6-18.8%
์คํํธ๋ผ ๊ตฌ์กฐ๋ฅผ ๋ณด์กดํ๋ฉฐ ์ต์ ๋๋ฆฌํํธ๋ก ์ฑ๋ฅ ํฅ์
SFT ์๋์ PEFT ๋ฐฉ๋ฒ์ RL์ ์ง์ ์ ์ฉํ๋ ๊ฒ์ ํ๊ณ ์ ์ฆ
๐ฏ ์ ์ด๊ฒ์ด ๊ฒ์ ์ฒด์ธ์ ์ธ๊ฐ? : ๋ธ๋๋ฐ์ค RL ์ดํด โ ํ๋ผ๋ฏธํฐ ์์ค ํ์ดํธ๋ฐ์ค ๋ถ์์ ์ ํ์ ๊ฐ์กฐ
๐ ๋ ์์ธํ ๋ด์ฉ์ด ๊ถ๊ธํ๋ค๋ฉด : https://arxiv.org/abs/2511.08567
๐ค ์์ ์์์ ๋ก๋ด์ ํ๋ จ์ํค๋ค
๐๏ธ ์์: ByteDance, HKUST
๐ท๏ธ ํต์ฌ ํค์๋: World Model, On-Policy RL, VLA Policy Optimization
๐ญ ์ด๋ฐ ์ง๋ฌธ์ ํด๋ณธ ์ ์๋์?
"์ค์ ํ๊ฒฝ๊ณผ ์ํธ์์ฉ ์์ด ๋ก๋ด ์ ์ฑ ์ ํ์ตํ ์ ์์๊น?"
"์๋ ๋ชจ๋ธ์์์ ์์๋ง์ผ๋ก ์๊ธฐ ๊ต์ ๋ฅ๋ ฅ์ ์ต๋ํ ์ ์์๊น?"
"์ํ ํจ์จ์ฑ๊ณผ ์ฑ๋ฅ์ ๋์์ ๊ฐ์ ํ ์ ์์๊น?"
WMPO๋ ํฝ์ ๊ธฐ๋ฐ ์๋ ๋ชจ๋ธ์์ on-policy ๊ฐํํ์ต์ ์ํํ์ฌ ์ค์ ๋ก๋ด ์ํธ์์ฉ ์์ด ์ ์ฑ ์ ์ต์ ํํฉ๋๋ค. policy behavior alignment๋ก ์ํ ๋ถํฌ ๋ถ์ผ์น๋ฅผ ํด๊ฒฐํ๊ณ , ์์ ํ ์ํ ์์ฑ์ผ๋ก ์ ๋ขฐํ ์ ์๋ ๋ณด์ ํ ๋น์ ๊ตฌํํ์ต๋๋ค. ํนํ ์ฃผ๋ชฉํ ์ :
์ํ ํจ์จ์ฑ์ ํฌ๊ฒ ๊ฐ์ ํ๋ฉฐ ์ค์ ๊ถค์ ๊ธฐ๋ฐ ๋ฐฉ๋ฒ ๋ฅ๊ฐ
์๊ธฐ ๊ต์ ๊ณผ ๊ฐ์ ์ฐฝ๋ฐ์ ํ๋ ๋ฐํ
๊ณต๊ฐ์ , ๋ฐฐ๊ฒฝ, ํ ์ค์ฒ ๋ณํ์ ๋ํ ๊ฐ๋ ฅํ ์ผ๋ฐํ
๐ฏ ์ ์ด๊ฒ์ด ๊ฒ์ ์ฒด์ธ์ ์ธ๊ฐ? : ์ค์ ํ๊ฒฝ ์์กด RL โ ์๋ ๋ชจ๋ธ ๊ธฐ๋ฐ ์์ ์์ ํ์ต์ ์ ํ์ ๊ฐ์กฐ
๐ ๋ ์์ธํ ๋ด์ฉ์ด ๊ถ๊ธํ๋ค๋ฉด : https://arxiv.org/abs/2511.09515
๐ก ์ํฌ๋ผํ ์ค์ ์ง๋ฌธ์ผ๋ก LLM ์ถ๋ก ์ ๊ฐ์ ํ๋ค
๐๏ธ ์์: The University of Texas at Austin, Rutgers University, Salesforce AI Research
๐ท๏ธ ํต์ฌ ํค์๋: Socratic Steps, Step-Level Verification, Self-Consistency
๐ญ ์ด๋ฐ ์ง๋ฌธ์ ํด๋ณธ ์ ์๋์?
"LLM์ ์ถ๋ก ๊ณผ์ ์ ์ธ๋ฐํ๊ฒ ๊ฒ์ฆํ ์ ์์๊น?"
"๋ถํ์คํ ๋จ๊ณ๋ง ์ ํ์ ์ผ๋ก ๊ฐ์ ํ ์ ์์๊น?"
"์ ์ฒด์ ํ๋จ์ด ์๋ ๋จ๊ณ๋ณ ์ค๋ฅ ๊ต์ ์ด ๊ฐ๋ฅํ ๊น?"
์ํฌ๋ผํ ์ค์ ๋ฌธ๋ต๋ฒ์ฒ๋ผ, SSR์ ์ถ๋ก ์ ๊ฒ์ฆ ๊ฐ๋ฅํ (ํ์ ์ง๋ฌธ, ํ์ ๋ต๋ณ) ์์ผ๋ก ๋ถํดํ์ฌ ์ธ๋ฐํ ์ ๋ขฐ๋ ์ถ์ ์ ๊ฐ๋ฅํ๊ฒ ํฉ๋๋ค. self-consistency ์ฒดํฌ๋ฅผ ํตํด ๋ถํ์คํ ๋จ๊ณ๋ฅผ ์ ํํ ์ฐพ์๋ด๊ณ ์ ํ์ ์ผ๋ก ๊ฐ์ ํฉ๋๋ค. ํนํ ์ฃผ๋ชฉํ ์ :
5๊ฐ ์ถ๋ก ๋ฒค์น๋งํฌ์์ ๊ธฐ์กด self-refinement ๋ฐฉ๋ฒ ์ผ๊ด๋๊ฒ ๋ฅ๊ฐ
๋ ์ ๋ขฐํ ์ ์๋ ๊ฐ์ ๊ถค์ ์ ๊ณต
์ํ์ ๋ฐ ๋ ผ๋ฆฌ์ ์ถ๋ก ์์ ๋ชจ๋์์ ์ ํ๋ ๋ฐ ํด์ ๊ฐ๋ฅ์ฑ ํฅ์
๐ฏ ์ ์ด๊ฒ์ด ๊ฒ์ ์ฒด์ธ์ ์ธ๊ฐ? : ์ ์ฒด์ ์๊ธฐ ๊ฐ์ โ ์ธ๋ฐํ ๋จ๊ณ๋ณ ๊ฒ์ฆ ๋ฐ ์์ ์ ์ ํ์ ๊ฐ์กฐ
๐ ๋ ์์ธํ ๋ด์ฉ์ด ๊ถ๊ธํ๋ค๋ฉด : https://arxiv.org/abs/2511.10621
๐ฆพ ์ธ๊ฐ ๋์์ ๋ก๋ด์ ๋ฌผ๋ฆฌ์ ๊ถค์ ์ผ๋ก ๋ณํํ๋ค
๐๏ธ ์์: Carnegie Mellon University, Meta, FAIR at Meta
๐ท๏ธ ํต์ฌ ํค์๋: Physics-Based Retargeting, Virtual Contact Guidance, Dexterous Manipulation
๐ญ ์ด๋ฐ ์ง๋ฌธ์ ํด๋ณธ ์ ์๋์?
"์ธ๊ฐ์ ๋์์ ๋ก๋ด์ ์ง์ ์ ์ฉํ ์ ์์๊น?"
"๋ฌผ๋ฆฌ์ ์คํ ๊ฐ๋ฅ์ฑ์ ๋ณด์ฅํ๋ฉด์ ๋๊ท๋ชจ ๋ฐ์ดํฐ๋ฅผ ์์ฑํ ์ ์์๊น?"
"๋จ์ผ RGB ์นด๋ฉ๋ผ๋ง์ผ๋ก๋ ์ ํํ retargeting์ด ๊ฐ๋ฅํ ๊น?"
ํต์ญ์ฌ๊ฐ ์ธ์ด๋ฅผ ๋ฒ์ญํ๋ฏ, SPIDER๋ ์ธ๊ฐ ์์ฐ์ ๋ก๋ด์ ๋์ ์ผ๋ก ์คํ ๊ฐ๋ฅํ ๊ถค์ ์ผ๋ก ๋ณํํฉ๋๋ค. curriculum ์คํ์ผ์ ๊ฐ์ ์ ์ด ์๋ด๋ก ์ฌ๋ฐ๋ฅธ ์ ์ด ์ํ์ค๋ฅผ ๋ณด์ฅํ๊ณ , ๋๊ท๋ชจ ๋ฌผ๋ฆฌ ๊ธฐ๋ฐ ์ํ๋ง์ผ๋ก ํ์ฅ์ฑ์ ๋ฌ์ฑํ์ต๋๋ค. ํนํ ์ฃผ๋ชฉํ ์ :
9๊ฐ์ ๋ค์ํ ํด๋จธ๋ ธ์ด๋/์์ฌ์ฃผ embodiment์ 6๊ฐ ๋ฐ์ดํฐ์ ์ ๊ฑธ์ณ ํ์ฅ
ํ์ค ์ํ๋ง ๋๋น 18% ์ฑ๊ณต๋ฅ ํฅ์, RL ๊ธฐ๋ฐ ๋ฐฉ๋ฒ๋ณด๋ค 10๋ฐฐ ๋น ๋ฆ
2.4M ํ๋ ์์ ๋์ ์คํ ๊ฐ๋ฅ ๋ก๋ด ๋ฐ์ดํฐ์ ์์ฑ
๐ฏ ์ ์ด๊ฒ์ด ๊ฒ์ ์ฒด์ธ์ ์ธ๊ฐ? : ํค๋ค๋งํฑ ์ ์ฉ retargeting โ ๋ฌผ๋ฆฌ ๊ธฐ๋ฐ ๋์ ์คํ ๊ฐ๋ฅ ๋ณํ์ ์ ํ์ ๊ฐ์กฐ
๐ ๋ ์์ธํ ๋ด์ฉ์ด ๊ถ๊ธํ๋ค๋ฉด : https://arxiv.org/abs/2511.09484
๐จ ํ ์คํธ์ ์ด๋ฏธ์ง๊ฐ ๊ถค์ ์ ์ฒด์์ ์ํธ์์ฉํ๋ค
๐๏ธ ์์: Peking University, ByteDance, Princeton University, CASIA, The University of Chicago
๐ท๏ธ ํต์ฌ ํค์๋: Parallel Diffusion, Cross-Modal Alignment, Trajectory-Level RL
๐ญ ์ด๋ฐ ์ง๋ฌธ์ ํด๋ณธ ์ ์๋์?
"ํ ์คํธ ์ถ๋ก ๊ณผ ์ด๋ฏธ์ง ์์ฑ์ ๋์์ ์ํํ ์ ์์๊น?"
"์์ฐจ์ ์ค๋ฅ ์ ํ๋ฅผ ์ด๋ป๊ฒ ๋ฐฉ์งํ ์ ์์๊น?"
"์์ฑ ๊ถค์ ์ ์ฒด์์ ๋ชจ๋ฌ ๊ฐ ์ผ๊ด์ฑ์ ์ ์งํ ์ ์์๊น?"
์ค์ผ์คํธ๋ผ์ ์ ๊ธฐ๋ค์ด ์กฐํ๋ฅผ ์ด๋ฃจ๋ฏ, MMaDA-Parallel์ denoising ๊ถค์ ์ ์ฒด์์ ํ ์คํธ์ ์ด๋ฏธ์ง ๊ฐ ์ฐ์์ ์๋ฐฉํฅ ์ํธ์์ฉ์ ๊ฐ๋ฅํ๊ฒ ํฉ๋๋ค. Parallel Reinforcement Learning(ParaRL)์ ๋์ ํ์ฌ ๊ถค์ ์ ๋ฐ๋ผ ์๋ฏธ์ ๋ณด์์ ์ ์ฉํด ๊ต์ฐจ ๋ชจ๋ฌ ์ผ๊ด์ฑ์ ๊ฐํํ์ต๋๋ค. ํนํ ์ฃผ๋ชฉํ ์ :
ParaBench์์ SOTA ๋ชจ๋ธ Bagel ๋๋น Output Alignment 6.9% ํฅ์
์ค๋ฅ ์ ํ๋ฅผ ํจ๊ณผ์ ์ผ๋ก ์ํํ๋ ๋ณ๋ ฌ ํ๋ ์์ํฌ
์ต์ข ๊ฒฐ๊ณผ๋ฟ๋ง ์๋๋ผ ์ค๊ฐ ๋จ๊ณ์์๋ ์ผ๊ด์ฑ ์ ์ง
๐ฏ ์ ์ด๊ฒ์ด ๊ฒ์ ์ฒด์ธ์ ์ธ๊ฐ? : ์์ฐจ์ autoregressive ์์ฑ โ ๋ณ๋ ฌ ๊ต์ฐจ ๋ชจ๋ฌ diffusion์ ์ ํ์ ๊ฐ์กฐ
๐ ๋ ์์ธํ ๋ด์ฉ์ด ๊ถ๊ธํ๋ค๋ฉด : https://arxiv.org/abs/2511.09611
๋งค์ผ ํ์์ผ ์ค์ 8์,
๋ฐ์ ๋น์ ์ ๊ธฐ์ ๋ฐ์ ์ ๋ค์ณ์ง์ง ์๊ฒ ๋ง๋ค์ด์ค
์ต์ AI ํธ๋ ๋๊ฐ ์์ฝ ์ ๋ฆฌ๋ณธ์ผ๋ก ์ ๋ฌ๋ฉ๋๋ค!