๋ชฉ๋ก
Vol.132025.11.17

๐Ÿ“‘ByteDance: "3D แ„€แ…ฉแ†ผแ„€แ…กแ†ซแ„‹แ…ณแ†ฏ แ„‹แ…ชแ†ซแ„‡แ…งแ†จ แ„‡แ…ฉแ†จแ„‹แ…ฏแ†ซแ„’แ…ขแ„Œแ…ฎแ†ฏแ„€แ…ฆ!"

25.11. 3แ„Œแ…ฎแ„Žแ…ก | ByteDance, Meta, Alibaba, NYU, CMU, Princeton, UT Austin

1,248๋ช… ์ˆ˜์‹ ์˜คํ”ˆ์œจ 52.91%ํด๋ฆญ๋ฅ  10.08%

๐Ÿ“‘ByteDance: "3D แ„€แ…ฉแ†ผแ„€แ…กแ†ซแ„‹แ…ณแ†ฏ แ„‹แ…ชแ†ซแ„‡แ…งแ†จ แ„‡แ…ฉแ†จแ„‹แ…ฏแ†ซแ„’แ…ขแ„Œแ…ฎแ†ฏแ„€แ…ฆ!"

25.11. 3แ„Œแ…ฎแ„Žแ…ก | ByteDance, Meta, Alibaba, NYU, CMU, Princeton, UT Austin

๊ธˆ์ฃผ ์บ์น˜ํŽ˜์ดํผ๋Š” ByteDance, NYU, Meta, Alibaba, CMU, Princeton ๊ณผ ํ•จ๊ป˜ํ•ฉ๋‹ˆ๋‹ค. 3๋ถ„๋งŒ ํˆฌ์žํ•ด ์“ฑ ๋‘˜๋Ÿฌ๋ณด๊ณ , ๋น ๋ฅด๊ฒŒ ๋ฐ”๋€Œ๋Š” ๊ธฐ์ˆ ์˜ ๋ฐฉํ–ฅ์„ฑ์„ ๋†“์น˜์ง€ ๋งˆ์„ธ์š”!

๐Ÿ“ˆ ์ตœ์‹  AI ํŠธ๋ Œ๋“œ 2์ค„ ์š”์•ฝ

๐ŸŒŸ ์ตœ๊ทผ AI ์—ฐ๊ตฌ์—์„œ๋Š” ์ž๊ธฐ ์ง„ํ™” ์—์ด์ „ํŠธ์™€ ์›”๋“œ ๋ชจ๋ธ์„ ํ™œ์šฉํ•œ ์žฅ๊ธฐ ์‹œ๋ฎฌ๋ ˆ์ด์…˜์ด ๋‘๋“œ๋Ÿฌ์ง€๊ณ  ์žˆ์œผ๋ฉฐ, ๋ฌผ๋ฆฌ ๋ฒ•์น™์„ ๊ณ ๋ คํ•œ ๋กœ๋ด‡ ์ œ์–ด์™€ 3D ๊ณต๊ฐ„ ์ธ์‹ ๊ธฐ์ˆ ์ด ๊ธ‰์†๋„๋กœ ๋ฐœ์ „ํ•˜๊ณ  ์žˆ์Šต๋‹ˆ๋‹ค.

๐Ÿš€ LLM์˜ ์ถ”๋ก  ๋Šฅ๋ ฅ ํ–ฅ์ƒ์„ ์œ„ํ•œ ์ž๊ธฐ ๊ฐœ์„  ํ”„๋ ˆ์ž„์›Œํฌ์™€ ๊ฐ•ํ™”ํ•™์Šต ๊ธฐ๋ฒ•์ด ํ™œ๋ฐœํžˆ ์—ฐ๊ตฌ๋˜๊ณ  ์žˆ์œผ๋ฉฐ, ํŠนํžˆ ์ด๋ก ์  ๊ธฐ๋ฐ˜์„ ๊ฐ–์ถ˜ ์ž๊ธฐ์ง€๋„ ํ•™์Šต๊ณผ ์„ธ๋ฐ€ํ•œ ์˜ค๋ฅ˜ ์ˆ˜์ • ๋ฉ”์ปค๋‹ˆ์ฆ˜์ด ์ฃผ๋ชฉ๋ฐ›๊ณ  ์žˆ์Šต๋‹ˆ๋‹ค.

๐ŸŒ ์–ด๋–ค ์‹œ์ ์—์„œ๋“  3D ๊ณต๊ฐ„์„ ์™„๋ฒฝํ•˜๊ฒŒ ์žฌ๊ตฌ์„ฑํ•˜๋‹ค.

Depth Anything 3: Recovering the Visual Space from Any Views

๐Ÿ›๏ธ ์†Œ์†: ByteDance

๐Ÿท๏ธ ํ•ต์‹ฌ ํ‚ค์›Œ๋“œ: Depth-Ray Representation, Any-View Geometry, Unified Transformer

๐Ÿ’ญ ์ด๋Ÿฐ ์งˆ๋ฌธ์„ ํ•ด๋ณธ ์  ์žˆ๋‚˜์š”?

  • "๋‹จ์ผ ์ด๋ฏธ์ง€๋งŒ์œผ๋กœ๋„ ์ •ํ™•ํ•œ 3D ๊ณต๊ฐ„์„ ๋ณต์›ํ•  ์ˆ˜ ์žˆ์„๊นŒ?"

  • "์นด๋ฉ”๋ผ ์œ„์น˜ ์ •๋ณด ์—†์ด๋„ ์—ฌ๋Ÿฌ ์‹œ์ ์„ ํ†ตํ•ฉํ•  ์ˆ˜ ์žˆ์„๊นŒ?"

  • "๋ณต์žกํ•œ ๊ตฌ์กฐ ์—†์ด ํ•˜๋‚˜์˜ ๋ชจ๋ธ๋กœ ๋ชจ๋“  3D ์ž‘์—…์„ ์ฒ˜๋ฆฌํ•  ์ˆ˜ ์žˆ์„๊นŒ?"

๋ชจ๋“  ๊ฐ๋„์—์„œ ๋™์‹œ์— ์„ธ์ƒ์„ ๋ฐ”๋ผ๋ณด๋Š” ๊ฒƒ์ฒ˜๋Ÿผ, Depth Anything 3๋Š” ๋‹จ์ผ transformer๋กœ ์ž„์˜ ๊ฐœ์ˆ˜์˜ ์‹œ์ ์—์„œ ์ผ๊ด€๋œ 3D ๊ณต๊ฐ„์„ ์žฌ๊ตฌ์„ฑํ•ฉ๋‹ˆ๋‹ค. ์นด๋ฉ”๋ผ ํฌ์ฆˆ ์ •๋ณด ์œ ๋ฌด์™€ ๊ด€๊ณ„์—†์ด ์ž‘๋™ํ•˜๋ฉฐ, depth-ray ํ‘œํ˜„๋งŒ์œผ๋กœ ๋ณต์žกํ•œ ๋‹ค์ค‘ ์ž‘์—… ํ•™์Šต์˜ ํ•„์š”์„ฑ์„ ์ œ๊ฑฐํ–ˆ์Šต๋‹ˆ๋‹ค. ํŠนํžˆ ์ฃผ๋ชฉํ•  ์ :

  • ๊ธฐ์กด SOTA์ธ VGGT ๋Œ€๋น„ ์นด๋ฉ”๋ผ ํฌ์ฆˆ ์ •ํ™•๋„ 44.3%, ๊ธฐํ•˜ํ•™์  ์ •ํ™•๋„ 25.1% ํ–ฅ์ƒ

  • Depth Anything 2๋ฅผ ๋Šฅ๊ฐ€ํ•˜๋Š” ๋‹จ์•ˆ ๊นŠ์ด ์ถ”์ • ์„ฑ๋Šฅ

  • ๋‹จ์ˆœํ•œ vanilla transformer๋กœ ๊ตฌ์กฐ์  ํŠน์ˆ˜ํ™” ์—†์ด ๋‹ฌ์„ฑํ•œ ์ตœ์ฒจ๋‹จ ์„ฑ๋Šฅ

๐ŸŽฏ ์™œ ์ด๊ฒƒ์ด ๊ฒŒ์ž„ ์ฒด์ธ์ €์ธ๊ฐ€? : ์ „๋ฌธํ™”๋œ 3D ์•„ํ‚คํ…์ฒ˜ โ†’ ํ†ตํ•ฉ๋œ plain transformer ๊ธฐ๋ฐ˜ any-view ์žฌ๊ตฌ์„ฑ์˜ ์ „ํ™˜์  ๊ฐ•์กฐ

๐Ÿ”— ๋” ์ž์„ธํ•œ ๋‚ด์šฉ์ด ๊ถ๊ธˆํ•˜๋‹ค๋ฉด : https://arxiv.org/abs/2511.10647

๐Ÿง  "ํœด๋ฆฌ์Šคํ‹ฑ ์—†๋Š” ์ž๊ธฐ์ง€๋„ ํ•™์Šต์ด ๊ฐ€๋Šฅํ• ๊นŒ?"

LeJEPA: Provable and Scalable Self-Supervised Learning Without the Heuristics

๐Ÿ›๏ธ ์†Œ์†: Brown University, New York University, Meta

๐Ÿท๏ธ ํ•ต์‹ฌ ํ‚ค์›Œ๋“œ: Joint-Embedding Predictive Architecture, SIGReg, Isotropic Gaussian

๐Ÿ’ญ ์ด๋Ÿฐ ์งˆ๋ฌธ์„ ํ•ด๋ณธ ์  ์žˆ๋‚˜์š”?

  • "์ž๊ธฐ์ง€๋„ ํ•™์Šต์—์„œ ํ‘œํ˜„ ๋ถ•๊ดด๋ฅผ ์ด๋ก ์ ์œผ๋กœ ๋ฐฉ์ง€ํ•  ์ˆ˜ ์žˆ์„๊นŒ?"

  • "stop-gradient๋‚˜ teacher-student ์—†์ด๋„ ์•ˆ์ •์ ์ธ ํ•™์Šต์ด ๊ฐ€๋Šฅํ• ๊นŒ?"

  • "๋‹จ์ผ ํ•˜์ดํผํŒŒ๋ผ๋ฏธํ„ฐ๋งŒ์œผ๋กœ ๋‹ค์–‘ํ•œ ์•„ํ‚คํ…์ฒ˜์— ์ ์šฉํ•  ์ˆ˜ ์žˆ์„๊นŒ?"

๋ณต์žกํ•œ ํŠธ๋ฆญ ์—†์ด ์ˆœ์ˆ˜ํ•œ ์ด๋ก ์œผ๋กœ ์™„๋ฒฝํ•จ์„ ์ถ”๊ตฌํ•˜๋“ฏ, LeJEPA๋Š” ๋“ฑ๋ฐฉ์„ฑ ๊ฐ€์šฐ์‹œ์•ˆ ๋ถ„ํฌ๋ฅผ ๊ฐ•์ œํ•˜์—ฌ ํ‘œํ˜„ ๋ถ•๊ดด๋ฅผ ๊ทผ๋ณธ์ ์œผ๋กœ ํ•ด๊ฒฐํ–ˆ์Šต๋‹ˆ๋‹ค. Sketched Isotropic Gaussian Regularization(SIGReg)์„ ๋„์ž…ํ•˜์—ฌ stop-gradient, teacher-student, ํ•˜์ดํผํŒŒ๋ผ๋ฏธํ„ฐ ์Šค์ผ€์ค„๋Ÿฌ ๋“ฑ ๋ชจ๋“  ํœด๋ฆฌ์Šคํ‹ฑ์„ ์ œ๊ฑฐํ–ˆ์Šต๋‹ˆ๋‹ค. ํŠนํžˆ ์ฃผ๋ชฉํ•  ์ :

  • ImageNet-1k์—์„œ ViT-H/14๋กœ 79% ์ •ํ™•๋„ ๋‹ฌ์„ฑ

  • ๋‹จ ํ•˜๋‚˜์˜ trade-off ํ•˜์ดํผํŒŒ๋ผ๋ฏธํ„ฐ๋กœ ResNets, ViTs, ConvNets ๋ชจ๋‘ ์ง€์›

  • ํ•™์Šต ์†์‹ค๊ณผ ๋‹ค์šด์ŠคํŠธ๋ฆผ ์„ฑ๋Šฅ ๊ฐ„ 99% ์ƒ๊ด€๊ด€๊ณ„๋กœ ๋ผ๋ฒจ ์—†๋Š” ๋ชจ๋ธ ์„ ํƒ ๊ฐ€๋Šฅ

๐ŸŽฏ ์™œ ์ด๊ฒƒ์ด ๊ฒŒ์ž„ ์ฒด์ธ์ €์ธ๊ฐ€? : ํœด๋ฆฌ์Šคํ‹ฑ ์˜์กด ์ž๊ธฐ์ง€๋„ ํ•™์Šต โ†’ ์ด๋ก ์ ์œผ๋กœ ์ฆ๋ช… ๊ฐ€๋Šฅํ•œ ์›์น™ ๊ธฐ๋ฐ˜ ํ•™์Šต์˜ ์ „ํ™˜์  ๊ฐ•์กฐ

๐Ÿ”— ๋” ์ž์„ธํ•œ ๋‚ด์šฉ์ด ๊ถ๊ธˆํ•˜๋‹ค๋ฉด : https://arxiv.org/abs/2511.08544

๐Ÿค– ์Šค์Šค๋กœ ํ•™์Šต ๋ชฉํ‘œ๋ฅผ ์„ค์ •ํ•˜๋Š” AI ์—์ด์ „ํŠธ์˜ ํƒ„์ƒ

AgentEvolver: Towards Efficient Self-Evolving Agent System

๐Ÿ›๏ธ ์†Œ์†: Alibaba Group, Tongyi Lab

๐Ÿท๏ธ ํ•ต์‹ฌ ํ‚ค์›Œ๋“œ: Self-Evolving Agent, Curiosity-Driven, Fine-Grained Credit Assignment

๐Ÿ’ญ ์ด๋Ÿฐ ์งˆ๋ฌธ์„ ํ•ด๋ณธ ์  ์žˆ๋‚˜์š”?

  • "AI ์—์ด์ „ํŠธ๊ฐ€ ์Šค์Šค๋กœ ํ•™์Šต ๋ชฉํ‘œ๋ฅผ ์ƒ์„ฑํ•  ์ˆ˜ ์žˆ์„๊นŒ?"

  • "์ˆ˜์ž‘์—… ๋ฐ์ดํ„ฐ์…‹ ์—†์ด๋„ ํšจ์œจ์ ์ธ ํƒ์ƒ‰์ด ๊ฐ€๋Šฅํ• ๊นŒ?"

  • "์—์ด์ „ํŠธ๊ฐ€ ๊ฐ ํ–‰๋™์˜ ๊ธฐ์—ฌ๋„๋ฅผ ์„ธ๋ฐ€ํ•˜๊ฒŒ ํ‰๊ฐ€ํ•  ์ˆ˜ ์žˆ์„๊นŒ?"

์Šค์Šค๋กœ ์„ฑ์žฅํ•˜๋Š” ์ƒ๋ช…์ฒด์ฒ˜๋Ÿผ, AgentEvolver๋Š” ํ˜ธ๊ธฐ์‹ฌ ์ฃผ๋„ ์ž‘์—… ์ƒ์„ฑ๊ณผ ๊ฒฝํ—˜ ์žฌ์‚ฌ์šฉ์„ ํ†ตํ•ด ์ž์œจ์ ์œผ๋กœ ์ง„ํ™”ํ•ฉ๋‹ˆ๋‹ค. Self-questioning์œผ๋กœ ์ž‘์—…์„ ์ƒ์„ฑํ•˜๊ณ , Self-navigating์œผ๋กœ ํƒ์ƒ‰ ํšจ์œจ์„ ๋†’์ด๋ฉฐ, Self-attributing์œผ๋กœ ๋‹จ๊ณ„๋ณ„ ๋ณด์ƒ์„ ํ• ๋‹นํ•ฉ๋‹ˆ๋‹ค. ํŠนํžˆ ์ฃผ๋ชฉํ•  ์ :

  • 7B ๋ชจ๋ธ๋กœ ํ‰๊ท  29.4% ํฌ์ธํŠธ ์„ฑ๋Šฅ ํ–ฅ์ƒ

  • ํ›ˆ๋ จ ๋‹จ๊ณ„๋ฅผ ์ตœ๋Œ€ 67%๊นŒ์ง€ ๋‹จ์ถ•ํ•˜์—ฌ ์ˆ˜๋ ด ์†๋„ ๊ฐœ์„ 

  • ์ˆ˜์ž‘์—… ๋ฐ์ดํ„ฐ์…‹ ์˜์กด๋„ ๋Œ€ํญ ๊ฐ์†Œ

๐ŸŽฏ ์™œ ์ด๊ฒƒ์ด ๊ฒŒ์ž„ ์ฒด์ธ์ €์ธ๊ฐ€? : ์ˆ˜๋™์  ๋ฐ์ดํ„ฐ ์˜์กด ์—์ด์ „ํŠธ โ†’ ์ž์œจ์  ์ง„ํ™” ์—์ด์ „ํŠธ ์‹œ์Šคํ…œ์˜ ์ „ํ™˜์  ๊ฐ•์กฐ

๐Ÿ”— ๋” ์ž์„ธํ•œ ๋‚ด์šฉ์ด ๊ถ๊ธˆํ•˜๋‹ค๋ฉด : https://arxiv.org/abs/2511.10395

๐Ÿ”ง ์ธ๊ฐ„์ฒ˜๋Ÿผ, ๋งŽ์€ ๊ธฐํ•˜ํ•™์  ์ •๋ณด๋ฅผ ํ•œ๋ฒˆ์— ํ†ตํ•ฉํ•˜๋Š” ์ง€๋Šฅ์˜ ์ถœํ˜„

OmniVGGT: Omni-Modality Driven Visual Geometry Grounded

๐Ÿ›๏ธ ์†Œ์†: Alibaba Group, Sun Yat-Sen University, NUS, NTU, HKUST

๐Ÿท๏ธ ํ•ต์‹ฌ ํ‚ค์›Œ๋“œ: Geometric Modalities, GeoAdapter, Stochastic Multimodal Fusion

๐Ÿ’ญ ์ด๋Ÿฐ ์งˆ๋ฌธ์„ ํ•ด๋ณธ ์  ์žˆ๋‚˜์š”?

  • "๊นŠ์ด ๋งต, ์นด๋ฉ”๋ผ ๋‚ด๋ถ€ ํŒŒ๋ผ๋ฏธํ„ฐ, ํฌ์ฆˆ ์ •๋ณด๋ฅผ ๋™์‹œ์— ํ™œ์šฉํ•  ์ˆ˜ ์žˆ์„๊นŒ?"

  • "์ถ”๊ฐ€ ์ž…๋ ฅ ์—†์ด๋„ RGB๋งŒ์œผ๋กœ SOTA ์„ฑ๋Šฅ์„ ๋‚ผ ์ˆ˜ ์žˆ์„๊นŒ?"

  • "์ถ”๋ก  ์†๋„ ์ €ํ•˜ ์—†์ด ์—ฌ๋Ÿฌ ๊ธฐํ•˜ํ•™์  ์ •๋ณด๋ฅผ ํ†ตํ•ฉํ•  ์ˆ˜ ์žˆ์„๊นŒ?"

์—ฌ๋Ÿฌ ๊ฐ๊ฐ์„ ๋™์‹œ์— ํ™œ์šฉํ•˜๋Š” ๊ฒƒ์ฒ˜๋Ÿผ, OmniVGGT๋Š” ์ž„์˜ ๊ฐœ์ˆ˜์˜ ๋ณด์กฐ ๊ธฐํ•˜ํ•™์  ๋ชจ๋‹ฌ๋ฆฌํ‹ฐ๋ฅผ seamlessly ํ†ตํ•ฉํ•ฉ๋‹ˆ๋‹ค. zero-initialized convolution์„ ์‚ฌ์šฉํ•˜๋Š” GeoAdapter๋กœ ์•ˆ์ •์  ์ตœ์ ํ™”๋ฅผ ๋ณด์žฅํ•˜๊ณ , ํ™•๋ฅ ์  ๋‹ค์ค‘๋ชจ๋‹ฌ ์œตํ•ฉ์œผ๋กœ ๊ณผ์ ํ•ฉ์„ ๋ฐฉ์ง€ํ•ฉ๋‹ˆ๋‹ค. ํŠนํžˆ ์ฃผ๋ชฉํ•  ์ :

  • ๋ณด์กฐ ์ž…๋ ฅ ํ™œ์šฉ ์‹œ ๊ธฐ์กด ๋ฐฉ๋ฒ• ๋Œ€๋น„ ์šฐ์ˆ˜ํ•œ ์„ฑ๋Šฅ

  • RGB๋งŒ ์‚ฌ์šฉํ•ด๋„ state-of-the-art ๊ฒฐ๊ณผ ๋‹ฌ์„ฑ

  • ๋กœ๋ด‡ ์กฐ์ž‘ ์ž‘์—…์—์„œ vanilla ํฌ์ธํŠธํด๋ผ์šฐ๋“œ ๊ธฐ๋ฐ˜ ๋Œ€๋น„ ์ผ๊ด€๋œ ์„ฑ๋Šฅ ํ–ฅ์ƒ

๐ŸŽฏ ์™œ ์ด๊ฒƒ์ด ๊ฒŒ์ž„ ์ฒด์ธ์ €์ธ๊ฐ€? : RGB ์ „์šฉ ๋ชจ๋ธ โ†’ ์œ ์—ฐํ•œ ๋‹ค์ค‘๋ชจ๋‹ฌ 3D foundation ๋ชจ๋ธ์˜ ์ „ํ™˜์  ๊ฐ•์กฐ

๐Ÿ”— ๋” ์ž์„ธํ•œ ๋‚ด์šฉ์ด ๊ถ๊ธˆํ•˜๋‹ค๋ฉด : https://arxiv.org/abs/2511.10560

๐Ÿ“Š "๊ฐ•ํ™”ํ•™์Šต์ด ์‹ค์ œ๋กœ ์–ด๋–ป๊ฒŒ ์ž‘๋™ํ•˜๋Š”์ง€ ํŒŒ๋ผ๋ฏธํ„ฐ ์ˆ˜์ค€์—์„œ ์ดํ•ดํ•˜๋‹ค"

The Path Not Taken: RLVR Provably Learns Off the Principals

๐Ÿ›๏ธ ์†Œ์†: Meta, The University of Texas at Austin

๐Ÿท๏ธ ํ•ต์‹ฌ ํ‚ค์›Œ๋“œ: RLVR, Three-Gate Theory, Off-Principal Learning

๐Ÿ’ญ ์ด๋Ÿฐ ์งˆ๋ฌธ์„ ํ•ด๋ณธ ์  ์žˆ๋‚˜์š”?

  • "๊ฐ•ํ™”ํ•™์Šต์ด ์™œ ์†Œ์ˆ˜์˜ ํŒŒ๋ผ๋ฏธํ„ฐ๋งŒ ์ˆ˜์ •ํ•˜๋Š” ๊ฒƒ์ฒ˜๋Ÿผ ๋ณด์ผ๊นŒ?"

  • "RL๊ณผ SFT๊ฐ€ ํŒŒ๋ผ๋ฏธํ„ฐ ๊ณต๊ฐ„์—์„œ ์–ด๋–ป๊ฒŒ ๋‹ค๋ฅด๊ฒŒ ์ž‘๋™ํ• ๊นŒ?"

  • "RLVR์˜ ์„ฑ๋Šฅ ํ–ฅ์ƒ์„ ๊ธฐํ•˜ํ•™์ ์œผ๋กœ ์„ค๋ช…ํ•  ์ˆ˜ ์žˆ์„๊นŒ?"

์ˆจ๊ฒจ์ง„ ๊ฒฝ๋กœ๋ฅผ ๋”ฐ๋ผ๊ฐ€๋“ฏ, RLVR์€ ์ฃผ์š” ๋ฐฉํ–ฅ(principal directions)์„ ํ”ผํ•˜๊ณ  ๋‚ฎ์€ ๊ณก๋ฅ ์˜ off-principal ๋ถ€๋ถ„๊ณต๊ฐ„์—์„œ ์—…๋ฐ์ดํŠธ๋ฅผ ์ˆ˜ํ–‰ํ•ฉ๋‹ˆ๋‹ค. Three-Gate Theory๋ฅผ ํ†ตํ•ด KL ์ œ์•ฝ, ๋ชจ๋ธ ๊ธฐํ•˜ํ•™, ์ •๋ฐ€๋„๊ฐ€ ์–ด๋–ป๊ฒŒ ์ƒํ˜ธ์ž‘์šฉํ•˜๋Š”์ง€ ๋ฐํ˜”์Šต๋‹ˆ๋‹ค. ํŠนํžˆ ์ฃผ๋ชฉํ•  ์ :

  • RLVR์€ 36-92%์˜ ์—…๋ฐ์ดํŠธ ํฌ์†Œ์„ฑ์„ ๋ณด์ด๋Š” ๋ฐ˜๋ฉด SFT๋Š” 0.6-18.8%

  • ์ŠคํŽ™ํŠธ๋Ÿผ ๊ตฌ์กฐ๋ฅผ ๋ณด์กดํ•˜๋ฉฐ ์ตœ์†Œ ๋“œ๋ฆฌํ”„ํŠธ๋กœ ์„ฑ๋Šฅ ํ–ฅ์ƒ

  • SFT ์‹œ๋Œ€์˜ PEFT ๋ฐฉ๋ฒ•์„ RL์— ์ง์ ‘ ์ ์šฉํ•˜๋Š” ๊ฒƒ์˜ ํ•œ๊ณ„ ์ž…์ฆ

๐ŸŽฏ ์™œ ์ด๊ฒƒ์ด ๊ฒŒ์ž„ ์ฒด์ธ์ €์ธ๊ฐ€? : ๋ธ”๋ž™๋ฐ•์Šค RL ์ดํ•ด โ†’ ํŒŒ๋ผ๋ฏธํ„ฐ ์ˆ˜์ค€ ํ™”์ดํŠธ๋ฐ•์Šค ๋ถ„์„์˜ ์ „ํ™˜์  ๊ฐ•์กฐ

๐Ÿ”— ๋” ์ž์„ธํ•œ ๋‚ด์šฉ์ด ๊ถ๊ธˆํ•˜๋‹ค๋ฉด : https://arxiv.org/abs/2511.08567

๐Ÿค– ์ƒ์ƒ ์†์—์„œ ๋กœ๋ด‡์„ ํ›ˆ๋ จ์‹œํ‚ค๋‹ค

WMPO: World Model-based Policy Optimization for Vision-Language-Action Models

๐Ÿ›๏ธ ์†Œ์†: ByteDance, HKUST

๐Ÿท๏ธ ํ•ต์‹ฌ ํ‚ค์›Œ๋“œ: World Model, On-Policy RL, VLA Policy Optimization

๐Ÿ’ญ ์ด๋Ÿฐ ์งˆ๋ฌธ์„ ํ•ด๋ณธ ์  ์žˆ๋‚˜์š”?

  • "์‹ค์ œ ํ™˜๊ฒฝ๊ณผ ์ƒํ˜ธ์ž‘์šฉ ์—†์ด ๋กœ๋ด‡ ์ •์ฑ…์„ ํ•™์Šตํ•  ์ˆ˜ ์žˆ์„๊นŒ?"

  • "์›”๋“œ ๋ชจ๋ธ์—์„œ์˜ ์ƒ์ƒ๋งŒ์œผ๋กœ ์ž๊ธฐ ๊ต์ • ๋Šฅ๋ ฅ์„ ์Šต๋“ํ•  ์ˆ˜ ์žˆ์„๊นŒ?"

  • "์ƒ˜ํ”Œ ํšจ์œจ์„ฑ๊ณผ ์„ฑ๋Šฅ์„ ๋™์‹œ์— ๊ฐœ์„ ํ•  ์ˆ˜ ์žˆ์„๊นŒ?"

WMPO๋Š” ํ”ฝ์…€ ๊ธฐ๋ฐ˜ ์›”๋“œ ๋ชจ๋ธ์—์„œ on-policy ๊ฐ•ํ™”ํ•™์Šต์„ ์ˆ˜ํ–‰ํ•˜์—ฌ ์‹ค์ œ ๋กœ๋ด‡ ์ƒํ˜ธ์ž‘์šฉ ์—†์ด ์ •์ฑ…์„ ์ตœ์ ํ™”ํ•ฉ๋‹ˆ๋‹ค. policy behavior alignment๋กœ ์ƒํƒœ ๋ถ„ํฌ ๋ถˆ์ผ์น˜๋ฅผ ํ•ด๊ฒฐํ•˜๊ณ , ์™„์ „ํ•œ ์‹œํ–‰ ์ƒ์„ฑ์œผ๋กœ ์‹ ๋ขฐํ•  ์ˆ˜ ์žˆ๋Š” ๋ณด์ƒ ํ• ๋‹น์„ ๊ตฌํ˜„ํ–ˆ์Šต๋‹ˆ๋‹ค. ํŠนํžˆ ์ฃผ๋ชฉํ•  ์ :

  • ์ƒ˜ํ”Œ ํšจ์œจ์„ฑ์„ ํฌ๊ฒŒ ๊ฐœ์„ ํ•˜๋ฉฐ ์‹ค์ œ ๊ถค์  ๊ธฐ๋ฐ˜ ๋ฐฉ๋ฒ• ๋Šฅ๊ฐ€

  • ์ž๊ธฐ ๊ต์ •๊ณผ ๊ฐ™์€ ์ฐฝ๋ฐœ์  ํ–‰๋™ ๋ฐœํ˜„

  • ๊ณต๊ฐ„์ , ๋ฐฐ๊ฒฝ, ํ…์Šค์ฒ˜ ๋ณ€ํ™”์— ๋Œ€ํ•œ ๊ฐ•๋ ฅํ•œ ์ผ๋ฐ˜ํ™”

๐ŸŽฏ ์™œ ์ด๊ฒƒ์ด ๊ฒŒ์ž„ ์ฒด์ธ์ €์ธ๊ฐ€? : ์‹ค์ œ ํ™˜๊ฒฝ ์˜์กด RL โ†’ ์›”๋“œ ๋ชจ๋ธ ๊ธฐ๋ฐ˜ ์ˆœ์ˆ˜ ์ƒ์ƒ ํ•™์Šต์˜ ์ „ํ™˜์  ๊ฐ•์กฐ

๐Ÿ”— ๋” ์ž์„ธํ•œ ๋‚ด์šฉ์ด ๊ถ๊ธˆํ•˜๋‹ค๋ฉด : https://arxiv.org/abs/2511.09515

๐Ÿ’ก ์†Œํฌ๋ผํ…Œ์Šค์‹ ์งˆ๋ฌธ์œผ๋กœ LLM ์ถ”๋ก ์„ ๊ฐœ์„ ํ•˜๋‹ค

SSR: Socratic Self-Refine for Large Language Model Reasoning

๐Ÿ›๏ธ ์†Œ์†: The University of Texas at Austin, Rutgers University, Salesforce AI Research

๐Ÿท๏ธ ํ•ต์‹ฌ ํ‚ค์›Œ๋“œ: Socratic Steps, Step-Level Verification, Self-Consistency

๐Ÿ’ญ ์ด๋Ÿฐ ์งˆ๋ฌธ์„ ํ•ด๋ณธ ์  ์žˆ๋‚˜์š”?

  • "LLM์˜ ์ถ”๋ก  ๊ณผ์ •์„ ์„ธ๋ฐ€ํ•˜๊ฒŒ ๊ฒ€์ฆํ•  ์ˆ˜ ์žˆ์„๊นŒ?"

  • "๋ถˆํ™•์‹คํ•œ ๋‹จ๊ณ„๋งŒ ์„ ํƒ์ ์œผ๋กœ ๊ฐœ์„ ํ•  ์ˆ˜ ์žˆ์„๊นŒ?"

  • "์ „์ฒด์  ํŒ๋‹จ์ด ์•„๋‹Œ ๋‹จ๊ณ„๋ณ„ ์˜ค๋ฅ˜ ๊ต์ •์ด ๊ฐ€๋Šฅํ• ๊นŒ?"

์†Œํฌ๋ผํ…Œ์Šค์˜ ๋ฌธ๋‹ต๋ฒ•์ฒ˜๋Ÿผ, SSR์€ ์ถ”๋ก ์„ ๊ฒ€์ฆ ๊ฐ€๋Šฅํ•œ (ํ•˜์œ„ ์งˆ๋ฌธ, ํ•˜์œ„ ๋‹ต๋ณ€) ์Œ์œผ๋กœ ๋ถ„ํ•ดํ•˜์—ฌ ์„ธ๋ฐ€ํ•œ ์‹ ๋ขฐ๋„ ์ถ”์ •์„ ๊ฐ€๋Šฅํ•˜๊ฒŒ ํ•ฉ๋‹ˆ๋‹ค. self-consistency ์ฒดํฌ๋ฅผ ํ†ตํ•ด ๋ถˆํ™•์‹คํ•œ ๋‹จ๊ณ„๋ฅผ ์ •ํ™•ํžˆ ์ฐพ์•„๋‚ด๊ณ  ์„ ํƒ์ ์œผ๋กœ ๊ฐœ์„ ํ•ฉ๋‹ˆ๋‹ค. ํŠนํžˆ ์ฃผ๋ชฉํ•  ์ :

  • 5๊ฐœ ์ถ”๋ก  ๋ฒค์น˜๋งˆํฌ์—์„œ ๊ธฐ์กด self-refinement ๋ฐฉ๋ฒ• ์ผ๊ด€๋˜๊ฒŒ ๋Šฅ๊ฐ€

  • ๋” ์‹ ๋ขฐํ•  ์ˆ˜ ์žˆ๋Š” ๊ฐœ์„  ๊ถค์  ์ œ๊ณต

  • ์ˆ˜ํ•™์  ๋ฐ ๋…ผ๋ฆฌ์  ์ถ”๋ก  ์ž‘์—… ๋ชจ๋‘์—์„œ ์ •ํ™•๋„ ๋ฐ ํ•ด์„ ๊ฐ€๋Šฅ์„ฑ ํ–ฅ์ƒ

๐ŸŽฏ ์™œ ์ด๊ฒƒ์ด ๊ฒŒ์ž„ ์ฒด์ธ์ €์ธ๊ฐ€? : ์ „์ฒด์  ์ž๊ธฐ ๊ฐœ์„  โ†’ ์„ธ๋ฐ€ํ•œ ๋‹จ๊ณ„๋ณ„ ๊ฒ€์ฆ ๋ฐ ์ˆ˜์ •์˜ ์ „ํ™˜์  ๊ฐ•์กฐ

๐Ÿ”— ๋” ์ž์„ธํ•œ ๋‚ด์šฉ์ด ๊ถ๊ธˆํ•˜๋‹ค๋ฉด : https://arxiv.org/abs/2511.10621

๐Ÿฆพ ์ธ๊ฐ„ ๋™์ž‘์„ ๋กœ๋ด‡์˜ ๋ฌผ๋ฆฌ์  ๊ถค์ ์œผ๋กœ ๋ณ€ํ™˜ํ•˜๋‹ค

SPIDER: Scalable Physics-Informed Dexterous Retargeting

๐Ÿ›๏ธ ์†Œ์†: Carnegie Mellon University, Meta, FAIR at Meta

๐Ÿท๏ธ ํ•ต์‹ฌ ํ‚ค์›Œ๋“œ: Physics-Based Retargeting, Virtual Contact Guidance, Dexterous Manipulation

๐Ÿ’ญ ์ด๋Ÿฐ ์งˆ๋ฌธ์„ ํ•ด๋ณธ ์  ์žˆ๋‚˜์š”?

  • "์ธ๊ฐ„์˜ ๋™์ž‘์„ ๋กœ๋ด‡์— ์ง์ ‘ ์ ์šฉํ•  ์ˆ˜ ์žˆ์„๊นŒ?"

  • "๋ฌผ๋ฆฌ์  ์‹คํ–‰ ๊ฐ€๋Šฅ์„ฑ์„ ๋ณด์žฅํ•˜๋ฉด์„œ ๋Œ€๊ทœ๋ชจ ๋ฐ์ดํ„ฐ๋ฅผ ์ƒ์„ฑํ•  ์ˆ˜ ์žˆ์„๊นŒ?"

  • "๋‹จ์ผ RGB ์นด๋ฉ”๋ผ๋งŒ์œผ๋กœ๋„ ์ •ํ™•ํ•œ retargeting์ด ๊ฐ€๋Šฅํ• ๊นŒ?"

ํ†ต์—ญ์‚ฌ๊ฐ€ ์–ธ์–ด๋ฅผ ๋ฒˆ์—ญํ•˜๋“ฏ, SPIDER๋Š” ์ธ๊ฐ„ ์‹œ์—ฐ์„ ๋กœ๋ด‡์˜ ๋™์ ์œผ๋กœ ์‹คํ–‰ ๊ฐ€๋Šฅํ•œ ๊ถค์ ์œผ๋กœ ๋ณ€ํ™˜ํ•ฉ๋‹ˆ๋‹ค. curriculum ์Šคํƒ€์ผ์˜ ๊ฐ€์ƒ ์ ‘์ด‰ ์•ˆ๋‚ด๋กœ ์˜ฌ๋ฐ”๋ฅธ ์ ‘์ด‰ ์‹œํ€€์Šค๋ฅผ ๋ณด์žฅํ•˜๊ณ , ๋Œ€๊ทœ๋ชจ ๋ฌผ๋ฆฌ ๊ธฐ๋ฐ˜ ์ƒ˜ํ”Œ๋ง์œผ๋กœ ํ™•์žฅ์„ฑ์„ ๋‹ฌ์„ฑํ–ˆ์Šต๋‹ˆ๋‹ค. ํŠนํžˆ ์ฃผ๋ชฉํ•  ์ :

  • 9๊ฐœ์˜ ๋‹ค์–‘ํ•œ ํœด๋จธ๋…ธ์ด๋“œ/์†์žฌ์ฃผ embodiment์™€ 6๊ฐœ ๋ฐ์ดํ„ฐ์…‹์— ๊ฑธ์ณ ํ™•์žฅ

  • ํ‘œ์ค€ ์ƒ˜ํ”Œ๋ง ๋Œ€๋น„ 18% ์„ฑ๊ณต๋ฅ  ํ–ฅ์ƒ, RL ๊ธฐ๋ฐ˜ ๋ฐฉ๋ฒ•๋ณด๋‹ค 10๋ฐฐ ๋น ๋ฆ„

  • 2.4M ํ”„๋ ˆ์ž„์˜ ๋™์  ์‹คํ–‰ ๊ฐ€๋Šฅ ๋กœ๋ด‡ ๋ฐ์ดํ„ฐ์…‹ ์ƒ์„ฑ

๐ŸŽฏ ์™œ ์ด๊ฒƒ์ด ๊ฒŒ์ž„ ์ฒด์ธ์ €์ธ๊ฐ€? : ํ‚ค๋„ค๋งˆํ‹ฑ ์ „์šฉ retargeting โ†’ ๋ฌผ๋ฆฌ ๊ธฐ๋ฐ˜ ๋™์  ์‹คํ–‰ ๊ฐ€๋Šฅ ๋ณ€ํ™˜์˜ ์ „ํ™˜์  ๊ฐ•์กฐ

๐Ÿ”— ๋” ์ž์„ธํ•œ ๋‚ด์šฉ์ด ๊ถ๊ธˆํ•˜๋‹ค๋ฉด : https://arxiv.org/abs/2511.09484

๐ŸŽจ ํ…์ŠคํŠธ์™€ ์ด๋ฏธ์ง€๊ฐ€ ๊ถค์  ์ „์ฒด์—์„œ ์ƒํ˜ธ์ž‘์šฉํ•˜๋‹ค

MMaDA-Parallel: Multimodal Large Diffusion Language Models for Thinking-Aware Editing and Generation

๐Ÿ›๏ธ ์†Œ์†: Peking University, ByteDance, Princeton University, CASIA, The University of Chicago

๐Ÿท๏ธ ํ•ต์‹ฌ ํ‚ค์›Œ๋“œ: Parallel Diffusion, Cross-Modal Alignment, Trajectory-Level RL

๐Ÿ’ญ ์ด๋Ÿฐ ์งˆ๋ฌธ์„ ํ•ด๋ณธ ์  ์žˆ๋‚˜์š”?

  • "ํ…์ŠคํŠธ ์ถ”๋ก ๊ณผ ์ด๋ฏธ์ง€ ์ƒ์„ฑ์„ ๋™์‹œ์— ์ˆ˜ํ–‰ํ•  ์ˆ˜ ์žˆ์„๊นŒ?"

  • "์ˆœ์ฐจ์  ์˜ค๋ฅ˜ ์ „ํŒŒ๋ฅผ ์–ด๋–ป๊ฒŒ ๋ฐฉ์ง€ํ•  ์ˆ˜ ์žˆ์„๊นŒ?"

  • "์ƒ์„ฑ ๊ถค์  ์ „์ฒด์—์„œ ๋ชจ๋‹ฌ ๊ฐ„ ์ผ๊ด€์„ฑ์„ ์œ ์ง€ํ•  ์ˆ˜ ์žˆ์„๊นŒ?"

์˜ค์ผ€์ŠคํŠธ๋ผ์˜ ์•…๊ธฐ๋“ค์ด ์กฐํ™”๋ฅผ ์ด๋ฃจ๋“ฏ, MMaDA-Parallel์€ denoising ๊ถค์  ์ „์ฒด์—์„œ ํ…์ŠคํŠธ์™€ ์ด๋ฏธ์ง€ ๊ฐ„ ์—ฐ์†์  ์–‘๋ฐฉํ–ฅ ์ƒํ˜ธ์ž‘์šฉ์„ ๊ฐ€๋Šฅํ•˜๊ฒŒ ํ•ฉ๋‹ˆ๋‹ค. Parallel Reinforcement Learning(ParaRL)์„ ๋„์ž…ํ•˜์—ฌ ๊ถค์ ์„ ๋”ฐ๋ผ ์˜๋ฏธ์  ๋ณด์ƒ์„ ์ ์šฉํ•ด ๊ต์ฐจ ๋ชจ๋‹ฌ ์ผ๊ด€์„ฑ์„ ๊ฐ•ํ™”ํ–ˆ์Šต๋‹ˆ๋‹ค. ํŠนํžˆ ์ฃผ๋ชฉํ•  ์ :

  • ParaBench์—์„œ SOTA ๋ชจ๋ธ Bagel ๋Œ€๋น„ Output Alignment 6.9% ํ–ฅ์ƒ

  • ์˜ค๋ฅ˜ ์ „ํŒŒ๋ฅผ ํšจ๊ณผ์ ์œผ๋กœ ์™„ํ™”ํ•˜๋Š” ๋ณ‘๋ ฌ ํ”„๋ ˆ์ž„์›Œํฌ

  • ์ตœ์ข… ๊ฒฐ๊ณผ๋ฟ๋งŒ ์•„๋‹ˆ๋ผ ์ค‘๊ฐ„ ๋‹จ๊ณ„์—์„œ๋„ ์ผ๊ด€์„ฑ ์œ ์ง€

๐ŸŽฏ ์™œ ์ด๊ฒƒ์ด ๊ฒŒ์ž„ ์ฒด์ธ์ €์ธ๊ฐ€? : ์ˆœ์ฐจ์  autoregressive ์ƒ์„ฑ โ†’ ๋ณ‘๋ ฌ ๊ต์ฐจ ๋ชจ๋‹ฌ diffusion์˜ ์ „ํ™˜์  ๊ฐ•์กฐ

๐Ÿ”— ๋” ์ž์„ธํ•œ ๋‚ด์šฉ์ด ๊ถ๊ธˆํ•˜๋‹ค๋ฉด : https://arxiv.org/abs/2511.09611

๋งค์ผ ํ™”์š”์ผ ์˜ค์ „ 8์‹œ,

๋ฐ”์œ ๋‹น์‹ ์„ ๊ธฐ์ˆ  ๋ฐœ์ „์— ๋’ค์ณ์ง€์ง€ ์•Š๊ฒŒ ๋งŒ๋“ค์–ด์ค„

์ตœ์‹  AI ํŠธ๋ Œ๋“œ๊ฐ€ ์š”์•ฝ ์ •๋ฆฌ๋ณธ์œผ๋กœ ์ „๋‹ฌ๋ฉ๋‹ˆ๋‹ค!