๋ชฉ๋ก
Vol.162025.12.08

๐Ÿ“‘DeepSeek: "GPT-5? แ„‹แ…ฎแ„…แ…ตแ„ƒแ…ฉ แ„‹แ…ตแ„€แ…ตแ†ซแ„ƒแ…ก" - แ„‹แ…ฉแ„‘แ…ณแ†ซ LLMแ„‹แ…ด แ„‡แ…กแ†ซแ„…แ…กแ†ซ

25.12. 2แ„Œแ…ฎแ„Žแ…ก | Google DeepMind, DeepSeek, Meta, ByteDance, Alibaba, Stanford, NVIDIAHayejin Kang

1,549๋ช… ์ˆ˜์‹ ์˜คํ”ˆ์œจ 56.38%ํด๋ฆญ๋ฅ  6.53%

๐Ÿ“‘DeepSeek: "GPT-5? แ„‹แ…ฎแ„…แ…ตแ„ƒแ…ฉ แ„‹แ…ตแ„€แ…ตแ†ซแ„ƒแ…ก" - แ„‹แ…ฉแ„‘แ…ณแ†ซ LLMแ„‹แ…ด แ„‡แ…กแ†ซแ„…แ…กแ†ซ

25.12. 2แ„Œแ…ฎแ„Žแ…ก | Google DeepMind, DeepSeek, Meta, ByteDance, Alibaba, Stanford, NVIDIAHayejin Kang

๊ธˆ์ฃผ ์บ์น˜ํŽ˜์ดํผ๋Š” Google DeepMind, DeepSeek, Meta, ByteDance, Alibaba, Stanford, NVIDIA ์™€ ํ•จ๊ป˜ํ•ฉ๋‹ˆ๋‹ค. 3๋ถ„๋งŒ ํˆฌ์žํ•ด ์“ฑ ๋‘˜๋Ÿฌ๋ณด๊ณ , ๋น ๋ฅด๊ฒŒ ๋ฐ”๋€Œ๋Š” ๊ธฐ์ˆ ์˜ ๋ฐฉํ–ฅ์„ฑ์„ ๋†“์น˜์ง€ ๋งˆ์„ธ์š”!

๐Ÿ“ˆ ์ตœ์‹  AI ํŠธ๋ Œ๋“œ 2์ค„ ์š”์•ฝ

๐ŸŒŸ ์˜คํ”ˆ์†Œ์Šค LLM์ด ๊ตญ์ œ ์ˆ˜ํ•™ยท์ •๋ณด ์˜ฌ๋ฆผํ”ผ์•„๋“œ ๊ธˆ๋ฉ”๋‹ฌ ์ˆ˜์ค€์˜ ์ถ”๋ก  ๋Šฅ๋ ฅ์„ ๋‹ฌ์„ฑํ•˜๋ฉฐ, ๊ธฐ์กด ๋Œ€๊ธฐ์—…๋“ค์ด ๊ณต๊ฐœํ•œ ํ์‡„ํ˜• ๋ชจ๋ธ๊ณผ์˜ ๊ฒฉ์ฐจ๋ฅผ ๊ธ‰๊ฒฉํžˆ ์ขํžˆ๊ณ  ์žˆ์Šต๋‹ˆ๋‹ค.

๐Ÿš€ 3D ๊ฐ€์ƒ ์„ธ๊ณ„์—์„œ ์ž์œจ์ ์œผ๋กœ ํ•™์Šตํ•˜๋Š” ๋ฒ”์šฉ ์—์ด์ „ํŠธ, ๋ฉ€ํ‹ฐ๋ชจ๋‹ฌ ์ดํ•ดยท์ƒ์„ฑ ํ†ตํ•ฉ ๋ชจ๋ธ, ๊ทธ๋ฆฌ๊ณ  ๊ฐ•ํ™”ํ•™์Šต ์•ˆ์ •ํ™” ๊ธฐ๋ฒ• ๋“ฑ ์ฐจ์„ธ๋Œ€ AI ์ธํ”„๋ผ ์—ฐ๊ตฌ๊ฐ€ ํ™œ๋ฐœํžˆ ์ง„ํ–‰๋˜๊ณ  ์žˆ์Šต๋‹ˆ๋‹ค.

๐ŸŽฎ ๊ฒŒ์ž„ ์†์—์„œ ์Šค์Šค๋กœ ๋ฐฐ์šฐ๊ณ  ์ง„ํ™”ํ•˜๋Š” AI๊ฐ€ ์˜จ๋‹ค.

SIMA 2: A Generalist Embodied Agent for Virtual Worlds

๐Ÿ›๏ธ ์†Œ์†: Google DeepMind

๐Ÿท๏ธ ํ•ต์‹ฌ ํ‚ค์›Œ๋“œ: Embodied Agent, Gemini, Self-Improvement, Virtual Worlds

๐Ÿ’ญ ์ด๋Ÿฐ ์งˆ๋ฌธ์„ ํ•ด๋ณธ ์  ์žˆ๋‚˜์š”?

  • "AI๊ฐ€ ์ธ๊ฐ„์ฒ˜๋Ÿผ 3D ์„ธ๊ณ„๋ฅผ ์ดํ•ดํ•˜๊ณ  ํ–‰๋™ํ•  ์ˆ˜ ์žˆ์„๊นŒ?"

  • "๋‹จ์ˆœํ•œ ๋ช…๋ น ์ˆ˜ํ–‰์„ ๋„˜์–ด, AI๊ฐ€ ์Šค์Šค๋กœ ๋ชฉํ‘œ๋ฅผ ์„ค์ •ํ•˜๊ณ  ํ•™์Šตํ•  ์ˆ˜ ์žˆ์„๊นŒ?"

  • "ํ•œ ๊ฒŒ์ž„์—์„œ ๋ฐฐ์šด ๊ธฐ์ˆ ์„ ๋‹ค๋ฅธ ๊ฒŒ์ž„์—์„œ๋„ ํ™œ์šฉํ•  ์ˆ˜ ์žˆ์„๊นŒ?"

์ˆ™๋ จ๋œ ๊ฒŒ์ด๋จธ๊ฐ€ ์ƒˆ๋กœ์šด ๊ฒŒ์ž„์—์„œ๋„ ๋น ๋ฅด๊ฒŒ ์ ์‘ํ•˜๋“ฏ, SIMA 2๋Š” ๋‹ค์–‘ํ•œ 3D ๊ฐ€์ƒ ์„ธ๊ณ„์—์„œ ๋ชฉํ‘œ๋ฅผ ์ดํ•ดํ•˜๊ณ  ์ž์œจ์ ์œผ๋กœ ํ–‰๋™ํ•ฉ๋‹ˆ๋‹ค. Gemini ๋ชจ๋ธ์„ ๊ธฐ๋ฐ˜์œผ๋กœ ์ „์ž‘ ๋Œ€๋น„ ์ž‘์—… ์„ฑ๊ณต๋ฅ ์„ 2๋ฐฐ๋กœ ๋Œ์–ด์˜ฌ๋ ธ์œผ๋ฉฐ, ์Šค์Šค๋กœ ๊ณผ์ œ๋ฅผ ์ƒ์„ฑํ•˜๊ณ  ๋ณด์ƒ์„ ๋ถ€์—ฌํ•˜๋Š” ์ž๊ธฐ ๊ฐœ์„  ๋ฉ”์ปค๋‹ˆ์ฆ˜๊นŒ์ง€ ๊ฐ–์ท„์Šต๋‹ˆ๋‹ค. ํŠนํžˆ ์ฃผ๋ชฉํ•  ์ :

  • SIMA 1์˜ 31% ์„ฑ๊ณต๋ฅ ์—์„œ 62%๋กœ ๋„์•ฝ, ์ธ๊ฐ„ ์ˆ˜์ค€(71%)์— ๊ทผ์ ‘

  • ์ด๋ชจ์ง€, ์Œ์„ฑ, ์Šค์ผ€์น˜ ๋“ฑ ๋‹ค์–‘ํ•œ ์ž…๋ ฅ ๋ฐฉ์‹์œผ๋กœ ๋ช…๋ น ์ˆ˜ํ–‰ ๊ฐ€๋Šฅ

  • No Man's Sky, Goat Simulator 3 ๋“ฑ ์ƒ์šฉ ๊ฒŒ์ž„๊ณผ Genie 3 ์ƒ์„ฑ ํ™˜๊ฒฝ๊นŒ์ง€ ์ผ๋ฐ˜ํ™”

๐ŸŽฏ ์™œ ์ด๊ฒƒ์ด ๊ฒŒ์ž„ ์ฒด์ธ์ €์ธ๊ฐ€? : ๋‹จ์ˆœ ๋ช…๋ น ์ˆ˜ํ–‰ ์—์ด์ „ํŠธ โ†’ ์ž์œจ ํ•™์Šตํ•˜๋Š” ๋ฒ”์šฉ ์ฒดํ™” ์—์ด์ „ํŠธ์˜ ์ „ํ™˜์  ๊ฐ•์กฐ

๐Ÿ”— ๋” ์ž์„ธํ•œ ๋‚ด์šฉ์ด ๊ถ๊ธˆํ•˜๋‹ค๋ฉด : ๋…ผ๋ฌธ ๋งํฌ

๐Ÿฅ‡ ์˜คํ”ˆ์†Œ์Šค LLM์ด ๋“œ๋””์–ด IMO ๊ธˆ๋ฉ”๋‹ฌ์„ ๋•„๋‹ค.

DeepSeek-V3.2: Pushing the Frontier of Open Large Language Models

๐Ÿ›๏ธ ์†Œ์†: DeepSeek

๐Ÿท๏ธ ํ•ต์‹ฌ ํ‚ค์›Œ๋“œ: Open LLM, Sparse Attention, IMO Gold Medal, Reinforcement Learning

๐Ÿ’ญ ์ด๋Ÿฐ ์งˆ๋ฌธ์„ ํ•ด๋ณธ ์  ์žˆ๋‚˜์š”?

  • "์˜คํ”ˆ์†Œ์Šค ๋ชจ๋ธ๋„ GPT-5์™€ ๊ฒฝ์Ÿํ•  ์ˆ˜ ์žˆ์„๊นŒ?"

  • "๊ตญ์ œ ์ˆ˜ํ•™ ์˜ฌ๋ฆผํ”ผ์•„๋“œ ๋ฌธ์ œ๋ฅผ AI๊ฐ€ ํ’€ ์ˆ˜ ์žˆ์„๊นŒ?"

  • "ํšจ์œจ์„ฑ๊ณผ ์ถ”๋ก  ๋Šฅ๋ ฅ์„ ๋™์‹œ์— ์žก์„ ์ˆ˜ ์žˆ์„๊นŒ?"

์˜ฌ๋ฆผํ”ฝ ๊ธˆ๋ฉ”๋‹ฌ๋ฆฌ์ŠคํŠธ๊ฐ€ ํŠน์ • ์ข…๋ชฉ์ด ์•„๋‹Œ ์ „ ์ข…๋ชฉ์—์„œ ๋น›๋‚˜๋“ฏ, DeepSeek-V3.2๋Š” ์ˆ˜ํ•™, ์ฝ”๋”ฉ, ์—์ด์ „ํŠธ ์ž‘์—… ๋ชจ๋‘์—์„œ ์ตœ์ •์ƒ๊ธ‰ ์„ฑ๋Šฅ์„ ๋ณด์—ฌ์ค๋‹ˆ๋‹ค. ํŠนํžˆ Speciale ๋ณ€ํ˜•์€ 2025๋…„ IMO์™€ IOI์—์„œ ๊ธˆ๋ฉ”๋‹ฌ ์ˆ˜์ค€์˜ ์„ฑ์ ์„ ๋‹ฌ์„ฑํ–ˆ์Šต๋‹ˆ๋‹ค. ํŠนํžˆ ์ฃผ๋ชฉํ•  ์ :

  • DeepSeek Sparse Attention(DSA)์œผ๋กœ O(Lยฒ)์—์„œ O(Lk)๋กœ ์—ฐ์‚ฐ ๋ณต์žก๋„ ๋Œ€ํญ ๊ฐ์†Œ

  • GPT-5์™€ ๋™๋“ฑ, Gemini-3.0-Pro ์ˆ˜์ค€์˜ ์ถ”๋ก  ๋Šฅ๋ ฅ

  • 1,827๊ฐœ ํ™˜๊ฒฝ, 85,000๊ฐœ ๋ณต์žก ํ”„๋กฌํ”„ํŠธ๋กœ ์—์ด์ „ํŠธ ๋Šฅ๋ ฅ ๊ฐ•ํ™”

๐ŸŽฏ ์™œ ์ด๊ฒƒ์ด ๊ฒŒ์ž„ ์ฒด์ธ์ €์ธ๊ฐ€? : ํ์‡„ํ˜• ๋ชจ๋ธ ๋…์ ์˜ ์ถ”๋ก  ์˜์—ญ โ†’ ์˜คํ”ˆ์†Œ์Šค์˜ ๊ธˆ๋ฉ”๋‹ฌ ์ง„์ž… ์ „ํ™˜์  ๊ฐ•์กฐ

๐Ÿ”— ๋” ์ž์„ธํ•œ ๋‚ด์šฉ์ด ๊ถ๊ธˆํ•˜๋‹ค๋ฉด : ๋…ผ๋ฌธ ๋งํฌ

๐Ÿ–ผ๏ธ ์ด๋ฏธ์ง€๊ฐ€ ๋’ค์ง‘ํžˆ๋ฉด ๋ชป ์•Œ์•„๋ณธ๋‹ค๊ณ ?

Thinking with Programming Vision (CodeVision)

๐Ÿ›๏ธ ์†Œ์†: Zhejiang University, ByteDance

๐Ÿท๏ธ ํ•ต์‹ฌ ํ‚ค์›Œ๋“œ: Code-as-Tool, MLLM Robustness, Image Manipulation, Tool Use

๐Ÿ’ญ ์ด๋Ÿฐ ์งˆ๋ฌธ์„ ํ•ด๋ณธ ์  ์žˆ๋‚˜์š”?

  • "GPT-5๋„ 90๋„ ํšŒ์ „๋œ ์ด๋ฏธ์ง€๋ฅผ ์ธ์‹ํ•˜์ง€ ๋ชปํ•œ๋‹ค๋ฉด?"

  • "AI๊ฐ€ ๋„๊ตฌ๋ฅผ ์‚ฌ์šฉํ•ด ์ด๋ฏธ์ง€๋ฅผ ์ง์ ‘ ์กฐ์ž‘ํ•  ์ˆ˜ ์žˆ์„๊นŒ?"

  • "๋” ์œ ์—ฐํ•˜๊ณ  ํ™•์žฅ ๊ฐ€๋Šฅํ•œ ๋„๊ตฌ ์‚ฌ์šฉ ํ”„๋ ˆ์ž„์›Œํฌ๋Š” ์—†์„๊นŒ?"

์Šค์œ„์Šค ์•„๋ฏธ ๋‚˜์ดํ”„์ฒ˜๋Ÿผ ๋‹ค์–‘ํ•œ ๋„๊ตฌ๋ฅผ ์ƒํ™ฉ์— ๋งž๊ฒŒ ๊บผ๋‚ด ์“ฐ๋“ฏ, CodeVision์€ ์ฝ”๋“œ ์ƒ์„ฑ์„ ํ†ตํ•ด ์–ด๋–ค ์ด๋ฏธ์ง€ ์—ฐ์‚ฐ์ด๋“  ํ˜ธ์ถœํ•  ์ˆ˜ ์žˆ๋Š” ๋ฒ”์šฉ ๋„๊ตฌ ์ธํ„ฐํŽ˜์ด์Šค๋ฅผ ์ œ๊ณตํ•ฉ๋‹ˆ๋‹ค. ๋‹จ์ˆœ ํšŒ์ „์ด๋‚˜ ๋’ค์ง‘๊ธฐ์—๋„ ์„ฑ๋Šฅ์ด 80%๊นŒ์ง€ ๋–จ์–ด์ง€๋Š” ์ตœ์‹  ๋ชจ๋ธ์˜ ์ทจ์•ฝ์ ์„ ๊ทน๋ณตํ•ฉ๋‹ˆ๋‹ค. ํŠนํžˆ ์ฃผ๋ชฉํ•  ์ :

  • ๊ณ ์ •๋œ ๋„๊ตฌ ์„ธํŠธ ๋Œ€์‹  ์ฝ”๋“œ๋กœ ๋ฌดํ•œ ํ™•์žฅ ๊ฐ€๋Šฅํ•œ ๋„๊ตฌ ํ˜ธ์ถœ

  • ์—๋Ÿฌ ๋ณต๊ตฌ, ๋„๊ตฌ ์ฒด์ด๋‹ ๋“ฑ ์ฐฝ๋ฐœ์  ๋Šฅ๋ ฅ ๋ฐœํ˜„

  • Qwen2.5-VL, Qwen3-VL ์‹œ๋ฆฌ์ฆˆ์—์„œ ์„ฑ๋Šฅ ๋Œ€ํญ ํ–ฅ์ƒ ๊ฒ€์ฆ

๐ŸŽฏ ์™œ ์ด๊ฒƒ์ด ๊ฒŒ์ž„ ์ฒด์ธ์ €์ธ๊ฐ€? : ์ œํ•œ๋œ ๋„๊ตฌ ์„ธํŠธ โ†’ ์ฝ”๋“œ ๊ธฐ๋ฐ˜ ๋ฒ”์šฉ ๋„๊ตฌ ์ธํ„ฐํŽ˜์ด์Šค์˜ ์ „ํ™˜์  ๊ฐ•์กฐ

๐Ÿ”— ๋” ์ž์„ธํ•œ ๋‚ด์šฉ์ด ๊ถ๊ธˆํ•˜๋‹ค๋ฉด : ๋…ผ๋ฌธ ๋งํฌ

๐Ÿง  LLM์˜ ์ถ”๋ก  ๊ณผ์ •์„ ์ˆ˜ํ•™์ ์œผ๋กœ ํ˜•์‹ํ™”ํ•  ์ˆ˜ ์žˆ๋‹ค๋ฉด?

Algorithmic Thinking Theory

๐Ÿ›๏ธ ์†Œ์†: Google, NYU, ETH Zurich, Stanford

๐Ÿท๏ธ ํ•ต์‹ฌ ํ‚ค์›Œ๋“œ: Reasoning Algorithm, Probabilistic Oracle, Iterative Improvement, Branching

๐Ÿ’ญ ์ด๋Ÿฐ ์งˆ๋ฌธ์„ ํ•ด๋ณธ ์  ์žˆ๋‚˜์š”?

  • "์™œ ๊ฐ™์€ ๋ชจ๋ธ๋„ ์—ฌ๋Ÿฌ ๋ฒˆ ์‹œ๋„ํ•˜๋ฉด ๋” ์ข‹์€ ๋‹ต์„ ๋‚ผ๊นŒ?"

  • "Chain-of-Thought๋‚˜ Tree-of-Thought๊ฐ€ ์™œ ํšจ๊ณผ์ ์ธ์ง€ ์ด๋ก ์ ์œผ๋กœ ์„ค๋ช…ํ•  ์ˆ˜ ์žˆ์„๊นŒ?"

  • "์ตœ์ ์˜ ์ถ”๋ก  ์•Œ๊ณ ๋ฆฌ์ฆ˜์„ ์„ค๊ณ„ํ•˜๋Š” ์›๋ฆฌ๋Š” ๋ฌด์—‡์ผ๊นŒ?"

์˜ค์ผ€์ŠคํŠธ๋ผ ์ง€ํœ˜์ž๊ฐ€ ๊ฐ ์•…๊ธฐ์˜ ํŠน์„ฑ์„ ์ดํ•ดํ•˜๊ณ  ์ตœ์ ์˜ ํ•˜๋ชจ๋‹ˆ๋ฅผ ๋งŒ๋“ค๋“ฏ, ์ด ์—ฐ๊ตฌ๋Š” LLM์„ ํ™•๋ฅ ์  ์˜ค๋ผํด๋กœ ๋ชจ๋ธ๋งํ•˜๊ณ  ๋ฐ˜๋ณต ์ถ”๋ก  ์•Œ๊ณ ๋ฆฌ์ฆ˜์„ ์ˆ˜ํ•™์ ์œผ๋กœ ๋ถ„์„ํ•ฉ๋‹ˆ๋‹ค. ๋ถ„๊ธฐ ์•Œ๊ณ ๋ฆฌ์ฆ˜๊ณผ ์œ ์ „ ์•Œ๊ณ ๋ฆฌ์ฆ˜์ด ์ตœ์  ์„ฑ๊ณต ํ™•๋ฅ ์„ ๋‹ฌ์„ฑํ•  ์ˆ˜ ์žˆ์Œ์„ ์ฆ๋ช…ํ–ˆ์Šต๋‹ˆ๋‹ค. ํŠนํžˆ ์ฃผ๋ชฉํ•  ์ :

  • ๊ฒฝํ—˜์  ๊ด€์ฐฐ์„ ๋„˜์–ด ์ด๋ก ์  ๊ธฐ๋ฐ˜ ์ œ๊ณต

  • ๋ชจ๋ธ ์•„ํ‚คํ…์ฒ˜์— ๋…๋ฆฝ์ ์ธ ๋ฒ”์šฉ ํ”„๋ ˆ์ž„์›Œํฌ

  • "overthinking" ํ˜„์ƒ ๋“ฑ ์‹ค์ œ ๊ด€์ฐฐ๋˜๋Š” ํ˜„์ƒ๊นŒ์ง€ ์„ค๋ช…

๐ŸŽฏ ์™œ ์ด๊ฒƒ์ด ๊ฒŒ์ž„ ์ฒด์ธ์ €์ธ๊ฐ€? : ๊ฒฝํ—˜์  ์ถ”๋ก  ๊ธฐ๋ฒ• โ†’ ์ˆ˜ํ•™์ ์œผ๋กœ ๊ฒ€์ฆ๋œ ์ถ”๋ก  ์•Œ๊ณ ๋ฆฌ์ฆ˜ ์„ค๊ณ„ ์›๋ฆฌ์˜ ์ „ํ™˜์  ๊ฐ•์กฐ

๐Ÿ”— ๋” ์ž์„ธํ•œ ๋‚ด์šฉ์ด ๊ถ๊ธˆํ•˜๋‹ค๋ฉด : ๋…ผ๋ฌธ ๋งํฌ

๐ŸŽฌ ์–ธ์–ด๋กœ ์ƒ๊ฐํ•˜๊ณ , ํ”ฝ์…€๋กœ ํ–‰๋™ํ•œ๋‹ค.

TV2TV: A Unified Framework for Interleaved Language and Video Generation

๐Ÿ›๏ธ ์†Œ์†: Meta FAIR

๐Ÿท๏ธ ํ•ต์‹ฌ ํ‚ค์›Œ๋“œ: Interleaved Generation, Video-Text Omni Model, Flow Matching, Controllability

๐Ÿ’ญ ์ด๋Ÿฐ ์งˆ๋ฌธ์„ ํ•ด๋ณธ ์  ์žˆ๋‚˜์š”?

  • "๋น„๋””์˜ค ์ƒ์„ฑ ์ค‘๊ฐ„์— '๋‹ค์Œ์— ๋ฌด์—‡์„ ํ• ์ง€' ์–ธ์–ด๋กœ ๊ณ„ํšํ•  ์ˆ˜ ์žˆ์„๊นŒ?"

  • "๋ณต์žกํ•œ ์‹œ๋‚˜๋ฆฌ์˜ค์˜ ์žฅํŽธ ๋น„๋””์˜ค๋ฅผ ์ผ๊ด€์„ฑ ์žˆ๊ฒŒ ์ƒ์„ฑํ•  ์ˆ˜ ์žˆ์„๊นŒ?"

  • "์ƒ์„ฑ ๋„์ค‘์— ์‚ฌ์šฉ์ž๊ฐ€ ๊ฐœ์ž…ํ•ด ๋ฐฉํ–ฅ์„ ๋ฐ”๊ฟ€ ์ˆ˜ ์žˆ์„๊นŒ?"

์˜ํ™” ๊ฐ๋…์ด ๋Œ€๋ณธ์„ ์ฝ๊ณ  ์žฅ๋ฉด์„ ์—ฐ์ถœํ•˜๋“ฏ, TV2TV๋Š” ํ…์ŠคํŠธ์™€ ๋น„๋””์˜ค ์ƒ์„ฑ์„ ๊ต์ฐจํ•˜๋ฉฐ ์ง„ํ–‰ํ•ฉ๋‹ˆ๋‹ค. ๋จผ์ € "๋ง๋กœ ์ƒ๊ฐ"ํ•œ ๋’ค "ํ”ฝ์…€๋กœ ํ–‰๋™"ํ•˜๋Š” ๋ฐฉ์‹์œผ๋กœ, ๋ณต์žกํ•œ ๋น„๋””์˜ค๋„ ๋…ผ๋ฆฌ์  ์ผ๊ด€์„ฑ์„ ์œ ์ง€ํ•ฉ๋‹ˆ๋‹ค. ํŠนํžˆ ์ฃผ๋ชฉํ•  ์ :

  • ๋‹จ์ˆœ T2V ๋Œ€๋น„ 92%์˜ ์‹œ๊ฐ ํ’ˆ์งˆ ์„ ํ˜ธ๋„ ํš๋“

  • Think2V ๋ฐฉ์‹ ๋Œ€๋น„ ์„ธ๋ฐ€ํ•œ ๋ช…๋ น ์ค€์ˆ˜์œจ 19ํฌ์ธํŠธ ํ–ฅ์ƒ

  • ๊ฒŒ์ž„ ๋ฐ์ดํ„ฐ(CS:GO)์™€ ์Šคํฌ์ธ  ๋น„๋””์˜ค๊นŒ์ง€ ํ™•์žฅ ๊ฒ€์ฆ

๐ŸŽฏ ์™œ ์ด๊ฒƒ์ด ๊ฒŒ์ž„ ์ฒด์ธ์ €์ธ๊ฐ€? : ์ผ๋ฐฉํ–ฅ ๋น„๋””์˜ค ์ƒ์„ฑ โ†’ ์–ธ์–ด ์ถ”๋ก ๊ณผ ๋น„๋””์˜ค ์ƒ์„ฑ์˜ ์ธํ„ฐ๋ฆฌ๋น™ ์ „ํ™˜์  ๊ฐ•์กฐ

๐Ÿ”— ๋” ์ž์„ธํ•œ ๋‚ด์šฉ์ด ๊ถ๊ธˆํ•˜๋‹ค๋ฉด : ๋…ผ๋ฌธ ๋งํฌ

โš–๏ธ MoE ๋ชจ๋ธ์˜ ๊ฐ•ํ™”ํ•™์Šต, ์™œ ๋ถˆ์•ˆ์ •ํ• ๊นŒ?

Stabilizing Reinforcement Learning with LLMs: Formulation and Practices

๐Ÿ›๏ธ ์†Œ์†: Alibaba Qwen Team

๐Ÿท๏ธ ํ•ต์‹ฌ ํ‚ค์›Œ๋“œ: MoE LLM, RL Stability, Token-level Optimization, Routing Replay

๐Ÿ’ญ ์ด๋Ÿฐ ์งˆ๋ฌธ์„ ํ•ด๋ณธ ์  ์žˆ๋‚˜์š”?

  • "์‹œํ€€์Šค ์ˆ˜์ค€ ๋ณด์ƒ์„ ํ† ํฐ ์ˆ˜์ค€์œผ๋กœ ์ตœ์ ํ™”ํ•ด๋„ ๊ดœ์ฐฎ์„๊นŒ?"

  • "์™œ MoE ๋ชจ๋ธ์˜ RL ํ›ˆ๋ จ์€ ์œ ๋… ๋ถˆ์•ˆ์ •ํ• ๊นŒ?"

  • "ํ›ˆ๋ จ-์ถ”๋ก  ๊ฐ„ ๋ถˆ์ผ์น˜๋ฅผ ์–ด๋–ป๊ฒŒ ํ•ด๊ฒฐํ•  ์ˆ˜ ์žˆ์„๊นŒ?"

์ •๊ตํ•œ ์‹œ๊ณ„์˜ ํ†ฑ๋‹ˆ๋ฐ”ํ€ด๋“ค์ด ์™„๋ฒฝํžˆ ๋งž๋ฌผ๋ ค์•ผ ํ•˜๋“ฏ, ์ด ์—ฐ๊ตฌ๋Š” LLM ๊ฐ•ํ™”ํ•™์Šต์˜ ํ† ํฐ ์ˆ˜์ค€ ์ตœ์ ํ™”๊ฐ€ 1์ฐจ ๊ทผ์‚ฌ๋กœ์„œ ํƒ€๋‹นํ•จ์„ ์ด๋ก ์ ์œผ๋กœ ์ฆ๋ช…ํ•ฉ๋‹ˆ๋‹ค. ํ›ˆ๋ จ-์ถ”๋ก  ๋ถˆ์ผ์น˜์™€ ์ •์ฑ… ๋…ธํ›„ํ™”๋ฅผ ์ตœ์†Œํ™”ํ•˜๋ฉด ์•ˆ์ •์ ์ธ RL์ด ๊ฐ€๋Šฅํ•ฉ๋‹ˆ๋‹ค. ํŠนํžˆ ์ฃผ๋ชฉํ•  ์ :

  • ํ† ํฐ ์ˆ˜์ค€ ์ตœ์ ํ™”์˜ ์ด๋ก ์  ์ •๋‹น์„ฑ ์ตœ์ดˆ ์ œ์‹œ

  • MoE ํŠนํ™” Routing Replay ๊ธฐ๋ฒ•์œผ๋กœ ์•ˆ์ •์„ฑ ๋Œ€ํญ ํ–ฅ์ƒ

  • ์ˆ˜์‹ญ๋งŒ GPU ์‹œ๊ฐ„์˜ ๋Œ€๊ทœ๋ชจ ์‹คํ—˜์œผ๋กœ ๊ฒ€์ฆ

๐ŸŽฏ ์™œ ์ด๊ฒƒ์ด ๊ฒŒ์ž„ ์ฒด์ธ์ €์ธ๊ฐ€? : ๊ฒฝํ—˜์  RL ๋ ˆ์‹œํ”ผ โ†’ ์ด๋ก ์ ์œผ๋กœ ๊ฒ€์ฆ๋œ ์•ˆ์ •ํ™” ํ”„๋ ˆ์ž„์›Œํฌ์˜ ์ „ํ™˜์  ๊ฐ•์กฐ

๐Ÿ”— ๋” ์ž์„ธํ•œ ๋‚ด์šฉ์ด ๊ถ๊ธˆํ•˜๋‹ค๋ฉด : ๋…ผ๋ฌธ ๋งํฌ

๐ŸŽจ ํ™•์‚ฐ ๋ชจ๋ธ RL์˜ ๋ฆฌ์›Œ๋“œ ํ•ดํ‚น, ์–ด๋–ป๊ฒŒ ๋ง‰์„ ์ˆ˜ ์žˆ์„๊นŒ?

DDRL: Data-regularized Reinforcement Learning for Diffusion Models at Scale

๐Ÿ›๏ธ ์†Œ์†: Stanford University, NVIDIA, Tsinghua University

๐Ÿท๏ธ ํ•ต์‹ฌ ํ‚ค์›Œ๋“œ: Diffusion RL, Reward Hacking, Forward KL Divergence, Off-policy Regularization

๐Ÿ’ญ ์ด๋Ÿฐ ์งˆ๋ฌธ์„ ํ•ด๋ณธ ์  ์žˆ๋‚˜์š”?

  • "์™œ RL๋กœ ํ•™์Šตํ•œ ์ด๋ฏธ์ง€ ์ƒ์„ฑ ๋ชจ๋ธ์€ ํ’ˆ์งˆ์ด ๋–จ์–ด์ง€๊ฑฐ๋‚˜ ๊ณผ๋„ํ•˜๊ฒŒ ์Šคํƒ€์ผํ™”๋ ๊นŒ?"

  • "๋ฆฌ์›Œ๋“œ ํ•ดํ‚น ์—†์ด ์ธ๊ฐ„ ์„ ํ˜ธ๋„์— ๋งž์ถ”๋Š” ๋ฐฉ๋ฒ•์€ ์—†์„๊นŒ?"

  • "SFT์™€ RL์„ ํ•˜๋‚˜์˜ ํ”„๋ ˆ์ž„์›Œํฌ๋กœ ํ†ตํ•ฉํ•  ์ˆ˜ ์žˆ์„๊นŒ?"

ํ•ญํ•ด์‚ฌ๊ฐ€ ๋‚˜์นจ๋ฐ˜๊ณผ ๋ณ„์ž๋ฆฌ๋ฅผ ํ•จ๊ป˜ ์ฐธ์กฐํ•˜๋“ฏ, DDRL์€ Forward KL ๋ฐœ์‚ฐ์œผ๋กœ ์˜คํ”„ํด๋ฆฌ์‹œ ๋ฐ์ดํ„ฐ์— ์•ต์ปค๋งํ•˜๋ฉฐ ๋ณด์ƒ์„ ์ตœ๋Œ€ํ™”ํ•ฉ๋‹ˆ๋‹ค. ๋ฐฑ๋งŒ GPU ์‹œ๊ฐ„์˜ ์‹คํ—˜๊ณผ ๋งŒ ๊ฑด์˜ ์ด์ค‘๋งน๊ฒ€ ์ธ๊ฐ„ ํ‰๊ฐ€๋กœ ํšจ๊ณผ๋ฅผ ๊ฒ€์ฆํ–ˆ์Šต๋‹ˆ๋‹ค. ํŠนํžˆ ์ฃผ๋ชฉํ•  ์ :

  • On-policy ์ •๊ทœํ™”์˜ ํ•œ๊ณ„๋ฅผ Off-policy ๋ฐ์ดํ„ฐ ์•ต์ปค๋ง์œผ๋กœ ๊ทน๋ณต

  • DanceGRPO ๋“ฑ ๊ธฐ์กด ๋ฐฉ์‹๊ณผ ๋‹ฌ๋ฆฌ ํŒŒ๋ ˆํ†  ๊ฐœ์„  ๋‹ฌ์„ฑ

  • ๋Œ€๊ทœ๋ชจ ๋น„๋””์˜คยท์ด๋ฏธ์ง€ ์ƒ์„ฑ์—์„œ ์ตœ๊ณ  ์ธ๊ฐ„ ์„ ํ˜ธ๋„ ๋‹ฌ์„ฑ

๐ŸŽฏ ์™œ ์ด๊ฒƒ์ด ๊ฒŒ์ž„ ์ฒด์ธ์ €์ธ๊ฐ€? : ๋ฆฌ์›Œ๋“œ ํ•ดํ‚น์— ์ทจ์•ฝํ•œ ํ™•์‚ฐ RL โ†’ ๋ฐ์ดํ„ฐ ๊ธฐ๋ฐ˜ ๊ฐ•๊ฑดํ•œ ์ •๊ทœํ™”์˜ ์ „ํ™˜์  ๊ฐ•์กฐ

๐Ÿ”— ๋” ์ž์„ธํ•œ ๋‚ด์šฉ์ด ๊ถ๊ธˆํ•˜๋‹ค๋ฉด : ๋…ผ๋ฌธ ๋งํฌ

๐ŸŸ ํ•˜๋‚˜์˜ ๋ชจ๋ธ๋กœ ์ดํ•ดํ•˜๊ณ  ์ƒ์„ฑํ•˜๊ณ  ํŽธ์ง‘๊นŒ์ง€.

Tuna: Taming Unified Visual Representations for Native Unified Multimodal Models

๐Ÿ›๏ธ ์†Œ์†: Meta BizAI, University of Waterloo, University of Hong Kong, KAUST

๐Ÿท๏ธ ํ•ต์‹ฌ ํ‚ค์›Œ๋“œ: Unified Multimodal Model, Cascaded VAE, Visual Understanding, Image Generation

๐Ÿ’ญ ์ด๋Ÿฐ ์งˆ๋ฌธ์„ ํ•ด๋ณธ ์  ์žˆ๋‚˜์š”?

  • "์ด๋ฏธ์ง€ ์ดํ•ด์™€ ์ƒ์„ฑ์„ ํ•˜๋‚˜์˜ ๋ชจ๋ธ๋กœ ํ•  ์ˆ˜ ์žˆ์„๊นŒ?"

  • "๋ถ„๋ฆฌ๋œ ์ธ์ฝ”๋”๊ฐ€ ๋งŒ๋“œ๋Š” ํ‘œํ˜„ ๋ถˆ์ผ์น˜ ๋ฌธ์ œ๋ฅผ ํ•ด๊ฒฐํ•  ์ˆ˜ ์žˆ์„๊นŒ?"

  • "๋” ์ž‘์€ ๋ชจ๋ธ๋กœ ๋” ํฐ ์„ฑ๋Šฅ์„ ๋‚ผ ์ˆ˜ ์žˆ์„๊นŒ?"

๋งŒ๋Šฅ ์š”๋ฆฌ์‚ฌ๊ฐ€ ๋ชจ๋“  ์žฌ๋ฃŒ๋ฅผ ํ•˜๋‚˜์˜ ์ฃผ๋ฐฉ์—์„œ ๋‹ค๋ฃจ๋“ฏ, Tuna๋Š” VAE ์ธ์ฝ”๋”์™€ ํ‘œํ˜„ ์ธ์ฝ”๋”๋ฅผ ๊ณ„๋‹จ์‹์œผ๋กœ ์—ฐ๊ฒฐํ•ด ์ดํ•ดยท์ƒ์„ฑยทํŽธ์ง‘์„ ๋‹จ์ผ ์—ฐ์† ํ‘œํ˜„ ๊ณต๊ฐ„์—์„œ ์ˆ˜ํ–‰ํ•ฉ๋‹ˆ๋‹ค. ํŠนํžˆ ์ฃผ๋ชฉํ•  ์ :

  • ๋ถ„๋ฆฌ๋œ ํ‘œํ˜„์œผ๋กœ ์ธํ•œ ํฌ๋งท ๋ถˆ์ผ์น˜ ๋ฌธ์ œ ํ•ด๊ฒฐ

  • 4B ํŒŒ๋ผ๋ฏธํ„ฐ๋กœ BAGEL-7B ๋“ฑ ๋Œ€ํ˜• ๋ชจ๋ธ ๋Šฅ๊ฐ€

  • ์ด๋ฏธ์ง€ยท๋น„๋””์˜ค ์ดํ•ด, ์ƒ์„ฑ, ํŽธ์ง‘ ๋ฒค์น˜๋งˆํฌ์—์„œ SOTA

๐ŸŽฏ ์™œ ์ด๊ฒƒ์ด ๊ฒŒ์ž„ ์ฒด์ธ์ €์ธ๊ฐ€? : ๋ถ„๋ฆฌ๋œ ์ดํ•ด-์ƒ์„ฑ ๋ชจ๋ธ โ†’ ํ†ตํ•ฉ ์—ฐ์† ํ‘œํ˜„ ๊ธฐ๋ฐ˜ ๋„ค์ดํ‹ฐ๋ธŒ ๋ฉ€ํ‹ฐ๋ชจ๋‹ฌ์˜ ์ „ํ™˜์  ๊ฐ•์กฐ

๐Ÿ”— ๋” ์ž์„ธํ•œ ๋‚ด์šฉ์ด ๊ถ๊ธˆํ•˜๋‹ค๋ฉด : ๋…ผ๋ฌธ ๋งํฌ

๐Ÿ”บ ์‚ผ๊ฐํ˜• ๋ฉ”์‹œ๋กœ 3D ๋ Œ๋”๋ง์˜ ์ƒˆ ์ง€ํ‰์„ ์—ด๋‹ค.

Radiance Meshes for Volumetric Reconstruction

๐Ÿ›๏ธ ์†Œ์†: Google, UC San Diego

๐Ÿท๏ธ ํ•ต์‹ฌ ํ‚ค์›Œ๋“œ: Delaunay Tetrahedralization, Volume Rendering, Rasterization, 3D Gaussian Splatting

๐Ÿ’ญ ์ด๋Ÿฐ ์งˆ๋ฌธ์„ ํ•ด๋ณธ ์  ์žˆ๋‚˜์š”?

  • "3D Gaussian Splatting๋ณด๋‹ค ๋น ๋ฅด๊ณ  ์ •ํ™•ํ•œ ๋ Œ๋”๋ง์ด ๊ฐ€๋Šฅํ• ๊นŒ?"

  • "GPU ํ•˜๋“œ์›จ์–ด์— ๋„ค์ดํ‹ฐ๋ธŒ๋กœ ์ตœ์ ํ™”๋œ ๋ฐฉ์‚ฌ์žฅ ํ‘œํ˜„์€ ์—†์„๊นŒ?"

  • "์‹œ์  ๋ณ€ํ™”์— ๋”ฐ๋ฅธ ํŒํ•‘ ์•„ํ‹ฐํŒฉํŠธ๋ฅผ ์™„์ „ํžˆ ์ œ๊ฑฐํ•  ์ˆ˜ ์žˆ์„๊นŒ?"

๋ ˆ๊ณ  ๋ธ”๋ก์ฒ˜๋Ÿผ ๊ธฐ๋ณธ ๋‹จ์œ„๋ฅผ ์กฐํ•ฉํ•ด ๋ณต์žกํ•œ ๊ตฌ์กฐ๋ฅผ ๋งŒ๋“ค๋“ฏ, Radiance Meshes๋Š” Delaunay ์‚ฌ๋ฉด์ฒด๋กœ ๊ณต๊ฐ„์„ ๋ถ„ํ• ํ•˜๊ณ  ๊ฐ ์…€์— ๋ฐ€๋„์™€ ์ƒ‰์ƒ์„ ๋ถ€์—ฌํ•ฉ๋‹ˆ๋‹ค. GPU๊ฐ€ ๊ธฐ๋ณธ ์ง€์›ํ•˜๋Š” ์‚ผ๊ฐํ˜•์„ ํ™œ์šฉํ•ด ์ •ํ™•ํ•˜๊ณ  ๋น ๋ฅธ ๋ณผ๋ฅจ ๋ Œ๋”๋ง์„ ๊ตฌํ˜„ํ•ฉ๋‹ˆ๋‹ค. ํŠนํžˆ ์ฃผ๋ชฉํ•  ์ :

  • ๋ณผ๋ฅจ ๋ Œ๋”๋ง ๋ฐฉ์ •์‹์„ ๊ทผ์‚ฌ ์—†์ด ์ •ํ™•ํžˆ ๊ณ„์‚ฐ

  • ๋™์ผ ์กฐ๊ฑด์—์„œ 3DGS๋ณด๋‹ค 32% ๋น ๋ฅธ ๋ Œ๋”๋ง

  • ๋ž˜์Šคํ„ฐํ™”์™€ ๋ ˆ์ดํŠธ๋ ˆ์ด์‹ฑ ๋ชจ๋‘ ์ง€์›, ๋ฌผ๋ฆฌ ์‹œ๋ฎฌ๋ ˆ์ด์…˜๊ณผ ์ง์ ‘ ํ†ตํ•ฉ ๊ฐ€๋Šฅ

๐ŸŽฏ ์™œ ์ด๊ฒƒ์ด ๊ฒŒ์ž„ ์ฒด์ธ์ €์ธ๊ฐ€? : ๊ทผ์‚ฌ ๊ธฐ๋ฐ˜ ์Šคํ”Œ๋ž˜ํŒ… โ†’ ์ •ํ™•ํ•œ ๋ณผ๋ฅจ ๋ Œ๋”๋ง์˜ ๋ฉ”์‹œ ๊ธฐ๋ฐ˜ ํŒจ๋Ÿฌ๋‹ค์ž„ ์ „ํ™˜์  ๊ฐ•์กฐ

๐Ÿ”— ๋” ์ž์„ธํ•œ ๋‚ด์šฉ์ด ๊ถ๊ธˆํ•˜๋‹ค๋ฉด : ๋…ผ๋ฌธ ๋งํฌ

๐Ÿง  AI ์—์ด์ „ํŠธ๊ฐ€ ํ‰์ƒ ํ•™์Šตํ•˜๋ ค๋ฉด ๋ฌด์—‡์ด ํ•„์š”ํ• ๊นŒ?

MemVerse: Multimodal Memory for Lifelong Learning Agents

๐Ÿ›๏ธ ์†Œ์†: Shanghai Artificial Intelligence Laboratory

๐Ÿท๏ธ ํ•ต์‹ฌ ํ‚ค์›Œ๋“œ: Lifelong Learning, Knowledge Graph, Parametric Memory, Memory Distillation

๐Ÿ’ญ ์ด๋Ÿฐ ์งˆ๋ฌธ์„ ํ•ด๋ณธ ์  ์žˆ๋‚˜์š”?

  • "AI ์—์ด์ „ํŠธ๊ฐ€ ๊ณผ๊ฑฐ ๊ฒฝํ—˜์„ ๊ธฐ์–ตํ•˜๊ณ  ํ™œ์šฉํ•  ์ˆ˜ ์žˆ์„๊นŒ?"

  • "์ง€์‹ ๊ทธ๋ž˜ํ”„์™€ ์‹ ๊ฒฝ๋ง ๋ฉ”๋ชจ๋ฆฌ๋ฅผ ํ†ตํ•ฉํ•  ์ˆ˜ ์žˆ์„๊นŒ?"

  • "์น˜๋ช…์  ๋ง๊ฐ ์—†์ด ์ง€์†์ ์œผ๋กœ ํ•™์Šตํ•˜๋Š” ๋ฐฉ๋ฒ•์€?"

์ธ๊ฐ„์ด ์žฅ๊ธฐ ๊ธฐ์–ต๊ณผ ๋‹จ๊ธฐ ๊ธฐ์–ต์„ ์กฐํ™”๋กญ๊ฒŒ ํ™œ์šฉํ•˜๋“ฏ, MemVerse๋Š” ๋ช…์‹œ์  ์ง€์‹ ๊ทธ๋ž˜ํ”„์™€ ๋น ๋ฅธ ํŒŒ๋ผ๋ฉ”ํŠธ๋ฆญ ๋ฉ”๋ชจ๋ฆฌ๋ฅผ ํ†ตํ•ฉํ•ฉ๋‹ˆ๋‹ค. ์ฃผ๊ธฐ์  ์ฆ๋ฅ˜๋กœ ์ค‘์š” ์ง€์‹์„ ๋ชจ๋ธ ๊ฐ€์ค‘์น˜์— ์••์ถ•ํ•ด ๋น ๋ฅธ ํšŒ์ƒ๊ณผ ๊ตฌ์กฐํ™”๋œ ์ €์žฅ์„ ๋™์‹œ์— ๋‹ฌ์„ฑํ•ฉ๋‹ˆ๋‹ค. ํŠนํžˆ ์ฃผ๋ชฉํ•  ์ :

  • ScienceQA์—์„œ GPT-4o-mini ๋Œ€๋น„ 9%p ํ–ฅ์ƒ(85.48% ๋‹ฌ์„ฑ)

  • MSR-VTT ํ…์ŠคํŠธ-๋น„๋””์˜ค ๊ฒ€์ƒ‰ R@1์—์„œ RAG ๋Œ€๋น„ 60%p ์ด์ƒ ํ–ฅ์ƒ

  • ์ง€์‹ ํšŒ์ƒ ์†๋„ 89% ๊ฐ€์†, ๋ชจ๋ธ ๋ถˆ๋ฌธ ํ”Œ๋Ÿฌ๊ทธ์•คํ”Œ๋ ˆ์ด ์ ์šฉ

๐ŸŽฏ ์™œ ์ด๊ฒƒ์ด ๊ฒŒ์ž„ ์ฒด์ธ์ €์ธ๊ฐ€? : ๋‹จ๋ฐœ์„ฑ ์ปจํ…์ŠคํŠธ ํ•™์Šต โ†’ ํ‰์ƒ ํ•™์Šตํ•˜๋Š” ๋ฉ€ํ‹ฐ๋ชจ๋‹ฌ ์—์ด์ „ํŠธ ๋ฉ”๋ชจ๋ฆฌ์˜ ์ „ํ™˜์  ๊ฐ•์กฐ

๐Ÿ”— ๋” ์ž์„ธํ•œ ๋‚ด์šฉ์ด ๊ถ๊ธˆํ•˜๋‹ค๋ฉด : ๋…ผ๋ฌธ ๋งํฌ

๋งค์ผ ํ™”์š”์ผ ์˜ค์ „ 8์‹œ,
๋ฐ”์œ ๋‹น์‹ ์„ ๊ธฐ์ˆ  ๋ฐœ์ „์— ๋’ค์ณ์ง€์ง€ ์•Š๊ฒŒ ๋งŒ๋“ค์–ด์ค„
์ตœ์‹  AI ํŠธ๋ Œ๋“œ๊ฐ€ ์š”์•ฝ ์ •๋ฆฌ๋ณธ์œผ๋กœ ์ „๋‹ฌ๋ฉ๋‹ˆ๋‹ค!