๋ชฉ๋ก
Vol.262026.03.09

๐Ÿ“‘Meta&NVIDIA: "แ„‹แ…ฎแ„…แ…ต แ„€แ…กแ‡€แ„‹แ…ต แ„‹แ…ฅแ„แ…ฆแ†ซแ„‰แ…งแ†ซแ„‹แ…ด แ„‰แ…ข แ„€แ…ตแ„Œแ…ฎแ†ซแ„‹แ…ณแ†ฏ แ„†แ…กแ†ซแ„ƒแ…ณแ†ฏแ„Œแ…ก!"

26.03. 2แ„Œแ…ฎแ„Žแ…ก | Meta, NVIDIA, NYU, Alibaba, Stanford, Princeton, Tsinghua, DeepSeek, ByteDance, Google DeepMind

2,184๋ช… ์ˆ˜์‹ ์˜คํ”ˆ์œจ 55.65%ํด๋ฆญ๋ฅ  8.20%

๐Ÿ“‘Meta&NVIDIA: "แ„‹แ…ฎแ„…แ…ต แ„€แ…กแ‡€แ„‹แ…ต แ„‹แ…ฅแ„แ…ฆแ†ซแ„‰แ…งแ†ซแ„‹แ…ด แ„‰แ…ข แ„€แ…ตแ„Œแ…ฎแ†ซแ„‹แ…ณแ†ฏ แ„†แ…กแ†ซแ„ƒแ…ณแ†ฏแ„Œแ…ก!"

26.03. 2แ„Œแ…ฎแ„Žแ…ก | Meta, NVIDIA, NYU, Alibaba, Stanford, Princeton, Tsinghua, DeepSeek, ByteDance, Google DeepMind

๊ธˆ์ฃผ ์บ์น˜ํŽ˜์ดํผ๋Š” Meta, NVIDIA, NYU, Alibaba, Stanford, Princeton, Tsinghua, DeepSeek, ByteDance, Google DeepMind์™€ ํ•จ๊ป˜ํ•ฉ๋‹ˆ๋‹ค. 3๋ถ„๋งŒ ํˆฌ์žํ•ด ์“ฑ ๋‘˜๋Ÿฌ๋ณด๊ณ , ๋น ๋ฅด๊ฒŒ ๋ฐ”๋€Œ๋Š” ๊ธฐ์ˆ ์˜ ๋ฐฉํ–ฅ์„ฑ์„ ๋†“์น˜์ง€ ๋งˆ์„ธ์š”!

๐Ÿ“ˆ ์ตœ์‹  AI ํŠธ๋ Œ๋“œ 3์ค„ ์š”์•ฝ

๐ŸŒŸ ์ด๋ฒˆ ์ฃผ AI ์—ฐ๊ตฌ์˜ ํ•ต์‹ฌ ํ‚ค์›Œ๋“œ๋Š” "์†๋„์™€ ํšจ์œจ์˜ ์žฌ์ •์˜"์ž…๋‹ˆ๋‹ค.

๐Ÿ”ฅ GPU ์—ฐ์‚ฐ ์ตœ์ ํ™”, LLM ์ถ”๋ก  ๊ฐ€์†, ๋ฉ€ํ‹ฐ๋ชจ๋‹ฌ ํ†ตํ•ฉ ํ”„๋ ˆ์ž„์›Œํฌ๊นŒ์ง€ โ€” ๋ชจ๋ธ์„ ๋” ํฌ๊ฒŒ ๋งŒ๋“œ๋Š” ๊ฒƒ์ด ์•„๋‹ˆ๋ผ ๋” ๋น ๋ฅด๊ณ  ๋” ์˜๋ฆฌํ•˜๊ฒŒ ์“ฐ๋Š” ๋ฐฉ๋ฒ•์„ ์ฐพ๋Š” ์—ฐ๊ตฌ๋“ค์ด ์Ÿ์•„์กŒ์Šต๋‹ˆ๋‹ค.

๐Ÿš€ ์—์ด์ „ํŠธ์˜ ์ฝ”๋“œ ์œ ์ง€๋ณด์ˆ˜ ๋Šฅ๋ ฅ ํ‰๊ฐ€, ๊ฐ•ํ™”ํ•™์Šต ๊ธฐ๋ฐ˜ ํˆด ์‚ฌ์šฉ, ์ •๊ทœํ™” ๋ ˆ์ด์–ด ์ œ๊ฑฐ ๋“ฑ AI ์ธํ”„๋ผ์˜ ๊ธฐ์ดˆ ์ฒด๋ ฅ์„ ๋ฐ”๊พธ๋Š” ์—ฐ๊ตฌ๋“ค์ด ๋ณธ๊ฒฉํ™”๋˜๊ณ  ์žˆ์Šต๋‹ˆ๋‹ค.

โšก "Blackwell GPU์˜ ์ž ์žฌ๋ ฅ์„ 71%๊นŒ์ง€ ๋Œ์–ด๋ƒˆ๋‹ค โ€” ์–ดํ…์…˜์˜ ์ƒˆ ๊ธฐ์ค€"

FlashAttention-4: Algorithm and Kernel Pipelining Co-Designย 

๐Ÿ›๏ธ ์†Œ์†: Meta, NVIDIA

๐Ÿท๏ธ ํ•ต์‹ฌ ํ‚ค์›Œ๋“œ: Attention Mechanism, GPU Optimization, Blackwell

๐Ÿ’ญ ์ด๋Ÿฐ ์งˆ๋ฌธ์„ ํ•ด๋ณธ ์  ์žˆ๋‚˜์š”?

  • "์ตœ์‹  GPU๋ฅผ ์‚ฌ๋„ ์‹ค์ œ ํ™œ์šฉ๋ฅ ์ด 50%๋„ ์•ˆ ๋œ๋‹ค๋ฉด ์–ด๋–ป๊ฒŒ ํ•ด์•ผ ํ• ๊นŒ์š”?"

  • "์–ดํ…์…˜ ์—ฐ์‚ฐ ์†๋„๊ฐ€ LLM ์ „์ฒด ์„ฑ๋Šฅ์˜ ๋ณ‘๋ชฉ์ด ๋˜๋Š” ๊ฒŒ ๋งž์„๊นŒ์š”?"

  • "์•Œ๊ณ ๋ฆฌ์ฆ˜๊ณผ ํ•˜๋“œ์›จ์–ด๋ฅผ ๋™์‹œ์— ์„ค๊ณ„ํ•˜๋ฉด ์–ผ๋งˆ๋‚˜ ๋‹ฌ๋ผ์งˆ๊นŒ์š”?"

๋ ˆ์ด์‹ฑ์นด์˜ ์—”์ง„๊ณผ ์ฐจ์ฒด๋ฅผ ํ•จ๊ป˜ ์„ค๊ณ„ํ•˜๋“ฏ, FlashAttention-4๋Š” NVIDIA Blackwell GPU์˜ ๋น„๋Œ€์นญ ํ•˜๋“œ์›จ์–ด ๊ตฌ์กฐ์— ๋งž์ถฐ ์•Œ๊ณ ๋ฆฌ์ฆ˜๊ณผ ์ปค๋„์„ ๊ณต๋™ ์„ค๊ณ„ํ–ˆ์Šต๋‹ˆ๋‹ค. ์ด๋ก  ์ตœ๋Œ€์น˜์˜ 71%์ธ 1613 TFLOPs/s๋ฅผ ๋‹ฌ์„ฑํ•˜๋ฉฐ cuDNN ๋Œ€๋น„ ์ตœ๋Œ€ 1.3๋ฐฐ ์†๋„ ํ–ฅ์ƒ์„ ์ด๋Œ์–ด๋ƒˆ์Šต๋‹ˆ๋‹ค. ํŠนํžˆ ์ฃผ๋ชฉํ•  ์ :

  • ์ด๋ก  ์ตœ๋Œ€ ์„ฑ๋Šฅ์˜ 71% ๋‹ฌ์„ฑ (1613 TFLOPs/s)

  • cuDNN ๋Œ€๋น„ forward pass ์ตœ๋Œ€ 1.3x ์†๋„ ํ–ฅ์ƒ

  • ํšจ์œจ์ ์ธ ๊ฒฐ์ •๋ก ์  backward pass ๊ตฌํ˜„

๐ŸŽฏย ์™œ ์ด๊ฒƒ์ด ๊ฒŒ์ž„ ์ฒด์ธ์ €์ธ๊ฐ€? : ๋ฒ”์šฉ ์ตœ์ ํ™” โ†’ ํ•˜๋“œ์›จ์–ด ๊ตฌ์กฐ์— ๊ณต๋™ ์„ค๊ณ„๋œ ์–ดํ…์…˜์œผ๋กœ GPU ํ™œ์šฉ์˜ ์ƒˆ ๊ธฐ์ค€ ์ˆ˜๋ฆฝ

๐ŸŒ "์ฒ˜์Œ๋ถ€ํ„ฐ ํ•จ๊ป˜ ํ•™์Šตํ•œ ๋ฉ€ํ‹ฐ๋ชจ๋‹ฌ ๋ชจ๋ธ์ด ๊ฒฐ๊ตญ ์ด๊ธด๋‹ค"

Scaling Laws for Native Multimodal Modelsย 

๐Ÿ›๏ธ ์†Œ์†: Apple, Sorbonne University

๐Ÿท๏ธ ํ•ต์‹ฌ ํ‚ค์›Œ๋“œ: Multimodal Scaling, Early Fusion, Mixture of Experts

๐Ÿ’ญ ์ด๋Ÿฐ ์งˆ๋ฌธ์„ ํ•ด๋ณธ ์  ์žˆ๋‚˜์š”?

  • "์ด๋ฏธ์ง€์™€ ํ…์ŠคํŠธ๋ฅผ ๋”ฐ๋กœ ํ•™์Šตํ•œ ๋ชจ๋ธ์„ ํ•ฉ์น˜๋Š” ๊ฒŒ ๋‚˜์„๊นŒ์š”, ์ฒ˜์Œ๋ถ€ํ„ฐ ๊ฐ™์ด ํ•™์Šตํ•˜๋Š” ๊ฒŒ ๋‚˜์„๊นŒ์š”?"

  • "๋ฉ€ํ‹ฐ๋ชจ๋‹ฌ ๋ชจ๋ธ์—๋„ ์–ธ์–ด ๋ชจ๋ธ๊ณผ ๊ฐ™์€ ์Šค์ผ€์ผ๋ง ๋ฒ•์น™์ด ์ ์šฉ๋ ๊นŒ์š”?"

  • "MoE ๊ตฌ์กฐ๊ฐ€ ๋ฉ€ํ‹ฐ๋ชจ๋‹ฌ ํ™˜๊ฒฝ์—์„œ๋„ ํšจ๊ณผ์ ์ผ๊นŒ์š”?"

์•…๋‹จ์›๋“ค์ด ์ฒ˜์Œ๋ถ€ํ„ฐ ํ•จ๊ป˜ ์—ฐ์Šตํ• ์ˆ˜๋ก ํ˜ธํก์ด ๋งž๋“ฏ, Apple ์—ฐ๊ตฌ์ง„์€ Early Fusion ์•„ํ‚คํ…์ฒ˜๊ฐ€ Late Fusion ๋ฐฉ์‹๊ณผ ๋™๋“ฑํ•œ ์„ฑ๋Šฅ์„ ํ›จ์”ฌ ๋‚ฎ์€ ํ•™์Šต ๋น„์šฉ์œผ๋กœ ๋‹ฌ์„ฑํ•จ์„ ์ฆ๋ช…ํ–ˆ์Šต๋‹ˆ๋‹ค. ์—ฌ๊ธฐ์— MoE๋ฅผ ๊ฒฐํ•ฉํ•˜๋ฉด ๋ชจ๋‹ฌ๋ฆฌํ‹ฐ๋ณ„ ์•”๋ฌต์  ์ „๋ฌธํ™”๊นŒ์ง€ ์ฐฝ๋ฐœํ•ฉ๋‹ˆ๋‹ค. ํŠนํžˆ ์ฃผ๋ชฉํ•  ์ :

  • Early Fusion์ด Late Fusion ๋Œ€๋น„ ํ›ˆ๋ จ ํšจ์œจ ๋ฐ ๋ฐฐํฌ ๋น„์šฉ ์šฐ์œ„

  • MoE ํ†ตํ•ฉ์œผ๋กœ ์„ฑ๋Šฅ ์ถ”๊ฐ€ ํ–ฅ์ƒ ๋ฐ ๋ชจ๋‹ฌ๋ฆฌํ‹ฐ ์ „๋ฌธํ™” ์ฐฝ๋ฐœ

  • ๋ฉ€ํ‹ฐ๋ชจ๋‹ฌ ๋ชจ๋ธ์— ๋Œ€ํ•œ ์ฒด๊ณ„์  ์Šค์ผ€์ผ๋ง ๋ฒ•์น™ ํ™•๋ฆฝ

๐ŸŽฏย ์™œ ์ด๊ฒƒ์ด ๊ฒŒ์ž„ ์ฒด์ธ์ €์ธ๊ฐ€? : ์‚ฌํ›„ ๊ฒฐํ•ฉ ๋ฐฉ์‹ โ†’ ์ฒ˜์Œ๋ถ€ํ„ฐ ํ†ตํ•ฉ ์„ค๊ณ„ํ•˜๋Š” Native Multimodal์ด ์ƒˆ ํ‘œ์ค€์œผ๋กœ

๐Ÿ”ญ "ํ•˜๋‚˜์˜ Transformer๋กœ ์ด๋ฏธ์ง€ ์ดํ•ดยท์ƒ์„ฑยท์„ธ๊ณ„ ๋ชจ๋ธ๋ง์„ ๋™์‹œ์—"

Beyond Language Modeling: Transfusionย 

๐Ÿ›๏ธ ์†Œ์†: Meta FAIR, NYU

๐Ÿท๏ธ ํ•ต์‹ฌ ํ‚ค์›Œ๋“œ: Unified Autoregressive Transformer, Multimodal Pretraining, RAE

๐Ÿ’ญ ์ด๋Ÿฐ ์งˆ๋ฌธ์„ ํ•ด๋ณธ ์  ์žˆ๋‚˜์š”?

  • "์–ธ์–ด ๋ชจ๋ธ๊ณผ ์ด๋ฏธ์ง€ ์ƒ์„ฑ ๏ฟฝ๏ฟฝ๋ธ์„ ํ•˜๋‚˜์˜ ์•„ํ‚คํ…์ฒ˜๋กœ ํ†ตํ•ฉํ•  ์ˆ˜ ์žˆ์„๊นŒ์š”?"

  • "์ฒ˜์Œ๋ถ€ํ„ฐ ๋ฉ€ํ‹ฐ๋ชจ๋‹ฌ๋กœ ํ•™์Šตํ•˜๋ฉด ์„ธ๊ณ„ ๋ชจ๋ธ๋ง ๋Šฅ๋ ฅ์ด ์ž์—ฐ์Šค๋Ÿฝ๊ฒŒ ์ƒ๊ฒจ๋‚ ๊นŒ์š”?"

  • "Representation Autoencoder๊ฐ€ ์™œ ํ•ต์‹ฌ์ผ๊นŒ์š”?"

์Šค์œ„์Šค ๊ตฐ์šฉ ์นผ์ฒ˜๋Ÿผ ํ•˜๋‚˜๋กœ ๋ชจ๋“  ๊ฒƒ์„ ํ•ด๊ฒฐํ•˜๋Š” ๋ชจ๋ธ, Transfusion์ด ๋“ฑ์žฅํ–ˆ์Šต๋‹ˆ๋‹ค. RAE(Representation Autoencoder)๋ฅผ ํ†ตํ•ด ์‹œ๊ฐ์  ์ดํ•ด์™€ ์ƒ์„ฑ์„ ํ†ตํ•ฉํ•˜๊ณ , ์ผ๋ฐ˜ ๋ฐ์ดํ„ฐ๋กœ๋ถ€ํ„ฐ ์„ธ๊ณ„ ๋ชจ๋ธ๋ง ๋Šฅ๋ ฅ์ด ์ž์—ฐ์Šค๋Ÿฝ๊ฒŒ ์ฐฝ๋ฐœํ•˜๋ฉฐ, MoE ๊ตฌ์กฐ์™€๋„ ํšจ์œจ์ ์œผ๋กœ ๊ฒฐํ•ฉ๋ฉ๋‹ˆ๋‹ค. ํŠนํžˆ ์ฃผ๋ชฉํ•  ์ :

  • RAE๋กœ ์‹œ๊ฐ์  ์ดํ•ดยท์ƒ์„ฑ ํ†ตํ•ฉ ํ”„๋ ˆ์ž„์›Œํฌ ๊ตฌํ˜„

  • ์ผ๋ฐ˜ ๋ฐ์ดํ„ฐ์—์„œ ์„ธ๊ณ„ ๋ชจ๋ธ๋ง ๋Šฅ๋ ฅ ์ž์—ฐ ์ฐฝ๋ฐœ

  • MoE์™€์˜ ๊ฒฐํ•ฉ์œผ๋กœ ํ™•์žฅ์„ฑ ํ™•๋ณด

๐ŸŽฏย ์™œ ์ด๊ฒƒ์ด ๊ฒŒ์ž„ ์ฒด์ธ์ €์ธ๊ฐ€? : ์–ธ์–ด / ๋น„์ „ ๋ชจ๋ธ ๋ถ„๋ฆฌ ๊ตฌ์กฐ โ†’ ๋‹จ์ผ ํ†ตํ•ฉ Transformer๋กœ ๋ชจ๋“  ๋ชจ๋‹ฌ๋ฆฌํ‹ฐ๋ฅผ ์ฒ˜๋ฆฌํ•˜๋Š” ์‹œ๋Œ€๋กœ

๐Ÿงช "๋ฒค์น˜๋งˆํฌ 1๋“ฑ AI, ์ฝ”๋“œ ์œ ์ง€๋ณด์ˆ˜๋Š” ์™œ ๋ชปํ• ๊นŒ?"

SWE-CI: Evaluating Agent Capabilities via Continuous Integrationย 

๐Ÿ›๏ธ ์†Œ์†: Alibaba Group, Sun Yat-Sen University

๐Ÿท๏ธ ํ•ต์‹ฌ ํ‚ค์›Œ๋“œ: Code Maintenance, CI Benchmark, Agent Evaluation

๐Ÿ’ญ ์ด๋Ÿฐ ์งˆ๋ฌธ์„ ํ•ด๋ณธ ์  ์žˆ๋‚˜์š”?

"AI๊ฐ€ ์ฝ”๋“œ๋ฅผ ์ฒ˜์Œ ์งœ๋Š” ๊ฒƒ๊ณผ ์ง€์†์ ์œผ๋กœ ์œ ์ง€๋ณด์ˆ˜ํ•˜๋Š” ๊ฒƒ์€ ์–ผ๋งˆ๋‚˜ ๋‹ค๋ฅผ๊นŒ์š”?"

"ํ˜„์žฌ ์ตœ๊ณ  ์ˆ˜์ค€์˜ LLM์ด ์‹ค์ œ ์†Œํ”„ํŠธ์›จ์–ด ๊ฐœ๋ฐœ ํ™˜๊ฒฝ์—์„œ ์–ผ๋งˆ๋‚˜ ์‹ ๋ขฐํ•  ์ˆ˜ ์žˆ์„๊นŒ์š”?"

"ํ•œ ๋ฒˆ ๋งžํžˆ๋Š” ๊ฒƒ๊ณผ ๋ฐ˜๋ณตํ•ด์„œ ์˜ค๋ฅ˜ ์—†์ด ์œ ์ง€ํ•˜๋Š” ๊ฒƒ, ์–ด๋А ์ชฝ์ด ๋” ์–ด๋ ค์šธ๊นŒ์š”?"

์‹œํ—˜ ํ•œ ๋ฒˆ ์ž˜ ๋ณด๋Š” ๊ฒƒ๊ณผ ๋งค์ผ ๊พธ์ค€ํžˆ ์„ฑ์ ์„ ์œ ์ง€ํ•˜๋Š” ๊ฒƒ์€ ๋‹ค๋ฆ…๋‹ˆ๋‹ค. SWE-CI๋Š” AI ์—์ด์ „ํŠธ๊ฐ€ CI ํ™˜๊ฒฝ์—์„œ ์žฅ๊ธฐ์ ์œผ๋กœ ์ฝ”๋“œ๋ฒ ์ด์Šค๋ฅผ ์œ ์ง€๋ณด์ˆ˜ํ•  ์ˆ˜ ์žˆ๋Š”์ง€๋ฅผ ํ‰๊ฐ€ํ•˜๋Š” ์ƒˆ ๋ฒค์น˜๋งˆํฌ๋กœ, 18๊ฐœ ๋ชจ๋ธ ์‹คํ—˜์—์„œ ๋Œ€๋ถ€๋ถ„์ด zero-regression rate 0.25 ๋ฏธ๋งŒ์ด๋ผ๋Š” ์ถฉ๊ฒฉ์ ์ธ ๊ฒฐ๊ณผ๋ฅผ ๋ณด์˜€์Šต๋‹ˆ๋‹ค. ํŠนํžˆ ์ฃผ๋ชฉํ•  ์ :

  • ์ผํšŒ์„ฑ ๊ธฐ๋Šฅ ์ •ํ™•๋„๋ฅผ ๋„˜์–ด ์žฅ๊ธฐ ์ฝ”๋“œ ์œ ์ง€๋ณด์ˆ˜ ๋Šฅ๋ ฅ ์ธก์ •

  • 18๊ฐœ ๋ชจ๋ธ ํ…Œ์ŠคํŠธ, Claude Opus๊ฐ€ ์„ ๋‘ โ€” ํ•˜์ง€๋งŒ ์ „๋ฐ˜์ ์œผ๋กœ ๋‚ฎ์€ ์ˆ˜์ค€

  • ๋ฐ˜๋ณต์  ๋ณ€๊ฒฝ ์ค‘ ๊ฒฐํ•จ ๋ฐฉ์ง€ ๋Šฅ๋ ฅ์˜ ํ˜„์ฃผ์†Œ๋ฅผ ์‹ค์ฆ์ ์œผ๋กœ ํญ๋กœ

๐ŸŽฏย ์™œ ์ด๊ฒƒ์ด ๊ฒŒ์ž„ ์ฒด์ธ์ €์ธ๊ฐ€? : ์ผํšŒ์„ฑ ์ฝ”๋“œ ์ƒ์„ฑ ํ‰๊ฐ€ โ†’ ์ง€์†์  ํ†ตํ•ฉ ํ™˜๊ฒฝ์˜ ์œ ์ง€๋ณด์ˆ˜ ๋Šฅ๋ ฅ ํ‰๊ฐ€๋ผ๋Š” ์ƒˆ ๊ธฐ์ค€ ์ œ์‹œ

๐Ÿš€ "์ดˆ์•ˆ ์žก๊ธฐ์™€ ๊ฒ€์ฆ์„ ๋™์‹œ์— โ€” LLM ์ถ”๋ก  ์†๋„ 5๋ฐฐ ๋ŒํŒŒ"

Speculative Speculative Decoding (SSD)ย 

๐Ÿ›๏ธ ์†Œ์†: Stanford University, Princeton University

๐Ÿท๏ธ ํ•ต์‹ฌ ํ‚ค์›Œ๋“œ: Speculative Decoding, Inference Acceleration, LLM Throughput

๐Ÿ’ญ ์ด๋Ÿฐ ์งˆ๋ฌธ์„ ํ•ด๋ณธ ์  ์žˆ๋‚˜์š”?

  • "LLM์˜ ์ถ”๋ก  ์†๋„๋ฅผ ๋†’์ด๋Š” ๋ฐ ๋ณ‘๋ ฌํ™”๊ฐ€ ์–ผ๋งˆ๋‚˜ ํšจ๊ณผ์ ์ผ๊นŒ์š”?"

  • "๋“œ๋ž˜ํ”„ํŒ…๊ณผ ๊ฒ€์ฆ์„ ์ˆœ์ฐจ ์ฒ˜๋ฆฌํ•˜์ง€ ์•Š์•„๋„ ๋ ๊นŒ์š”?"

  • "ํ‘œ์ค€ ์ž๊ธฐํšŒ๊ท€ ๋””์ฝ”๋”ฉ์ด ์™œ ๋А๋ฆด ์ˆ˜๋ฐ–์— ์—†๋Š”์ง€ ์•„์‹œ๋‚˜์š”?"

๊ณต์žฅ์—์„œ ๊ฒ€์‚ฌ์™€ ์ƒ์‚ฐ์„ ๋™์‹œ์— ๋Œ๋ฆฌ๋“ฏ, SSD๋Š” ๋“œ๋ž˜ํ”„ํŒ…๊ณผ ๊ฒ€์ฆ ๋‹จ๊ณ„๋ฅผ ๋ณ‘๋ ฌํ™”ํ•ด ๊ธฐ์กด Speculative Decoding ๋Œ€๋น„ ์ตœ๋Œ€ 2๋ฐฐ, ํ‘œ์ค€ ์ž๊ธฐํšŒ๊ท€ ๋””์ฝ”๋”ฉ ๋Œ€๋น„ ์ตœ๋Œ€ 5๋ฐฐ ์†๋„ ํ–ฅ์ƒ์„ ๋‹ฌ์„ฑํ–ˆ์Šต๋‹ˆ๋‹ค. ํŠนํžˆ ์ฃผ๋ชฉํ•  ์ :

  • ๋“œ๋ž˜ํ”„ํŒ…ยท๊ฒ€์ฆ ๋‹จ๊ณ„ ์™„์ „ ๋ณ‘๋ ฌํ™”๋กœ ์ง€์—ฐ ์‹œ๊ฐ„ ํš๊ธฐ์  ๋‹จ์ถ•

  • ๊ธฐ์กด Speculative Decoding ๋Œ€๋น„ ์ตœ๋Œ€ 2x ์ถ”๊ฐ€ ๊ฐ€์†

  • ํ‘œ์ค€ ์ž๊ธฐํšŒ๊ท€ ๋Œ€๋น„ ์ตœ๋Œ€ 5x ์ฒ˜๋ฆฌ๋Ÿ‰ ํ–ฅ์ƒ

๐ŸŽฏย ์™œ ์ด๊ฒƒ์ด ๊ฒŒ์ž„ ์ฒด์ธ์ €์ธ๊ฐ€? : ์ˆœ์ฐจ์  ์ถ”๋ก  ๊ตฌ์กฐ์˜ ํ•œ๊ณ„ โ†’ ๋ณ‘๋ ฌ ํŒŒ์ดํ”„๋ผ์ธ์œผ๋กœ LLM ์ถ”๋ก  ๋น„์šฉ ๊ตฌ์กฐ๋ฅผ ๋ฐ”๊พธ๋Š” ์ „ํ™˜์ 

๐Ÿ—บ๏ธ "์ˆ˜๋ฐฑ ์žฅ์˜ ์ด๋ฏธ์ง€๋ฅผ ์„ ํ˜• ์‹œ๊ฐ„์œผ๋กœ โ€” ์‹ค์‹œ๊ฐ„ 3D ์žฌ๊ตฌ์„ฑ์˜ ์ƒˆ ์ง€ํ‰"

ZipMap: Linear-Time Stateful 3D Reconstructionย 

๐Ÿ›๏ธ ์†Œ์†: Google DeepMind, Cornell University

๐Ÿท๏ธ ํ•ต์‹ฌ ํ‚ค์›Œ๋“œ: 3D Reconstruction, Feed-forward Architecture, Novel View Synthesis

๐Ÿ’ญ ์ด๋Ÿฐ ์งˆ๋ฌธ์„ ํ•ด๋ณธ ์  ์žˆ๋‚˜์š”?

  • "์ด๋ฏธ์ง€๊ฐ€ ๋งŽ์•„์งˆ์ˆ˜๋ก ๊ธฐํ•˜๊ธ‰์ˆ˜์ ์œผ๋กœ ๋А๋ ค์ง€๋Š” 3D ์žฌ๊ตฌ์„ฑ, ํ•ด๊ฒฐ์ฑ…์ด ์žˆ์„๊นŒ์š”?"

  • "์‹ค์‹œ๊ฐ„์œผ๋กœ ์ƒˆ๋กœ์šด ์‹œ์ ์„ ํ•ฉ์„ฑํ•˜๋ฉด์„œ ์ •ํ™•๋„๋„ ์œ ์ง€ํ•  ์ˆ˜ ์žˆ์„๊นŒ์š”?"

  • "์„ ํ˜• ์‹œ๊ฐ„ ์ฒ˜๋ฆฌ๊ฐ€ ์‹ค์ œ ์žฌ๊ตฌ์„ฑ ํ’ˆ์งˆ์— ์˜ํ–ฅ์„ ๋ฏธ์น˜์ง€ ์•Š๋Š” ๊ฒŒ ๊ฐ€๋Šฅํ• ๊นŒ์š”?"

GPS๊ฐ€ ์‹ค์‹œ๊ฐ„์œผ๋กœ ์ง€๋„๋ฅผ ์—…๋ฐ์ดํŠธํ•˜๋“ฏ, ZipMap์€ ์ด๋ฏธ์ง€ ์‹œํ€€์Šค๋ฅผ ๋ทฐ ์ˆ˜์— ๋น„๋ก€ํ•œ ์„ ํ˜• ์‹œ๊ฐ„์œผ๋กœ ์ฒ˜๋ฆฌํ•˜๋ฉด์„œ๋„ ๊ธฐ์กด ์ด์ฐจ ์‹œ๊ฐ„ ๋ฐฉ๋ฒ• ์ˆ˜์ค€์˜ ์ •ํ™•๋„๋ฅผ ์œ ์ง€ํ•ฉ๋‹ˆ๋‹ค. ์‹ค์‹œ๊ฐ„ novel view synthesis๊นŒ์ง€ ์ง€์›ํ•ฉ๋‹ˆ๋‹ค. ํŠนํžˆ ์ฃผ๋ชฉํ•  ์ :

  • ์ด๋ฏธ์ง€ ์ˆ˜์— ๋Œ€ํ•ด ์„ ํ˜• ๋ณต์žก๋„๋กœ 3D ์žฌ๊ตฌ์„ฑ ์ฒ˜๋ฆฌ

  • ๊ธฐ์กด SOTA ์ด์ฐจ ์‹œ๊ฐ„ ๋ฐฉ๋ฒ•๊ณผ ๋™๋“ฑํ•˜๊ฑฐ๋‚˜ ์šฐ์ˆ˜ํ•œ ์ •ํ™•๋„

  • ์•”๋ฌต์  ์”ฌ ํ‘œํ˜„์˜ ์‹ค์‹œ๊ฐ„ ์ฟผ๋ฆฌ ์ง€์›

๐ŸŽฏย ์™œ ์ด๊ฒƒ์ด ๊ฒŒ์ž„ ์ฒด์ธ์ €์ธ๊ฐ€? : ์ด๋ฏธ์ง€ ์ฆ๊ฐ€ = ์ฒ˜๋ฆฌ ์‹œ๊ฐ„ ํญ์ฆ ๊ตฌ์กฐ โ†’ ์„ ํ˜• ํ™•์žฅ์œผ๋กœ ์‹ค์‹œ๊ฐ„ 3D ์žฌ๊ตฌ์„ฑ ๊ฐ€๋Šฅํ•œ ์‹œ๋Œ€๋กœ

๐Ÿ† "์ถ”๋ก  ์‹œ๊ฐ„์„ ๋Š˜๋ฆฌ๋ฉด ์ž‘์€ ๋ชจ๋ธ๋„ ํฐ ๋ชจ๋ธ์„ ์ด๊ธด๋‹ค"

Inference-Time Scaling for Generalist Reward Modeling (DeepSeek-GRM)ย 

๐Ÿ›๏ธ ์†Œ์†: DeepSeek, Tsinghua University

๐Ÿท๏ธ ํ•ต์‹ฌ ํ‚ค์›Œ๋“œ: Reward Modeling, SPCT, Inference-Time Scaling

๐Ÿ’ญ ์ด๋Ÿฐ ์งˆ๋ฌธ์„ ํ•ด๋ณธ ์  ์žˆ๋‚˜์š”?

  • "๋ณด์ƒ ๋ชจ๋ธ๋„ ์ถ”๋ก  ์‹œ๊ฐ„์„ ๋” ์“ฐ๋ฉด ์„ฑ๋Šฅ์ด ์ข‹์•„์งˆ๊นŒ์š”?"

  • "LLM ์ •๋ ฌ์—์„œ ๋ฒ”์šฉ ๋ฆฌ์›Œ๋“œ ๋ชจ๋ธ๋ง์ด ์™œ ์ค‘์š”ํ• ๊นŒ์š”?"

  • "๋” ํฐ ๋ชจ๋ธ ์—†์ด๋„ ์„ฑ๋Šฅ์„ ๋†’์ด๋Š” ๋ฐฉ๋ฒ•์ด ์žˆ์„๊นŒ์š”?"

์˜ฌ๋ฆผํ”ฝ ์‹ฌํŒ์ด ๋” ์˜ค๋ž˜ ๊ณ ๋ฏผํ• ์ˆ˜๋ก ๋” ๊ณต์ •ํ•œ ํŒ์ •์„ ๋‚ด๋ฆฌ๋“ฏ, DeepSeek-GRM์€ SPCT(Self-Principled Critique Tuning)๋กœ ์ถ”๋ก  ์‹œ ์ปดํ“จํŒ…์„ ๋Š˜๋ ค ์†Œํ˜• ๋ชจ๋ธ์ด ํ›จ์”ฌ ํฐ ๋ชจ๋ธ์˜ ์„ฑ๋Šฅ์„ ๋›ฐ์–ด๋„˜๋Š” ๊ฒƒ์„ ๊ฐ€๋Šฅํ•˜๊ฒŒ ํ•ฉ๋‹ˆ๋‹ค. ํŠนํžˆ ์ฃผ๋ชฉํ•  ์ :

  • ์ถ”๋ก  ์‹œ๊ฐ„ ํ™•์žฅ์œผ๋กœ ์†Œํ˜• ๋ชจ๋ธ์ด ๋Œ€ํ˜• ๋ชจ๋ธ ์„ฑ๋Šฅ ์ดˆ๊ณผ

  • ๋ฒ”์šฉ ๋ฆฌ์›Œ๋“œ ๋ฒค์น˜๋งˆํฌ์—์„œ SOTA ๋‹ฌ์„ฑ

  • LLM ์ •๋ ฌ ํŒŒ์ดํ”„๋ผ์ธ์— ์ง์ ‘ ํ™œ์šฉ ๊ฐ€๋Šฅ

๐ŸŽฏย ์™œ ์ด๊ฒƒ์ด ๊ฒŒ์ž„ ์ฒด์ธ์ €์ธ๊ฐ€? : ๋” ํฐ ๋ชจ๋ธ = ๋” ์ข‹์€ ๋ฆฌ์›Œ๋“œ ํŒ๋‹จ ๊ณต์‹ โ†’ ์ถ”๋ก  ์ปดํ“จํŒ… ํ™•์žฅ์œผ๋กœ ์†Œํ˜• ๋ชจ๋ธ์ด ์—ญ์ „ํ•˜๋Š” ์‹œ๋Œ€๋กœ

๐Ÿ› ๏ธ "ํ•ฉ์„ฑ ๋ฐ์ดํ„ฐ + ๋‹ค๋‹จ๊ณ„ RL๋กœ ๋ณต์žกํ•œ ํˆด ์‚ฌ์šฉ ๋Šฅ๋ ฅ์„ ํ‚ค์šด๋‹ค"

SWiRL: Synthetic Data Generation & Multi-Step RL for Reasoning & Tool Useย 

๐Ÿ›๏ธ ์†Œ์†: Google DeepMind, Stanford University

๐Ÿท๏ธ ํ•ต์‹ฌ ํ‚ค์›Œ๋“œ: Multi-step RL, Tool Use, Synthetic Data

๐Ÿ’ญ ์ด๋Ÿฐ ์งˆ๋ฌธ์„ ํ•ด๋ณธ ์  ์žˆ๋‚˜์š”?

  • "LLM์ด ํˆด์„ '์•„๋Š”' ๊ฒƒ๊ณผ '์ž˜ ์“ฐ๋Š”' ๊ฒƒ์€ ์–ผ๋งˆ๋‚˜ ๋‹ค๋ฅผ๊นŒ์š”?"

  • "ํ•ฉ์„ฑ ๋ฐ์ดํ„ฐ๋กœ ์‹ค์ œ ๋ณต์žกํ•œ ์ถ”๋ก  ๋Šฅ๋ ฅ๊นŒ์ง€ ๊ธฐ๋ฅผ ์ˆ˜ ์žˆ์„๊นŒ์š”?"

  • "๋‹จ๊ณ„๋ณ„ ์ตœ์ ํ™”๊ฐ€ ์ „์ฒด ๊ฒฐ๊ณผ ์ตœ์ ํ™”๋ณด๋‹ค ์™œ ํšจ๊ณผ์ ์ผ๊นŒ์š”?"

์š”๋ฆฌ์‚ฌ๊ฐ€ ๊ฐ ๋‹จ๊ณ„๋งˆ๋‹ค ๋ง›์„ ๋ณด๋ฉฐ ์กฐ๋ฆฌํ•˜๋“ฏ, SWiRL์€ ํ”„๋กœ์„ธ์Šค ๊ธฐ๋ฐ˜ ํ•„ํ„ฐ๋ง์œผ๋กœ ํ•ฉ์„ฑ ๋ฐ์ดํ„ฐ๋ฅผ ๋‹จ๊ณ„๋ณ„๋กœ ์ตœ์ ํ™”ํ•ด ๋ณต์žกํ•œ ํƒœ์Šคํฌ์—์„œ ํฐ ์„ฑ๋Šฅ ํ–ฅ์ƒ๊ณผ ๊ฐ•๋ ฅํ•œ ํฌ๋กœ์Šค ๋„๋ฉ”์ธ ์ผ๋ฐ˜ํ™”๋ฅผ ๋‹ฌ์„ฑํ–ˆ์Šต๋‹ˆ๋‹ค. ํŠนํžˆ ์ฃผ๋ชฉํ•  ์ :

  • ํ•ฉ์„ฑ ๋ฐ์ดํ„ฐ์— ํ”„๋กœ์„ธ์Šค ๊ธฐ๋ฐ˜ ํ•„ํ„ฐ๋ง ์ ์šฉ์œผ๋กœ ํ’ˆ์งˆ ํ–ฅ์ƒ

  • ๋ณต์žกํ•œ ์ถ”๋ก  ๋ฐ ํˆด ์‚ฌ์šฉ ํƒœ์Šคํฌ์—์„œ ์‹ค์งˆ์  ์„ฑ๋Šฅ ํ–ฅ์ƒ

  • ๋‹ค์–‘ํ•œ ๋„๋ฉ”์ธ์œผ๋กœ์˜ ๊ฐ•๋ ฅํ•œ ์ผ๋ฐ˜ํ™” ๋Šฅ๋ ฅ ์ž…์ฆ

๐ŸŽฏย ์™œ ์ด๊ฒƒ์ด ๊ฒŒ์ž„ ์ฒด์ธ์ €์ธ๊ฐ€? : ๋‹จ์ˆœ ๋ชจ๋ฐฉ ํ•™์Šต โ†’ ๋‹จ๊ณ„๋ณ„ ๊ฐ•ํ™” ์ตœ์ ํ™”๋กœ ์ง„์งœ ํˆด ์‚ฌ์šฉ ๋Šฅ๋ ฅ์„ ๊ธฐ๋ฅด๋Š” ๋ฐฉ๋ฒ•๋ก ์œผ๋กœ ์ „ํ™˜

๐Ÿงฎ "์ฝ”๋“œ ์ธํ„ฐํ”„๋ฆฌํ„ฐ๋ฅผ ์ „๋žต์ ์œผ๋กœ ์“ฐ๋Š” AI โ€” AIME 2024์—์„œ 67% ๋ŒํŒŒ"

ReTool: Reinforcement Learning for Strategic Tool Use in LLMsย 

๐Ÿ›๏ธ ์†Œ์†: ByteDance Seed

๐Ÿท๏ธ ํ•ต์‹ฌ ํ‚ค์›Œ๋“œ: RL, Code Interpreter, Strategic Tool Use

๐Ÿ’ญ ์ด๋Ÿฐ ์งˆ๋ฌธ์„ ํ•ด๋ณธ ์  ์žˆ๋‚˜์š”?

  • "LLM์ด ๊ณ„์‚ฐ๊ธฐ๋ฅผ ์–ธ์ œ ๊บผ๋‚ด์•ผ ํ•˜๋Š”์ง€ ์Šค์Šค๋กœ ํŒ๋‹จํ•  ์ˆ˜ ์žˆ์„๊นŒ์š”?"

  • "ํ…์ŠคํŠธ ๊ธฐ๋ฐ˜ ์ถ”๋ก ๊ณผ ์ฝ”๋“œ ์‹คํ–‰์„ ์ „๋žต์ ์œผ๋กœ ์„ž์œผ๋ฉด ์–ผ๋งˆ๋‚˜ ๊ฐ•๋ ฅํ•ด์งˆ๊นŒ์š”?"

  • "์ˆ˜ํ•™ ๋ฌธ์ œ์—์„œ ์ž๊ธฐ๊ต์ •์ด ์ž์—ฐ์Šค๋Ÿฝ๊ฒŒ ์ฐฝ๋ฐœํ•  ์ˆ˜ ์žˆ์„๊นŒ์š”?"

์ˆ™๋ จ๋œ ์—”์ง€๋‹ˆ์–ด๊ฐ€ ์†๊ณ„์‚ฐ๊ณผ CAD ํˆด์„ ์ƒํ™ฉ์— ๋งž๊ฒŒ ๋ฒˆ๊ฐˆ์•„ ์“ฐ๋“ฏ, ReTool์€ RL๋กœ ์ฝ”๋“œ ์ธํ„ฐํ”„๋ฆฌํ„ฐ ์‚ฌ์šฉ ์ „๋žต ์ž์ฒด๋ฅผ ํ•™์Šต์‹œ์ผœ AIME 2024์—์„œ 67.0%๋ฅผ ๋‹ฌ์„ฑํ•˜๋ฉฐ ํ…์ŠคํŠธ ๊ธฐ๋ฐ˜ ์ถ”๋ก  ๋ชจ๋ธ์„ ํฌ๊ฒŒ ์•ž์งˆ๋ €์Šต๋‹ˆ๋‹ค. ์ฝ”๋“œ ์ž๊ธฐ์ˆ˜์ • ๋Šฅ๋ ฅ๋„ ์ฐฝ๋ฐœํ–ˆ์Šต๋‹ˆ๋‹ค. ํŠนํžˆ ์ฃผ๋ชฉํ•  ์ :

  • AIME 2024 ๊ธฐ์ค€ 67.0% ์ •ํ™•๋„๋กœ ํ…์ŠคํŠธ ์ถ”๋ก  ๋Œ€๋น„ ์••๋„์  ํ–ฅ์ƒ

  • ์ฝ”๋“œ ์ƒ์„ฑ์—์„œ ์ž๊ธฐ์ˆ˜์ •(self-correction) ๋Šฅ๋ ฅ ์ฐฝ๋ฐœ

  • ๋ณต์žกํ•œ ์ˆ˜ํ•™ยท๋…ผ๋ฆฌ ๋ฌธ์ œ์— ์ฝ”๋“œ ํˆด์„ ์ „๋žต์ ์œผ๋กœ ํ™œ์šฉ

๐ŸŽฏย ์™œ ์ด๊ฒƒ์ด ๊ฒŒ์ž„ ์ฒด์ธ์ €์ธ๊ฐ€? : ํˆด์„ ์ฃผ๋Š” ๊ฒƒ โ†’ ํˆด์„ ์–ธ์ œยท์–ด๋–ป๊ฒŒ ์“ธ์ง€ ์Šค์Šค๋กœ ๊ฒฐ์ •ํ•˜๋Š” ์ „๋žต์  ์—์ด์ „ํŠธ๋กœ ์ง„ํ™”

๐Ÿงฌ "Transformer์—์„œ ์ •๊ทœํ™” ๋ ˆ์ด์–ด๋ฅผ ์—†์•ด๋”๋‹ˆ ์˜คํžˆ๋ ค ๋” ์ž˜ ๋๋‹ค"

Transformers without Normalization (DyT)ย 

๐Ÿ›๏ธ ์†Œ์†: Meta, NYU

๐Ÿท๏ธ ํ•ต์‹ฌ ํ‚ค์›Œ๋“œ: Dynamic Tanh, Normalization-Free, Transformer

๐Ÿ’ญ ์ด๋Ÿฐ ์งˆ๋ฌธ์„ ํ•ด๋ณธ ์  ์žˆ๋‚˜์š”?

  • "BatchNorm, LayerNorm ์—†์ด Transformer๊ฐ€ ์ œ๋Œ€๋กœ ํ•™์Šต๋  ์ˆ˜ ์žˆ์„๊นŒ์š”?"

  • "์ •๊ทœํ™” ๋ ˆ์ด์–ด๊ฐ€ ์ •๋ง ๊ผญ ํ•„์š”ํ•œ ๊ฒƒ์ธ์ง€ ์˜์‹ฌํ•ด๋ณธ ์  ์žˆ๋‚˜์š”?"

  • "๋‹จ์ˆœํ•œ ํ•จ์ˆ˜ ํ•˜๋‚˜๊ฐ€ ๋ณต์žกํ•œ ๋ ˆ์ด์–ด๋ฅผ ๋Œ€์ฒดํ•  ์ˆ˜ ์žˆ์„๊นŒ์š”?"

์—”์ง„ ์˜ค์ผ ์—†์ด๋„ ๋‹ฌ๋ฆฌ๋Š” ์ฐจ์ฒ˜๋Ÿผ, Dynamic Tanh(DyT) โ€” ๋‹จ ํ•˜๋‚˜์˜ ์›์†Œ๋ณ„ ํ•จ์ˆ˜ โ€” ๊ฐ€ ๋ชจ๋“  ์ •๊ทœํ™” ๋ ˆ์ด์–ด๋ฅผ ๋Œ€์ฒดํ•˜๋ฉด์„œ๋„ ๋น„์ „, LLM, ์Œ์„ฑ ์ฒ˜๋ฆฌ ์ „ ์˜์—ญ์—์„œ ๋™๋“ฑํ•˜๊ฑฐ๋‚˜ ๋” ๋‚˜์€ ์„ฑ๋Šฅ์„ ๋ณด์—ฌ์คฌ์Šต๋‹ˆ๋‹ค. ํ•˜์ดํผํŒŒ๋ผ๋ฏธํ„ฐ ํŠœ๋‹๋„ ๊ฑฐ์˜ ํ•„์š” ์—†์Šต๋‹ˆ๋‹ค. ํŠนํžˆ ์ฃผ๋ชฉํ•  ์ :

  • LayerNormยทBatchNorm์„ ๋‹จ์ผ ์›์†Œ๋ณ„ ํ•จ์ˆ˜๋กœ ์™„์ „ ๋Œ€์ฒด

  • ๋น„์ „ยทLLMยท์Œ์„ฑ ๋“ฑ ๊ด‘๋ฒ”์œ„ํ•œ ํƒœ์Šคํฌ์—์„œ ๋™๋“ฑ ๋˜๋Š” ํ–ฅ์ƒ๋œ ์„ฑ๋Šฅ

  • ํ•˜์ดํผํŒŒ๋ผ๋ฏธํ„ฐ ํŠœ๋‹ ๋ถ€๋‹ด ์—†์ด ๊ธฐ์กด ์•„ํ‚คํ…์ฒ˜์— ์ฆ‰์‹œ ์ ์šฉ ๊ฐ€๋Šฅ

๐ŸŽฏย ์™œ ์ด๊ฒƒ์ด ๊ฒŒ์ž„ ์ฒด์ธ์ €์ธ๊ฐ€? : ์ •๊ทœํ™” = Transformer ํ•„์ˆ˜ ์š”์†Œ๋ผ๋Š” 10๋…„์˜ ์ƒ์‹ โ†’ DyT ํ•˜๋‚˜๋กœ ๊น”๋”ํ•˜๊ฒŒ ๋Œ€์ฒดํ•˜๋Š” ์ƒˆ ์„ค๊ณ„ ์ฒ ํ•™์œผ๋กœ

๋งค์ผ ํ™”์š”์ผ ์˜ค์ „ 8์‹œ,
๋ฐ”์œ ๋‹น์‹ ์„ ๊ธฐ์ˆ  ๋ฐœ์ „์— ๋’ค์ณ์ง€์ง€ ์•Š๊ฒŒ ๋งŒ๋“ค์–ด์ค„
์ตœ์‹  AI ํŠธ๋ Œ๋“œ ์š”์•ฝ๋ณธ์ด ์ „๋‹ฌ๋ฉ๋‹ˆ๋‹ค! ๐Ÿš€