๋ชฉ๋ก
Vol.242026.02.09

๐Ÿ“‘Google: "AIแ„€แ…ก แ„’แ…ชแ†ฏแ„‰แ…ฅแ†ผแ„’แ…ช แ„’แ…กแ†ทแ„‰แ…ฎแ„…แ…ณแ†ฏ แ„‰แ…ฆแ†ฏแ„‘แ…ณ แ„Œแ…ตแ†ซแ„’แ…ชแ„‰แ…ตแ„แ…ตแ„†แ…งแ†ซ แ„‹แ…ฅแ„„แ…ฅแ†ฏแ„แ…ก?"

26.02. 2แ„Œแ…ฎแ„Žแ…ก | Google DeepMind, Meta, MIT, Harvard, ByteDance, Alibaba, Oxford

2,118๋ช… ์ˆ˜์‹ ์˜คํ”ˆ์œจ 56.67%ํด๋ฆญ๋ฅ  7.73%

๐Ÿ“‘Google: "AIแ„€แ…ก แ„’แ…ชแ†ฏแ„‰แ…ฅแ†ผแ„’แ…ช แ„’แ…กแ†ทแ„‰แ…ฎแ„…แ…ณแ†ฏ แ„‰แ…ฆแ†ฏแ„‘แ…ณ แ„Œแ…ตแ†ซแ„’แ…ชแ„‰แ…ตแ„แ…ตแ„†แ…งแ†ซ แ„‹แ…ฅแ„„แ…ฅแ†ฏแ„แ…ก?"

26.02. 2แ„Œแ…ฎแ„Žแ…ก | Google DeepMind, Meta, MIT, Harvard, ByteDance, Alibaba, Oxford

๊ธˆ์ฃผ ์บ์น˜ํŽ˜์ดํผ๋Š” Google DeepMind, Meta, MIT, Harvard, ByteDance, Alibaba, Oxford ์™€ ํ•จ๊ป˜ํ•ฉ๋‹ˆ๋‹ค. 3๋ถ„๋งŒ ํˆฌ์žํ•ด ์“ฑ ๋‘˜๋Ÿฌ๋ณด๊ณ , ๋น ๋ฅด๊ฒŒ ๋ฐ”๋€Œ๋Š” ๊ธฐ์ˆ ์˜ ๋ฐฉํ–ฅ์„ฑ์„ ๋†“์น˜์ง€ ๋งˆ์„ธ์š”!

๐Ÿ“ˆ ์ตœ์‹  AI ํŠธ๋ Œ๋“œ 3์ค„ ์š”์•ฝ

๐ŸŒŸ ์ตœ๊ทผ AI ์—ฐ๊ตฌ์—์„œ๋Š” ๋‹จ์ผ forward pass๋กœ ๊ณ ํ’ˆ์งˆ ์ƒ˜ํ”Œ์„ ์ƒ์„ฑํ•˜๋Š” ํ˜์‹ ์ ์ธ ์ƒ์„ฑ ๋ชจ๋ธ๋ง๊ณผ ๊ทน์†Œ์ˆ˜ ํŒŒ๋ผ๋ฏธํ„ฐ๋กœ ๋ณต์žกํ•œ ์ถ”๋ก ์„ ๊ฐ€๋Šฅํ•˜๊ฒŒ ํ•˜๋Š” ์ดˆํšจ์œจ์  ํ•™์Šต ๊ธฐ๋ฒ•์ด ์ฃผ๋ชฉ๋ฐ›๊ณ  ์žˆ์Šต๋‹ˆ๋‹ค.

๐Ÿš€ AI๊ฐ€ ์ˆ˜ํ•™์  ๋ฐœ๊ฒฌ๊ณผ ์•Œ๊ณ ๋ฆฌ์ฆ˜ ๊ฐœ๋ฐœ์—์„œ ์ธ๊ฐ„ ์ „๋ฌธ๊ฐ€์™€ ํ˜‘๋ ฅํ•˜๋Š” ์ƒˆ๋กœ์šด ํŒจ๋Ÿฌ๋‹ค์ž„์ด ๋“ฑ์žฅํ•˜๊ณ  ์žˆ์Šต๋‹ˆ๋‹ค.

๐Ÿ”Žattention ๋ฉ”์ปค๋‹ˆ์ฆ˜์˜ ์ง์ ‘ ์ตœ์ ํ™”์™€ ํ™œ์„ฑํ™” ํ•จ์ˆ˜์˜ ์ง„ํ™”์  ํƒ์ƒ‰์„ ํ†ตํ•œ ์„ฑ๋Šฅ ํ–ฅ์ƒ ์—ฐ๊ตฌ๊ฐ€ ํ™œ๋ฐœํžˆ ์ง„ํ–‰๋˜๊ณ  ์žˆ์Šต๋‹ˆ๋‹ค.

๐Ÿงฎ AI๊ฐ€ ์ˆ˜ํ•™ ์ฆ๋ช…์—์„œ ์‹คํŒจํ•˜๋‹ค? 10๊ฐœ์˜ ๋ฏธ๊ณต๊ฐœ ๋ฌธ์ œ๋กœ ๋ฐํ˜€๋‚ธ ์ถฉ๊ฒฉ์  ์ง„์‹ค!

First Proof

๐Ÿ›๏ธ ์†Œ์†: Mohammed Abouzaid, Andrew J. Blumberg, Martin Hairer
๐Ÿท๏ธ ํ•ต์‹ฌ ํ‚ค์›Œ๋“œ: Autonomous Problem-Solving, Mathematical Proofs, AI Evaluation

๐Ÿ’ญ ์ด๋Ÿฐ ์งˆ๋ฌธ์„ ํ•ด๋ณธ ์  ์žˆ๋‚˜์š”?

  • "AI๊ฐ€ ์ •๋ง๋กœ ๋…๋ฆฝ์ ์œผ๋กœ ์ˆ˜ํ•™ ๋ฌธ์ œ๋ฅผ ํ’€ ์ˆ˜ ์žˆ์„๊นŒ?"

  • "ํ˜„์žฌ ์ตœ์‹  AI ์‹œ์Šคํ…œ์˜ ์ˆ˜ํ•™์  ์ถ”๋ก  ๋Šฅ๋ ฅ์€ ์–ด๋””๊นŒ์ง€์ผ๊นŒ?"

  • "AI์˜ ์ง„์ •ํ•œ ๋ฌธ์ œ ํ•ด๊ฒฐ ๋Šฅ๋ ฅ์„ ์–ด๋–ป๊ฒŒ ์ธก์ •ํ•  ์ˆ˜ ์žˆ์„๊นŒ?"

์‹œํ—˜์ง€์—์„œ ๋‹ต์•ˆ์„ ์ฐพ์ง€ ๋ชปํ•˜๋Š” ํ•™์ƒ์ฒ˜๋Ÿผ, First Proof ํ”„๋กœ์ ํŠธ๋Š” 10๊ฐœ์˜ ๋ฏธ๊ณต๊ฐœ ์—ฐ๊ตฌ ์ˆ˜์ค€ ์ˆ˜ํ•™ ๋ฌธ์ œ๋กœ ํ˜„์žฌ ์ตœ์‹  AI ์‹œ์Šคํ…œ๋“ค์„ ํ…Œ์ŠคํŠธํ–ˆ์Šต๋‹ˆ๋‹ค. ๊ทธ ๊ฒฐ๊ณผ๋Š” ์ถฉ๊ฒฉ์ ์ž…๋‹ˆ๋‹ค. AI๋“ค์€ ์ด๋Ÿฌํ•œ ๋ณต์žกํ•œ ๋ฌธ์ œ์— ๋Œ€ํ•ด ๋…๋ฆฝ์ ์œผ๋กœ ์˜ฌ๋ฐ”๋ฅธ ์ฆ๋ช…์„ ์ƒ์„ฑํ•˜๋Š” ๋ฐ ์–ด๋ ค์›€์„ ๊ฒช์—ˆ์Šต๋‹ˆ๋‹ค. ์ด๋Š” AI์˜ ์ˆ˜ํ•™์  ์ถ”๋ก  ๋Šฅ๋ ฅ์— ๋Œ€ํ•œ ์ƒˆ๋กœ์šด ๊ธฐ์ค€์„ ์ œ์‹œํ•ฉ๋‹ˆ๋‹ค. ํŠนํžˆ ์ฃผ๋ชฉํ•  ์ :

  • ๋ฏธ๊ณต๊ฐœ ๋ฌธ์ œ๋ฅผ ํ†ตํ•ด AI์˜ ์‹ค์ œ ๋ฌธ์ œ ํ•ด๊ฒฐ ๋Šฅ๋ ฅ์„ ์ธก์ •

  • ๊ธฐ์กด ๋ฒค์น˜๋งˆํฌ์™€ ๋‹ฌ๋ฆฌ ํ•™์Šต๋˜์ง€ ์•Š์€ ์ƒˆ๋กœ์šด ๋ฌธ์ œ๋กœ ํ‰๊ฐ€

  • ๋‹ค์–‘ํ•œ ์ˆ˜ํ•™ ๋ถ„์•ผ์— ๊ฑธ์นœ ํฌ๊ด„์ ์ธ ํ‰๊ฐ€

๐ŸŽฏ ์™œ ์ด๊ฒƒ์ด ๊ฒŒ์ž„ ์ฒด์ธ์ €์ธ๊ฐ€? : ๊ธฐ์กด์˜ ๋ฒค์น˜๋งˆํฌ ๊ธฐ๋ฐ˜ ํ‰๊ฐ€ โ†’ ๋ฏธ๊ณต๊ฐœ ๋ฌธ์ œ๋ฅผ ํ†ตํ•œ ์ง„์ •ํ•œ AI ๋Šฅ๋ ฅ ์ธก์ •์˜ ์ „ํ™˜์  ๊ฐ•์กฐ

๐Ÿ”— ๋” ์ž์„ธํ•œ ๋‚ด์šฉ์ด ๊ถ๊ธˆํ•˜๋‹ค๋ฉด : https://arxiv.org/abs/2602.05192

๐Ÿš€ ๋‹จ ํ•œ ๋ฒˆ์˜ ๊ณ„์‚ฐ์œผ๋กœ ์™„๋ฒฝํ•œ ์ด๋ฏธ์ง€๋ฅผ ์ƒ์„ฑํ•œ๋‹ค?! FID 1.54์˜ ์ถฉ๊ฒฉ!

Generative Modeling via Drifting

๐Ÿ›๏ธ ์†Œ์†: Harvard University, MIT
๐Ÿท๏ธ ํ•ต์‹ฌ ํ‚ค์›Œ๋“œ: Single Forward Pass, Drifting Models, FID Score

๐Ÿ’ญ ์ด๋Ÿฐ ์งˆ๋ฌธ์„ ํ•ด๋ณธ ์  ์žˆ๋‚˜์š”?

  • "๋ฐ˜๋ณต ์—†์ด ํ•œ ๋ฒˆ์— ๊ณ ํ’ˆ์งˆ ์ด๋ฏธ์ง€๋ฅผ ์ƒ์„ฑํ•  ์ˆ˜ ์žˆ์„๊นŒ?"

  • "ํ•™์Šต ์‹œ๊ฐ„์˜ ์ตœ์ ํ™”๊ฐ€ ์ƒ์„ฑ ์†๋„๋ฅผ ํ˜์‹ ์ ์œผ๋กœ ๋ฐ”๊ฟ€ ์ˆ˜ ์žˆ์„๊นŒ?"

  • "๋กœ๋ด‡ ์ œ์–ด์—๋„ ์ ์šฉ ๊ฐ€๋Šฅํ•œ ๋ฒ”์šฉ ์ƒ์„ฑ ๋ชจ๋ธ์ด ๊ฐ€๋Šฅํ• ๊นŒ?"

๋งˆ๋ฒ•์‚ฌ๊ฐ€ ์ง€ํŒก์ด๋ฅผ ํ•œ ๋ฒˆ ํœ˜๋‘๋ฅด๋Š” ๊ฒƒ์ฒ˜๋Ÿผ, Drifting Models์€ ๋ฐ˜๋ณต์  ๋ถ„ํฌ ๋งค์นญ์„ ํ•™์Šต ์‹œ๊ฐ„์œผ๋กœ ์ด๋™์‹œ์ผœ ๋‹จ์ผ forward pass๋กœ ๊ณ ํ’ˆ์งˆ ์ƒ˜ํ”Œ์„ ์ƒ์„ฑํ•ฉ๋‹ˆ๋‹ค. ImageNet 256x256์—์„œ FID 1.54๋ฅผ ๋‹ฌ์„ฑํ•˜๋ฉฐ, ์ด๋Š” ๊ธฐ์กด ๋‹จ์ผ ๋‹จ๊ณ„ ์ ‘๊ทผ๋ฒ•์„ ์••๋„ํ•˜๋Š” ์„ฑ๊ณผ์ž…๋‹ˆ๋‹ค. ๋” ๋†€๋ผ์šด ๊ฒƒ์€ ๋กœ๋ด‡ ์ œ์–ด ์ž‘์—…์—์„œ๋„ ํšจ๊ณผ๋ฅผ ์ž…์ฆํ–ˆ๋‹ค๋Š” ์ ์ž…๋‹ˆ๋‹ค. ํŠนํžˆ ์ฃผ๋ชฉํ•  ์ :

  • ๋‹จ์ผ neural function evaluation์œผ๋กœ latent space์—์„œ FID 1.54, pixel space์—์„œ 1.61 ๋‹ฌ์„ฑ

  • ์ด์ „ ๋‹จ์ผ ๋‹จ๊ณ„ ์ƒ์„ฑ ๋ชจ๋ธ์„ ํฌ๊ฒŒ ๋Šฅ๊ฐ€ํ•˜๋Š” ์„ฑ๋Šฅ

  • ์ด๋ฏธ์ง€ ์ƒ์„ฑ๋ฟ ์•„๋‹ˆ๋ผ ๋กœ๋ด‡ ์ œ์–ด ์ž‘์—…์—๋„ ์ ์šฉ ๊ฐ€๋Šฅ

๐ŸŽฏ ์™œ ์ด๊ฒƒ์ด ๊ฒŒ์ž„ ์ฒด์ธ์ €์ธ๊ฐ€? : ๋ฐ˜๋ณต์  ์ƒ์„ฑ ํŒจ๋Ÿฌ๋‹ค์ž„ โ†’ ๋‹จ์ผ forward pass ์ƒ์„ฑ์˜ ์ „ํ™˜์  ๊ฐ•์กฐ

๐Ÿ”— ๋” ์ž์„ธํ•œ ๋‚ด์šฉ์ด ๊ถ๊ธˆํ•˜๋‹ค๋ฉด : https://arxiv.org/abs/2602.04770

๐Ÿคฏ ๋‹จ 13๊ฐœ ํŒŒ๋ผ๋ฏธํ„ฐ๋กœ GSM8K 91% ๋‹ฌ์„ฑ! Meta๊ฐ€ ๋ฐํ˜€๋‚ธ ๊ทนํ•œ์˜ ํšจ์œจ์„ฑ!

Learning to Reason in 13 Parameters

๐Ÿ›๏ธ ์†Œ์†: Meta FAIR
๐Ÿท๏ธ ํ•ต์‹ฌ ํ‚ค์›Œ๋“œ: TinyLoRA, Ultra-Low-Capacity Adaptation, Mathematical Reasoning

๐Ÿ’ญ ์ด๋Ÿฐ ์งˆ๋ฌธ์„ ํ•ด๋ณธ ์  ์žˆ๋‚˜์š”?

  • "์ •๋ง ๋ช‡ ๊ฐœ์˜ ํŒŒ๋ผ๋ฏธํ„ฐ๋งŒ์œผ๋กœ ๋ณต์žกํ•œ ์ถ”๋ก ์ด ๊ฐ€๋Šฅํ• ๊นŒ?"

  • "๋Œ€ํ˜• ์–ธ์–ด ๋ชจ๋ธ์˜ ๋ฏธ์„ธ์กฐ์ •์„ ์–ผ๋งˆ๋‚˜ ํšจ์œจ์ ์œผ๋กœ ๋งŒ๋“ค ์ˆ˜ ์žˆ์„๊นŒ?"

  • "์ˆ˜ํ•™์  ์ถ”๋ก  ๋Šฅ๋ ฅ์„ ๊ทน์†Œ๋Ÿ‰์˜ ํ•™์Šต์œผ๋กœ ๋ถ€์—ฌํ•  ์ˆ˜ ์žˆ์„๊นŒ?"

ํ•œ ๋ฐฉ์šธ์˜ ๋ฌผ์ด ๋ฐ”์œ„๋ฅผ ๋šซ๋“ฏ, Meta FAIR์˜ TinyLoRA๋Š” ๋‹จ 13๊ฐœ์˜ ํŒŒ๋ผ๋ฏธํ„ฐ๋งŒ ํ•™์Šตํ•˜์—ฌ ๋Œ€ํ˜• ์–ธ์–ด ๋ชจ๋ธ์— ๋ณต์žกํ•œ ์ˆ˜ํ•™์  ์ถ”๋ก  ๋Šฅ๋ ฅ์„ ๋ถ€์—ฌํ•ฉ๋‹ˆ๋‹ค. ์ด ์ดˆ๋ฏธ์„ธ ์กฐ์ • ๋ฐฉ๋ฒ•์€ ๊ฐ•ํ™”ํ•™์Šต๊ณผ ๊ฒฐํ•ฉ๋˜์–ด GSM8K์—์„œ 91%์˜ ์ •ํ™•๋„๋ฅผ ๋‹ฌ์„ฑํ–ˆ์Šต๋‹ˆ๋‹ค. ์ด๋Š” ์ดˆ์ €์šฉ๋Ÿ‰ ๋ชจ๋ธ ์ ์‘์˜ ์ƒˆ๋กœ์šด ์ง€ํ‰์„ ์—ด์—ˆ์Šต๋‹ˆ๋‹ค. ํŠนํžˆ ์ฃผ๋ชฉํ•  ์ :

  • 13๊ฐœ ํŒŒ๋ผ๋ฏธํ„ฐ๋กœ ๋ณต์žกํ•œ ์ˆ˜ํ•™์  ์ถ”๋ก  ๋Šฅ๋ ฅ ํš๋“

  • ๊ธฐ์กด LoRA ๋ฐฉ์‹๋ณด๋‹ค ๊ทน๋‹จ์ ์œผ๋กœ ํŒŒ๋ผ๋ฏธํ„ฐ ํšจ์œจ์ 

  • GSM8K์—์„œ 91% ์ •ํ™•๋„๋กœ ์‹ค์šฉ์„ฑ ์ž…์ฆ

๐ŸŽฏ ์™œ ์ด๊ฒƒ์ด ๊ฒŒ์ž„ ์ฒด์ธ์ €์ธ๊ฐ€? : ๋Œ€๊ทœ๋ชจ ํŒŒ๋ผ๋ฏธํ„ฐ ๋ฏธ์„ธ์กฐ์ • โ†’ ๊ทน์†Œ์ˆ˜ ํŒŒ๋ผ๋ฏธํ„ฐ ์ ์‘์˜ ์ „ํ™˜์  ๊ฐ•์กฐ

๐Ÿ”— ๋” ์ž์„ธํ•œ ๋‚ด์šฉ์ด ๊ถ๊ธˆํ•˜๋‹ค๋ฉด : https://arxiv.org/abs/2602.04118

๐ŸŽฏ ์ถœ๋ ฅ์ด ์•„๋‹Œ attention์„ ์ง์ ‘ ํ›ˆ๋ จ์‹œํ‚จ๋‹ค! V*Bench +5.8%, NExTQA +3.4% ๋‹ฌ์„ฑ!

Reinforced Attention Learning

๐Ÿ›๏ธ ์†Œ์†: Bangzheng Li, Jianmo Ni, Chen Qu
๐Ÿท๏ธ ํ•ต์‹ฌ ํ‚ค์›Œ๋“œ: RAL, Attention Optimization, Multimodal Alignment

๐Ÿ’ญ ์ด๋Ÿฐ ์งˆ๋ฌธ์„ ํ•ด๋ณธ ์  ์žˆ๋‚˜์š”?

  • "๋ชจ๋ธ์˜ ๋‚ด๋ถ€ attention์„ ์ง์ ‘ ์ตœ์ ํ™”ํ•  ์ˆ˜ ์žˆ์„๊นŒ?"

  • "์‹œ๊ฐ์  grounding์„ ๊ฐœ์„ ํ•˜๋Š” ํ˜์‹ ์ ์ธ ๋ฐฉ๋ฒ•์€ ๋ฌด์—‡์ผ๊นŒ?"

  • "๋ฉ€ํ‹ฐ๋ชจ๋‹ฌ ์ •๋ ฌ์„ ๊ทผ๋ณธ์ ์œผ๋กœ ํ–ฅ์ƒ์‹œํ‚ฌ ์ˆ˜ ์žˆ์„๊นŒ?"

์™ธ๊ณผ์˜์‚ฌ๊ฐ€ ์ •ํ™•ํ•œ ๋ถ€์œ„๋ฅผ ์ง‘๋„ํ•˜๋“ฏ, Reinforced Attention Learning(RAL)์€ ์ถœ๋ ฅ ํ† ํฐ์ด ์•„๋‹Œ Multimodal Large Language Models์˜ ๋‚ด๋ถ€ attention ๋ถ„ํฌ๋ฅผ ์ง์ ‘ ์ตœ์ ํ™”ํ•ฉ๋‹ˆ๋‹ค. ์ด ํ˜์‹ ์ ์ธ post-training ํ”„๋ ˆ์ž„์›Œํฌ๋Š” V*Bench์—์„œ +5.8%, NExTQA์—์„œ +3.4%์˜ ์„ฑ๋Šฅ ํ–ฅ์ƒ์„ ๋‹ฌ์„ฑํ•˜๋ฉฐ, ์‹œ๊ฐ์  grounding๊ณผ ๋ฉ€ํ‹ฐ๋ชจ๋‹ฌ ์ •๋ ฌ์„ ๊ทผ๋ณธ์ ์œผ๋กœ ๊ฐœ์„ ํ–ˆ์Šต๋‹ˆ๋‹ค. ํŠนํžˆ ์ฃผ๋ชฉํ•  ์ :

  • ์ถœ๋ ฅ ํ† ํฐ์ด ์•„๋‹Œ ๋‚ด๋ถ€ attention ๋ถ„ํฌ๋ฅผ ์ง์ ‘ ์ตœ์ ํ™”

  • ๋‹ค์–‘ํ•œ ์ด๋ฏธ์ง€ ๋ฐ ๋น„๋””์˜ค QA ๋ฒค์น˜๋งˆํฌ์—์„œ ์šฐ์ˆ˜ํ•œ ์„ฑ๋Šฅ

  • ๋‹ค์–‘ํ•œ ๋ฉ€ํ‹ฐ๋ชจ๋‹ฌ ์ž‘์—…์— ์ผ๊ด€๋˜๊ฒŒ ์ ์šฉ ๊ฐ€๋Šฅ

๐ŸŽฏ ์™œ ์ด๊ฒƒ์ด ๊ฒŒ์ž„ ์ฒด์ธ์ €์ธ๊ฐ€? : ์ถœ๋ ฅ ํ† ํฐ ์ตœ์ ํ™” โ†’ ๋‚ด๋ถ€ attention ๋ถ„ํฌ ์ง์ ‘ ์ตœ์ ํ™”์˜ ์ „ํ™˜์  ๊ฐ•์กฐ

๐Ÿ”— ๋” ์ž์„ธํ•œ ๋‚ด์šฉ์ด ๊ถ๊ธˆํ•˜๋‹ค๋ฉด : https://arxiv.org/abs/2602.04884

๐Ÿ”ฌ Google์ด LLM์œผ๋กœ ์ƒˆ๋กœ์šด ํ™œ์„ฑํ™” ํ•จ์ˆ˜๋ฅผ ๋ฐœ๊ฒฌํ–ˆ๋‹ค! OOD ์„ฑ๋Šฅ ๋Œ€ํญ ํ–ฅ์ƒ!

Mining Generalizable Activation Functions

๐Ÿ›๏ธ ์†Œ์†: Google DeepMind
๐Ÿท๏ธ ํ•ต์‹ฌ ํ‚ค์›Œ๋“œ: AlphaEvolve, Periodic Components, OOD Generalization

๐Ÿ’ญ ์ด๋Ÿฐ ์งˆ๋ฌธ์„ ํ•ด๋ณธ ์  ์žˆ๋‚˜์š”?

  • "AI๊ฐ€ ์Šค์Šค๋กœ ๋” ๋‚˜์€ activation function์„ ์ฐพ์„ ์ˆ˜ ์žˆ์„๊นŒ?"

  • "์ฃผ๊ธฐ์  ์š”์†Œ๊ฐ€ ์ผ๋ฐ˜ํ™” ์„ฑ๋Šฅ์„ ํ–ฅ์ƒ์‹œํ‚ฌ ์ˆ˜ ์žˆ์„๊นŒ?"

  • "๋ณต์žกํ•œ ์ถ”๋ก ๊ณผ ๋ถ„์ž ํŠน์„ฑ ์˜ˆ์ธก์„ ๋™์‹œ์— ๊ฐœ์„ ํ•  ์ˆ˜ ์žˆ์„๊นŒ?"

์—ฐ๊ธˆ์ˆ ์‚ฌ๊ฐ€ ์™„๋ฒฝํ•œ ๊ณต์‹์„ ์ฐพ๋“ฏ, Google DeepMind๋Š” AlphaEvolve ํ”„๋ ˆ์ž„์›Œํฌ๋ฅผ ํ™œ์šฉํ•ด ์ฃผ๊ธฐ์  ์š”์†Œ๋ฅผ ํ†ตํ•ฉํ•œ ์ƒˆ๋กœ์šด ํ™œ์„ฑํ™” ํ•จ์ˆ˜๋ฅผ ๋ฐœ๊ฒฌํ–ˆ์Šต๋‹ˆ๋‹ค. ์ด ํ•จ์ˆ˜๋“ค์€ out-of-distribution ์ผ๋ฐ˜ํ™”๋ฅผ ๋ช…์‹œ์ ์œผ๋กœ ํ–ฅ์ƒ์‹œํ‚ค๋ฉฐ, ๋ณต์žกํ•œ ์ถ”๋ก  ๋ฒค์น˜๋งˆํฌ์™€ ๋ถ„์ž ํŠน์„ฑ ์˜ˆ์ธก ์ž‘์—…์—์„œ ์„ฑ๋Šฅ์„ ๋Œ€ํญ ๊ฐœ์„ ํ–ˆ์Šต๋‹ˆ๋‹ค. ํŠนํžˆ ์ฃผ๋ชฉํ•  ์ :

  • frontier LLM์ด ์ฃผ๋„ํ•˜๋Š” ์ง„ํ™”์  ํ”„๋ ˆ์ž„์›Œํฌ๋กœ ์ƒˆ๋กœ์šด ํ•จ์ˆ˜ ๋ฐœ๊ฒฌ

  • ์ฃผ๊ธฐ์  ์š”์†Œ ํ†ตํ•ฉ์œผ๋กœ OOD ์ผ๋ฐ˜ํ™” ์„ฑ๋Šฅ ํ–ฅ์ƒ

  • ์ถ”๋ก  ๋ฒค์น˜๋งˆํฌ์™€ ๋ถ„์ž ์˜ˆ์ธก ์ž‘์—… ๋ชจ๋‘์—์„œ ํšจ๊ณผ ์ž…์ฆ

๐ŸŽฏ ์™œ ์ด๊ฒƒ์ด ๊ฒŒ์ž„ ์ฒด์ธ์ €์ธ๊ฐ€? : ์ˆ˜๋™ ์„ค๊ณ„๋œ ํ™œ์„ฑํ™” ํ•จ์ˆ˜ โ†’ AI๊ฐ€ ๋ฐœ๊ฒฌํ•œ ์ผ๋ฐ˜ํ™” ์ตœ์  ํ•จ์ˆ˜์˜ ์ „ํ™˜์  ๊ฐ•์กฐ

๐Ÿ”— ๋” ์ž์„ธํ•œ ๋‚ด์šฉ์ด ๊ถ๊ธˆํ•˜๋‹ค๋ฉด : https://arxiv.org/abs/2602.05688

๐Ÿง  Gemini๊ฐ€ ์˜คํ”ˆ ์ถ”์ธก์„ ๋ฐ˜๋ฐ•ํ•˜๊ณ  ์ƒˆ ์•Œ๊ณ ๋ฆฌ์ฆ˜์„ ๋ฐœ๊ฒฌํ–ˆ๋‹ค!

Accelerating Scientific Research with Gemini: Case Studies and Common Techniques

๐Ÿ›๏ธ ์†Œ์†: Google Research, Harvard University, Carnegie Mellon University
๐Ÿท๏ธ ํ•ต์‹ฌ ํ‚ค์›Œ๋“œ: Human-AI Collaboration, Mathematical Discovery, Algorithm Development

๐Ÿ’ญ ์ด๋Ÿฐ ์งˆ๋ฌธ์„ ํ•ด๋ณธ ์  ์žˆ๋‚˜์š”?

  • "AI๊ฐ€ ์ „๋ฌธ๊ฐ€ ์ˆ˜์ค€์˜ ์ˆ˜ํ•™์  ๋ฐœ๊ฒฌ์— ๊ธฐ์—ฌํ•  ์ˆ˜ ์žˆ์„๊นŒ?"

  • "์˜คํ”ˆ ์ถ”์ธก์„ ๋ฐ˜๋ฐ•ํ•˜๊ณ  ์ƒˆ๋กœ์šด ์•Œ๊ณ ๋ฆฌ์ฆ˜์„ ์‹๋ณ„ํ•  ์ˆ˜ ์žˆ์„๊นŒ?"

  • "์ธ๊ฐ„๊ณผ AI์˜ ํ˜‘๋ ฅ์ด ์ด๋ก  ์—ฐ๊ตฌ๋ฅผ ์–ด๋–ป๊ฒŒ ๊ฐ€์†ํ™”ํ•  ์ˆ˜ ์žˆ์„๊นŒ?"

๋…ธ๋ฒจ์ƒ ์ˆ˜์ƒ์ž์™€ ํ•จ๊ป˜ ์—ฐ๊ตฌํ•˜๋Š” ๊ฒƒ์ฒ˜๋Ÿผ, Google Research๋Š” Gemini ๊ธฐ๋ฐ˜ AI ๋ชจ๋ธ์ด ์ˆ˜ํ•™์ ยท์•Œ๊ณ ๋ฆฌ์ฆ˜ ๋ฐœ๊ฒฌ์—์„œ ํšจ๊ณผ์ ์ธ ํ˜‘๋ ฅ์ž๊ฐ€ ๋  ์ˆ˜ ์žˆ์Œ์„ ์ž…์ฆํ–ˆ์Šต๋‹ˆ๋‹ค. ๋‹ค์–‘ํ•œ ์‚ฌ๋ก€ ์—ฐ๊ตฌ๋ฅผ ํ†ตํ•ด ์ด ๋ชจ๋ธ๋“ค์ด ์˜คํ”ˆ ์ถ”์ธก์„ ๋ฐ˜๋ฐ•ํ•˜๊ณ , ์ƒˆ๋กœ์šด ์•Œ๊ณ ๋ฆฌ์ฆ˜์„ ์‹๋ณ„ํ•˜๋ฉฐ, ๋ณต์žกํ•œ ๋ถ„์„ ์†”๋ฃจ์…˜์„ ๋„์ถœํ•  ์ˆ˜ ์žˆ์Œ์„ ๋ณด์—ฌ์ค๋‹ˆ๋‹ค. ํŠนํžˆ ์ฃผ๋ชฉํ•  ์ :

  • ์ „๋ฌธ๊ฐ€ ์ˆ˜์ค€์˜ ์ˆ˜ํ•™์  ๋ฐœ๊ฒฌ์— AI๊ฐ€ ์ง์ ‘ ๊ธฐ์—ฌ

  • ์˜คํ”ˆ ์ถ”์ธก ๋ฐ˜๋ฐ•, ์•Œ๊ณ ๋ฆฌ์ฆ˜ ์‹๋ณ„, ๋ถ„์„ ์†”๋ฃจ์…˜ ๋„์ถœ ๋“ฑ ๋‹ค๋ฐฉ๋ฉด ์„ฑ๊ณผ

  • ์ด๋ก  ์—ฐ๊ตฌ์˜ ์ธ๊ฐ„-AI ํ˜‘๋ ฅ์„ ์œ„ํ•œ ๊ณตํ†ต ๊ธฐ๋ฒ• ์ œ์‹œ

๐ŸŽฏ ์™œ ์ด๊ฒƒ์ด ๊ฒŒ์ž„ ์ฒด์ธ์ €์ธ๊ฐ€? : ์ธ๊ฐ„ ์ „์šฉ ์ด๋ก  ์—ฐ๊ตฌ โ†’ ์ธ๊ฐ„-AI ํ˜‘๋ ฅ ๋ฐœ๊ฒฌ์˜ ์ „ํ™˜์  ๊ฐ•์กฐ

๐Ÿ”— ๋” ์ž์„ธํ•œ ๋‚ด์šฉ์ด ๊ถ๊ธˆํ•˜๋‹ค๋ฉด : https://arxiv.org/abs/2602.03837

๐Ÿ“‰ LLM์˜ ๊นŠ์ด ๋น„๋ฐ€, Loss๊ฐ€ ๊นŠ์ด์— ๋ฐ˜๋น„๋ก€ํ•œ๋‹ค (L ~ 1/โ„“)

Inverse Depth Scaling From Most Layers Being Similar

๐Ÿ›๏ธ ์†Œ์†: MIT, Harvard, Stanford
๐Ÿท๏ธ ํ•ต์‹ฌ ํ‚ค์›Œ๋“œ: Depth Scaling, Ensemble Averaging, Layer Similarity

๐Ÿ’ญ ์ด๋Ÿฐ ์งˆ๋ฌธ์„ ํ•ด๋ณธ ์  ์žˆ๋‚˜์š”?

  • "LLM์˜ loss๊ฐ€ ๊นŠ์ด์™€ ์–ด๋–ค ๊ด€๊ณ„๋ฅผ ๊ฐ€์งˆ๊นŒ?"

  • "๋ ˆ์ด์–ด๋“ค์ด ์œ ์‚ฌํ•œ ์—ญํ• ์„ ์ˆ˜ํ–‰ํ•˜๋Š” ์ด์œ ๋Š” ๋ฌด์—‡์ผ๊นŒ?"

  • "๊นŠ์ด๊ฐ€ ์„ฑ๋Šฅ์— ๋ฏธ์น˜๋Š” ์˜ํ–ฅ์„ ์ •๋Ÿ‰์ ์œผ๋กœ ์ดํ•ดํ•  ์ˆ˜ ์žˆ์„๊นŒ?"

๋งˆ์น˜ ์ˆ˜๋งŽ์€ ์ž‘์€ ์ถ”๊ฐ€ ํ•˜๋‚˜์˜ ํฐ ๊ท ํ˜•์„ ๋งŒ๋“ค์–ด๋‚ด๋“ฏ, MIT, Harvard, Stanford ์—ฐ๊ตฌ์ง„์€ ๋Œ€ํ˜• ์–ธ์–ด ๋ชจ๋ธ์˜ loss๊ฐ€ ๊นŠ์ด์— ๋ฐ˜๋น„๋ก€(L ~ 1/โ„“)ํ•จ์„ ์ •๋Ÿ‰์ ์œผ๋กœ ์ž…์ฆํ–ˆ์Šต๋‹ˆ๋‹ค. ์—ฐ๊ตฌ ๊ฒฐ๊ณผ, LLM์€ ์ฃผ๋กœ "์•™์ƒ๋ธ” ํ‰๊ท " ๋ฉ”์ปค๋‹ˆ์ฆ˜์„ ํ†ตํ•ด ๊นŠ์ด๋ฅผ ํ™œ์šฉํ•˜๋ฉฐ, ๋ ˆ์ด์–ด๋“ค์ด ์œ ์‚ฌํ•œ ์ ์ง„์  ์—…๋ฐ์ดํŠธ๋ฅผ ์ˆ˜ํ–‰ํ•ด ์ง‘๋‹จ์ ์œผ๋กœ ์˜ค๋ฅ˜๋ฅผ ๊ฐ์†Œ์‹œํ‚ต๋‹ˆ๋‹ค. ํŠนํžˆ ์ฃผ๋ชฉํ•  ์ :

  • ๊นŠ์ด์™€ loss์˜ ๊ด€๊ณ„๋ฅผ ์ •๋Ÿ‰์ ์œผ๋กœ ๊ทœ๋ช…

  • "์•™์ƒ๋ธ” ํ‰๊ท " ๋ฉ”์ปค๋‹ˆ์ฆ˜์˜ ๋ฐœ๊ฒฌ์œผ๋กœ ๋ ˆ์ด์–ด ์œ ์‚ฌ์„ฑ ์„ค๋ช…

  • ๋‹ค์–‘ํ•œ LLM ์•„ํ‚คํ…์ฒ˜์— ์ ์šฉ ๊ฐ€๋Šฅํ•œ ๋ณดํŽธ์  ์›๋ฆฌ

๐ŸŽฏ ์™œ ์ด๊ฒƒ์ด ๊ฒŒ์ž„ ์ฒด์ธ์ €์ธ๊ฐ€? : ๋ถˆ๋ช…ํ™•ํ•œ ๊นŠ์ด ํšจ๊ณผ โ†’ ๊นŠ์ด์™€ ์„ฑ๋Šฅ์˜ ์ •๋Ÿ‰์  ๊ด€๊ณ„ ๊ทœ๋ช…์˜ ์ „ํ™˜์  ๊ฐ•์กฐ

๐Ÿ”— ๋” ์ž์„ธํ•œ ๋‚ด์šฉ์ด ๊ถ๊ธˆํ•˜๋‹ค๋ฉด : https://arxiv.org/abs/2602.05970

๐Ÿ’ฐ ByteDance๊ฐ€ ์ˆ˜์‹ญ์–ต ํŒŒ๋ผ๋ฏธํ„ฐ ๋žญํ‚น ๋ชจ๋ธ๋กœ GMV 2.98% ์˜ฌ๋ ธ๋‹ค! ๊ด‘๊ณ ์ฃผ ๋งŒ์กฑ๋„๋„ 2.0% UP!

TokenMixer-Large: Scaling Up Large Ranking Models in Industrial Recommenders

๐Ÿ›๏ธ ์†Œ์†: ByteDance AML
๐Ÿท๏ธ ํ•ต์‹ฌ ํ‚ค์›Œ๋“œ: Multi-Billion Parameters, Industrial Recommender, Online Performance

๐Ÿ’ญ ์ด๋Ÿฐ ์งˆ๋ฌธ์„ ํ•ด๋ณธ ์  ์žˆ๋‚˜์š”?

  • "์ˆ˜์‹ญ์–ต ํŒŒ๋ผ๋ฏธํ„ฐ ๋žญํ‚น ๋ชจ๋ธ์„ ์‹ค์ œ ์„œ๋น„์Šค์— ์ ์šฉํ•  ์ˆ˜ ์žˆ์„๊นŒ?"

  • "์ถ”์ฒœ ์‹œ์Šคํ…œ์˜ ์˜จ๋ผ์ธ ์„ฑ๋Šฅ์„ ์–ด๋–ป๊ฒŒ ๊ทน๋Œ€ํ™”ํ•  ์ˆ˜ ์žˆ์„๊นŒ?"

  • "๊ด‘๊ณ , ์ด์ปค๋จธ์Šค, ๋ผ์ด๋ธŒ ์ŠคํŠธ๋ฆฌ๋ฐ์—์„œ ๋™์‹œ์— ์„ฑ๊ณผ๋ฅผ ๋‚ผ ์ˆ˜ ์žˆ์„๊นŒ?"

๊ฑฐ๋Œ€ํ•œ ์—”์ง„์ด ์ •๋ฐ€ํ•˜๊ฒŒ ์ž‘๋™ํ•˜๋“ฏ, ByteDance AML์˜ TokenMixer-Large๋Š” ์ˆ˜์‹ญ์–ต ํŒŒ๋ผ๋ฏธํ„ฐ๊นŒ์ง€ ํšจ์œจ์ ์œผ๋กœ ํ™•์žฅ ๊ฐ€๋Šฅํ•œ ์‚ฐ์—…์šฉ ์ถ”์ฒœ ์‹œ์Šคํ…œ ๋žญํ‚น ๋ชจ๋ธ์ž…๋‹ˆ๋‹ค. ์•„ํ‚คํ…์ฒ˜ ํ˜์‹ ๊ณผ ํฌ๊ด„์  ์ตœ์ ํ™”๋ฅผ ํ†ตํ•ด Douyin์˜ ๊ด‘๊ณ , ์ด์ปค๋จธ์Šค, ๋ผ์ด๋ธŒ ์ŠคํŠธ๋ฆฌ๋ฐ ํ”Œ๋žซํผ์—์„œ ์ผ๊ด€๋œ ์˜จ๋ผ์ธ ์„ฑ๋Šฅ ํ–ฅ์ƒ์„ ๋‹ฌ์„ฑํ–ˆ์œผ๋ฉฐ, GMV 2.98% ์ฆ๊ฐ€์™€ ๊ด‘๊ณ ์ฃผ ๋งŒ์กฑ๋„ 2.0% ๊ฐœ์„ ์„ ๊ธฐ๋กํ–ˆ์Šต๋‹ˆ๋‹ค. ํŠนํžˆ ์ฃผ๋ชฉํ•  ์ :

  • ์ˆ˜์‹ญ์–ต ํŒŒ๋ผ๋ฏธํ„ฐ ๊ทœ๋ชจ๋กœ ํšจ์œจ์  ํ™•์žฅ

  • ์‹ค์ œ ์„œ๋น„์Šค์—์„œ ๊ฒ€์ฆ๋œ ์˜จ๋ผ์ธ ์„ฑ๋Šฅ ํ–ฅ์ƒ

  • ๊ด‘๊ณ , ์ด์ปค๋จธ์Šค, ๋ผ์ด๋ธŒ ์ŠคํŠธ๋ฆฌ๋ฐ ์ „ ์˜์—ญ์—์„œ ์„ฑ๊ณผ

๐ŸŽฏ ์™œ ์ด๊ฒƒ์ด ๊ฒŒ์ž„ ์ฒด์ธ์ €์ธ๊ฐ€? : ์ œํ•œ๋œ ๊ทœ๋ชจ์˜ ๋žญํ‚น ๋ชจ๋ธ โ†’ ์ˆ˜์‹ญ์–ต ํŒŒ๋ผ๋ฏธํ„ฐ ์‚ฐ์—…์šฉ ๋ชจ๋ธ์˜ ์ „ํ™˜์  ๊ฐ•์กฐ

๐Ÿ”— ๋” ์ž์„ธํ•œ ๋‚ด์šฉ์ด ๊ถ๊ธˆํ•˜๋‹ค๋ฉด : https://arxiv.org/abs/2602.06563

๐ŸŽฌ Meta์™€ Oxford๊ฐ€ ์ƒ๊ด€๊ด€๊ณ„ ๋Œ€์‹  ์›Œํ•‘์œผ๋กœ ์ถ”์ ํ•œ๋‹ค! TAP-Vid์—์„œ SOTA ๋‹ฌ์„ฑ!

CoWTracker: Tracking by Warping instead of Correlation

๐Ÿ›๏ธ ์†Œ์†: University of Oxford, Meta
๐Ÿท๏ธ ํ•ต์‹ฌ ํ‚ค์›Œ๋“œ: Iterative Warping, Spatiotemporal Transformers, Dense Point Tracking

๐Ÿ’ญ ์ด๋Ÿฐ ์งˆ๋ฌธ์„ ํ•ด๋ณธ ์  ์žˆ๋‚˜์š”?

  • "์ƒ๊ด€๊ด€๊ณ„ ๊ธฐ๋ฐ˜ ์ถ”์ ์˜ ํ•œ๊ณ„๋ฅผ ๊ทน๋ณตํ•  ์ˆ˜ ์žˆ์„๊นŒ?"

  • "dense point tracking์˜ ์ •ํ™•๋„๋ฅผ ์–ด๋–ป๊ฒŒ ํ–ฅ์ƒ์‹œํ‚ฌ ์ˆ˜ ์žˆ์„๊นŒ?"

  • "optical flow์—์„œ๋„ ๊ฒฝ์Ÿ๋ ฅ ์žˆ๋Š” zero-shot ์„ฑ๋Šฅ์„ ๋‚ผ ์ˆ˜ ์žˆ์„๊นŒ?"

๋‚˜์นจ๋ฐ˜์ด ๋ถ๊ทน์„ ๊ฐ€๋ฆฌํ‚ค๋“ฏ ์ •ํ™•ํ•˜๊ฒŒ, CoWTracker๋Š” ์ „ํ†ต์ ์ธ ์ƒ๊ด€๊ด€๊ณ„ ๊ธฐ๋ฐ˜ ๋น„์šฉ ๋ณผ๋ฅจ์„ ๋ฐ˜๋ณต์  ์›Œํ•‘ ๋ฉ”์ปค๋‹ˆ์ฆ˜๊ณผ ์‹œ๊ณต๊ฐ„ ํŠธ๋žœ์Šคํฌ๋จธ๋กœ ๋Œ€์ฒดํ•ฉ๋‹ˆ๋‹ค. ์ด ํ˜์‹ ์  ์ ‘๊ทผ๋ฒ•์€ TAP-Vid์™€ RoboTAP ๊ฐ™์€ dense point tracking ๋ฒค์น˜๋งˆํฌ์—์„œ state-of-the-art ์„ฑ๋Šฅ์„ ๋‹ฌ์„ฑํ•˜๋ฉฐ, MPI-Sintel๊ณผ KITTI-2015 ๊ฐ™์€ optical flow ์ž‘์—…์—์„œ๋„ ๊ฒฝ์Ÿ๋ ฅ ์žˆ๋Š” zero-shot ๋Šฅ๋ ฅ์„ ์ž…์ฆํ–ˆ์Šต๋‹ˆ๋‹ค. ํŠนํžˆ ์ฃผ๋ชฉํ•  ์ :

  • ์ƒ๊ด€๊ด€๊ณ„ ๊ธฐ๋ฐ˜ cost volume ๋Œ€์‹  ์›Œํ•‘ ๋ฉ”์ปค๋‹ˆ์ฆ˜ ์‚ฌ์šฉ

  • TAP-Vid, RoboTAP์—์„œ SOTA ๋‹ฌ์„ฑ

  • optical flow ์ž‘์—…์—์„œ๋„ zero-shot ์„ฑ๋Šฅ ์‹œ์—ฐ

๐ŸŽฏ ์™œ ์ด๊ฒƒ์ด ๊ฒŒ์ž„ ์ฒด์ธ์ €์ธ๊ฐ€? : ์ƒ๊ด€๊ด€๊ณ„ ๊ธฐ๋ฐ˜ ์ถ”์  โ†’ ์›Œํ•‘ ๊ธฐ๋ฐ˜ ์ถ”์ ์˜ ์ „ํ™˜์  ๊ฐ•์กฐ

๐Ÿ”— ๋” ์ž์„ธํ•œ ๋‚ด์šฉ์ด ๊ถ๊ธˆํ•˜๋‹ค๋ฉด : https://arxiv.org/abs/2602.04877

๐Ÿฆ… Alibaba๊ฐ€ ํ…์ŠคํŠธยท๋น„์ „ยท์ธํ„ฐ๋ฆฌ๋ธŒ ์ถ”๋ก  ๋ชจ๋“œ๋ฅผ ์ž์œ ์ž์žฌ๋กœ ์ „ํ™˜ํ•œ๋‹ค! SwimBird ๋“ฑ์žฅ!

SwimBird: Eliciting Switchable Reasoning Mode in Hybrid Autoregressive MLLMs

๐Ÿ›๏ธ ์†Œ์†: Alibaba Group, Huazhong University of Science and Technology
๐Ÿท๏ธ ํ•ต์‹ฌ ํ‚ค์›Œ๋“œ: Switchable Reasoning, Hybrid Autoregressive, Dynamic Token Budget

๐Ÿ’ญ ์ด๋Ÿฐ ์งˆ๋ฌธ์„ ํ•ด๋ณธ ์  ์žˆ๋‚˜์š”?

  • "MLLM์ด ์ƒํ™ฉ์— ๋”ฐ๋ผ ์ถ”๋ก  ๋ชจ๋“œ๋ฅผ ์ „ํ™˜ํ•  ์ˆ˜ ์žˆ์„๊นŒ?"

  • "ํ…์ŠคํŠธ ์ „์šฉ, ๋น„์ „ ์ „์šฉ, ์ธํ„ฐ๋ฆฌ๋ธŒ ์ถ”๋ก ์„ ํ•˜๋‚˜์˜ ๋ชจ๋ธ๋กœ ๊ฐ€๋Šฅํ• ๊นŒ?"

  • "ํ•ด์ƒ๋„ ์ธ์‹ ๋™์  ํ† ํฐ ์˜ˆ์‚ฐ์ด ์„ฑ๋Šฅ์„ ์–ด๋–ป๊ฒŒ ํ–ฅ์ƒ์‹œํ‚ฌ๊นŒ?"

์นด๋ฉœ๋ ˆ์˜จ์ด ํ™˜๊ฒฝ์— ๋”ฐ๋ผ ์ƒ‰์„ ๋ฐ”๊พธ๋“ฏ, SwimBird๋Š” ํ…์ŠคํŠธ ์ „์šฉ, ๋น„์ „ ์ „์šฉ, ์ธํ„ฐ๋ฆฌ๋ธŒ ์ถ”๋ก  ๋ชจ๋“œ๋ฅผ ๋™์ ์œผ๋กœ ์ „ํ™˜ํ•  ์ˆ˜ ์žˆ๋Š” Multimodal Large Language Model์ž…๋‹ˆ๋‹ค. ํ•˜์ด๋ธŒ๋ฆฌ๋“œ autoregressive ๊ณต์‹๊ณผ ํ•ด์ƒ๋„ ์ธ์‹ ๋™์  latent token budget์„ ํ†ตํ•ด ๊ฐ€๋Šฅํ•ด์ง„ ์ด ๋ชจ๋ธ์€ SwimBird-SFT-92K ๋ฐ์ดํ„ฐ์…‹์œผ๋กœ ํ•™์Šต๋˜์–ด, ์„ธ๋ฐ€ํ•œ ์‹œ๊ฐ ์ดํ•ด์™€ ๋ณต์žกํ•œ ๋ฉ€ํ‹ฐ๋ชจ๋‹ฌ ์ถ”๋ก ์„ ์š”๊ตฌํ•˜๋Š” ๋‹ค์–‘ํ•œ ๋ฒค์น˜๋งˆํฌ์—์„œ state-of-the-art ์„ฑ๋Šฅ์„ ๋‹ฌ์„ฑํ–ˆ์Šต๋‹ˆ๋‹ค. ํŠนํžˆ ์ฃผ๋ชฉํ•  ์ :

  • ๋™์  ์ถ”๋ก  ๋ชจ๋“œ ์ „ํ™˜ ๋Šฅ๋ ฅ

  • ์„ธ๋ฐ€ํ•œ ์‹œ๊ฐ ์ดํ•ด์™€ ๋ณต์žกํ•œ ์ถ”๋ก  ๋ชจ๋‘์—์„œ SOTA

  • ๋‹ค์–‘ํ•œ ๋ฉ€ํ‹ฐ๋ชจ๋‹ฌ ๋ฒค์น˜๋งˆํฌ์—์„œ ์ผ๊ด€๋œ ์„ฑ๋Šฅ

๐ŸŽฏ ์™œ ์ด๊ฒƒ์ด ๊ฒŒ์ž„ ์ฒด์ธ์ €์ธ๊ฐ€? : ๊ณ ์ •๋œ ์ถ”๋ก  ๋ชจ๋“œ โ†’ ์ƒํ™ฉ ์ ์‘ํ˜• ๋™์  ์ถ”๋ก  ๋ชจ๋“œ์˜ ์ „ํ™˜์  ๊ฐ•์กฐ

๐Ÿ”— ๋” ์ž์„ธํ•œ ๋‚ด์šฉ์ด ๊ถ๊ธˆํ•˜๋‹ค๋ฉด : https://arxiv.org/abs/2602.06040

๋งค์ผ ํ™”์š”์ผ ์˜ค์ „ 8์‹œ,
๋ฐ”์œ ๋‹น์‹ ์„ ๊ธฐ์ˆ  ๋ฐœ์ „์— ๋’ค์ณ์ง€์ง€ ์•Š๊ฒŒ ๋งŒ๋“ค์–ด์ค„
์ตœ์‹  AI ํŠธ๋ Œ๋“œ๊ฐ€ ์š”์•ฝ ์ •๋ฆฌ๋ณธ์œผ๋กœ ์ „๋‹ฌ๋ฉ๋‹ˆ๋‹ค!