๋ชฉ๋ก
Vol.272026.03.19

๐Ÿ“‘ Microsoft:"LLMแ„‹แ…ต แ„‡แ…ขแ„‘แ…ฉ แ„’แ…ฎแ„‹แ…ฆแ„ƒแ…ฉ แ„€แ…จแ„‰แ…ฉแ†จ แ„‡แ…กแ†ฏแ„Œแ…ฅแ†ซแ„’แ…กแ†ฏ แ„‰แ…ฎแ„‚แ…ณแ†ซ แ„‹แ…ฅแ†นแ„‹แ…ณแ†ฏแ„แ…ก?"

26.03. 3แ„Œแ…ฎแ„Žแ…ก | Microsoft Research, Google, Tencent, Meta, Alibaba, Meituan

2,188๋ช… ์ˆ˜์‹ ์˜คํ”ˆ์œจ 52.82%ํด๋ฆญ๋ฅ  7.52%

๐Ÿ“‘ Microsoft:"LLMแ„‹แ…ต แ„‡แ…ขแ„‘แ…ฉ แ„’แ…ฎแ„‹แ…ฆแ„ƒแ…ฉ แ„€แ…จแ„‰แ…ฉแ†จ แ„‡แ…กแ†ฏแ„Œแ…ฅแ†ซแ„’แ…กแ†ฏ แ„‰แ…ฎแ„‚แ…ณแ†ซ แ„‹แ…ฅแ†นแ„‹แ…ณแ†ฏแ„แ…ก?"

26.03. 3แ„Œแ…ฎแ„Žแ…ก | Microsoft Research, Google, Tencent, Meta, Alibaba, Meituan

๊ธˆ์ฃผ ์บ์น˜ํŽ˜์ดํผ๋Š” Microsoft Research, Google, Tencent, Meta, Alibaba, Meituan๊ณผ ํ•จ๊ป˜ํ•ฉ๋‹ˆ๋‹ค. 3๋ถ„๋งŒ ํˆฌ์žํ•ด ์“ฑ ๋‘˜๋Ÿฌ๋ณด๊ณ , ๋น ๋ฅด๊ฒŒ ๋ฐ”๋€Œ๋Š” ๊ธฐ์ˆ ์˜ ๋ฐฉํ–ฅ์„ฑ์„ ๋†“์น˜์ง€ ๋งˆ์„ธ์š”!

๐Ÿ“ˆ ์ตœ์‹  AI ํŠธ๋ Œ๋“œ 3์ค„ ์š”์•ฝ

๐ŸŒŸ ๋น„๋””์˜ค ์ƒ์„ฑ ๋ชจ๋ธ์˜ ์ถ”๋ก  ๋Šฅ๋ ฅ๊ณผ ์›”๋“œ ์‹œ๋ฎฌ๋ ˆ์ด์…˜์ด ์ด๋ฒˆ ์ฃผ์˜ ํ•ต์‹ฌ ํ‚ค์›Œ๋“œ์ž…๋‹ˆ๋‹ค
๐Ÿ”ฅ LLM ์—์ด์ „ํŠธ์˜ '๊ฒฝํ—˜ ํ•™์Šต'๊ณผ '์ž๊ธฐ ์ง„ํ™”'๊ฐ€ ์ƒˆ๋กœ์šด ์—ฐ๊ตฌ ํ๋ฆ„์œผ๋กœ ๋ถ€์ƒํ•˜๊ณ  ์žˆ์Šต๋‹ˆ๋‹ค
๐Ÿš€ 1,600๊ฐœ ์–ธ์–ด ๋ฒˆ์—ญ๋ถ€ํ„ฐ ์Šคํ…Œ๋ ˆ์˜ค VR ๋ Œ๋”๋ง๊นŒ์ง€, AI๊ฐ€ ์ปค๋ฒ„ํ•˜๋Š” ๋ฒ”์œ„๊ฐ€ ๊ทน์ ์œผ๋กœ ํ™•์žฅ๋˜๊ณ  ์žˆ์Šต๋‹ˆ๋‹ค

๐Ÿ”ญ "๋น„๋””์˜ค ๋ชจ๋ธ์€ ํ”„๋ ˆ์ž„์ด ์•„๋‹ˆ๋ผ '๋…ธ์ด์ฆˆ ์ œ๊ฑฐ ๋‹จ๊ณ„'์—์„œ ์ƒ๊ฐํ•œ๋‹ค"

Demystifing Video Reasoning
๐Ÿ›๏ธ ์†Œ์†: SenseTime, CUHK, NTU
๐Ÿท๏ธ ํ•ต์‹ฌ ํ‚ค์›Œ๋“œ: Video Reasoning, Chain-of-Steps, Diffusion Transformers

๐Ÿ’ญ ์ด๋Ÿฐ ์งˆ๋ฌธ์„ ํ•ด๋ณธ ์  ์žˆ๋‚˜์š”?

  • ๋น„๋””์˜ค ์ƒ์„ฑ ๋ชจ๋ธ์ด ์ •๋ง๋กœ '์ถ”๋ก '์„ ํ•  ์ˆ˜ ์žˆ์„๊นŒ?

  • ์˜์ƒ ์† ๋…ผ๋ฆฌ์  ์ „๊ฐœ๋Š” ํ”„๋ ˆ์ž„ ์ˆœ์„œ๋Œ€๋กœ ๋งŒ๋“ค์–ด์ง€๋Š” ๊ฑธ๊นŒ?

  • ๋””ํ“จ์ „ ๋ชจ๋ธ ๋‚ด๋ถ€์—์„œ ์‹ค์ œ๋กœ ๋ฌด์Šจ ์ผ์ด ๋ฒŒ์–ด์ง€๊ณ  ์žˆ์„๊นŒ?

์…ฐํ”„๊ฐ€ ์š”๋ฆฌ๋ฅผ ํ•  ๋•Œ, ๊ฐ„์„ ๋ณด๊ณ  ์กฐ์ ˆํ•˜๊ณ  ๋•Œ๋ก  ์ฒ˜์Œ๋ถ€ํ„ฐ ๋‹ค์‹œ ์‹œ์ž‘ํ•˜์ฃ . ๋น„๋””์˜ค ๋””ํ“จ์ „ ๋ชจ๋ธ๋„ ๋งˆ์ฐฌ๊ฐ€์ง€์˜€์Šต๋‹ˆ๋‹ค. ์ด ์—ฐ๊ตฌ๋Š” ๊ธฐ์กด์˜ 'ํ”„๋ ˆ์ž„ ์ˆœ์„œ๋Œ€๋กœ ์ถ”๋ก ํ•œ๋‹ค(Chain-of-Frames)' ๊ฐ€์ •์„ ๋’ค์ง‘๊ณ , ์‹ค์ œ๋กœ๋Š” ๋””๋…ธ์ด์ง• ๋‹จ๊ณ„๋ฅผ ๋”ฐ๋ผ ์ถ”๋ก ์ด ์ „๊ฐœ๋œ๋‹ค๋Š” Chain-of-Steps(CoS) ๋ฉ”์ปค๋‹ˆ์ฆ˜์„ ๋ฐœ๊ฒฌํ–ˆ์Šต๋‹ˆ๋‹ค. ์ดˆ๊ธฐ ๋‹จ๊ณ„์—์„œ ์—ฌ๋Ÿฌ ํ›„๋ณด ํ•ด๋‹ต์„ ํƒ์ƒ‰ํ•˜๊ณ , ์ ์ง„์ ์œผ๋กœ ์ตœ์ข… ๋‹ต์— ์ˆ˜๋ ดํ•˜๋Š” ๊ณผ์ •์ด ๊ด€์ฐฐ๋ฉ๋‹ˆ๋‹ค.

ํŠนํžˆ ์ฃผ๋ชฉํ•  ์ :

  • ์›Œํ‚น ๋ฉ”๋ชจ๋ฆฌ, ์ž๊ธฐ๊ต์ •, ์ธ์ง€ ํ›„ ํ–‰๋™ ๋“ฑ 3๊ฐ€์ง€ ์ฐฝ๋ฐœ์  ์ถ”๋ก  ํ–‰๋™์„ ์ตœ์ดˆ๋กœ ๊ทœ๋ช…

  • Diffusion Transformer ๋‚ด๋ถ€์—์„œ ์ดˆ๊ธฐ ๋ ˆ์ด์–ดโ†’์ง€๊ฐ, ์ค‘๊ฐ„โ†’์ถ”๋ก , ํ›„๊ธฐโ†’ํ†ตํ•ฉ์ด๋ผ๋Š” ๊ธฐ๋Šฅ์  ๋ถ„ํ™” ๋ฐœ๊ฒฌ

  • ๋™์ผ ๋ชจ๋ธ์˜ ๋‹ค๋ฅธ ์‹œ๋“œ ์ž ์žฌ ๊ฒฝ๋กœ๋ฅผ ์•™์ƒ๋ธ”ํ•˜๋Š” ๊ฒƒ๋งŒ์œผ๋กœ ์ถ”๋ก  ์„ฑ๋Šฅ ํ–ฅ์ƒ (ํ•™์Šต ์—†์ด!)

๐ŸŽฏ ์™œ ์ด๊ฒƒ์ด ๊ฒŒ์ž„ ์ฒด์ธ์ €์ธ๊ฐ€? : ๋น„๋””์˜ค ๋ชจ๋ธ์˜ ์ถ”๋ก ์„ '๋ธ”๋ž™๋ฐ•์Šค'๋กœ ์ทจ๊ธ‰ โ†’ ๋””๋…ธ์ด์ง• ์Šคํ… ๋‹จ์œ„์˜ ์ฒด๊ณ„์  ์ดํ•ด์™€ ํ•™์Šต-์—†๋Š” ๊ฐœ์„  ์ „๋žต ์ œ์‹œ

๐Ÿง  "AI๊ฐ€ ์‹ค์ „ ๊ฒฝํ—˜์—์„œ ์Šค์Šค๋กœ ๋ฐฐ์šฐ๋Š” ์‹œ๋Œ€๊ฐ€ ์˜จ๋‹ค"

Online Experiential Learning for Language Models
๐Ÿ›๏ธ ์†Œ์†: Microsoft Research
๐Ÿท๏ธ ํ•ต์‹ฌ ํ‚ค์›Œ๋“œ: Online Learning, Experience Distillation, Context Distillation

๐Ÿ’ญ ์ด๋Ÿฐ ์งˆ๋ฌธ์„ ํ•ด๋ณธ ์  ์žˆ๋‚˜์š”?

  • LLM์ด ๋ฐฐํฌ ํ›„์—๋„ ๊ณ„์† ๋ฐœ์ „ํ•  ์ˆ˜๋Š” ์—†์„๊นŒ?

  • ์‹ค์ œ ์‚ฌ์šฉ์ž์™€์˜ ์ƒํ˜ธ์ž‘์šฉ ๋ฐ์ดํ„ฐ๋ฅผ ํ•™์Šต์— ํ™œ์šฉํ•  ๋ฐฉ๋ฒ•์€?

  • ์˜คํ”„๋ผ์ธ ํ›ˆ๋ จ์˜ ํ•œ๊ณ„๋ฅผ ์–ด๋–ป๊ฒŒ ๋„˜์–ด์„ค ์ˆ˜ ์žˆ์„๊นŒ?

์šด์ „๋ฉดํ—ˆ๋ฅผ ๋”ธ ๋•Œ, ์ด๋ก  ์‹œํ—˜๊ณผ ์‹ค์ œ ๋„๋กœ ์ฃผํ–‰ ๊ฒฝํ—˜์€ ์ฐจ์›์ด ๋‹ค๋ฆ…๋‹ˆ๋‹ค. ์ง€๊ธˆ๊นŒ์ง€์˜ LLM์€ '๋ฉดํ—ˆ ์‹œํ—˜'๊นŒ์ง€๋งŒ ์ค€๋น„๋œ ์ƒํƒœ์˜€์ฃ . Microsoft Research๊ฐ€ ์ œ์•ˆํ•œ OEL ํ”„๋ ˆ์ž„์›Œํฌ๋Š” ์‹ค์ œ ๋ฐฐํฌ ํ™˜๊ฒฝ์—์„œ ์ถ•์ ๋œ ๊ฒฝํ—˜์„ ์ถ”์ถœํ•˜๊ณ , ์ด๋ฅผ on-policy context distillation์œผ๋กœ ๋ชจ๋ธ์— ํ†ตํ•ฉํ•ฉ๋‹ˆ๋‹ค. ์‚ฌ์šฉ์ž ํ™˜๊ฒฝ์— ์ ‘๊ทผํ•˜์ง€ ์•Š๊ณ ๋„ ์ง€์†์  ๊ฐœ์„ ์ด ๊ฐ€๋Šฅํ•œ ๊ฒƒ์ด ํ•ต์‹ฌ์ž…๋‹ˆ๋‹ค.

ํŠนํžˆ ์ฃผ๋ชฉํ•  ์ :

  • ๋ฐ˜๋ณต ๋ผ์šด๋“œ๋งˆ๋‹ค ์ž‘์—… ์ •ํ™•๋„์™€ ํ† ํฐ ํšจ์œจ์„ฑ ๋ชจ๋‘ ์ผ๊ด€์ ์œผ๋กœ ํ–ฅ์ƒ

  • ์›์‹œ trajectory ๋Œ€๋น„ ์ถ”์ถœ๋œ ๊ฒฝํ—˜ ์ง€์‹์ด ํ˜„์ €ํžˆ ๋” ํšจ๊ณผ์ 

  • ๋น„์ •ํ˜•(OOD) ํ™˜๊ฒฝ ์„ฑ๋Šฅ๋„ ์œ ์ง€๋˜์–ด ์ผ๋ฐ˜ํ™” ๋Šฅ๋ ฅ ๋ณด์กด

๐ŸŽฏ ์™œ ์ด๊ฒƒ์ด ๊ฒŒ์ž„ ์ฒด์ธ์ €์ธ๊ฐ€? : ์˜คํ”„๋ผ์ธ ์ •์  ํ•™์Šต โ†’ ๋ฐฐํฌ ํ›„์—๋„ ์ž๊ธฐ ๊ฒฝํ—˜์œผ๋กœ ์ง„ํ™”ํ•˜๋Š” ์˜จ๋ผ์ธ ํ•™์Šต ๋ฃจํ”„

๐ŸŽฎ "์นด๋ฉ”๋ผ ํฌ์ฆˆ ํ•˜๋‚˜๋กœ ๊ฒŒ์ž„ ์›”๋“œ์˜ 3D ์ผ๊ด€์„ฑ์„ ์žก๋‹ค"

WorldCam: Interactive Autoregressive 3D Gaming Worlds with Camera Pose as a Unifying Geometric Representation
๐Ÿ›๏ธ ์†Œ์†: KAIST
๐Ÿท๏ธ ํ•ต์‹ฌ ํ‚ค์›Œ๋“œ: World Model, Camera Pose, 3D Consistency

๐Ÿ’ญ ์ด๋Ÿฐ ์งˆ๋ฌธ์„ ํ•ด๋ณธ ์  ์žˆ๋‚˜์š”?

  • AI๊ฐ€ ์ƒ์„ฑํ•œ ๊ฒŒ์ž„ ์›”๋“œ๋ฅผ ์ž์œ ๋กญ๊ฒŒ ํƒํ—˜ํ•  ์ˆ˜ ์žˆ์„๊นŒ?

  • ์ด์ „์— ๋ฐฉ๋ฌธํ•œ ์žฅ์†Œ๋ฅผ ๋‹ค์‹œ ๊ฐ”์„ ๋•Œ ๋˜‘๊ฐ™์ด ๋ณด์ผ๊นŒ?

  • ์‚ฌ์šฉ์ž์˜ ์ •๋ฐ€ํ•œ ์•ก์…˜ ์ปจํŠธ๋กค์ด ๊ฐ€๋Šฅํ• ๊นŒ?

VR ๊ฒŒ์ž„์—์„œ ๋’ค๋Œ์•„๋ดค๋”๋‹ˆ ๋ฐฉ๊ธˆ ๋ณธ ๊ฑด๋ฌผ์ด ์‚ฌ๋ผ์ ธ ์žˆ๋‹ค๋ฉด? ๊ธฐ์กด ์›”๋“œ ๋ชจ๋ธ๋“ค์€ ์‚ฌ์šฉ์ž ์•ก์…˜์„ ์ถ”์ƒ์  ์‹ ํ˜ธ๋กœ ์ฒ˜๋ฆฌํ•ด ์ด๋Ÿฐ ๋ฌธ์ œ๊ฐ€ ๋นˆ๋ฒˆํ–ˆ์Šต๋‹ˆ๋‹ค. KAIST ์—ฐ๊ตฌ์ง„์€ ์นด๋ฉ”๋ผ ํฌ์ฆˆ๋ฅผ ๊ธฐํ•˜ํ•™์  ํ†ตํ•ฉ ํ‘œํ˜„์œผ๋กœ ์„ค์ •ํ•˜์—ฌ ์ฆ‰๊ฐ์  ์•ก์…˜ ์ œ์–ด์™€ ์žฅ๊ธฐ์  3D ์ผ๊ด€์„ฑ์„ ๋™์‹œ์— ํ•ด๊ฒฐํ–ˆ์Šต๋‹ˆ๋‹ค. 6-DoF ์นด๋ฉ”๋ผ ํฌ์ฆˆ๋ฅผ ๋ฆฌ ๋Œ€์ˆ˜(Lie algebra)๋กœ ํ‘œํ˜„ํ•˜๊ณ , ๊ธ€๋กœ๋ฒŒ ํฌ์ฆˆ๋ฅผ ๊ณต๊ฐ„ ์ธ๋ฑ์Šค๋กœ ํ™œ์šฉํ•˜์—ฌ ๊ณผ๊ฑฐ ๊ด€์ธก์„ ๊ธฐํ•˜ํ•™์ ์œผ๋กœ ์ผ๊ด€๋˜๊ฒŒ ์žฌ๋ฐฉ๋ฌธํ•ฉ๋‹ˆ๋‹ค.

ํŠนํžˆ ์ฃผ๋ชฉํ•  ์ :

  • 3,000๋ถ„ ๋ถ„๋Ÿ‰์˜ ์‹ค์ œ ๊ฒŒ์ž„ํ”Œ๋ ˆ์ด ๋ฐ์ดํ„ฐ์…‹ ๊ตฌ์ถ• (์นด๋ฉ”๋ผ ๊ถค์  + ํ…์ŠคํŠธ ์–ด๋…ธํ…Œ์ด์…˜)

  • ์•ก์…˜ ์ œ์–ด ๊ฐ€๋Šฅ์„ฑ, ์žฅ๊ธฐ ์‹œ๊ฐ ํ’ˆ์งˆ, 3D ๊ณต๊ฐ„ ์ผ๊ด€์„ฑ ๋ชจ๋‘์—์„œ SOTA ๋Œ€๋น„ ํฌ๊ฒŒ ์šฐ์ˆ˜

  • ๋ฌผ๋ฆฌ ๊ธฐ๋ฐ˜ ์—ฐ์† ์•ก์…˜ ๊ณต๊ฐ„์œผ๋กœ ์ •๋ฐ€ํ•œ 6-DoF ์ œ์–ด ๊ตฌํ˜„

๐ŸŽฏ ์™œ ์ด๊ฒƒ์ด ๊ฒŒ์ž„ ์ฒด์ธ์ €์ธ๊ฐ€? : ์ถ”์ƒ์  ์•ก์…˜ ์‹ ํ˜ธ ๊ธฐ๋ฐ˜ ์›”๋“œ ๋ชจ๋ธ โ†’ ์นด๋ฉ”๋ผ ํฌ์ฆˆ ๊ธฐ๋ฐ˜์˜ ๊ธฐํ•˜ํ•™์ ์œผ๋กœ ์ •ํ™•ํ•œ ์ธํ„ฐ๋ž™ํ‹ฐ๋ธŒ 3D ์›”๋“œ

๐Ÿ—บ๏ธ "3D ํŒจ์น˜๋ฅผ ๋ชจ์ž์ดํฌ์ฒ˜๋Ÿผ ๋ถ™์—ฌ ์›”๋“œ ์‹œ๋ฎฌ๋ ˆ์ดํ„ฐ์˜ ๊ธฐ์–ต๋ ฅ์„ ์™„์„ฑํ•˜๋‹ค"

MosaicMem: Hybrid Spatial Memory for Controllable Video World Models
๐Ÿ›๏ธ ์†Œ์†: Georgia Tech
๐Ÿท๏ธ ํ•ต์‹ฌ ํ‚ค์›Œ๋“œ: Spatial Memory, Video World Model, Hybrid 3D Memory

๐Ÿ’ญ ์ด๋Ÿฐ ์งˆ๋ฌธ์„ ํ•ด๋ณธ ์  ์žˆ๋‚˜์š”?

  • ๋น„๋””์˜ค ์›”๋“œ ๋ชจ๋ธ์ด ์นด๋ฉ”๋ผ๋ฅผ ๋Œ๋ ค๋„ ์žฅ๋ฉด์„ ๊ธฐ์–ตํ•  ์ˆ˜ ์žˆ์„๊นŒ?

  • ๋ช…์‹œ์  3D์™€ ์•”๋ฌต์  ๋ฉ”๋ชจ๋ฆฌ์˜ ์žฅ๋‹จ์ ์„ ๋™์‹œ์— ๊ฐ€์ ธ์˜ฌ ๋ฐฉ๋ฒ•์€?

  • ๋ถ„ ๋‹จ์œ„์˜ ๊ธด ํƒ์ƒ‰์—์„œ๋„ ์ผ๊ด€์„ฑ์„ ์œ ์ง€ํ•  ์ˆ˜ ์žˆ์„๊นŒ?

ํผ์ฆ ์กฐ๊ฐ์„ ๋งž์ถ”๋“ฏ, MosaicMem์€ ์˜์ƒ ํŒจ์น˜๋ฅผ 3D๋กœ ๋“ค์–ด์˜ฌ๋ ค ์ •ํ™•ํ•œ ์œ„์น˜ ์ถ”์ ๊ณผ ํƒ€๊ฒŸ ๊ฒ€์ƒ‰์„ ์ˆ˜ํ–‰ํ•˜๋ฉด์„œ๋„, ๋ชจ๋ธ ๊ณ ์œ ์˜ ์ปจ๋””์…”๋‹์„ ํ™œ์šฉํ•ด ํ”„๋กฌํ”„ํŠธ ๋”ฐ๋ฅด๊ธฐ ๋Šฅ๋ ฅ์„ ๋ณด์กดํ•ฉ๋‹ˆ๋‹ค. ์ฟผ๋ฆฌ๋œ ๋ทฐ์—์„œ ๊ณต๊ฐ„ ์ •๋ ฌ๋œ ํŒจ์น˜๋ฅผ ํ•ฉ์„ฑํ•˜๊ณ , ๋ณ€ํ•ด์•ผ ํ•  ๋ถ€๋ถ„์€ ๋ชจ๋ธ์ด ์ธํŽ˜์ธํŒ…ํ•˜๋Š” patch-and-compose ๋ฐฉ์‹์ด ํ•ต์‹ฌ์ž…๋‹ˆ๋‹ค.

ํŠนํžˆ ์ฃผ๋ชฉํ•  ์ :

  • ์•”๋ฌต์  ๋ฉ”๋ชจ๋ฆฌ ๋Œ€๋น„ ํฌ์ฆˆ ์ค€์ˆ˜๋ ฅ ํ–ฅ์ƒ, ๋ช…์‹œ์  ๋ฒ ์ด์Šค๋ผ์ธ ๋Œ€๋น„ ๋™์  ๋ชจ๋ธ๋ง ๊ฐ•ํ™”

  • ๋ถ„ ๋‹จ์œ„ ๋‚ด๋น„๊ฒŒ์ด์…˜, ๋ฉ”๋ชจ๋ฆฌ ๊ธฐ๋ฐ˜ ์”ฌ ํŽธ์ง‘, ์˜คํ† ๋ฆฌ๊ทธ๋ ˆ์‹œ๋ธŒ ๋กค์•„์›ƒ๊นŒ์ง€ ์ง€์›

  • PRoPE ์นด๋ฉ”๋ผ ์ปจ๋””์…”๋‹๊ณผ 2๊ฐ€์ง€ ์ƒˆ๋กœ์šด ๋ฉ”๋ชจ๋ฆฌ ์ •๋ ฌ ๊ธฐ๋ฒ• ๋„์ž…

๐ŸŽฏ ์™œ ์ด๊ฒƒ์ด ๊ฒŒ์ž„ ์ฒด์ธ์ €์ธ๊ฐ€? : ๋ช…์‹œ์  3D vs ์•”๋ฌต์  ๋ฉ”๋ชจ๋ฆฌ ํƒ์ผ โ†’ ํ•˜์ด๋ธŒ๋ฆฌ๋“œ ๊ณต๊ฐ„ ๋ฉ”๋ชจ๋ฆฌ๋กœ ๋‘ ๊ฐ€์ง€ ์žฅ์ ์„ ๋™์‹œ ํ™•๋ณด

๐Ÿค– "๋ง๋งŒ ํ•˜๋ฉด ์Šค์Šค๋กœ ์ง„ํ™”ํ•˜๋Š” AI ์—์ด์ „ํŠธ"

MetaClaw: Just Talk -- An Agent That Meta-Learns and Evolves in the Wild
๐Ÿ›๏ธ ์†Œ์†: UCSC, UNC
๐Ÿท๏ธ ํ•ต์‹ฌ ํ‚ค์›Œ๋“œ: Meta-Learning, Continual Learning, LLM Agent

๐Ÿ’ญ ์ด๋Ÿฐ ์งˆ๋ฌธ์„ ํ•ด๋ณธ ์  ์žˆ๋‚˜์š”?

  • ๋ฐฐํฌ๋œ AI ์—์ด์ „ํŠธ๊ฐ€ ์‚ฌ์šฉ์ž ๋‹ˆ์ฆˆ ๋ณ€ํ™”์— ์Šค์Šค๋กœ ์ ์‘ํ•  ์ˆ˜ ์žˆ์„๊นŒ?

  • ๋‹ค์šดํƒ€์ž„ ์—†์ด ์—์ด์ „ํŠธ ๋Šฅ๋ ฅ์„ ์—…๊ทธ๋ ˆ์ด๋“œํ•  ๋ฐฉ๋ฒ•์€?

  • ์Šคํ‚ฌ ๋ผ์ด๋ธŒ๋Ÿฌ๋ฆฌ์™€ ๊ธฐ๋ณธ ์ •์ฑ…์„ ๋™์‹œ์— ์ง„ํ™”์‹œํ‚ฌ ์ˆ˜ ์žˆ์„๊นŒ?

์ž๋™์ฐจ์˜ ์†Œํ”„ํŠธ์›จ์–ด ์—…๋ฐ์ดํŠธ๊ฐ€ ์ฃผํ–‰ ์ค‘์— ์ด๋ฃจ์–ด์ง„๋‹ค๊ณ  ์ƒ์ƒํ•ด๋ณด์„ธ์š”. MetaClaw๊ฐ€ ๋ฐ”๋กœ ๊ทธ ๊ฐœ๋…์ž…๋‹ˆ๋‹ค. ์‹คํŒจ ๊ฒฝํ—˜์—์„œ ์ƒˆ๋กœ์šด ์Šคํ‚ฌ์„ ํ•ฉ์„ฑํ•˜์—ฌ ์ฆ‰๊ฐ์  ๊ฐœ์„ (๋‹ค์šดํƒ€์ž„ ์ œ๋กœ)์„ ๋‹ฌ์„ฑํ•˜๊ณ , ์‚ฌ์šฉ์ž ๋น„ํ™œ์„ฑ ์‹œ๊ฐ„์— RL-PRM ๊ธฐ๋ฐ˜ ์ •์ฑ… ์ตœ์ ํ™”๋ฅผ ์ˆ˜ํ–‰ํ•ฉ๋‹ˆ๋‹ค. ๋‘ ๋ฉ”์ปค๋‹ˆ์ฆ˜์ด ์ƒํ˜ธ ๊ฐ•ํ™”๋˜์–ด ์—์ด์ „ํŠธ๊ฐ€ ์ง€์†์ ์œผ๋กœ ๋ฐœ์ „ํ•ฉ๋‹ˆ๋‹ค.

ํŠนํžˆ ์ฃผ๋ชฉํ•  ์ :

  • ์Šคํ‚ฌ ๊ธฐ๋ฐ˜ ๋น ๋ฅธ ์ ์‘์œผ๋กœ ์ •ํ™•๋„ ์ตœ๋Œ€ 32% ์ƒ๋Œ€ ํ–ฅ์ƒ

  • Kimi-K2.5 ์ •ํ™•๋„ 21.4% โ†’ 40.6%๋กœ ๊ฐœ์„ , ๋ณตํ•ฉ ๊ฐ•๊ฑด์„ฑ 18.3% ์ฆ๊ฐ€

  • ํ”„๋ก์‹œ ๊ธฐ๋ฐ˜ ์•„ํ‚คํ…์ฒ˜๋กœ ๋กœ์ปฌ GPU ์—†์ด๋„ ๋Œ€ํ˜• LLM ์Šค์ผ€์ผ๋ง ๊ฐ€๋Šฅ

๐ŸŽฏ ์™œ ์ด๊ฒƒ์ด ๊ฒŒ์ž„ ์ฒด์ธ์ €์ธ๊ฐ€? : ์ •์ ์œผ๋กœ ๋ฐฐํฌ๋˜๋Š” ์—์ด์ „ํŠธ โ†’ ์‹ค์ „์—์„œ ์Šคํ‚ฌ๊ณผ ์ •์ฑ…์ด ๊ณต์ง„ํ™”ํ•˜๋Š” ๋ฉ”ํƒ€๋Ÿฌ๋‹ ์—์ด์ „ํŠธ

โšก "ํ‚คํ”„๋ ˆ์ž„ ๋ช‡ ์žฅ์ด๋ฉด ์˜์ƒ ์ „์ฒด๊ฐ€ ๊ณ ํ™”์งˆ๋กœ โ€” Google์˜ ์ธํ„ฐ๋ž™ํ‹ฐ๋ธŒ ์ดˆํ•ด์ƒ๋„"

SparkVSR: Interactive Video Super-Resolution via Sparse Keyframe Propagation
๐Ÿ›๏ธ ์†Œ์†: Google
๐Ÿท๏ธ ํ•ต์‹ฌ ํ‚ค์›Œ๋“œ: Video Super-Resolution, Keyframe Propagation, Interactive Editing

๐Ÿ’ญ ์ด๋Ÿฐ ์งˆ๋ฌธ์„ ํ•ด๋ณธ ์  ์žˆ๋‚˜์š”?

  • ์˜์ƒ ์ดˆํ•ด์ƒ๋„์—์„œ ์›์น˜ ์•Š๋Š” ์•„ํ‹ฐํŒฉํŠธ๋ฅผ ์‚ฌ์šฉ์ž๊ฐ€ ์ง์ ‘ ์ˆ˜์ •ํ•  ์ˆ˜ ์žˆ์„๊นŒ?

  • ๋ชจ๋“  ํ”„๋ ˆ์ž„์ด ์•„๋‹Œ ํ•ต์‹ฌ ํ”„๋ ˆ์ž„๋งŒ ์ฒ˜๋ฆฌํ•ด๋„ ๋ ๊นŒ?

  • ์˜›๋‚  ์˜ํ™” ๋ณต์›์ด๋‚˜ ์Šคํƒ€์ผ ๋ณ€ํ™˜์—๋„ ๊ฐ™์€ ๋ชจ๋ธ์„ ์“ธ ์ˆ˜ ์žˆ์„๊นŒ?

์‚ฌ์ง„ ํŽธ์ง‘์—์„œ 'ํฌ์ธํŠธ' ๋ช‡ ๊ฐœ๋งŒ ์ฐ์œผ๋ฉด ์ „์ฒด ์ด๋ฏธ์ง€๊ฐ€ ๋ณ€ํ•˜๋Š” ๊ฒƒ์ฒ˜๋Ÿผ, SparkVSR์€ ์†Œ์ˆ˜์˜ ํ‚คํ”„๋ ˆ์ž„๋งŒ ์ดˆํ•ด์ƒ๋„๋กœ ์ฒ˜๋ฆฌํ•œ ๋’ค ๊ทธ ์ •๋ณด๋ฅผ ์ „์ฒด ์˜์ƒ์— ์ „ํŒŒํ•ฉ๋‹ˆ๋‹ค. ๊ธฐ์กด VSR์ด ๋ธ”๋ž™๋ฐ•์Šค์ฒ˜๋Ÿผ ๊ฒฐ๊ณผ๋ฅผ ๋ฐ›์•„๋“ค์—ฌ์•ผ ํ–ˆ๋‹ค๋ฉด, ์ด ์‹œ์Šคํ…œ์€ ํ‚คํ”„๋ ˆ์ž„ ์„ ํƒ๊ณผ ๊ฐ€์ด๋˜์Šค ์กฐ์ ˆ์„ ํ†ตํ•ด ์‚ฌ์šฉ์ž ์ œ์–ด๋ฅผ ๊ฐ€๋Šฅํ•˜๊ฒŒ ํ•ฉ๋‹ˆ๋‹ค.

ํŠนํžˆ ์ฃผ๋ชฉํ•  ์ :

  • CLIP-IQA 24.6%, DOVER 21.8%, MUSIQ 5.6% ๋ฒ ์ด์Šค๋ผ์ธ ๋Œ€๋น„ ํ–ฅ์ƒ

  • ๋ ˆํผ๋Ÿฐ์Šค ํ‚คํ”„๋ ˆ์ž„์ด ์—†๊ฑฐ๋‚˜ ๋ถˆ์™„์ „ํ•ด๋„ ๊ฐ•๊ฑดํ•˜๊ฒŒ ์ž‘๋™ํ•˜๋Š” ๊ฐ€์ด๋˜์Šค ๋ฉ”์ปค๋‹ˆ์ฆ˜

  • ํ•™์Šต ์—†์ด old-film restoration, video style transfer์— ์ฆ‰์‹œ ์ ์šฉ ๊ฐ€๋Šฅ

๐ŸŽฏ ์™œ ์ด๊ฒƒ์ด ๊ฒŒ์ž„ ์ฒด์ธ์ €์ธ๊ฐ€? : ๋ธ”๋ž™๋ฐ•์Šค VSR โ†’ ํ‚คํ”„๋ ˆ์ž„ ๊ธฐ๋ฐ˜ ์ธํ„ฐ๋ž™ํ‹ฐ๋ธŒ ์ œ์–ด๋กœ ์‚ฌ์šฉ์ž๊ฐ€ ๊ฒฐ๊ณผ๋ฅผ ์ฃผ๋„ํ•˜๋Š” ์ดˆํ•ด์ƒ๋„

๐Ÿ‘๏ธ "์Šคํ…Œ๋ ˆ์˜ค ๋น„๋””์˜ค๋ฅผ ํ•œ ๋ฒˆ์— ์ƒ์„ฑ โ€” Tencent์˜ VR ๋ Œ๋”๋ง ํ˜๋ช…"

Stereo World Model: Camera-Guided Stereo Video Generation
๐Ÿ›๏ธ ์†Œ์†: Tencent, Meituan, HKU
๐Ÿท๏ธ ํ•ต์‹ฌ ํ‚ค์›Œ๋“œ: Stereo Video, Binocular Generation, VR Rendering

๐Ÿ’ญ ์ด๋Ÿฐ ์งˆ๋ฌธ์„ ํ•ด๋ณธ ์  ์žˆ๋‚˜์š”?

  • VR ์ฝ˜ํ…์ธ ๋ฅผ ์œ„ํ•ด ์–‘์•ˆ ์Šคํ…Œ๋ ˆ์˜ค ์˜์ƒ์„ ์ž๋™ ์ƒ์„ฑํ•  ์ˆ˜ ์žˆ์„๊นŒ?

  • ๋ชจ๋…ธ RGB ์˜์ƒ์—์„œ ๊นŠ์ด ์ถ”์ • ์—†์ด 3D๋ฅผ ๋งŒ๋“ค ์ˆ˜ ์žˆ์„๊นŒ?

  • ๊ธฐ์กด ๋‹จ์•ˆ ๋ชจ๋ธ ํŒŒ์ดํ”„๋ผ์ธ์˜ ์†๋„ ๋ณ‘๋ชฉ์„ ๊นฐ ์ˆ˜ ์žˆ์„๊นŒ?

3D ์˜ํ™”๋ฅผ ๋งŒ๋“ค๋ ค๋ฉด ๋ณดํ†ต ํ•œ์ชฝ ๋ˆˆ ์˜์ƒ์„ ๋จผ์ € ๋งŒ๋“  ๋’ค ๊นŠ์ด ์ถ”์ •โ†’์ธํŽ˜์ธํŒ…์œผ๋กœ ๋‹ค๋ฅธ ์ชฝ์„ ํ•ฉ์„ฑํ•ฉ๋‹ˆ๋‹ค. StereoWorld๋Š” ์ด ๋ฒˆ๊ฑฐ๋กœ์šด ๊ณผ์ •์„ ๊ฑด๋„ˆ๋›ฐ๊ณ , ์–‘์•ˆ ์˜์ƒ์„ End-to-End๋กœ ๋™์‹œ์— ์ƒ์„ฑํ•ฉ๋‹ˆ๋‹ค. ์นด๋ฉ”๋ผ ์ธ์‹ RoPE์™€ ์—ํ”ผํด๋ผ prior๋ฅผ ํ™œ์šฉํ•œ ์Šคํ…Œ๋ ˆ์˜ค ์–ดํ…์…˜ ๋ถ„ํ•ด๊ฐ€ ํ•ต์‹ฌ ์„ค๊ณ„์ž…๋‹ˆ๋‹ค.

ํŠนํžˆ ์ฃผ๋ชฉํ•  ์ :

  • ๊ธฐ์กด ๋‹จ์•ˆโ†’๋ณ€ํ™˜ ํŒŒ์ดํ”„๋ผ์ธ ๋Œ€๋น„ 3๋ฐฐ ๋น ๋ฅธ ์ƒ์„ฑ ์†๋„

  • ๋ทฐํฌ์ธํŠธ ์ผ๊ด€์„ฑ 5% ์ถ”๊ฐ€ ํ–ฅ์ƒ

  • ๋ณ„๋„ ๊นŠ์ด ์ถ”์ •์ด๋‚˜ ์ธํŽ˜์ธํŒ… ์—†์ด End-to-End VR ๋ Œ๋”๋ง ๊ฐ€๋Šฅ

๐ŸŽฏ ์™œ ์ด๊ฒƒ์ด ๊ฒŒ์ž„ ์ฒด์ธ์ €์ธ๊ฐ€? : ๋‹จ์•ˆ ์ƒ์„ฑ โ†’ ๊นŠ์ด ์ถ”์ • โ†’ ์ธํŽ˜์ธํŒ…์˜ ๋‹ค๋‹จ๊ณ„ ํŒŒ์ดํ”„๋ผ์ธ โ†’ ์–‘์•ˆ ๋™์‹œ ์ƒ์„ฑ์œผ๋กœ ๋‹จ์ผ ์Šคํ… VR ์˜์ƒ ์ œ์ž‘

๐Ÿงฉ "๋‡Œ๊ณผํ•™์—์„œ ํžŒํŠธ๋ฅผ ์–ป๋‹ค โ€” Alibaba์˜ ๊ฒฝํ—˜ ๊ธฐ๋ฐ˜ ๊ฐ•ํ™”ํ•™์Šต"

Complementary Reinforcement Learning
๐Ÿ›๏ธ ์†Œ์†: Alibaba
๐Ÿท๏ธ ํ•ต์‹ฌ ํ‚ค์›Œ๋“œ: Reinforcement Learning, Experience Learning, Complementary Learning Systems

๐Ÿ’ญ ์ด๋Ÿฐ ์งˆ๋ฌธ์„ ํ•ด๋ณธ ์  ์žˆ๋‚˜์š”?

  • RL ์—์ด์ „ํŠธ์˜ ๋‚ฎ์€ ์ƒ˜ํ”Œ ํšจ์œจ์„ฑ์„ ์–ด๋–ป๊ฒŒ ํ•ด๊ฒฐํ•  ์ˆ˜ ์žˆ์„๊นŒ?

  • ๊ณผ๊ฑฐ ์—ํ”ผ์†Œ๋“œ ๊ฒฝํ—˜์„ ํ˜„์žฌ ํ•™์Šต์— ํšจ๊ณผ์ ์œผ๋กœ ๋ฐ˜์˜ํ•˜๋Š” ๋ฐฉ๋ฒ•์€?

  • ๊ฒฝํ—˜๊ณผ ์ •์ฑ…์ด ์„œ๋กœ ๋”ฐ๋กœ ๋†€์ง€ ์•Š๊ฒŒ ํ•  ์ˆ˜ ์žˆ์„๊นŒ?

์ธ๊ฐ„์˜ ๋‡Œ์—๋Š” ํ•ด๋งˆ(๋น ๋ฅธ ํ•™์Šต)์™€ ์‹ ํ”ผ์งˆ(๋А๋ฆฐ ํ†ตํ•ฉ)์ด ์ƒ๋ณด์ ์œผ๋กœ ์ž‘๋™ํ•˜๋Š” ํ•™์Šต ์‹œ์Šคํ…œ์ด ์žˆ์Šต๋‹ˆ๋‹ค. Alibaba์˜ Complementary RL์€ ์ด ์›๋ฆฌ๋ฅผ ์ฐจ์šฉํ•ด ๊ฒฝํ—˜ ์ถ”์ถœ๊ธฐ์™€ ์ •์ฑ… ์•กํ„ฐ๊ฐ€ RL ๋ฃจํ”„ ์•ˆ์—์„œ ํ•จ๊ป˜ ์ง„ํ™”ํ•ฉ๋‹ˆ๋‹ค. ์ถ”์ถœ๋œ ๊ฒฝํ—˜์ด ์•กํ„ฐ์˜ ์„ฑ๊ณต์— ๊ธฐ์—ฌํ•˜๋Š”์ง€ ์—ฌ๋ถ€์— ๋”ฐ๋ผ ๊ฒฝํ—˜ ๊ด€๋ฆฌ ์ „๋žต ์ž์ฒด๊ฐ€ ์ตœ์ ํ™”๋ฉ๋‹ˆ๋‹ค.

ํŠนํžˆ ์ฃผ๋ชฉํ•  ์ :

  • ๋‹จ์ผ ์ž‘์—… ์‹œ๋‚˜๋ฆฌ์˜ค์—์„œ ๊ฒฝํ—˜ ๋ฏธํ™œ์šฉ RL ๋Œ€๋น„ 10% ์„ฑ๋Šฅ ํ–ฅ์ƒ

  • ๋ฉ€ํ‹ฐํƒœ์Šคํฌ ํ™˜๊ฒฝ์—์„œ๋„ ๊ฐ•๊ฑดํ•œ ํ™•์žฅ์„ฑ ํ™•์ธ

  • ๊ฒฝํ—˜ ์ถ”์ถœ๊ธฐ-์•กํ„ฐ ๊ณต์ง„ํ™”๋กœ '๊ฒฝํ—˜-์ •์ฑ… ๋ถˆ์ผ์น˜' ๋ฌธ์ œ ๊ทผ๋ณธ ํ•ด๊ฒฐ

๐ŸŽฏ ์™œ ์ด๊ฒƒ์ด ๊ฒŒ์ž„ ์ฒด์ธ์ €์ธ๊ฐ€? : ์ •์  ๊ฒฝํ—˜ ์ €์žฅ or ์ •์ฑ…๊ณผ ๋ฌด๊ด€ํ•œ ๊ฒฝํ—˜ โ†’ ๊ฒฝํ—˜๊ณผ ์ •์ฑ…์ด ์‹ค์‹œ๊ฐ„์œผ๋กœ ๊ณต์ง„ํ™”ํ•˜๋Š” ์ƒ๋ณด์  ํ•™์Šต

๐ŸŒ "1,600๊ฐœ ์–ธ์–ด๋ฅผ ๋ฒˆ์—ญํ•˜๋‹ค โ€” Meta์˜ ์ดˆ๋‹ค๊ตญ์–ด ๊ธฐ๊ณ„๋ฒˆ์—ญ"

Omnilingual MT: Machine Translation for 1,600 Languages
๐Ÿ›๏ธ ์†Œ์†: Meta
๐Ÿท๏ธ ํ•ต์‹ฌ ํ‚ค์›Œ๋“œ: Machine Translation, Multilingual, Low-Resource Languages

๐Ÿ’ญ ์ด๋Ÿฐ ์งˆ๋ฌธ์„ ํ•ด๋ณธ ์  ์žˆ๋‚˜์š”?

  • ์„ธ๊ณ„ 7,000๊ฐœ ์–ธ์–ด ์ค‘ AI๊ฐ€ ๋ฒˆ์—ญํ•  ์ˆ˜ ์žˆ๋Š” ๊ฑด ์–ผ๋งˆ๋‚˜ ๋ ๊นŒ?

  • ๋ฐ์ดํ„ฐ๊ฐ€ ๊ฑฐ์˜ ์—†๋Š” ์–ธ์–ด๋„ ๊ณ ํ’ˆ์งˆ ๋ฒˆ์—ญ์ด ๊ฐ€๋Šฅํ• ๊นŒ?

  • 70B ๋ชจ๋ธ ์—†์ด๋„ ๊ฐ•๋ ฅํ•œ ๋‹ค๊ตญ์–ด ๋ฒˆ์—ญ์„ ํ•  ์ˆ˜ ์žˆ์„๊นŒ?

๋ฐ”๋ฒจํƒ‘ ์ดํ›„ ์ธ๋ฅ˜์˜ ์ˆ™์›์ด์—ˆ๋˜ ๋ณดํŽธ ๋ฒˆ์—ญ. Meta๊ฐ€ ๊ทธ ๊ฟˆ์— ํ•œ ๋ฐœ ๋” ๋‹ค๊ฐ€๊ฐ”์Šต๋‹ˆ๋‹ค. Omnilingual MT๋Š” ์ตœ์ดˆ๋กœ 1,600๊ฐœ ์ด์ƒ ์–ธ์–ด๋ฅผ ์ง€์›ํ•˜๋Š” ๋ฒˆ์—ญ ์‹œ์Šคํ…œ์ž…๋‹ˆ๋‹ค. ๋Œ€๊ทœ๋ชจ ๊ณต๊ฐœ ์ฝ”ํผ์Šค์™€ ์ˆ˜์ž‘์—… ํ๋ ˆ์ด์…˜๋œ MeDLEY ๋ณ‘๋ ฌ ํ…์ŠคํŠธ๋ฅผ ํ†ตํ•ฉํ•˜๊ณ , LLM์„ ๋””์ฝ”๋” ์ „์šฉ(OMT-LLaMA) ๋˜๋Š” ์ธ์ฝ”๋”-๋””์ฝ”๋”(OMT-NLLB) ๋ฐฉ์‹์œผ๋กœ ํŠนํ™”์‹œ์ผฐ์Šต๋‹ˆ๋‹ค.

ํŠนํžˆ ์ฃผ๋ชฉํ•  ์ :

  • 1B~8B ํŒŒ๋ผ๋ฏธํ„ฐ ๋ชจ๋ธ์ด 70B LLM ๋ฒ ์ด์Šค๋ผ์ธ๊ณผ ๋™๋“ฑํ•˜๊ฑฐ๋‚˜ ์ƒํšŒํ•˜๋Š” ๋ฒˆ์—ญ ํ’ˆ์งˆ

  • ๊ธฐ์กด ๋ชจ๋ธ์ด '์ดํ•ด'๋Š” ํ•˜์ง€๋งŒ '์ƒ์„ฑ'์— ์‹คํŒจํ•˜๋˜ ์ €์ž์› ์–ธ์–ด์—์„œ ์ผ๊ด€๋œ ์ƒ์„ฑ ๋‹ฌ์„ฑ

  • BOUQuET, Met-BOUQuET ๋“ฑ ์ธ๊ฐ„ ์ƒ์„ฑ ํ‰๊ฐ€ ๋ฐ์ดํ„ฐ์…‹ ๊ณต๊ฐœ

๐ŸŽฏ ์™œ ์ด๊ฒƒ์ด ๊ฒŒ์ž„ ์ฒด์ธ์ €์ธ๊ฐ€? : ~200๊ฐœ ์–ธ์–ด ํƒ€๊ฒŸ ๋ฒˆ์—ญ์˜ ํ•œ๊ณ„ โ†’ 1,600๊ฐœ ์–ธ์–ด๋กœ ํ™•์žฅ, ์ €์ž์› ์–ธ์–ด์˜ '์ƒ์„ฑ ์žฅ๋ฒฝ' ๋ŒํŒŒ

๐Ÿ’ฌ "AI๊ฐ€ ๋‹น์‹ ์„ ์ง„์งœ๋กœ ๊ธฐ์–ตํ•˜๋Š” ๋Œ€ํ™” โ€” Tencent ร— ์นญํ™”์˜ ์ ์‘ํ˜• ๋ฉ”๋ชจ๋ฆฌ"

AdaMem: Adaptive User-Centric Memory for Long-Horizon Dialogue Agents
๐Ÿ›๏ธ ์†Œ์†: Tencent, Tsinghua
๐Ÿท๏ธ ํ•ต์‹ฌ ํ‚ค์›Œ๋“œ: Dialogue Memory, User Modeling, Adaptive Retrieval

๐Ÿ’ญ ์ด๋Ÿฐ ์งˆ๋ฌธ์„ ํ•ด๋ณธ ์  ์žˆ๋‚˜์š”?

  • AI ์ฑ—๋ด‡์ด ํ•œ ๋‹ฌ ์ „ ๋Œ€ํ™” ๋‚ด์šฉ์„ ์ •ํ™•ํžˆ ๊ธฐ์–ตํ•  ์ˆ˜ ์žˆ์„๊นŒ?

  • ์˜๋ฏธ์  ์œ ์‚ฌ์„ฑ๋งŒ์œผ๋กœ ์ถฉ๋ถ„ํ•œ ์ •๋ณด๋ฅผ ๊ฒ€์ƒ‰ํ•  ์ˆ˜ ์žˆ์„๊นŒ?

  • ์‚ฌ์šฉ์ž์˜ ์„ฑ๊ฒฉ๊ณผ ์Šต๊ด€๊นŒ์ง€ ํŒŒ์•…ํ•˜๋Š” ๋ฉ”๋ชจ๋ฆฌ ์‹œ์Šคํ…œ์ด ๊ฐ€๋Šฅํ• ๊นŒ?

์˜ค๋ž˜๋œ ์นœ๊ตฌ์™€ ๋Œ€ํ™”ํ•  ๋•Œ ์šฐ๋ฆฌ๋Š” ์ตœ๊ทผ ์ด์•ผ๊ธฐ, ๊ณผ๊ฑฐ ์—ํ”ผ์†Œ๋“œ, ์ƒ๋Œ€์˜ ์„ฑ๊ฒฉ์„ ์ž์—ฐ์Šค๋Ÿฝ๊ฒŒ ์˜ค๊ฐ€๋ฉฐ ๊ธฐ์–ต์„ ํ™œ์šฉํ•ฉ๋‹ˆ๋‹ค. AdaMem์€ ์ด ์ธ๊ฐ„์  ๊ธฐ์–ต ๊ตฌ์กฐ๋ฅผ ์ž‘์—… ๋ฉ”๋ชจ๋ฆฌ, ์—ํ”ผ์†Œ๋“œ ๋ฉ”๋ชจ๋ฆฌ, ํŽ˜๋ฅด์†Œ๋‚˜ ๋ฉ”๋ชจ๋ฆฌ, ๊ทธ๋ž˜ํ”„ ๋ฉ”๋ชจ๋ฆฌ์˜ 4๊ฐ€์ง€๋กœ ์ฒด๊ณ„ํ™”ํ–ˆ์Šต๋‹ˆ๋‹ค. ์งˆ๋ฌธ์— ๋”ฐ๋ผ ์˜๋ฏธ ๊ฒ€์ƒ‰๊ณผ ๊ด€๊ณ„ ์ธ์‹ ๊ทธ๋ž˜ํ”„ ํ™•์žฅ์„ ๋™์ ์œผ๋กœ ์กฐํ•ฉํ•˜๋Š” ์ ์‘ํ˜• ๊ฒ€์ƒ‰ ๋ผ์šฐํŒ…์ด ํ•ต์‹ฌ์ž…๋‹ˆ๋‹ค.

ํŠนํžˆ ์ฃผ๋ชฉํ•  ์ :

  • LoCoMo ๋ฐ PERSONAMEM ๋ฒค์น˜๋งˆํฌ ๋ชจ๋‘์—์„œ SOTA ๋‹ฌ์„ฑ

  • ์—ญํ•  ์ „๋ฌธํ™” ํŒŒ์ดํ”„๋ผ์ธ์œผ๋กœ ์ฆ๊ฑฐ ํ•ฉ์„ฑ๊ณผ ์‘๋‹ต ์ƒ์„ฑ์„ ๋ถ„๋ฆฌ

  • ์ •์  ๋ฉ”๋ชจ๋ฆฌ ์„ธ๋ถ„ํ™”๊ฐ€ ์•„๋‹Œ ์งˆ๋ฌธ ์กฐ๊ฑด๋ถ€ ์ ์‘ํ˜• ๊ฒ€์ƒ‰ ๊ฒฝ๋กœ ๊ตฌ์ถ•

๐ŸŽฏ ์™œ ์ด๊ฒƒ์ด ๊ฒŒ์ž„ ์ฒด์ธ์ €์ธ๊ฐ€? : ์˜๋ฏธ ์œ ์‚ฌ์„ฑ ๊ธฐ๋ฐ˜ ๋‹จ์ผ ๋ฉ”๋ชจ๋ฆฌ โ†’ 4๊ฐ€์ง€ ๋ฉ”๋ชจ๋ฆฌ + ์งˆ๋ฌธ ๋งž์ถคํ˜• ์ ์‘์  ๊ฒ€์ƒ‰์œผ๋กœ ์ง„์ •ํ•œ ์‚ฌ์šฉ์ž ์ดํ•ด

๋งค์ผ ๋ชฉ์š”์ผ ์˜ค์ „ 8์‹œ,
๋ฐ”์œ ๋‹น์‹ ์„ ๊ธฐ์ˆ  ๋ฐœ์ „์— ๋’ค์ณ์ง€์ง€ ์•Š๊ฒŒ ๋งŒ๋“ค์–ด์ค„
์ตœ์‹  AI ํŠธ๋ Œ๋“œ ์š”์•ฝ๋ณธ์ด ์ „๋‹ฌ๋ฉ๋‹ˆ๋‹ค! ๐Ÿš€