๋ชฉ๋ก
Vol.322026.04.22

๐Ÿ“‘OpenAI: โ€œแ„‹แ…ฉแ„ƒแ…กแ†ธแ„‹แ…ณแ„…แ…ฉ แ„’แ…ฎแ†ซแ„…แ…งแ†ซแ„‰แ…ตแ„แ…งแ†ปแ„‚แ…ณแ†ซแ„ƒแ…ฆ แ„Žแ…ฎแ„…แ…ฉแ†ซแ„‹แ…ต แ„ƒแ…ฌแ†ซแ„ƒแ…กแ„€แ…ฉ?โ€

26.04. 4แ„Œแ…ฎแ„Žแ…ก | Microsoft, Alibaba, OpenAI, Amazon, NVIDIA

2,311๋ช… ์ˆ˜์‹ ์˜คํ”ˆ์œจ 52.10%ํด๋ฆญ๋ฅ  7.72%

๐Ÿ“‘OpenAI: โ€œแ„‹แ…ฉแ„ƒแ…กแ†ธแ„‹แ…ณแ„…แ…ฉ แ„’แ…ฎแ†ซแ„…แ…งแ†ซแ„‰แ…ตแ„แ…งแ†ปแ„‚แ…ณแ†ซแ„ƒแ…ฆ แ„Žแ…ฎแ„…แ…ฉแ†ซแ„‹แ…ต แ„ƒแ…ฌแ†ซแ„ƒแ…กแ„€แ…ฉ?โ€

26.04. 4แ„Œแ…ฎแ„Žแ…ก | Microsoft, Alibaba, OpenAI, Amazon, NVIDIA

๊ธˆ์ฃผ ์บ์น˜ํŽ˜์ดํผ๋Š” Microsoft, Alibaba, OpenAI, Amazon, NVIDIA์™€ ํ•จ๊ป˜ํ•ฉ๋‹ˆ๋‹ค. 3๋ถ„๋งŒ ํˆฌ์žํ•ด ์“ฑ ๋‘˜๋Ÿฌ๋ณด๊ณ , ๋น ๋ฅด๊ฒŒ ๋ฐ”๋€Œ๋Š” ๊ธฐ์ˆ ์˜ ๋ฐฉํ–ฅ์„ฑ์„ ๋†“์น˜์ง€ ๋งˆ์„ธ์š”!

๐Ÿ“ˆ ์ตœ์‹  AI ํŠธ๋ Œ๋“œ 3์ค„ ์š”์•ฝ

๐ŸŒŸ ์—์ด์ „ํŠธ ์ž์œจ ์ง„ํ™” โ€” MCP ํ™˜๊ฒฝ ์ž๋™ ํ•ฉ์„ฑ๋ถ€ํ„ฐ ์—์ด์ „ํŠธ ๊ฐ„ ํ˜‘๋ ฅ๊นŒ์ง€, ์ž์ƒ ์ƒํƒœ๊ณ„๊ฐ€ ์—ด๋ฆฐ๋‹ค

๐Ÿ”ฅ ๋น„๋””์˜คยท3D ์›”๋“œ ๋ชจ๋ธ ํญ๋ฐœ โ€” ๋ฉ€ํ‹ฐ์—์ด์ „ํŠธ ์‹œ๋ฎฌ๋ ˆ์ด์…˜, ๊ฐ€์ƒ ํ”ผํŒ…, ์ž„์˜ ๋ทฐ 3D ๋ณต์›์ด ๋™์‹œ์— ๊ธ‰๊ฐ€์†

๐Ÿš€ โ€œ๋” ์ ๊ฒŒ, ๋” ๋น ๋ฅด๊ฒŒโ€ โ€” ํ•œ ์Šคํ… ์ถ”๋ก , 4๋น„ํŠธ KV ์บ์‹œ, ์•ฝํ•œ ๋ณด์ƒ ํ•™์Šตโ€ฆ ํšจ์œจ์ด ์ •ํ™•๋„๋ฅผ ๋”ฐ๋ผ์žก๋Š”๋‹ค

๐ŸŒ โ€œMCP ํ™˜๊ฒฝ 1400๊ฐœ, ์‚ฌ๋žŒ ์† ํ•˜๋‚˜ ์•ˆ ํƒ”๋‹คโ€

Agent-World: Scaling Real-World Environment Synthesis for Evolving General Agent Intelligence

๐Ÿ›๏ธ ์†Œ์†: Microsoft Research, Renmin University

๐Ÿท๏ธ ํ•ต์‹ฌ ํ‚ค์›Œ๋“œ: Agent Training, MCP Environment Synthesis, Self-Evolving

๐Ÿ’ญ ์ด๋Ÿฐ ์งˆ๋ฌธ์„ ํ•ด๋ณธ ์  ์žˆ๋‚˜์š”?

  • AI ์—์ด์ „ํŠธ๋ฅผ ํ›ˆ๋ จ์‹œํ‚ค๋ ค๋ฉด ํ™˜๊ฒฝ์„ ํ•˜๋‚˜ํ•˜๋‚˜ ์ง์ ‘ ๋งŒ๋“ค์–ด์•ผ ํ•˜๋‚˜์š”?

  • MCP(Model Context Protocol) ๊ธฐ๋ฐ˜ ์—์ด์ „ํŠธ๋Š” ์–ด๋””์„œ ์‹ค์ „ ๊ฒฝํ—˜์„ ์Œ“์„๊นŒ์š”?

  • ์—์ด์ „ํŠธ๊ฐ€ ์Šค์Šค๋กœ ํ›ˆ๋ จ ํ™˜๊ฒฝ์„ ๋งŒ๋“ค๊ณ  ๋‚œ์ด๋„๊นŒ์ง€ ์˜ฌ๋ฆด ์ˆ˜ ์žˆ๋‹ค๋ฉด?

๊ฒฉํˆฌ ๊ฒŒ์ž„์˜ AI๋ฅผ ํ›ˆ๋ จ์‹œํ‚ฌ ๋•Œ, ๋งค๋ฒˆ ์‚ฌ๋žŒ์ด ์ƒˆ๋กœ์šด ์Šคํ…Œ์ด์ง€๋ฅผ ๋งŒ๋“ค์–ด์•ผ ํ•œ๋‹ค๋ฉด ํ™•์žฅ์€ ๋ถˆ๊ฐ€๋Šฅํ•ฉ๋‹ˆ๋‹ค. Agent-World๋Š” ์ด ๋ณ‘๋ชฉ์„ ์ •๋ฉด์œผ๋กœ ๋ถ€์‰ˆ์Šต๋‹ˆ๋‹ค. ์‹ค์ œ MCP ์„œ๋น„์Šค๋“ค์„ ๊ธฐ๋ฐ˜์œผ๋กœ 1,400๊ฐœ ์ด์ƒ์˜ ํ˜„์‹ค์  ํ™˜๊ฒฝ์„ ์ž๋™ ํ•ฉ์„ฑํ•˜๊ณ , ์—์ด์ „ํŠธ๊ฐ€ ํ™˜๊ฒฝ ์†์—์„œ ์‹คํŒจํ• ์ˆ˜๋ก ๋” ์–ด๋ ค์šด ํ™˜๊ฒฝ์ด ์ž๋™ ์ƒ์„ฑ๋˜๋Š” ์ž๊ธฐ ์ง„ํ™”(self-evolving) ๊ตฌ์กฐ๋ฅผ ๋„์ž…ํ–ˆ์Šต๋‹ˆ๋‹ค. ์—์ด์ „ํŠธ๋Š” stateful tool ํ™˜๊ฒฝ๊ณผ ์ƒํ˜ธ์ž‘์šฉํ•˜๋ฉฐ ์‹ค์ „ ๊ฐ๊ฐ์„ ํ‚ค์šฐ๊ณ , ์ปค๋ฆฌํ˜๋Ÿผ ํ•™์Šต์œผ๋กœ ์ ์ง„์ ์œผ๋กœ ๊ฐ•ํ•ด์ง‘๋‹ˆ๋‹ค.

ํŠนํžˆ ์ฃผ๋ชฉํ•  ์ :

  • MCP ๊ธฐ๋ฐ˜ ์‹ค์ œ ์„œ๋น„์Šค ํ™˜๊ฒฝ 1,400+๊ฐœ๋ฅผ ์ž๋™ ํ•ฉ์„ฑ โ€” ์ˆ˜์ž‘์—… ํ™˜๊ฒฝ ๊ตฌ์ถ•์˜ ์ข…๋ง

  • ์ž๊ธฐ ์ง„ํ™” ๋ฉ”์ปค๋‹ˆ์ฆ˜: ์—์ด์ „ํŠธ ์‹คํŒจ ํŒจํ„ด ๋ถ„์„ โ†’ ๋” ๋„์ „์ ์ธ ํ™˜๊ฒฝ ์ž๋™ ์ƒ์„ฑ

  • ๊ธฐ์กด ์—์ด์ „ํŠธ ๋ฒค์น˜๋งˆํฌ ๋Œ€๋น„ ํ˜„์‹ค์„ฑ๊ณผ ๋‹ค์–‘์„ฑ ๋ชจ๋‘ ์••๋„

๐ŸŽฏ ์™œ ์ด๊ฒƒ์ด ๊ฒŒ์ž„ ์ฒด์ธ์ €์ธ๊ฐ€? : ์‚ฌ๋žŒ์ด ํ™˜๊ฒฝ์„ ๋งŒ๋“ค์–ด์ฃผ๋˜ ์‹œ๋Œ€ โ†’ ์—์ด์ „ํŠธ๊ฐ€ ์Šค์Šค๋กœ ํ›ˆ๋ จ์žฅ์„ ์ฐ์–ด๋‚ด๋Š” ์‹œ๋Œ€

๐Ÿš— โ€œ์ž์œจ์ฃผํ–‰์— CoT๊ฐ€ ์˜คํžˆ๋ ค ๋…์ด์—ˆ๋‹ค?โ€

OneVL: One-Step Latent Reasoning and Planning with Vision-Language Explanation

๐Ÿ›๏ธ ์†Œ์†: NUS, HKBU

๐Ÿท๏ธ ํ•ต์‹ฌ ํ‚ค์›Œ๋“œ: Autonomous Driving, Latent Reasoning, VLA

๐Ÿ’ญ ์ด๋Ÿฐ ์งˆ๋ฌธ์„ ํ•ด๋ณธ ์  ์žˆ๋‚˜์š”?

  • ์ž์œจ์ฃผํ–‰์— Chain-of-Thought๋ฅผ ์“ฐ๋ฉด ์ถ”๋ก ์€ ์ข‹์€๋ฐ ๋„ˆ๋ฌด ๋А๋ฆฌ์ง€ ์•Š๋‚˜์š”?

  • CoT์˜ ์ •ํ™•๋„๋ฅผ ์œ ์ง€ํ•˜๋ฉด์„œ ๋ ˆ์ดํ„ด์‹œ๋ฅผ ๊ทน์ ์œผ๋กœ ์ค„์ผ ์ˆ˜ ์žˆ์„๊นŒ์š”?

  • ํ…์ŠคํŠธ๊ฐ€ ์•„๋‹Œ ์‹œ๊ฐ์  ์ž ์žฌ ๊ณต๊ฐ„์—์„œ ์ถ”๋ก ํ•˜๋ฉด ์–ด๋–จ๊นŒ์š”?

์ž์œจ์ฃผํ–‰์—์„œ โ€œ์ƒ๊ฐํ•˜๋ฉด์„œ ๋‹ฌ๋ฆฐ๋‹คโ€๋Š” ๊ฑด ์‚ฌ์น˜์ž…๋‹ˆ๋‹ค. ์ฐจ์„  ๋ณ€๊ฒฝ ํŒ๋‹จ์— 2์ดˆ์”ฉ ๊ฑธ๋ฆฌ๋ฉด ์‚ฌ๊ณ  ๋‚˜์ฃ . OneVL์€ ๊ธฐ์กด VLA ๋ชจ๋ธ์˜ autoregressive CoT๋ฅผ ํ๊ธฐํ•˜๊ณ , ๋น„์ „-์–ธ์–ด ์ž ์žฌ ๊ณต๊ฐ„์—์„œ ๋‹จ ํ•œ ์Šคํ…์œผ๋กœ ์ถ”๋ก ๊ณผ ๊ณ„ํš์„ ๋™์‹œ์— ์™„๋ฃŒํ•ฉ๋‹ˆ๋‹ค. ํ•ต์‹ฌ์€ ์–ธ์–ด์  ์ƒ์ง• ์ถ”์ƒํ™”๊ฐ€ ์•„๋‹Œ, ์‹œ๊ฐ์  ์„ธ๊ณ„ ์ƒํƒœ๋ฅผ ์ง์ ‘ ์••์ถ•ํ•œ ์ž ์žฌ ํ‘œํ˜„์„ ์‚ฌ์šฉํ•œ๋‹ค๋Š” ์ ์ž…๋‹ˆ๋‹ค. 50๋ช…์˜ ์—ฐ๊ตฌ์ง„์ด ์ฐธ์—ฌํ•œ ๋Œ€๊ทœ๋ชจ ํ”„๋กœ์ ํŠธ๋กœ, CoT์˜ ์ •ํ™•๋„๋ฅผ ์œ ์ง€ํ•˜๋ฉด์„œ ์‹ค์‹œ๊ฐ„ ๋ฐฐํฌ๊ฐ€ ๊ฐ€๋Šฅํ•œ ์†๋„๋ฅผ ๋‹ฌ์„ฑํ–ˆ์Šต๋‹ˆ๋‹ค.

ํŠนํžˆ ์ฃผ๋ชฉํ•  ์ :

  • Autoregressive CoT ๋Œ€๋น„ ๋ ˆ์ดํ„ด์‹œ ๋Œ€ํญ ๊ฐ์†Œ โ€” ์‹ค์‹œ๊ฐ„ ์ž์œจ์ฃผํ–‰ ๋ฐฐํฌ ๊ฐ€๋Šฅ

  • ์ˆœ์ˆ˜ ์–ธ์–ด ์ž ์žฌ ํ‘œํ˜„์ด ์•„๋‹Œ, ์‹œ๊ฐ ์„ธ๊ณ„ ์ƒํƒœ ๊ธฐ๋ฐ˜ ์ž ์žฌ ์ถ”๋ก ์œผ๋กœ ์ •ํ™•๋„ ์œ ์ง€

  • 50๋ช… ์—ฐ๊ตฌ์ง„ ์ฐธ์—ฌ โ€” ์ปค๋ฎค๋‹ˆํ‹ฐ ์ฃผ๋ชฉ๋„ ์ตœ๊ณ  (HuggingFace 68โ†‘)

๐ŸŽฏ ์™œ ์ด๊ฒƒ์ด ๊ฒŒ์ž„ ์ฒด์ธ์ €์ธ๊ฐ€? : โ€œ๋А๋ฆฌ์ง€๋งŒ ์ •ํ™•ํ•œ CoTโ€ vs โ€œ๋น ๋ฅด์ง€๋งŒ ๋ถ€์ •ํ™•ํ•œ ์ง์ ‘ ์˜ˆ์ธกโ€ ํŠธ๋ ˆ์ด๋“œ์˜คํ”„ โ†’ ์ž ์žฌ ๊ณต๊ฐ„์—์„œ ํ•œ ์Šคํ…์œผ๋กœ ๋‘˜ ๋‹ค ์žก๋Š”๋‹ค

๐Ÿ‘— โ€œํƒ€์˜ค๋ฐ”์˜ค ์ˆ˜์ฒœ๋งŒ ๊ฑด์ด ๊ฐ€์ƒ ํ”ผํŒ…์ด๋ผ๋‹ˆโ€

Tstars-Tryon 1.0: Robust and Realistic Virtual Try-On for Diverse Fashion Items

๐Ÿ›๏ธ ์†Œ์†: Alibaba

๐Ÿท๏ธ ํ•ต์‹ฌ ํ‚ค์›Œ๋“œ: Virtual Try-On, Diffusion Model, E-commerce

๐Ÿ’ญ ์ด๋Ÿฐ ์งˆ๋ฌธ์„ ํ•ด๋ณธ ์  ์žˆ๋‚˜์š”?

  • ์˜จ๋ผ์ธ ์‡ผํ•‘์—์„œ โ€œ์ด ์˜ท ๋‚˜ํ•œํ…Œ ์–ด์šธ๋ฆด๊นŒ?โ€ ๊ณ ๋ฏผํ•ด๋ณธ ์  ์žˆ๋‚˜์š”?

  • ๊ฐ€์ƒ ํ”ผํŒ…์ธ๋ฐ ์†์„ ์˜ฌ๋ฆฌ๊ฑฐ๋‚˜ ๋Œ์•„์„œ๋ฉด ์˜ท์ด ๊นจ์ง€์ง€ ์•Š๋‚˜์š”?

  • ์ƒ์˜, ํ•˜์˜, ์›ํ”ผ์Šค, ์•ก์„ธ์„œ๋ฆฌ๊นŒ์ง€ ๋‹ค ๋˜๋Š” ๋ฒ”์šฉ ๊ฐ€์ƒ ํ”ผํŒ…์ด ๊ฐ€๋Šฅํ•œ๊ฐ€์š”?

๊ธฐ์กด ๊ฐ€์ƒ ํ”ผํŒ… ๊ธฐ์ˆ ์€ โ€œ์ •๋ฉด ์„œ ์žˆ๋Š” ์ž์„ธโ€์—์„œ๋งŒ ๊ทธ๋Ÿด๋“ฏํ–ˆ์Šต๋‹ˆ๋‹ค. ํฌ์ฆˆ๊ฐ€ ๊ทน๋‹จ์ ์ด๊ฑฐ๋‚˜, ์กฐ๋ช…์ด ๋‚˜์˜๊ฑฐ๋‚˜, ๋ชจ์…˜๋ธ”๋Ÿฌ๊ฐ€ ์žˆ์œผ๋ฉด ๊ฒฐ๊ณผ๊ฐ€ ์ฒ˜์ฐธํ–ˆ์ฃ . Alibaba์˜ Tstars-Tryon 1.0์€ ์ด ๋ชจ๋“  ๋‚œ๊ด€์„ ๋ŒํŒŒํ•ฉ๋‹ˆ๋‹ค. ๊ทนํ•œ ํฌ์ฆˆ, ์‹ฌํ•œ ์กฐ๋ช… ๋ณ€ํ™”, ๋ชจ์…˜๋ธ”๋Ÿฌ, ์•ผ์™ธ ์ดฌ์˜ ๋“ฑ ์‹ค์ „ ์กฐ๊ฑด์—์„œ๋„ ๋†’์€ ์„ฑ๊ณต๋ฅ ์„ ์œ ์ง€ํ•˜๋ฉฐ, ์ƒ์˜ยทํ•˜์˜ยท์›ํ”ผ์Šคยท์•ก์„ธ์„œ๋ฆฌ๊นŒ์ง€ ๋‹ค์–‘ํ•œ ํŒจ์…˜ ์•„์ดํ…œ์„ ์ปค๋ฒ„ํ•ฉ๋‹ˆ๋‹ค. ์ƒ์šฉ ๊ทœ๋ชจ(commercial-scale) ์‹œ์Šคํ…œ์œผ๋กœ, ์‹ค์ œ ์ด์ปค๋จธ์Šค ๋ฐฐํฌ๋ฅผ ๋ชฉํ‘œ๋กœ ์„ค๊ณ„๋˜์—ˆ์Šต๋‹ˆ๋‹ค.

ํŠนํžˆ ์ฃผ๋ชฉํ•  ์ :

  • ๊ทนํ•œ ํฌ์ฆˆยท๋ชจ์…˜๋ธ”๋Ÿฌยท์กฐ๋ช… ๋ณ€ํ™” ๋“ฑ ์‹ค์ „ ์•…์กฐ๊ฑด์—์„œ๋„ ๋†’์€ ์„ฑ๊ณต๋ฅ 

  • ์ƒ์˜, ํ•˜์˜, ์›ํ”ผ์Šค, ์•ก์„ธ์„œ๋ฆฌ ๋“ฑ ๋‹ค์–‘ํ•œ ์นดํ…Œ๊ณ ๋ฆฌ ๋™์‹œ ์ง€์›

  • ์ƒ์šฉ ๊ทœ๋ชจ ์‹œ์Šคํ…œ โ€” Alibaba ์ด์ปค๋จธ์Šค ์‹ค๋ฐฐํฌ ๋ชฉํ‘œ ์„ค๊ณ„

๐ŸŽฏ ์™œ ์ด๊ฒƒ์ด ๊ฒŒ์ž„ ์ฒด์ธ์ €์ธ๊ฐ€? : โ€œ์ •๋ฉด ์„œ์žˆ๋Š” ์ž์„ธ์—์„œ๋งŒ ์ž‘๋™ํ•˜๋Š” ๋ฐ๋ชจโ€ โ†’ โ€œ์‹ค์ „ ์•…์กฐ๊ฑด ํฌํ•จ, ๋ชจ๋“  ํŒจ์…˜ ์•„์ดํ…œ์— ์ž‘๋™ํ•˜๋Š” ์ƒ์šฉ ์‹œ์Šคํ…œโ€

๐ŸŽฎ โ€œ์›”๋“œ ๋ชจ๋ธ, ์•„์ง๋„ ์‹ฑ๊ธ€ํ”Œ๋ ˆ์ด์–ด?โ€

MultiWorld: Scalable Multi-Agent Multi-View Video World Models

๐Ÿ›๏ธ ์†Œ์†: HKU

๐Ÿท๏ธ ํ•ต์‹ฌ ํ‚ค์›Œ๋“œ: World Model, Multi-Agent, Video Generation

๐Ÿ’ญ ์ด๋Ÿฐ ์งˆ๋ฌธ์„ ํ•ด๋ณธ ์  ์žˆ๋‚˜์š”?

  • ๋น„๋””์˜ค ์›”๋“œ ๋ชจ๋ธ์ด ํ”Œ๋ ˆ์ด์–ด 1๋ช…๋งŒ ์ง€์›ํ•˜๋ฉด ํ˜„์‹ค ์‹œ๋ฎฌ๋ ˆ์ด์…˜์ด ๋˜๋‚˜์š”?

  • ์—ฌ๋Ÿฌ ์—์ด์ „ํŠธ๊ฐ€ ๋™์‹œ์— ํ–‰๋™ํ•˜๋Š” ํ™˜๊ฒฝ์„ ๋น„๋””์˜ค๋กœ ์‹œ๋ฎฌ๋ ˆ์ด์…˜ํ•  ์ˆ˜ ์žˆ์„๊นŒ์š”?

  • ๊ฐ ์—์ด์ „ํŠธ์˜ ์‹œ์ (view)๊นŒ์ง€ ๋…๋ฆฝ์ ์œผ๋กœ ์ƒ์„ฑํ•  ์ˆ˜ ์žˆ๋‹ค๋ฉด?

์ง€๊ธˆ๊นŒ์ง€ ๋น„๋””์˜ค ์›”๋“œ ๋ชจ๋ธ์€ ๋…๋ฐฉ์ด์—ˆ์Šต๋‹ˆ๋‹ค. ํ”Œ๋ ˆ์ด์–ด ํ•œ ๋ช…์ด ํ–‰๋™ํ•˜๋ฉด ๊ทธ์— ๋งž๋Š” ๋ฏธ๋ž˜ ํ”„๋ ˆ์ž„์„ ์˜ˆ์ธกํ•˜๋Š” ๊ตฌ์กฐ. MultiWorld๋Š” ์ด ๋ฒฝ์„ ํ—ˆ๋ฌผ๊ณ , ์—ฌ๋Ÿฌ ์—์ด์ „ํŠธ๊ฐ€ ๋™์‹œ์— ํ–‰๋™ํ•˜๋Š” ๋ฉ€ํ‹ฐ์—์ด์ „ํŠธยท๋ฉ€ํ‹ฐ๋ทฐ ํ™˜๊ฒฝ์„ ํ•˜๋‚˜์˜ ํ†ตํ•ฉ ํ”„๋ ˆ์ž„์›Œํฌ๋กœ ์‹œ๋ฎฌ๋ ˆ์ด์…˜ํ•ฉ๋‹ˆ๋‹ค. ๊ฐ ์—์ด์ „ํŠธ์˜ ์•ก์…˜์— ์กฐ๊ฑดํ™”๋œ ๋น„๋””์˜ค ์ƒ์„ฑ์ด ๊ฐ€๋Šฅํ•˜๋ฉฐ, ์—์ด์ „ํŠธ๋ณ„ ๋…๋ฆฝ ์‹œ์ ๊นŒ์ง€ ์ œ๊ณตํ•ฉ๋‹ˆ๋‹ค. ๋ณต์žกํ•œ ์ƒํ˜ธ์ž‘์šฉ์ด ์กด์žฌํ•˜๋Š” ์‹ค์ œ ์„ธ๊ณ„๋ฅผ ๋น„๋””์˜ค๋กœ ์‹œ๋ฎฌ๋ ˆ์ด์…˜ํ•˜๋Š” ์ฒซ ๊ฑธ์Œ์ž…๋‹ˆ๋‹ค.

ํŠนํžˆ ์ฃผ๋ชฉํ•  ์ :

  • ๋ฉ€ํ‹ฐ์—์ด์ „ํŠธ + ๋ฉ€ํ‹ฐ๋ทฐ๋ฅผ ํ•˜๋‚˜์˜ ํ†ตํ•ฉ ๋น„๋””์˜ค ์›”๋“œ ๋ชจ๋ธ๋กœ ์ฒ˜๋ฆฌ

  • ๊ฐ ์—์ด์ „ํŠธ์˜ ํ–‰๋™์— ๋…๋ฆฝ์ ์œผ๋กœ ์กฐ๊ฑดํ™”๋œ ๋ฏธ๋ž˜ ํ”„๋ ˆ์ž„ ์ƒ์„ฑ

  • ๊ธฐ์กด ๋‹จ์ผ ์—์ด์ „ํŠธ ์›”๋“œ ๋ชจ๋ธ์˜ ๊ตฌ์กฐ์  ํ•œ๊ณ„๋ฅผ ์ •๋ฉด ๋ŒํŒŒ

๐ŸŽฏ ์™œ ์ด๊ฒƒ์ด ๊ฒŒ์ž„ ์ฒด์ธ์ €์ธ๊ฐ€? : โ€œ1์ธ์นญ ์‹œ๋ฎฌ๋ ˆ์ด์…˜โ€ โ†’ โ€œ๋‹ค์ˆ˜ ์—์ด์ „ํŠธ๊ฐ€ ์ƒํ˜ธ์ž‘์šฉํ•˜๋Š” ์„ธ๊ณ„ ์‹œ๋ฎฌ๋ ˆ์ด์…˜โ€

๐Ÿง  โ€œ์ •๋‹ต์ง€๊ฐ€ ํ‹€๋ ธ๋Š”๋ฐ ์„ฑ์ ์ด ์˜ฌ๋ž๋‹คโ€

When Can LLMs Learn to Reason with Weak Supervision?

๐Ÿ›๏ธ ์†Œ์†: OpenAI, UCLA

๐Ÿท๏ธ ํ•ต์‹ฌ ํ‚ค์›Œ๋“œ: RLVR, Weak Supervision, Reasoning

๐Ÿ’ญ ์ด๋Ÿฐ ์งˆ๋ฌธ์„ ํ•ด๋ณธ ์  ์žˆ๋‚˜์š”?

  • LLM ์ถ”๋ก  ๋Šฅ๋ ฅ์„ ํ‚ค์šฐ๋ ค๋ฉด ์™„๋ฒฝํ•œ ๋ณด์ƒ ์‹ ํ˜ธ๊ฐ€ ๊ผญ ํ•„์š”ํ•œ๊ฐ€์š”?

  • ๋ฐ์ดํ„ฐ๊ฐ€ ๋ถ€์กฑํ•˜๊ฑฐ๋‚˜ ๋ณด์ƒ์— ๋…ธ์ด์ฆˆ๊ฐ€ ๋ผ๋ฉด RLVR์€ ์‹คํŒจํ• ๊นŒ์š”?

  • ๋ชจ๋ธ์ด ์Šค์Šค๋กœ ์ž๊ธฐ ๋‹ต์„ ํ‰๊ฐ€ํ•˜๋Š” self-supervision์€ ์ง„์งœ ๋˜๋‚˜์š”?

โ€œ์ •๋‹ต์ง€๊ฐ€ ์™„๋ฒฝํ•ด์•ผ ํ•™์ƒ์ด ๋ฐฐ์šด๋‹คโ€๋Š” ์ƒ์‹์ด ๊นจ์กŒ์Šต๋‹ˆ๋‹ค. OpenAI ์—ฐ๊ตฌํŒ€์€ RLVR(Reinforcement Learning with Verifiable Rewards)์ด ์•ฝํ•œ ๊ฐ๋…(scarce data, noisy rewards, self-supervision) ํ•˜์—์„œ๋„ ์ถ”๋ก  ๋Šฅ๋ ฅ์„ ํ•™์Šตํ•  ์ˆ˜ ์žˆ๋Š” ์กฐ๊ฑด์„ ์ฒด๊ณ„์ ์œผ๋กœ ์‹คํ—˜ํ–ˆ์Šต๋‹ˆ๋‹ค. ๋‹ค์–‘ํ•œ ๋ชจ๋ธ ํŒจ๋ฐ€๋ฆฌ์™€ ์ถ”๋ก  ๋„๋ฉ”์ธ์—์„œ ํ…Œ์ŠคํŠธํ•œ ๊ฒฐ๊ณผ, ๋†€๋ž๊ฒŒ๋„ ๋ณด์ƒ ์‹ ํ˜ธ๊ฐ€ ์ƒ๋‹นํžˆ ๋ถ€์ •ํ™•ํ•˜๊ฑฐ๋‚˜ ํฌ์†Œํ•œ ์ƒํ™ฉ์—์„œ๋„ ์ถ”๋ก  ์„ฑ๋Šฅ ํ–ฅ์ƒ์ด ๊ด€์ฐฐ๋˜์—ˆ์Šต๋‹ˆ๋‹ค. ์ด๋Š” ๊ณ ํ’ˆ์งˆ ๋ณด์ƒ ํ•จ์ˆ˜ ๊ตฌ์ถ•์ด๋ผ๋Š” RLVR์˜ ๊ฐ€์žฅ ํฐ ๋ณ‘๋ชฉ์„ ํฌ๊ฒŒ ์™„ํ™”ํ•ฉ๋‹ˆ๋‹ค.

ํŠนํžˆ ์ฃผ๋ชฉํ•  ์ :

  • ํฌ์†Œ ๋ฐ์ดํ„ฐ, ๋…ธ์ด์ฆˆ ๋ณด์ƒ, ์…€ํ”„ ์ˆ˜ํผ๋น„์ „ ๋“ฑ 3๊ฐ€์ง€ ์•ฝํ•œ ๊ฐ๋… ์‹œ๋‚˜๋ฆฌ์˜ค ์ฒด๊ณ„์  ๊ฒ€์ฆ

  • ๋ณด์ƒ์ด ๋ถ€์ •ํ™•ํ•ด๋„ ์ถ”๋ก  ์„ฑ๋Šฅ ํ–ฅ์ƒ ํ™•์ธ โ€” ์™„๋ฒฝํ•œ reward function ๋ถˆํ•„์š”

  • ๋‹ค์–‘ํ•œ ๋ชจ๋ธ ํŒจ๋ฐ€๋ฆฌ ร— ์ถ”๋ก  ๋„๋ฉ”์ธ์—์„œ ์ผ๊ด€๋œ ๊ฒฐ๊ณผ

๐ŸŽฏ ์™œ ์ด๊ฒƒ์ด ๊ฒŒ์ž„ ์ฒด์ธ์ €์ธ๊ฐ€? : โ€œ์™„๋ฒฝํ•œ ๋ณด์ƒ ํ•จ์ˆ˜๊ฐ€ ์žˆ์–ด์•ผ ์ถ”๋ก ์„ ๊ฐ€๋ฅด์นœ๋‹คโ€ โ†’ โ€œ๋Œ€์ถฉ ๋งž๋Š” ๋ณด์ƒ์œผ๋กœ๋„ ์ถ”๋ก ์„ ํ‚ค์šธ ์ˆ˜ ์žˆ๋‹คโ€

๐Ÿ”ญ โ€œ๋Œ€์ถฉ ์ฐ์€ ์‚ฌ์ง„ 5์žฅ์ด 3D ๊ฑด๋ฌผ์ด ๋œ๋‹คโ€

AnyRecon: Arbitrary-View 3D Reconstruction with Video Diffusion Model

๐Ÿ›๏ธ ์†Œ์†: CUHK

๐Ÿท๏ธ ํ•ต์‹ฌ ํ‚ค์›Œ๋“œ: 3D Reconstruction, Video Diffusion, Sparse-View

๐Ÿ’ญ ์ด๋Ÿฐ ์งˆ๋ฌธ์„ ํ•ด๋ณธ ์  ์žˆ๋‚˜์š”?

  • ์Šค๋งˆํŠธํฐ์œผ๋กœ ์•„๋ฌด๋ ‡๊ฒŒ๋‚˜ ์ฐ์€ ์‚ฌ์ง„ ๋ช‡ ์žฅ์œผ๋กœ 3D ๋ชจ๋ธ์„ ๋งŒ๋“ค ์ˆ˜ ์žˆ์„๊นŒ์š”?

  • ๊ธฐ์กด 3D ๋ณต์›์€ ์™œ ๊ผญ ์ •ํ•ด์ง„ ๊ฐ๋„์—์„œ ์ดฌ์˜ํ•ด์•ผ ํ–ˆ์„๊นŒ์š”?

  • ๋””ํ“จ์ „ ๋ชจ๋ธ์ด ์—†๋Š” ๋ทฐ๋ฅผ โ€œ์ƒ์ƒโ€ํ•ด์„œ ์ฑ„์›Œ๋„ฃ์„ ์ˆ˜ ์žˆ๋‹ค๋ฉด?

์—ฌํ–‰ ์‚ฌ์ง„ 5์žฅ์œผ๋กœ ๊ฑด๋ฌผ ์ „์ฒด์˜ 3D ๋ชจ๋ธ์„ ๋งŒ๋“ ๋‹ค๊ณ  ์ƒ์ƒํ•ด๋ณด์„ธ์š”. AnyRecon์ด ๊ทธ๊ฑธ ํ•ด๋ƒ…๋‹ˆ๋‹ค. ๊ธฐ์กด ๋””ํ“จ์ „ ๊ธฐ๋ฐ˜ ์ ‘๊ทผ๋ฒ•์€ 1~2์žฅ์˜ ์ด๋ฏธ์ง€์—๋งŒ ์กฐ๊ฑดํ™”๋˜์–ด ๊ธฐํ•˜ํ•™์  ์ผ๊ด€์„ฑ์ด ๋–จ์–ด์กŒ์ง€๋งŒ, AnyRecon์€ ์ž„์˜ ๊ฐœ์ˆ˜ยท์ž„์˜ ์ˆœ์„œ์˜ ์ŠคํŒŒ์Šค ์ž…๋ ฅ์„ ๋ฐ›์•„ ๋น„๋””์˜ค ๋””ํ“จ์ „ ๋ชจ๋ธ๋กœ ๋นˆ ์‹œ์ ์„ ํ•ฉ์„ฑํ•ฉ๋‹ˆ๋‹ค. ์ž…๋ ฅ ์ด๋ฏธ์ง€๊ฐ€ ๋งŽ์•„์งˆ์ˆ˜๋ก ๋” ์ •ํ™•ํ•ด์ง€๋Š” ํ™•์žฅ ๊ฐ€๋Šฅํ•œ ๊ตฌ์กฐ์ž…๋‹ˆ๋‹ค.

ํŠนํžˆ ์ฃผ๋ชฉํ•  ์ :

  • ์ž„์˜ ๊ฐœ์ˆ˜, ์ž„์˜ ์ˆœ์„œ์˜ ์ŠคํŒŒ์Šค ์ž…๋ ฅ โ†’ ๋†’์€ ๊ธฐํ•˜ํ•™์  ์ผ๊ด€์„ฑ์˜ 3D ๋ณต์›

  • ๋น„๋””์˜ค ๋””ํ“จ์ „ ๋ชจ๋ธ๋กœ ๋นˆ ์‹œ์ ์„ ํ•ฉ์„ฑํ•˜์—ฌ ๋Œ€๊ทœ๋ชจยท๋‹ค์–‘ํ•œ ์žฅ๋ฉด์—๋„ ๋Œ€์‘

  • ๊ธฐ์กด 1~2์žฅ ์กฐ๊ฑดํ™” ๋ฐฉ์‹ ๋Œ€๋น„ ํ™•์žฅ์„ฑ๊ณผ ์ •ํ™•๋„ ๋ชจ๋‘ ํ–ฅ์ƒ

๐ŸŽฏ ์™œ ์ด๊ฒƒ์ด ๊ฒŒ์ž„ ์ฒด์ธ์ €์ธ๊ฐ€? : โ€œ์ •ํ•ด์ง„ ๊ฐ๋„์—์„œ ์ˆ˜์‹ญ ์žฅ ํ•„์š”โ€ โ†’ โ€œ์•„๋ฌด๋ ‡๊ฒŒ๋‚˜ ์ฐ์€ ์‚ฌ์ง„ ๋ช‡ ์žฅ์ด๋ฉด ์ถฉ๋ถ„โ€

๐Ÿค– โ€œ์•„์ง๋„ ์—์ด์ „ํŠธ ํ™˜๊ฒฝ์„ ์ฝ”๋”ฉํ•˜์„ธ์š”?โ€

ClawEnvKit: Automatic Environment Generation for Claw-Like Agents

๐Ÿ›๏ธ ์†Œ์†: UC Berkeley, UCLA, University of Maryland

๐Ÿท๏ธ ํ•ต์‹ฌ ํ‚ค์›Œ๋“œ: Agent Environment, Code Generation, Benchmark Automation

๐Ÿ’ญ ์ด๋Ÿฐ ์งˆ๋ฌธ์„ ํ•ด๋ณธ ์  ์žˆ๋‚˜์š”?

  • AI ์—์ด์ „ํŠธ๋ฅผ ํ‰๊ฐ€ํ•˜๋ ค๋ฉด ํ™˜๊ฒฝ์„ ๋งค๋ฒˆ ์‚ฌ๋žŒ์ด ์ฝ”๋”ฉํ•ด์•ผ ํ•˜๋‚˜์š”?

  • โ€œ์ด๋ฉ”์ผ ๋ณด๋‚ด๊ณ  ์บ˜๋ฆฐ๋”์— ๋“ฑ๋กํ•ด์ค˜โ€ ๊ฐ™์€ ํƒœ์Šคํฌ ํ™˜๊ฒฝ์„ ์ž๋™์œผ๋กœ ๋งŒ๋“ค ์ˆ˜ ์žˆ๋‹ค๋ฉด?

  • ํ™˜๊ฒฝ ๋ถ€์กฑ์ด ์—์ด์ „ํŠธ ์—ฐ๊ตฌ์˜ ์ง„์งœ ๋ณ‘๋ชฉ ์•„๋‹Œ๊ฐ€์š”?

์—์ด์ „ํŠธ ์—ฐ๊ตฌ์˜ ์ˆจ์€ ๋น„์šฉ์€ ํ™˜๊ฒฝ ๊ตฌ์ถ•์ž…๋‹ˆ๋‹ค. ์ƒˆ๋กœ์šด ํƒœ์Šคํฌ๋ฅผ ํ…Œ์ŠคํŠธํ•˜๋ ค๋ฉด ํ™˜๊ฒฝ์„ ์ง์ ‘ ์ฝ”๋”ฉํ•ด์•ผ ํ•˜๋Š”๋ฐ, ์ด๊ฑด ํ™•์žฅ์ด ์•ˆ ๋ฉ๋‹ˆ๋‹ค. BerkeleyยทUCLAยทUMD ์—ฐํ•ฉํŒ€์˜ ClawEnvKit์€ ์ž์—ฐ์–ด ์„ค๋ช…๋งŒ์œผ๋กœ ํ™˜๊ฒฝ์„ ์ž๋™ ์ƒ์„ฑํ•˜๋Š” ํŒŒ์ดํ”„๋ผ์ธ์ž…๋‹ˆ๋‹ค. ํŒŒ์„œ๊ฐ€ ๊ตฌ์กฐํ™”๋œ ์ŠคํŽ™์„ ์ถ”์ถœํ•˜๊ณ , ์ƒ์„ฑ๊ธฐ๊ฐ€ ๊ฒ€์ฆ๋œ ํ™˜๊ฒฝ ์ฝ”๋“œ๋ฅผ ๋งŒ๋“ค์–ด๋ƒ…๋‹ˆ๋‹ค. LMSYS์˜ Wei-Lin Chiang๊ณผ Ion Stoica๊ฐ€ ์ฐธ์—ฌํ•œ ํ”„๋กœ์ ํŠธ์ž…๋‹ˆ๋‹ค.

ํŠนํžˆ ์ฃผ๋ชฉํ•  ์ :

  • ์ž์—ฐ์–ด โ†’ ๊ตฌ์กฐํ™”๋œ ์ŠคํŽ™ โ†’ ๊ฒ€์ฆ๋œ ํ™˜๊ฒฝ ์ฝ”๋“œ์˜ 3๋‹จ๊ณ„ ์ž๋™ ํŒŒ์ดํ”„๋ผ์ธ

  • ๋‹ค์–‘ํ•˜๊ณ  ๊ฒ€์ฆ๋œ ํ™˜๊ฒฝ์„ on-demand๋กœ ์ƒ์„ฑ โ€” ์ˆ˜์ž‘์—… ํ™˜๊ฒฝ ๊ตฌ์ถ• ๋ถˆํ•„์š”

  • LMSYS ํ•ต์‹ฌ ๋ฉค๋ฒ„(Wei-Lin Chiang, Ion Stoica) ์ฐธ์—ฌ

๐ŸŽฏ ์™œ ์ด๊ฒƒ์ด ๊ฒŒ์ž„ ์ฒด์ธ์ €์ธ๊ฐ€? : โ€œํ™˜๊ฒฝ ํ•˜๋‚˜ ๋งŒ๋“œ๋Š” ๋ฐ ๋ฉฐ์น โ€ โ†’ โ€œํ…์ŠคํŠธ ํ•œ ์ค„์ด๋ฉด ๊ฒ€์ฆ๋œ ํ™˜๊ฒฝ์ด ๋‚˜์˜จ๋‹คโ€

โœ‹ โ€œAI ์˜์ƒ์—์„œ ์†์ด ์ปต์„ ์•ˆ ๋šซ๋Š” ๋‚ ์ด ์™”๋‹คโ€

CoInteract: Physically-Consistent Human-Object Interaction Video Synthesis via Spatially-Structured Co-Generation

๐Ÿ›๏ธ ์†Œ์†: Independent

๐Ÿท๏ธ ํ•ต์‹ฌ ํ‚ค์›Œ๋“œ: HOI Video Synthesis, Physical Consistency, Diffusion Model

๐Ÿ’ญ ์ด๋Ÿฐ ์งˆ๋ฌธ์„ ํ•ด๋ณธ ์  ์žˆ๋‚˜์š”?

  • AI๊ฐ€ ๋งŒ๋“  ์˜์ƒ์—์„œ ์†์ด ๋ฌผ๊ฑด์„ ๋šซ๊ณ  ์ง€๋‚˜๊ฐ€๋Š” ๊ฑธ ๋ณธ ์  ์žˆ๋‚˜์š”?

  • ์‚ฌ๋žŒ๊ณผ ๋ฌผ์ฒด๊ฐ€ ์ž์—ฐ์Šค๋Ÿฝ๊ฒŒ ์ƒํ˜ธ์ž‘์šฉํ•˜๋Š” ์˜์ƒ์„ ํ•ฉ์„ฑํ•  ์ˆ˜ ์žˆ์„๊นŒ์š”?

  • ์ด์ปค๋จธ์Šค ๊ด‘๊ณ  ์˜์ƒ์„ AI๋กœ ์ž๋™ ์ƒ์„ฑํ•œ๋‹ค๋ฉด?

๋””ํ“จ์ „ ๋ชจ๋ธ๋กœ ๋งŒ๋“  ์˜์ƒ์—์„œ ๊ฐ€์žฅ ์–ด์ƒ‰ํ•œ ์ˆœ๊ฐ„์€ ์†์ด ์ปต ์†์žก์ด๋ฅผ ์žก๋Š” ์žฅ๋ฉด์ž…๋‹ˆ๋‹ค. ์†๊ฐ€๋ฝ์ด ๋šซ๊ณ  ์ง€๋‚˜๊ฐ€๊ฑฐ๋‚˜, ๋ฌผ๊ฑด์ด ๊ณต์ค‘์— ๋–  ์žˆ์ฃ . CoInteract๋Š” ์ด ๋ฌธ์ œ๋ฅผ ๊ณต๊ฐ„ ๊ตฌ์กฐ์  ๊ณต๋™ ์ƒ์„ฑ(spatially-structured co-generation)์œผ๋กœ ํ•ด๊ฒฐํ•ฉ๋‹ˆ๋‹ค. ์†ยท์–ผ๊ตด ๋“ฑ ๋ฏผ๊ฐ ์˜์—ญ์˜ ๊ตฌ์กฐ์  ์•ˆ์ •์„ฑ๊ณผ ๋ฌผ๋ฆฌ์ ์œผ๋กœ ํƒ€๋‹นํ•œ ์ ‘์ด‰(interpenetration ๋ฐฉ์ง€)์„ ๋™์‹œ์— ๋ณด์žฅํ•˜๋Š” end-to-end ํ”„๋ ˆ์ž„์›Œํฌ์ž…๋‹ˆ๋‹ค. ์ด์ปค๋จธ์Šค, ๋””์ง€ํ„ธ ๊ด‘๊ณ , ๊ฐ€์ƒ ๋งˆ์ผ€ํŒ…์— ์ง์ ‘ ํ™œ์šฉ ๊ฐ€๋Šฅํ•ฉ๋‹ˆ๋‹ค.

ํŠนํžˆ ์ฃผ๋ชฉํ•  ์ :

  • ์†-๋ฌผ์ฒด ๊ด€ํ†ต(interpenetration) ๋ฌธ์ œ๋ฅผ ๊ณต๊ฐ„ ๊ตฌ์กฐ์  ์ ‘๊ทผ์œผ๋กœ ํ•ด๊ฒฐ

  • ์†ยท์–ผ๊ตด ๋“ฑ ๋ฏผ๊ฐ ์˜์—ญ์˜ ๊ตฌ์กฐ์  ์•ˆ์ •์„ฑ ๋ณด์žฅ

  • ์ด์ปค๋จธ์Šคยท๊ด‘๊ณ ยท๊ฐ€์ƒ ๋งˆ์ผ€ํŒ… ์ง์ ‘ ์ ์šฉ ๊ฐ€๋Šฅํ•œ end-to-end ํŒŒ์ดํ”„๋ผ์ธ

๐ŸŽฏ ์™œ ์ด๊ฒƒ์ด ๊ฒŒ์ž„ ์ฒด์ธ์ €์ธ๊ฐ€? : โ€œ์˜ˆ์˜์ง€๋งŒ ๋ฌผ๋ฆฌ์ ์œผ๋กœ ๋ง์ด ์•ˆ ๋˜๋Š” ์˜์ƒโ€ โ†’ โ€œ๋ฌผ๋ฆฌ ๋ฒ•์น™์„ ์•„๋Š” HOI ์˜์ƒ ํ•ฉ์„ฑโ€

โšก โ€œKV ์บ์‹œ 75%๋ฅผ ๋‚ ๋ ธ๋Š”๋ฐ ๋ˆ„๊ฐ€ ์•Œ์•„์ฑŒ๊นŒ?โ€

SAW-INT4: System-Aware 4-Bit KV-Cache Quantization for Real-World LLM Serving

๐Ÿ›๏ธ ์†Œ์†: Amazon, Princeton, UC Berkeley

๐Ÿท๏ธ ํ•ต์‹ฌ ํ‚ค์›Œ๋“œ: KV-Cache Quantization, LLM Serving, INT4

๐Ÿ’ญ ์ด๋Ÿฐ ์งˆ๋ฌธ์„ ํ•ด๋ณธ ์  ์žˆ๋‚˜์š”?

  • LLM ์„œ๋น™์—์„œ KV ์บ์‹œ ๋ฉ”๋ชจ๋ฆฌ๊ฐ€ ์™œ ๊ทธ๋ ‡๊ฒŒ ํฐ ๋ณ‘๋ชฉ์ธ๊ฐ€์š”?

  • ๊ธฐ์กด KV ์บ์‹œ ์••์ถ• ๊ธฐ๋ฒ•์€ ์™œ ์‹ค์„œ๋น™์—์„œ ์•ˆ ์“ฐ์ด๋‚˜์š”?

  • 4๋น„ํŠธ ์–‘์žํ™”๋กœ 75% ๋ฉ”๋ชจ๋ฆฌ๋ฅผ ์ค„์ด๋ฉด์„œ ์ •ํ™•๋„๋ฅผ ์œ ์ง€ํ•  ์ˆ˜ ์žˆ์„๊นŒ์š”?

LLM ์„œ๋น™์˜ ์ˆจ์€ ๊ดด๋ฌผ์€ KV ์บ์‹œ์ž…๋‹ˆ๋‹ค. ์š”์ฒญ์ด ๋ชฐ๋ฆฌ๋ฉด ๋ฉ”๋ชจ๋ฆฌ๊ฐ€ ํญ๋ฐœํ•˜๊ณ , ๊ธด ์ปจํ…์ŠคํŠธ๋Š” ๋” ์‹ฌํ•ฉ๋‹ˆ๋‹ค. ๊ธฐ์กด ์••์ถ• ๊ธฐ๋ฒ•๋“ค์€ ๋…ผ๋ฌธ์—์„œ๋Š” ์ž˜ ๋˜๋Š”๋ฐ, ์‹ค์„œ๋น™์˜ paged memory layout์ด๋‚˜ fused attention ๊ฐ™์€ ์ œ์•ฝ์„ ๋ฌด์‹œํ•ด์„œ ์‹ค์ œ๋กœ๋Š” ๋ชป ์“ฐ๋Š” ๊ฒฝ์šฐ๊ฐ€ ๋งŽ์•˜์Šต๋‹ˆ๋‹ค. SAW-INT4๋Š” ์‹ค์„œ๋น™ ์‹œ์Šคํ…œ์˜ ์ œ์•ฝ์„ ์ฒ˜์Œ๋ถ€ํ„ฐ ์„ค๊ณ„์— ๋ฐ˜์˜ํ•œ 4๋น„ํŠธ KV ์บ์‹œ ์–‘์žํ™”์ž…๋‹ˆ๋‹ค. FlashAttention ์ฐฝ์‹œ์ž Tri Dao๊ฐ€ ๊ณต์ €์ž๋กœ ์ฐธ์—ฌํ–ˆ์œผ๋ฉฐ, ์‹ค์ œ serving ํ™˜๊ฒฝ์—์„œ ๊ฒ€์ฆ๋˜์—ˆ์Šต๋‹ˆ๋‹ค.

ํŠนํžˆ ์ฃผ๋ชฉํ•  ์ :

  • ์‹ค์„œ๋น™ ์ œ์•ฝ(paged memory, fused attention) ํ˜ธํ™˜ 4๋น„ํŠธ KV ์บ์‹œ ์–‘์žํ™”

  • ๊ธฐ์กด ์••์ถ• ๊ธฐ๋ฒ• ๋Œ€๋น„ ์‹ค๋ฐฐํฌ ๊ฐ€๋Šฅ์„ฑ์—์„œ ์••๋„์  ์šฐ์œ„

  • FlashAttention ์ฐฝ์‹œ์ž Tri Dao + Amazon ๊ณต๋™ ์—ฐ๊ตฌ

๐ŸŽฏ ์™œ ์ด๊ฒƒ์ด ๊ฒŒ์ž„ ์ฒด์ธ์ €์ธ๊ฐ€? : โ€œ๋…ผ๋ฌธ์—์„œ๋งŒ ๋˜๋Š” KV ์บ์‹œ ์••์ถ•โ€ โ†’ โ€œ์‹ค์„œ๋น™ ์‹œ์Šคํ…œ์—์„œ ๋ฐ”๋กœ ์“ธ ์ˆ˜ ์žˆ๋Š” 4๋น„ํŠธ ์–‘์žํ™”โ€

๐Ÿ—บ๏ธ โ€œ๋ธ”๋ž™๋ฐ•์Šค ์˜์ƒ์—์„œ 3D ์ฐจ๋Ÿ‰์„ ๋ฝ‘์•„๋‚ธ๋‹คโ€

Asset Harvester: Extracting 3D Assets from Autonomous Driving Logs for Simulation

๐Ÿ›๏ธ ์†Œ์†: NVIDIA, University of Toronto

๐Ÿท๏ธ ํ•ต์‹ฌ ํ‚ค์›Œ๋“œ: 3D Asset Extraction, Autonomous Driving, Simulation

๐Ÿ’ญ ์ด๋Ÿฐ ์งˆ๋ฌธ์„ ํ•ด๋ณธ ์  ์žˆ๋‚˜์š”?

  • ์ž์œจ์ฃผํ–‰ ์‹œ๋ฎฌ๋ ˆ์ด์…˜์— ์“ธ 3D ์ฐจ๋Ÿ‰ ๋ชจ๋ธ์€ ์–ด๋””์„œ ๊ตฌํ•˜๋‚˜์š”?

  • ์ฃผํ–‰ ๋กœ๊ทธ ์˜์ƒ์—์„œ ์ฐจ๋Ÿ‰์„ 3D ์—์…‹์œผ๋กœ ๋ฐ”๋กœ ์ถ”์ถœํ•  ์ˆ˜ ์žˆ๋‹ค๋ฉด?

  • Neural scene reconstruction์€ ์™œ ๊ฐœ๋ณ„ ๋ฌผ์ฒด๋ฅผ ์กฐ์ž‘ ๋ชป ํ•˜๋‚˜์š”?

์ž์œจ์ฃผํ–‰ ์‹œ๋ฎฌ๋ ˆ์ด์…˜์˜ ์•„ํ‚ฌ๋ ˆ์Šค๊ฑด์€ 3D ์—์…‹์ž…๋‹ˆ๋‹ค. Neural scene reconstruction์€ ์žฅ๋ฉด ์ „์ฒด๋ฅผ ๋ณต์›ํ•˜์ง€๋งŒ, ๊ฐœ๋ณ„ ์ฐจ๋Ÿ‰์„ ๊บผ๋‚ด์„œ ์ด๋™์‹œํ‚ค๊ฑฐ๋‚˜ ๋‹ค๋ฅธ ์‹œ๋‚˜๋ฆฌ์˜ค์— ๋ฐฐ์น˜ํ•˜๋Š” ๊ฑด ๋ถˆ๊ฐ€๋Šฅํ–ˆ์Šต๋‹ˆ๋‹ค. NVIDIA์˜ Asset Harvester๋Š” ์ฃผํ–‰ ๋กœ๊ทธ์—์„œ ๊ฐœ๋ณ„ ์ฐจ๋Ÿ‰์˜ ์™„์ „ํ•œ 3D ์—์…‹์„ ์ž๋™ ์ถ”์ถœํ•˜๋Š” image-to-3D ํŒŒ์ดํ”„๋ผ์ธ์ž…๋‹ˆ๋‹ค. Sanja Fidler(NVIDIA VP of AI Research)๊ฐ€ ์ด๋„๋Š” ํŒ€์œผ๋กœ, ์ถ”์ถœ๋œ ์—์…‹์€ ์—์ด์ „ํŠธ ์กฐ์ž‘๊ณผ ๋Œ€๊ฐ๋„ novel-view synthesis๊ฐ€ ๊ฐ€๋Šฅํ•ฉ๋‹ˆ๋‹ค.

ํŠนํžˆ ์ฃผ๋ชฉํ•  ์ :

  • ์ฃผํ–‰ ๋กœ๊ทธ โ†’ ๊ฐœ๋ณ„ ์ฐจ๋Ÿ‰ ์™„์ „ํ•œ 3D ์—์…‹ ์ž๋™ ์ถ”์ถœ

  • ์—์ด์ „ํŠธ ์กฐ์ž‘ + ๋Œ€๊ฐ๋„ novel-view synthesis ์ง€์› โ€” ์‹œ๋ฎฌ๋ ˆ์ด์…˜ ์ง์ ‘ ํˆฌ์ž… ๊ฐ€๋Šฅ

  • NVIDIA AI Research VP Sanja Fidler ์ฃผ๋„

๐ŸŽฏ ์™œ ์ด๊ฒƒ์ด ๊ฒŒ์ž„ ์ฒด์ธ์ €์ธ๊ฐ€? : โ€œ3D ์—์…‹์„ ์ˆ˜์ž‘์—…์œผ๋กœ ๋ชจ๋ธ๋งโ€ โ†’ โ€œ์ฃผํ–‰ ๋กœ๊ทธ๋งŒ ์žˆ์œผ๋ฉด ์‹œ๋ฎฌ๋ ˆ์ด์…˜์šฉ 3D ์ฐจ๋Ÿ‰์ด ์ž๋™์œผ๋กœ ๋‚˜์˜จ๋‹คโ€

๋งค์ฃผ ๋ชฉ์š”์ผ ์˜ค์ „ 8์‹œ,
๋ฐ”์œ ๋‹น์‹ ์„ ๊ธฐ์ˆ  ๋ฐœ์ „์— ๋’ค์ณ์ง€์ง€ ์•Š๊ฒŒ ๋งŒ๋“ค์–ด์ค„
์ตœ์‹  AI ํŠธ๋ Œ๋“œ ์š”์•ฝ๋ณธ์ด ์ „๋‹ฌ๋ฉ๋‹ˆ๋‹ค! ๐Ÿš€