25.12. 1แแ ฎแแ ก | Alibaba, ByteDance, NVIDIA, MIT, Tencent, AI2, CMU, NYU, Google DeepMind

๊ธ์ฃผ ์บ์นํ์ดํผ๋ Alibaba, ByteDance, NVIDIA, MIT, Tencent, AI2, CMU, NYU, Google DeepMind์ ํจ๊ปํฉ๋๋ค. 3๋ถ๋ง ํฌ์ํด ์ฑ ๋๋ฌ๋ณด๊ณ , ๋น ๋ฅด๊ฒ ๋ฐ๋๋ ๊ธฐ์ ์ ๋ฐฉํฅ์ฑ์ ๋์น์ง ๋ง์ธ์!
๐ ์ด๋ฒ ์ฃผ AI ์ฐ๊ตฌ์์๋ ์ํ ๋ชจ๋ธ์ ํจ์จ์ฑ ํ๋ช ์ด ๋๋๋ฌ์ง๋ฉฐ, 8B ํ๋ผ๋ฏธํฐ ๋ชจ๋ธ์ด ํ๋ก ํฐ์ด ๋ชจ๋ธ์ ๋ฅ๊ฐํ๊ณ , ์ฟผ๋ฆฌ๋น $0.0019๋ก ์ฌ์ธต ์ฐ๊ตฌ๋ฅผ ์ํํ๋ ๋ฑ "์์ง๋ง ๊ฐํ" ํจ๋ฌ๋ค์์ด ํ์ฐ๋๊ณ ์์ต๋๋ค.
๐ ๋ฉํฐ๋ชจ๋ฌ AI์ ๊ฒฝ๊ณ๊ฐ ํ์ฅ๋์ด 256K ํ ํฐ ๋น์ -์ธ์ด ๋ชจ๋ธ, ๋น๋์ค ์๊ณต๊ฐ ๊ทธ๋ผ์ด๋ฉ, 360๋ ํด๋จธ๋ ธ์ด๋ ์๊ฐ ํ์ ๋ฑ ์ค์ธ๊ณ ์์ฉ์ ์ํ ํ์ ์ ์ธ ์ฐ๊ตฌ๊ฐ ํ๋ฐํ ์งํ๋๊ณ ์์ต๋๋ค.
๐๏ธ 256K ํ ํฐ์ผ๋ก ์ธ์์ ์ฝ๋ค - ์คํ์์ค VLM์ ์๋ก์ด ์ ์
๐๏ธ ์์: Alibaba
๐ท๏ธ ํต์ฌ ํค์๋: Vision-Language Model, 256K Context, Multimodal Reasoning
๐ญ ์ด๋ฐ ์ง๋ฌธ์ ํด๋ณธ ์ ์๋์?
"ํ ๋ฒ์ ์๋ฐฑ ํ์ด์ง์ ๋ฌธ์์ ์์ญ ๋ถ์ ์์์ ๋์์ ์ดํดํ ์ ์์๊น?"
"39๊ฐ ์ธ์ด์ ํ ์คํธ๋ฅผ ์ด๋ฏธ์ง์์ ์ ํํ ์ธ์ํ๋ AI๊ฐ ๊ฐ๋ฅํ ๊น?"
"์คํ์์ค ๋ชจ๋ธ์ด ๋ ์ ๋ชจ๋ธ์ ๋ฒฝ์ ๋์ ์ ์์๊น?"
๋ง๋ผํค ์ ์๊ฐ 42.195km๋ฅผ ์์ฃผํ๋ฏ, Qwen3-VL์ 256K ํ ํฐ์ด๋ผ๋ ์ด์ฅ๊ฑฐ๋ฆฌ ์ปจํ ์คํธ๋ฅผ ์๋ฒฝํ ์ํํฉ๋๋ค. ํ ์คํธ, ์ด๋ฏธ์ง, ๋น๋์ค๋ฅผ ์์ ๋กญ๊ฒ ๋๋๋ค๋ฉฐ MMMU, MathVista ๋ฑ ์ฃผ์ ๋ฒค์น๋งํฌ์์ SOTA๋ฅผ ๋ฌ์ฑํ์ต๋๋ค. ํนํ ์ฃผ๋ชฉํ ์ :
256K ๋ค์ดํฐ๋ธ ์ปจํ ์คํธ ์๋์ฐ๋ก ์ด์ฅ๋ฌธ ๋ฉํฐ๋ชจ๋ฌ ์ดํด ์คํ
๋๊ธ ํ ์คํธ ์ ์ฉ ๋ฐฑ๋ณธ์ ๋ฅ๊ฐํ๋ ์์ ํ ์คํธ ์ดํด๋ ฅ๊น์ง ํ๋ณด
2B๋ถํฐ 235B๊น์ง Dense ๋ฐ MoE ๋ณํ์ผ๋ก ๋ค์ํ ํ์ฉ ์๋๋ฆฌ์ค ์ง์
๐ฏ ์ ์ด๊ฒ์ด ๊ฒ์ ์ฒด์ธ์ ์ธ๊ฐ? : ์ ํ๋ ์ปจํ ์คํธ์ ๋ฉํฐ๋ชจ๋ฌ โ 256K ํ ํฐ ํตํฉ ๋ฉํฐ๋ชจ๋ฌ ์ดํด์ ์ ํ์ ๊ฐ์กฐ
๐ ๋ ์์ธํ ๋ด์ฉ์ด ๊ถ๊ธํ๋ค๋ฉด : ๋ ผ๋ฌธ ๋งํฌ
๐ฌ "GPT-5์ Gemini 3 Pro๋ฅผ ๋์ด์ฐ๋ค" - ๋น๋์ค ์ดํด์ ์ ์ฅ์ ์ด๋ค
๐๏ธ ์์: ByteDance
๐ท๏ธ ํต์ฌ ํค์๋: Spatio-Temporal Grounding, Video QA, Temporal Retrieval
๐ญ ์ด๋ฐ ์ง๋ฌธ์ ํด๋ณธ ์ ์๋์?
"30๋ถ์ง๋ฆฌ ์์์์ ํน์ ์ธ๋ฌผ์ด ๋ฑ์ฅํ๋ ์ ํํ ์๊ฐ๊ณผ ์์น๋ฅผ ์ฐพ์ ์ ์์๊น?"
"๋น๋์ค ์ ๋ณต์กํ ํ๋์ ์๊ณต๊ฐ์ ์ผ๋ก ์ ๋ฐํ๊ฒ ์ถ์ ํ ์ ์์๊น?"
"์คํ์์ค ๋ชจ๋ธ์ด ๋ ์ ๊ฑฐ๋ ๋ชจ๋ธ๋ค์ ๋ฅ๊ฐํ ์ ์์๊น?"
CCTV ๊ด์ ์ฌ๊ฐ ์์ฒ ์๊ฐ์ ์์์์ ์ฉ์์๋ฅผ ์ฐพ์๋ด๋ฏ, Vidi2๋ ํ ์คํธ ์ฟผ๋ฆฌ๋ง์ผ๋ก ๋น๋์ค ์ ์๊ฐ๊ณผ ๊ณต๊ฐ์ ์ ๋ฐํ๊ฒ ํน์ ํฉ๋๋ค. Gemini 3 Pro์ GPT-5๋ฅผ ํฐ ํญ์ผ๋ก ์์๋ฉฐ, ์๊ณต๊ฐ ๊ทธ๋ผ์ด๋ฉ(STG)์ด๋ผ๋ ์๋ก์ด ์์ญ์ ๊ฐ์ฒํ์ต๋๋ค. ํนํ ์ฃผ๋ชฉํ ์ :
์๋ํฌ์๋ ์๊ณต๊ฐ ๊ทธ๋ผ์ด๋ฉ์ผ๋ก ํ์์คํฌํ์ ๋ฐ์ด๋ฉ ๋ฐ์ค ๋์ ์ถ๋ ฅ
VUE-TR-V2, VUE-STG ๋ฒค์น๋งํฌ์์ GPT-5, Gemini 3 Pro ๋ํญ ๋ฅ๊ฐ
10์ด~30๋ถ ์์๊น์ง ์ฅ๋ฌธ๋งฅ ์ถ๋ก ์ง์
๐ฏ ์ ์ด๊ฒ์ด ๊ฒ์ ์ฒด์ธ์ ์ธ๊ฐ? : ๋จ์ ๋น๋์ค ์บก์ ๋ โ ์ ๋ฐํ ์๊ณต๊ฐ ๊ทธ๋ผ์ด๋ฉ์ ์ ํ์ ๊ฐ์กฐ
๐ ๋ ์์ธํ ๋ด์ฉ์ด ๊ถ๊ธํ๋ค๋ฉด : ๋ ผ๋ฌธ ๋งํฌ
๐ป 8B ์งํ์๊ฐ GPT-5 ์ค์ผ์คํธ๋ผ๋ฅผ ์ด๋๋ค
๐๏ธ ์์: NVIDIA
๐ท๏ธ ํต์ฌ ํค์๋: Tool Orchestration, Reinforcement Learning, Agentic AI
๐ญ ์ด๋ฐ ์ง๋ฌธ์ ํด๋ณธ ์ ์๋์?
"์์ ๋ชจ๋ธ์ด ๊ฑฐ๋ ๋ชจ๋ธ๋ค์ ์กฐ์จํ์ฌ ๋ ๋์ ๊ฒฐ๊ณผ๋ฅผ ๋ผ ์ ์์๊น?"
"AI ์์ด์ ํธ์ ๋น์ฉ์ ํ๊ธฐ์ ์ผ๋ก ์ค์ด๋ฉด์ ์ฑ๋ฅ์ ์ ์งํ ์ ์์๊น?"
"๋๊ตฌ ์ฌ์ฉ์ ํจ์จ์ฑ๊ณผ ์ ํ์ฑ์ ๋์์ ์ต์ ํํ ์ ์์๊น?"
์ค์ผ์คํธ๋ผ ์งํ์๊ฐ ๊ฐ ์ ๊ธฐ์ ์ฅ์ ์ ์กฐํ์ํค๋ฏ, 8B ํ๋ผ๋ฏธํฐ์ Orchestrator๋ GPT-5, ์ ๋ฌธ ์ฝ๋ฉ ๋ชจ๋ธ, ์ํ ๋ชจ๋ธ ๋ฑ์ ์ ์ฌ์ ์์ ํธ์ถํฉ๋๋ค. Humanity's Last Exam์์ GPT-5(35.1%)๋ฅผ ๋์ด 37.1%๋ฅผ ๋ฌ์ฑํ๋ฉด์๋ ๋น์ฉ์ 2.5๋ฐฐ ์ ๊ฐํ์ต๋๋ค. ํนํ ์ฃผ๋ชฉํ ์ :
๊ฒฐ๊ณผ, ํจ์จ์ฑ, ์ฌ์ฉ์ ์ ํธ๋๋ฅผ ๋์ ์ต์ ํํ๋ ๋ค๋ชฉ์ RL ํ๋ จ
ฯ2-Bench, FRAMES์์ GPT-5 ๋๋น 30% ๋น์ฉ์ผ๋ก ์ฐ์ํ ์ฑ๋ฅ
๋ฏธ์ง์ ๋๊ตฌ์๋ ๊ฒฌ๊ณ ํ๊ฒ ์ผ๋ฐํ๋๋ ๊ฐ๊ฑด์ฑ
๐ฏ ์ ์ด๊ฒ์ด ๊ฒ์ ์ฒด์ธ์ ์ธ๊ฐ? : ๋จ์ผ ๊ฑฐ๋ ๋ชจ๋ธ ์์กด โ ์ํ ์ค์ผ์คํธ๋ ์ดํฐ ๊ธฐ๋ฐ ๋๊ตฌ ์กฐ์จ์ ์ ํ์ ๊ฐ์กฐ
๐ ๋ ์์ธํ ๋ด์ฉ์ด ๊ถ๊ธํ๋ค๋ฉด : ๋ ผ๋ฌธ ๋งํฌ
๐จ ์คํ ์ธ์ฝ๋ ์์ด ํฝ์ ์์ ์ง์ - ํ์ฐ ๋ชจ๋ธ์ ์๋ก์ด ๊ณต์
๐๏ธ ์์: NVIDIA
๐ท๏ธ ํต์ฌ ํค์๋: Pixel-Space Diffusion, Dual-Level DiT, End-to-End Training
๐ญ ์ด๋ฐ ์ง๋ฌธ์ ํด๋ณธ ์ ์๋์?
"VAE์ ์์ค ์์ด ํฝ์ ์์ค์์ ์ง์ ์ด๋ฏธ์ง๋ฅผ ์์ฑํ ์ ์์๊น?"
"์ ์ฌ ๊ณต๊ฐ๊ณผ ํฝ์ ๊ณต๊ฐ ์ค ์ด๋ ๊ฒ์ด ์ง์ ํ ๊ณ ํ์ง ์์ฑ์ ์ ๋ฆฌํ ๊น?"
"๋จ์ผ ์คํ ์ด์ง๋ก ์๋ํฌ์๋ ์ด๋ฏธ์ง ์์ฑ์ด ๊ฐ๋ฅํ ๊น?"
ํ๊ฐ๊ฐ ์บ๋ฒ์ค์ ์ง์ ๋ถ์ ๋๋ฏ, PixelDiT๋ ์ ์ฌ ๊ณต๊ฐ์ ๊ฑฐ์น์ง ์๊ณ ํฝ์ ์์ ๋ฐ๋ก ํ์ฐ์ ์ํํฉ๋๋ค. ํจ์น ๋ ๋ฒจ DiT๊ฐ ์ ์ญ ์๋ฏธ๋ฅผ, ํฝ์ ๋ ๋ฒจ DiT๊ฐ ์ธ๋ถ ํ ์ค์ฒ๋ฅผ ๋ด๋นํ๋ ์ด์ค ๊ตฌ์กฐ๋ก ImageNet 256ร256์์ FID 1.61์ ๋ฌ์ฑํ์ต๋๋ค. ํนํ ์ฃผ๋ชฉํ ์ :
VAE ์์ด ๋จ์ผ ์คํ ์ด์ง ์๋ํฌ์๋ ํ์ต์ผ๋ก ์ค๋ฅ ๋์ ์ ๊ฑฐ
๊ธฐ์กด ํฝ์ ๊ณต๊ฐ ์์ฑ ๋ชจ๋ธ๋ค์ ํฐ ํญ์ผ๋ก ๋ฅ๊ฐ
1024ร1024 ํ ์คํธ-์ด๋ฏธ์ง ์์ฑ๊น์ง ํ์ฅ, ์ด๋ฏธ์ง ํธ์ง์์๋ ์ฐ์
๐ฏ ์ ์ด๊ฒ์ด ๊ฒ์ ์ฒด์ธ์ ์ธ๊ฐ? : 2๋จ๊ณ ์ ์ฌ ๊ณต๊ฐ ํ์ฐ โ ๋จ์ผ ์คํ ์ด์ง ํฝ์ ๊ณต๊ฐ ํ์ฐ์ ์ ํ์ ๊ฐ์กฐ
๐ ๋ ์์ธํ ๋ด์ฉ์ด ๊ถ๊ธํ๋ค๋ฉด : ๋ ผ๋ฌธ ๋งํฌ
๐ AI ๋ฐ์ ์ 89%๋ ์ด๋์ ์์๊น? - ์๊ณ ๋ฆฌ์ฆ ์ง๋ณด์ ๊ธฐ์์ ์ถ์ ํ๋ค
๐๏ธ ์์: MIT
๐ท๏ธ ํต์ฌ ํค์๋: Algorithmic Efficiency, Scale-Dependent Innovation, Transformer
๐ญ ์ด๋ฐ ์ง๋ฌธ์ ํด๋ณธ ์ ์๋์?
"AI์ ๊ธ๊ฒฉํ ๋ฐ์ ์ ์๊ณ ๋ฆฌ์ฆ ํ์ ๋๋ถ์ผ๊น, ๋จ์ํ ์ปดํจํ ํ์ฅ ๋๋ถ์ผ๊น?"
"ํธ๋์คํฌ๋จธ ๊ฐ์ ํ์ ์ด ์์๋ค๋ฉด ์ค๋๋ ์ AI๊ฐ ๊ฐ๋ฅํ์๊น?"
"์์ผ๋ก์ AI ๋ฐ์ ์ ์ํด ์ด๋์ ํฌ์ํด์ผ ํ ๊น?"
๊ณ ๊ณ ํ์๊ฐ ์ ๋ฌผ์ ๊ธฐ์์ ์ถ์ ํ๋ฏ, MIT ์ฐ๊ตฌ์ง์ AI ์๊ณ ๋ฆฌ์ฆ ํจ์จ์ฑ ํฅ์์ ๊ทผ์์ ๋ถ์ํ์ต๋๋ค. ๋๋๊ฒ๋ 2023๋ ์ปดํจํธ ํ๋ก ํฐ์ด ๊ธฐ์ค ์ด 6,930๋ฐฐ ํจ์จ์ฑ ํฅ์์ 89%๊ฐ ํธ๋์คํฌ๋จธ, ์น์น ๋ผ ์ค์ผ์ผ๋ง ๊ฐ์ ์ค์ผ์ผ ์์กด์ ํ์ ์์ ๋น๋กฏ๋์์ต๋๋ค. ํนํ ์ฃผ๋ชฉํ ์ :
์ ๋์ ๋ถํด๋ฅผ ํตํด ์๊ณ ๋ฆฌ์ฆ ์ง๋ณด์ ์์ฒ์ ์ต์ด๋ก ๊ท๋ช
์ค์ผ์ผ ๋ถ๋ณ ๊ฐ์ ์ 10% ๋ฏธ๋ง์ผ๋ก ์ค์ผ์ผ ์์กด ํ์ ์ด ์๋์
AI ํฌ์ ๋ฐ ์ฐ๊ตฌ ๋ฐฉํฅ ์ค์ ์ ์ค์ํ ์์ฌ์ ์ ๊ณต
๐ฏ ์ ์ด๊ฒ์ด ๊ฒ์ ์ฒด์ธ์ ์ธ๊ฐ? : ๋ง์ฐํ "์๊ณ ๋ฆฌ์ฆ ๋ฐ์ " โ ์ค์ผ์ผ ์์กด/๋ถ๋ณ ํ์ ์ ์ ๋์ ๊ตฌ๋ถ์ ์ ํ์ ๊ฐ์กฐ
๐ ๋ ์์ธํ ๋ด์ฉ์ด ๊ถ๊ธํ๋ค๋ฉด : ๋ ผ๋ฌธ ๋งํฌ
๐ 1B๋ก ์์ฉ ์์ค ๋ฌ์ฑ - OCR์ ๊ฐํํ์ต์ ์ต์ด ์ ์ฉํ๋ค
๐๏ธ ์์: Tencent
๐ท๏ธ ํต์ฌ ํค์๋: End-to-End OCR, Reinforcement Learning, Lightweight VLM
๐ญ ์ด๋ฐ ์ง๋ฌธ์ ํด๋ณธ ์ ์๋์?
"OCR ํ์ดํ๋ผ์ธ์ ๋ณต์กํ ์ ์ฒ๋ฆฌ ์์ด ์๋ํฌ์๋๋ก ํ ์คํธ๋ฅผ ์ธ์ํ ์ ์์๊น?"
"๊ฐํํ์ต์ด OCR ์ฑ๋ฅ์ ํ๊ธฐ์ ์ผ๋ก ๊ฐ์ ํ ์ ์์๊น?"
"1B ํ๋ผ๋ฏธํฐ๋ก ์์ฉ API ์์ค์ ์ ํ๋๋ฅผ ๋ฌ์ฑํ ์ ์์๊น?"
์๋ จ๋ ์์๊ฐ๊ฐ ์ด๋ค ๊ธ์จ์ฒด๋ ์ฝ์ด๋ด๋ฏ, HunyuanOCR์ 1B ํ๋ผ๋ฏธํฐ๋ง์ผ๋ก ๋ณต์กํ ๋ ์ด์์, ๋ค๊ตญ์ด, ์๊ธ์จ๊น์ง ์ ํํ ์ธ์ํฉ๋๋ค. ์ ๊ณ ์ต์ด๋ก GRPO ๊ฐํํ์ต์ OCR์ ์ ์ฉํ์ฌ ICDAR 2025 DIMT ์ฑ๋ฆฐ์ง 1์๋ฅผ ์ฐจ์งํ์ต๋๋ค. ํนํ ์ฃผ๋ชฉํ ์ :
์์ ์๋ํฌ์๋ ํจ๋ฌ๋ค์์ผ๋ก ์ ์ฒ๋ฆฌ ๋ชจ๋ ์์กด์ฑ ์ ๊ฑฐ
Qwen3-VL-4B ๋ฑ ๋ ํฐ ๋ชจ๋ธ๋ค์ ๋ฅ๊ฐํ๋ ์ฑ๋ฅ
์คํํ , ํ์ฑ, ์ ๋ณด ์ถ์ถ, VQA, ๋ฒ์ญ๊น์ง ํตํฉ ์ง์
๐ฏ ์ ์ด๊ฒ์ด ๊ฒ์ ์ฒด์ธ์ ์ธ๊ฐ? : ํ์ดํ๋ผ์ธ ๊ธฐ๋ฐ OCR โ RL ์ต์ ํ ์๋ํฌ์๋ OCR์ ์ ํ์ ๊ฐ์กฐ
๐ ๋ ์์ธํ ๋ด์ฉ์ด ๊ถ๊ธํ๋ค๋ฉด : ๋ ผ๋ฌธ ๋งํฌ
๐ฌ ์ฟผ๋ฆฌ๋น $0.0019๋ก ์ฌ์ธต ์ฐ๊ตฌ๋ฅผ - ์คํ์์ค์ ์ญ์ต
๐๏ธ ์์: University of Washington, Carnegie Mellon University, AI2, MIT
๐ท๏ธ ํต์ฌ ํค์๋: Deep Research, Evolving Rubrics, Long-Form QA
๐ญ ์ด๋ฐ ์ง๋ฌธ์ ํด๋ณธ ์ ์๋์?
"OpenAI Deep Research ์์ค์ ์ฌ์ธต ์ฐ๊ตฌ๋ฅผ ์คํ์์ค๋ก ๊ตฌํํ ์ ์์๊น?"
"์ฅ๋ฌธ์ ์ฐ๊ตฌ ๋ณด๊ณ ์ ์์ฑ์ ์ด๋ป๊ฒ ๊ฐํํ์ต์ผ๋ก ์ต์ ํํ ์ ์์๊น?"
"์ฌ์ธต ์ฐ๊ตฌ AI์ ๋น์ฉ์ 1/500๋ก ์ค์ผ ์ ์์๊น?"
๋์๊ด ์ฌ์๊ฐ ์์ฒ ๊ถ์ ์ฑ ์์ ์ ๋ณด๋ฅผ ์ข ํฉํ๋ฏ, DR Tulu-8B๋ ๋ค๋จ๊ณ ๊ฒ์๊ณผ ์ข ํฉ์ ํตํด ์ฅ๋ฌธ์ ์ฐ๊ตฌ ๋ณด๊ณ ์๋ฅผ ์์ฑํฉ๋๋ค. ์งํํ๋ ๋ฃจ๋ธ๋ฆญ(RLER)์ผ๋ก ํ์ตํ์ฌ ์ฟผ๋ฆฌ๋น $0.0019์ ๋น์ฉ์ผ๋ก ๋ ์ ์์คํ ๊ณผ ๋๋ฑํ ์ฑ๋ฅ์ ๋ฌ์ฑํ์ต๋๋ค. ํนํ ์ฃผ๋ชฉํ ์ :
์ ์ฑ ๋ชจ๋ธ๊ณผ ํจ๊ป ์งํํ๋ ๋ฃจ๋ธ๋ฆญ์ผ๋ก ์ฅ๋ฌธ ์ฐ๊ตฌ์ ์ต์ ํ
OpenAI Deep Research, GPT-5+Search์ ๋๋ฑ ๋๋ ์ฐ์ํ ์ฑ๋ฅ
๊ณผํ, ์๋ฃ, ์ผ๋ฐ ๋๋ฉ์ธ์์ ์ผ๊ด๋ ์ฐ์์ฑ
๐ฏ ์ ์ด๊ฒ์ด ๊ฒ์ ์ฒด์ธ์ ์ธ๊ฐ? : ๊ณ ๋น์ฉ ๋ ์ ์ฌ์ธต ์ฐ๊ตฌ โ ์ ๋น์ฉ ์คํ์์ค ์ฌ์ธต ์ฐ๊ตฌ์ ์ ํ์ ๊ฐ์กฐ
๐ ๋ ์์ธํ ๋ด์ฉ์ด ๊ถ๊ธํ๋ค๋ฉด : ๋ ผ๋ฌธ ๋งํฌ
๐ 3DGS๋ก ์์จ์ฃผํ์ ์์ ์ ์๋ฎฌ๋ ์ด์ ํ๋ค
๐๏ธ ์์: Carnegie Mellon University, Stanford University, NVIDIA
๐ท๏ธ ํต์ฌ ํค์๋: 3D Gaussian Splatting, Closed-Loop Simulation, Policy Adaptation
๐ญ ์ด๋ฐ ์ง๋ฌธ์ ํด๋ณธ ์ ์๋์?
"์์จ์ฃผํ AI๋ฅผ ์ค์ ๋๋ก ์์ด ํ์ค์ ์ผ๋ก ํ๋ จํ ์ ์์๊น?"
"์๋ฎฌ๋ ์ด์ ๊ณผ ์ค์ ํ๊ฒฝ์ ๊ฒฉ์ฐจ๋ฅผ ์ด๋ป๊ฒ ์ค์ผ ์ ์์๊น?"
"ํ์ ๋ฃจํ ํ๊ฐ์์ ์์ ์ฑ์ ๊ทน๋ํํ ์ ์์๊น?"
๋นํ ์๋ฎฌ๋ ์ดํฐ์์ ํ์ผ๋ฟ์ด ํ๋ จํ๋ฏ, MPA๋ 3D Gaussian Splatting์ผ๋ก ๊ตฌ์ถํ ํฌํ ๋ฆฌ์ผ๋ฆฌ์คํฑ ํ๊ฒฝ์์ ์์จ์ฃผํ ์ ์ฑ ์ ํ์ตํฉ๋๋ค. ํ์ ๋ฃจํ ์๋ฎฌ๋ ์ด์ ์ ํตํด ๋ถํฌ ์ธ ์ํฉ์์์ ๋์๋ ฅ์ ํฌ๊ฒ ํฅ์์์ผฐ์ต๋๋ค. ํนํ ์ฃผ๋ชฉํ ์ :
3DGS ๊ธฐ๋ฐ ๊ณ ํ์ง ๋ ๋๋ง์ผ๋ก ํ์ค-์๋ฎฌ๋ ์ด์ ๊ฒฉ์ฐจ ์ต์ํ
๋ชจ๋ฐฉ ํ์ต ๋๋น ์ถฉ๋๋ฅ 3๋ฐฐ ๊ฐ์
๋ค์ํ ๋ฐ์ดํฐ์ ๊ณผ ์๋๋ฆฌ์ค์ ์ ์ฉ ๊ฐ๋ฅ
๐ฏ ์ ์ด๊ฒ์ด ๊ฒ์ ์ฒด์ธ์ ์ธ๊ฐ? : ๊ฐ๋ฐฉ ๋ฃจํ ํ๊ฐ โ 3DGS ๊ธฐ๋ฐ ํ์ ๋ฃจํ ์ ์์ ์ ํ์ ๊ฐ์กฐ
๐ ๋ ์์ธํ ๋ด์ฉ์ด ๊ถ๊ธํ๋ค๋ฉด : ๋ ผ๋ฌธ ๋งํฌ
๐ 360๋๋ก ์ธ์์ ํ์ํ๋ค - ํด๋จธ๋ ธ์ด๋ ์๊ฐ์ ์ ์งํ
๐๏ธ ์์: NYU, NVIDIA, UC Berkeley, Stanford University
๐ท๏ธ ํต์ฌ ํค์๋: Humanoid Visual Search, 360ยฐ Panorama, Embodied AI
๐ญ ์ด๋ฐ ์ง๋ฌธ์ ํด๋ณธ ์ ์๋์?
"๋ก๋ด์ด ์ฌ๋์ฒ๋ผ ๊ณ ๊ฐ๋ฅผ ๋๋ ค ์ฃผ๋ณ์ ํ์ํ ์ ์์๊น?"
"๋ณต์กํ ์ค์ ํ๊ฒฝ์์ ํน์ ๊ฐ์ฒด๋ ๊ฒฝ๋ก๋ฅผ ํจ์จ์ ์ผ๋ก ์ฐพ์ ์ ์์๊น?"
"์คํ์์ค ๋ชจ๋ธ์ด ๋ ์ ๋ชจ๋ธ์ ์๊ฐ ํ์ ๋ฅ๋ ฅ์ ๋ฅ๊ฐํ ์ ์์๊น?"
์ธ๊ฐ์ด ๊ณตํญ์์ ํ์งํ์ ์ฐพ์ ๊ณ ๊ฐ๋ฅผ ๋๋ฆฌ๋ฒ๊ฑฐ๋ฆฌ๋ฏ, ํด๋จธ๋ ธ์ด๋ ์์ด์ ํธ๋ 360๋ ํ๋ ธ๋ผ๋ง ์ด๋ฏธ์ง์์ ๋ฅ๋์ ์ผ๋ก ๋จธ๋ฆฌ๋ฅผ ํ์ ํ๋ฉฐ ๋ชฉํ๋ฅผ ํ์ํฉ๋๋ค. ๊ตํต ํ๋ธ, ๋ํ ๋งค์ฅ ๋ฑ ์ค์ ํ๊ฒฝ์ H* Bench์์ ์คํ์์ค ๋ชจ๋ธ์ด ๋ ์ ๋ชจ๋ธ์ ๋ฅ๊ฐํ์ต๋๋ค. ํนํ ์ฃผ๋ชฉํ ์ :
์ ์ ์ด๋ฏธ์ง ํ์์ ๋์ด ๋ฅ๋์ ๋๋ถ ํ์ ๊ธฐ๋ฐ ํ์ ํจ๋ฌ๋ค์ ์ ์
๊ฐ์ ํ๊ฒฝ์ ๋์ด ๋ณต์กํ ์ผ์ธ ํ๊ฒฝ์์์ ๋ฒค์น๋งํฌ ๊ตฌ์ถ
๊ฐ์ฒด ํ์๊ณผ ๊ฒฝ๋ก ํ์ ๋ชจ๋ ์ง์
๐ฏ ์ ์ด๊ฒ์ด ๊ฒ์ ์ฒด์ธ์ ์ธ๊ฐ? : ์ ์ ์ด๋ฏธ์ง ์ธ์ โ ๋ฅ๋์ 360๋ ์๊ฐ ํ์์ ์ ํ์ ๊ฐ์กฐ
๐ ๋ ์์ธํ ๋ด์ฉ์ด ๊ถ๊ธํ๋ค๋ฉด : ๋ ผ๋ฌธ ๋งํฌ
๐๏ธ ์์: Google DeepMind
๐ท๏ธ ํต์ฌ ํค์๋: Variational Bounds, Reweighted Loss, Masked Diffusion
๐ญ ์ด๋ฐ ์ง๋ฌธ์ ํด๋ณธ ์ ์๋์?
"ํ์ฐ ๋ชจ๋ธ ํ๋ จ์์ ๋๋ฆฌ ์ฐ์ด๋ ์ฌ๊ฐ์ค ์์ค์ ์ด๋ก ์ ๊ทผ๊ฑฐ๋ ๋ฌด์์ผ๊น?"
"ELBO๋ณด๋ค ๋ ์ข์ ๋ณ๋ถ ํํ์ ๊ตฌ์ฑํ ์ ์์๊น?"
"๋ง์คํฌ ํ์ฐ ๋ชจ๋ธ๋ ์ฐ์ ํ์ฐ ๋ชจ๋ธ ์์ค์ ํ์ง์ ๋๋ฌํ ์ ์์๊น?"
์ํ์๊ฐ ๊ฒฝํ์ ๋ฒ์น์ ์ด๋ก ์ ์ฆ๋ช ์ ๋ํ๋ฏ, DeepMind ์ฐ๊ตฌ์ง์ ์ฌ๊ฐ์ค ์์ค์ด ํ์ค ELBO๋ณด๋ค ๊ฐ์ ๋ ๋ณ๋ถ ํํ์์ ์ฆ๋ช ํ์ต๋๋ค. ์ด ํ๋ ์์ํฌ๋ฅผ ๋ง์คํฌ ํ์ฐ์ ์ ์ฉํ์ฌ ImageNet 64ร64์์ FID 1.92๋ฅผ ๋ฌ์ฑ, ์ฐ์ ํ์ฐ ๋ชจ๋ธ์ ๊ทผ์ ํ์ต๋๋ค. ํนํ ์ฃผ๋ชฉํ ์ :
์๊ฐ ์์กด์ ๋ณ๋ถ ํํ์ ๊ณ๋จ์ ๊ตฌ์ฑ์ผ๋ก KL ๋ฐ์ฐ ๊ฐ์ ์ฆ๋ช
๋ง์คํฌ ํ์ฐ์์ ๊ธฐ์กด ํ๋ จ ์์ค ๋๋น ์ ์๋ฏธํ FID ๊ฐ์
์ฐ์ ๊ฐ์ฐ์์ ํ์ฐ๊ณผ ์ด์ฐ ๋ง์คํฌ ํ์ฐ ๋ชจ๋์ ์ ์ฉ ๊ฐ๋ฅ
๐ฏ ์ ์ด๊ฒ์ด ๊ฒ์ ์ฒด์ธ์ ์ธ๊ฐ? : ๊ฒฝํ์ ์ฌ๊ฐ์ค ์์ค โ ์ด๋ก ์ ์ผ๋ก ์ ๋นํ๋ ๊ฐ์ ๋ ๋ณ๋ถ ํํ์ ์ ํ์ ๊ฐ์กฐ
๐ ๋ ์์ธํ ๋ด์ฉ์ด ๊ถ๊ธํ๋ค๋ฉด : ๋ ผ๋ฌธ ๋งํฌ
๋งค์ผ ํ์์ผ ์ค์ 8์,
๋ฐ์ ๋น์ ์ ๊ธฐ์ ๋ฐ์ ์ ๋ค์ณ์ง์ง ์๊ฒ ๋ง๋ค์ด์ค
์ต์ AI ํธ๋ ๋๊ฐ ์์ฝ ์ ๋ฆฌ๋ณธ์ผ๋ก ์ ๋ฌ๋ฉ๋๋ค!