26.04. 2แแ ฎแแ ก | Tencent, NVIDIA, Microsoft, Meta, IBM Research, Google DeepMind, Huawei, Snap

๊ธ์ฃผ ์บ์นํ์ดํผ๋ Tencent, NVIDIA, Microsoft, Meta, IBM Research, Google DeepMind, Huawei, Snap๊ณผ ํจ๊ปํฉ๋๋ค. 3๋ถ๋ง ํฌ์ํด ์ฑ ๋๋ฌ๋ณด๊ณ , ๋น ๋ฅด๊ฒ ๋ฐ๋๋ ๊ธฐ์ ์ ๋ฐฉํฅ์ฑ์ ๋์น์ง ๋ง์ธ์!
๐ ๋ฐ์ดํฐ ์์ง๋์ด๋ง์ด ์ํคํ ์ฒ๋ฅผ ์ด๊ธด๋ค โ 1.2B๊ฐ 200๋ฐฐ ํฐ ๋ชจ๋ธ์ ๋๋ ์๋
๐ฅ ๋น๋์ค ๋ฒค์น๋งํฌ ์ ๋ขฐ์ฑ ์๊ธฐ: ํ ์คํธ๋ง์ผ๋ก 60% ๋ง์ถ๋ ํ์ค์ด ๋๋ฌ๋๋ค
๐ KV ์บ์ ์์ถยทRL ๊ธฐ๋ฐ ํํ๋ จ์ผ๋ก ์๋น์ GPU์์ ๊ธด ์ถ๋ก ์ด ํ์คํ
Watch Before You Answer: Learning from Visually Grounded Post-Training
๐๏ธ ์์: Google DeepMind
๐ท๏ธ ํต์ฌ ํค์๋: Video Understanding, Visual Grounding, Post-Training Data Quality
๐ญ ์ด๋ฐ ์ง๋ฌธ์ ํด๋ณธ ์ ์๋์?
๋น๋์ค ์ดํด ๋ฒค์น๋งํฌ ์ ์๊ฐ ์ง์ง โ์์์ ๋ดค๊ธฐ ๋๋ฌธ์โ ๋์จ ๊ฑธ๊น?
์๋ง๋ง ์ฝ์ด๋ ๋ต์ ๋งํ ์ ์๋ค๋ฉด, ๊ทธ ๋ฒค์น๋งํฌ๋ฅผ ๋ฏฟ์ด๋ ๋ ๊น?
ํ๋ จ ๋ฐ์ดํฐ์ ์ง์ด ์๋ณด๋ค ์ค์ํ ์๊ฐ์ด ์์๊น?
์ํ์ง๋ฅผ ๋ฐ์๋๋ฐ, ๋ฌธ์ ๋ฅผ ์ ์ฝ์ด๋ ๋ณด๊ธฐ๋ง ๋ณด๋ฉด ๋ต์ด ๋ณด์ธ๋ค๋ฉด์? Google DeepMind์ด ๋น๋์ค ์ดํด ๋ฒค์น๋งํฌ๋ฅผ ํด๋ถํ๋๋, ๋ฌด๋ ค 40~60%์ ๋ฌธ์ ๊ฐ ํ ์คํธ ๋จ์๋ง์ผ๋ก ํ ์ ์์์ต๋๋ค. ์์์ โ๋ณด๋โ ๋ฅ๋ ฅ์ ์ธก์ ํ๋ค๋ ๋ฒค์น๋งํฌ๊ฐ, ์ฌ์ค์ ์ฝ๊ธฐ ์ํ์ด์๋ ์ ์ ๋๋ค. ์ด ๋ฐ๊ฒฌ์ ๋ฐํ์ผ๋ก VidGround๋ฅผ ์ ์ํฉ๋๋ค โ ํํ๋ จ ๋ฐ์ดํฐ์์ ํ ์คํธ๋ง์ผ๋ก ํ ์ ์๋ ๋ฌธ์ ๋ฅผ ์ ๊ฑฐํ๊ณ , ์ง์ง ์๊ฐ์ ๊ทผ๊ฑฐ๊ฐ ํ์ํ ๋ฌธ์ ๋ง ๋จ๊ธฐ๋ ๋ฐฉ๋ฒ์ ๋๋ค.
ํนํ ์ฃผ๋ชฉํ ์ :
์ ์ฒด ๋ฐ์ดํฐ์ 69.1%๋ง ์ฌ์ฉํ๊ณ ๋ ์ฑ๋ฅ์ด ์ต๋ 6.2ํฌ์ธํธ ํฅ์
๋จ์ํ ๋ฐ์ดํฐ ํ๋ ์ด์ ์ด ๋ณต์กํ ํํ๋ จ ์๊ณ ๋ฆฌ์ฆ๋ณด๋ค ์ฐ์
โ์๊ฐ์ ๊ทผ๊ฑฐ๊ฐ ํ์ํ ๋ฌธ์ โ๋ง ๊ณจ๋ผ ์ฐ๋ ๊ฒ์ด ํต์ฌ
๐ฏ ์ ์ด๊ฒ์ด ๊ฒ์ ์ฒด์ธ์ ์ธ๊ฐ? : โ๋ ๋ง์ ๋ฐ์ดํฐ๋ก ํํ๋ จโ โ โ์ง์ง ์๊ฐ ์ ๋ณด๊ฐ ํ์ํ ๋ฐ์ดํฐ๋ง ํํ๋ จโ
Video-MME-v2: Towards the Next Stage in Benchmarks for Comprehensive Video Understanding
๐๏ธ ์์: Tencent, University of Macau, Fudan University
๐ท๏ธ ํต์ฌ ํค์๋: Video Benchmark, Multi-step Reasoning, Human Annotation Pipeline
๐ญ ์ด๋ฐ ์ง๋ฌธ์ ํด๋ณธ ์ ์๋์?
๋น๋์ค ๋ชจ๋ธ ๋ฆฌ๋๋ณด๋ ์ ์๊ฐ ์ ์ค์ ์ฒด๊ฐ๊ณผ ๋ค๋ฅผ๊น?
์ฐ์ด์ ๋งํ ๋ต๊ณผ ์ถ๋ก ํด์ ๋งํ ๋ต์ ๊ตฌ๋ถํ ์ ์์๊น?
๋ฒค์น๋งํฌ ํ๋์ 3,300์๊ฐ์ ์์ผ๋ฉด ๋ญ๊ฐ ๋ฌ๋ผ์ง๊น?
์ฌ๋ฆผํฝ ์ฌํ์ด 12๋ช , ๊ฒํ ์์์ด 50๋ช , ํ์ง ๊ฒ์ฆ๋ง 5๋ผ์ด๋. Tencent๊ฐ 3,300์๊ฐ์ ํฌ์ ํด ๋ง๋ Video-MME-v2๋ โ์ ๋ต๋ฅ ๋ปฅํ๊ธฐโ๋ฅผ ์์ฒ ์ฐจ๋จํฉ๋๋ค. ๊ธฐ์กด ๋ฒค์น๋งํฌ์ ๋ฌ๋ฆฌ, ์๊ฐ ์ ๋ณด ์์ง โ ์๊ฐ ๋์ญํ ๋ชจ๋ธ๋ง โ ๋ณตํฉ ์ถ๋ก ๊น์ง 3๋จ๊ณ ๊ณ์ธต ๊ตฌ์กฐ๋ก ํ๊ฐํ๊ณ , ์ฐ๊ธฐ๋ก ๋งํ ๋ต์๋ ์ ์๋ฅผ ์ฃผ์ง ์๋ ๊ทธ๋ฃน ๊ธฐ๋ฐ ๋น์ ํ ํ๊ฐ๋ฅผ ๋์ ํ์ต๋๋ค.
ํนํ ์ฃผ๋ชฉํ ์ :
Gemini-3-Pro์กฐ์ฐจ ์ธ๊ฐ ์ ๋ฌธ๊ฐ์ ์๋นํ ๊ฒฉ์ฐจ ์กด์ฌ
Thinking ๊ธฐ๋ฐ ์ถ๋ก ์ ์๋ง์ด ์์ผ๋ฉด ๊ฐ์ ๋์ง๋ง, ์์ ์๊ฐ ํ๊ฒฝ์์๋ ์คํ๋ ค ์ฑ๋ฅ ํ๋ฝ
์๊ฐ ์ ๋ณด ์์ง ๋จ๊ณ์ ์ค๋ฅ๊ฐ ์์ ์ถ๋ก ๊น์ง ์ ํ๋๋ ๊ณ์ธต์ ๋ณ๋ชฉ ๋ฐ๊ฒฌ
๐ฏ ์ ์ด๊ฒ์ด ๊ฒ์ ์ฒด์ธ์ ์ธ๊ฐ? : โ๋ฌธ์ ๋น ์ ๋ต๋ฅ ์ธก์ โ โ โ์ถ๋ก ๊ณผ์ ์ ์ผ๊ด์ฑ๊ณผ ์ ํฉ์ฑ๊น์ง ํ๊ฐโ
TriAttention: Efficient Long Reasoning with Trigonometric KV Compression
๐๏ธ ์์: NVIDIA, MIT, CUHK
๐ท๏ธ ํต์ฌ ํค์๋: KV Cache Compression, Long Reasoning, Trigonometric Series
๐ญ ์ด๋ฐ ์ง๋ฌธ์ ํด๋ณธ ์ ์๋์?
LLM์ด ๊ธธ๊ฒ ์๊ฐํ ์๋ก ๋ฉ๋ชจ๋ฆฌ๊ฐ ํญ๋ฐํ๋ ๋ฌธ์ , ํด๊ฒฐํ ์ ์์๊น?
์ดํ ์ ์์ โ์ค์ํ ํคโ๋ฅผ ์ด๋ป๊ฒ ์์ ์ ์ผ๋ก ๊ณจ๋ผ๋ผ ์ ์์๊น?
์๋น์ GPU ํ๋๋ก OpenClaw ๊ฐ์ ์์ด์ ํธ๋ฅผ ๋๋ฆด ์ ์์๊น?
32K ํ ํฐ์ ์์ฑํ๋ ๊ธด ์ถ๋ก ์์ KV ์บ์๋ ๋ณ๋ชฉ์ ๋๋ค. ๊ธฐ์กด ์์ถ ๋ฐฉ๋ฒ๋ค์ ์ต๊ทผ ์ฟผ๋ฆฌ์ ์ดํ ์ ์ ์๋ก ์ค์๋๋ฅผ ์ถ์ ํ์ง๋ง, RoPE ํ์ ๋๋ฌธ์ ๋ํ์ฑ์ด ๋จ์ด์ง๋๋ค. NVIDIA์ MIT๋ RoPE ์ ์ฉ ์ ๊ณต๊ฐ์์ Q/K ๋ฒกํฐ๊ฐ ํน์ ์ค์ฌ ์ฃผ์์ ์์ ์ ์ผ๋ก ๋ชจ์ธ๋ค๋ ๊ฒ์ ๋ฐ๊ฒฌํ๊ณ , ์ผ๊ฐ๊ธ์๋ก ํค ์ค์๋๋ฅผ ์ถ์ ํ๋ TriAttention์ ์ ์ํฉ๋๋ค.
ํนํ ์ฃผ๋ชฉํ ์ :
AIME25์์ Full Attention๊ณผ ๋์ผํ ์ถ๋ก ์ ํ๋, ์ค๋ฃจํ 2.5๋ฐฐ ๋๋ KV ๋ฉ๋ชจ๋ฆฌ 10.7๋ฐฐ ๊ฐ์
๊ธฐ์กด ์ต์ ๋ฐฉ๋ฒ์ ๊ฐ์ ํจ์จ์์ ์ ํ๋๊ฐ ์ ๋ฐ ์์ค์ผ๋ก ์ถ๋ฝ
์๋น์ GPU ํ ์ฅ์์ OpenClaw ๋ฐฐํฌ ๊ฐ๋ฅ (Full Attention์ OOM)
๐ฏ ์ ์ด๊ฒ์ด ๊ฒ์ ์ฒด์ธ์ ์ธ๊ฐ? : โKV ์บ์ ์ค์ด๋ฉด ์ ํ๋๋ ์ค์ด๋ ๋คโ โ โ์ผ๊ฐ๊ธ์๋ก ์ค์๋๋ฅผ ์ ํํ ์ถ์ ํ๋ฉด ์ ํ๋ ์์ค ์์ด 10๋ฐฐ ์์ถโ
MinerU2.5-Pro: Pushing the Limits of Data-Centric Document Parsing at Scale
๐๏ธ ์์: Shanghai AI Lab, CUHK
๐ท๏ธ ํต์ฌ ํค์๋: Document Parsing, Data Engineering, GRPO Alignment
๐ญ ์ด๋ฐ ์ง๋ฌธ์ ํด๋ณธ ์ ์๋์?
๋ชจ๋ธ์ ํค์ฐ์ง ์๊ณ ๋ฐ์ดํฐ๋ง ๋ฐ๊ฟ๋ SOTA๋ฅผ ์ฐ์ ์ ์์๊น?
์๋ก ๋ค๋ฅธ ์ํคํ ์ฒ์ ๋ชจ๋ธ๋ค์ด ๊ฐ์ ์ค์๋ฅผ ํ๋ค๋ฉด, ๋ฌธ์ ๋ ์ด๋์?
ํ์ต ๋ฐ์ดํฐ์ โ์งโ์ ์ฒด๊ณ์ ์ผ๋ก ๋์ด์ฌ๋ฆฌ๋ ์์ง์ด ์๋ค๋ฉด?
๋ ์ํผ๊ฐ ๊ฐ์ผ๋ฉด ์ด๋ค ์ค๋ธ์ ์จ๋ ๊ฐ์ ๋ง์ด ๋ฉ๋๋ค. ๋ค๋ฅธ ์ํคํ ์ฒ, ๋ค๋ฅธ ํ๋ผ๋ฏธํฐ ๊ท๋ชจ์ ๋ฌธ์ ํ์ฑ ๋ชจ๋ธ๋ค์ด ๋๊ฐ์ ์ํ์์ ์คํจํ๋ค๋ ์ฌ์ค โ ์ด๊ฒ์ด MinerU2.5-Pro์ ์ถ๋ฐ์ ์ ๋๋ค. ๋ชจ๋ธ ์ํคํ ์ฒ๋ฅผ 1.2B๋ก ์์ ํ ๊ณ ์ ํ ์ฑ, ๋ฐ์ดํฐ ์์ง๋ง์ผ๋ก SOTA๋ฅผ ๋ฌ์ฑํ์ต๋๋ค. 10M ๋ฏธ๋ง์ด๋ ํ์ต ๋ฐ์ดํฐ๋ฅผ 65.5M์ผ๋ก ํ์ฅํ๋, ๋์ด๋ ์ธ์ง ์ํ๋ง๊ณผ ๊ต์ฐจ ๋ชจ๋ธ ์ผ๊ด์ฑ ๊ฒ์ฆ์ผ๋ก ํ์ง์ ๋ณด์ฅํฉ๋๋ค.
ํนํ ์ฃผ๋ชฉํ ์ :
์ํคํ ์ฒ ๋ณ๊ฒฝ ์ ๋ก, ์ค์ง ๋ฐ์ดํฐ ์์ง๋์ด๋ง๊ณผ ํ์ต ์ ๋ต๋ง์ผ๋ก
OmniDocBench v1.6์์ 95.69์ , ๋์ผ ์ํคํ ์ฒ ๋๋น +2.71ํฌ์ธํธ
200๋ฐฐ ์ด์ ํฐ ๋ชจ๋ธ์ ํฌํจํ ๋ชจ๋ ๊ธฐ์กด ๋ฐฉ๋ฒ์ ๋ฅ๊ฐ
๐ฏ ์ ์ด๊ฒ์ด ๊ฒ์ ์ฒด์ธ์ ์ธ๊ฐ? : โ์ฑ๋ฅ์ ์ฌ๋ฆฌ๋ ค๋ฉด ๋ชจ๋ธ์ ํค์๋ผโ โ โ๋ฐ์ดํฐ ์์ง์ ํค์๋ผ, ๋ชจ๋ธ์ ๊ทธ๋๋กโ
SpatialEdit: Benchmarking Fine-Grained Image Spatial Editing
๐๏ธ ์์: Microsoft Research, CUHK, Tsinghua, HKU, University of Waterloo
๐ท๏ธ ํต์ฌ ํค์๋: Spatial Editing, 3D-aware Image Manipulation, Blender Pipeline
๐ญ ์ด๋ฐ ์ง๋ฌธ์ ํด๋ณธ ์ ์๋์?
์ด๋ฏธ์ง ์ ๋ฌผ์ฒด๋ฅผ 3D์ฒ๋ผ ํ์ ์ํฌ ์ ์์๊น?
โ์นด๋ฉ๋ผ๋ฅผ ์ผ์ชฝ์ผ๋ก 30๋ ์ฎ๊ฒจ์คโ๋ฅผ ์ด๋ฏธ์ง ํธ์ง ๋ชจ๋ธ์ด ์ดํดํ ์ ์์๊น?
๊ณต๊ฐ ๋ณํ์ ์ ๋ฐ๋๋ฅผ ์ด๋ป๊ฒ ์ ๋์ ์ผ๋ก ์ธก์ ํ ๊น?
๏ฟฝ๏ฟฝํ ์ต์ผ๋ก ๋ฌผ์ฒด๋ฅผ โ์ด๋โํ๋ ๊ฑด ์ฝ์ง๋ง, โ์์ ์ 30๋ ํ์ โํ๋ ๊ฑด ๋ค๋ฅธ ์ฐจ์์ ๋ฌธ์ ์ ๋๋ค. Microsoft์ 5๊ฐ ๋ํ์ด ํฉ์ํ SpatialEdit์ Blender ํ์ดํ๋ผ์ธ์ผ๋ก 50๋ง ์ฅ์ ์ ๋ฐ ground-truth๋ฅผ ์์ฑํ๊ณ , ์์ ๋ณต์๊ณผ ํ๋ ์ด๋ฐ ๋ถ์์ ๋์์ ์ธก์ ํ๋ ๋ฒค์น๋งํฌ๋ฅผ ๊ตฌ์ถํ์ต๋๋ค. ์ด๋ฅผ ๊ธฐ๋ฐ์ผ๋ก ํ๋ จํ SpatialEdit-16B๋ ์ผ๋ฐ ํธ์ง์์๋ ๊ฒฝ์๋ ฅ์ ์ ์งํ๋ฉด์ ๊ณต๊ฐ ์กฐ์์์ ๊ธฐ์กด ๋ฐฉ๋ฒ์ ํฌ๊ฒ ์์ญ๋๋ค.
ํนํ ์ฃผ๋ชฉํ ์ :
50๋ง ์ฅ์ Blender ๊ธฐ๋ฐ ํฉ์ฑ ๋ฐ์ดํฐ์ (SpatialEdit-500k)
์์ง๊ฐ์ ์์ฐ์ค๋ฌ์๊ณผ ๊ธฐํํ์ ์ ๋ฐ๋๋ฅผ ๋์ ํ๊ฐํ๋ ๋ฒค์น๋งํฌ
๊ธฐ์กด ๋ฐฉ๋ฒ ๋๋น ๊ณต๊ฐ ์กฐ์ ํ์คํฌ์์ ์๋นํ ์ฑ๋ฅ ์ฐ์
๐ฏ ์ ์ด๊ฒ์ด ๊ฒ์ ์ฒด์ธ์ ์ธ๊ฐ? : โ์ด๋ฏธ์ง ํธ์ง = 2D ํ๋ฉด ๋ณํโ โ โ์ด๋ฏธ์ง ํธ์ง = 3D ๊ณต๊ฐ ์ธ์ ๋ณํโ
Vero: An Open RL Recipe for General Visual Reasoning
๐๏ธ ์์: Meta, Princeton University
๐ท๏ธ ํต์ฌ ํค์๋: Visual Reasoning, Reinforcement Learning, Open-weight VLM
๐ญ ์ด๋ฐ ์ง๋ฌธ์ ํด๋ณธ ์ ์๋์?
์ฐจํธ, ๊ณผํ, ๊ณต๊ฐ ์ดํด๋ฅผ ๋ชจ๋ ์ํ๋ ๋น์ ๋ชจ๋ธ์ ์คํ์์ค๋ก ๋ง๋ค ์ ์์๊น?
RL๋ก VLM์ ํ๋ จํ ๋, ๋ฐ์ดํฐ ๋ค์์ฑ์ด ์ ์ค์ํ ๊น?
๋น๊ณต๊ฐ thinking ๋ฐ์ดํฐ ์์ด๋ thinking ๋ชจ๋ธ์ ์ด๊ธธ ์ ์์๊น?
์ต๊ฐ VLM๋ค์ ๋น๋ฐ ๋ ์ํผ๋ ๋น๊ณต๊ฐ RL ํ์ดํ๋ผ์ธ๊ณผ ๋น๊ณต๊ฐ ๋ฐ์ดํฐ ๋ค์ ์ ๊ฒจ ์์์ต๋๋ค. Meta์ Princeton์ด ๊ทธ ์๋ฌผ์ ๋ฅผ ์ด์์ต๋๋ค. Vero๋ 59๊ฐ ๋ฐ์ดํฐ์ ์์ 60๋ง ์ํ์ ๋ชจ์ผ๊ณ , ํ์คํฌ๋ณ ๋ง์ถค ๋ณด์์ ์ค๊ณํด ์์ ๊ณต๊ฐ VLM์ ๊ตฌ์ถํฉ๋๋ค. Qwen3-VL-8B ๊ธฐ๋ฐ Vero๋ ๋น๊ณต๊ฐ thinking ๋ฐ์ดํฐ๋ฅผ ์ด Qwen3-VL-8B-Thinking์ 30๊ฐ ๋ฒค์น๋งํฌ ์ค 23๊ฐ์์ ์ด๊ฒผ์ต๋๋ค.
ํนํ ์ฃผ๋ชฉํ ์ :
4๊ฐ ๋ฒ ์ด์ค ๋ชจ๋ธ์์ ํ๊ท 3.6~5.3ํฌ์ธํธ ํฅ์
30๊ฐ ๋ฒค์น๋งํฌ ์ค 23๊ฐ์์ Thinking ๋ชจ๋ธ ๋ฅ๊ฐ (๋น๊ณต๊ฐ ๋ฐ์ดํฐ ์์ด)
์๋ก ๋ค๋ฅธ ํ์คํฌ ์นดํ ๊ณ ๋ฆฌ๊ฐ ๊ณ ์ ํ ์ถ๋ก ํจํด์ ์ ๋ โ ๋จ์ผ ์นดํ ๊ณ ๋ฆฌ๋ก๋ ์ ์ด ์ ๋จ
๐ฏ ์ ์ด๊ฒ์ด ๊ฒ์ ์ฒด์ธ์ ์ธ๊ฐ? : โ๊ฐํ VLM = ๋น๊ณต๊ฐ RL + ๋น๊ณต๊ฐ ๋ฐ์ดํฐโ โ โ๊ณต๊ฐ ๋ฐ์ดํฐ 60๋ง + ํ์คํฌ ๋ผ์ฐํ ๋ณด์์ผ๋ก ์ถฉ๋ถโ
FileGram: Grounding Agent Personalization in File-System Behavioral Traces
๐๏ธ ์์: NTU (S-Lab)
๐ท๏ธ ํต์ฌ ํค์๋: Agent Personalization, File-System Traces, Memory Architecture
๐ญ ์ด๋ฐ ์ง๋ฌธ์ ํด๋ณธ ์ ์๋์?
AI ์์ด์ ํธ๊ฐ ๋๋ฅผ ์ดํดํ๋ ค๋ฉด, ๋ํ ๋ง๊ณ ๋ฌด์์ ๋ด์ผ ํ ๊น?
ํ์ผ ์์ฑยท์์ ยท์ญ์ ๊ธฐ๋ก๋ง์ผ๋ก ์ฌ์ฉ์ ํ๋กํ์ ๋ง๋ค ์ ์์๊น?
์์ด์ ํธ์ โ๊ธฐ์ตโ์ ์ด๋ป๊ฒ ๊ตฌ์กฐํํ๋ฉด ์ฅ๊ธฐ ๊ฐ์ธํ๊ฐ ๋ ๊น?
๋น์ ์ด ์ด๋ค ํ์ผ์ ๋ง๋ค๊ณ , ์ด๋ค ํด๋๋ฅผ ์ ๋ฆฌํ๊ณ , ์ด๋ค ๋ฌธ์๋ฅผ ์์ ํ๋์ง โ ์ด ํ์ ์๋ ๋ํ๋ณด๋ค ๋ ์์งํ ๋น์ ์ด ๋ด๊ฒจ ์์ต๋๋ค. NTU S-Lab์ FileGram์ ํ์ผ ์์คํ ํ๋ ํ์ ์ ๊ธฐ๋ฐ์ผ๋ก ์์ด์ ํธ๋ฅผ ๊ฐ์ธํํฉ๋๋ค. FileGramOS๋ ๋ํ ์์ฝ์ด ์๋, ์์์ ํ์ผ ์กฐ์๊ณผ ์ฝํ ์ธ ๋ณํ๋์์ ํ๋กํ์ ๊ตฌ์ถํ๊ณ , ์ ์ฐจ์ ยท์๋ฏธ์ ยท์ํผ์๋ ๊ธฐ์ต ์ฑ๋๋ก ์ธ์ฝ๋ฉํฉ๋๋ค.
ํนํ ์ฃผ๋ชฉํ ์ :
ํ๋ฅด์๋ ๊ธฐ๋ฐ ๋ฐ์ดํฐ ์์ง์ผ๋ก ๋๊ท๋ชจ ๋ฉํฐ๋ชจ๋ฌ ํ๋ ์ํ์ค ์๋ ์์ฑ
ํ๋กํ ๋ณต์, ํ์ ๋ถ๋ฆฌ, ํ๋ฅด์๋ ๋๋ฆฌํํธ ๊ฐ์ง, ๋ฉํฐ๋ชจ๋ฌ ๊ทผ๊ฑฐ ๋ฑ 4๊ฐ ์ง๋จ ํ์คํฌ
์ต์ ๋ฉ๋ชจ๋ฆฌ ์์คํ ๋ค์ด FileGramBench์์ ์ฌ์ ํ ๊ณ ์
๐ฏ ์ ์ด๊ฒ์ด ๊ฒ์ ์ฒด์ธ์ ์ธ๊ฐ? : โ์์ด์ ํธ ๊ฐ์ธํ = ๋ํ ๊ธฐ๋ก ์์ฝโ โ โํ์ผ ์์คํ ํ๋ ํ์ ์์ ๋ฐํ ์ ์ผ๋ก ํ๋กํ ๊ตฌ์ถโ
Action Images: End-to-End Policy Learning via Multiview Video Generation
๐๏ธ ์์: IBM Research (MIT-IBM Watson AI Lab), MIT, Harvard, UMass Amherst
๐ท๏ธ ํต์ฌ ํค์๋: World Action Model, Robot Policy, Video Generation
๐ญ ์ด๋ฐ ์ง๋ฌธ์ ํด๋ณธ ์ ์๋์?
๋น๋์ค ์์ฑ ๋ชจ๋ธ์ด ๊ณง ๋ก๋ด ์ ์ด๊ธฐ๊ฐ ๋ ์ ์์๊น?
๋ก๋ด ์ก์ ์ โ์ด๋ฏธ์งโ๋ก ํํํ๋ฉด ๋ฌด์์ด ๋ฌ๋ผ์ง๊น?
๋ณ๋์ ์ ์ฑ ํค๋ ์์ด ๋น๋์ค ๋ฐฑ๋ณธ๋ง์ผ๋ก ์ ๋ก์ท ์ ์ด๊ฐ ๊ฐ๋ฅํ ๊น?
๋ก๋ด์๊ฒ โ์ ์ปต์ ์ง์ดโ๋ผ๊ณ ๋งํ๋ฉด, ๋ก๋ด์ด ๋ฏธ๋ ์์์ ์์ํ๊ณ ๊ทธ๋๋ก ์์ง์ ๋๋ค. MIT-IBM Watson AI Lab์ Action Images๋ 7-DoF ๋ก๋ด ์ก์ ์ ํด์ ๊ฐ๋ฅํ ๋ฉํฐ๋ทฐ ์ก์ ์ด๋ฏธ์ง๋ก ๋ณํํฉ๋๋ค. ๋ก๋ด ํ์ ์์ง์์ด 2D ํฝ์ ์ ๊ทธ๋๋ก ๊ทธ๋ ค์ง๊ธฐ ๋๋ฌธ์, ๋น๋์ค ๋ฐฑ๋ณธ ์์ฒด๊ฐ ๋ณ๋ ์ ์ฑ ๋ชจ๋ ์์ด ์ ๋ก์ท ์ ์ฑ ์ผ๋ก ์๋ํฉ๋๋ค.
ํนํ ์ฃผ๋ชฉํ ์ :
๋ณ๋ ์ ์ฑ ํค๋๋ ์ก์ ๋ชจ๋ ์์ด ๋น๋์ค ๋ฐฑ๋ณธ์ด ๊ณง ์ ์ฑ
RLBench์ ์ค์ ํ๊ฒฝ์์ ์ต๊ณ ์ ๋ก์ท ์ฑ๊ณต๋ฅ ๋ฌ์ฑ
์์-์ก์ ๋์ ์์ฑ, ์ก์ ์กฐ๊ฑด๋ถ ์์ ์์ฑ, ์ก์ ๋ผ๋ฒจ๋ง๊น์ง ๋จ์ผ ๋ชจ๋ธ๋ก
๐ฏ ์ ์ด๊ฒ์ด ๊ฒ์ ์ฒด์ธ์ ์ธ๊ฐ? : โ์์ ๋ชจ๋ธ + ๋ณ๋ ์ก์ ๋ชจ๋โ โ โ์ก์ ์ ํฝ์ ๋ก ํํํ๋ฉด ์์ ๋ชจ๋ธ ์์ฒด๊ฐ ์ ์ฑ โ
Data-Driven Function Calling Improvements in Large Language Model for Online Financial QA
๐๏ธ ์์: Huawei Noahโs Ark Lab, Shenzhen University
๐ท๏ธ ํต์ฌ ํค์๋: Function Calling, Financial QA, Data Augmentation
๐ญ ์ด๋ฐ ์ง๋ฌธ์ ํด๋ณธ ์ ์๋์?
๊ธ์ต ๋๋ฉ์ธ์ ์๋ฐฑ ๊ฐ API๋ฅผ LLM์ด ์์์ ๊ณจ๋ผ ์ธ ์ ์์๊น?
์ฌ์ฉ์ ์ง๋ฌธ์ ํ๋ผ๋ฏธํฐ๊ฐ API ์คํ๊ณผ ์ ๋ง์ผ๋ฉด ์ด๋ป๊ฒ ํ ๊น?
์คํ๋ผ์ธ ๋ฐ์ดํฐ๋ก ํ๋ จํ ํจ์ ํธ์ถ์ด ์จ๋ผ์ธ์์๋ ํตํ ๊น?
โ์ผ์ฑ์ ์ ์ต๊ทผ 3๊ฐ์ ์์ต๋ฅ ์๋ ค์คโ๋ผ๋ ์ง๋ฌธ์, LLM์ด ์๋ง์ ๊ธ์ต API๋ฅผ ๊ณ ๋ฅด๊ณ , ํ๋ผ๋ฏธํฐ๋ฅผ ์ฑ์ ํธ์ถํ๊ณ , ๊ฒฐ๊ณผ๋ฅผ ํด์ํด ๋ตํฉ๋๋ค. Huawei Noahโs Ark Lab์ ๊ธ์ต ๋๋ฉ์ธ ํนํ ํจ์ ํธ์ถ์ ์ํ ๋ฐ์ดํฐ ๊ธฐ๋ฐ ํ์ดํ๋ผ์ธ์ ์ ์ํฉ๋๋ค. AugFC๋ผ๋ ์ฆ๊ฐ ๊ธฐ๋ฒ์ผ๋ก ํ๋ผ๋ฏธํฐ ๊ฐ์ ๋ค์์ฑ์ ํ๋ณดํ๊ณ , 2๋จ๊ณ ํ๋ จ์ผ๋ก LLM์ ๊ธ์ต ํจ์ ํธ์ถ ๋ฅ๋ ฅ์ ๋ถ์ฌํฉ๋๋ค.
ํนํ ์ฃผ๋ชฉํ ์ :
์ค๊ตญ ์ต๋ ์ฑ ํ๋ซํผ ์ค ํ๋์ธ YuanBao์ ์ค์ ๋ฐฐํฌ
์ฌ์ฉ์ ์ฟผ๋ฆฌ ๊ธฐ๋ฐ ์ํ ์ถ๊ฐ๋ก ๊ธ์ต ๋๊ตฌ๋ฅผ ๋ฐ์ดํฐ ๊ธฐ๋ฐ์ผ๋ก ํ์
AugFC๋ก ํ๋ผ๋ฏธํฐ ๋ค์์ฑ์ ํ๋ณดํด OOD ์ฟผ๋ฆฌ ๋์๋ ฅ ๊ฐํ
๐ฏ ์ ์ด๊ฒ์ด ๊ฒ์ ์ฒด์ธ์ ์ธ๊ฐ? : โ๋ฒ์ฉ LLM์ API ๋ฌธ์๋ฅผ ํ๋กฌํํธ๋กโ โ โ๊ธ์ต ํนํ ๋ฐ์ดํฐ ํ์ดํ๋ผ์ธ์ผ๋ก ํจ์ ํธ์ถ ๋ฅ๋ ฅ์ ๋ด์ฌํโ
DiffHDR: Re-Exposing LDR Videos with Video Diffusion Models
๐๏ธ ์์: Snap Research
๐ท๏ธ ํต์ฌ ํค์๋: HDR Video, Diffusion Model, Radiance Inpainting
๐ญ ์ด๋ฐ ์ง๋ฌธ์ ํด๋ณธ ์ ์๋์?
8๋นํธ๋ก ์์ถํ๋ฉด์ ์ฌ๋ผ์ง ํ์ด๋ผ์ดํธ์ ๊ทธ๋ฆผ์๋ฅผ ๋์ด๋ฆด ์ ์์๊น?
๊ณผ๋ ธ์ถ๋ก ํ์๊ฒ ๋ ์๊ฐ ํ๋์ ์๋ ๊ตฌ๋ฆ์ด ์์๋ค๋ฉด?
๋น๋์ค ๋ํจ์ ๋ชจ๋ธ์ด โ์์ด๋ฒ๋ฆฐ ๋นโ์ ์์ํด ๊ทธ๋ฆด ์ ์์๊น?
์ค๋งํธํฐ์ผ๋ก ์ฐ์ ์์์์ ํ์๊ฒ ๋ ์๊ฐ ํ๋, ๊น๋งฃ๊ฒ ๋ญ๊ฐ์ง ๊ทธ๋ฆผ์ โ 8๋นํธ LDR ํฌ๋งท์ด ์ผ์ผ๋ฒ๋ฆฐ ๋น์ ๋๋ค. Snap Research์ DiffHDR์ ์ด ๋ฌธ์ ๋ฅผ โ๋น์ ์ธํ์ธํ โ์ผ๋ก ์ฌ์ ์ํฉ๋๋ค. ๋น๋์ค ๋ํจ์ ๋ชจ๋ธ์ ์๊ณต๊ฐ ์์ฑ ๋ฅ๋ ฅ์ ํ์ฉํด, ๊ณผ๋ ธ์ถยท์ ๋ ธ์ถ ์์ญ์ ์ฌ์ค์ ์ธ HDR ๋น์ ๋ณต์ํฉ๋๋ค. Log-Gamma ์๊ณต๊ฐ์์ ๋์ํ๋ฉฐ, ํ ์คํธ ํ๋กฌํํธ๋ ์ฐธ์กฐ ์ด๋ฏธ์ง๋ก ๋ณํ์ ์ ์ดํ ์๋ ์์ต๋๋ค.
ํนํ ์ฃผ๋ชฉํ ์ :
LDRโHDR ๋ณํ์ ์์ฑ์ ์ธํ์ธํ ํ์คํฌ๋ก ์ฌ์ ์
HDRI ๋งต์์ ํฉ์ฑํ ๊ณ ํ์ง HDR ๋น๋์ค ํ์ต ๋ฐ์ดํฐ ํ์ดํ๋ผ์ธ ๊ตฌ์ถ
๋น ์ถฉ์ค๋์ ์๊ฐ ์์ ์ฑ ๋ชจ๋์์ SOTA ์๋นํ ๊ฒฉ์ฐจ๋ก ๋ฅ๊ฐ
๐ฏ ์ ์ด๊ฒ์ด ๊ฒ์ ์ฒด์ธ์ ์ธ๊ฐ? : โLDRโHDR = ํค ๋งคํ ์ญ๋ณํโ โ โ๋ํจ์ ๋ชจ๋ธ์ด ์์ด๋ฒ๋ฆฐ ์ฅ๋ฉด์ ์์ํด ๋ณต์โ
๋งค์ฃผ ๋ชฉ์์ผ ์ค์ 8์, ๋ฐ์ ๋น์ ์ ๊ธฐ์ ๋ฐ์ ์ ๋ค์ณ์ง์ง ์๊ฒ ๋ง๋ค์ด์ค ์ต์ AI ํธ๋ ๋ ์์ฝ๋ณธ์ด ์ ๋ฌ๋ฉ๋๋ค! ๐