|
๊ธ์ฃผ ์บ์นํ์ดํผ๋ NVIDIA, IBM Research, Meta, Alibaba, ByteDance, Google DeepMind์ ํจ๊ปํฉ๋๋ค. 3๋ถ๋ง ํฌ์ํด ์ฑ ๋๋ฌ๋ณด๊ณ , ๋น ๋ฅด๊ฒ ๋ฐ๋๋ ๊ธฐ์ ์ ๋ฐฉํฅ์ฑ์ ๋์น์ง ๋ง์ธ์!
|
|
|
WEEKLY BRIEF
|
|
์์ด์ ํธ ๋ฆฌ๋๋ณด๋, ์ ์ด๋ ๊ฒ ๋ชป ๋ฏฟ๊ฒ ์ง?
|
|
๊ธ์ฃผ ์บ์นํ์ดํผ๋ NVIDIA, IBM Research, Meta, Alibaba, ByteDance, Google DeepMind์ ํจ๊ปํฉ๋๋ค. 3๋ถ๋ง ํฌ์ํด ์ฑ ๋๋ฌ๋ณด๊ณ , ๋น ๋ฅด๊ฒ ๋ฐ๋๋ ๊ธฐ์ ์ ๋ฐฉํฅ์ฑ์ ๋์น์ง ๋ง์ธ์!
|
|
|
|
|
01
"์์ ๋ชจ๋ธ์ ๋ฐ๋" โ 0.2B๊ฐ 10B๋ฅผ, 7B๊ฐ 72B๋ฅผ, 8B๊ฐ GPT-5.4๋ฅผ ์ํํ๋ค
|
|
|
02
๋ก๋ดยท์์ด์ ํธ๊ฐ ์ค์ค๋ก ํ์ตํ๋ '์์จ ๊ฐ์ ๋ฃจํ'๊ฐ ์ค์ ๋ฌผ๋ฆฌ ์ธ๊ณ๋ก ์ง์
์ค
|
|
|
03
๋ฒค์น๋งํฌ ์์ฒด์ ์ ๋ขฐ์ฑ์ด ๋์ ๋ฐ๋ ์๋ โ ๋ฆฌ๋๋ณด๋ 1๋ฑ โ ์ค์ ์ต๊ฐ
|
|
|
| |
|
|
|
|
|
VISION
|
|
๋ชจ๋ฐ์ผ์์๋ ์ค์๊ฐ ์ธํ์ธํ
์ ๋๋ฆด ์ ์์๊น?
|
|
Moebius: 0.2B Lightweight Image Inpainting Framework with 10B-Level Performance
|
|
๐๏ธ HUST (Huazhong University of Science and Technology)
๐ท๏ธ Image Inpainting, Model Compression, Knowledge Distillation
|
|
๐ญ ์ด๋ฐ ์ง๋ฌธ์ ํด๋ณธ ์ ์๋์?
โข ์ฌ์ง์์ ๋ถํ์ํ ๊ฐ์ฒด๋ฅผ ์ง์ธ ๋, ์ ์ด๋ ๊ฒ ๋ฌด๊ฑฐ์ด ๋ชจ๋ธ์ด ํ์ํ ๊น?
โข 10B ํ๋ผ๋ฏธํฐ ๋ชจ๋ธ์ ํ์ง์ 0.2B๋ก ์ฌํํ๋ ๊ฒ ๊ฐ๋ฅํ ๊น?
โข ๋ชจ๋ฐ์ผ์์๋ ์ค์๊ฐ ์ธํ์ธํ
์ ๋๋ฆด ์ ์๋ค๋ฉด?
|
|
|
|
|
ํนํ ์ฃผ๋ชฉํ ์ :
โ ํ๋ผ๋ฏธํฐ: 0.22B vs 11.9B (1.8%)๋ก ๋๋ฑ ์ด์์ ์์ฑ ํ์ง
โ ์๋: ์ด ์ถ๋ก ์๊ฐ 15๋ฐฐ ์ด์ ๊ฐ์
โ ํ์ง: Natural + Portrait ๋ฒค์น๋งํฌ์์ 10B๊ธ ์ฐ์
๋ชจ๋ธ๊ณผ ๋๋ฑ/์ฐ์
|
|
๐ฏ GAME CHANGER
"๊ณ ํ์ง ์ธํ์ธํ
= ๊ฑฐ๋ ๋ชจ๋ธ" ๊ณต์ โ ๊ทนํ ๊ฒฝ๋ํ๋ก ์ฃ์ง ๋๋ฐ์ด์ค์์๋ ํ๋ก๊ธ ํธ์ง ๊ฐ๋ฅ
|
|
|
๋
ผ๋ฌธ ๋ณด๊ธฐ →
|
|
|
|
|
NLP
|
|
๊ธฐ์ต๋ ฅ๊ณผ ์์ฌ๊ฒฐ์ ๋ฅ๋ ฅ์ ๋ถ๋ฆฌํด์ ์ธก์ ํ ์ ์์๊น?
|
|
Beyond the Current Observation: Evaluating Multimodal Large Language Models in Controllable Non-Markov Games
|
|
๐๏ธ CUHK (Chinese University of Hong Kong), Shanghai AI Lab
๐ท๏ธ MLLM Evaluation, Memory Benchmark, Non-Markov Decision
|
|
๐ญ ์ด๋ฐ ์ง๋ฌธ์ ํด๋ณธ ์ ์๋์?
โข ๋ฉํฐ๋ชจ๋ฌ AI๊ฐ ์์ ์ ๊ณผ๊ฑฐ ์ฅ๋ฉด์ ์ ๋ง ๊ธฐ์ตํ ์ ์์๊น?
โข ๊ธฐ์ต๋ ฅ๊ณผ ์์ฌ๊ฒฐ์ ๋ฅ๋ ฅ์ ๋ถ๋ฆฌํด์ ์ธก์ ํ ์ ์์๊น?
โข 128K ํ ํฐ ์ปจํ
์คํธ๋ฅผ ๊ฐ์ก๋ค๋ ๋ชจ๋ธ์ด ์ ๋ง ๊ทธ๋งํผ ๊ธฐ์ตํ ๊น?
|
|
|
|
|
ํนํ ์ฃผ๋ชฉํ ์ :
โ Memory Gap ๋ถ์: ์์ฌ ์ค๋ฅ์ ๋๋ถ๋ถ์ด "์์ด๋ฒ๋ฆผ"์์ ๋ฐ์ (์๋ชป๋ ํ๋ ์ ํ์ด ์๋)
โ Qwen3.5-9B ํ์ธํ๋: RNG-Bench + ๊ธฐ์กด ๋ฒค์น๋งํฌ ๋์ ํฅ์, ๋ฒ์ฉ ๋ฅ๋ ฅ ์ ํ ์์
โ 3์ถ ๋์ด๋ ์ ์ด: ๊ทธ๋ฆฌ๋ ํฌ๊ธฐ, ์๊ฐ ํจํด, ๊ด์ธก ๋ชจ๋ฌ๋ฆฌํฐ๋ก ์ ๋ฐ ์ง๋จ ๊ฐ๋ฅ
|
|
๐ฏ GAME CHANGER
"์ปจํ
์คํธ ๊ธธ๋ฉด ๊ธฐ์ต๋ ์ ํ๋ค" ๊ฐ์ โ ์ปจํ
์คํธ vs ์ค์ ๊ธฐ์ต ํ์ฉ์ ๋ถ๋ฆฌ ์ธก์ ํ๋ ํ๋ ์์ํฌ ํ๋ฆฝ
|
|
|
๋
ผ๋ฌธ ๋ณด๊ธฐ →
|
|
|
|
|
NLP
|
|
์ฝ๋ฉ ๋ฒค์น๋งํฌ๊ฐ Python์ ํธํฅ๋์ด ์์ง ์์๊น?
|
|
Multi-LCB: Extending LiveCodeBench to Multiple Programming Languages
|
|
๐๏ธ Independent Research
๐ท๏ธ Code Generation, Multilingual Benchmark, LLM Evaluation
|
|
๐ญ ์ด๋ฐ ์ง๋ฌธ์ ํด๋ณธ ์ ์๋์?
โข LLM์ด Python์ ์ ์ง๋๋ฐ, Rust๋ Go๋ ์ ๋ชป ์งค๊น?
โข LiveCodeBench 1๋ฑ ๋ชจ๋ธ์ด Java๋ก๋ ๋ช ๋ฑ์ผ๊น?
โข ์ฝ๋ฉ ๋ฒค์น๋งํฌ๊ฐ Python์ ํธํฅ๋์ด ์์ง ์์๊น?
|
|
|
|
|
ํนํ ์ฃผ๋ชฉํ ์ :
โ 24๊ฐ LLM ํ๊ฐ: instruction + reasoning ๋ชจ๋ธ ์ ๋ถ ํฌํจ
โ Python overfitting ์ฆ๊ฑฐ: ๋ค์ ๋ชจ๋ธ์ด Python ๋๋น ํ ์ธ์ด pass rate 40-60% ํ๋ฝ
โ ์ธ์ด๋ณ ์ค์ผ ํ์ง: ํน์ ์ธ์ด์์๋ง ๋น์ ์์ ๊ณ ์ฑ๋ฅ์ ๋ณด์ด๋ ํจํด ๋ฐ๊ฒฌ
|
|
๐ฏ GAME CHANGER
"Python ์ํ๋ฉด ์ฝ๋ฉ ์ํ๋ ๋ชจ๋ธ" โ 12๊ฐ ์ธ์ด ๋์ ํ๊ฐ๋ก ์ง์ง ํ๋ก๊ทธ๋๋ฐ ์ผ๋ฐํ ๋ฅ๋ ฅ ์ธก์
|
|
|
๋
ผ๋ฌธ ๋ณด๊ธฐ →
|
|
|
|
|
AGENTS
|
|
๋ฆฌ๋๋ณด๋ 1๋ฑ, ์ค์ ์์ ์์๊ฐ ๋ค์งํ๋ค
|
|
Beyond Static Leaderboards: Predictive Validity for the Evaluation of LLM Agents
|
|
๐๏ธ IBM Research
๐ท๏ธ Agent Evaluation, Benchmark Validity, Predictive Ranking
|
|
๐ญ ์ด๋ฐ ์ง๋ฌธ์ ํด๋ณธ ์ ์๋์?
โข ๋ฒค์น๋งํฌ 1๋ฑ ์์ด์ ํธ๋ฅผ ์ค์ ๋ฐฐํฌํ๋๋ฐ ์ ๊ธฐ๋ ์ดํ์ผ๊น?
โข ์์ด์ ํธ ๋ฆฌ๋๋ณด๋ ์์๋ฅผ ์ผ๋ง๋ ์ ๋ขฐํ ์ ์์๊น?
โข ๋ฐฐํฌ ํ๊ฒฝ์์์ ์ฑ๋ฅ์ ์ฌ์ ์ ์์ธกํ ๋ฐฉ๋ฒ์ ์์๊น?
|
|
|
|
|
ํนํ ์ฃผ๋ชฉํ ์ :
โ 14๊ฐ ๋ณ๋ ฌ ์ฐ๊ตฌ: MCP ๊ธฐ๋ฐ ์ฐ์
์์ด์ ํธ ๋ฒค์น๋งํฌ ์ต๋ ๊ท๋ชจ ์ฌ์ธต ๋ถ์
โ 12-tier ์ธก์ ์ฅ์น: HELM์ด ์ถ์ฝํ๋ ๋ฐฐํฌ ๊ด๋ จ ์ฐจ์์ ์ธ๋ถํ
โ 3๊ฐ ๋ฐ์ฆ ๊ฐ๋ฅ OOD ๊ธฐ์ค: ๋ช
์์ ์๊ณ๊ฐ ์ ์, ์ฌ์ ๋ฑ๋ก๋ ํ์ผ๋ฟ ์ค๊ณ ํฌํจ
|
|
๐ฏ GAME CHANGER
"์ง๊ณ ์ ์ ๋์ผ๋ฉด ์ข์ ์์ด์ ํธ" โ "์ค์ ์ ์ด ๊ฐ๋ฅ์ฑ"์ ์ง์ ์ธก์ ํ๋ ํ๊ฐ ํจ๋ฌ๋ค์
|
|
|
๋
ผ๋ฌธ ๋ณด๊ธฐ →
|
|
|
|
|
VISION
|
|
์ธ๊ฐ ์ ํธ๋ ๋ผ๋ฒจ ์์ด๋ ์์ฑ ํ์ง์ ์ฌ๋ฆด ์ ์์๊น?
|
|
The Reward Was in Your Data All Along: Correcting Flow Matching with Discriminator-Guided RL
|
|
๐๏ธ Meta / FAIR
๐ท๏ธ Flow Matching, Reinforcement Learning, Image Generation
|
|
๐ญ ์ด๋ฐ ์ง๋ฌธ์ ํด๋ณธ ์ ์๋์?
โข ์ด๋ฏธ์ง ์์ฑ ๋ชจ๋ธ์ด ์ RLHF ์์ด๋ ์ฌ์ค์ ์ธ ์์ ๋ชป ๊ทธ๋ฆด๊น?
โข ์ธ๊ฐ ์ ํธ๋ ๋ผ๋ฒจ ์์ด๋ ์์ฑ ํ์ง์ ์ฌ๋ฆด ์ ์์๊น?
โข Flow matching์ L2 loss๊ฐ ๋์น๋ ๊ฒ์ ๋ฌด์์ผ๊น?
|
|
|
|
|
ํนํ ์ฃผ๋ชฉํ ์ :
โ FID ๊ธ๊ฐ: SiT์์ guidance-free FID 9.38 โ 2.62
โ ์๋งจํฑ FD: DINOv3 ๊ธฐ์ค 88.2 โ 19.3 (SiT)
โ ๋ฒ์ฉ์ฑ: SiT, JiT, REPA, RAE ๋ชจ๋ ๋ฐฑ๋ณธ์์ ์ผ๊ด๋ ๊ฐ์
|
|
๐ฏ GAME CHANGER
"RLHF๋ก ์ธ๊ฐ ์ทจํฅ ๋ง์ถ๊ธฐ" โ "๋ฐ์ดํฐ ์์ฒด์์ ์ต์ ๋ณด์์ ์ถ์ถํด ๋ชจ๋ธ์ ๊ตฌ์กฐ์ ๊ฒฐํจ์ ์ง์ ๊ต์ "
|
|
|
๋
ผ๋ฌธ ๋ณด๊ธฐ →
|
|
|
|
|
VISION
|
|
๊ธด ์์์ ์ดํดํ๋ ค๋ฉด ๋ฌด์กฐ๊ฑด ์ ์ฒด๋ฅผ ๋ค ๋ด์ผ ํ ๊น?
|
|
Native Active Perception as Reasoning for Omni-Modal Understanding
|
|
๐๏ธ Alibaba (Qwen Team), CUHK
๐ท๏ธ Video Understanding, Active Perception, Test-time Scaling
|
|
๐ญ ์ด๋ฐ ์ง๋ฌธ์ ํด๋ณธ ์ ์๋์?
โข ๊ธด ์์์ ์ดํดํ๋ ค๋ฉด ๋ฌด์กฐ๊ฑด ์ ์ฒด๋ฅผ ๋ค ๋ด์ผ ํ ๊น?
โข ๋น๋์ค ๊ธธ์ด์ ๋น๋กํด ๋น์ฉ์ด ์ฆ๊ฐํ๋ ๊ตฌ์กฐ๋ฅผ ๊นฐ ์ ์์๊น?
โข ์์ ๋ชจ๋ธ์ด "ํ์ํ ๋๋ง ๋ณด๋" ์ ๋ต์ผ๋ก ํฐ ๋ชจ๋ธ์ ์ด๊ธธ ์ ์์๊น?
|
|
|
|
|
ํนํ ์ฃผ๋ชฉํ ์ :
โ 7B vs 72B: LVBench์์ OmniAgent-7B๊ฐ Qwen2.5-VL-72B๋ฅผ ๋ฅ๊ฐ (50.5% vs 47.3%)
โ ๋น์ฉ ํ๊ฒฐํฉ: ์ถ๋ก ๋ณต์ก๋๊ฐ ์์ ๊ธธ์ด๊ฐ ์๋ ์ง๋ฌธ ๋์ด๋์๋ง ๋น๋ก
โ ์คํ์์ค SOTA: VideoMME ๋ฑ 10๊ฐ ๋ฒค์น๋งํฌ์์ ์คํ์์ค ์ต๊ณ ์ฑ๋ฅ
|
|
๐ฏ GAME CHANGER
"๊ธด ์์ = ๋ฌด์กฐ๊ฑด ๋ง์ ํ๋ ์ ์ฒ๋ฆฌ" โ "๋ฅ๋์ ์ง๊ฐ + ๋ฉ๋ชจ๋ฆฌ๋ก ๋น์ฉ๊ณผ ํ์ง ๋์ ํด๊ฒฐ"
|
|
|
๋
ผ๋ฌธ ๋ณด๊ธฐ →
|
|
|
|
|
ROBOTICS
|
|
์ฝ๋ฉ ์์ด์ ํธ๊ฐ ๋ก๋ด์ 99%๊น์ง ํ๋ จ์์ผ๋ธ๋ค
|
|
ENPIRE: Agentic Robot Policy Self-Improvement in the Real World
|
|
๐๏ธ NVIDIA, UC Berkeley
๐ท๏ธ Robot Learning, Coding Agent, Autonomous Training
|
|
๐ญ ์ด๋ฐ ์ง๋ฌธ์ ํด๋ณธ ์ ์๋์?
โข ๋ก๋ด ํ๋ จ์์ ์ฌ๋ ๊ฐ๋
์ ์์ ํ ์ ๊ฑฐํ ์ ์์๊น?
โข ์ฝ๋ฉ ์์ด์ ํธ๊ฐ ๋ฌผ๋ฆฌ ์ธ๊ณ์ ๋ก๋ด์ ์์จ์ ์ผ๋ก ๊ฐ์ ํ ์ ์์๊น?
โข "๋ฆฌ์
-์คํ-๊ฒ์ฆ-๊ฐ์ " ๋ฃจํ๋ฅผ ์๋ํํ๋ฉด ์ด๋ค ์ผ์ด ๋ฒ์ด์ง๊น?
|
|
|
|
|
ํนํ ์ฃผ๋ชฉํ ์ :
โ 99% ์ฑ๊ณต๋ฅ : ํ ๋ฐ์ค ์ ๋ฆฌ, ์ผ์ด๋ธ ํ์ด ์กฐ์ด๊ธฐ, ๋๊ตฌ ์ฌ์ฉ ๋ฑ ์ ๊ตํ ์กฐ์ ํ์คํฌ
โ ๋ก๋ด ํจ๋ ๊ฐ์: ์์ด์ ํธ ํ + ๋ณต์ ๋ก๋ด ๋ณ๋ ฌ ์ด์์ผ๋ก ํ์ต ๊ฐ์
โ ์์ ์์จ: ํ๋ก ํฐ์ด ์ฝ๋ฉ ์์ด์ ํธ๊ฐ ์ฌ๋ ๊ฐ์
์์ด ์ ์ฑ
์ ์์จ ํ๋ จ
|
|
๐ฏ GAME CHANGER
"๋ก๋ด ํ์ต = ์ธ๊ฐ ์์ง๋์ด์ ๋ฐ๋ณต ์คํ" โ "์ฝ๋ฉ ์์ด์ ํธ๊ฐ ๋ฌผ๋ฆฌ ์ธ๊ณ์์ ์์จ์ ์ผ๋ก ๋ก๋ด์ ์งํ์ํจ๋ค"
|
|
|
๋
ผ๋ฌธ ๋ณด๊ธฐ →
|
|
|
|
|
ROBOTICS
|
|
์ ํ๋ธ์ ๋์น๋ 1์ธ์นญ ์์์ด ๋ก๋ด ํ๋ จ์ ์ฐ์ผ ์ ์์๊น?
|
|
HumanScale: Egocentric Human Video Can Outperform Real-Robot Data for Embodied Pretraining
|
|
๐๏ธ ByteDance, MIT, NUS
๐ท๏ธ Embodied AI, Egocentric Video, Pretraining
|
|
๐ญ ์ด๋ฐ ์ง๋ฌธ์ ํด๋ณธ ์ ์๋์?
โข ๋ก๋ด ๋ฐ์ดํฐ๋ฅผ ๋ชจ์ผ๋ ๋น์ฉ ์์ด ๋ก๋ด์ ํ์ต์ํฌ ์ ์์๊น?
โข ์ ํ๋ธ์ ๋์น๋ 1์ธ์นญ ์์์ด ๋ก๋ด ํ๋ จ์ ์ฐ์ผ ์ ์๋ค๋ฉด?
โข ๋ฐ์ดํฐ ๋ค์์ฑ์ด ์ ๋ฐํ ๋ก๋ด ๋ฐ์ดํฐ๋ณด๋ค ์ค์ํ ์ ์์๊น?
|
|
|
|
|
ํนํ ์ฃผ๋ชฉํ ์ :
โ ๊ฒ์ฆ ์์ค: ๋์ผ ๋ฐ์ดํฐ๋ ๊ธฐ์ค, 1์ธ์นญ ๋ฐ์ดํฐ ์ฌ์ ํ์ต์ด ๋ก๋ด ๋ฐ์ดํฐ ๋๋น 24% ๋ฎ์ validation loss
โ ์ค์ ์ฑ๊ณต๋ฅ : ๋ถํฌ ๋ด 52.5%, ๋ถํฌ ์ธ 90% ๋ ๋์ ์ค์ ๋ก๋ด ํ์คํฌ ์ฑ๊ณต๋ฅ
โ ์ค์ผ์ผ๋ฌ๋ธ ํจ๋ฌ๋ค์: 1์ธ์นญ ์์์ผ๋ก ์ธ๊ณ ํํ ํ์ต โ ์๋ ๋ก๋ด ๋ฐ์ดํฐ๋ก ํ๋ ์ ๋ ฌ
|
|
๐ฏ GAME CHANGER
"๋ก๋ด ํ์ต = ๋น์ผ ํ
๋ ์คํผ๋ ์ด์
๋ฐ์ดํฐ ์์ง" โ "์ธํฐ๋ท์ ๋ฌดํํ ์ธ๊ฐ ์์์ด ๋ ๋์ ์ฌ์ ํ์ต ์์ค"
|
|
|
๋
ผ๋ฌธ ๋ณด๊ธฐ →
|
|
|
|
|
NLP
|
|
AI ์์ ์ ์ํด ๋ชจ๋ธ์ "์๊ฐ ๊ณผ์ "์ ๋ชจ๋ํฐ๋งํ ์ ์์๊น?
|
|
How Transparent is DiffusionGemma?
|
|
๐๏ธ Google DeepMind
๐ท๏ธ Interpretability, Diffusion LLM, Transparency
|
|
๐ญ ์ด๋ฐ ์ง๋ฌธ์ ํด๋ณธ ์ ์๋์?
โข ํ์ฐ ๋ชจ๋ธ์ด ์ฐ์ ์ ์ฌ ๊ณต๊ฐ์์ ์ถ๋ก ํ๋ฉด, ์ค๊ฐ ๊ณผ์ ์ ํด์ํ ์ ์์๊น?
โข Autoregressive ๋ชจ๋ธ๋ณด๋ค ํ์ฐ ๋ชจ๋ธ์ด ๋ ๋ถํฌ๋ช
ํ ๊ฑด ์ฌ์ค์ผ๊น?
โข AI ์์ ์ ์ํด ๋ชจ๋ธ์ "์๊ฐ ๊ณผ์ "์ ๋ชจ๋ํฐ๋งํ ์ ์์๊น?
|
|
|
|
|
ํนํ ์ฃผ๋ชฉํ ์ :
โ ๋ณ์ ํฌ๋ช
๋: ํ ํฐ ๋ณ๋ชฉ ์ ์ฉ ์ opaque serial depth 28.6x โ 1.1x
โ ์๊ณ ๋ฆฌ์ฆ ํฌ๋ช
๋: ๋น์์ฐจ์ ์ถ๋ก , ํ ํฐ ์ค๋ฏธ์ด๋ง ๋ฑ ํ์ฐ ๊ณ ์ ํ์ ์ต์ด ๋ฐ๊ฒฌ
โ ๋ชจ๋ํฐ๋ง ๊ฐ๋ฅ์ฑ: DiffusionGemma์ ์ถ๋ ฅ์ด Gemma 4์ ๋๋ฑํ๊ฒ ๋ค์ด์คํธ๋ฆผ ํ์ฉ ๊ฐ๋ฅ
|
|
๐ฏ GAME CHANGER
"ํ์ฐ ๋ชจ๋ธ = ํด์ ๋ถ๊ฐ ๋ธ๋๋ฐ์ค" โ "์ ์ ํ ๋ณ๋ชฉ ์ค๊ณ๋ก autoregressive ๋ชจ๋ธ ์์ค์ ํฌ๋ช
๋ ๋ฌ์ฑ ๊ฐ๋ฅ"
|
|
|
๋
ผ๋ฌธ ๋ณด๊ธฐ →
|
|
|
|
|
WORLD MODEL
|
|
๋๊ตฌ๋ฅผ ํ์ฉํ๋ฉด ์์ ๋ชจ๋ธ๋ ๊ณต๊ฐ ์ถ๋ก ์์ ๋ํ ๋ชจ๋ธ์ ์ด๊ธธ ์ ์์๊น?
|
|
S-Agent: Spatial Tool-Use Elicits Reasoning for Spatial Intelligence
|
|
๐๏ธ NTU (Nanyang Technological University)
๐ท๏ธ Spatial Reasoning, Tool-Use Agent, 3D Understanding
|
|
๐ญ ์ด๋ฐ ์ง๋ฌธ์ ํด๋ณธ ์ ์๋์?
โข VLM์ด 3D ๊ณต๊ฐ์ ์ ๋ง ์ดํดํ ์ ์์๊น?
โข ๋๊ตฌ๋ฅผ ํ์ฉํ๋ฉด ์์ ๋ชจ๋ธ๋ ๊ณต๊ฐ ์ถ๋ก ์์ ๋ํ ๋ชจ๋ธ์ ์ด๊ธธ ์ ์์๊น?
โข ์ ์ง ์ด๋ฏธ์ง๊ฐ ์๋ ์ฐ์ ์์์์์ ๊ณต๊ฐ ์ดํด๋ ์ด๋ป๊ฒ ๋ค๋ฅผ๊น?
|
|
|
|
|
ํนํ ์ฃผ๋ชฉํ ์ :
โ 8B vs GPT-5.4: S-Agent-8B๊ฐ GPT-5.4, Gemini 3๊ณผ ๋๋ฑํ ๊ณต๊ฐ ์ถ๋ก ์ฑ๋ฅ
โ Training-free: ์คํ์์คยทํด๋ก์ฆ๋ VLM ๋ชจ๋ ํ์ต ์์ด ์ผ๊ด๋ ์ฑ๋ฅ ํฅ์
โ S-300K ๋ฐ์ดํฐ์
: S-Agent ๊ถค์ ์ผ๋ก SFTํ์ฌ ๋
๋ฆฝํ ๊ณต๊ฐ ์์ด์ ํธ ์์ฑ ๊ฐ๋ฅ
|
|
๐ฏ GAME CHANGER
"๊ณต๊ฐ ์ดํด = ๊ฑฐ๋ ๋ชจ๋ธ์ ์ ์ ๋ฌผ" โ "๋๊ตฌ ํ์ฉ + ์๊ณต๊ฐ ๋ฉ๋ชจ๋ฆฌ๋ก 8B๊ฐ ํ๋ก ํฐ์ด ๋ชจ๋ธ๊ธ ๊ณต๊ฐ ์ง๋ฅ ๋ฌ์ฑ"
|
|
|
๋
ผ๋ฌธ ๋ณด๊ธฐ →
|
|
|
|
|