26.04. 3แแ ฎแแ ก | NVIDIA, Apple, Google, Meta, Tencent
๊ธ์ฃผ ์บ์นํ์ดํผ๋ NVIDIA, Apple, Google, Meta, Tencent์ ํจ๊ปํฉ๋๋ค. 3๋ถ๋ง ํฌ์ํด ์ฑ ๋๋ฌ๋ณด๊ณ , ๋น ๋ฅด๊ฒ ๋ฐ๋๋ ๊ธฐ์ ์ ๋ฐฉํฅ์ฑ์ ๋์น์ง ๋ง์ธ์!
๐ MoE + Mamba ํ์ด๋ธ๋ฆฌ๋๊ฐ ๋์ธ โ NVIDIA๊ฐ 120B ๋ชจ๋ธ์ 12B ๋น์ฉ์ผ๋ก ๊ตด๋ฆฐ๋ค
๐ฅ ๋ฌผ๋ฆฌ ์๋ฎฌ๋ ์ดํฐ๋ก ํ๋ จํ LLM์ด ๊ตญ์ ๋ฌผ๋ฆฌ์ฌ๋ฆผํผ์๋ ๋ฌธ์ ๋ฅผ ํ๊ธฐ ์์ํ๋ค
๐ GUI ์์ด์ ํธ, RL + ํ๋ก์ธ์ค ๋ณด์์ผ๋ก 2B ํ๋ผ๋ฏธํฐ์์๋ ์ค์ฉ ์์ค ๋ํ
Nemotron 3 Super: Open, Efficient Mixture-of-Experts Hybrid Mamba-Transformer Model for Agentic Reasoning
๐๏ธ ์์: NVIDIA
๐ท๏ธ ํต์ฌ ํค์๋: MoE, Mamba-Transformer Hybrid, Inference Efficiency
๐ญ ์ด๋ฐ ์ง๋ฌธ์ ํด๋ณธ ์ ์๋์?
120B ๋ชจ๋ธ์ ์ฑ๋ฅ์ ์ํ๋๋ฐ, ๋น์ฉ์ 12B๋ง ์ฐ๊ณ ์ถ๋ค๋ฉด?
Transformer๋ง์ผ๋ก๋ ๊ธด ๋ฌธ๋งฅ์ ํจ์จ์ ์ผ๋ก ์ฒ๋ฆฌํ ์ ์๋ ๊ฑธ๊น?
์คํ์์ค ๋ชจ๋ธ์ด ์์ฉ ๋ชจ๋ธ ์์ค์ ์์ด์ ํฑ ์ถ๋ก ์ ํ ์ ์์๊น?
๋ํ ๋ ์คํ ๋์ 547๋ช ์ ์ ฐํ๊ฐ ์์ง๋ง ํ ์ ์์ 12๋ช ๋ง ํฌ์ ๋ฉ๋๋ค. NVIDIA๊ฐ ์ ์ฌ์ ์ผ๋ก ๋ง๋ Nemotron 3 Super๋ 120B ํ๋ผ๋ฏธํฐ ์ค 12B๋ง ํ์ฑํํ๋ MoE ๊ตฌ์กฐ์, Mamba์ Attention์ ๊ฒฐํฉํ ํ์ด๋ธ๋ฆฌ๋ ์ํคํ ์ฒ์ ๋๋ค. 25์กฐ ํ ํฐ์ผ๋ก ์ฌ์ ํ๋ จํ๊ณ , SFT์ RL๋ก ํํ๋ จํ ์ด ๋ชจ๋ธ์ 100๋ง ํ ํฐ ๋ฌธ๋งฅ์ ์ง์ํ๋ฉด์๋ ๊ธฐ์กด ๋๊ธ ๋ชจ๋ธ์ ์ฒ๋ฆฌ๋์์ ์๋ํฉ๋๋ค.
ํนํ ์ฃผ๋ชฉํ ์ :
GPT-OSS-120B ๋๋น 2.2๋ฐฐ, Qwen3.5-122B ๋๋น 7.5๋ฐฐ ๋์ ์ถ๋ก ์ฒ๋ฆฌ๋
NVFP4๋ก ์ฌ์ ํ๋ จํ ์ต์ด์ ๋ชจ๋ธ โ ์์ํ๊ฐ ํ์ฒ๋ฆฌ๊ฐ ์๋ ์ถ๋ฐ์
LatentMoE: FLOP๋น ์ ํ๋์ ํ๋ผ๋ฏธํฐ๋น ์ ํ๋๋ฅผ ๋์์ ์ต์ ํํ๋ ์ MoE ์ํคํ ์ฒ
๐ฏ ์ ์ด๊ฒ์ด ๊ฒ์ ์ฒด์ธ์ ์ธ๊ฐ? : โํฐ ๋ชจ๋ธ์ ๋น์ธ๊ณ ๋๋ฆฌ๋คโ โ โํฐ ๋ชจ๋ธ์ ์ง์, ์์ ๋ชจ๋ธ์ ๋น์ฉโ
ClawGUI: A Unified Framework for Training, Evaluating, and Deploying GUI Agents
๐๏ธ ์์: Zhejiang University
๐ท๏ธ ํต์ฌ ํค์๋: GUI Agent, Reinforcement Learning, Process Reward Model
๐ญ ์ด๋ฐ ์ง๋ฌธ์ ํด๋ณธ ์ ์๋์?
AI๊ฐ ์ฑ ํ๋ฉด์ ๋ณด๊ณ ์ง์ ํญํ๊ณ ์ค์์ดํํ ์ ์์๊น?
2B ํ๋ผ๋ฏธํฐ๋ก ์ค์ ์ค๋งํธํฐ์ ์กฐ์ํ๋ ์์ด์ ํธ๋ฅผ ๋ง๋ค ์ ์์๊น?
์ GUI ์์ด์ ํธ ์ฐ๊ตฌ๋ค์ ๋ฒค์น๋งํฌ ์ฌํ์ด ์ ๋ ๊น?
๋ฆฌ๋ชจ์ปจ ์์ด TV๋ฅผ ์กฐ์ํด ๋ณธ ์ ์๋์? AI๊ฐ ์ฑ์ โ๋์ผ๋ก ๋ณด๊ณ โ ์กฐ์ํ๋ ๊ฑด ๊ทธ๋ณด๋ค ํจ์ฌ ์ด๋ ต์ต๋๋ค. ClawGUI๋ ํ๋ จ(RL)ยทํ๊ฐยท๋ฐฐํฌ๋ฅผ ํ๋๋ก ํตํฉํ ์คํ์์ค ํ๋ ์์ํฌ์ ๋๋ค. GiGPO ์๊ณ ๋ฆฌ์ฆ๊ณผ ํ๋ก์ธ์ค ๋ณด์ ๋ชจ๋ธ๋ก ๋จ๊ณ๋ณ ํผ๋๋ฐฑ์ ์ฃผ๊ณ , 6๊ฐ ๋ฒค์น๋งํฌ์์ ๊ณต์ ๊ฒฐ๊ณผ์ 95.8%๋ฅผ ์ฌํํ๋ ํ์คํ๋ ํ๊ฐ๋ฅผ ์ ๊ณตํฉ๋๋ค.
ํนํ ์ฃผ๋ชฉํ ์ :
ClawGUI-2B๊ฐ MobileWorld GUI-Only์์ 17.1% ์ฑ๊ณต๋ฅ โ ๋๊ธ MAI-UI-2B๋ฅผ 6.0%p ์ด๊ณผ
Android, HarmonyOS, iOS ์ธ ํ๋ซํผ์์ ์ค์ ๋ฐฐํฌ ๊ฐ๋ฅ
12๊ฐ ์ด์ ์ฑํ ํ๋ซํผ์์ ํ์ด๋ธ๋ฆฌ๋ CLI-GUI ์ปจํธ๋กค ์ง์
๐ฏ ์ ์ด๊ฒ์ด ๊ฒ์ ์ฒด์ธ์ ์ธ๊ฐ? : โGUI ์์ด์ ํธ๋ ์ฐ๊ตฌ ๋จ๊ณโ โ โ์คํ์์ค๋ก ํ๋ จํ๊ณ ์ค์ ํฐ์ ๋ฐฐํฌโ
OmniShow: Unifying Multimodal Conditions for Human-Object Interaction Video Generation
๐๏ธ ์์: Zhejiang University, CUHK
๐ท๏ธ ํต์ฌ ํค์๋: Video Generation, Human-Object Interaction, Multimodal Conditioning
๐ญ ์ด๋ฐ ์ง๋ฌธ์ ํด๋ณธ ์ ์๋์?
์ํ ์์ฐ ์์์ ํ ์คํธ ํ ์ค๋ก ์๋ ์์ฑํ ์ ์์๊น?
์ฌ๋์ด ๋ฌผ๊ฑด์ ์์ฐ์ค๋ฝ๊ฒ ๋ค๋ฃจ๋ ์์์ AI๊ฐ ๋ง๋ค ์ ์์๊น?
ํ ์คํธยท์ด๋ฏธ์งยท์ค๋์คยทํฌ์ฆ๋ฅผ ํ๊บผ๋ฒ์ ์กฐ๊ฑด์ผ๋ก ์ค ์ ์์๊น?
์ผํ๋ชฐ์ ์ฌ๋ฆด ์์ฐ ์์์ ๋ชจ๋ธ ์ญ์ธ ์์ด ๋ง๋ค ์ ์๋ค๋ฉด? OmniShow๋ ํ ์คํธ, ์ฐธ์กฐ ์ด๋ฏธ์ง, ์ค๋์ค, ํฌ์ฆ๋ฅผ ๋ชจ๋ ์กฐ๊ฑด์ผ๋ก ๋ฐ์ ์ฌ๋-๋ฌผ๊ฑด ์ํธ์์ฉ ์์์ ์์ฑํ๋ ํ๋ ์์ํฌ์ ๋๋ค. ์๋ก ๋ค๋ฅธ ์กฐ๊ฑด์ ๋ค๋ฃจ๋ ์ด์ข ๋ฐ์ดํฐ์ ์ ๋ถ๋ฆฌ ํ๋ จ ํ ๋ชจ๋ธ ๋ณํฉํ๋ ์ ๋ต์ผ๋ก ๋ฐ์ดํฐ ๋ถ์กฑ ๋ฌธ์ ๋ฅผ ํด๊ฒฐํ์ต๋๋ค.
ํนํ ์ฃผ๋ชฉํ ์ :
Unified Channel-wise Conditioning์ผ๋ก ์ด๋ฏธ์งยทํฌ์ฆ ์ฃผ์ ์ ํ์ง-์ ์ด ํธ๋ ์ด๋์คํ ๊ทน๋ณต
Gated Local-Context Attention์ผ๋ก ์ค๋์ค-๋น์ฃผ์ผ ๋๊ธฐํ ์ ๋ฐ๋ ํ๋ณด
HOIVG-Bench: ์ด ๋ถ์ผ ์ต์ด์ ์ ์ฉ ๋ฒค์น๋งํฌ ์ ์
๐ฏ ์ ์ด๊ฒ์ด ๊ฒ์ ์ฒด์ธ์ ์ธ๊ฐ? : โ์กฐ๊ฑด๋ณ๋ก ๋ฐ๋ก ๋ชจ๋ธโ โ โ๋ชจ๋ ๋ฉํฐ๋ชจ๋ฌ ์กฐ๊ฑด์ ํ๋์ ํ๋ ์์ํฌ๋กโ
Solving Physics Olympiad via Reinforcement Learning on Physics Simulators
๐๏ธ ์์: CMU
๐ท๏ธ ํต์ฌ ํค์๋: Physics Reasoning, RL on Simulators, Sim-to-Real Transfer
๐ญ ์ด๋ฐ ์ง๋ฌธ์ ํด๋ณธ ์ ์๋์?
LLM์๊ฒ ๋ฌผ๋ฆฌ๋ฅผ ๊ฐ๋ฅด์น๋ ค๋ฉด ๋ฌธ์ ์ง์ด ๊ผญ ํ์ํ ๊น?
๋ฌผ๋ฆฌ ์๋ฎฌ๋ ์ดํฐ์์ ์ป์ ๊ฒฝํ์ด ์ค์ ๋ฌผ๋ฆฌ ๋ฌธ์ ํ์ด๋ก ์ ์ด๋ ๊น?
์ํ ์ธ ๊ณผํ ๋ถ์ผ์์๋ RLVR๊ฐ ํตํ ๊น?
์ํ์ ์ธํฐ๋ท์ ๋ฌธ์ ๊ฐ ๋์น์ง๋ง ๋ฌผ๋ฆฌ๋ ๊ทธ๋ ์ง ์์ต๋๋ค. CMU ํ์ ๋ฐ์์ ๋ฐ๊ฟจ์ต๋๋ค โ ๋ฌผ๋ฆฌ ์์ง์์ ๋๋ค ์ฅ๋ฉด์ ๋ง๋ค๊ณ , ์๋ฎฌ๋ ์ด์ ๊ฒฐ๊ณผ๋ก QA๋ฅผ ์์ฑํด์ RL๋ก ํ๋ จํฉ๋๋ค. ๊ฐ์ ์ธ๊ณ์์๋ง ํ๋ จํ ๋ชจ๋ธ์ด ์ค์ ๊ตญ์ ๋ฌผ๋ฆฌ์ฌ๋ฆผํผ์๋(IPhO) ๋ฌธ์ ์์ ์ ๋ก์ท์ผ๋ก ์ฑ๋ฅ ํฅ์์ ๋ณด์ฌ์ค๋๋ค.
ํนํ ์ฃผ๋ชฉํ ์ :
ํฉ์ฑ ์๋ฎฌ๋ ์ด์ ๋ฐ์ดํฐ๋ง์ผ๋ก IPhO ์ฑ๋ฅ 5~10%p ํฅ์
๋ชจ๋ธ ํฌ๊ธฐ์ ๊ด๊ณ์์ด ์ผ๊ด๋ ๊ฐ์ โ ์ค์ผ์ผ๋ง ๊ฐ๋ฅ์ฑ ์ ์ฆ
์ธํฐ๋ท QA ๋ฐ์ดํฐ ์์ด๋ ๋ฌผ๋ฆฌ ์ถ๋ก ๋ฅ๋ ฅ ์ต๋ ๊ฐ๋ฅ
๐ฏ ์ ์ด๊ฒ์ด ๊ฒ์ ์ฒด์ธ์ ์ธ๊ฐ? : โQA ๋ฐ์ดํฐ์ ์ผ๋ก ์ถ๋ก ํ๋ จโ โ โ์๋ฎฌ๋ ์ดํฐ๊ฐ ๋ฌดํํ ํ๋ จ ๋ฐ์ดํฐ๋ฅผ ์์ฑโ
Cycle-Consistent Search: Question Reconstructability as a Proxy Reward for Search Agent Training
๐๏ธ ์์: Meta, UCLA
๐ท๏ธ ํต์ฌ ํค์๋: Search Agent, Cycle Consistency, Unsupervised RL
๐ญ ์ด๋ฐ ์ง๋ฌธ์ ํด๋ณธ ์ ์๋์?
๊ฒ์ ์์ด์ ํธ๋ฅผ ํ๋ จํ๋ ค๋ฉด ํญ์ ์ ๋ต์ด ํ์ํ ๊น?
์ข์ ๊ฒ์ ๊ฒฐ๊ณผ์ธ์ง ์๋์ง๋ฅผ ์ ๋ต ์์ด ํ๋จํ ์ ์์๊น?
๋น์ง๋ ๊ธฐ๊ณ๋ฒ์ญ์ cycle consistency๊ฐ ๊ฒ์์๋ ํตํ ๊น?
์ข์ ๊ฒ์์ ์ง๋ฌธ์ ๋ณต์ํ ์ ์์ด์ผ ํฉ๋๋ค. Meta ํ์ ๋น์ง๋ ๋ฒ์ญ์ cycle consistency๋ฅผ ๊ฒ์์ ์ ์ฉํ์ต๋๋ค. โ๊ฒ์ ๊ฒฐ๊ณผ์์ ์๋ ์ง๋ฌธ์ ์ฌ๊ตฌ์ฑํ ์ ์์ผ๋ฉด ์ข์ ๊ฒ์์ด๋คโ๋ผ๋ ๊ฐ์ค๋ก ๋ณด์ ์ ํธ๋ฅผ ๋ง๋ญ๋๋ค. ๊ณ ์ ๋ช ์ฌ ๋ง์คํน๊ณผ ์ ๋ณด ๋ณ๋ชฉ์ผ๋ก ํ๋ฉด์ ๋จ์ ์์กด์ ์ฐจ๋จํด ์ง์ง ๊ฒ์ ํ์ง์ ์ธก์ ํฉ๋๋ค.
ํนํ ์ฃผ๋ชฉํ ์ :
์ ๋ต ๋ ์ด๋ธ ์์ด ์ง๋ํ์ต ๋ฒ ์ด์ค๋ผ์ธ๊ณผ ๋๋ฑํ ์ฑ๋ฅ ๋ฌ์ฑ
๊ณ ์ ๋ช ์ฌ(NER) ๋ง์คํน์ผ๋ก ์ธ์ด์ ๋จ์ ์ ์ถ ๋ฐฉ์ง
๊ธฐ์กด ๋น์ง๋ ๋ฐฉ๋ฒ ๋๋น ์ผ๊ด๋ ์ฑ๋ฅ ์ฐ์
๐ฏ ์ ์ด๊ฒ์ด ๊ฒ์ ์ฒด์ธ์ ์ธ๊ฐ? : โ์ ๋ต ๋ผ๋ฒจ๋ก ๊ฒ์ ์์ด์ ํธ ํ๋ จโ โ โ์ ๋ต ์์ด๋ ์๊ธฐ ๊ฒ์ฆ์ผ๋ก ํ์ตโ
Learning Long-term Motion Embeddings for Efficient Kinematics Generation
๐๏ธ ์์: Apple
๐ท๏ธ ํต์ฌ ํค์๋: Motion Generation, Temporal Compression, Flow Matching
๐ญ ์ด๋ฐ ์ง๋ฌธ์ ํด๋ณธ ์ ์๋์?
์์์ โ์์ง์โ๋ง ๋ฐ๋ก ์์ฑํ ์ ์์๊น?
๋น๋์ค ๋ชจ๋ธ๋ณด๋ค ์์ญ ๋ฐฐ ๋น ๋ฅด๊ฒ ๋ชจ์ ์ ์์ธกํ ์ ์์๊น?
ํ ์คํธ ํ ์ค๋ก ๋ฌผ์ฒด์ ๋ฏธ๋ ๊ถค์ ์ ๋ง๋ค์ด๋ผ ์ ์์๊น?
๋น๋์ค๋ฅผ ํต์งธ๋ก ๋ง๋๋ ๊ฑด ๋ง์น๋ก ํธ๋๋ฅผ ๊น๋ ๊ฒ์ ๋๋ค. Apple ํ์ ๋๊ท๋ชจ ๊ถค์ ๋ฐ์ดํฐ์์ ํ์ตํ ๋ชจ์ ์๋ฒ ๋ฉ์ 64๋ฐฐ ์๊ฐ ์์ถํ๊ณ , ์ด ์์ถ๋ ๊ณต๊ฐ์์ flow matching์ผ๋ก ๋ชจ์ ์ ์์ฑํฉ๋๋ค. ์์์ ๋ ๋๋งํ์ง ์๊ณ ์์ง์ ์์ฒด๋ฅผ ๋ค๋ฃจ๋ ๋น๋์ค ๋ชจ๋ธ๋ณด๋ค ์ ์๋ฆฟ์ ๋ ํจ์จ์ ์ ๋๋ค.
ํนํ ์ฃผ๋ชฉํ ์ :
์๊ฐ ์์ถ 64๋ฐฐ โ ์ฅ๊ธฐ ๋ชจ์ ์ ๊ทน๋๋ก ์์ถ๋ ์ ์ฌ ๊ณต๊ฐ์์ ์์ฑ
ํ ์คํธ ํ๋กฌํํธ์ ๊ณต๊ฐ ํฌํฌ(spatial poke)๋ก ๋ชจ์ ์กฐ๊ฑด ์ง์ ๊ฐ๋ฅ
๋น๋์ค ๋ชจ๋ธ๊ณผ ํ์คํฌ๋ณ ์ ๋ฌธ ๋ชจ๋ธ ๋ชจ๋๋ฅผ ๋ฅ๊ฐํ๋ ๋ชจ์ ๋ถํฌ
๐ฏ ์ ์ด๊ฒ์ด ๊ฒ์ ์ฒด์ธ์ ์ธ๊ฐ? : โ๋ชจ์ ์ ๋ณด๋ ค๋ฉด ์์ ์ ์ฒด๋ฅผ ์์ฑโ โ โ๋ชจ์ ๋ง ์์ถยท์์ฑํ๊ณ ํ์ํ ๋ ๋ ๋๋งโ
TIPSv2: Advancing Vision-Language Pretraining with Enhanced Patch-Text Alignment
๐๏ธ ์์: Google
๐ท๏ธ ํต์ฌ ํค์๋: Vision-Language Pretraining, Patch-Text Alignment, Knowledge Distillation
๐ญ ์ด๋ฐ ์ง๋ฌธ์ ํด๋ณธ ์ ์๋์?
๋น์ ๋ชจ๋ธ์ด ์ด๋ฏธ์ง์ โ๋ถ๋ถโ๊ณผ ํ ์คํธ๋ฅผ ์ ๋ฐํ๊ฒ ๋งค์นญํ ์ ์์๊น?
์ง์ ์ฆ๋ฅ์์ ํ์์ด ์ ์๋ณด๋ค ๋์ ์ ์์๊น?
๋ง์คํฌ๋ ์ด๋ฏธ์ง ํ์ต์์ ๋ง์คํฌ ์ ๋ ํ ํฐ์ ์ ๋ฌด์ํ ๊น?
์ ์๊ฐ ์ค์น์ ๋์ด์๋ ์๊ฐ์ ๋๋ค. Google ํ์ด ํจ์น ๋ ๋ฒจ ์ฆ๋ฅ๋ฅผ ์ ์ฉํ๋๋, ํ์ ๋ชจ๋ธ์ ํจ์น-ํ ์คํธ ์ ๋ ฌ์ด ์ ์ ๋ชจ๋ธ์ ๊ฐํ๊ฒ ๋ฅ๊ฐํ์ต๋๋ค. ์ด ๋ฐ๊ฒฌ์์ ์๊ฐ์ ๋ฐ์ iBOT++ โ ๋ง์คํฌ๋์ง ์์ ํ ํฐ๋ ์์ค์ ๊ธฐ์ฌํ๋๋ก ํ ์ ๊ทธ๋ ์ด๋ โ ๋ฅผ ์ ์ํ๊ณ , 9๊ฐ ํ์คํฌ, 20๊ฐ ๋ฐ์ดํฐ์ ์์ ์ต์ ๋น์ ์ธ์ฝ๋ ๋ชจ๋ธ๊ณผ ๋๋ฑํ๊ฑฐ๋ ์ฐ์ํ ๊ฒฐ๊ณผ๋ฅผ ๋ณด์ฌ์ค๋๋ค.
ํนํ ์ฃผ๋ชฉํ ์ :
ํจ์น-ํ ์คํธ ์ ๋ ฌ์์ ํ์ > ์ ์ โ ์ฆ๋ฅ์ ๋ฐ์ง๊ด์ ํจ๊ณผ ๋ฐ๊ฒฌ
iBOT++: ๋ง์คํฌ/๋น๋ง์คํฌ ํ ํฐ ๋ชจ๋ ํ์ต์ ํ์ฉ โ ํจ์น ์ ๋ ฌ ๊ทน์ ๊ฐ์
ํฉ์ฑ ์บก์ ์ํ๋ง์ผ๋ก ๋ค์ํ ์ธ๋ฐ๋์ ํ ์คํธ ํ์ฉ
๐ฏ ์ ์ด๊ฒ์ด ๊ฒ์ ์ฒด์ธ์ ์ธ๊ฐ? : โ์ด๋ฏธ์ง ์ ์ฒด์ ํ ์คํธ๋ฅผ ๋งค์นญโ โ โ์ด๋ฏธ์ง์ ๊ฐ ํจ์น์ ๊ฐ๋ ์ ์ ๋ฐ ์ ๋ ฌโ
Evolution of Optimization Methods: Algorithms, Scenarios, and Evaluations
๐๏ธ ์์: Tencent
๐ท๏ธ ํต์ฌ ํค์๋: Deep Learning Optimization, SGD vs Adam, Comprehensive Survey
๐ญ ์ด๋ฐ ์ง๋ฌธ์ ํด๋ณธ ์ ์๋์?
2026๋ ํ์ฌ, ์ด๋ค ์ตํฐ๋ง์ด์ ๋ฅผ ์จ์ผ ํ ๊น?
2์ฐจ ์ต์ ํ๋ ์ ์ด๋ก ๋ง ์ข๊ณ ์ค์ ์์ ์ ์ธ๊น?
๋๊ท๋ชจ ๋ชจ๋ธ ํ๋ จ์์ ๋ฉ๋ชจ๋ฆฌ๋ฅผ ์๋ผ๋ฉด์ ์๋ ด๋ ๋น ๋ฅด๊ฒ ํ ์ ์์๊น?
๋ฅ๋ฌ๋ ์ต์ ํ์ ์กฑ๋ณด๋ฅผ ํ ํธ์ ์ ๋ฆฌํฉ๋๋ค. Tencent ํ์ด 1์ฐจ(SGD, Adam), 2์ฐจ, 0์ฐจ ์ต์ ํ๋ฅผ ๋ชจ๋ ์์ฐ๋ฅด๋ ์ข ํฉ ํ๋ ์์ํฌ๋ฅผ ์ ์ํ๊ณ , ๋ค์ํ ์ํคํ ์ฒ์ ์๋๋ฆฌ์ค์์ ์ค์ฆ ํ๊ฐ๋ฅผ ์ํํ์ต๋๋ค. ๋๊ท๋ชจ ๋ชจ๋ธ, ์ฐจ๋ฑ ํ๋ผ์ด๋ฒ์, ๋ถ์ฐ ํ์ต ๋ฑ ์ค์ ์๋๋ฆฌ์ค๋ณ๋ก ์ด๋ค ๋ฐฉ๋ฒ์ด ์ฐ์์ธ์ง ๊ฐ์ด๋๋ฅผ ์ ๊ณตํฉ๋๋ค.
ํนํ ์ฃผ๋ชฉํ ์ :
1์ฐจ โ 2์ฐจ โ 0์ฐจ ์ต์ ํ์ ์งํ ๊ฒฝ๋ก๋ฅผ ํตํฉ ํ๋ ์์ํฌ๋ก ์ ๋ฆฌ
ํ๋ผ์ด๋ฒ์ ๋ณดํธยท๋ฉ๋ชจ๋ฆฌ ํจ์จ ์๋๋ฆฌ์ค์์ 0์ฐจ ๋ฐฉ๋ฒ์ ์ฌ๋ถ์
์ฐจ์ธ๋ ์ตํฐ๋ง์ด์ ์ค๊ณ๋ฅผ ์ํ ์ค์ฉ์ ๊ฐ์ด๋๋ผ์ธ ์ ์
๐ฏ ์ ์ด๊ฒ์ด ๊ฒ์ ์ฒด์ธ์ ์ธ๊ฐ? : โAdam ์ฐ๋ฉด ๋์ถฉ ๋๊ฒ ์งโ โ โ์๋๋ฆฌ์ค๋ณ ์ต์ ์ตํฐ๋ง์ด์ ๋ฅผ ๋ฐ์ดํฐ๋ก ์ ํโ
Agentic Aggregation for Parallel Scaling of Long-Horizon Agentic Tasks
๐๏ธ ์์: Princeton University
๐ท๏ธ ํต์ฌ ํค์๋: Parallel Scaling, Test-Time Compute, Agentic Aggregation
๐ญ ์ด๋ฐ ์ง๋ฌธ์ ํด๋ณธ ์ ์๋์?
๋ฅ๋ฆฌ์์น ๊ฒฐ๊ณผ๋ฅผ ์ฌ๋ฌ ๊ฐ ๋ฝ์๋๋ฐ ์ด๋ป๊ฒ ํฉ์น ๊น?
์์ด์ ํธ ๊ถค์ ์ด ๋๋ฌด ๊ธธ์ด์ ์ปจํ ์คํธ์ ์ ๋ค์ด๊ฐ๋ฉด?
๋ณ๋ ฌ ์ค์ผ์ผ๋ง์ด ์ํ๋งํผ ์์ด์ ํธ ํ์คํฌ์์๋ ํตํ ๊น?
์ฌํ ๊ณํ์ ์ธ ๋ช ์๊ฒ ์์ผฐ๋๋ ๊ฐ์ 100ํ์ด์ง ๋ณด๊ณ ์๋ฅผ ์คฌ์ต๋๋ค. ์ ๋ถ ์ฝ์ ์๋, ๊ฒฐ๋ก ๋ง ๋ณผ ์๋ ์๋ ์ํฉ. Princeton ํ์ AggAgent๋ ๋ณ๋ ฌ ์์ด์ ํธ ๊ถค์ ์ โํ๊ฒฝโ์ผ๋ก ์ทจ๊ธํ๊ณ , ๋๊ตฌ๋ฅผ ์จ์ ํ๋ณด ๋ต์์ ๊ฒ์ฌํ๊ณ ๊ถค์ ์ ํ์ํฉ๋๋ค. ํ์ํ ์ ๋ณด๋ง ๊ณจ๋ผ ํฉ์ฑํ๋ ์ปจํ ์คํธ ์ ํ๋ ๋์ต๋๋ค.
ํนํ ์ฃผ๋ชฉํ ์ :
๊ธฐ์กด ๋ชจ๋ ์ง๊ณ ๋ฐฉ๋ฒ ๋๋น ํ๊ท 5.3%p, ๋ฅ๋ฆฌ์์น ํ์คํฌ์์ ์ต๋ 10.3%p ํฅ์
์ง๊ณ ๋น์ฉ์ด ๋จ์ผ ๋กค์์ ์์ค โ ์ฌ์ค์ ๋ฌด๋ฃ ์ฑ๋ฅ ํฅ์
GLM-4.7, Qwen3.5, MiniMax-M2.5 ๋ฑ 3๊ฐ ๋ชจ๋ธ ํจ๋ฐ๋ฆฌ์์ ์ผ๊ด๋ ํจ๊ณผ
๐ฏ ์ ์ด๊ฒ์ด ๊ฒ์ ์ฒด์ธ์ ์ธ๊ฐ? : โ๋ณ๋ ฌ ๋กค์์์ ์ต์ข ๋ต๋ง ๋ค์๊ฒฐโ โ โ๊ถค์ ์ ์ฒด๋ฅผ ์์ด์ ํธ๊ฐ ํ์ยทํฉ์ฑโ
General365: Benchmarking General Reasoning in Large Language Models Across Diverse and Challenging Tasks
๐๏ธ ์์: Independent
๐ท๏ธ ํต์ฌ ํค์๋: General Reasoning, Benchmark, Domain-Independent
๐ญ ์ด๋ฐ ์ง๋ฌธ์ ํด๋ณธ ์ ์๋์?
์ํ ๋ฒค์น๋งํฌ 1๋ฑ ๋ชจ๋ธ์ด ๋ค๋ฅธ ์ถ๋ก ๋ ์ํ ๊น?
์ ๋ฌธ ์ง์ ์์ด ์์ ์ถ๋ก ๋ง ํ ์คํธํ ์ ์์๊น?
LLM์ด ์ ๋ง โ์ถ๋ก โํ๋ ๊ฑด์ง, ๋๋ฉ์ธ ํจํด์ ์ธ์ด ๊ฑด์ง?
์ํ์ ๋ง์ ์ธ๋ฐ ๋ ผ๋ฆฌ ํผ์ฆ์ ๋ชป ํ๋ฉด ์ง์ง ์ถ๋ก ์ผ๊น์? General365๋ ๋ฐฐ๊ฒฝ์ง์์ ์คํ๊ต ์์ค์ผ๋ก ์ ํํ๊ณ , ๋ณต์กํ ์ ์ฝยท์ค์ฒฉ ๋ ผ๋ฆฌยท์๋ฏธ ๊ฐ์ญ์ ๋ด์ 365๊ฐ ๋ฌธ์ ๋ก ์์ ์ถ๋ก ๋ ฅ์ ์ธก์ ํฉ๋๋ค. 26๊ฐ ์ต์ ๋ชจ๋ธ์ ํ ์คํธํ ๊ฒฐ๊ณผ, ์ต๊ณ ๋ชจ๋ธ๋ 62.8%์ ๊ทธ์ณค์ต๋๋ค โ ์ํยท๋ฌผ๋ฆฌ ๋ฒค์น๋งํฌ์ ๊ฑฐ์ ๋ง์ ๊ณผ ๊ทน๋ช ํ ๋๋น์ ๋๋ค.
ํนํ ์ฃผ๋ชฉํ ์ :
26๊ฐ LLM ์ค ์ต๊ณ ์ฑ๋ฅ์ด 62.8% โ ๋๋ฉ์ธ ํนํ ๋ฒค์น๋งํฌ์ ๊ทน๋ช ํ ๊ฒฉ์ฐจ
8๊ฐ ์นดํ ๊ณ ๋ฆฌ์ 1,095๊ฐ ๋ณํ ๋ฌธ์ ๋ก ๋ค์์ฑ๊ณผ ๋์ด๋ ํ๋ณด
ํ์ฌ LLM์ ์ถ๋ก ๋ฅ๋ ฅ์ด ๋๋ฉ์ธ์ ๊ฐํ๊ฒ ์์กดํ๋ค๋ ์ฆ๊ฑฐ
๐ฏ ์ ์ด๊ฒ์ด ๊ฒ์ ์ฒด์ธ์ ์ธ๊ฐ? : โ์ํยท์ฝ๋ ๋ฒค์น๋งํฌ๋ก ์ถ๋ก ๋ฅ๋ ฅ ์ธก์ โ โ โ๋๋ฉ์ธ ์ง์ ์์ด ์์ ์ถ๋ก ๋ง ์ธก์ โ
๋งค์ฃผ ๋ชฉ์์ผ ์ค์ 8์, ๋ฐ์ ๋น์ ์ ๊ธฐ์ ๋ฐ์ ์ ๋ค์ณ์ง์ง ์๊ฒ ๋ง๋ค์ด์ค ์ต์ AI ํธ๋ ๋ ์์ฝ๋ณธ์ด ์ ๋ฌ๋ฉ๋๋ค! ๐