26.05. 3แแ ฎแแ ก | SenseTime, Alibaba, NVIDIA, Google, ByteDance

๊ธ์ฃผ ์บ์นํ์ดํผ๋ SenseTime, Alibaba, NVIDIA, Google, ByteDance์ ํจ๊ปํฉ๋๋ค. 3๋ถ๋ง ํฌ์ํด ์ฑ ๋๋ฌ๋ณด๊ณ , ๋น ๋ฅด๊ฒ ๋ฐ๋๋ ๊ธฐ์ ์ ๋ฐฉํฅ์ฑ์ ๋์น์ง ๋ง์ธ์!
๐ ๋ฉํฐ๋ชจ๋ฌ ์ดํดยท์์ฑ ํตํฉ โ โ๋ฐ๋ก ๋ง๋๋ ๊ฑด ๋ญ๋นโ๋ผ๋ ๊ณต๊ฐ๋ ํ์ฐ
๐ฅ ์์ด์ ํธ ์์จ ํ์ต๊ณผ ์ฝ๋ ๊ธฐ๋ฐ OSํ๊ฐ ๋์์ ๊ธ๋ฌผ์ด
๐ ์ ๋ต ์๋ ๋ฌธ์ ๊น์ง RL์ด ์ง์ถ โ ๋ฆฌ์์นยท์ฌ๋ฆผํผ์๋ ์ ๋ฐฉ์ ํ์ฅ
SenseNova-U1: Unifying Multimodal Understanding and Generation with NEO-unify Architecture
๐๏ธ ์์: SenseTime
๐ท๏ธ ํต์ฌ ํค์๋: Unified VLM, Understanding-Generation, NEO-unify Architecture
๐ญ ์ด๋ฐ ์ง๋ฌธ์ ํด๋ณธ ์ ์๋์?
์ด๋ฏธ์ง๋ฅผ โ์ดํดโํ๋ ๋ชจ๋ธ๊ณผ โ๋ง๋๋โ ๋ชจ๋ธ์ ์ ๋ฐ๋ก ์จ์ผ ํ์ฃ ?
ํ๋๋ก ํฉ์น๋ฉด ๋ ๋ค ํ์ง์ด ๋จ์ด์ง์ง ์๋์?
๋ฉํฐ๋ชจ๋ฌ ๋ชจ๋ธ์ ๋ค์ ์งํ ๋ฐฉํฅ์ ๋ญ๊น์?
์๋ฆฌ์ฌ ๋์ ๊ณ ์ฉํด ํ ๋ช ์ ๋ง๋ง ๋ณด๊ฒ ํ๊ณ , ๋ค๋ฅธ ํ ๋ช ์ ์๋ฆฌ๋ง ํ๊ฒ ์ํค๋ ๋ ์คํ ๋์ ์์ํด ๋ณด์ธ์. ๋นํจ์จ์ ์ด์ฃ ? ์ง๊ธ๊น์ง VLM์ด ์ ํํ ๊ทธ๋์์ต๋๋ค. SenseTime์ 58๋ช ์ฐ๊ตฌ์ง์ โ์ด ์ด๋ถ๋ฒ ์์ฒด๊ฐ ๊ฐ๋ ์ ๋ณ๋ชฉโ์ด๋ผ๊ณ ์ ์ธํฉ๋๋ค. NEO-unify ์ํคํ ์ฒ๋ ์ดํด์ ์์ฑ์ ํ๋์ ํํ ๊ณต๊ฐ์์ ํตํฉํ์ฌ, ๋ถ์ ๋ ํ์ดํ๋ผ์ธ๊ณผ ๋ถ์ผ์น ๋ฌธ์ ๋ฅผ ํ ๋ฒ์ ํด๊ฒฐํฉ๋๋ค.
ํนํ ์ฃผ๋ชฉํ ์ :
์ดํด(VQA, ์บก์ ๋)์ ์์ฑ(์ด๋ฏธ์ง ์์ฑ) ํ์คํฌ๋ฅผ ๋จ์ผ ๋ชจ๋ธ๋ก ์ํ
๊ธฐ์กด ์บ์ค์ผ์ด๋ ํ์ดํ๋ผ์ธ ๋๋น ์ํคํ ์ฒ ๋จ์ํ ๋ฐ ์ถ๋ก ํจ์จ ํฅ์
58๋ช ๋๊ท๋ชจ ํ์ ์ข ํฉ ๊ธฐ์ ๋ณด๊ณ ์๋ก ์ฐ์ ์ ์ฉ ์๋ ๋ช ํ
๐ฏ ์ ์ด๊ฒ์ด ๊ฒ์ ์ฒด์ธ์ ์ธ๊ฐ? : ์ดํด ๋ชจ๋ธ ๋ฐ๋ก, ์์ฑ ๋ชจ๋ธ ๋ฐ๋ก ๋ง๋ค์ด ์ด์ด ๋ถ์ด๋ ์๋ โ ํ๋์ ํตํฉ ์ํคํ ์ฒ๋ก ์ดํด์ ์์ฑ์ด ์๋ก๋ฅผ ๊ฐํํ๋ ์๋
Self-Distilled Agentic Reinforcement Learning
๐๏ธ ์์: Alibaba, Zhejiang University
๐ท๏ธ ํต์ฌ ํค์๋: On-Policy Self-Distillation, Agentic RL, Token-level Reward
๐ญ ์ด๋ฐ ์ง๋ฌธ์ ํด๋ณธ ์ ์๋์?
RL ์์ด์ ํธํํ โ์ต์ข ์ฑ๊ณต/์คํจโ๋ง ์๋ ค์ฃผ๋ฉด ๋ญ ๊ณ ์ณ์ผ ํ๋์ง ์๊น์?
์ ์๋ ๋ชจ๋ธ ์์ด ์์ด์ ํธ๊ฐ ์ค์ค๋ก ๋ฐ๋ ๋์ ํผ๋๋ฐฑ์ ๋ง๋ค ์ ์์๊น์?
๊ธด ์์ ์์ ์ด๋ ์คํ ์ด ์๋ชป๋ ๊ฑด์ง ์ด๋ป๊ฒ ์ฐพ์ฃ ?
๋ง๋ผํค ์ฝ์น๊ฐ โ์์ฃผ ์ฑ๊ณตโ ๋๋ โ์คํจโ๋ง ๋งํด์ค๋ค๊ณ ์๊ฐํด ๋ณด์ธ์. 10km ์ง์ ์์ ํ์ด์ค๋ฅผ ์์๋์ง, 30km์์ ๋ณด๊ธ์ ๋์ณค๋์ง ์ ์๊ฐ ์์ฃ . ๊ธฐ์กด ์์ด์ ํธ RL์ด ์ ํํ ์ด ๋ฌธ์ ๋ฅผ ๊ฒช๊ณ ์์์ต๋๋ค. Alibaba์ ์ ์ฅ๋ ์ฐ๊ตฌ์ง์ On-Policy Self-Distillation(OPSD)์ ์ ์ํฉ๋๋ค. ๊ถค์ ์ ์ฒด์ ๋ํ ์ฑ๊ณต/์คํจ ๋ณด์์, ํ ํฐ ๋ ๋ฒจ์ ๋ฐ๋ ๋์ ์ง๋ ์ ํธ๋ก ๋ณํํ์ฌ ์์ด์ ํธ๊ฐ ์ด๋ ์๊ฐ ์ด๋ค ๊ฒฐ์ ์ด ์๋ชป๋๋์ง๋ฅผ ์ง์ ํ์ตํฉ๋๋ค.
ํนํ ์ฃผ๋ชฉํ ์ :
๊ถค์ (trajectory) ๋ณด์์ ํ ํฐ ์์ค ๋ฐ๋ ๋์ ํผ๋๋ฐฑ์ผ๋ก ์๋ ๋ถํด
๋ณ๋ ๊ต์ฌ ๋ชจ๋ธ ์์ด ์๊ธฐ ์์ ์ ์ด์ ์ ์ฑ ์ ๊ต์ฌ๋ก ํ์ฉ
์ฅ๊ธฐ ํธ๋ผ์ด์ฆ ์์ด์ ํธ ํ์คํฌ์์ ํ์ต ํจ์จ ๋ํญ ํฅ์
๐ฏ ์ ์ด๊ฒ์ด ๊ฒ์ ์ฒด์ธ์ ์ธ๊ฐ? : ๊ถค์ ๋์์๋ง โ์ฑ๊ณต/์คํจโ๋ฅผ ๋ฃ๋ ์์ด์ ํธ โ ๋งค ์คํ ๋ง๋ค ์๊ธฐ ์ค์๋ฅผ ๊ต์ ํ๋ฉฐ ์ค์ค๋ก ์ฑ์ฅํ๋ ์์ด์ ํธ
AnyFlow: Any-Step Video Diffusion Model with On-Policy Flow Map Distillation
๐๏ธ ์์: NVIDIA, MIT, NUS
๐ท๏ธ ํต์ฌ ํค์๋: Video Diffusion, Any-Step Generation, Flow Map Distillation
๐ญ ์ด๋ฐ ์ง๋ฌธ์ ํด๋ณธ ์ ์๋์?
๋ํจ์ ๋ชจ๋ธ ์คํ ์๋ฅผ ์ค์ด๋ฉด ์ ํ์ง์ด ํ ๋จ์ด์ง์ฃ ?
๋น ๋ฅธ ์์ฑ๊ณผ ๊ณ ํ์ง ์์ฑ์ ๋์์ ์ธ ์ ์๋ ๋ชจ๋ธ์ ์๋์?
์ค์๊ฐ ํ๋ฆฌ๋ทฐ๋ 1์คํ , ์ต์ข ๋ ๋๋ง์ 50์คํ โ ๊ฐ์ ๋ชจ๋ธ๋ก ๊ฐ๋ฅํ ๊น์?
๋ ์ด์ฑ์นด์ ๊ธฐ์ด๋ฅผ ์๊ฐํด ๋ณด์ธ์. 1๋จ ๊ธฐ์ด์ 6๋จ ๊ธฐ์ด์์ ๋ชจ๋ ์ต๊ณ ์ฑ๋ฅ์ ๋ด๋ ์ฐจ๋ ์์์ฃ . ์ง๊ธ๊น์ง ์์ ์์ฑ ๋ชจ๋ธ๋ ๋ง์ฐฌ๊ฐ์ง์์ต๋๋ค. ์ ์ ์คํ ์ ์ต์ ํํ๋ฉด ๋ง์ ์คํ ์์ ์ฑ๋ฅ์ด ๋จ์ด์ก๊ณ , ๊ทธ ๋ฐ๋๋ ๋ง์ฐฌ๊ฐ์ง. NVIDIA์ MIT ์ฐ๊ตฌ์ง์ AnyFlow๋ On-Policy Flow Map Distillation์ด๋ผ๋ ์๋ก์ด ์ ๊ทผ์ผ๋ก, 1์คํ ๋ถํฐ 50์คํ ๊น์ง ์ด๋ค ์คํ ์์์๋ ์ผ๊ด๋ ํ์ง์ ๋ณด์ฅํฉ๋๋ค. ๊ธฐ์ด๋ฅผ ๋ฐ๊ฟ๋ ์ฑ๋ฅ์ด ์ ์ง๋๋ ๋ ์ด์ฑ์นด๋ฅผ ๋ง๋ ์ ์ด์ฃ .
ํนํ ์ฃผ๋ชฉํ ์ :
๊ธฐ์กด consistency distillation์ โ์คํ ๋๋ฆฌ๋ฉด ์ฑ๋ฅ ์ ํโ ๋ฌธ์ ๋ฅผ ๊ทผ๋ณธ์ ์ผ๋ก ํด๊ฒฐ
On-Policy ํ์ต์ผ๋ก ํ์ ๋ชจ๋ธ์ ์ค์ ๋ถํฌ์์ ์ง์ ์ต์ ํ
์ค์๊ฐ ํ๋ฆฌ๋ทฐ(์ ์คํ ) โ ์ต์ข ๋ ๋(๊ณ ์คํ ) ์ ํ์ด ๋ชจ๋ธ ๊ต์ฒด ์์ด ๊ฐ๋ฅ
๐ฏ ์ ์ด๊ฒ์ด ๊ฒ์ ์ฒด์ธ์ ์ธ๊ฐ? : ๋น ๋ฅธ ๋ชจ๋ธ ๋ฐ๋ก, ๊ณ ํ์ง ๋ชจ๋ธ ๋ฐ๋ก ์จ์ผ ํ๋ ์์ ์์ฑ โ ํ๋์ ๋ชจ๋ธ์ด ์ํฉ์ ๋ง๊ฒ ์คํ ์๋ฅผ ์์ ๋กญ๊ฒ ์ ํ
RubricEM: Meta-RL with Rubric-guided Policy Decomposition beyond Verifiable Rewards
๐๏ธ ์์: Google
๐ท๏ธ ํต์ฌ ํค์๋: Deep Research Agent, Meta-RL, Rubric-guided Reward
๐ญ ์ด๋ฐ ์ง๋ฌธ์ ํด๋ณธ ์ ์๋์?
AI ์์ด์ ํธ๊ฐ ๋ฌธํ ์กฐ์ฌ, ์ฆ๊ฑฐ ํ๊ฐ, ๋ณด๊ณ ์ ์์ฑ๊น์ง ํ ์ ์์๊น์?
์ ๋ต์ด ์๋ ์ฐ๊ตฌ ๊ณผ์ ์์ RL์ ์ด๋ป๊ฒ ์ ์ฉํ์ฃ ?
์ฑ์ ๊ธฐ์ค๋ง ์ค๋ ์์ด์ ํธ๊ฐ ์ฐ๊ตฌ ํ์ง์ ํ์ตํ ์ ์์๊น์?
์ํ ๋ฌธ์ ์๋ ์ ๋ต์ด ์์ง๋ง, ์ฐ๊ตฌ ๋ณด๊ณ ์์๋ โ์ ๋ตโ์ด ์์ต๋๋ค. ๊ทธ๋์ ์ง๊ธ๊น์ง RL์ ์ ๋ต์ด ์๋ ๊ณผ์ ์๋ง ๊ฐํ ์์์ฃ . Google์ RubricEM์ ์ด ํ๊ณ๋ฅผ ๋ํํฉ๋๋ค. ์ฑ์ ๊ธฐ์คํ(rubric)๋ฅผ ๊ธฐ๋ฐ์ผ๋ก ์ ์ฑ ์ ๋ถํดํ๊ณ , Meta-RL๋ก ๊ฐ ํ์ ์ ์ฑ ์ ๋ ๋ฆฝ์ ์ผ๋ก ์ต์ ํํฉ๋๋ค. ๊ณํ ์๋ฆฝ, ๊ฒ์, ์ฆ๊ฑฐ ํ๊ฐ, ์ฅ๋ฌธ ๋ณด๊ณ ์ ํฉ์ฑ๊น์ง โ ์ ๋ต ์์ด๋ ๋ฅ ๋ฆฌ์์น ์์ด์ ํธ๋ฅผ ํ๋ จํ ์ ์๊ฒ ๋ ๊ฒ์ ๋๋ค.
ํนํ ์ฃผ๋ชฉํ ์ :
์ ๋ต(verifiable reward) ์์ด๋ ์ฅ๋ฌธ ์ฐ๊ตฌ ๋ณด๊ณ ์ ์์ฑ ์์ด์ ํธ ํ๋ จ ์ฑ๊ณต
์ฑ์ ๊ธฐ์คํ๋ก ๋ณต์กํ ์ฐ๊ตฌ ๊ณผ์ ์ ํ์ ์ ์ฑ ์ผ๋ก ์๋ ๋ถํด
๊ณํ-๊ฒ์-ํ๊ฐ-ํฉ์ฑ ์ ๊ณผ์ ์ ๋ค๋ฃจ๋ end-to-end ์์ด์ ํธ ํ์ดํ๋ผ์ธ
๐ฏ ์ ์ด๊ฒ์ด ๊ฒ์ ์ฒด์ธ์ ์ธ๊ฐ? : ์ ๋ต์ด ์๋ ๊ณผ์ (์ฝ๋ฉ, ์ํ)์์๋ง ์๋ํ๋ RL โ ์ ๋ต ์๋ ์ฐ๊ตฌยท๋ถ์ ๊ณผ์ ๊น์ง RL์ด ์ง์ถ
Lance: Unified Multimodal Modeling by Multi-Task Synergy
๐๏ธ ์์: ByteDance
๐ท๏ธ ํต์ฌ ํค์๋: Unified Multimodal, Lightweight Model, Multi-Task Synergy
๐ญ ์ด๋ฐ ์ง๋ฌธ์ ํด๋ณธ ์ ์๋์?
์ด๋ฏธ์ง ์ดํด, ์์ ์์ฑ, ํธ์ง์ ํ๋์ ๋ชจ๋ธ๋ก ํ ์ ์๋์?
๋ชจ๋ธ ํฌ๊ธฐ๋ฅผ ํค์ฐ์ง ์๊ณ ๋ฉํฐ๋ชจ๋ฌ ํตํฉ์ด ๊ฐ๋ฅํ ๊น์?
์ด๋ฏธ์ง ์ค์ฌ ํ์ต๋ง์ผ๋ก ์์๊น์ง ์ปค๋ฒํ ์ ์์๊น์?
์ค์์ค ์๋ฏธ ๋์ดํ๊ฐ ์ปค์ ธ์ผ๋ง ๊ธฐ๋ฅ์ด ๋์ด๋๋ ๊ฑด ์๋๋๋ค. ByteDance์ Lance๋ โ๋ชจ๋ธ์ ํค์ฐ๋ ๋์ ํ์คํฌ ๊ฐ ์๋์ง๋ฅผ ๊ทน๋ํํ์โ๋ ์ค์ฉ์ ์ ๊ทผ์ ์ทจํฉ๋๋ค. ์ด๋ฏธ์ง์ ์์์ ์ดํด, ์์ฑ, ํธ์ง์ ๊ฒฝ๋ ๋ค์ดํฐ๋ธ ํตํฉ ๋ชจ๋ธ๋ก ์ํํ๋ฉฐ, ํ ์คํธ-์ด๋ฏธ์ง ์์ฃผ ์ค๊ณ๊ฐ ์๋ ๋ฉํฐํ์คํฌ ํ์ ์ ํตํด ๊ฐ ๋ชจ๋ฌ๋ฆฌํฐ๊ฐ ์๋ก๋ฅผ ๊ฐํํ๋ ๊ตฌ์กฐ๋ฅผ ๋ง๋ค์์ต๋๋ค.
ํนํ ์ฃผ๋ชฉํ ์ :
์ด๋ฏธ์งยท์์์ ์ดํด/์์ฑ/ํธ์ง 6๊ฐ์ง ํ์คํฌ๋ฅผ ๋จ์ผ ๊ฒฝ๋ ๋ชจ๋ธ๋ก ์ฒ๋ฆฌ
๋ชจ๋ธ ํฌ๊ธฐ ์ค์ผ์ผ๋ง ๋์ ๋ฉํฐํ์คํฌ ์๋์ง๋ก ์ฑ๋ฅ ํ๋ณด
ํ ์คํธ-์ด๋ฏธ์ง ํธํฅ ์๋ ๊ท ํ ์กํ ๋ฉํฐ๋ชจ๋ฌ ์ค๊ณ
๐ฏ ์ ์ด๊ฒ์ด ๊ฒ์ ์ฒด์ธ์ ์ธ๊ฐ? : ํ์คํฌ๋ง๋ค ์ ์ฉ ๋ํ ๋ชจ๋ธ์ ๋๋ ค์ผ ํ๋ ๋ฉํฐ๋ชจ๋ฌ โ ๊ฒฝ๋ ํ๋๋ก 6๊ฐ์ง ํ์คํฌ๋ฅผ ๋์์ ์ฒ๋ฆฌํ๋ ์ค์ฉ์ ํตํฉ
CiteVQA: Benchmarking Evidence Attribution for Trustworthy Document Intelligence
๐๏ธ ์์: Independent
๐ท๏ธ ํต์ฌ ํค์๋: Evidence Attribution, Document VQA, Hallucination Detection
๐ญ ์ด๋ฐ ์ง๋ฌธ์ ํด๋ณธ ์ ์๋์?
AI๊ฐ ์ ๋ต์ ๋งํ์ผ๋ฉด ๊ทธ ๋ต์ ๋ฏฟ์ด๋ ๋๋ ๊ฑฐ ์๋๊ฐ์?
๋ชจ๋ธ์ด โ์ฌ๊ธฐ ๊ทผ๊ฑฐ ์์ต๋๋คโ๋ผ๊ณ ๊ฐ๋ฆฌํจ ๊ณณ์ด ์ง์ง ๊ทผ๊ฑฐ์ธ์ง ์ด๋ป๊ฒ ํ์ธํ์ฃ ?
๋ฌธ์ ๊ธฐ๋ฐ QA์์ ๋ต๋ง ํ๊ฐํ๋ฉด ๋ญ ๋์น๊ฒ ๋๋์?
๋ฒ์ ์์ ํ์ฌ๊ฐ โํ๊ฒฐ ๊ฒฐ๊ณผ๋ง ๋ง์ผ๋ฉด ์ฆ๊ฑฐ๋ ์๋ฌด๊ฑฐ๋ ์จ๋ ๋ฉ๋๋คโ๋ผ๊ณ ํ๋ค๋ฉด? ๋ง๋ ์ ๋์ฃ . ๊ทธ๋ฐ๋ฐ ์ง๊ธ๊น์ง ๋ฌธ์ QA ํ๊ฐ๊ฐ ์ ํํ ๊ทธ๋์์ต๋๋ค. CiteVQA๋ ์ด ๋งน์ ์ ์ ๋ฉด์ผ๋ก ๊ณต๊ฒฉํฉ๋๋ค. ๋ชจ๋ธ์ด ์ ๋ต์ ๋งํ๋ฉด์๋ ์์ ํ ์๋ฑํ ๋ฌธ์ ์์ญ์ ๊ทผ๊ฑฐ๋ก ์ ์ํ๋ โ์ฆ๊ฑฐ ๋ ์กฐโ ํ์์ ์ฒด๊ณ์ ์ผ๋ก ๋ฒค์น๋งํนํ ์ฒซ ํ๋ ์์ํฌ์ ๋๋ค. HuggingFace ์ฃผ๊ฐ ์ต๋ค upvote(253)๊ฐ ์ด ๋ฌธ์ ์ ์ฌ๊ฐ์ฑ์ ๋ํ ์ปค๋ฎค๋ํฐ์ ๊ณต๊ฐ์ ๋ณด์ฌ์ค๋๋ค.
ํนํ ์ฃผ๋ชฉํ ์ :
์ ๋ต๋ฅ ์ ๋์ง๋ง ๊ทผ๊ฑฐ ์ ํ๋๊ฐ ํ์ ํ ๋ฎ์ โ์ฆ๊ฑฐ ๋ ์กฐโ ํจํด ์ต์ด ์ฒด๊ณํ
๋ต๋ณ-๊ทผ๊ฑฐ ๋์ ํ๊ฐ ํ๋ ์์ํฌ๋ก ์ ๋ขฐํ ์ ์๋ ๋ฌธ์ AI ๊ธฐ์ค ์ ์
HuggingFace ์ฃผ๊ฐ ์ปค๋ฎค๋ํฐ upvote 253ํ โ ์ด๋ฒ ์ฃผ ๊ฐ์ฅ ๋จ๊ฑฐ์ด ๋ ผ๋ฌธ
๐ฏ ์ ์ด๊ฒ์ด ๊ฒ์ ์ฒด์ธ์ ์ธ๊ฐ? : โ์ ๋ต ๋งํ๋ฉด OKโ โ โ์ ๋ต๋ ๋ง๊ณ ๊ทผ๊ฑฐ๋ ์ ํํด์ผ ์ ๋ขฐํ ์ ์๋คโ๋ ์๋ก์ด ํ๊ฐ ๊ธฐ์ค
MinT: Managed Infrastructure for Training and Serving Millions of LLMs
๐๏ธ ์์: Mind Lab
๐ท๏ธ ํต์ฌ ํค์๋: LoRA Infrastructure, Multi-Policy Serving, Managed System
๐ญ ์ด๋ฐ ์ง๋ฌธ์ ํด๋ณธ ์ ์๋์?
LoRA๋ก ์๋ฐฑ ๊ฐ ๋ง์ถค ๋ชจ๋ธ์ ๋ง๋ค์๋๋ฐ ์ด๊ฑธ ์ด๋ป๊ฒ ๋ค ์๋นํ์ฃ ?
๋ฒ ์ด์ค ๋ชจ๋ธ ํ๋์ LoRA ์ด๋ํฐ ์๋ฐฑ๋ง ๊ฐ๋ฅผ ๋์์ ์ฌ๋ฆด ์ ์์๊น์?
๊ฐ ์ฌ์ฉ์๋ณ ๋ง์ถค AI๋ฅผ ๋๊ท๋ชจ๋ก ์ด์ํ๋ ์ธํ๋ผ๊ฐ ์๋์?
์ํํธ ํ ๋์ ์ธ์ ์๊ฐ ์๋ฐฑ๋ง ๋ช ์ธ๋ฐ, ๊ฐ์ ์ธํ ๋ฆฌ์ด๊ฐ ๋ค๋ฆ ๋๋ค. ๊ฑด๋ฌผ์ ์๋ฐฑ๋ง ์ฑ ์ง๋ ๊ฑด ๋ถ๊ฐ๋ฅํ์ฃ . MindLab์ MinT๋ ์ด ๋ฌธ์ ๋ฅผ AI ์๋น์์ ํ์ด๋ ๋๋ค. ๋น์ผ ๋ฒ ์ด์ค ๋ชจ๋ธ ๋ฐฐํฌ ์์ ์์ ์๋ฐฑ๋ง ๊ฐ์ LoRA ์ ์ฑ ์ ํ๋ จํ๊ณ ์๋นํ๋ ๊ด๋ฆฌํ ์ธํ๋ผ ์์คํ ์ ๋๋ค. ๊ฐ ์ ์ฑ ์ mergeํ์ง ์๊ณ , ์์์ ๋ฒ ์ด์ค ๋ชจ๋ธ ์์ ์ด๋ํฐ๋ง ๋์ ์ผ๋ก ๊ต์ฒดํ๋ฉฐ ์๋นํฉ๋๋ค.
ํนํ ์ฃผ๋ชฉํ ์ :
์์ ๋ฒ ์ด์ค ๋ชจ๋ธ ์ธ์คํด์ค ์์ ์๋ฐฑ๋ง LoRA ์ ์ฑ ๋์ ์๋น
๊ฐ ์ ์ฑ ์ mergeํ์ง ์์ ๋ฉ๋ชจ๋ฆฌ ํจ์จ์ฑ๊ณผ ์ ์ฐ์ฑ ํ๋ณด
๋๊ท๋ชจ LoRA ํฌ์คํธ ํธ๋ ์ด๋๊ณผ ์จ๋ผ์ธ ์๋น์ ํตํฉ ๊ด๋ฆฌ
๐ฏ ์ ์ด๊ฒ์ด ๊ฒ์ ์ฒด์ธ์ ์ธ๊ฐ? : ๋ง์ถค ๋ชจ๋ธ๋ง๋ค ๋ณ๋ GPU ์ธ์คํด์ค๊ฐ ํ์ํ๋ ์๋ โ ํ๋์ ๋ฒ ์ด์ค ๋ชจ๋ธ์์ ์๋ฐฑ๋ง ๊ฐ์ธํ ์ ์ฑ ์ ๋์์ ์๋น
Code as Agent Harness
๐๏ธ ์์: Independent
๐ท๏ธ ํต์ฌ ํค์๋: Code Agent, Operational Substrate, Agent Harness
๐ญ ์ด๋ฐ ์ง๋ฌธ์ ํด๋ณธ ์ ์๋์?
AI ์์ด์ ํธ๊ฐ ์ฝ๋๋ฅผ โ์์ฑโํ๋ ๊ฒ๊ณผ ์ฝ๋๋ก โ์๋โํ๋ ๊ฑด ์ด๋ป๊ฒ ๋ค๋ฅด์ฃ ?
์์ด์ ํธ์ ํ๊ฒฝยท๋๊ตฌยท์ํ ๊ด๋ฆฌ๋ฅผ ์ฝ๋ ์์ฒด๊ฐ ํ ์ ์์๊น์?
์์ด์ ํธ ์์คํ ์์ ์ฝ๋์ ์ญํ ์ด โ์ถ๋ ฅโ์์ โ์ธํ๋ผโ๋ก ๋ฐ๋๊ณ ์๋ค๊ณ ?
์ฝ๋๋ ๋ ์ด์ AI๊ฐ ๋ง๋ค์ด๋ด๋ โ๊ฒฐ๊ณผ๋ฌผโ์ด ์๋๋๋ค. 42๋ช ์ ๋๊ท๋ชจ ์ฐ๊ตฌ์ง์ด ์ ์ํ ์ด ๋ ผ๋ฌธ์ ํจ๋ฌ๋ค์ ์ ํ์ ์ ์ธํฉ๋๋ค โ ์ฝ๋๋ ์์ด์ ํธ์ ์ด์์ฒด์ (operational substrate)์ ๋๋ค. ์์ด์ ํธ๊ฐ ํ๊ฒฝ์ ์ธ์ํ๊ณ , ๋๊ตฌ๋ฅผ ์กฐํฉํ๊ณ , ์ํ๋ฅผ ๊ด๋ฆฌํ๋ ๋ชจ๋ ๊ณผ์ ์ด ์ฝ๋๋ผ๋ ๋งค๊ฐ๋ฅผ ํตํด ์ด๋ฃจ์ด์ง๋ค๋ ๊ฒ์ด์ฃ . ์ฝ๋ฉ ๋ฅ๋ ฅ์ ๋ ์ด์ โํ๋ก๊ทธ๋๋ฐ ๋ณด์กฐโ๊ฐ ์๋๋ผ ์์ด์ ํธ ์์ฒด์ ์ญ๋์ ๊ฒฐ์ ํ๋ ํต์ฌ ์ถ์ด ๋ฉ๋๋ค.
ํนํ ์ฃผ๋ชฉํ ์ :
โ์ฝ๋ = ์ถ๋ ฅโ์์ โ์ฝ๋ = ์์ด์ ํธ ์ด์ ๊ธฐ๋ฐโ์ผ๋ก์ ๊ฐ๋ ์ ํ ์ ์
๊ฒฝ์ ํ๋ก๊ทธ๋๋ฐ๋ถํฐ ์ ์ฅ์ ๋ ๋ฒจ ์์ง๋์ด๋ง, ์์ด์ ํธ ์์คํ ๊น์ง ํตํฉ ์กฐ๋ง
HuggingFace 157 upvote โ ์์ด์ ํธ ์ปค๋ฎค๋ํฐ์ ๊ฐํ ๊ณต๊ฐ
๐ฏ ์ ์ด๊ฒ์ด ๊ฒ์ ์ฒด์ธ์ ์ธ๊ฐ? : ์ฝ๋๋ฅผ ์ โ์์ฑโํ๋ AI๋ฅผ ๋ง๋ค๋ ์๋ โ ์ฝ๋๊ฐ ์์ด์ ํธ์ ์๋ ์๋ฆฌ ์์ฒด๊ฐ ๋๋ ์๋
Achieving Gold-Medal-Level Olympiad Reasoning via Simple and Unified Scaling
๐๏ธ ์์: SJTU (Shanghai Jiao Tong University)
๐ท๏ธ ํต์ฌ ํค์๋: Olympiad Reasoning, RL Scaling, Unified Approach
๐ญ ์ด๋ฐ ์ง๋ฌธ์ ํด๋ณธ ์ ์๋์?
์ํ ์ฌ๋ฆผํผ์๋ ๊ธ๋ฉ๋ฌ ์์ค์ ์ถ๋ก ์ ํน์ํ ๊ธฐ๋ฒ์ด ํ์ํ๊ฐ์?
๋ณต์กํ ํธ๋ฆญ ์์ด RL ์ค์ผ์ผ๋ง๋ง์ผ๋ก IMO ์์ค์ ๋๋ฌํ ์ ์์๊น์?
์ํ๊ณผ ๋ฌผ๋ฆฌ ์ฌ๋ฆผํผ์๋๋ฅผ ๊ฐ์ ๋ฐฉ๋ฒ๋ก ์ผ๋ก ํ ์ ์๋์?
๋ฐ๋์์ AlphaGo๊ฐ ์ธ๊ฐ ์ง๊ด์ ์ด๊ฒผ์ ๋, ํต์ฌ์ โ๋จ์ํ ๊ท์น์ ๋๊ท๋ชจ ์ ์ฉโ์ด์์ต๋๋ค. ์ฌ๋ฆผํผ๏ฟฝ๏ฟฝ๋ ์ถ๋ก ์์๋ ๊ฐ์ ์ผ์ด ๋ฒ์ด์ก์ต๋๋ค. SJTU์ 28๋ช ์ฐ๊ตฌ์ง์ ๋ณต์กํ ๋๋ฉ์ธ ํนํ ๊ธฐ๋ฒ์ด๋ ํน์ ํ์ดํ๋ผ์ธ ์์ด, ๋จ์ํ๊ณ ํตํฉ๋ RL ์ค์ผ์ผ๋ง๋ง์ผ๋ก IMO(๊ตญ์ ์ํ์ฌ๋ฆผํผ์๋)์ IPhO(๊ตญ์ ๋ฌผ๋ฆฌ์ฌ๋ฆผํผ์๋) ๊ธ๋ฉ๋ฌ ์์ค์ ๋๋ฌํ์ต๋๋ค. โ๋จ์ํจ์ด ๋ณต์กํจ์ ์ด๊ธด๋คโ๋ ์ค์ผ์ผ๋ง์ ํ์ ๋ค์ ํ๋ฒ ์ฆ๋ช ํ ์ ์ด์ฃ .
ํนํ ์ฃผ๋ชฉํ ์ :
ํน์ ๊ธฐ๋ฒ(๋๋ฉ์ธ ํนํ ๋ณด์, ์ปค๋ฆฌํ๋ผ ํ์ต ๋ฑ) ์์ด ๋จ์ RL ์ค์ผ์ผ๋ง์ผ๋ก ๊ธ๋ฉ๋ฌ ์์ค ๋ฌ์ฑ
IMO(์ํ)์ IPhO(๋ฌผ๋ฆฌ) ๋ ๋๋ฉ์ธ์ ๋์ผ ์ ๊ทผ๋ฒ ์ ์ฉ โ ํตํฉ ๋ฐฉ๋ฒ๋ก
โSimple and Unifiedโ๋ผ๋ ์ ๋ชฉ์ด ๊ณง ํต์ฌ ๋ฉ์์ง โ ๋ณต์กํจ์ ๋ถํ์ํ๋ค
๐ฏ ์ ์ด๊ฒ์ด ๊ฒ์ ์ฒด์ธ์ ์ธ๊ฐ? : ๋๋ฉ์ธ๋ณ ํน์ ํธ๋ฆญ์ ์์ ์ฌ๋ฆฌ๋ ์ฌ๋ฆผํผ์๋ AI โ ๋จ์ํ๊ณ ํตํฉ๋ RL ์ค์ผ์ผ๋ง์ด ๋ชจ๋ ๊ฑธ ํด๊ฒฐ
MemPrivacy: Privacy-Preserving Personalized Memory Management for Edge-Cloud Agents
๐๏ธ ์์: Independent
๐ท๏ธ ํต์ฌ ํค์๋: Privacy-Preserving Memory, Edge-Cloud Agent, Personalization
๐ญ ์ด๋ฐ ์ง๋ฌธ์ ํด๋ณธ ์ ์๋์?
AI ์์ด์ ํธ์๊ฒ ๋ด ๋ํ ๊ธฐ๋ก์ ๊ธฐ์ต์ํค๋ฉด ๊ฐ์ธ์ ๋ณด๋ ์์ ํ๊ฐ์?
ํด๋ผ์ฐ๋ ๊ธฐ๋ฐ ๋ฉ๋ชจ๋ฆฌ ๊ด๋ฆฌ์์ ํ๋ผ์ด๋ฒ์๋ฅผ ์ด๋ป๊ฒ ์งํค์ฃ ?
๊ฐ์ธํ ํ์ง์ ํฌ๊ธฐํ์ง ์์ผ๋ฉด์ ํ๋ผ์ด๋ฒ์๋ฅผ ๋ณดํธํ ์ ์์๊น์?
AI ๋น์์๊ฒ โ๋ด ์ทจํฅ์ ๊ธฐ์ตํด์คโ๋ผ๊ณ ๋งํ๋ ์๊ฐ, ๋น์ ์ ๋ฐ์ดํฐ๋ ํด๋ผ์ฐ๋๋ก ์ฌ๋ผ๊ฐ๋๋ค. ๊ทธ๋ฆฌ๊ณ ๊ทธ ์๊ฐ ํ๋ผ์ด๋ฒ์๋ ์ํ์ ๋ ธ์ถ๋์ฃ . ๊ธฐ์กด ํ๋ผ์ด๋ฒ์ ๋ณดํธ ๊ธฐ๋ฒ์ ๊ฐ์ธํ ํ์ง์ ์ฌ๊ฐํ๊ฒ ํฌ์์์ผฐ์ต๋๋ค. MemPrivacy๋ ์ด ๋๋ ๋ง๋ฅผ ์ ๋ฉด ๋ํํฉ๋๋ค. ์ฃ์ง-ํด๋ผ์ฐ๋ ํ๊ฒฝ์์ ๊ฐ์ธํ๋ ์ฅ๊ธฐ ๊ธฐ์ต์ ์ ์งํ๋ฉด์๋ ๋ฏผ๊ฐ ์ ๋ณด ๋ ธ์ถ์ ์์ฒ ์ฐจ๋จํ๋ ์๋ก์ด ๋ฉ๋ชจ๋ฆฌ ๊ด๋ฆฌ ํ๋ ์์ํฌ๋ฅผ ์ ์ํฉ๋๋ค.
ํนํ ์ฃผ๋ชฉํ ์ :
์ฃ์ง(๋ก์ปฌ)์ ํด๋ผ์ฐ๋ ๊ฐ ๋ฉ๋ชจ๋ฆฌ ๋ถ๋ฆฌ๋ก ๋ฏผ๊ฐ ์ ๋ณด ์ ์ถ ์ฐจ๋จ
๊ธฐ์กด ๋ฐฉ์ ๋๋น ๊ฐ์ธํ ํ์ง ํฌ์ ์์ด ํ๋ผ์ด๋ฒ์ ๋ณดํธ ๋ฌ์ฑ
LLM ์์ด์ ํธ์ ๋๊ท๋ชจ ๋ฐฐํฌ์์ ํต์ฌ ๋ณ๋ชฉ์ธ ํ๋ผ์ด๋ฒ์ ๋ฌธ์ ์ ๋ฉด ํด๊ฒฐ
๐ฏ ์ ์ด๊ฒ์ด ๊ฒ์ ์ฒด์ธ์ ์ธ๊ฐ? : โ๊ฐ์ธํํ๋ฉด ํ๋ผ์ด๋ฒ์ ํฌ๊ธฐ, ํ๋ผ์ด๋ฒ์ ์งํค๋ฉด ๊ฐ์ธํ ํฌ๊ธฐโ โ ๋ ๋ค ํฌ๊ธฐํ์ง ์๋ ์์ด์ ํธ ๋ฉ๋ชจ๋ฆฌ ์๋
๋งค์ฃผ ๋ชฉ์์ผ ์ค์ 8์,
๋ฐ์ ๋น์ ์ ๊ธฐ์ ๋ฐ์ ์ ๋ค์ณ์ง์ง ์๊ฒ ๋ง๋ค์ด์ค
์ต์ AI ํธ๋ ๋ ์์ฝ๋ณธ์ด ์ ๋ฌ๋ฉ๋๋ค! ๐