|
๊ธ์ฃผ ์บ์นํ์ดํผ๋ NVIDIA, ByteDance, Alibaba, Tencent, Sony AI, Ant Group, Meta, Microsoft, Kuaishou, LinkedIn๊ณผ ํจ๊ปํฉ๋๋ค. 3๋ถ๋ง ํฌ์ํด ์ฑ ๋๋ฌ๋ณด๊ณ , ๋น ๋ฅด๊ฒ ๋ฐ๋๋ ๊ธฐ์ ์ ๋ฐฉํฅ์ฑ์ ๋์น์ง ๋ง์ธ์!
|
|
|
WEEKLY BRIEF
|
|
๋น์ ์ฝ๋, GPU๋ฅผ ์ผ๋ง๋ ๋ญ๋นํ๊ณ ์์๊น?
|
|
๊ธ์ฃผ ์บ์นํ์ดํผ๋ NVIDIA, ByteDance, Alibaba, Tencent, Sony AI, Ant Group, Meta, Microsoft, Kuaishou, LinkedIn๊ณผ ํจ๊ปํฉ๋๋ค. 3๋ถ๋ง ํฌ์ํด ์ฑ ๋๋ฌ๋ณด๊ณ , ๋น ๋ฅด๊ฒ ๋ฐ๋๋ ๊ธฐ์ ์ ๋ฐฉํฅ์ฑ์ ๋์น์ง ๋ง์ธ์!
|
|
|
|
|
01
์ด๋ฏธ์งยท์์ ์์ฑ์ด '์์ด์ ํธํ'๋๊ณ , ์ธ์ด ๋ชจ๋ธ์ ์๊ธฐํ๊ท ๋๋จธ๋ก ๋์ด๊ฐ๋ ํ ์ฃผ
|
|
|
02
ํ ๋ชจ๋ธ์ด ์ฌ๋ฌ ๋ฅ๋ ฅ์ ํตํฉ(์์ฑ+ํธ์ง)ํ๊ณ , ๋น์๊ธฐํ๊ท ํ์ฐ LLM์ด ์๊ธฐํ๊ท์ ์์ฑ์ ์ํ
|
|
|
03
AI๊ฐ ๋ฐ์ดํฐยท์ฝ๋ยท์คํ๊น์ง ์ค์ค๋ก ๋ง๋ค๊ณ ๊ฐ์ ํ๋ '์๊ธฐ์งํ' ๋ฃจํ๋ก ๋ฌด๊ฒ์ค์ฌ ์ด๋
|
|
|
| |
|
|
|
|
|
EFFICIENCY
|
|
๊ทธ๋ฆฌ๊ธฐ๋ ํธ์ง๋ ๋ค ์ํ๋ AI๋ ์๋ค๋ฉฐ?
|
|
DanceOPD: On-Policy Generative Field Distillation
|
|
๐๏ธ ByteDance, National University of Singapore
๐ท๏ธ Flow-Matching, Generative Field Distillation, Multi-Capability
|
|
๐ญ ์ด๋ฐ ์ง๋ฌธ์ ํด๋ณธ ์ ์๋์?
โข ์ด๋ฏธ์ง ์์ฑ๊ณผ ํธ์ง์ ํ ๋ชจ๋ธ์ ๋ฃ์ผ๋ฉด ์ ์๋ก ์ฑ๋ฅ์ ๊น์๋จน์๊น์?
โข ๋ก์ปฌ ํธ์ง๊ณผ ๊ธ๋ก๋ฒ ํธ์ง์ด ์๋ก ๊ฐ์ญํ์ง ์๊ฒ ํ ์ ์์๊น์?
โข classifier-free guidance ๊ฐ์ ํธ๋ฆญ๋ ํ์ต์ ๋
น์ฌ๋ผ ์ ์์๊น์?
|
|
|
|
|
ํนํ ์ฃผ๋ชฉํ ์ :
โ T2Iยท๋ก์ปฌ ํธ์งยท๊ธ๋ก๋ฒ ํธ์ง์ ๋จ์ผ flow-matching ๋ชจ๋ธ์ ํตํฉํ๋ฉฐ ๋ฅ๋ ฅ ๊ฐ ์ถฉ๋ ํด์
โ ํ์์ด ์๊ธฐ ๋กค์์ ์ํ์์ ๊ฐ '๋ฅ๋ ฅ ํ๋'๋ฅผ ์ง์ํ๋ on-policy ์ฆ๋ฅ(velocity MSE)
โ classifier-free guidance ๊ฐ์ ์ฐ์ฐ์ ์ ์ ํ๋๊น์ง ํ๋๋ก ํก์
|
|
๐ฏ GAME CHANGER
๋ฅ๋ ฅ๋ณ๋ก ๋ฐ๋ก ํ์ตํ๋ค ์๋ก ๋ง์น๋ ๋ฐฉ์ โ ๋จ์ผ flow ๋ชจ๋ธ์ด ์ฌ๋ฌ ๋ฅ๋ ฅ์ ์์ ์ ์ผ๋ก ์กฐํฉํ๋ ๋ฐฉ์
|
|
|
๋
ผ๋ฌธ ๋ณด๊ธฐ →
|
|
|
|
|
AGENTS
|
|
๋ง์ฐํ๊ฒ ์์ผฐ๋๋ ์์์ ๊ฒ์ํ๋ค
|
|
Qwen-Image-Agent: Bridging the Context Gap in Real-World Image Generation
|
|
๐๏ธ Alibaba
๐ท๏ธ Agentic Generation, Context Gap, Retrieval-Augmented
|
|
๐ญ ์ด๋ฐ ์ง๋ฌธ์ ํด๋ณธ ์ ์๋์?
โข "๊ทธ๊ฑฐ ๊ทธ๋ ค์ค" ๊ฐ์ ๋ง์ฐํ ์์ฒญ์ T2I ๋ชจ๋ธ์ด ์ ํค๋งฌ๊น์?
โข ์ต์ ์ง์์ด ํ์ํ ์ด๋ฏธ์ง๋ฅผ ๋ชจ๋ธ์ด ์ด๋ป๊ฒ ์๊ณ ๊ทธ๋ฆด๊น์?
โข ์ด๋ฏธ์ง ์์ฑ์๋ ๊ณํยท๊ฒ์ยท๊ธฐ์ต์ด ํ์ํ ๊น์?
|
|
|
|
|
ํนํ ์ฃผ๋ชฉํ ์ :
โ ๋ถ์กฑยท์๋ฌตยท์ต์ ์ง์ ์์กด ์์ฒญ์ '๋งฅ๋ฝ ๊ฒฉ์ฐจ(Context Gap)'๋ก ์ ์ํ๊ณ ์์ด์ ํธ๊ฐ ๋ณด๊ฐ
โ ๊ณํยท์ถ๋ก ยท๊ฒ์ยท๊ธฐ์ตยทํผ๋๋ฐฑ์ ํตํฉํ ๋งฅ๋ฝ ์ค์ฌ ์์ด์ ํธ ํ๋ ์์ํฌ
โ PlanยทReasonยทSearchยทMemory ๋ฅ๋ ฅ์ ์ธก์ ํ๋ IA-Bench ์ ์ค, ์ธ ๋ฒค์น๋งํฌ SOTA
|
|
๐ฏ GAME CHANGER
ํ๋กฌํํธ๋ฅผ ์์ฑ๋ ๋ช
์ธ๋ก ๊ฐ์ ํ๋ ์์ฑ โ ๋ถ๋ถ ๋งฅ๋ฝ์์ ์ถ๋ฐํด ๋๋จธ์ง๋ฅผ ์์ด์ ํธ๊ฐ ์ฑ์ฐ๋ ์์ฑ
|
|
|
๋
ผ๋ฌธ ๋ณด๊ธฐ →
|
|
|
|
|
VISION
|
|
์ด๋ฏธ์ง๋ฅผ ๊ธ์์ฒ๋ผ ์ชผ๊ฐ๋ 70%๊ฐ ๋นจ๋ผ์ง๋ค
|
|
ViQ: Text-Aligned Visual Quantized Representations at Any Resolution
|
|
๐๏ธ Tencent, Tsinghua University
๐ท๏ธ Visual Tokenizer, Quantization, Multimodal Efficiency
|
|
๐ญ ์ด๋ฐ ์ง๋ฌธ์ ํด๋ณธ ์ ์๋์?
โข ์ด๋ฏธ์ง๋ฅผ ํ
์คํธ์ฒ๋ผ ์ด์ฐ ํ ํฐ์ผ๋ก ๋ฐ๊พธ๋ฉด ์ ์ ๋ณด๊ฐ ํฌ๊ฒ ์์ค๋ ๊น์?
โข ์๋ฏธ(semantics)์ ๋ํ
์ผ์ ๋์์ ์ด๋ฆฐ ์ด์ฐ ํํ์ด ๊ฐ๋ฅํ ๊น์?
โข ํด์๋๊ฐ ์ ๊ฐ๊ฐ์ธ ์ด๋ฏธ์ง๋ฅผ ํ๋์ ํ ํฌ๋์ด์ ๋ก ์ฒ๋ฆฌํ ์ ์์๊น์?
|
|
|
|
|
ํนํ ์ฃผ๋ชฉํ ์ :
โ ํ
์คํธ ์ ๋ ฌ ์ฌ์ ํ์ต + proximal ์ด์ฐํ 2๋จ๊ณ๋ก ์๋ฏธยท๋ํ
์ผ ๊ท ํ
โ position-aware head-wise quantization์ผ๋ก ์์ ํด์๋ ์
๋ ฅ ์ง์
โ ๋ฉํฐ๋ชจ๋ฌ ํ์ต์์ base LLMยท๋ ์ํผ์ ๋ฐ๋ผ 20~70% ๊ฐ์
|
|
๐ฏ GAME CHANGER
์ฐ์ยท๊ณ ์ฐจ์ ๋น์ฃผ์ผ ํผ์ฒ์ ์์กดํ๋ ๋ฉํฐ๋ชจ๋ฌ โ ํ
์คํธ์ ํตํฉ ๊ฐ๋ฅํ ํจ์จ์ ์ด์ฐ ํํ
|
|
|
๋
ผ๋ฌธ ๋ณด๊ธฐ →
|
|
|
|
|
VISION
|
|
์์ AI๊ฐ ์ฌ์ค 3D๋ฅผ ์๊ณ ์์๋ค๊ณ ?
|
|
MVTrack4Gen: Multi-View Point Tracking as Geometric Supervision for 4D Video Generation
|
|
๐๏ธ Sony AI, KAIST
๐ท๏ธ 4D Video Generation, Point Tracking, Novel-View Synthesis
|
|
๐ญ ์ด๋ฐ ์ง๋ฌธ์ ํด๋ณธ ์ ์๋์?
โข ๋จ์ ์์์์ ์๋ก์ด ์นด๋ฉ๋ผ ์์ ์ ์์์ ๋ง๋ค ๋ ์ ์์ง์์ด ์ด๊ธ๋ ๊น์?
โข ์ธ๋ถ 3D ์ฌ๊ตฌ์ฑ ๋ชจ๋ ์์ด๋ ๊ธฐํ ์ผ๊ด์ฑ์ ์งํฌ ์ ์์๊น์?
โข ๋ํจ์ ๋ชจ๋ธ์ ์ดํ
์
์ด ์ฌ์ค ๋์์ ์ ๋ณด๋ฅผ ํ๊ณ ์๋ค๋ฉด?
|
|
|
|
|
ํนํ ์ฃผ๋ชฉํ ์ :
โ ๋จ์ ์ฐธ์กฐ ์์ โ ๋ชฉํ ์นด๋ฉ๋ผ ๊ถค์ ์ ์ ์์ ๋น๋์ค๋ฅผ ๊ธฐํยท๋ชจ์
์ผ๊ด์ฑ ์๊ฒ ์์ฑ
โ ํน์ ์ดํ
์
๋ ์ด์ด๊ฐ ๋์์ ๋จ์๋ฅผ ์ธ์ฝ๋ฉํ๋ค๋ ํต์ฌ ๊ด์ฐฐ
โ ๋ฉํฐ๋ทฐ ํฌ์ธํธ ํธ๋ํน์ ๋ณด์กฐ ๊ฐ๋
์ผ๋ก ๊ฒฐํฉํด SOTA ๊ธฐํ ์ผ๊ด์ฑ ๋ฌ์ฑ
|
|
๐ฏ GAME CHANGER
๋ถ์ ํํ ์ธ๋ถ 3D ์ฌ๊ตฌ์ฑ์ ์์กดํ๋ ์ ์์ ์์ฑ โ ๋ชจ๋ธ ๋ด๋ถ ํธ๋ํน ์ ํธ๋ฅผ ๊ฐ๋
์ผ๋ก ์ฐ๋ ์์ฑ
|
|
|
๋
ผ๋ฌธ ๋ณด๊ธฐ →
|
|
|
|
|
NLP
|
|
๋ค์ ๋จ์ด ์์ธก, ์ ํ๋๋ฐ ๋ ์ํ๋ค
|
|
Improved Large Language Diffusion Models
|
|
๐๏ธ Ant Group, Renmin University of China
๐ท๏ธ Diffusion LLM, Bidirectional Attention, Non-Autoregressive
|
|
๐ญ ์ด๋ฐ ์ง๋ฌธ์ ํด๋ณธ ์ ์๋์?
โข LLM์ ๊ผญ '๋ค์ ๋จ์ด ์์ธก + ์ธ๊ณผ ์ดํ
์
'์ด์ด์ผ๋ง ํ ๊น์?
โข ์๋ฐฉํฅ ์ดํ
์
์ผ๋ก ์ฒ์๋ถํฐ ํ์ตํ ๋ชจ๋ธ์ด ์ถ๋ก ์ ์ํ ์ ์์๊น์?
โข ๋น์๊ธฐํ๊ท ๋ชจ๋ธ์ด ์๊ธฐํ๊ท ๊ฐ์์ ๊ฒฌ์ค ์ ์์๊น์?
|
|
|
|
|
ํนํ ์ฃผ๋ชฉํ ์ :
โ iLLaDA-Base: ์ด์ LLaDA ๋๋น BBH +21.6์ , ARC-Challenge +14.9์
โ iLLaDA-Instruct: MATH +14.5์ , HumanEval +16.5์
โ ๋น์๊ธฐํ๊ท ํ์ต์๋ ์๊ธฐํ๊ท Qwen2.5 7B์ ์ฌ๋ฌ ๋ฒค์น๋งํฌ์์ ๊ฒฝ์
|
|
๐ฏ GAME CHANGER
์๊ธฐํ๊ท+์ธ๊ณผ ์ดํ
์
๋ง์ด ์ ๋ต์ด๋ผ ์ฌ๊ธฐ๋ ํต๋
โ ์ฒ์๋ถํฐ ์๋ฐฉํฅ ํ์ฐ์ผ๋ก๋ ๊ฐ๋ ฅํ LLM์ ๋๋ฌ
|
|
|
๋
ผ๋ฌธ ๋ณด๊ธฐ →
|
|
|
|
|
AGENTS
|
|
์ด์ ๋ฐ์ดํฐ๋ AI๊ฐ ๋ง๋ ๋ค๋
|
|
Autodata: An agentic data scientist to create high quality synthetic data
|
|
๐๏ธ Meta
๐ท๏ธ Synthetic Data, Agentic Pipeline, Meta-Optimization
|
|
๐ญ ์ด๋ฐ ์ง๋ฌธ์ ํด๋ณธ ์ ์๋์?
โข ํฉ์ฑ ๋ฐ์ดํฐ๋ฅผ ์ฌ๋์ด ์ผ์ผ์ด ์ค๊ณํด์ผ๋ง ํ ๊น์?
โข ๋ฐ์ดํฐ๋ฅผ ๋ง๋๋ ์์ด์ ํธ ์์ฒด๋ฅผ ๋ ๋๋ํ๊ฒ ํค์ธ ์ ์์๊น์?
โข ๋์ด๋ ์ถ๋ก ์ฐ์ฐ์ '๋ ๋์ ํ์ต ๋ฐ์ดํฐ'๋ก ๋ฐ๊ฟ ์ ์์๊น์?
|
|
|
|
|
ํนํ ์ฃผ๋ชฉํ ์ :
โ AI ์์ด์ ํธ๊ฐ ํ์ตยทํ๊ฐ ๋ฐ์ดํฐ๋ฅผ ์ง์ ์ค๊ณํ๋ Agentic Self-Instruct ๊ตฌํ
โ ๋ฐ์ดํฐ ์์ฑ ์์ด์ ํธ ์์ฒด๋ฅผ ๋ฉํ ์ต์ ํํ๋ ์ฑ๋ฅ ํฅ์ํญ์ด ๋ ์ปค์ง
โ CS ์ฐ๊ตฌยท๋ฒ๋ฅ ์ถ๋ก ยท์ํ์ ์ถ๋ก ๊ณผ์ ์์ ๊ณ ์ ์ ํฉ์ฑ ๋ฐ์ดํฐ ๊ธฐ๋ฒ ๋๋น ๊ฐ์
|
|
๐ฏ GAME CHANGER
์ฌ๋์ด ํฉ์ฑ ๋ฐ์ดํฐ๋ฅผ ์ค๊ณํ๋ ๋ฐฉ์ โ ์์ด์ ํธ๊ฐ ๋ฐ์ดํฐ๋ฅผ ๋ง๋ค๊ณ ์ค์ค๋ก๋ฅผ ๊ฐ์ ํ๋ ๋ฐฉ์
|
|
|
๋
ผ๋ฌธ ๋ณด๊ธฐ →
|
|
|
|
|
NLP
|
|
๋ด ์ฝ๋, ํ๊ณ ์๋์ ๋ช %๋ ์ฐ๊ณ ์์๊น?
|
|
SOLAR: AI-Powered Speed-of-Light Performance Analysis
|
|
๐๏ธ NVIDIA, Stanford University
๐ท๏ธ Speed-of-Light Analysis, Performance Bounds, LLM Compiler
|
|
๐ญ ์ด๋ฐ ์ง๋ฌธ์ ํด๋ณธ ์ ์๋์?
โข ๋ด ๋ฅ๋ฌ๋ ๋ชจ๋ธ์ด ์ด ํ๋์จ์ด์์ ์ด๋ก ์ ์ผ๋ง๋ ๋นจ๋ผ์ง ์ ์์๊น์?
โข ์ง๊ธ ๊ตฌํ์ด ๊ทธ ํ๊ณ์์ ์ผ๋ง๋ ๋จ์ด์ ธ ์๋์ง ์ด๋ป๊ฒ ์๊น์?
โข ์์ผ๋ก ํ๋ Speed-of-Light ๋ถ์์ ์ฝ๋์์ ์๋ํํ ์ ์์๊น์?
|
|
|
|
|
ํนํ ์ฃผ๋ชฉํ ์ :
โ LLM ํ๋ฐํธ์๋๊ฐ ์์ค๋ฅผ Affine Loop IR๋ก ๋ฒ์ญํ๊ณ ์ถ๋ ฅ ๋น๊ต๋ก ๊ฒ์ฆ
โ ๊ฒฐ์ ๋ก ์ ํ๋ฆ์ด IR์ einsum ๊ทธ๋ํ๋ก ์ฌ๋ ค unfusedยทfusedยทcache-aware ํ๊ณ ์ฐ์ถ
โ KernelBenchยทJAX/Flaxยท๋ก๋ณดํฑ์ค ์ํฌ๋ก๋์์ SOL ์๋ฐ 0๊ฑด
|
|
๐ฏ GAME CHANGER
์์์
ยท์ค๋ฅํฌ์ฑ์ด๋ก ๋จ์ ๋ผ ์๋ SOL ๋ถ์ โ ์ฝ๋์์ ๊ฒ์ฆ๋ ์ฑ๋ฅ ํ๊ณ์น๋ฅผ ์๋ ์ฐ์ถํ๋ ํ๋ฆ
|
|
|
๋
ผ๋ฌธ ๋ณด๊ธฐ →
|
|
|
|
|
NLP
|
|
๊ธฐ์ต ์ํ๋ ๋น๊ฒฐ? ๋จผ์ ์ ์ง์ฐ๋ ๊ฑฐ์๋ค
|
|
Erase-then-Delta Attention: Decoupling Erase and Write Addresses in Delta-Rule Linear Attention
|
|
๐๏ธ Microsoft
๐ท๏ธ Linear Attention, Memory Management, Long-Context
|
|
๐ญ ์ด๋ฐ ์ง๋ฌธ์ ํด๋ณธ ์ ์๋์?
โข ์ ํ ์ดํ
์
์ด ์ ๋ด์ฉ์ ์ฐ๋ ์๋ฆฌ์์๋ง ๊ธฐ์ต์ ๊ณ ์น ์ ์๋ค๋ฉด?
โข ์ ํ ๋ค๋ฅธ ์์น์ ์์ธ '์ค๋๋ ๊ธฐ์ต'์ ์ด๋ป๊ฒ ์ง์ธ๊น์?
โข ์ฅ๋ฌธ ๋งฅ๋ฝ์ผ์๋ก ๋ฉ๋ชจ๋ฆฌ ๊ด๋ฆฌ๊ฐ ์ฑ๋ฅ์ ๊ฐ๋ฅผ๊น์?
|
|
|
|
|
ํนํ ์ฃผ๋ชฉํ ์ :
โ ์ฐ๊ธฐ ์ฃผ์์ ๋
๋ฆฝ๋ ์์น์ ๋ก์ ๊ธฐ์ต์ ๋จผ์ ์ง์ฐ๋ erase ๋จ๊ณ ์ถ๊ฐ
โ dense 2.5BยทMoE 25B-A2.8B ๋ชจ๋ธ๊ตฐ ๋ชจ๋์์ ์ต๊ณ ์ฑ๋ฅ
โ 80B ํ ํฐ ์ฅ๋ฌธ ์ค๊ฐํ์ต ํ 4k~128k ์ฅ๋ฌธ ํ๊ฐ์์ ์ผ๊ด๋ ์ฐ์
|
|
๐ฏ GAME CHANGER
์ฐ๋ ๊ณณ๋ง ๊ต์ ํ๋ delta-rule ๋ฉ๋ชจ๋ฆฌ โ ์ง์ธ ๊ณณ์ ๋
๋ฆฝ์ ์ผ๋ก ๊ณ ๋ฅด๋ ๋ฅ๋์ ๋ฉ๋ชจ๋ฆฌ ๊ด๋ฆฌ
|
|
|
๋
ผ๋ฌธ ๋ณด๊ธฐ →
|
|
|
|
|
AGENTS
|
|
์ถ์ฒ ์๊ณ ๋ฆฌ์ฆ, ์์ง๋ ์ฌ๋์ด ์ง์ธ์?
|
|
AgentX: Towards Agent-Driven Self-Iteration of Industrial Recommender Systems
|
|
๐๏ธ Kuaishou
๐ท๏ธ Multi-Agent System, Self-Evolving, Recommender
|
|
๐ญ ์ด๋ฐ ์ง๋ฌธ์ ํด๋ณธ ์ ์๋์?
โข ์ถ์ฒ ์๊ณ ๋ฆฌ์ฆ ๊ฐ์ ์ด ์ ์์ง๋์ด ๋จธ๋ฆฟ์์ ๋น๋กํด์๋ง ๋นจ๋ผ์ง๊น์?
โข ๊ฐ์คโ์ฝ๋โA/Bโ๋ถ์์ ์ฌ์ดํด์ ํต์งธ๋ก ์๋ํํ ์ ์์๊น์?
โข ์คํจํ ์คํ๋ ๋ฒ๋ฆฌ์ง ์๊ณ ์ง์ ์์ฐ์ผ๋ก ์์ ์ ์์๊น์?
|
|
|
|
|
ํนํ ์ฃผ๋ชฉํ ์ :
โ BrainstormยทDevelopingยทEvaluation ์์ด์ ํธ๊ฐ ๊ฐ์คโํ๋ก๋์
์ฝ๋โ์์ ํ A/B๋ฅผ ๋ซํ ๋ฃจํ๋ก ์ํ
โ ๊ฐ๋๋ ์ผ์ด ๊ฑฐ๋ถ๊ถ์ ๊ฐ์ง ์จ๋ผ์ธ ๋กค์์์ผ๋ก ์ฑ๊ณตยท์คํจ๋ฅผ ๋ชจ๋ ๊ตฌ์กฐํ ์ง์์ผ๋ก ์ ํ
โ Harness Evolution ์ธต(SGPO)์ด ์คํ ๊ถค์ ์ ์๋ฏธ์ ๊ทธ๋๋์ธํธ๋ก ์ฆ๋ฅํด ์์ด์ ํธ ์์ฒด๋ฅผ ๊ฐ์
|
|
๐ฏ GAME CHANGER
ํ์ ์ด ํค๋์นด์ดํธ์ ์ ํ ๋น๋กํ๋ ๊ตฌ์กฐ โ ์ฆ๊ฑฐยท์ฐ์ฐยท์ถ์ ์ง์์ผ๋ก ๋ณต๋ฆฌ ์ฑ์ฅํ๋ ์๊ธฐ์งํ ์ฐ๊ตฌ ๋ฃจํ
|
|
|
๋
ผ๋ฌธ ๋ณด๊ธฐ →
|
|
|
|
|
RL
|
|
๋ค๋ค ์ฐ๋ GRPO๊ฐ ๋ณด์ ํดํน์ ์ ์ผ ์ฝํ๋๋ผ
|
|
Designing Reward Signals for Portable Query Generation: A Case Study in Industrial Semantic Job Search
|
|
๐๏ธ LinkedIn
๐ท๏ธ RLAIF, Reward Hacking, GRPO
|
|
๐ญ ์ด๋ฐ ์ง๋ฌธ์ ํด๋ณธ ์ ์๋์?
โข RL ํ์ต์์ ์ตํฐ๋ง์ด์ ์ ํ๊ณผ ๋ณด์ ์ค๊ณ ์ค ๋ฌด์์ด ๋ ์ค์ํ ๊น์?
โข GRPO๊ฐ reward hacking์ ์ ๋
์ฝํ ์ด์ ๊ฐ ์์๊น์?
โข ํ์ต์ฉ reward model์ด ์ฑ๋ฅ์ ๊ณผ์ฅํ๊ณ ์๋ ๊ฑด ์๋๊น์?
|
|
|
|
|
ํนํ ์ฃผ๋ชฉํ ์ :
โ ๊ท์น ๊ธฐ๋ฐ reward floor๋ก verbatim copying์ ๊ต์ ํด cross-family ํ๊ฐ์ +0.147 ํ์ง ํฅ์
โ RLOOยทREINFORCE++๋ ๋ณด์ ํดํน์ ๊ฐํ์ง๋ง, GRPO์ group-relative ์ ๊ทํ๋ ์ ๋
์ทจ์ฝ
โ ํ์ต์ฉ reward model์ด ์ฑ๋ฅ ํฅ์์ 2.4๋ฐฐ ๊ณผ์ฅํจ์ ํ์ธ
|
|
๐ฏ GAME CHANGER
์ตํฐ๋ง์ด์ ์ ํ์ด ํต์ฌ์ด๋ผ ๋ฏฟ๋ RL ํ๋ โ ๋ณด์ ์ค๊ณ ๊ท์จ์ด ์ฑํจ๋ฅผ ์ข์ฐํ๋ค๋ ์ค์ฆ
|
|
|
๋
ผ๋ฌธ ๋ณด๊ธฐ →
|
|
|
|
|