26.05. 1แแ ฎแแ ก | Meta, Google, Alibaba, Microsoft, Tencent
๊ธ์ฃผ ์บ์นํ์ดํผ๋ Meta, Google, Alibaba, Microsoft, Tencent์ ํจ๊ปํฉ๋๋ค. 3๋ถ๋ง ํฌ์ํด ์ฑ ๋๋ฌ๋ณด๊ณ , ๋น ๋ฅด๊ฒ ๋ฐ๋๋ ๊ธฐ์ ์ ๋ฐฉํฅ์ฑ์ ๋์น์ง ๋ง์ธ์!
๐ โ์ฒ์๋ถํฐ ๋ง๋ค์ด๋ดโ โ AI ์ฝ๋ฉ ์์ด์ ํธ์ ์ง์ง ์ค๋ ฅ์ ์ํํ๋ ๋ฒค์น๋งํฌ ๊ฒฝ์์ด ์์๋๋ค
๐ฅ ๋น๋์ค ์์ฑ ๋ชจ๋ธ์ด ๋ฌผ๋ฆฌ๋ฒ์น ๋๋จธ โ์์ ์ ๊ท์นโ๊น์ง ํ์ตํ๋ ๋จ๊ณ๋ก ์งํ ์ค
๐ LLM์ ํ ๋ฃจ์๋ค์ด์ ์ ์ด๊ฐ โํ์๊ณผ ํ์ ์ ๋ถ๋ฆฌโํ๋ ์๋ก์ด ํจ๋ฌ๋ค์์ผ๋ก ์ ํ๋๊ณ ์๋ค
ProgramBench: Can Language Models Rebuild Programs From Scratch?
๐๏ธ ์์: Meta, Princeton University
๐ท๏ธ ํต์ฌ ํค์๋: Software Engineering Benchmark, Code Generation, Program Synthesis
๐ญ ์ด๋ฐ ์ง๋ฌธ์ ํด๋ณธ ์ ์๋์?
AI ์ฝ๋ฉ ์์ด์ ํธ๊ฐ ๋ฒ๊ทธ ํ๋ ๊ณ ์น๋ ๊ฒ ๋ง๊ณ , ์ง์ง ์ํํธ์จ์ด๋ฅผ ์ค๊ณํ ์ ์์๊น?
FFmpeg์ด๋ SQLite ๊ฐ์ ํ๋ก๊ทธ๋จ์ ๋ฌธ์๋ง ๋ณด๊ณ ๋ค์ ๋ง๋ค๋ผ๋ฉด?
์ AI๊ฐ ๋ง๋ ์ฝ๋๋ ํญ์ ๋จ์ผ ํ์ผ ์คํ๊ฒํฐ๊ฐ ๋ ๊น?
๋ ์ํผ๋ฅผ ๋ฐ๋ผ ์๋ฆฌํ๋ ๊ฒ๊ณผ, ๋ ์ํผ ์์ด ๋ง๋ง ๋ณด๊ณ ์ ์ฒด ์ฝ์ค ์๋ฆฌ๋ฅผ ์ฌํํ๋ ๊ฒ์ ์ฐจ์์ด ๋ค๋ฅธ ๋ฅ๋ ฅ์ด๋ค. ProgramBench๋ AI์๊ฒ ํ์๋ฅผ ์๊ตฌํ๋ค. ํ๋ก๊ทธ๋จ์ ์คํ ๊ฒฐ๊ณผ์ ๋ฌธ์๋ง ์ฃผ๊ณ , โ์ด๊ฑธ ์ฒ์๋ถํฐ ์ค๊ณํ๊ณ ๊ตฌํํด๋ดโ๋ผ๊ณ ์ํจ๋ค. FFmpeg, SQLite, PHP ์ธํฐํ๋ฆฌํฐ๊น์ง ํฌํจ๋ 200๊ฐ ํ์คํฌ์์, ์ต๊ณ ๋ชจ๋ธ์กฐ์ฐจ 95% ํ ์คํธ ํต๊ณผ์จ์ ๋ฌ์ฑํ ํ์คํฌ๋ ๋จ 3%๋ฟ์ด์๋ค.
ํนํ ์ฃผ๋ชฉํ ์ :
9๊ฐ ์ต์ LM ๋ชจ๋ ๋จ ํ๋์ ํ์คํฌ๋ ์์ ํ ํด๊ฒฐํ์ง ๋ชปํจ
๋ชจ๋ธ๋ค์ด ์ผ๊ด๋๊ฒ ๋จ์ผ ํ์ผ ๋ชจ๋๋ฆฌ์ ๊ตฌํ์ ์ ํธ โ ์ธ๊ฐ ์ฝ๋์ ๊ทน๋ช ํ ์ฐจ์ด
Agent-driven fuzzing์ผ๋ก ๊ตฌํ ๊ตฌ์กฐ๋ฅผ ๊ฐ์ ํ์ง ์๋ ํ๋ ๊ธฐ๋ฐ ํ ์คํธ ์์ฑ
๐ฏ ์ ์ด๊ฒ์ด ๊ฒ์ ์ฒด์ธ์ ์ธ๊ฐ? : โ๋ฒ๊ทธ ํ๋ ๊ณ ์น๊ธฐโ ๋ฒค์น๋งํฌ โ โ์ํํธ์จ์ด๋ฅผ ์ฒ์๋ถํฐ ์ค๊ณํ๋ผโ๋ ์ ์ธ์ ํ๊ฐ๋ก ์ ํ
SymptomAI: Towards a Conversational AI Agent for Everyday Symptom Assessment
๐๏ธ ์์: Google (Fitbit)
๐ท๏ธ ํต์ฌ ํค์๋: Medical AI, Conversational Diagnosis, Wearable Integration
๐ญ ์ด๋ฐ ์ง๋ฌธ์ ํด๋ณธ ์ ์๋์?
๋ํต์ด ์์ ๋ AI์๊ฒ ๋ฌผ์ด๋ณด๋ฉด ์ง์ง ์ธ ๋งํ ์ง๋จ์ ๋ฐ์ ์ ์์๊น?
๋ณ์์ ๊ฐ ์ ๋์ธ์ง ์๋์ง, AI๊ฐ ํ๋จํ ์ ์์๊น?
Fitbit ๊ฐ์ ์จ์ด๋ฌ๋ธ ๋ฐ์ดํฐ๊ฐ ์ง๋จ ์ ํ๋๋ฅผ ๋์ผ ์ ์์๊น?
13,917๋ช ์ด Fitbit ์ฑ์ ํตํด ์ค์ ๋ก AI ์์ฌ์ ๋ํํ๋ค. ์ฆ์์ ์ค๋ช ํ๊ณ , AI๊ฐ ์ถ๊ฐ ์ง๋ฌธ์ ํ๊ณ , ์ง๋จ์ ๋ด๋ ธ๋ค. ๊ฒฐ๊ณผ? ๊ฐ์ ๋ํ๋ก์ ๋ณธ ์ค์ ์์์๋ณด๋ค AI์ ๊ฐ๋ณ์ง๋จ ์ ํ๋๊ฐ OR 2.47๋ก ์ ์๋ฏธํ๊ฒ ๋์๋ค. ํต์ฌ์ AI๊ฐ โ๋ฅ๋์ ์ผ๋ก ์ฆ์์ ์บ๋ฌป๋โ ์ ๋ต์ด ์ฌ์ฉ์๊ฐ ์์ ๋กญ๊ฒ ๋งํ๋ ๋ฐฉ์๋ณด๋ค ์๋์ ์ผ๋ก ๋์๋ค๋ ๊ฒ.
ํนํ ์ฃผ๋ชฉํ ์ :
1,228๋ช ์ด ์ค์ ์์์ ์ง๋จ์ ๋ฐ์ ๊ฒ์ฆ โ ๊ฐ์ ์๋๋ฆฌ์ค๊ฐ ์๋ ์ค์ ํ์ ๋ฐ์ดํฐ
๋ฅ๋ ์ธํฐ๋ทฐ ์ ๋ต์ด ์์ ๋ํ ๋๋น ์ ์๋ฏธํ๊ฒ ์ฐ์ (p < 0.001)
50๋ง ์ผ ๋ถ๋์ ์จ์ด๋ฌ๋ธ ๋ฐ์ดํฐ์์ ์ธํ๋ฃจ์์ ๊ฐ์ผ๊ณผ ์๋ฆฌ์ ๋ณํ์ OR > 7 ํ์ธ
๐ฏ ์ ์ด๊ฒ์ด ๊ฒ์ ์ฒด์ธ์ ์ธ๊ฐ? : ์ํ ๋ฒค์น๋งํฌ ์ ์ ๊ฒฝ์ โ 1.4๋ง ๋ช ์ค์ ๋ฐฐํฌ์์ ์์์๋ฅผ ๋์ด์ ์ต์ด ๋๊ท๋ชจ ์ค์ฆ
CC-OCR V2: Benchmarking Large Multimodal Models for Literacy in Real-world Document Processing
๐๏ธ ์์: Alibaba (Ant Group)
๐ท๏ธ ํต์ฌ ํค์๋: OCR Benchmark, Document Processing, Multimodal Models
๐ญ ์ด๋ฐ ์ง๋ฌธ์ ํด๋ณธ ์ ์๋์?
GPT-4V๊ฐ OCR๋ ์ํ๋ค๋๋ฐ, ์ง์ง ๊ธฐ์ ๋ฌธ์์์๋ ์ ๋ ๊น?
์์์ฆ์ด ๊ตฌ๊ฒจ์ง๊ฑฐ๋ ํ๋ฆฟํ ์ฌ์ง์ด๋ฉด ์ด๋ป๊ฒ ๋ ๊น?
ํ ์คํธ ์ธ์, ๋ฌธ์ ํ์ฑ, ์ ๋ณด ์ถ์ถ์ ํ๊บผ๋ฒ์ ํ ์คํธํ๋ฉด?
๊น๋ํ ์ค์บ ๋ฌธ์์์๋ ์ ์๋ํ๋ ๋ฉํฐ๋ชจ๋ฌ ๋ชจ๋ธ์ด, ํ์ค์ ๊ตฌ๊ฒจ์ง ์์์ฆ๊ณผ ํ๋ฆฟํ ๊ณ์ฝ์ ์์์๋ ๊ธ๊ฒฉํ ๋ฌด๋์ง๋ค. CC-OCR V2๋ 5๊ฐ OCR ํธ๋(ํ ์คํธ ์ธ์, ๋ฌธ์ ํ์ฑ, ๋ฌธ์ ๊ทธ๋ผ์ด๋ฉ, ํต์ฌ ์ ๋ณด ์ถ์ถ, ๋ฌธ์ QA)์ ๊ฑธ์ณ 7,093๊ฐ ๊ณ ๋๋ ์ํ๋ก 14๊ฐ ์ต์ LMM์ ํ๊ฐํ๋ค. SOTA ๋ชจ๋ธ์กฐ์ฐจ ํ์ค ์ ์ฉ์๋ ํ์ฐธ ๋ถ์กฑํ๋ค๋ ๊ฒฐ๋ก .
ํนํ ์ฃผ๋ชฉํ ์ :
14๊ฐ ์ต์ ๋ฉํฐ๋ชจ๋ฌ ๋ชจ๋ธ ์ค ํ์ค ๊ธฐ์ ๋ฌธ์ ์ฒ๋ฆฌ ์๊ฑด์ ์ถฉ์กฑํ๋ ๋ชจ๋ธ ์์
๊ธฐ์กด ๋ฒค์น๋งํฌ ์ฑ๋ฅ๊ณผ ํ์ค ์ ์ฉ ์ฌ์ด์ ๊ฒฉ์ฐจ๊ฐ ์๋นํจ์ ์ ๋์ ์ผ๋ก ์ ์ฆ
์ ์ฒด ๋ฐ์ดํฐ์ ๊ณผ ํ๊ฐ ๋๊ตฌ๋ฅผ ์คํ์์ค๋ก ๊ณต๊ฐ
๐ฏ ์ ์ด๊ฒ์ด ๊ฒ์ ์ฒด์ธ์ ์ธ๊ฐ? : โOCR์ ํด๊ฒฐ๋ ๋ฌธ์ โ ์ธ์ โ ํ์ค ๊ธฐ์ ๋ฌธ์์์๋ ์์ง ๊ฐ ๊ธธ์ด ๋ฉ๋ค๋ ๊ฐ์ฑ
Only Say What You Know: Calibration-Aware Generation for Long-Form Factuality
๐๏ธ ์์: Microsoft Research
๐ท๏ธ ํต์ฌ ํค์๋: Hallucination Reduction, Calibration, Long-form Generation
๐ญ ์ด๋ฐ ์ง๋ฌธ์ ํด๋ณธ ์ ์๋์?
AI๊ฐ ๊ธด ๊ธ์ ์ธ ๋ ์ ๋ค๋ก ๊ฐ์๋ก ๊ฑฐ์ง๋ง์ด ๋์ด๋ ๊น?
โํ์คํ ๊ฒ๋ง ๋งํดโ๋ผ๊ณ ํ๋ฉด ์ ๋ง ๋ ๊น?
์ฌ๊ณ ๊ณผ์ (CoT)์์ ๋ถํ์คํ ์ ๋ณด๊ฐ ์ต์ข ๋ต๋ณ์ ์ค์ผ๋๋ ๊ฑธ ๋ง์ ์ ์์๊น?
์๋ฆฌ์ฌ๊ฐ 100๊ฐ์ง ์๋ฆฌ๋ฅผ ํ๊บผ๋ฒ์ ๋ง๋ค ๋, ๋ง์ ๋ณด๋ฉด์ ๋ง๋๋ ๊ฒ๊ณผ ๋ ์ํผ๋ง ๋ฏฟ๊ณ ๋ค ์์๋ด๋ ๊ฒ์ ๋ค๋ฅด๋ค. ๊ธฐ์กด LLM์ ์ถ๋ก ์ค ๋ถํ์คํ ์ ๋ณด๋ฅผ ๊ทธ๋๋ก ์ต์ข ์ถ๋ ฅ์ ๋๊ฒผ๋ค. CAG(Calibration-Aware Generation)๋ โํ์โ๊ณผ โํ์ โ์ ๋ถ๋ฆฌํ๋ค. ์ค๊ฐ ์ถ๋ก ์ ์ ๋ขฐ๋ ์ถ์ ์น๋ฅผ ๋ฌ๊ณ , ํ์คํ ์ ๋ณด๋ง ์ต์ข ๋ต์ ๋ฐ์ํ๋ค.
ํนํ ์ฃผ๋ชฉํ ์ :
5๊ฐ ์ฅ๋ฌธ ์ฌ์ค์ฑ ๋ฒค์น๋งํฌ์์ ์ต๋ 13% ์ฌ์ค์ฑ ํฅ์
๋์ฝ๋ฉ ์๊ฐ ์ต๋ 37% ๋จ์ถ (๋ถํ์คํ ๊ฒฝ๋ก ์กฐ๊ธฐ ์ฐจ๋จ ํจ๊ณผ)
์ฌ๋ฌ ๋ชจ๋ธ ํจ๋ฐ๋ฆฌ์ ๋ฒ์ฉ ์ ์ฉ ๊ฐ๋ฅ
๐ฏ ์ ์ด๊ฒ์ด ๊ฒ์ ์ฒด์ธ์ ์ธ๊ฐ? : โํ ๋ฃจ์๋ค์ด์ ํ ๊ต์ โ โ โ์์ฑ ๋จ๊ณ์์ ์์ฒ ์ฐจ๋จโ์ผ๋ก ํจ๋ฌ๋ค์ ์ ํ
AniMatrix: An Anime Video Generation Model that Thinks in Art, Not Physics
๐๏ธ ์์: Tencent
๐ท๏ธ ํต์ฌ ํค์๋: Anime Video Generation, Artistic Prior, Deformation-Aware Training
๐ญ ์ด๋ฐ ์ง๋ฌธ์ ํด๋ณธ ์ ์๋์?
AI๋ก ์ ๋๋ฉ์ด์ ์ ๋ง๋ค๋ฉด ์ โ๋์ธ์ง ๋๋โ์ด ์๋๋ผ โ์ค์ฌ ๋๋โ์ด ๋ ๊น?
์ํฉํธ ํ๋ ์, ์ค๋ฏธ์ด, SD ๋ณ์ ๊ฐ์ ์ ๋ ๋ฌธ๋ฒ์ AI๊ฐ ๋ฐฐ์ธ ์ ์์๊น?
๋ฌผ๋ฆฌ์ ์ผ๋ก ์ ํํ ์์ ์์ฑ ๋ชจ๋ธ์ด ์ ์ ๋์์๋ ์คํ๋ ค ์คํจํ ๊น?
๊ธฐ์กด ๋น๋์ค ์์ฑ ๋ชจ๋ธ์ ๋ฌผ๋ฆฌ ๋ฒ์น์ ๋ด์ฌํํ๋ค. ํ์ง๋ง ์ ๋๋ฉ์ด์ ์ ์๋์ ์ผ๋ก ๋ฌผ๋ฆฌ๋ฅผ ์๋ฐํ๋ค โ ์ํฉํธ ํ๋ ์, ์ ์ฒด ๋น์จ ๋ณํ, ์์ ํจ๊ณผ๊ฐ ๋ฐ๋ก ์์ ์ด๋ค. AniMatrix๋ โ์ ํํจโ์ ์ ์๋ฅผ ๋ฌผ๋ฆฌ์์ ์์ ๋ก ์ฌ์ค์ ํ๋ค. ํ๋ก๋์ ์ง์ ์์คํ ์ด ์คํ์ผยท๋ชจ์ ยท์นด๋ฉ๋ผยทVFX๋ฅผ ๋ถ๋ฅํ์ผ๋ก ๊ตฌ์กฐํํ๊ณ , ๋ณํ ์ธ์ ์ ํธ๋ ์ต์ ํ๊ฐ โ์๋๋ ์์ โ๊ณผ โ๋จ์ ์ค๋ฅโ๋ฅผ ๊ตฌ๋ถํ๋ค.
ํนํ ์ฃผ๋ชฉํ ์ :
ํ๋ก ์ ๋๋ฉ์ดํฐ ํ๊ฐ 5๊ฐ ์ฐจ์ ์ค 4๊ฐ์์ 1์
Seedance-Pro 1.0 ๋๋น ํ๋กฌํํธ ์ดํด +22.4%, ์์ ์ ๋ชจ์ +16.9%
๋ชจ๋ธ ๊ฐ์ค์น์ ์ถ๋ก ์ฝ๋ ๊ณต๊ฐ ์์
๐ฏ ์ ์ด๊ฒ์ด ๊ฒ์ ์ฒด์ธ์ ์ธ๊ฐ? : โ๋ฌผ๋ฆฌ์ ์ผ๋ก ์ ํํ ์์ ์์ฑโ โ โ์์ ์ ๊ท์น์ ํ์ตํ๋ ์ฐฝ์ ๋๊ตฌโ๋ก ์ ํ
Stream-R1: Reliability-Perplexity Aware Reward Distillation for Streaming Video Generation
๐๏ธ ์์: USTC (์ค๊ตญ๊ณผํ๊ธฐ์ ๋ํ๊ต)
๐ท๏ธ ํต์ฌ ํค์๋: Video Distillation, Reward-guided Learning, Streaming Generation
๐ญ ์ด๋ฐ ์ง๋ฌธ์ ํด๋ณธ ์ ์๋์?
์ค์๊ฐ ๋น๋์ค ์์ฑ์์ ์๋์ ํ์ง์ ๋์์ ์ก์ ์ ์์๊น?
Teacher ๋ชจ๋ธ์ ์ถ๋ ฅ์ด ํญ์ ๋ฏฟ์ ๋งํ ๊ฑด ์๋๋ผ๋ฉด?
์์์ ์ด๋ ๋ถ๋ถ์ ํ์ต ์์์ ์ง์คํด์ผ ํจ๊ณผ๊ฐ ํด๊น?
ํ์์๊ฒ ๋ชจ๋ ๋ฌธ์ ๋ฅผ ๊ฐ์ ๋น์ค์ผ๋ก ๊ฐ๋ฅด์น๋ ์ ์์ ๋นํจ์จ์ ์ด๋ค. Stream-R1์ ๋ ๊ฐ์ง๋ฅผ ๊ตฌ๋ถํ๋ค: ์ด ๋กค์์์ ๋ฐฐ์ธ ๊ฐ์น๊ฐ ์๋๊ฐ(Inter-Reliability), ๊ทธ๋ฆฌ๊ณ ์์์ ์ด๋์ ์ง์คํ ๊ฒ์ธ๊ฐ(Intra-Perplexity). ๋ณด์ ๋ชจ๋ธ์ ์ ์๋ก ์ ๋ขฐ๋๋ฅผ ํ๋จํ๊ณ , ๊ทธ๋๋์ธํธ ํ์ ์ฑ์ผ๋ก ๊ฐ์ ์ฌ์ง๊ฐ ํฐ ํฝ์ /ํ๋ ์์ ์ต์ ํ ์๋ ฅ์ ์ง์คํ๋ค.
ํนํ ์ฃผ๋ชฉํ ์ :
์๊ฐ ํ์ง, ๋ชจ์ ํ์ง, ํ ์คํธ ์ ํฉ 3๊ฐ ์ฐจ์ ๋ชจ๋ ๊ธฐ์กด ์ฆ๋ฅ ๊ธฐ์ค ์ผ๊ด ๊ฐ์
์ํคํ ์ฒ ๋ณ๊ฒฝ์ด๋ ์ถ๋ก ๋น์ฉ ์ฆ๊ฐ ์์
์ ์ํ ๋ฐธ๋ฐ์ฑ์ผ๋ก ๋จ์ผ ํ์ง ์ถ ํธํฅ ๋ฐฉ์ง
๐ฏ ์ ์ด๊ฒ์ด ๊ฒ์ ์ฒด์ธ์ ์ธ๊ฐ? : โTeacher ์ถ๋ ฅ ์ผ๊ด ๋ชจ๋ฐฉโ โ โ์ ๋ขฐ๋์ ๊ฐ์ ์ฌ์ง๋ฅผ ํ๋จํ๋ฉฐ ์ ํ์ ์ผ๋ก ๋ฐฐ์ฐ๊ธฐโ
Workspace-Bench 1.0: Benchmarking AI Agents on Workspace Tasks with Large-Scale File Dependencies
๐๏ธ ์์: Tsinghua University
๐ท๏ธ ํต์ฌ ํค์๋: AI Agent Benchmark, File Dependencies, Workspace Learning
๐ญ ์ด๋ฐ ์ง๋ฌธ์ ํด๋ณธ ์ ์๋์?
AI ์์ด์ ํธ์๊ฒ ๋ด ์ค์ ์์ ํด๋๋ฅผ ์คฌ์ ๋, ํ์ผ ๊ฐ ์์กด์ฑ์ ์ดํดํ ๊น?
20GB์ง๋ฆฌ ์ํฌ์คํ์ด์ค์์ ํ์ํ ํ์ผ์ ์ฐพ์ ์์ ์ ์๋ฃํ ์ ์์๊น?
ํ์ฌ ์์ด์ ํธ๊ฐ ์ค์ ์ง์ฅ์ธ์ ์ ๋ฌด๋ฅผ ๋์ฒดํ ์ค๋น๊ฐ ๋์์๊น?
์ฌ๋ฌด์ค ์ฑ ์ ์์ 2๋ง ๊ฐ์ ํ์ผ์ด ๋์ฌ์๋ค๊ณ ์์ํด๋ณด์. ์คํ๋ ๋์ํธ๋ ์ฌ๋ผ์ด๋๋ฅผ ์ฐธ์กฐํ๊ณ , ์ฝ๋๋ ์ค์ ํ์ผ์ ์์กดํ๋ค. Workspace-Bench๋ 5๊ฐ์ง ์ง์ ํ๋กํ, 74์ข ํ์ผ ํ์, 20,476๊ฐ ํ์ผ(์ต๋ 20GB)๋ก ๊ตฌ์ฑ๋ ํ์ค์ ์ํฌ์คํ์ด์ค์์ 388๊ฐ ํ์คํฌ๋ฅผ ํ๊ฐํ๋ค. ์ต๊ณ ์์ด์ ํธ๊ฐ 68.7%์ธ ๋ฐ๋ฉด ์ธ๊ฐ์ 80.7% โ ์์ง 12%p ๊ฒฉ์ฐจ๊ฐ ์๋ค.
ํนํ ์ฃผ๋ชฉํ ์ :
7๊ฐ ๊ธฐ๋ฐ ๋ชจ๋ธ ร 4๊ฐ ์์ด์ ํธ ํ๋์ค ์กฐํฉ ํ๊ฐ, ํ๊ท ์ฑ๋ฅ 47.4%
7,399๊ฐ ์ธ๋ถ ํ๊ฐ ๊ธฐ์ค(rubrics)์ผ๋ก ํฌ๋ก์ค ํ์ผ ๊ฒ์ยท๋งฅ๋ฝ ์ถ๋ก ยท์ ์์ ์์ฌ๊ฒฐ์ ์ธก์
70% ๋น์ฉ ์ ๊ฐ ๊ฐ๋ฅํ Lite ๋ฒ์ (100 ํ์คํฌ) ํจ๊ป ์ ๊ณต
๐ฏ ์ ์ด๊ฒ์ด ๊ฒ์ ์ฒด์ธ์ ์ธ๊ฐ? : โ๋จ์ผ ํ์ผ ์ฝ๋ฉ ๋ฒค์น๋งํฌโ โ โ์ค์ ์ง์ฅ์ธ ์ํฌ์คํ์ด์ค ์ ์ฒด๋ฅผ ๋ค๋ฃจ๋ ์ข ํฉ ํ๊ฐโ
Quantifying the human visual exposome with vision language models
๐๏ธ ์์: University of Graz, TU Dresden
๐ท๏ธ ํต์ฌ ํค์๋: Visual Exposome, Mental Health, VLM Application
๐ญ ์ด๋ฐ ์ง๋ฌธ์ ํด๋ณธ ์ ์๋์?
๋งค์ผ ๋ณด๋ ์๊ฐ ํ๊ฒฝ์ด ์คํธ๋ ์ค์ ๊ธฐ๋ถ์ ์ํฅ์ ์ค๊น?
โ๋ น์ง๊ฐ ์ ์ ๊ฑด๊ฐ์ ์ข๋คโ๋ ๊ฑธ ๊ฐ๊ด์ ์ผ๋ก ์ธก์ ํ ์ ์์๊น?
VLM(๋น์ -์ธ์ด ๋ชจ๋ธ)์ด ์ฌ๋ฆฌํ ์ฐ๊ตฌ์ ์ธ๋ชจ๊ฐ ์์๊น?
2,674์ฅ์ ์ฐธ๊ฐ์ ์ดฌ์ ์ฌ์ง์ VLM์ผ๋ก ๋ถ์ํ๋ค. โ๋ น์์ด ์ผ๋ง๋ ๋ณด์ด๋๊ฐโ๋ถํฐ ์์ํด, LLM ํ์ดํ๋ผ์ธ์ผ๋ก 700๋ง ๊ฑด ๋ ผ๋ฌธ์์ 1,000๊ฐ ํ๊ฒฝ ํน์ง์ ์๋ ์ถ์ถํ๊ณ , ์ด๋ฅผ ์ค์ ์ด๋ฏธ์ง์์ ์ธก์ ํ๋ค. ๊ฒฐ๊ณผ: VLM์ด ์ถ์ถํ ๋ น์ ๋น์จ์ ์๊ฐ ๊ฐ์ ๊ณผ ๋ง์ฑ ์คํธ๋ ์ค๋ฅผ ์ ์๋ฏธํ๊ฒ ์์ธกํ๊ณ , ์ถ์ถ๋ ๋งฅ๋ฝ ํ๊ฐ ์ค 33%๊ฐ ์ ์ ๊ฑด๊ฐ ์งํ์ ์๊ด.
ํนํ ์ฃผ๋ชฉํ ์ :
700๋ง ๊ฑด ๋ ผ๋ฌธ์์ LLM์ผ๋ก ํ๊ฒฝ-์ ์ ๊ฑด๊ฐ ์ฐ๊ฒฐ ํน์ง 1,000๊ฐ ์๋ ๋ง์ด๋
VLM ์ถ์ถ ๋ น์ ๋น์จ์ด ๊ธฐ์กด ๊ฒ์ฆ๋ ๋ฒค์น๋งํฌ์ ์ผ์นํ๋ ์์ธก๋ ฅ ํ์ธ
์๊ธฐ๋ณด๊ณ ํธํฅ ์๋ 1์ธ์นญ ์๊ฐ ํ๊ฒฝ์ ๊ฐ๊ด์ ์ ๋ํ ์ต์ด ๋ฌ์ฑ
๐ฏ ์ ์ด๊ฒ์ด ๊ฒ์ ์ฒด์ธ์ ์ธ๊ฐ? : โ์ค๋ฌธ์ง ๊ธฐ๋ฐ ํ๊ฒฝ ํ๊ฐโ โ โAI๊ฐ ๋น์ ์ ์์ผ๋ฅผ ๋ถ์ํด ์ ์ ๊ฑด๊ฐ์ ์์ธกํ๋โ ์๊ฐ ๋ ธ์ถ์ฒดํ(visual exposomics) ํ์
Perceptual Flow Network for Visually Grounded Reasoning
๐๏ธ ์์: Independent
๐ท๏ธ ํต์ฌ ํค์๋: Visual Reasoning, Reinforcement Learning, Hallucination Reduction
๐ญ ์ด๋ฐ ์ง๋ฌธ์ ํด๋ณธ ์ ์๋์?
๋น์ -์ธ์ด ๋ชจ๋ธ์ด ์ด๋ฏธ์ง๋ฅผ โ๋ณด๊ณ โ ๋ตํ๋ ๊ฑด์ง, โ์ถ์ธกโํ๋ ๊ฑด์ง ์ด๋ป๊ฒ ์๊น?
์๊ฐ ์ ๋ฌธ๊ฐ์ ๊ธฐํํ์ ๊ฐ์ด๋๊ฐ ์คํ๋ ค ์ถ๋ก ์ ๋ฐฉํดํ ์ ์๋ค๋ฉด?
์ง๊ฐ(perception)๊ณผ ์ถ๋ก (reasoning)์ ๋ถ๋ฆฌํ๋ฉด ํ ๋ฃจ์๋ค์ด์ ์ด ์ค๊น?
๊ธฐ์กด ๋ฐฉ๋ฒ์ ์๊ฐ ์ ๋ฌธ๊ฐ ๋ชจ๋ธ์ ๊ธฐํํ์ ์ ๋ณด๋ฅผ ๊ทธ๋๋ก ์ฃผ์ ํ๋ค. ํ์ง๋ง ์ด ๊ฐ๋ ์ ํธ๋ โ๊ธฐํํ์ ์ ๋ฐ๋โ์ ํธํฅ๋์ด ์ถ๋ก ์๋ ์คํ๋ ค ๋ฐฉํด๊ฐ ๋๋ค. PFlowNet์ ์ง๊ฐ๊ณผ ์ถ๋ก ์ ๋ถ๋ฆฌํ๊ณ , ๋ณ๋ถ ๊ฐํํ์ต์ผ๋ก ์ถ๋ก ์งํฅ์ ์๊ฐ ํ๋์ ์ ๋ํ๋ค. ๊ฒฐ๊ณผ์ ์ผ๋ก V* Bench 90.6%, MME-RealWorld-lite 67.0%๋ก ์๋ก์ด SOTA๋ฅผ ๋ฌ์ฑ.
ํนํ ์ฃผ๋ชฉํ ์ :
V* Bench 90.6% โ ์๊ฐ ๊ธฐ๋ฐ ์ถ๋ก ์์ ์ ๊ธฐ๋ก
์ธ๋ถ ์ ๋ฌธ๊ฐ ๋ชจ๋ธ ์์ด ์๊ธฐ ์กฐ๊ฑด๋ถ(self-conditioned) ์์ฑ์ผ๋ก ํด๊ฒฐ
์ด๋ก ์ ์ฑ๋ฅ ๋ณด์ฅ๊ณผ ์ค์ฆ์ ๊ฒฐ๊ณผ๋ฅผ ๋์์ ์ ๊ณต
๐ฏ ์ ์ด๊ฒ์ด ๊ฒ์ ์ฒด์ธ์ ์ธ๊ฐ? : โ๊ธฐํํ ์ ๋ฌธ๊ฐ ์ ํธ๋ฅผ ๋ ๋ฃ์โ โ โ์ง๊ฐ๊ณผ ์ถ๋ก ์ ๋ถ๋ฆฌํ๊ณ ์ถ๋ก ๋ณด์์ผ๋ก ์๊ฐ์ ์ ๋ํ์โ
PatRe: A Full-Stage Office Action and Rebuttal Generation Benchmark for Patent Examination
๐๏ธ ์์: Independent
๐ท๏ธ ํต์ฌ ํค์๋: Patent Examination, Legal Reasoning, Multi-turn Benchmark
๐ญ ์ด๋ฐ ์ง๋ฌธ์ ํด๋ณธ ์ ์๋์?
ํนํ ์ฌ์ฌ์ ๊ฑฐ์ โ๋ฐ๋ก โ์ฌ์ฌ ๊ณผ์ ์ AI๊ฐ ์๋ฎฌ๋ ์ด์ ํ ์ ์์๊น?
์ฌ์ฌ๊ด ์ญํ ๊ณผ ์ถ์์ธ ์ญํ ์ค AI๋ ์ด๋ ์ชฝ์ ๋ ์ํ ๊น?
๋ฒ์ ์ถ๋ก ๊ณผ ๊ธฐ์ ์ ์ ๊ท์ฑ ํ๋จ์ ๋์์ ์๊ตฌํ๋ฉด LLM์ด ๋ฒํธ๊น?
ํ์ ๋ ผ๋ฌธ์ ํผ์ด๋ฆฌ๋ทฐ์ ๋ฆฌ๋ฒํ์ด ์๋ฏ, ํนํ์๋ Office Action(๊ฑฐ์ ์ด์ ์)๊ณผ Rebuttal(๋ฐ๋ก )์ด ์๋ค. PatRe๋ ์ด ์ ์ฒด ์์ ์ฃผ๊ธฐ๋ฅผ ์ต์ด๋ก ๋ฒค์น๋งํฌํํ๋ค. 480๊ฑด ์ค์ ์ฌ๋ก๋ก ๋ค์ํ LLM์ ํ๊ฐํ ๊ฒฐ๊ณผ, ์ฌ์ฌ๊ด ๋ถ์๊ณผ ์ถ์์ธ ๋ฐ๋ก ์ฌ์ด์ ๋๋ ทํ ๋น๋์นญ์ด ์กด์ฌํ๋ค.
ํนํ ์ฃผ๋ชฉํ ์ :
ํนํ ์ฌ์ฌ ์ ๊ณผ์ (Office Action ์์ฑ + ๋ฐ๋ก )์ ๋ชจ๋ธ๋งํ ์ต์ด์ ๋ฒค์น๋งํฌ
์ค๋ผํด ์ค์ ๊ณผ ๊ฒ์ ์๋ฎฌ๋ ์ด์ ์ค์ ๋ชจ๋ ์ง์
์์ฉ ๋ชจ๋ธ๊ณผ ์คํ์์ค ๋ชจ๋ธ ๊ฐ ์ฑ๋ฅ ๊ฒฉ์ฐจ ๋ฐ ํ์คํฌ ๋น๋์นญ ๋ฐ๊ฒฌ
๐ฏ ์ ์ด๊ฒ์ด ๊ฒ์ ์ฒด์ธ์ ์ธ๊ฐ? : โํนํ ๋ถ๋ฅ/์ถ์ถโ ๋จ๋ฐฉํฅ ํ์คํฌ โ โ์ฌ์ฌ-๋ฐ๋ก โ ๋คํ์ ๋์ ํ๋ก์ธ์ค๋ก ํ์ฅ
๋งค์ฃผ ๋ชฉ์์ผ ์ค์ 8์,
๋ฐ์ ๋น์ ์ ๊ธฐ์ ๋ฐ์ ์ ๋ค์ณ์ง์ง ์๊ฒ ๋ง๋ค์ด์ค
์ต์ AI ํธ๋ ๋ ์์ฝ๋ณธ์ด ์ ๋ฌ๋ฉ๋๋ค! ๐