본문으로 건너뛰기
AI Trends
피드
트렌딩
커뮤니티
탐색
보관함
로그인
홈
트렌딩
커뮤니티
보관함
프로필
관련 기사 바로가기
Flexibility Trap의 ICML 우수상 수상과 JustGRPO 튜토리얼 재현기
합성 데이터를 활용한 소형 언어 모델의 수학 추론 능력 향상 연구
프로덕션 환경의 AI 에이전트 신뢰성 검증을 위한 EvalMonkey 공개
Qwen2.5-0.5B-Instruct 모델의 GSM8K 추론 튜닝 중 발생한 리워드 해킹 사례
CDLM: 일관성 모델을 통한 확산 언어 모델의 추론 가속화
읽기일 뿐, 생각하기가 아니다: 멀티모달 LLM에서 텍스트가 픽셀이 될 때 발생하는 모달리티 격차의 이해와 해소
vLLM 기반의 고효율 다중 에이전트 토론 라이브러리 DAR 공개
← 피드로 돌아가기
GSM8K
Benchmarks (벤치마크)
약 7개 아티클
관련 태그:
GRPO
Chain of Thought
Diffusion LLM
Diffusion Model
EvalMonkey
InternVL 3.5
KV-cache
MMLU
Qwen2.5
Qwen3-VL