관련 기사 바로가기
Flexibility Trap의 ICML 우수상 수상과 JustGRPO 튜토리얼 재현기합성 데이터를 활용한 소형 언어 모델의 수학 추론 능력 향상 연구프로덕션 환경의 AI 에이전트 신뢰성 검증을 위한 EvalMonkey 공개Qwen2.5-0.5B-Instruct 모델의 GSM8K 추론 튜닝 중 발생한 리워드 해킹 사례CDLM: 일관성 모델을 통한 확산 언어 모델의 추론 가속화읽기일 뿐, 생각하기가 아니다: 멀티모달 LLM에서 텍스트가 픽셀이 될 때 발생하는 모달리티 격차의 이해와 해소vLLM 기반의 고효율 다중 에이전트 토론 라이브러리 DAR 공개
← 피드로 돌아가기
GSM8K
약 8개 아티클
관심 태그 추가
관련 태그:GRPOchain-of-thoughtCrowdTensorDiffusion LLMDiffusion modelingEvalMonkeyInternVL 3.5KV CacheLoRAMMLU
TIMEHEADLINE