본문으로 건너뛰기
관련 기사 바로가기
LLM을 인간 작업기억의 외부 레지스터로 보는 관점과 제약 기반 재구성의 작동 원리
ML 데이터셋 품질 평가를 위한 서드파티 시스템 구축
vLLM 기반의 고효율 다중 에이전트 토론 라이브러리 DAR 공개
ASI-Evolve: AI가 AI 연구와 개발을 스스로 가속화하는 에이전트 프레임워크
번역에서 회복되다: 벤치마크 및 데이터셋의 자동 번역을 위한 효율적인 파이프라인
LLM 스케줄링 Kaggle 경진대회: 소형 모델 실행 여부 결정하기
LLM 벤치마크의 한계: 서사 구조 분석을 위한 '해석적 추론' 측정의 필요성
← 피드로 돌아가기
MMLU
Benchmarks (벤치마크)
약 9개 아티클
관심 태그 추가
Benchmarks
관련 태그:
Alibaba
ASI-Evolve
Gemini 2.0 Flash
GPQA
GPT-4o-mini
GRPO
GSM8K
HumanEval
LLM-as-a-Judge
NarrativeQA
TIME
HEADLINE
AI Trends
피드
트렌딩
커뮤니티
탐색
보관함
로그인
홈
트렌딩
커뮤니티
보관함
프로필