본문으로 건너뛰기
관련 기사 바로가기
대화형 에이전트의 신뢰성과 협업 능력을 측정하는 벤치마크인 τ-bench와 τ²-bench 연구.
엔터프라이즈 환경에서의 에이전트 학습
값싼 제안 모델과 기호 검증기 결합으로 τ²-bench 정답 오류를 찾아내고 비용을 크게 낮춘 사례
Signals: 에이전트 상호작용의 궤적 샘플링 및 분류를 위한 경량 프레임워크
CoVe: 제약 조건 가이드 검증을 통한 대화형 도구 사용 에이전트 학습
스탠포드 ACE와 반추 언어 모델 패턴을 결합한 대규모 에이전트 실행 추적 분석 시스템
← 피드로 돌아가기
tau-bench
Benchmarks (벤치마크)
약 9개 아티클
관심 태그 추가
Benchmarks
관련 태그:
DigitalOcean
τ2-bench
CoVe-4B
Deepseek V4 Flash
GRPO
Llama-2
Plano
Qwen3
Qwen3-30B
Reflective Language Model
TIME
HEADLINE
AI Trends
피드
트렌딩
커뮤니티
탐색
보관함
로그인
홈
트렌딩
커뮤니티
보관함
프로필