InternScience/Agents-A1
35B Mixture-of-Experts 구조를 사용해 장기 탐색과 도구 호출에 최적화된 에이전트 성능을 제공한다.
학습 방식 · Agents-A1는 35B Mixture-of-Experts 기반의 에이전트 모델로, 전체 도메인 supervised fine-tuning을 먼저 수행하고 도메인별 교사 모델을 학습한 뒤 다중-교사 다중-도메인 온-폴리시 증류와 heterogeneity-aware 최적화를 통해 지식 전이를 향상시키는 세 단계 학습 패러다임을 사용했다.
TL;DR
Agents-A1은 InternScience가 발표한 약 35B 규모의 Mixture-of-Experts 기반 에이전트 모델로 장기 궤적 탐색과 도구 호출을 결합한 에이전시 능력 확장을 목표로 설계되었다. 모델은 전체 도메인 supervised fine-tuning, 도메인별 교사 모델 학습, 다중-교사 다중-도메인 온-폴리시 증류의 세 단계 학습 파이프라인을 통해 도메인 간 지식 전이를 강화했고 도구 호출과 함수 인터페이스를 네이티브로 지원해 외부 API 및 코드 인터프리터와의 통합을 용이하게 한다. 공개된 평가 프레임워크와 컨텍스트 길이 262144 권장 설정을 바탕으로 다양한 벤치마크(예: Seal-0 56.36, IFBench 80.61, IFEval 94.82, FrontierScience-Olympiad 79.0)에서 동급 또는 상위권 성적을 기록했으며 이 결과는 동일 프로토콜로 재현 가능하도록 구성되어 있다. 다만 모델이 Mixture-of-Experts 구조와 온-폴리시 증류에 의존하므로 서빙 및 메모리 구성, 그리고 도구 통합 파이프라인의 구현 난이도가 운영 환경에서 고려되어야 한다.
핵심 포인트
- 에이전시 역량 확장을 목적으로 Mixture-of-Experts 기반에서 장기 궤적 스케일링을 중점적으로 설계한 점이 동일 규모 모델 대비 차별화 요소이다.
- 세 단계의 학습 전략(전체 도메인 SFT → 도메인별 교사 모델 → 다중-교사 온-폴리시 증류)을 통합해 도메인 간 이질성을 고려한 지식 전이에 초점을 맞춘 점이 기술적 차별점이다.
- 도구 호출을 네이티브로 지원하고 서빙 지침에서 reasoning-parser와 tool-call-parser를 명시해 실전적 API·인터프리터 통합을 바로 적용할 수 있도록 한 점이 실용성 측면의 차별화이다.
- 비교적 작은 모델 클래스(~35B)임에도 장기 탐색과 도구 사용을 결합한 작업군에서 상위권 성능을 달성하면서 대형 최전선 모델과의 격차를 줄인 점이 강점이다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| Seal-0 | score | 56.36 | — |
| IFBench | score | 80.61 | — |
| IFEval | score | 94.82 | — |
| FrontierScience-Olympiad | score | 79.0 | — |
| FrontierScience-Research | score | 40.0 | — |
이미지 분석
594
LIKES
36.6k
DOWNLOADS
1 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.