본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

InternScience/Agents-A1

주요 태스크는 text-generation 기반의 에이전트 행동 생성과 장기 추론을 포함한 멀티스텝 문제 해결이다. Agents-A1은 사용자의 목표를 해석해 실행 가능한 하위 작업으로 분해하고, 필요 시 외부 도구를 호출해 중간 결과를 반영하여 최종 출력을 생성하는 기능을 수행한다. 또한 도메인별 전문성에 기반한 과학적·공학적 질문 응답과 제약이 많은 명령 이행 작업을 처리하도록 설계되었다.35B256K 컨텍스트apache-2.0

35B Mixture-of-Experts 구조를 사용해 장기 탐색과 도구 호출에 최적화된 에이전트 성능을 제공한다.

학습 방식 · Agents-A1는 35B Mixture-of-Experts 기반의 에이전트 모델로, 전체 도메인 supervised fine-tuning을 먼저 수행하고 도메인별 교사 모델을 학습한 뒤 다중-교사 다중-도메인 온-폴리시 증류와 heterogeneity-aware 최적화를 통해 지식 전이를 향상시키는 세 단계 학습 패러다임을 사용했다.

TL;DR

Agents-A1은 InternScience가 발표한 약 35B 규모의 Mixture-of-Experts 기반 에이전트 모델로 장기 궤적 탐색과 도구 호출을 결합한 에이전시 능력 확장을 목표로 설계되었다. 모델은 전체 도메인 supervised fine-tuning, 도메인별 교사 모델 학습, 다중-교사 다중-도메인 온-폴리시 증류의 세 단계 학습 파이프라인을 통해 도메인 간 지식 전이를 강화했고 도구 호출과 함수 인터페이스를 네이티브로 지원해 외부 API 및 코드 인터프리터와의 통합을 용이하게 한다. 공개된 평가 프레임워크와 컨텍스트 길이 262144 권장 설정을 바탕으로 다양한 벤치마크(예: Seal-0 56.36, IFBench 80.61, IFEval 94.82, FrontierScience-Olympiad 79.0)에서 동급 또는 상위권 성적을 기록했으며 이 결과는 동일 프로토콜로 재현 가능하도록 구성되어 있다. 다만 모델이 Mixture-of-Experts 구조와 온-폴리시 증류에 의존하므로 서빙 및 메모리 구성, 그리고 도구 통합 파이프라인의 구현 난이도가 운영 환경에서 고려되어야 한다.

핵심 포인트

  • 에이전시 역량 확장을 목적으로 Mixture-of-Experts 기반에서 장기 궤적 스케일링을 중점적으로 설계한 점이 동일 규모 모델 대비 차별화 요소이다.
  • 세 단계의 학습 전략(전체 도메인 SFT → 도메인별 교사 모델 → 다중-교사 온-폴리시 증류)을 통합해 도메인 간 이질성을 고려한 지식 전이에 초점을 맞춘 점이 기술적 차별점이다.
  • 도구 호출을 네이티브로 지원하고 서빙 지침에서 reasoning-parser와 tool-call-parser를 명시해 실전적 API·인터프리터 통합을 바로 적용할 수 있도록 한 점이 실용성 측면의 차별화이다.
  • 비교적 작은 모델 클래스(~35B)임에도 장기 탐색과 도구 사용을 결합한 작업군에서 상위권 성능을 달성하면서 대형 최전선 모델과의 격차를 줄인 점이 강점이다.

벤치마크

벤치마크지표비교
Seal-0score56.36
IFBenchscore80.61
IFEvalscore94.82
FrontierScience-Olympiadscore79.0
FrontierScience-Researchscore40.0

이미지 분석

Agents-A1의 벤치마크 개요를 시각화한 표/그리드 이미지로서 다수의 장르(장기 탐색, 공학, 과학, 지시 이행 등)에서 모델의 점수를 비교하고 있다.
이미지는 동일한 벤치마크 집합에 대해 동급(~35B) 모델들과 대형 모델들의 성능을 한눈에 보여주며 Agents-A1이 여러 항목에서 최상위 또는 동급 최상위 성적을 기록했음을 시각적으로 확인할 수 있다. 특히 장기 탐색과 지시 이행 계열에서 Agents-A1의 점수가 눈에 띄게 높게 표시되어 모델이 장기 플래닝과 도구 통합 워크플로우에서 강점을 보이는 근거로 활용된다. 이 시각화는 README의 성능 표를 보조하는 근거 자료로서 성능 분포와 분야별 강약점 파악에 유용하다.

594

LIKES

36.6k

DOWNLOADS

1 / 0

조회수

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.