35B MoE 에이전트 성능을 양자화로 압축한 배포형 모델
Agents‑A1 Q4_K_M GGUF는 35B Mixture‑of‑Experts 기반의 agentic VLM으로 장기 탐색과 도구 호출을 지원하도록 최적화된 양자화 모델이다
TL;DR
InternScience의 Agents‑A1 Q4_K_M GGUF는 35B Mixture‑of‑Experts 기반의 agentic VLM으로 장기 탐색과 도구 호출을 핵심 목표로 설계된 양자화 배포 모델이다. 모델은 범용 행동 정렬을 위한 풀도메인 감독 파인튜닝, 도메인별 교사 모델 학습, 멀티티처 온폴리시 증류의 3단계 학습 체계를 통해 도메인 간 지식 전이를 개선했고 행동, 관찰, 검증 결과를 학습 목표로 통합하는 인프라를 사용해 연쇄적 의사결정 능력을 향상시켰다. 공개된 벤치마크에서 다수의 과제군에서 동급 대비 상위 성과를 보고했으며 GGUF 양자화 아티팩트와 vLLM, SGLang 호환성으로 로컬 서빙과 연구 재현성 측면에서 실용적 이점을 제공한다. 한편 문서상 결과는 공개된 평가 프로토콜과 비교 대상의 기술 보고서를 기반으로 산출된 것이므로 자체 사용자는 제공된 평가 코드로 결과를 재현해 운용 환경에서의 성능을 검증할 필요가 있다.
핵심 역량
- 이 모델은 복잡한 목표를 단계별 실행 가능한 서브스텝으로 분해하고 각 단계에서 도구를 호출해 외부 정보를 취합하며 그 결과를 다음 단계 계획에 반영하는 연쇄적 행동 플로우를 수행할 수 있다. 도구 호출을 위한 네이티브 함수 콜 인터페이스를 갖추었으며 코드 인터프리터나 검색 엔진 같은 외부 체계와 연결해 중간 관찰을 수집하고 재평가하는 흐름을 유지한다. 텍스트 전용 모드로 전환해 KV 캐시를 절약할 수 있어 멀티모달과 텍스트 워크로드를 상황에 따라 선택적으로 운영할 수 있다.
- 이 모델은 도메인별 교사 모델과의 증류를 통해 전문 지식을 통합해 복잡한 과학적 질의나 엔지니어링 문제에서 도구와 결합된 추론을 수행할 수 있다. 온폴리시 방식의 지식 전이로 실제 에이전트 행위 분포에 맞춘 출력을 생성하며 내부 검증기(verifier) 결과를 학습 목표로 포함해 행동-관찰-검증 루프를 학습 대상화했다. 따라서 다중 제약의 지시문을 따르는 상황에서 제약을 유지하며 결과를 산출하는 능력이 향상되었다.
- 장기적 탐색(long‑horizon search) 능력과 멀티스텝 플래닝에서 강점을 보이며 대화형 지시문 처리와 복잡한 워크플로를 중단 없이 이어갈 수 있도록 설계되어 있다. 262144 토큰까지를 권장 컨텍스트 길이로 운영하며 긴 궤적에서의 상태 저장과 단계적 의사결정에 적합한 실행 전략을 제공한다. 공개된 평가 프레임워크를 통해 재현 가능한 검증을 수행했기 때문에 동일 프로토콜 하에서 비교 실험을 수행할 수 있다.
강점
- 동급 약 35B 모델군과의 비교에서 여러 벤치마크에서 최상위 성과를 보고했다는 점이 강점이다. 표에서 제시된 Seal‑0, HiPhO, FrontierScience‑Olympiad, IFBench, IFEval 등에서 높은 점수를 보이며 장기 탐색과 과학적 추론, 지시문 수행 능력에서 균형 잡힌 성능을 확보했다. 또한 GGUF 양자화 아티팩트로 배포되어 로컬 서빙과 경량 인프라에서 실용적으로 운영할 수 있는 배포 이점을 가진다.
- 모델 설계 측면에서는 Mixture‑of‑Experts 구조를 통해 모델 용량과 연산 효율을 분리해 확장성 있는 성능 향상을 달성한 점이 우수하다. 라우팅 기반의 전문가 활성화로 매 입력에서 전체 파라미터를 모두 계산하지 않으므로 동일한 추론 예산에서 더 높은 표현력을 확보할 수 있었다. 게다가 도구 호출과 긴 컨텍스트 운영을 고려한 설계로 실무적 에이전시 워크플로에 적합하다.
훈련 방식
베이스 모델은 InternScience/Agents‑A1이며 전체 도메인 감독 파인튜닝을 시작으로 도메인별 교사 모델을 학습하고 멀티티처 온폴리시 증류와 이질성 인식 최적화 기법을 적용해 도메인 간 지식 전이 효율을 높이는 3단계 학습 파이프라인을 사용했다.
알아두면 좋은 것
- Agents‑A1은 장기 궤적 스케일링과 이질적 에이전시 능력 확장이라는 두 축을 중심으로 설계되어 있다. 장기 궤적 축에서는 행동, 관찰, 검증 결과를 합쳐 학습 가능한 목표로 전환하는 도메인 기반의 지식‑행동 인프라를 사용했고 이질성 축에서는 풀도메인 감독 파인튜닝, 도메인별 교사 모델, 멀티티처 온폴리시 증류의 3단계 학습 체계를 적용했다. 이러한 학습 파이프라인이 도메인 간 지식 전이 효율을 높이는 핵심 요소로 제시되어 있다.
- 모델은 도구 호출을 네이티브로 지원하며 함수 호출, API 연동, 코드 해석기, 검색 엔진 등과의 통합을 염두에 두고 설계되었다. SGLang과 vLLM 같은 서빙 툴과의 호환성을 명시해 실무 환경에서 즉시 연결해 사용 가능한 배포 경로를 제공한다. 텍스트 전용 모드로 비전 인코더를 비활성화하면 KV 캐시를 확보해 더 긴 컨텍스트를 효율적으로 사용할 수 있다.
- 퍼포먼스 섹션에서 다수의 벤치마크에서 동급 대비 상위 성과가 보고되어 있으며 표는 비교 대상과 세부 점수를 함께 제시하고 있다. 모델 제작팀은 공개된 평가 프레임워크를 통해 결과의 재현성을 확보했다고 밝히며 동일 프로토콜로 다른 모델들을 비교할 수 있도록 평가 코드를 공개했다. 라이선스는 Apache‑2.0으로 기업 및 연구 목적의 재사용 경로가 열려 있다.
기술적 특징
- Mixture‑of‑Experts 아키텍처는 입력별로 소수의 전문가만 활성화해 계산 비용을 유지하면서도 전체 네트워크 용량을 크게 확장하는 방식이다. 이 구조는 Agents‑A1이 35B 파라미터 규모에서 높은 표현력을 발휘하도록 하며 장기 플래닝과 도메인별 전문성 분리를 가능하게 했다. 라우팅 메커니즘과 전문가 배분 전략이 핵심 설계 요소로 작동한다.
- 학습 파이프라인은 세 단계로 구성되어 있어 범용 에이전시 행동을 먼저 확보하고 이후 도메인별 전문 지식을 교사 모델로 캡처한 뒤 온폴리시 증류로 통합한다. 이 과정에서 실제 행위 분포에 기반한 온폴리시 학습이 분포 불일치를 줄여 도메인 간 지식 전이를 촉진했다. 또한 내부적으로 행동, 관찰, 검증 결과를 합쳐 학습 목표로 삼는 도메인‑그라운디드 지식‑행동 인프라를 사용해 에이전트의 연쇄적 의사결정을 학습 가능한 신호로 전환했다.
- 도구 통합을 위한 네이티브 함수 호출 인터페이스를 제공해 외부 API, 코드 인터프리터, 검색 엔진과의 연동을 원활하게 처리한다. 이 인터페이스는 도구 선택, 호출, 결과 파싱, 결과 기반의 계획 수정이라는 순환적 흐름을 지원하며 도구 기반 과업에서의 안정성을 높인다. 서빙 레이어에서는 SGLang과 vLLM과의 호환성을 명시해 실제 배포 시 빠른 통합이 가능하도록 설계되었다.
- 긴 컨텍스트 처리를 위해 262144 토큰 수준의 컨텍스트 길이를 권장하며 텍스트 전용 모드로 전환해 비전 인코더를 비활성화하면 KV 캐시 메모리를 절약할 수 있도록 구현되었다. 이로 인해 장기 시퀀스에서의 상태 유지와 중간 결과 재활용이 용이해지고 긴 탐색 궤적을 따라가는 작업에서 안정적인 성능 유지가 가능하다. 실제 서빙 예시와 권장 샘플링 파라미터가 README에 포함되어 있어 운영 환경에서의 튜닝을 지원한다.
차별점
- 에이전시 중심의 학습 설계는 행동, 관찰, 검증 결과를 통합하는 도메인‑그라운디드 인프라를 학습 목표로 삼아 연쇄적 의사결정 체인을 직접 학습 대상화한 점에서 차별화된다. 이 접근은 단순한 지식 전달이 아니라 행동 기반의 목표화를 통해 에이전트가 자체적으로 계획과 검증을 반복하도록 유도한다. 결과적으로 도구 사용과 장기 플래닝에서의 일관성이 향상된다.
- 멀티티처 온폴리시 증류를 도입해 도메인별 교사 모델로부터 전문성을 전수하는 파이프라인을 구성한 점이 차별화 요소이다. 온폴리시 방식은 교사와 학생 간의 행동 분포 불일치를 줄이며 실제 에이전트 행동에 맞춘 지식 전이를 가능하게 한다. 이로 인해 서로 다른 도메인 간의 이질성을 인식하는 최적화가 가능해졌다.
- 배포 측면에서는 GGUF 양자화 아티팩트를 제공해 로컬 및 경량 서빙 환경에서 모델을 바로 운영할 수 있게 한 점이 실용적 차별화 요소다. 이 형태는 대규모 모델의 추론 자원 요구를 낮추고 vLLM, SGLang 같은 서빙 엔진과의 직접 호환성을 지원해 운영 부담을 줄인다. 따라서 연구용 성능과 실무 운영성 사이의 균형을 맞춘 배포 전략을 취하고 있다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| Seal‑0 | score | 56.4 | — |
| HiPhO | score | 46.4 | — |
| FrontierScience‑Olympiad | score | 79.0 | — |
| FrontierScience‑Research | score | 40.0 | — |
| IFBench | score | 80.6 | — |
| IFEval | score | 94.8 | — |
이미지 분석
102
Likes
43k
Downloads
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.