과학문서와 장기 에이전트 작업에 최적화된 397B 멀티모달 모델
이미지-텍스트 통합 이해 및 생성, 긴 문맥 기반 텍스트 추론, 과학적 멀티모달 질문응답과 분자·재료 생성 같은 특화된 과학 태스크, 도구 호출을 포함한 에이전트 상호작용을 수행한다.397B256K 컨텍스트apache-2.0
Intern-S2-Preview-397B는 과학 문헌 원문과 시각 정보를 결합해 학습한 397B 규모의 멀티모달 파운데이션 모델로 장문 추론과 에이전트 툴 호출을 지원한다.
TL;DR
Intern-S2-Preview-397B는 과학 문헌의 원문 페이지와 시각 정보를 함께 학습하는 Vision-Language 프리트레이닝을 기반으로 대규모 다중태스크 강화학습과 장기 에이전트 강화학습을 결합한 397B 규모의 멀티모달 파운데이션 모델이다. 이 모델은 텍스트 추론에서 최대 256K 토큰, 멀티모달 입력에서 64K 토큰의 긴 컨텍스트를 지원하며 도구 호출과 에이전트 프레임워크 연동을 통해 외부 API와의 결합 작업을 수행할 수 있다. 공개된 벤치마크 표에서는 MMLU Pro, HMMT-2026, 여러 과학 벤치마크에서 경쟁력 있는 점수를 기록해 과학적 추론과 생성 과제에서 강점을 보였으나 README에는 상세한 저수준 학습 데이터 목록이나 전체 하이퍼파라미터가 완전하게 공개되어 있지 않아 재현성 관점에서는 추가 정보가 필요하다.
핵심 역량
- 문서 페이지와 포함된 그림을 함께 해석해 질문에 답하고 요약을 생성할 수 있으며, 원문 페이지 수준의 공간적·시맨틱 관계를 보존한 표현으로 표와 도표의 의미를 추출해 텍스트로 변환할 수 있다. 이러한 멀티모달 입력 처리는 이미지와 텍스트를 동시 인코딩하여 중간 파싱 단계 없이 직접 대응 관계를 유지함으로써 가능하다. 결과적으로 복합 과학 문서에서 표, 분자 구조, 계측 그래프 등을 텍스트 설명과 연동해 처리할 수 있다.
- 긴 문맥을 필요로 하는 텍스트 추론에서 최대 256K 토큰의 컨텍스트를 활용해 장기 의존성을 유지하며 추론을 진행할 수 있다. 이 기능은 장기 플래닝이나 긴 실험 절차, 복수 페이지 문서 요약에 유리하며 멀티모달 벤치마크에서 장문 성능을 확보하는 데 기여한다. 멀티모달 입력에 대해서는 64K 토큰까지 평가된 점이 명시되어 있어 이미지 포함 긴 문서 처리도 지원된다.
- 에이전트 연동을 위해 함수 호출형 Tool Calling과 외부 에이전트 프레임워크 연동을 지원하며, OpenAI-호환 API 및 LMDeploy/vLLM/SGLang을 통해 자체 배포 환경과 호환된다. 모델은 thinking mode를 기본 활성화하여 내부적 추론 과정을 강화하고 이를 요청별로 끄거나 켤 수 있게 하여 에이전트 별 요구에 맞춰 반응 방식을 조정할 수 있다. 이러한 도구 통합은 외부 계산, 데이터베이스 조회, 시뮬레이션 호출 같은 워크플로를 모델 응답에 결합할 때 유용하다.
- 다중 과학 도메인에서의 강화학습을 통해 생체분자 상호작용 설계와 재료 구조 생성 같은 전문화된 생성 과제를 수행할 수 있으며, 여러 도메인의 강화학습 태스크를 공동 학습한 결과로 도메인 간 전이 성능이 개선되었다고 명시되어 있다. 이 접근은 단일 도메인에 국한된 튜닝 대신 범용적 과학 추론 능력을 끌어올리려는 목적을 갖는다. 결과적으로 일반 추론과 과학적 생성 모두에서 경쟁력 있는 성능을 보인다.
강점
- 공개된 벤치마크 표에 따르면 일반 추론(예: MMLU Pro 89.75)과 고등수학 경시(HMMT-2026 91.57) 등에서 높은 점수를 기록해 공개 모델군 가운데 우수한 성능을 보인다. 이러한 수치적 우위는 대규모 멀티모달 프리트레이닝과 다중태스크 강화학습의 결합으로 전문적 과학 태스크에 특화된 표현을 학습한 결과로 해석할 수 있다. 또한 256K 토큰의 긴 컨텍스트 처리를 공식적으로 지원해 장문 추론과 연속적 에이전트 작업에서 실용적 이점을 제공한다.
- 도구 호출과 에이전트 통합을 염두에 둔 설계로 LMDeploy, vLLM, SGLang 등 상용 추론 스택과 호환되며 OpenAI-호환 API를 통해 Claude Code 같은 외부 에이전트와도 연동이 가능하다. 이로 인해 자체 호스팅과 API 기반 서비스 양쪽에서 에이전트 워크플로를 실험하고 운영하기 쉬운 편의성을 확보했다. 라이선스가 Apache-2.0으로 명시되어 상업적 사용 가능성도 비교적 명확하다.
훈련 방식
Vision-Language 프리트레이닝으로 과학 문헌의 페이지 수준 이미지와 텍스트를 공동 학습하고, 그 위에 대규모 다중태스크 강화학습 및 장기 에이전트 강화학습을 결합해 일반 추론과 과학적 생성 능력, 장기 계획 능력을 동시에 확장했다.
알아두면 좋은 것
- 원문은 Vision-Language 프리트레이닝을 통해 과학 논문 페이지의 텍스트와 시각 정보를 중간 파싱 없이 공동 인코딩했다고 밝히며, 이를 통해 공간적 관계와 텍스트-이미지 대응성을 보존해 데이터 효율을 높였다고 명시되어 있다. 이러한 사전학습 패러다임은 표와 도표, 분자식 이미지 등 복합 시각 정보를 포함한 과학 문헌 처리에 초점을 맞춘다. 구현 관점에서 원문 이미지를 입력으로 직접 학습한 점이 차별 요소로 제시되어 있다.
- 대규모 다중태스크 강화학습과 장기 에이전트 강화학습을 결합해 20개 이상의 과학 도메인을 함께 학습했다고 밝히며, 그 결과 과학적 문제 해결과 장기 계획 과제에서 성능 향상을 달성했다고 표로 제시하고 있다. 에이전트 통합을 위해 OpenClaw, Hermes 등 에이전트 프레임워크와 호환 가능하도록 설계되었고 자체 호스팅 또는 공식 API 방식으로 배포할 수 있다. 평가에는 OpenCompass, VLMEvalKit, AgentCompass를 사용했다고 명시되어 있어 벤치마크 체인이 공개된 툴로 구성되어 있다.
- 텍스트 추론 용도로는 최대 256K 토큰, 멀티모달 용도로는 최대 64K 토큰의 추론 길이가 명시되어 있어 장문 및 문서급 멀티모달 입력을 처리하도록 구성되어 있다. 배포 측면에서는 LMDeploy, vLLM, SGLang 같은 추론 프레임워크와의 호환성을 강조하고 있으며, LMDeploy를 통한 타 에이전트(Claude Code 등) 연동 예시도 포함되어 있다. 또한 thinking mode의 온·오프 제어로 내부적 추론 강도를 조절할 수 있음을 보여준다.
- 모델은 Apache-2.0 라이선스를 명시하고 있어 상업적 활용과 재배포 조건이 비교적 명확하며, HuggingFace와 ModelScope 등 여러 저장소 링크와 데모 채널을 통해 접근성을 확보하고 있다. README에 포함된 샘플 코드와 배포 가이드는 자체 호스팅과 API 선택지를 모두 지원하도록 작성되어 있다. 다만 세부 학습 데이터 목록이나 전체 학습 파이프라인의 저수준 하이퍼파라미터는 README에서 완전하게 공개되어 있지 않다.
기술적 특징
- Vision-Language 프리트레이닝은 과학 문헌의 원문 페이지를 입력으로 사용해 텍스트와 시각적 요소를 중간 파싱 없이 공동 인코딩한다. 이 방식은 표와 도표, 분자 이미지에서 텍스트와 공간적 관계를 보존해 모델이 시각적 구성과 텍스트 의미를 직접 연결하도록 만든다. 결과적으로 시각-문맥 일치성과 데이터 효율이 향상되어 복합 문서 이해에서 이점을 제공한다.
- 대규모 다중태스크 강화학습을 20개 이상의 과학 도메인에 걸쳐 동시에 적용해 과학적 추론과 생성 능력을 강화했다. 서로 다른 과제의 보상 신호를 공유하면서 공통 표현과 정책을 학습함으로써 도메인 간 전이가 개선되었고, 이는 복합 과학 문제 해결에서 성능 향상으로 이어졌다. 특히 분자 상호작용 설계와 재료 구조 생성 같은 전문화된 생성 태스크에서의 성과가 강조되었다.
- 장기 에이전트 강화학습을 위해 다수의 샌드박스 환경과 에이전트 프레임워크를 연결해 블랙박스형 에이전트 학습을 수행했다. 이 구성은 장기 플래닝과 도구 호출을 포함하는 시나리오에서 일반화 능력을 끌어올려 장기 과업 수행 능력의 상한을 높이는 데 목적이 있다. 에이전트 연동을 위한 표준화된 API와 툴 호출 파이프라인도 함께 제공되어 실제 에이전트 워크플로에 통합하기 용이하다.
- 긴 컨텍스트 처리를 위해 텍스트 추론에서 최대 256K 토큰, 멀티모달에서 64K 토큰을 공식적으로 지원하도록 구성해 장문 문서와 복합 멀티모달 입력을 처리 가능하게 설계되었다. 이 설계는 긴 실험 절차나 연속적 이벤트를 요구하는 과학적 분석에서 의미 있는 이점을 제공한다. 다만 실제 배포 환경에서는 메모리·추론 비용을 고려한 최적화가 필요하다.
차별점
- 원문 페이지 수준의 Vision-Language 프리트레이닝을 통해 이미지와 텍스트를 중간 파싱 없이 공동 인코딩한다.
- 20개 이상의 과학 도메인을 대상으로 한 다중태스크 강화학습을 결합해 과학적 생성과 추론 능력을 동시 향상시켰다.
- 장기 에이전트 강화학습을 위한 샌드박스 환경과 에이전트 프레임워크 연동을 통해 장기 계획 능력과 에이전트 통합성을 높였다.
- 텍스트 추론에서 256K 토큰, 멀티모달에서 64K 토큰이라는 긴 컨텍스트 지원을 명시해 장문 및 문서급 처리에 초점을 맞추었다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| MMLU Pro | accuracy | 89.75 | — |
| SimpleQA-Verified | accuracy | 69.90 | — |
| AdvancedIF | accuracy | 74.44 | — |
| HMMT-2026 | accuracy | 91.57 | — |
| MMMU Pro | accuracy | 80.46 | — |
| ChartQAPro | accuracy | 69.65 | — |
| SkillsBench | score | 50.03 | — |
| TerminalBench 2.1 | score | 67.42 | — |
| SWE-Bench-Pro | score | 61.56 | — |
이미지 분석


60
Likes
233
Downloads
0 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.