본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

internlm/Intern-S2-Preview-397B

이미지-텍스트 통합 이해 및 생성, 긴 문맥 기반 텍스트 추론, 과학적 멀티모달 질문응답과 분자·재료 생성 같은 특화된 과학 태스크, 도구 호출을 포함한 에이전트 상호작용을 수행한다.397B256K 컨텍스트apache-2.0

Intern-S2-Preview-397B는 과학 문헌 원문과 시각 정보를 결합해 학습한 397B 규모의 멀티모달 파운데이션 모델로 장문 추론과 에이전트 툴 호출을 지원한다.

학습 방식 · Vision-Language 프리트레이닝으로 과학 문헌의 페이지 수준 이미지와 텍스트를 공동 학습하고, 그 위에 대규모 다중태스크 강화학습 및 장기 에이전트 강화학습을 결합해 일반 추론과 과학적 생성 능력, 장기 계획 능력을 동시에 확장했다.

TL;DR

Intern-S2-Preview-397B는 과학 문헌의 원문 페이지와 시각 정보를 함께 학습하는 Vision-Language 프리트레이닝을 기반으로 대규모 다중태스크 강화학습과 장기 에이전트 강화학습을 결합한 397B 규모의 멀티모달 파운데이션 모델이다. 이 모델은 텍스트 추론에서 최대 256K 토큰, 멀티모달 입력에서 64K 토큰의 긴 컨텍스트를 지원하며 도구 호출과 에이전트 프레임워크 연동을 통해 외부 API와의 결합 작업을 수행할 수 있다. 공개된 벤치마크 표에서는 MMLU Pro, HMMT-2026, 여러 과학 벤치마크에서 경쟁력 있는 점수를 기록해 과학적 추론과 생성 과제에서 강점을 보였으나 README에는 상세한 저수준 학습 데이터 목록이나 전체 하이퍼파라미터가 완전하게 공개되어 있지 않아 재현성 관점에서는 추가 정보가 필요하다.

핵심 포인트

  • 원문 페이지 수준의 Vision-Language 프리트레이닝을 통해 이미지와 텍스트를 중간 파싱 없이 공동 인코딩한다.
  • 20개 이상의 과학 도메인을 대상으로 한 다중태스크 강화학습을 결합해 과학적 생성과 추론 능력을 동시 향상시켰다.
  • 장기 에이전트 강화학습을 위한 샌드박스 환경과 에이전트 프레임워크 연동을 통해 장기 계획 능력과 에이전트 통합성을 높였다.
  • 텍스트 추론에서 256K 토큰, 멀티모달에서 64K 토큰이라는 긴 컨텍스트 지원을 명시해 장문 및 문서급 처리에 초점을 맞추었다.

벤치마크

벤치마크지표비교
MMLU Proaccuracy89.75
SimpleQA-Verifiedaccuracy69.90
AdvancedIFaccuracy74.44
HMMT-2026accuracy91.57
MMMU Proaccuracy80.46
ChartQAProaccuracy69.65
SkillsBenchscore50.03
TerminalBench 2.1score67.42
SWE-Bench-Proscore61.56
SWE-Bench-Multilingualscore81.67
Biology-Instructionsscore56.92
Mol-Instructionsscore52.37
MolecularIQscore61.49
SciReasonerscore63.97
TOMG-Benchscore65.66
MP20score67.88
ProteinBinder-9score4.36
XLRS-Benchscore51.97
MicroVQAscore68.81
SFEscore61.67
ObsCrisis-Benchscore26.07
SciCodescore49.11
SGI-Benchscore49.37
ResearchClawBenchscore18.44

이미지 분석

일반 태스크 성능 표로, 다양한 모델들에 대한 MMLU Pro, SimpleQA-Verified, AdvancedIF 등 일반 벤치마크 성적을 비교해 보여준다.
표는 Intern-S2-Preview-397B의 일반 태스크 성능을 수치로 제시하며 MMLU Pro 89.75, HMMT-2026 91.57 등 주요 항목에서 높은 점수를 표시한다. 각 행은 특정 벤치마크를 나타내고 컬럼은 비교 모델들을 나열해 공개 모델군 내 상대 위치를 파악할 수 있게 구성되어 있다. 이 이미지는 README의 성능 주장 근거로 사용된 원자료로, 수치 기반 비교와 모델별 강·약점을 한눈에 확인할 수 있다.
과학 분야 태스크 성능 표로, 생물학·분자·재료 생성 및 멀티모달 과학 벤치마크 결과를 비교해 보여준다.
이미지는 Biology-Instructions, MolecularIQ, SciReasoner 등 과학 전용 벤치마크에서 모델 성능을 수치화해 제시하며 Intern-S2-Preview-397B의 상대적 우위를 확인할 수 있다. 특히 분자·재료 생성 계열에서 높은 점수가 눈에 띄며 이는 다중태스크 강화학습과 과학 문헌 중심 프리트레이닝의 효과를 시사한다. 이 표는 과학적 생성·추론에서의 모델 강점을 근거로 삼는 자료로 활용된다.

60

LIKES

233

DOWNLOADS

1 / 0

조회수

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.