본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

WeiboAI/VibeThinker-3B

수학·코딩·검증 가능한 추론 중심의 텍스트 생성 및 문제 풀이, 대화형 지시 준수와 형식 검증이 가능한 추론 태스크3B64K 컨텍스트mit

VibeThinker-3B는 Qwen2.5-Coder-3B 기반의 3B 파라미터 모델로 SSP 기반 SFT+RL+자기증류 파이프라인과 CLR 테스트타임 스케일링으로 검증 가능한 추론 벤치에서 최상위권 성능을 달성했다.

학습 방식 · 모델은 Qwen/Qwen2.5-Coder-3B를 기반으로 한 후속 튜닝 모델이며 Spectrum-to-Signal Principle(SSP)을 중심으로 설계된 파이프라인을 사용했다. 파이프라인은 커리큘럼 기반의 두 단계 SFT로 넓은 해법 스펙트럼을 구축한 뒤 MaxEnt-Guided Policy Optimization을 포함한 RL로 올바른 해법 신호를 증폭하고, 이후 고품질 궤적을 오프라인 자기증류로 학생 모델에 재주입하는 방식으로 구성되었다. 마지막으로 규칙 기반 밸리데이터와 루브릭 보상 모델을 활용한 Instruct RL을 통해 사용자 지시 준수성과 출력 포맷 일관성을 개선했다.

TL;DR

VibeThinker-3B는 Qwen2.5-Coder-3B를 기반으로 한 3B 파라미터 규모의 모델로 Spectrum-to-Signal 원리에 따라 커리큘럼 SFT, MGPO 기반 RL, 오프라인 자기증류, Instruct RL을 순차적으로 적용해 검증 가능한 수학·코드 추론 성능을 끌어올린 모델이다. IMO-AnswerBench에서 기본 76.4점을 기록했고 Claim-Level Reliability Assessment 적용 시 80.6점으로 상승했으며 LeetCode 실전 평가에서 123/128 첫시도 통과(96.1%)를 보고해 경쟁형 코딩 문제에서도 높은 실용성을 보였다. 학습 파이프라인과 테스트타임 신뢰도 보정이 작은 모델의 성능을 대형 모델 수준의 범위로 확장시키는 핵심 메커니즘으로 작동했으며 다만 툴 호출이나 에이전트 오케스트레이션 용도로의 사용은 README에서 권장되지 않는다.

핵심 포인트

  • 모델은 파라미터 규모가 작음에도 검증 가능한 추론 벤치에서 대형 모델과 유사한 성능 범위에 도달한 점이 차별화 요소이다. README에서 제시된 표와 그래프는 SSP 기반 파이프라인과 CLR 같은 테스트타임 보정이 작은 모델의 성능을 크게 끌어올렸음을 보였다. 이 접근은 단순한 파라미터 확장 대신 신호의 구조적 증폭을 통해 성능을 확보하는 전략이라는 점에서 특징적이다.
  • 학습 파이프라인이 커리큘럼 SFT, MGPO 기반 RL, 오프라인 자기증류, Instruct RL을 연속적으로 결합한 점이 설계적 차별점이다. 각 단계는 역할이 분명하게 구분되어 있으며 특히 RL에서 얻은 고품질 궤적을 증류로 다시 주입하는 루프가 성능 안정성에 기여했다. 이러한 다단계 파이프라인 구성은 검증 가능한 추론 과제에서 작은 모델이 높은 신뢰도의 출력을 내도록 설계된 점에서 독특하다.
  • Claim-Level Reliability Assessment(CLR)를 테스트타임 스케일링으로 채택해 각 주장 단위의 신뢰도를 평가하고 결과 선택에 반영한 점이 실용적 차별점이다. CLR 적용 시 특정 벤치에서 점수 향상이 보고되어 실제 배포 환경에서 신뢰도 기반 후처리를 통한 성능 개선 가능성을 보여주었다. 이 방법은 특히 정답 검증 신호가 존재하는 과제에서 효율적인 성능 보강 수단으로 작동한다.
  • 작은 파라미터 규모(3B)에도 불구하고 검증 가능한 수학·코드 추론 벤치에서 상위권 성능을 보였다. README와 제공된 표에서 IMO-AnswerBench 76.4점, AIME/HMMT 등에서 고득점을 기록해 대형 모델의 성능 범위에 근접하는 결과가 보고되었다. 이러한 성과는 파라미터 규모보다 학습 신호의 구조화와 검증 가능한 보상 설계가 성능에 강한 영향을 미칠 수 있음을 시사한다.

벤치마크

벤치마크지표비교
IMO-AnswerBenchscore76.4CLR 적용 시 80.6; 비교 모델 예시로 DeepSeek V3.2 78.3, GLM-5 82.5, Kimi K2.5 81.8
LeetCode contests acceptancefirst-attempt acceptance rate96.1%123/128 첫시도 통과로 계산된 비율
AIME25score91.4정렬된 벤치 표에서 상위권 성능으로 보고
HMMT25score89.3대형 레퍼런스 모델의 점수 범위에 근접

이미지 분석

여러 벤치(AIME25, AIME26, LiveCodeBench v6, IMO-AnswerBench, HMMT25, IFBench)에서 VibeThinker-3B와 복수의 1등급 모델들을 비교한 막대그래프가 포함되어 있다. 그림에서 VibeThinker-3B는 일부 수학·코딩 벤치에서 상위권에 위치하며 CLR 보정이 적용된 경우 성능이 눈에 띄게 상승한 막대를 추가로 보여준다. 해당 시각화는 작은 모델이 검증 가능한 벤치에서 경쟁력 있는 위치를 점할 수 있음을 시각적 근거로 제시한다.
그래프는 VibeThinker-3B의 기본 점수와 CLR 적용 후 점수를 나란히 표시해 테스트타임 신뢰도 보정의 효과를 비교할 수 있게 설계되었다. 각 벤치에서 비교 대상으로 제시된 모델들은 Qwen3.6 Plus, Gemini 3 Pro, GLM-5, Kimi K2.5 등으로 표시되어 있어 상대적 위치를 직접 확인할 수 있다. 이 이미지는 README 본문에서 언급된 수치들과 일관되며 벤치별 점수 분포와 CLR의 영향력을 직관적으로 전달한다.
성능 대 스케일을 보여주는 가로 막대그래프가 포함되어 있고 VibeThinker-3B가 파라미터 수 대비 높은 IMO-AnswerBench 점수를 기록한 항목이 강조되어 있다. 그래프에는 다른 모델들의 파라미터 규모와 점수가 함께 나열되어 있어 효율성 비교가 가능하다. 이 이미지는 작은 모델이 큰 모델 대비 파라미터 효율성이 높다는 주장을 수치와 함께 시각화한 자료이다.
이미지는 모델별 파라미터 수와 IMO-AnswerBench 점수를 병렬로 보여주어 성능 대비 스케일의 불균형을 강조한다. VibeThinker-3B는 3B 파라미터로 76.4점을 기록했고 일부 대형 모델과 유사한 점수대를 형성하는 것으로 표시되어 파라미터 대비 성능 효율을 드러낸다. 이 시각적 자료는 README 텍스트에서 제시된 Parametric Compression-Coverage Hypothesis와 직접적으로 연결되어 작은 모델의 특정 역량이 파라미터 규모와 다른 의존성을 가진다는 주장에 근거를 제공한다.
모델의 종합 점수 표와 바 차트가 포함된 이미지로 AIME, HMMT, BruMO, IMO-AnswerBench 등 다양한 벤치에서의 수치가 나열되어 있다. 표에는 VibeThinker-3B의 여러 벤치 점수가 강조되어 있으며 일부 벤치에서 대형 모델과 근접한 순위를 보이는 것으로 표시되어 있다. 이 도표는 README의 표 형식 결과를 시각적으로 보완하는 역할을 한다.
이미지의 표는 VibeThinker-3B가 다수의 수학·코딩·지식 기반 벤치에서 고른 성능을 보였음을 수치로 확인하게 한다. 특히 AIME26과 같은 특정 벤치에서 높은 점수를 기록한 것이 눈에 띄며 이는 모델의 수학적 추론 능력에 대한 근거로 사용되었다. 도식은 단일 수치가 아닌 다중 벤치 종합 성능을 확인할 수 있게 구성되어 모델의 전반적 강점 분포를 보여준다.
CLR 적용 전후의 성능 차이를 강조한 그래프가 포함되어 있고 여러 벤치에서 CLR 적용 시 점수 상승이 표시되어 있다. 그래프는 특히 IMO-AnswerBench와 일부 수학 벤치에서 CLR의 정량적 효과를 시각적으로 제시한다. 이 이미지는 README에서 제시된 CLR 점수 향상 수치를 직접적으로 뒷받침한다.
CLR을 적용한 막대는 적용 전보다 확연히 높게 표시되어 테스트타임 신뢰도 보정이 성능 향상에 기여했음을 나타낸다. 그래프는 CLR이 모든 벤치에서 동일한 폭의 향상을 보이는 것이 아니라 검증 가능한 추론 벤치에서 더 큰 이득을 준다는 점을 시각적으로 드러낸다. 이미지의 구체적 수치는 README 본문과 일치하여 CLR 효과의 정량적 근거로 사용 가능하다.

757

LIKES

72.7k

DOWNLOADS

9 / 0

조회수

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.