thomsonreuters/Thomson-1.0-Small
법률·세무·저널리즘에 맞춘 35B MoE Continual Learning 모델
학습 방식 · Snowdon1.1-Small을 기반으로 Constitutional DPO, Continual pre-training, model merging, Direct Preference Optimisation과 reinforcement learning을 순차 적용했으며, Thomson Reuters의 전문 문서와 Public AI Constitution을 학습 자료로 사용했습니다.
TL;DR
Thomson-1.0-Small은 Snowdon1.1-Small에서 출발해 Qwen3.6-35B-A3B 구조를 재활용하고, Constitutional DPO·Continual pre-training·reinforcement learning을 거친 전문 업무 특화 Continual Learning 모델입니다. 전체 35B 중 3B만 활성화하는 Mixture-of-Experts 구조와 262,144 토큰 컨텍스트를 사용하며, Thomson Reuters의 법률·세무·뉴스 자료를 지식과 선호 학습에 활용했습니다. 법률·세무·일반 에이전트 평가에서 강점을 보이며 Overall Avg. 74.6점, 세무 Domain Avg. 82.6점, Legal Deep Research 85.0점을 기록했습니다. 반면 Coding 37.4점과 Multilingualism 71.9점은 범용 개발·다국어 용도에서 추가 검증이 필요한 수치입니다.
핵심 포인트
- Snowdon1.1-Small을 기반으로 Qwen3.6-35B-A3B 구조를 활용한 Continual Learning 모델입니다. 전체 35B 파라미터 중 3B만 활성화하는 Mixture-of-Experts 방식으로 작동합니다. BF16 가중치와 262,144 토큰 컨텍스트를 지원합니다.
- 19T 토큰 이상에서 선별한 200B 토큰을 Continual pre-training에 사용했습니다. proprietary 문서, synthetic rephrasing, 일반 능력 replay 데이터를 거의 같은 비중으로 구성했습니다. 법률·세무·뉴스·계약·판례 자료를 전문 지식 학습에 활용했습니다.
- Constitutional DPO와 reinforcement learning을 결합해 Public AI Constitution에 맞춰 가치와 행동을 조정했습니다. IRAC 같은 도메인 ontology와 전문가 작성 선호 데이터를 후속 학습에 사용했습니다. Deep Research harness에서는 도구 사용과 인용 정확도를 보상 대상으로 삼았습니다.
- 전체 평균 74.6점으로 Snowdon-1.1-Small과 Qwen3.6-35B-A3B의 71.7점을 앞섰습니다. 문서 처리·RAG는 78.8점, 세무 Domain Avg.는 82.6점, 법률 에이전트 평가는 73.4점입니다. 다만 법률 일반 벤치마크와 다국어 성능에서는 일부 비교 모델보다 낮은 점수를 기록했습니다.
제한사항
- Polyform Strict 1.0.0 라이선스가 적용되어 사용 목적과 배포 조건을 먼저 확인해야 합니다. README는 라이선스 전문을 준수하도록 요구하지만 구체적인 허용 범위를 이 모델 카드에서 모두 풀어 쓰지는 않습니다. 상업적 배포나 제품 통합에서는 원문 조건과 별도 법률 검토가 필요합니다.
- 전문 업무 성능이 모든 일반 능력에서 동일하게 높은 것은 아닙니다. Coding 점수는 37.4점으로 Qwen3.6-35B-A3B의 39.8점보다 낮고, Multilingualism 점수는 71.9점으로 Gemma 4-31B의 79.4점과 Haiku 4.5의 85.8점보다 낮습니다. 범용 코딩이나 다국어 서비스의 주력 모델로 선택할 때는 별도 평가가 필요합니다.
- 벤치마크 결과는 중간 reasoning effort와 특정 평가 하네스 조건에서 산출됐습니다. Deep Research 점수는 completeness 약 40%, factuality 약 35%, relevance 약 20%, coherence 약 5%의 가중 합산이며 planner-worker-reporter 구조와 도구 접근을 전제로 합니다. 실제 애플리케이션의 프롬프트, 검색 품질, 도구 연결 방식에 따라 결과가 달라질 수 있습니다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| Overall Avg. | score | 74.6 | Snowdon-1.1-Small 71.7, Qwen3.6-35B-A3B 71.7, Gemma 4-31B 71.2, Haiku 4.5 68.2 |
| Doc. Processing & RAG | score | 78.8 | Snowdon-1.1-Small 71.2, Qwen3.6-35B-A3B 74.7, Gemma 4-31B 76.6, Haiku 4.5 43.8 |
| Deep Research · Legal | score | 85.0 | Snowdon-1.1-Small 80.0, Qwen3.6-35B-A3B 82.0, Gemma 4-31B 74.0, Haiku 4.5 80.0 |
| Deep Research · Tax | score | 78.6 | Snowdon-1.1-Small 68.0, Qwen3.6-35B-A3B 68.0, Gemma 4-31B 75.0, Haiku 4.5 62.0 |
| Tax Q&A | score | 86.6 | Snowdon-1.1-Small 85.2, Qwen3.6-35B-A3B 86.2, Gemma 4-31B 84.5, Haiku 4.5 79.4 |
| Harvey Legal Agent Bench. | score | 73.4 | Snowdon-1.1-Small 71.5, Qwen3.6-35B-A3B 69.5, Gemma 4-31B 34.2, Haiku 4.5 60.5 |
| Political Neutrality | score | 98.5 | Snowdon-1.1-Small 91.5, Qwen3.6-35B-A3B 78.5, Gemma 4-31B 91.5, Haiku 4.5 92.0 |
| Long Context | score | 74.1 | Snowdon-1.1-Small 73.8, Qwen3.6-35B-A3B 73.8, Gemma 4-31B 69.4, Haiku 4.5 67.4 |
| General Agent | score | 85.8 | Snowdon-1.1-Small 81.4, Qwen3.6-35B-A3B 80.3, Gemma 4-31B 72.9, Haiku 4.5 59.7 |
| Factuality | score | 61.1 | Snowdon-1.1-Small 59.3, Qwen3.6-35B-A3B 58.8, Gemma 4-31B 57.6, Haiku 4.5 56.8 |
113
LIKES
214
DOWNLOADS
0 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.