inclusionAI/LLaDA2.2-flash
삭제·삽입 편집 토큰을 도입한 디퓨전 언어모델로 에이전트 벤치마크에서 동급보다 처리량이 훨씬 빠르다.
학습 방식 · MoE 디퓨전 아키텍처를 CPT→SFT까지 거친 뒤, 에이전트 환경 보상을 편집 정책에 직접 반영하는 L-EBPO(Levenshtein Editing ELBO 기반 블록 정책 최적화)로 마무리했다.
TL;DR
LLaDA2.2-flash는 100B(비임베딩) 파라미터 MoE 디퓨전 언어모델에 DELETE·INSERT 편집 토큰(Levenshtein Editing)을 도입해, 생성 중 병렬로 시퀀스를 고쳐 쓸 수 있게 한 에이전트 지향 모델이다. 128K 컨텍스트에서 MoE 전문가 활성화를 디퓨전 블록 단위로 제한하는 Block Routing과, 에이전트 환경 보상으로 편집 정책을 학습하는 L-EBPO 강화학습을 결합했다. 동일 평가 설정에서 τ²-Bench(80.33 vs 76.36), MCP-Atlas(46.21 vs 41.12)는 Ling-2.6-flash를 앞섰지만 SWE-bench Verified(49.28 vs 61.20)와 BFCL-V4(60.78 vs 66.81)는 뒤처져, 벤치마크별로 우열이 갈린다. 반면 처리량은 SWE-bench Verified 519 TPS, BFCL-V4 703.82 TPS로 Ling-2.6-flash(각각 303.2, 331.5)의 약 1.7~2배에 달해, 품질보다 속도에서 뚜렷한 우위를 보였다. SGLang 서빙을 권장하며, 도구 호출 결과를 반복적으로 고쳐 써야 하는 장문 에이전트 워크로드에 맞춰져 있다.
핵심 포인트
- τ²-Bench 80.33·MCP-Atlas 46.21은 Ling-2.6-flash보다 높고 SWE-bench·BFCL-V4는 낮다.
- 처리량은 SWE-bench Verified 519 TPS, BFCL-V4 703.82 TPS로 Ling-2.6-flash의 약 1.7~2배다.
- DELETE·INSERT 편집 토큰으로 디퓨전 생성 중 시퀀스를 고쳐 써 다중 턴 도구 사용에 유리하다.
- MoE 전문가 활성화를 디퓨전 블록 단위로 묶는 Block Routing으로 128K 컨텍스트를 감당한다.
제한사항
- SWE-bench Verified·SWE-bench Multilingual·BFCL-V4처럼 코드·도구 호출 정밀도를 요구하는 벤치마크에서는 Ling-2.6-flash보다 점수가 낮다.
- SGLang 서빙 지원이 아직 준비 중(coming soon)이라 README 시점 기준으로는 권장 배포 경로가 완전히 갖춰지지 않았다.
- 낮은 threshold로 속도를 올리면 반복이나 불안정한 출력이 늘어날 수 있다고 README가 직접 경고한다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| τ²-Bench | score | 80.33 | Ling-2.6-flash 76.36 |
| SWE-bench Verified | score | 49.28 | Ling-2.6-flash 61.20 |
| BFCL-V4 | score | 60.78 | Ling-2.6-flash 66.81 |
| SWE-bench Verified | throughput (TPS) | 519.0 | Ling-2.6-flash 303.2 TPS |
| BFCL-V4 | throughput (TPS) | 703.82 | Ling-2.6-flash 331.5 TPS |
65
LIKES
445
DOWNLOADS
0 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.