Levenshtein 편집과 128K 컨텍스트를 결합한 에이전트형 MoE 디퓨전 모델
Levenshtein Editing 제어 토큰과 블록 라우팅 MoE를 사용해 128K 장문 에이전트 워크로드에서 병렬 편집과 고처리량 추론을 목표로 한 디퓨전 언어모델이다.
TL;DR
LLaDA2.2-flash는 MoE 기반의 디퓨전 언어모델에 Levenshtein Editing(DELETE·INSERT) 제어 토큰과 블록 라우팅을 결합해 128K 토큰 길이의 장문 에이전트 워크로드에서 병렬 편집과 높은 처리량을 목표로 설계된 모델이다. 생성 과정에서 편집 토큰을 사용해 중복을 제거하고 삽입 슬롯을 만들며, ELBO 기반의 블록 수준 정책 최적화(L-EBPO)는 환경 보상을 이용해 편집 정책을 학습하여 다중 턴 도구 사용 중 오류 정정 능력을 향상시킨다. README의 벤치마크와 TPS 표는 동일 평가 설정에서 LLaDA2.2-flash가 전반적으로 더 높은 처리량을 기록했음을 보여주지만 일부 에이전트 벤치마크 점수는 Ling-2.6-flash보다 낮아 품질과 처리량 간 트레이드오프가 존재함을 시사한다. 배포 권장은 SGLang 서빙을 통해 128K 컨텍스트와 MoE 디퓨전 추론 요건을 충족시키고 block_length·threshold 계열 파라미터로 속도-품질 균형을 튜닝하는 것이다.
핵심 역량
- 긴 문맥(128K) 기반의 텍스트 생성과 멀티턴 대화에서 토큰 편집을 수행할 수 있다. Levenshtein Editing 토큰으로 생성 중 DELETE·INSERT 연산을 병렬로 적용하여 반복·중복을 줄이고 구조적 수정을 수행한다. 이 과정은 도구 호출 결과를 후처리하거나 다중 응답을 통합할 때 유용하다.
- 에이전트적 보상 신호를 활용한 정책 업데이트로 편집 행동을 개선할 수 있다. L-EBPO는 환경 보상을 블록 수준 ELBO와 결합해 편집 정책의 성능을 향상시키며, 반복적 상호작용에서 오류 정정 능력을 제고한다. 따라서 장기적인 툴 사용 시 회복력(resilience)을 확보한다.
- MoE 기반 추론으로 처리량을 높이면서도 활성화 전문가 수를 블록 단위로 제한해 메모리 사용을 제어할 수 있다. Block Routing은 디퓨전 블록 내부에서만 전문가를 활성화하여 128K 컨텍스트에서도 확장성을 유지한다. 이로 인해 대규모 모델에서도 장문 입력 처리 시 실용적인 TPS를 확보한다.
- 디퓨전 언어모델의 편집 기반 디코딩을 통해 병렬 생성과 구조적 수정이 가능하다. 디퓨전 과정에서 삽입 슬롯을 만들고 불필요한 토큰을 삭제해 반복된 출력 패턴을 줄인다. 편집 토큰을 통해 생성과 편집을 같은 프레임워크에서 처리하므로 도구 체인의 중간 단계 조작이 자연스럽다.
강점
- 제공된 벤치마크와 TPS 표에서 LLaDA2.2-flash는 동일 환경 하에 보고된 수치 기준으로 Ling-2.6-flash보다 전반적으로 높은 처리량을 보였다. 예컨대 SWE-bench Verified에서 TPS는 519.0으로 보고되어 Ling의 303.2보다 큰 차이를 보였다. 이 수치는 블록 라우팅과 MoE의 블록 단위 활성화가 긴 컨텍스트에서 추론 효율을 개선한 결과로 해석된다.
훈련 방식
기반은 MoE 디퓨전 언어모델이며 Levenshtein Editing을 포함한 CPT→SFT→L-EBPO(ELBO 기반 블록 레벨 정책 최적화) 형태로 단계적 학습을 진행해 에이전트 트래젝토리와 토큰 스텝맵을 이용해 정책을 갱신했다.
알아두면 좋은 것
- 모델 사양으로 100B 비임베딩 파라미터, 32개 레이어, 32개 어텐션 헤드를 명시했고 128K 컨텍스트를 기본 지원한다. 이 스펙은 장문 에이전트 작업과 고용량 토큰 흐름을 전제로 설계된 점을 드러낸다.
- Levenshtein Editing은 DELETE와 INSERT 제어 토큰을 도입해 디퓨전 디코딩에서 편집을 지원하며, L-EBPO로 에이전트 환경 보상을 이용한 편집 정책 학습을 결합했다. 이로 인해 다중 턴 도구 사용과 오류 교정이 목표임이 분명하다.
- 벤치마크 표는 SWE-bench 계열과 τ²-Bench, Claw-Eval, PinchBench, MCP-Atlas, BFCL-V4를 포함하며 LLaDA2.2-flash의 TPS가 Ling-2.6-flash보다 전반적으로 높게 보고되었다. 평가 환경은 128K 컨텍스트, temperature=1.0, block_length=32, threshold=0.5, editing_threshold=0.0으로 일관되게 설정되었다.
- SGLang을 권장 서빙 백엔드로 명시했으며 MTP 관련 설정과 Speed/Quality 모드 튜닝을 권장한다. 중국 본토 사용자는 ModelScope 링크를 별도 안내받도록 표기되어 있다.
기술적 특징
- MoE 디퓨전 아키텍처는 디퓨전 기반 디코딩과 전문가 라우팅을 결합해 대규모 파라미터를 갖는 모델에서 처리량과 확장성을 확보한다. 입력을 디퓨전 블록 단위로 분할하고 블록 라우팅으로 활성 전문가를 제한하여 긴 컨텍스트에서 메모리와 연산 비용을 제어한다. 이 설계는 128K 토큰 길이에서 실용적 TPS를 유지하는 데 핵심 역할을 한다.
- Levenshtein Editing은 DELETE와 INSERT 토큰을 생성 과정에 도입해 시퀀스 구조를 직접 편집하는 방식을 제공한다. 디퓨전 단계에서 삽입 슬롯을 만들고 중복 또는 불필요한 토큰을 삭제함으로써 병렬 편집이 가능해지고, 툴 호출 결과를 중간에 정제하는 워크플로에서 오류를 줄인다. 편집 토큰은 구조적 수정과 반복 제거를 하나의 생성 루프 안에서 수행하게 한다.
- L-EBPO는 편집 동작을 에이전트적 보상으로 학습하는 ELBO 기반의 블록 수준 정책 최적화 기법으로, 환경으로부터 얻는 보상을 사용해 편집 정책을 갱신한다. 이 방법은 에이전트 트래젝토리와 토큰 스텝맵을 입력으로 받아 정책 파라미터를 업데이트하므로 다중 턴 도구 상호작용에서 편집 정확도가 향상된다. 정책 학습은 디퓨전 편집 단계와 통합되어 생성-편집 루프의 성능을 직접 개선한다.
- 128K 컨텍스트 지원과 RoPE 사용은 긴 문맥에서 위치 정보를 보존하면서 편집 연산을 가능하게 한다. RoPE는 상대적·절대적 위치 정보를 안정적으로 유지해 편집 후 문맥 일관성을 확보한다. 장문 대화나 긴 문서 편집 시 위치 기반 오류를 줄이는 데 기여한다.
- 운영 측면에서는 SGLang과의 통합을 권장해 장문 에이전트 워크로드의 서빙을 최적화하도록 설계되었으며, inference 파라미터(block_length, threshold, editing_threshold)를 튜닝해 속도와 품질 간 트레이드오프를 조정할 수 있다. 이러한 설정은 MTP 사용 여부와 draft token 수 같은 서빙 옵션과 결합되어 실제 배포 성능에 영향을 준다.
차별점
- 디퓨전 언어모델 프레임워크에 Levenshtein Editing 토큰을 결합해 생성과 편집을 동일한 루프에서 수행할 수 있게 한 점이 차별화 요소이다.
- 블록 라우팅을 통한 MoE 전문가 활성화 제어로 128K 컨텍스트에서 실용적인 처리량을 확보하도록 설계된 점이 경쟁 모델과 구별된다.
- ELBO 기반의 블록 수준 정책 최적화(L-EBPO)를 도입해 에이전트 환경 보상을 편집 정책 학습에 직접 반영한 점이 작동상의 차별점을 만든다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| SWE-bench Verified | score | 49.28 | vs Ling-2.6-flash: 61.20 (Ling score sourced from Ling and Ring 2.6 Technical Report) |
| SWE-bench Pro | score | 30.10 | vs Ling-2.6-flash: 31.88 (Ling evaluated with OpenHands in its report; this model used Claude Code scaffold) |
| SWE-bench Multilingual | score | 25.00 | vs Ling-2.6-flash: 33.73 |
| τ²-Bench | score | 80.33 | vs Ling-2.6-flash: 76.36 |
| Claw-Eval | score | 64.22 | vs Ling-2.6-flash: 64.56 |
| PinchBench | score | 81.66 | vs Ling-2.6-flash: 81.30 |
| MCP-Atlas | score | 46.21 | vs Ling-2.6-flash: 41.12 |
| BFCL-V4 | score | 60.78 | vs Ling-2.6-flash: 66.81 |
이미지 분석
65
Likes
445
Downloads
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.