본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

inclusionAI/LLaDA2.2-flash

장문 에이전트 대화·도구 사용을 위한 텍스트 생성 (디퓨전 디코딩 + Levenshtein 편집)100B (비임베딩)125K 컨텍스트apache-2.0

삭제·삽입 편집 토큰을 도입한 디퓨전 언어모델로 에이전트 벤치마크에서 동급보다 처리량이 훨씬 빠르다.

학습 방식 · MoE 디퓨전 아키텍처를 CPT→SFT까지 거친 뒤, 에이전트 환경 보상을 편집 정책에 직접 반영하는 L-EBPO(Levenshtein Editing ELBO 기반 블록 정책 최적화)로 마무리했다.

TL;DR

LLaDA2.2-flash는 100B(비임베딩) 파라미터 MoE 디퓨전 언어모델에 DELETE·INSERT 편집 토큰(Levenshtein Editing)을 도입해, 생성 중 병렬로 시퀀스를 고쳐 쓸 수 있게 한 에이전트 지향 모델이다. 128K 컨텍스트에서 MoE 전문가 활성화를 디퓨전 블록 단위로 제한하는 Block Routing과, 에이전트 환경 보상으로 편집 정책을 학습하는 L-EBPO 강화학습을 결합했다. 동일 평가 설정에서 τ²-Bench(80.33 vs 76.36), MCP-Atlas(46.21 vs 41.12)는 Ling-2.6-flash를 앞섰지만 SWE-bench Verified(49.28 vs 61.20)와 BFCL-V4(60.78 vs 66.81)는 뒤처져, 벤치마크별로 우열이 갈린다. 반면 처리량은 SWE-bench Verified 519 TPS, BFCL-V4 703.82 TPS로 Ling-2.6-flash(각각 303.2, 331.5)의 약 1.7~2배에 달해, 품질보다 속도에서 뚜렷한 우위를 보였다. SGLang 서빙을 권장하며, 도구 호출 결과를 반복적으로 고쳐 써야 하는 장문 에이전트 워크로드에 맞춰져 있다.

핵심 포인트

  • τ²-Bench 80.33·MCP-Atlas 46.21은 Ling-2.6-flash보다 높고 SWE-bench·BFCL-V4는 낮다.
  • 처리량은 SWE-bench Verified 519 TPS, BFCL-V4 703.82 TPS로 Ling-2.6-flash의 약 1.7~2배다.
  • DELETE·INSERT 편집 토큰으로 디퓨전 생성 중 시퀀스를 고쳐 써 다중 턴 도구 사용에 유리하다.
  • MoE 전문가 활성화를 디퓨전 블록 단위로 묶는 Block Routing으로 128K 컨텍스트를 감당한다.

제한사항

  • SWE-bench Verified·SWE-bench Multilingual·BFCL-V4처럼 코드·도구 호출 정밀도를 요구하는 벤치마크에서는 Ling-2.6-flash보다 점수가 낮다.
  • SGLang 서빙 지원이 아직 준비 중(coming soon)이라 README 시점 기준으로는 권장 배포 경로가 완전히 갖춰지지 않았다.
  • 낮은 threshold로 속도를 올리면 반복이나 불안정한 출력이 늘어날 수 있다고 README가 직접 경고한다.

벤치마크

벤치마크지표비교
τ²-Benchscore80.33Ling-2.6-flash 76.36
SWE-bench Verifiedscore49.28Ling-2.6-flash 61.20
BFCL-V4score60.78Ling-2.6-flash 66.81
SWE-bench Verifiedthroughput (TPS)519.0Ling-2.6-flash 303.2 TPS
BFCL-V4throughput (TPS)703.82Ling-2.6-flash 331.5 TPS

65

LIKES

445

DOWNLOADS

0 / 0

조회수

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.