본문으로 건너뛰기

Thinking Machines의 네이티브 인터랙션 모델과 실시간 음성 AI의 진보

Thinking Machines가 200ms 단위의 마이크로 턴 구조를 통해 실시간 멀티모달 상호작용을 구현한 TML-Interaction-Small 모델을 공개했습니다.

섹션별 상세

기존의 사용자 턴 종료 후 응답 생성 방식은 실시간 대화의 흐름을 방해하는 병목 현상을 초래했습니다. TML-Interaction-Small은 입력과 출력 토큰을 모두 스트림으로 처리하며 200ms 단위의 짧은 청크로 나누어 병렬적으로 처리합니다. 이를 통해 지연 시간을 극도로 낮추고 사용자의 말을 중간에 끊거나 동시에 반응하는 자연스러운 인터랙션을 구현했습니다.
인간의 지각 흐름과 모델의 토큰 시퀀스 처리 방식을 비교한 다이어그램
Diagram인간은 입력과 출력을 동시에 인지하는 반면, 모델은 200ms 단위로 쪼개진 입력과 출력 토큰을 하나의 시퀀스로 교차 배치하여 처리함을 보여줍니다. 이 구조가 어떻게 실시간 동시성을 확보하는지 시각적으로 설명합니다.
근거
  • TML-Interaction-Small은 276B 파라미터 MoE 모델이며 12B의 활성 파라미터를 사용한다 본문 서두: TML-Interaction-Small is a 276B parameter MoE with 12B active
  • 200ms 단위의 시간 정렬 마이크로 턴을 통해 연속적인 인터랙션을 구현한다 The interaction model 섹션 및 Figure 3 설명
멀티모달 데이터를 처리할 때 각 모달리티별 인코더를 사용하는 방식은 시스템 복잡도와 지연을 증가시킵니다. 이 모델은 인코더가 없는 얼리 퓨전 아키텍처를 사용하여 이미지와 오디오 데이터를 단일 토큰 시퀀스로 통합하여 처리합니다. 이러한 설계는 모델이 시간 흐름을 인지하고 여러 입력 스트림을 동시에 이해할 수 있게 만듭니다.
로컬 추론 환경에서 모델의 효율성을 높이기 위한 MTP 기술이 Qwen 3.6 GGUF 빌드에 적용되었습니다. Unsloth는 MTP 레이어를 보존한 GGUF 모델을 공개했으나, 이를 실행하기 위해서는 표준 llama.cpp가 아닌 특정 PR 버전의 빌드가 필요합니다. 실제 사용자 테스트에서 메타데이터 파싱 오류나 런타임 어설션 실패가 보고되는 등 아직 기술적 안정화 단계에 있습니다.
최근 주목받았던 TurboQuant 기법이 실제 성능 면에서 회의적인 평가를 받기 시작했습니다. 독립적인 연구 결과에 따르면 TurboQuant는 정확도, 지연 시간, 처리량 측면에서 기대만큼의 성과를 내지 못하는 것으로 나타났습니다. vLLM 프로젝트와 Red Hat의 조사에서도 이 기법이 실질적으로 효과적이지 않다는 결론이 공유되며 인프라 기술의 독립적 검증 중요성이 강조되었습니다.

근거 모음

근거
  • 오픈 웨이트 모델의 성능 향상 속도가 무어의 법칙보다 빠른 10.7개월마다 두 배씩 증가하고 있다 Clement Delangue의 발언 인용 부분

기술

  • TML-Interaction-Small
  • Qwen 3.6
  • vLLM
  • llama.cpp
  • Unsloth

활용 사례

  • 실시간 음성 대화 에이전트
  • 지연 시간 없는 멀티모달 상호작용 시스템
  • 로컬 환경에서의 고성능 LLM 추론
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 05. 12.수집 2026. 05. 12.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.