본문으로 건너뛰기

코딩에서는 긴 컨텍스트에서 MTP를 끄는 편이 빠르다

MTP는 대화에서 빠르지만 긴 코딩 컨텍스트에서는 속도가 10~20t/s까지 떨어졌다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

작성자는 5090에서 MTP를 켠 상태와 끈 상태를 대화 및 코딩 작업으로 비교했습니다. 대화에서는 MTP가 최대 140t/s를 기록했지만, 코딩에서는 시작 약 100t/s에서 컨텍스트 약 60k 부근에 10~20t/s까지 떨어졌습니다. MTP를 끄면 시작 속도는 약 50t/s로 낮아지지만 긴 컨텍스트에서도 약 40t/s를 유지했습니다. 이 테스트에서는 긴 코딩 컨텍스트의 지속 처리량이 초기 생성 속도보다 안정적이었습니다.

실용적 조언

  • 짧은 일반 대화에서 높은 순간 생성 속도가 필요하면 MTP를 켜고, 긴 코딩 세션에서는 컨텍스트 길이에 따른 지속 속도를 먼저 확인하는 방식이 적합합니다. 작성자의 5090 테스트에서는 대화 중 MTP가 140t/s까지 도달했지만 코딩 중에는 컨텍스트 약 60k에서 10~20t/s로 떨어졌습니다. 코딩 작업에서는 MTP를 끈 뒤 시작 속도 약 50t/s와 장시간 약 40t/s 유지 결과를 비교할 수 있습니다.

섹션별 상세

01
작성자는 코딩과 일반 대화에서 MTP의 효과가 다르다고 여러 차례 테스트한 뒤, 코딩에서는 MTP가 유용하지 않다고 판단했습니다. 5090 환경에서 대화 중 MTP를 켜면 최대 140t/s까지 나오지만, 코딩에서는 컨텍스트가 길어질수록 속도가 크게 떨어졌습니다. 코딩 시작 속도는 약 100t/s였으나 컨텍스트가 약 60k에 이르면 10~20t/s로 감소했습니다.
02
MTP를 끄면 코딩 시작 속도는 약 50t/s로 낮아지지만 컨텍스트가 매우 길어져도 약 40t/s를 유지했습니다. 따라서 초기 생성 속도만 보면 MTP가 빠르지만, 긴 코딩 세션에서는 지속 처리량이 더 중요한 지표가 됩니다. 작성자의 테스트 결과에서는 컨텍스트 길이가 약 40k를 넘은 뒤 MTP의 속도 저하가 두드러졌습니다.

용어 해설

MTP
MTP는 한 번의 추론 단계에서 여러 토큰을 처리하도록 하는 기능을 가리키는 용어입니다. 이 글에서는 대화 생성 속도를 높이지만 긴 코딩 컨텍스트에서는 처리량이 급격히 떨어지는 설정으로 사용됩니다.
컨텍스트 윈도(Context Window)
컨텍스트 윈도는 모델이 한 요청에서 참고할 수 있는 입력과 이전 대화의 범위입니다. 길이가 커지면 매 단계에서 처리해야 할 정보가 늘어나므로 생성 속도와 메모리 사용량에 영향을 줍니다.
초당 토큰 수(tokens/s)
초당 토큰 수는 모델이 1초에 생성하는 토큰의 개수로, 텍스트 생성 속도를 나타내는 지표입니다. 글에서는 MTP를 켜고 끈 상태를 140t/s, 100t/s, 10~20t/s, 40t/s로 비교합니다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 22.수집 2026. 08. 23.출처 타입 REDDIT

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.