TL;DR
게시자는 oMLX Community Benchmarks에서 Qwen3.8-27B를 8bit와 64k 컨텍스트 조건으로 실행해 칩과 모델 변형별 처리량을 비교했습니다. TG TOK/s 기준으로 M3 Ultra(60c)의 한 실행이 46.7을 기록했고, M5 Max(40c)의 실행은 45.6과 43.9 등으로 나타났습니다. 원시 인자와 성공·실패 설정을 주석으로 남긴 뒤 실제 코딩 작업으로 검증 범위를 넓혔으며, vanilla 모델의 기본 권장값과 비교해 성능 문제를 아직 확인하지 못했습니다.
섹션별 상세
이미지 분석

이미지는 8bit와 64k 설정에서 M3 Ultra 및 M5 Max 칩으로 실행한 여러 Qwen3.8-27B 변형의 성능을 비교합니다. TG TOK/s 기준 최고 수치는 M3 Ultra(60c)의 46.7이며, M5 Max(40c)는 45.6과 43.9 등으로 기록되어 칩과 모델 변형별 생성 속도 차이를 확인할 수 있습니다.
oMLX Community Benchmarks에서 Qwen3.8-27B 성능 결과를 필터링한 표입니다.

스크린샷에는 칩별 RAM, 모델 변형, 양자화 방식, 컨텍스트 길이, PP TOK/s와 TG TOK/s가 행 단위로 정리되어 있습니다. 게시자는 이 수치를 바탕으로 설정을 비교한 뒤 실제 코딩 작업에서도 기본 권장값과 성능 차이가 없는지 확인하고 있습니다.
oMLX의 Qwen3.8-27B 커뮤니티 성능 벤치마크 표입니다.
용어 해설
- 벤치마크(Benchmark)
- — 동일한 조건에서 모델이나 시스템의 처리 성능을 측정하고 비교하는 방법입니다. 이 글에서는 Qwen3.8-27B를 8bit와 64k 컨텍스트 설정으로 실행해 프롬프트 처리량과 생성 속도를 기록하는 데 쓰였습니다.
- 프롬프트 처리(Prompt Processing)
- — 모델이 입력 프롬프트를 읽고 내부 상태를 계산하는 단계입니다. 표의 PP TOK/s는 이 과정에서 초당 처리한 토큰 수를 뜻하며, 입력 길이와 하드웨어 구성에 따라 값이 달라질 수 있습니다.
- 토큰 생성(Token Generation)
- — 모델이 입력을 바탕으로 응답 토큰을 순차적으로 생성하는 추론 단계입니다. 표의 TG TOK/s는 초당 생성 토큰 수이며, 같은 모델이라도 칩과 메모리 용량에 따라 실제 응답 속도가 달라집니다.
언급된 도구
Qwen3.8-27B를 여러 칩과 실행 설정에서 측정하고 실제 코딩 작업으로 시험하는 앱입니다.
언급된 리소스
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.