본문으로 건너뛰기

Qwen3.8-27B Q6로 20시간 연속 작업

Qwen3.8-27B Q6가 RTX 3090과 RTX 3060에서 약 20시간 동안 60~63 tokens/s를 유지했다

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

게시물 작성자는 RTX 3090과 RTX 3060에서 Qwen3.8-27B Q6를 약 20시간 동안 연속 실행해 목표 지향 작업을 수행했다. 세션 전반의 생성 속도는 약 60~63 tokens/s로 유지됐으며, 로그에는 프롬프트 처리와 토큰 생성 구간별 속도가 기록돼 있다. 완료 화면에는 40개 실행 파일과 40개 작업 manifest, 40/40 감사 완료, 66/66 테스트 통과, 20개 커밋이 남아 있다. 이 결과는 해당 모델이 혼합 GPU 환경에서 장시간 작업과 검증 절차를 안정적으로 처리한 사례로 읽힌다.

섹션별 상세

작성자는 RTX 3090과 RTX 3060을 함께 사용해 Qwen3.8-27B Q6로 거의 20시간 동안 목표 지향 작업을 연속 실행했다. 생성 속도는 세션 전반에서 약 60~63 tokens/s를 유지했고, 로그에는 여러 생성 구간의 속도가 대체로 59~64 tokens/s로 기록됐다. 장시간 추론에서도 처리량이 크게 흔들리지 않았다는 점이 이 테스트의 핵심 결과이다.
첨부된 실행 로그에는 모델 로딩에 14.11초가 걸렸고 Context Length가 172000으로 설정된 상태에서 프롬프트 처리와 토큰 생성을 진행한 과정이 남아 있다. 별도의 완료 화면에는 40개 실행 파일과 40개 작업 manifest, 40/40 감사 완료, 66/66 테스트 통과, 20개 커밋이 기록돼 있다. 따라서 게시물의 결과는 단순히 모델을 잠깐 실행한 속도 측정이 아니라 장시간 작업과 검증 절차를 포함한 실제 사용 사례에 가깝다.

이미지 분석

장시간 실행 작업의 완료 상태와 테스트·감사 결과를 기록한 터미널 화면이다.
Screenshot

화면에는 약 20시간에 해당하는 19시간 54분 실행 시간과 함께 40개 실행 파일, 40개 작업 manifest, 40/40 감사 완료, 66/66 테스트 통과, 20개 커밋이 기록돼 있다. 25개 Line A, 12개 Line C, 3개 Line B, 14개 대상의 두 차례 실행이라는 작업 분포도 확인되며, 모델 추론이 실제 산출물 생성과 검증 과정에 사용됐음을 뒷받침한다.

장시간 실행 작업의 완료 상태와 테스트·감사 결과를 기록한 터미널 화면이다.

llama_server의 모델 로딩과 프롬프트·토큰 생성 속도를 기록한 추론 로그 화면이다.
Screenshot

로그에는 Qwen3.8-27B Q6 모델 로딩 시간이 14.11초, Context Length가 172000으로 기록돼 있다. 프롬프트 처리 속도는 구간에 따라 약 680~764 tokens/s였고, 토큰 생성 속도는 약 56~64 tokens/s 범위로 나타나 게시물의 장시간 60~63 tokens/s 주장과 대체로 일치한다.

llama_server의 모델 로딩과 프롬프트·토큰 생성 속도를 기록한 추론 로그 화면이다.

용어 해설

초당 토큰 수(tokens/s)
생성 모델이 1초 동안 출력하는 토큰 수를 나타내는 처리 속도 지표이다. 게시물에서는 약 20시간 동안 Qwen3.8-27B Q6의 생성 속도가 60~63 tokens/s 범위에 머물렀다는 근거로 사용됐다.
컨텍스트 길이(Context Length)
모델이 한 번의 요청에서 처리할 수 있는 입력과 출력 토큰의 최대 범위이다. 로그 이미지에는 Context Length가 172000으로 기록되어 장시간 작업에서 다룬 문맥 규모를 확인할 수 있다.
최근 사용 빈도 기반 교체(LRU)
여러 작업 슬롯이나 캐시 항목 중 최근 사용 시점이 가장 오래된 대상을 먼저 교체하는 방식이다. 로그에는 선택된 슬롯이 LRU 방식으로 결정됐다는 처리 기록이 나타난다.

언급된 도구

Qwen3.8-27B Q6추천

RTX 3090과 RTX 3060 환경에서 장시간 목표 지향 작업을 수행한 언어 모델

llama_server중립

모델을 로드하고 로컬 HTTP 서버에서 추론 작업을 처리한 실행 서버

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 22.수집 2026. 08. 22.출처 타입 REDDIT

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.