TL;DR
게시물 작성자는 RTX 3090과 RTX 3060에서 Qwen3.8-27B Q6를 약 20시간 동안 연속 실행해 목표 지향 작업을 수행했다. 세션 전반의 생성 속도는 약 60~63 tokens/s로 유지됐으며, 로그에는 프롬프트 처리와 토큰 생성 구간별 속도가 기록돼 있다. 완료 화면에는 40개 실행 파일과 40개 작업 manifest, 40/40 감사 완료, 66/66 테스트 통과, 20개 커밋이 남아 있다. 이 결과는 해당 모델이 혼합 GPU 환경에서 장시간 작업과 검증 절차를 안정적으로 처리한 사례로 읽힌다.
섹션별 상세
이미지 분석

화면에는 약 20시간에 해당하는 19시간 54분 실행 시간과 함께 40개 실행 파일, 40개 작업 manifest, 40/40 감사 완료, 66/66 테스트 통과, 20개 커밋이 기록돼 있다. 25개 Line A, 12개 Line C, 3개 Line B, 14개 대상의 두 차례 실행이라는 작업 분포도 확인되며, 모델 추론이 실제 산출물 생성과 검증 과정에 사용됐음을 뒷받침한다.
장시간 실행 작업의 완료 상태와 테스트·감사 결과를 기록한 터미널 화면이다.

로그에는 Qwen3.8-27B Q6 모델 로딩 시간이 14.11초, Context Length가 172000으로 기록돼 있다. 프롬프트 처리 속도는 구간에 따라 약 680~764 tokens/s였고, 토큰 생성 속도는 약 56~64 tokens/s 범위로 나타나 게시물의 장시간 60~63 tokens/s 주장과 대체로 일치한다.
llama_server의 모델 로딩과 프롬프트·토큰 생성 속도를 기록한 추론 로그 화면이다.
용어 해설
- 초당 토큰 수(tokens/s)
- — 생성 모델이 1초 동안 출력하는 토큰 수를 나타내는 처리 속도 지표이다. 게시물에서는 약 20시간 동안 Qwen3.8-27B Q6의 생성 속도가 60~63 tokens/s 범위에 머물렀다는 근거로 사용됐다.
- 컨텍스트 길이(Context Length)
- — 모델이 한 번의 요청에서 처리할 수 있는 입력과 출력 토큰의 최대 범위이다. 로그 이미지에는 Context Length가 172000으로 기록되어 장시간 작업에서 다룬 문맥 규모를 확인할 수 있다.
- 최근 사용 빈도 기반 교체(LRU)
- — 여러 작업 슬롯이나 캐시 항목 중 최근 사용 시점이 가장 오래된 대상을 먼저 교체하는 방식이다. 로그에는 선택된 슬롯이 LRU 방식으로 결정됐다는 처리 기록이 나타난다.
언급된 도구
RTX 3090과 RTX 3060 환경에서 장시간 목표 지향 작업을 수행한 언어 모델
모델을 로드하고 로컬 HTTP 서버에서 추론 작업을 처리한 실행 서버
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.