TL;DR
작성자는 Qwen 3.8 27B Instruct Q8_0 GGUF를 LM Studio와 2× RTX 3090 환경에서 실행해 공식 ACT 연습 PDF 두 개, 총 342문항을 원문 그대로 풀게 했습니다. 모델은 326문항을 맞혀 95.3%의 정답률을 기록했고 Reading에서는 72문항을 모두 맞혔습니다. 공식 환산 점수는 Composite 36점과 34점이었지만, 두 시험을 처리하는 데 177분이 걸려 높은 정확도와 긴 vision 처리 시간이 함께 확인됐습니다.
합의점 vs 논쟁점
합의점
- Qwen 3.8 27B Instruct는 제시된 ACT 연습 PDF 두 개에서 높은 문항 정확도를 기록했습니다. 특히 Reading 영역에서 72문항을 모두 맞혔고 전체 정답률은 95.3%였습니다. 다만 모델의 처리 시간은 두 시험에 177분으로 짧지 않았습니다.
실용적 조언
- 로컬 모델의 PDF 시험 성능을 측정할 때는 문항을 텍스트로 재가공하지 않고 원본 PDF를 입력하며, 정답표와 공식 환산표를 기준으로 모든 문항을 동일하게 채점할 수 있습니다. 오답 재시도와 인간 개입을 제외하면 모델의 첫 답변만으로 결과를 비교할 수 있습니다. 양자화 버전과 GPU 실행 설정, 전체 문항 수, 처리 시간을 함께 기록해야 정확도와 속도의 균형을 확인할 수 있습니다.
섹션별 상세
용어 해설
- 양자화(Quantization)
- — 모델 가중치의 표현 정밀도를 낮춰 메모리 사용량과 추론 비용을 줄이는 기법입니다. 이 글에서는 Q8, Q6, Q4처럼 서로 다른 정밀도의 Qwen 모델을 비교해 속도와 답변 품질 사이의 균형을 평가했습니다.
- 비전 기능(Vision Capability)
- — 이미지나 PDF의 시각적 내용을 읽고 그 안의 문제와 도표를 해석하는 모델 기능입니다. 이 시험에서는 문제를 일반 텍스트로 변환하지 않고 PDF 원문 그대로 입력해 문항별 독해와 답변 능력을 함께 측정했습니다.
- GGUF 모델 형식(GGUF)
- — 로컬 환경에서 양자화된 대규모 언어 모델을 저장하고 실행하기 위해 사용하는 파일 형식입니다. 실험에서는 Qwen 3.8 27B Instruct의 Q8_0 GGUF 파일을 LM Studio에서 구동했습니다.
- 전체 GPU 오프로딩(Full Offload)
- — 모델 계산에 필요한 계층과 가중치를 가능한 범위까지 GPU 메모리에 배치해 CPU와 GPU 사이의 이동을 줄이는 실행 방식입니다. 작성자는 2× RTX 3090 환경에서 모델을 전체 오프로딩하고 32k context를 사용했습니다.
- 컨텍스트 윈도(Context Window)
- — 모델이 한 번의 요청에서 입력과 이전 처리 내용을 함께 유지할 수 있는 토큰 범위입니다. 이 테스트의 실행 설정은 32k context였으며, 두 공식 ACT 연습 PDF를 원문 상태로 처리하는 데 사용됐습니다.
- 원점수 환산(Raw-to-Scale Conversion)
- — 시험에서 맞힌 문항 수인 원점수를 공식 환산표에 따라 척도 점수로 바꾸는 절차입니다. 작성자는 PDF에 함께 수록된 ACT 공식 정답표와 raw→scale conversion tables를 사용해 모델의 결과를 실제 점수로 환산했습니다.
언급된 도구
Qwen 3.8 27B Instruct Q8_0 GGUF를 로컬 PC에서 실행하는 데 사용됐습니다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.

