본문으로 건너뛰기
r/LocalLLaMA조회 1

Qwen 3.8의 ACT PDF 풀이 성능

Qwen 3.8이 ACT PDF 342문항에서 95.3%를 맞혔지만 두 시험에 177분이 걸렸습니다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

작성자는 Qwen 3.8 27B Instruct Q8_0 GGUF를 LM Studio와 2× RTX 3090 환경에서 실행해 공식 ACT 연습 PDF 두 개, 총 342문항을 원문 그대로 풀게 했습니다. 모델은 326문항을 맞혀 95.3%의 정답률을 기록했고 Reading에서는 72문항을 모두 맞혔습니다. 공식 환산 점수는 Composite 36점과 34점이었지만, 두 시험을 처리하는 데 177분이 걸려 높은 정확도와 긴 vision 처리 시간이 함께 확인됐습니다.

합의점 vs 논쟁점

합의점

  • Qwen 3.8 27B Instruct는 제시된 ACT 연습 PDF 두 개에서 높은 문항 정확도를 기록했습니다. 특히 Reading 영역에서 72문항을 모두 맞혔고 전체 정답률은 95.3%였습니다. 다만 모델의 처리 시간은 두 시험에 177분으로 짧지 않았습니다.

실용적 조언

  • 로컬 모델의 PDF 시험 성능을 측정할 때는 문항을 텍스트로 재가공하지 않고 원본 PDF를 입력하며, 정답표와 공식 환산표를 기준으로 모든 문항을 동일하게 채점할 수 있습니다. 오답 재시도와 인간 개입을 제외하면 모델의 첫 답변만으로 결과를 비교할 수 있습니다. 양자화 버전과 GPU 실행 설정, 전체 문항 수, 처리 시간을 함께 기록해야 정확도와 속도의 균형을 확인할 수 있습니다.

섹션별 상세

작성자는 Qwen 3.8 27B Instruct의 full version과 Q8, Q6, Q4 버전을 PC에서 시험한 뒤 속도와 품질의 균형을 이유로 Q8을 선택했습니다. 이후 Q8_0 GGUF를 LM Studio에서 2× RTX 3090으로 full offload하고 32k context를 설정했습니다. 서로 다른 양자화 수준을 비교한 뒤 하나의 실행 조건을 고정했다는 점이 후속 시험의 기준이 됐습니다.
시험은 공식 ACT 연습 PDF 두 개의 342문항을 모델에 그대로 입력하는 방식으로 진행됐습니다. 문항을 일반 텍스트로 추출하지 않아 모델은 PDF를 읽고 문제와 시각적 요소를 해석한 뒤 문항별 답을 내놓았으며, 오답 재시도나 인간의 도움, 결과 선별은 없었습니다. 결과는 각 PDF의 정답표와 같은 문서에 포함된 공식 raw→scale conversion tables로 채점됐습니다.
두 시험에서 모델은 342문항 중 326문항을 맞혀 전체 정답률 95.3%를 기록했습니다. Reading은 36/36을 두 번 기록해 72문항 전부 정답이었고, English는 48/50과 45/50, Mathematics는 44/45와 43/45, Science는 39/40과 35/40이었습니다. 공식 환산 결과 Composite는 Test A 36점, Test B 34점으로 나타났습니다.
정확도와 달리 처리 시간은 주요 한계로 남았습니다. 두 시험 전체에 177분, 시험당 약 88분이 걸렸고, 작성자가 제시한 인간 응시 시간은 한 시험당 약 165분이었습니다. 모델이 일반 텍스트가 아니라 vision 기능으로 PDF를 읽으며 문제를 처리했다는 점이 예상보다 긴 실행 시간과 연결됩니다.

용어 해설

양자화(Quantization)
모델 가중치의 표현 정밀도를 낮춰 메모리 사용량과 추론 비용을 줄이는 기법입니다. 이 글에서는 Q8, Q6, Q4처럼 서로 다른 정밀도의 Qwen 모델을 비교해 속도와 답변 품질 사이의 균형을 평가했습니다.
비전 기능(Vision Capability)
이미지나 PDF의 시각적 내용을 읽고 그 안의 문제와 도표를 해석하는 모델 기능입니다. 이 시험에서는 문제를 일반 텍스트로 변환하지 않고 PDF 원문 그대로 입력해 문항별 독해와 답변 능력을 함께 측정했습니다.
GGUF 모델 형식(GGUF)
로컬 환경에서 양자화된 대규모 언어 모델을 저장하고 실행하기 위해 사용하는 파일 형식입니다. 실험에서는 Qwen 3.8 27B Instruct의 Q8_0 GGUF 파일을 LM Studio에서 구동했습니다.
전체 GPU 오프로딩(Full Offload)
모델 계산에 필요한 계층과 가중치를 가능한 범위까지 GPU 메모리에 배치해 CPU와 GPU 사이의 이동을 줄이는 실행 방식입니다. 작성자는 2× RTX 3090 환경에서 모델을 전체 오프로딩하고 32k context를 사용했습니다.
컨텍스트 윈도(Context Window)
모델이 한 번의 요청에서 입력과 이전 처리 내용을 함께 유지할 수 있는 토큰 범위입니다. 이 테스트의 실행 설정은 32k context였으며, 두 공식 ACT 연습 PDF를 원문 상태로 처리하는 데 사용됐습니다.
원점수 환산(Raw-to-Scale Conversion)
시험에서 맞힌 문항 수인 원점수를 공식 환산표에 따라 척도 점수로 바꾸는 절차입니다. 작성자는 PDF에 함께 수록된 ACT 공식 정답표와 raw→scale conversion tables를 사용해 모델의 결과를 실제 점수로 환산했습니다.

언급된 도구

LM Studio중립

Qwen 3.8 27B Instruct Q8_0 GGUF를 로컬 PC에서 실행하는 데 사용됐습니다.

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 20.수집 2026. 08. 20.출처 타입 REDDIT

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.