TL;DR
게시물은 Qwen3.8-27B의 low preset이 Qwen3.7 plus와 Qwen3.6-27B reasoning보다 높은 Artificial Analysis Intelligence Index 점수를 기록했다는 비교다. 첨부된 v4.1 차트는 9개 평가를 합산하며, Qwen3.8-27B low는 43점, Qwen3.7 plus는 39점, Qwen3.6-27B 항목은 38점으로 표시된다. Qwen3.8 Max의 58점과 비교하면 설정에 따른 성능 격차도 함께 확인된다.
섹션별 상세
이미지 분석

차트는 GDPval-AA v2, τ³-Banking, Terminal-Bench v2.1, SciCode, Humanity's Last Exam, GPQA Diamond, CritPt, AA-Omniscience, AA-LCR 등 9개 평가를 합친 지수를 사용한다. Qwen3.8 Max가 58점으로 가장 높고, Qwen3.8-27B의 high·medium·low 설정은 52점, 44점, 43점이며 Qwen3.7 plus와 Qwen3.6-27B 항목은 39점과 38점으로 표시된다.
Artificial Analysis Intelligence Index v4.1에서 Qwen 계열 모델과 설정별 점수를 비교한 막대그래프다.

막대그래프는 모델명과 설정을 세로 방향으로 배치하고 각 항목의 종합 점수를 막대 안에 직접 표시한다. Qwen3.8-27B low는 43점으로 Qwen3.7 plus의 39점과 Qwen3.6-27B로 표시된 38점 항목보다 높은 위치에 있다.
Artificial Analysis Intelligence Index v4.1의 Qwen 모델별 종합 점수를 나타낸 차트다.
용어 해설
- Artificial Analysis Intelligence Index
- — 여러 AI 평가 결과를 하나의 지수로 묶어 모델 성능을 비교하는 벤치마크다. 이 게시물의 차트는 v4.1 버전으로 9개 평가를 통합하며, 각 모델 또는 설정의 상대적 점수를 막대그래프로 나타낸다.
- 추론 모델(Reasoning Model)
- — 질문에 바로 답하기보다 내부적인 추론 과정을 거쳐 복잡한 문제를 처리하도록 설계된 언어 모델이다. 차트에서는 전구 아이콘으로 추론 모델을 구분하고, 여러 Qwen 계열 모델과 설정을 같은 지수에서 비교한다.
- 벤치마크 평가(Benchmark Evaluation)
- — 모델에 동일하거나 유사한 과제를 수행하게 한 뒤 정해진 기준으로 결과를 수치화하는 방식이다. 차트의 지수는 GDPval-AA v2, SciCode, GPQA Diamond 등 9개 평가 점수를 종합한 순위를 제공한다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.