본문으로 건너뛰기

Redactle에서 Gemini 3.8 Flash가 최저 비용 기록

Redactle 평가에서 Gemini 3.8 Flash가 12회 추측과 0.005달러 비용으로 100% 해결률을 기록했다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

Redactle는 제목의 의미 있는 단어를 가린 뒤 LLM이 추측을 반복해 제목을 복원하는 방식으로 모델의 추론 효율을 비교한다. Gemini 3.8 Flash는 low, medium, high 설정에서 모두 12회 추측으로 100% 해결률을 기록했으며, low 설정은 0.0점과 0.005달러 비용, 5초 실행 시간으로 표에 올랐다. 반면 일부 모델은 20회 이상 추측하거나 힌트를 사용해 점수와 비용이 높아졌고, GLM 5.3 Flash high는 24회 추측으로 83% 해결률을 기록했다. 평가는 500단어 기사에서 승인된 추측 30회 뒤 중단되며, 미완료 설정에는 60회 점수가 적용되므로 표시된 수치가 실제 필요한 추측 수와 항상 일치하지는 않는다.

섹션별 상세

01
Redactle 평가는 기사 제목의 의미 있는 단어를 가린 뒤 모델이 단어를 추측해 모든 제목 단어를 복원하는 구조다. 제목 단어 수만큼 정확히 추측하면 점수 0이 되고, 그보다 많은 승인된 추측을 사용할수록 점수가 올라간다. 따라서 단순한 정답 여부보다 추측 횟수와 비용, 실행 시간을 함께 비교해야 모델 설정의 효율을 판단할 수 있다.
02
Gemini 3.8 Flash는 low, medium, high 세 설정 모두 12회 추측으로 100% 해결률을 기록했다. 각 설정의 점수는 0.0점이었고 비용은 각각 0.005달러, 0.0067달러, 0.0091달러였으며 실행 시간은 5초, 7초, 10초였다. 같은 모델 계열 안에서도 reasoning 설정을 높이면 비용과 시간이 늘었지만 이 평가에서는 해결률과 점수 개선으로 이어지지 않았다.
03
Grok 4.6은 medium 설정에서 27회 추측과 5회 reasoning 시도로 100% 해결률, 1.3점, 0.0439달러, 91초를 기록했고 low 설정에서는 25회 추측과 7회 reasoning 시도로 1.5점, 0.0222달러, 23초를 기록했다. 두 설정 모두 제목을 복원했지만 Gemini 3.8 Flash보다 승인된 추측 수와 실행 시간이 컸다. 이 결과는 해결률만 보면 같은 성공이지만, 점수와 비용을 함께 보면 설정별 효율 차이가 커진다는 점을 나타낸다.
04
표의 후반부에는 추측 수가 20회를 넘는 설정과 해결률이 낮은 설정이 이어진다. GLM 5.3 Flash high는 24회 추측으로 83% 해결률과 40.0점을 기록했고, DeepSeek V4 Pro 0813은 22회 추측과 1회 reasoning 시도로 92% 해결률과 45.1점을 기록했다. 점수·비용 비교에서는 낮은 위치와 왼쪽 위치가 더 좋고, 두 지표의 중앙값보다 낮은 설정이 음영 영역에 들어간다.
05
평가 규칙은 500단어 평가를 승인된 추측 30회에서 중단하며, 그 시점까지 해결하지 못한 시도에는 60회 점수를 부여한다. 이 값은 모델이 실제로 필요로 했을 추측 수의 추정치가 아니라 비용을 줄이기 위한 중단 규칙의 결과다. 또한 힌트 사용 평가에서는 힌트 하나마다 50점이 추가되고, 불완전한 설정은 표에 남더라도 순위에는 포함되지 않는다.
06
Qwen 3.8 Flash의 low와 medium 설정은 요구된 guess tool call 대신 일반 문장을 반환해 각각 0/12로 기록됐지만 점수는 산정되지 않았다. 재시도는 상류 서비스의 요청 제한으로 진행되지 못했다. 이 사례는 모델의 언어 능력과 별개로 평가 도구의 호출 형식을 지키는 호환성이 전체 결과에 영향을 준다는 점을 드러낸다.

용어 해설

Redactle
기사 제목의 단어를 가린 뒤 모델이 단어를 추측해 원래 제목을 복원하는 퍼즐형 평가다. 모델은 의미 있는 제목 단어가 모두 드러날 때까지 추측을 반복하며, 정답 단어 수보다 많은 추측과 힌트 사용에 따라 점수가 높아진다.
승인된 추측(Accepted Guesses)
Redactle에서 실제 점수에 반영되는 유효한 단어 추측이다. 모델이 제출한 단어 가운데 평가 규칙에 따라 제목 단어를 공개한 추측만 누적되며, 이 횟수가 제목 단어 수를 얼마나 초과했는지가 기본 점수에 영향을 준다.
힌트 사용 평가(Hint-enabled Evaluation)
모델이 제목 단어를 직접 추측하는 대신 평가 중 힌트를 받을 수 있는 설정이다. 이 방식에서는 힌트 하나마다 50점이 추가되므로, 힌트 사용 여부가 모델 간 점수와 비용 비교에 직접 반영된다.
점수와 해결률(Score and Solve Rate)
해결률은 Redactle 제목의 의미 있는 단어를 모두 공개했는지를 나타내고, 점수는 기준 추측 수를 초과한 정도를 수치화한다. 제목 단어마다 한 번씩만 추측해 모두 공개하면 점수는 0이며, 점수가 낮을수록 효율적인 설정으로 평가된다.
도구 호출 호환성(Tool-call Compatibility)
모델이 요구된 추측 도구 호출 형식으로 응답할 수 있는지를 나타내는 평가 조건이다. Qwen 3.8 Flash는 필요한 도구 호출 대신 일반 문장을 반환했고 재시도도 상류 요청 제한에 막혀, 두 설정 모두 점수 산정 대상에서 제외됐다.

기술

  • Gemini 3.8 Flash
  • Gemini 3.7 Flash
  • Grok 4.6
  • GPT-5.6 Sol
  • GPT-5.6 Terra
  • GPT-5.6 Luna
  • Kimi K3
  • Muse Spark 1.2
  • GLM 5.3
  • GLM 5.3 Flash
  • Claude Sonnet 5
  • HY 4 Preview
  • DeepSeek V4 Pro 0813
  • DeepSeek V4 Flash 0731
  • Gemini 2.5 Flash Lite
  • Qwen 3.8 Flash

활용 사례

  • LLM 추론 효율 비교
  • 모델별 비용·속도 평가
  • 도구 호출 형식 검증
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 09. 03.수집 2026. 09. 03.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.