TL;DR
Redactle는 제목의 의미 있는 단어를 가린 뒤 LLM이 추측을 반복해 제목을 복원하는 방식으로 모델의 추론 효율을 비교한다. Gemini 3.8 Flash는 low, medium, high 설정에서 모두 12회 추측으로 100% 해결률을 기록했으며, low 설정은 0.0점과 0.005달러 비용, 5초 실행 시간으로 표에 올랐다. 반면 일부 모델은 20회 이상 추측하거나 힌트를 사용해 점수와 비용이 높아졌고, GLM 5.3 Flash high는 24회 추측으로 83% 해결률을 기록했다. 평가는 500단어 기사에서 승인된 추측 30회 뒤 중단되며, 미완료 설정에는 60회 점수가 적용되므로 표시된 수치가 실제 필요한 추측 수와 항상 일치하지는 않는다.
섹션별 상세
용어 해설
- Redactle
- — 기사 제목의 단어를 가린 뒤 모델이 단어를 추측해 원래 제목을 복원하는 퍼즐형 평가다. 모델은 의미 있는 제목 단어가 모두 드러날 때까지 추측을 반복하며, 정답 단어 수보다 많은 추측과 힌트 사용에 따라 점수가 높아진다.
- 승인된 추측(Accepted Guesses)
- — Redactle에서 실제 점수에 반영되는 유효한 단어 추측이다. 모델이 제출한 단어 가운데 평가 규칙에 따라 제목 단어를 공개한 추측만 누적되며, 이 횟수가 제목 단어 수를 얼마나 초과했는지가 기본 점수에 영향을 준다.
- 힌트 사용 평가(Hint-enabled Evaluation)
- — 모델이 제목 단어를 직접 추측하는 대신 평가 중 힌트를 받을 수 있는 설정이다. 이 방식에서는 힌트 하나마다 50점이 추가되므로, 힌트 사용 여부가 모델 간 점수와 비용 비교에 직접 반영된다.
- 점수와 해결률(Score and Solve Rate)
- — 해결률은 Redactle 제목의 의미 있는 단어를 모두 공개했는지를 나타내고, 점수는 기준 추측 수를 초과한 정도를 수치화한다. 제목 단어마다 한 번씩만 추측해 모두 공개하면 점수는 0이며, 점수가 낮을수록 효율적인 설정으로 평가된다.
- 도구 호출 호환성(Tool-call Compatibility)
- — 모델이 요구된 추측 도구 호출 형식으로 응답할 수 있는지를 나타내는 평가 조건이다. Qwen 3.8 Flash는 필요한 도구 호출 대신 일반 문장을 반환했고 재시도도 상류 요청 제한에 막혀, 두 설정 모두 점수 산정 대상에서 제외됐다.
기술
- Gemini 3.8 Flash
- Gemini 3.7 Flash
- Grok 4.6
- GPT-5.6 Sol
- GPT-5.6 Terra
- GPT-5.6 Luna
- Kimi K3
- Muse Spark 1.2
- GLM 5.3
- GLM 5.3 Flash
- Claude Sonnet 5
- HY 4 Preview
- DeepSeek V4 Pro 0813
- DeepSeek V4 Flash 0731
- Gemini 2.5 Flash Lite
- Qwen 3.8 Flash
활용 사례
- LLM 추론 효율 비교
- 모델별 비용·속도 평가
- 도구 호출 형식 검증
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.