TL;DR
9개의 주요 LLM을 대상으로 텍스트 기반 칼로리 추정 성능을 측정한 결과, Claude Sonnet 4.6이 정확도에서, GPT-5.4 Nano가 속도에서 가장 우수한 성적을 거두었다.
배경
칼로리 추적 앱 개발 과정에서 텍스트 입력 시 영양 정보를 반환하는 기능의 최적 모델을 찾기 위해 9개 모델의 API 성능을 직접 비교 분석했다.
의미 / 영향
이 벤치마크는 특정 도메인에서 모델 규모와 성능이 항상 비례하지 않음을 보여준다. 특히 Sonnet 4.6이 상위 모델인 Opus보다 효율적이고, 최신 소형 모델이 속도 면에서 압도적인 우위를 점한다는 점은 서비스 설계 시 모델 선택의 중요성을 시사한다.
주요 논점
Claude Sonnet 4.6이 정확도와 속도의 균형 면에서 식단 분석 작업에 가장 우수한 모델이다.
GPT-5.4 Nano는 정확도는 낮지만 속도가 매우 빨라 특정 유즈케이스에서는 고려할 만하다.
Gemini 3.1 Pro는 지연 시간이 너무 길고 정확도도 낮아 이 작업에는 부적합하다.
합의점 vs 논쟁점
합의점
- Claude Sonnet 4.6이 텍스트 기반 칼로리 추정에서 가장 정확한 모델이다.
- OpenAI의 모델들이 전반적으로 지연 시간(Latency) 측면에서 우위에 있다.
논쟁점
- Haiku 4.5가 소형 모델임에도 불구하고 정확도가 가장 낮게 나온 점은 의외의 결과이다.
실용적 조언
- 정확한 영양 분석이 필요하다면 Claude Sonnet 4.6을 사용하라.
- 매우 빠른 응답이 필요한 간단한 입력에는 GPT-5.4 Nano를 고려하라.
- Gemini 3.1 Pro는 이 특정 작업에서 가성비와 성능이 모두 떨어지므로 제외하는 것이 좋다.
섹션별 상세
용어 해설
- Mean Absolute Percentage Error
- — 예측값과 실제값의 차이를 실제값으로 나눈 절댓값의 평균으로, 모델의 예측 정확도를 백분율로 나타내는 지표이다. 이 수치가 낮을수록 모델이 실제 칼로리 수치를 더 정확하게 맞혔음을 의미한다.
- Latency
- — API 요청을 보낸 시점부터 응답을 완전히 받을 때까지 걸리는 전체 시간을 의미한다. 실시간 식단 기록 서비스에서 사용자 경험을 결정하는 핵심적인 성능 지표로 활용된다.
- JSON Schema
- — 데이터의 구조를 정의하는 규격으로, LLM이 칼로리, 단백질, 지방 등의 영양 정보를 정해진 형식에 맞춰 출력하도록 강제하는 역할을 한다. 이를 통해 후속 데이터 처리가 용이해진다.
- System Prompt
- — LLM의 역할과 행동 지침을 규정하는 최상위 지시문이다. 모든 모델에 동일한 시스템 프롬프트를 적용함으로써 모델 간의 순수한 추론 성능 차이를 공정하게 비교할 수 있다.
언급된 도구
벤치마크 테스트 환경 구축 및 실행
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.