TL;DR
문서 처리 제품의 운영 경로인 Gemini 3.7 Flash를 기준으로 DeepSeek V4 Flash Vision Exp와 GLM 5.3 Flash를 같은 이미지와 추출 프롬프트로 비교하는 실험 설계입니다. screenshots, charts, scanned forms로 구성한 문서 100개를 사용하고, 필드 정확도와 애플리케이션 검사 통과 여부뿐 아니라 확정 모델 ID, 지연 시간, 재시도, 토큰 사용량, 캐시 읽기, 승인 문서당 비용을 기록합니다. 세 경로는 ZenMux gateway를 거치지만 최종 pass/fail 판정은 애플리케이션이 맡아 API 응답 성공과 실제 업무 수용을 분리합니다. 새 경로는 Gemini의 수용률을 유지하면서 비용이나 지연 시간을 낮추고 재시도를 늘리지 않을 때만 트래픽을 이전할 계획입니다.
실용적 조언
- 모델 비교 시 동일한 image bytes와 extraction prompt를 유지하고, API 응답 성공 대신 애플리케이션의 최종 pass/fail을 평가 기준으로 사용합니다.
- 게이트웨이를 통일하더라도 확정 모델 ID, 이미지 처리 경로, 재시도, 캐시 읽기와 승인 문서당 비용을 함께 기록해 별칭 라우팅과 제공업체별 토큰 보고 차이를 확인합니다.
섹션별 상세
용어 해설
- OpenAI 호환 API(OpenAI compatible API)
- — 서로 다른 모델 제공업체의 엔드포인트를 OpenAI API와 비슷한 요청 형식으로 호출하는 인터페이스입니다. 애플리케이션의 연동 코드를 줄일 수 있지만, 이미지 크기 조정·픽셀 제한·콘텐츠 블록 변환·모델 별칭 라우팅 같은 내부 처리 방식까지 동일하게 만들지는 않습니다.
- 수용률(Acceptance Rate)
- — 모델의 최종 응답 중 애플리케이션 검사를 통과해 실제 문서 처리 결과로 받아들일 수 있는 비율입니다. 단순히 API 응답이 성공했는지가 아니라 필드 정확도와 서비스의 pass/fail 조건을 함께 반영하므로, 문서 추출 경로를 운영 환경에 적용할 때 핵심 평가 기준이 됩니다.
- 확정 모델 ID(Resolved Model ID)
- — 요청 시 별칭이나 게이트웨이 경로 뒤에서 실제로 호출된 모델을 식별하는 값입니다. 동일한 요청 형식을 사용해도 별칭이 다른 모델로 연결될 수 있으므로, 비교 실험에서는 확정된 ID를 기록해야 어떤 모델의 결과인지 추적할 수 있습니다.
- 캐시 읽기(Cache Reads)
- — 요청 처리 중 이미 저장된 입력 토큰이나 관련 계산 결과를 재사용한 횟수 또는 토큰량입니다. 제공업체마다 캐시 토큰을 보고하는 방식이 다를 수 있어, 비용과 토큰 사용량을 비교할 때 일반 입력 토큰과 구분해 기록해야 합니다.
언급된 도구
세 모델 경로의 요청 로그를 한곳에 모으는 gateway로 사용됩니다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.