TL;DR
DeepSeek가 포스트 트레인만으로 DeepSeek-V4-Flash API와 오픈 웨이트를 공개했고, 커뮤니티 관측에서는 동일 아키텍처·크기 유지 상태에서 Terminal-Bench가 56.9에서 82.7로 +25.8포인트 상승한 것으로 보고되었다. 관측 사양은 '284B total / 13B active', 1M context, 요금 $0.14/$0.28 per 1M input/output tokens와 캐시 히트 시 $0.0028/1M으로 98% 할인이 적용된다는 점을 포함해 비용 대비 성능 개선을 뒷받침한다. 이 사례는 프리트레인 재학습 없이 서빙·캐시·활성화 정책을 조정해 에이전트 성능과 비용 효율을 동시에 끌어올릴 수 있음을 보여준다.
섹션별 상세
- 관측 기술 사양: 284B total / 13B active, 1M context, 요금 $0.14/$0.28 per 1M input/output tokens, 캐시 히트 할인 98%로 $0.0028/1M cached tokens. — Artificial Analysis 트윗(상태 ID 2083123180869496865)에 기술 사양과 가격·캐시 할인 수치가 포함되어 있음. 출처
용어 해설
- 포스트 트레인(post-train)
- — 학습(프리트레인) 이후 추가적인 수정이나 튜닝을 통해 성능을 개선하는 절차로서, 사전학습 가중치를 변경하지 않고 파라미터·캐시·입출력 처리 방식 등을 조정해 결과를 개선하는 기법을 가리킨다.
- Responses API 형식(Responses API format)
- — 요청-응답 구조와 페이로드 스키마를 규정하는 API 규격으로서, 모델의 입력·출력 포맷과 스트리밍·메타데이터 처리 방식을 통일해 클라이언트 호환성과 에이전트 통합을 수월하게 하는 목적이 있다.
- Terminal-Bench
- — 모델의 종합 성능을 수치화한 벤치마크 지표군으로서, 언어 이해·추론·대화 같은 여러 작업을 통합해 단일 점수로 비교할 수 있게 설계된 평가 방식이다. 소스에서는 구체 점수가 공개되었다.
- 캐시 히트 할인(cache-hit discount)
- — 반복적이거나 동일한 프롬프트 부분을 캐시로 처리할 때 적용되는 비용 할인 정책으로서, 캐시 적중 시 입력·출력 토큰 요금을 대폭 낮춰 장기간 대화나 에이전트 워크플로 비용을 줄이는 수단이다.
기술
- Responses API format
- Codex
- agent capabilities
활용 사례
- 대량의 반복 요청이나 동일 프롬프트 패턴이 많은 에이전트 워크플로에서는 캐시 히트 할인이 비용을 극적으로 낮춰준다. 캐시 기반 비용 절감은 대화형 고객지원, 자동화된 에이전트 파이프라인, 반복 질의가 많은 분석 태스크에서 즉각적 비용 우위를 제공한다. DeepSeek의 사례처럼 동일 모델 구조 유지로 비용 효율을 올리면 마이그레이션 비용을 줄인 채 성능 개선을 도입할 수 있다.
- 에이전트 성능 개선이 요구되는 금융·고객 응대·업무 자동화 애플리케이션에서는 에이전트 능력 향상으로 효율과 정확도가 동시에 올라갈 수 있다. 발표된 GDPval-AA, τ³-Bench 같은 지표 개선은 에이전트 기반 의사결정과 자동문서처리에서 응답 품질과 처리 속도가 함께 개선될 가능성을 시사한다. 비용 측면에서 과제당 비용이 약 60% 낮다는 보고는 동일 예산으로 더 많은 작업을 처리할 수 있다는 실무적 장점을 제공한다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.
