본문으로 건너뛰기

Mercury 2: 즉각적인 반응을 제공하는 혁신적인 확산 기반 AI 모델

Inception Labs가 공개한 Mercury 2는 기존의 자기회귀 방식 대신 확산 기법을 도입하여 초당 1,000토큰의 압도적인 속도와 높은 추론 성능을 동시에 구현했습니다.

섹션별 상세

01
Mercury 2는 기존 Google이나 OpenAI가 사용하는 자기회귀(Auto-regressive) 방식에서 벗어나 확산(Diffusion) 모델을 언어 생성에 도입했다. 자기회귀 방식이 타자기처럼 한 단어씩 순차적으로 생성하는 것과 달리, Mercury 2는 전체 답변의 대략적인 버전을 먼저 만든 후 이를 병렬적으로 수정하고 다듬는 편집자 방식을 취한다. 이를 통해 추론 과정에서의 병렬 처리가 가능해져 속도가 비약적으로 향상되었다.
02
벤치마크 결과 Mercury 2는 초당 약 1,000토큰의 처리량(Throughput)을 기록했다. 이는 Claude 4.5 Haiku(89 t/s)나 GPT-5 mini(71 t/s)보다 10배 이상 빠른 수치이다. 또한 비용 측면에서도 입력 토큰당 0.25달러, 출력 토큰당 0.75달러(100만 토큰 기준)로 책정되어 경쟁 모델 대비 2.5배에서 6.5배가량 저렴하여 실시간 AI 에이전트 구현에 최적화되어 있다.
Mercury 2의 속도 벤치마크 결과 그래프
ChartMercury 2가 1009 tokens/sec를 기록하며 Claude Haiku 4.5(89) 및 GPT-5 mini(71) 대비 10배 이상 빠른 속도를 보유하고 있음을 시각적으로 증명한다.
03
속도 향상이 품질 저하로 이어지지 않았음을 벤치마크 수치로 입증했다. AIME 2025 수학 벤치마크에서 91.1점을 기록했으며, GPQA(과학) 및 IFBench(지시 이행)에서도 우수한 성적을 거두었다. 또한 128K 컨텍스트 윈도우, 도구 사용(Tool use), JSON 출력 기능을 지원하여 복잡한 애플리케이션 개발에 유연하게 대응할 수 있다.
다양한 모델 간의 성능 지표 비교표
Chart지연 시간, GPQA, AIME 등 주요 벤치마크에서 Mercury 2가 경쟁 모델들과 대등하거나 우월한 성능을 내고 있음을 구체적인 수치로 나타낸다.
04
세차장 테스트와 기사 요약 테스트를 통해 실제 환경에서의 추론 능력과 속도를 검증했다. 낮은 추론 노력 설정에서는 단순한 답변을 제공하지만, 설정을 높이면 세차장의 종류에 따른 상황별 권장 사항을 제시하는 등 정교한 논리 전개를 보여주었다. 특히 대규모 기사 요약 작업에서 ChatGPT가 35초 이상 소요된 반면, Mercury 2는 3초 이내에 결과를 도출하며 실전 성능을 나타냈다.
Mercury 2의 실제 대화 답변 화면
Screenshot세차장 관련 질문에 대해 모델이 상황별로 논리적인 근거를 들어 답변하는 실제 추론 과정을 보여준다.
Mercury 2의 후속 질문 추천 기능 화면
Screenshot답변 생성 후 사용자가 궁금해할 만한 추가 질문들을 자동으로 제안하는 인터페이스 기능을 확인시켜 준다.

기술

  • Mercury 2
  • Inception Labs API
  • JSON Output
  • Tool Use

활용 사례

  • 실시간 음성 비서
  • 실시간 코드 어시스턴트
  • 고속 문서 요약
  • 지능형 검색 도구

언급된 리소스

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 02. 28.수집 2026. 03. 01.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.