본문으로 건너뛰기
Hugging Face Blog조회 13

NVIDIA AI-Q, DeepResearch Bench I 및 II에서 1위 달성

NVIDIA AI-Q는 NeMo Agent Toolkit과 미세 조정된 Nemotron 3 모델 기반의 멀티 에이전트 아키텍처를 통해 주요 딥 리서치 벤치마크에서 세계 최고 성능을 기록했다.

섹션별 상세

01
NVIDIA AI-Q는 DeepResearch Bench I(55.95점)과 II(54.50점)에서 동시에 1위를 기록하며 딥 리서치 에이전트 분야의 새로운 기준을 제시했다. Bench I은 보고서의 전반적인 품질과 서사 구조를 평가하며, Bench II는 정보 회상 및 분석의 정확성을 70개 이상의 세부 항목으로 검증한다. 두 벤치마크에서의 동시 1위는 AI-Q가 세련된 보고서 작성 능력과 정교한 데이터 추출 능력을 모두 갖췄음을 입증한다.
02
AI-Q의 핵심 아키텍처는 오케스트레이터(Orchestrator), 플래너(Planner), 리서처(Researcher)의 세 가지 주요 컴포넌트로 구성된 멀티 에이전트 시스템이다. 플래너는 정보 지형을 먼저 파악한 후 증거 기반의 연구 계획을 설계하며, 리서처는 증거 수집가, 메커니즘 탐색기, 비교 분석기 등 다양한 전문 서브 에이전트를 병렬로 실행한다. 이러한 구조는 각 에이전트가 독립적인 컨텍스트 윈도우를 사용하게 함으로써 긴 검색 결과로 인한 추론 성능 저하를 방지한다.
AI-Q 딥 리서처의 오케스트레이터, 플래너, 리서처 파이프라인과 앙상블 구조를 보여주는 아키텍처 다이어그램이다.
Diagram전체 시스템의 데이터 흐름과 에이전트 간의 상호작용 방식을 시각화한다. 왼쪽의 앙상블 레이어와 오른쪽의 핵심 파이프라인 구성을 통해 AI-Q가 어떻게 고품질 보고서를 생성하는지 나타낸다.
03
성능 극대화를 위해 NVIDIA Nemotron-3-Super-120B-A12B 모델을 67,000개의 연구 및 합성 궤적 데이터를 사용하여 미세 조정했다. 학습 데이터는 OpenScholar, ResearchQA 등에서 수집한 질문을 바탕으로 GPT-OSS-120B 모델을 통해 생성된 8만 개의 궤적 중 품질 필터링을 거쳐 선별되었다. 16대의 NVIDIA H100 GPU 노드에서 약 25시간 동안 SFT(Supervised Fine-Tuning)를 진행하여 도구 호출 및 인용 기반 보고 능력을 최적화했다.
04
장기 실행(Long-horizon) 에이전트의 신뢰성을 높이기 위해 네 가지 커스텀 미들웨어를 도입했다. 도구 이름 환각을 방지하는 '도구 이름 정제', 추론 토큰만 생성되고 도구 호출이 누락될 때 재시도하는 '추론 인식 재시도', 도구 호출 한도를 관리하는 '예산 강제', 그리고 최종 보고서의 구조와 길이를 검증하는 '보고서 유효성 검사'가 포함된다. 이러한 장치들은 32단계 이상의 복잡한 상호작용 과정에서 발생할 수 있는 시스템 실패를 효과적으로 방지한다.

용어 해설

딥 리서치 벤치마크(DeepResearch Bench)
AI 에이전트의 심층 연구 능력을 평가하기 위한 벤치마크로, 보고서의 포괄성, 통찰력의 깊이, 지시 이행 능력 및 정보 회상 정확도를 측정한다.
멀티 에이전트 아키텍처(Multi-Agent Architecture)
하나의 복잡한 작업을 해결하기 위해 오케스트레이터, 플래너 등 서로 다른 역할을 가진 여러 AI 에이전트가 협력하고 통신하는 시스템 구조이다.
지도 미세 조정(SFT)
Supervised Fine-Tuning의 약자로, 사람이 작성하거나 검증한 고품질 데이터를 사용하여 사전 학습된 모델을 특정 작업에 맞게 추가 학습시키는 기법이다.
장기 추론 신뢰성(Long-Horizon Reliability)
수십 단계 이상의 복잡한 도구 호출과 추론이 이어지는 긴 작업 과정에서도 에이전트가 오류 없이 목표를 달성하고 일관된 성능을 유지하는 능력이다.
앙상블(Ensemble)
여러 개의 독립적인 모델이나 파이프라인을 병렬로 실행한 후 그 결과물들을 결합하여 단일 모델보다 더 높은 정확도와 포괄성을 얻는 기법이다.

기술

  • NVIDIA NeMo Agent Toolkit
  • NVIDIA Nemotron 3
  • LangChain DeepAgents
  • Tavily API
  • Serper API
  • NVIDIA H100 GPUs

활용 사례

  • 기업 데이터 심층 분석
  • 웹 기반 시장 조사 및 리포트 생성
  • 학술 논문 검색 및 요약
  • 복잡한 의사결정 지원 시스템

언급된 리소스

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 03. 12.수집 2026. 03. 12.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.