섹션별 상세
멀티턴 검색의 컨텍스트 팽창으로 인한 성능 저하와 비용 문제를 해결하기 위해 20B 규모의 전용 모델 Context-1을 구축했다. Context-1은 검색 서브에이전트로서 작동하며 하위 쿼리 분해, 반복 검색, 불필요한 문서 삭제(Pruning)를 수행한다. 이를 통해 하드웨어 자원을 효율적으로 사용하면서도 복잡한 멀티홉 질문에 대한 정확한 근거 문서를 찾아낸다.
python
agent.reset()
agent.observe(initial_observation)
while not agent.is_done:
action = agent.infer()
observation = agent.act(action)
if observation is not None:
agent.observe(observation)
trajectory = agent.trajectory에이전트의 관찰-추론-행동 루프를 구현한 의사코드
모델이 스스로 컨텍스트를 관리하는 'Self-editing context' 메커니즘을 도입하여 컨텍스트 부패(Context Rot) 현상을 방지한다. 에이전트는 토큰 예산이 임계값에 도달하면 prune_chunks 도구를 사용하여 무관한 정보를 제거하고 새로운 탐색 공간을 확보한다. 실험 결과 Context-1은 0.941의 높은 삭제 정확도를 기록하며 노이즈를 효과적으로 제어함이 확인됐다.

CISPO(Clipped Importance-Sampled Policy Optimization)라는 새로운 강화학습 알고리즘을 적용해 학습 안정성을 확보했다. 기존 GRPO 방식에서 발생하기 쉬운 엔트로피 붕괴를 막기 위해 중요도 샘플링 가중치를 클리핑하여 모든 토큰이 학습에 기여하도록 설계했다. 이 방식은 특히 삭제 결정이나 쿼리 재구성 같은 희소하지만 중요한 행동을 학습시키는 데 효과적이다.


웹, 금융, 법률, 이메일 등 4개 도메인에 걸쳐 8,000개 이상의 고품질 합성 태스크를 생성하는 파이프라인을 구축했다. LLM Judge와 추출 기반 검증(Extraction-based verification)을 결합하여 데이터의 근거 정확도를 80% 이상으로 유지했다. 특히 훈련되지 않은 이메일 도메인에서도 성능 향상이 나타나 검색 기술의 범용적인 전이 학습 가능성을 입증했다.
벤치마크 평가 결과 Context-1은 수십 배 더 큰 최신 모델들과 대등한 검색 성능을 내면서도 추론 속도는 10배 이상 빠르다. MXFP4 양자화를 적용해 B200 GPU에서 초당 400-500 토큰의 빠른 속도로 실시간 에이전틱 검색을 지원한다. 이는 프로덕션 환경에서 고성능 RAG 시스템을 저비용으로 운영할 수 있는 실질적인 대안을 제시한다.

용어 해설
- 클리핑된 중요도 샘플링 정책 최적화(CISPO)
- — GRPO의 변형으로 중요도 샘플링 가중치를 클리핑하여 엔트로피 붕괴를 방지하는 강화학습 알고리즘이다. 모든 토큰이 학습에 기여하도록 설계되어 에이전트의 의사결정 효율을 높인다.
- 에이전틱 검색(Agentic Search)
- — LLM이 스스로 고수준 질문을 하위 쿼리로 분해하고 도구를 사용하여 멀티턴으로 정보를 탐색하는 능동적 검색 방식이다. 복잡한 멀티홉 질문을 해결하는 데 필수적이다.
- 컨텍스트 부패(Context Rot)
- — 멀티턴 검색 과정에서 무관하거나 중복된 문서가 쌓여 컨텍스트 윈도우를 채우고 모델의 추론 성능을 저하시키는 현상이다. 이를 해결하기 위해 능동적인 컨텍스트 편집 기술이 요구된다.
- 상호 순위 결합(RRF)
- — 키워드 기반 검색과 시맨틱 벡터 검색 등 서로 다른 검색 결과의 순위를 결합하여 최종 랭킹을 산출하는 기법이다. 다양한 검색 방식의 장점을 통합하여 검색 품질을 높인다.
- MXFP4 양자화(MXFP4)
- — 모델 가중치를 4비트 정밀도로 압축하여 추론 속도를 높이고 메모리 사용량을 줄이는 기술이다. Context-1은 이를 통해 B200 GPU에서 초당 400-500 토큰의 빠른 속도를 구현한다.
기술
- Chroma
- Context-1
- vLLM
- MXFP4
- B200 GPU
- Python
활용 사례
- 멀티홉 질문 답변 시스템
- 금융/법률 문서 정밀 검색
- 저비용 고속 RAG 파이프라인
- 장기 대화 에이전트
언급된 리소스
AI 분석 전체 내용 보기
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
원문 발행 2026. 03. 27.수집 2026. 03. 29.출처 타입 RSS
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.