본문으로 건너뛰기
TLDR AI Feed조회 1

Chroma Context-1: 스스로 컨텍스트를 편집하는 검색 에이전트 학습

Chroma는 멀티턴 검색 중 불필요한 정보를 스스로 삭제하는 20B 규모의 에이전틱 검색 모델 Context-1을 공개했다.

섹션별 상세

01
멀티턴 검색의 컨텍스트 팽창으로 인한 성능 저하와 비용 문제를 해결하기 위해 20B 규모의 전용 모델 Context-1을 구축했다. Context-1은 검색 서브에이전트로서 작동하며 하위 쿼리 분해, 반복 검색, 불필요한 문서 삭제(Pruning)를 수행한다. 이를 통해 하드웨어 자원을 효율적으로 사용하면서도 복잡한 멀티홉 질문에 대한 정확한 근거 문서를 찾아낸다.
python
agent.reset()
agent.observe(initial_observation)
while not agent.is_done:
    action = agent.infer()
    observation = agent.act(action)
    if observation is not None:
        agent.observe(observation)
trajectory = agent.trajectory

에이전트의 관찰-추론-행동 루프를 구현한 의사코드

02
모델이 스스로 컨텍스트를 관리하는 'Self-editing context' 메커니즘을 도입하여 컨텍스트 부패(Context Rot) 현상을 방지한다. 에이전트는 토큰 예산이 임계값에 도달하면 prune_chunks 도구를 사용하여 무관한 정보를 제거하고 새로운 탐색 공간을 확보한다. 실험 결과 Context-1은 0.941의 높은 삭제 정확도를 기록하며 노이즈를 효과적으로 제어함이 확인됐다.
베이스 모델과 Context-1의 컨텍스트 삭제(Prune) 정확도 비교 차트
ChartContext-1이 0.94의 정확도를 기록하여 베이스 모델(0.82) 대비 무관한 정보를 식별하고 제거하는 능력이 유의미하게 향상되었음을 보여준다.
03
CISPO(Clipped Importance-Sampled Policy Optimization)라는 새로운 강화학습 알고리즘을 적용해 학습 안정성을 확보했다. 기존 GRPO 방식에서 발생하기 쉬운 엔트로피 붕괴를 막기 위해 중요도 샘플링 가중치를 클리핑하여 모든 토큰이 학습에 기여하도록 설계했다. 이 방식은 특히 삭제 결정이나 쿼리 재구성 같은 희소하지만 중요한 행동을 학습시키는 데 효과적이다.
학습 단계에 따른 총 보상(Total Reward)의 변화를 보여주는 그래프
Chart학습이 진행됨에 따라 보상이 꾸준히 상승하며 약 230단계 부근에서 수렴하는 것을 보여준다. 난이도가 낮은 태스크에서 높은 태스크로 전환되는 시점에서도 안정적인 학습 곡선을 유지한다.
PPO와 CISPO 알고리즘 간의 정책 엔트로피 유지 성능 비교 그래프
ChartPPO는 학습이 진행될수록 엔트로피가 급격히 감소하는 반면, CISPO는 높은 엔트로피를 유지하여 모델의 탐색 능력을 보존함을 증명한다. 이는 CISPO가 엔트로피 붕괴 방지에 더 효과적임을 나타낸다.
04
웹, 금융, 법률, 이메일 등 4개 도메인에 걸쳐 8,000개 이상의 고품질 합성 태스크를 생성하는 파이프라인을 구축했다. LLM Judge와 추출 기반 검증(Extraction-based verification)을 결합하여 데이터의 근거 정확도를 80% 이상으로 유지했다. 특히 훈련되지 않은 이메일 도메인에서도 성능 향상이 나타나 검색 기술의 범용적인 전이 학습 가능성을 입증했다.
05
벤치마크 평가 결과 Context-1은 수십 배 더 큰 최신 모델들과 대등한 검색 성능을 내면서도 추론 속도는 10배 이상 빠르다. MXFP4 양자화를 적용해 B200 GPU에서 초당 400-500 토큰의 빠른 속도로 실시간 에이전틱 검색을 지원한다. 이는 프로덕션 환경에서 고성능 RAG 시스템을 저비용으로 운영할 수 있는 실질적인 대안을 제시한다.
HLE(Humanity's Last Exam) 벤치마크에서 다양한 모델의 정확도 비교
ChartContext-1(4x)이 0.385의 정확도를 기록하여 Sonnet 4.5나 GPT-5.2 같은 대형 모델들과 대등한 수준의 검색 지원 능력을 갖추었음을 입증한다.

용어 해설

클리핑된 중요도 샘플링 정책 최적화(CISPO)
GRPO의 변형으로 중요도 샘플링 가중치를 클리핑하여 엔트로피 붕괴를 방지하는 강화학습 알고리즘이다. 모든 토큰이 학습에 기여하도록 설계되어 에이전트의 의사결정 효율을 높인다.
에이전틱 검색(Agentic Search)
LLM이 스스로 고수준 질문을 하위 쿼리로 분해하고 도구를 사용하여 멀티턴으로 정보를 탐색하는 능동적 검색 방식이다. 복잡한 멀티홉 질문을 해결하는 데 필수적이다.
컨텍스트 부패(Context Rot)
멀티턴 검색 과정에서 무관하거나 중복된 문서가 쌓여 컨텍스트 윈도우를 채우고 모델의 추론 성능을 저하시키는 현상이다. 이를 해결하기 위해 능동적인 컨텍스트 편집 기술이 요구된다.
상호 순위 결합(RRF)
키워드 기반 검색과 시맨틱 벡터 검색 등 서로 다른 검색 결과의 순위를 결합하여 최종 랭킹을 산출하는 기법이다. 다양한 검색 방식의 장점을 통합하여 검색 품질을 높인다.
MXFP4 양자화(MXFP4)
모델 가중치를 4비트 정밀도로 압축하여 추론 속도를 높이고 메모리 사용량을 줄이는 기술이다. Context-1은 이를 통해 B200 GPU에서 초당 400-500 토큰의 빠른 속도를 구현한다.

기술

  • Chroma
  • Context-1
  • vLLM
  • MXFP4
  • B200 GPU
  • Python

활용 사례

  • 멀티홉 질문 답변 시스템
  • 금융/법률 문서 정밀 검색
  • 저비용 고속 RAG 파이프라인
  • 장기 대화 에이전트

언급된 리소스

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 03. 27.수집 2026. 03. 29.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.