TL;DR
에이전트가 다수의 턴에 걸쳐 도구 응답과 환경 정보를 생성하는데, 기존 SFT는 도구 응답을 마스킹하고 로컬 턴 수준의 추론만 학습한다. ACC는 이러한 분산 신호를 하나의 긴 맥락으로 결합해 질문과 증거의 의존 관계를 직접 학습하게 함으로써, 장문 의존성 학습의 감독 신호를 확대하고 기존 방법의 한계를 극복한다. 이를 통해 MRCR 및 GraphWalks 같은 벤치마크에서 장거리 의존성 모델링 능력이 향상되며, GPQA-Diamond, MMLU-Pro, AIME, IFEval 등에서 일반 능력의 손실 없이 성능이 유지된다.
왜 중요한가
에이전트가 다수의 턴에 걸쳐 도구 응답과 환경 정보를 생성하는데, 기존 SFT는 도구 응답을 마스킹하고 로컬 턴 수준의 추론만 학습한다. ACC는 이러한 분산 신호를 하나의 긴 맥락으로 결합해 질문과 증거의 의존 관계를 직접 학습하게 함으로써, 장문 의존성 학습의 감독 신호를 확대하고 기존 방법의 한계를 극복한다. 이를 통해 MRCR 및 GraphWalks 같은 벤치마크에서 장거리 의존성 모델링 능력이 향상되며, GPQA-Diamond, MMLU-Pro, AIME, IFEval 등에서 일반 능력의 손실 없이 성능이 유지된다.
핵심 기여
ACC 제안
다중 턴 에이전트 트래젝토리를 긴 컨텍스트 QA 쌍으로 변환하는 간단하고 보편적인 감독 신호 생성 방법을 제시한다. 원 질문 q와 에이전트 응답/환경 컨텍스트를 하나의 맥락 C로 묶어 최종 답 y를 직접 예측하도록 학습시킨다.
맥락 구성 및 섞기
에피소드별 증거 조각 Evi(τ)를 수집하고 이를 순서를 무작위로 섞은 Ci를 구성한다. 토큰 예산 B를 초과하지 않도록 Ci를 연결하여, 위치 의존 없이 의미적 연관성으로 증거를 찾도록 학습한다.
정답-근거 추론 트레이스 생성
Search/SWE/SQL 트레이젝토리에 대해 정답 yi를 담보하는 근거 추론 트레이스를 DeepSeek-V3.2-Thinking으로 생성하거나 합성하여, 포함된 컴파일된 맥락 Ci에 근거한 reasoning 트레이스를 rr에 보존한다.
MRCR 및 GraphWalks에서의 성능 향상
ACC로 학습한 Qwen3-30B-A3B-Thinking은 MRCR에서 68.28(전체, +18.09), GraphWalks에서 77.51(+7.59)로 향상되어 대규모 대조군 대비 경쟁력을 보이고, GPQA-Diamond, MMLU-Pro, AIME, IFEval 등 일반 벤치마크의 성능도 유지했다.
일반 능력 보존 및 데이터 공개
ACC 학습은 일반적 능력의 하락 없이 다중 벤치마크에서의 성능 향상을 보이며, 데이터셋과 체크포인트를 공개한다.
핵심 아이디어 이해하기
core_intuition_1":
방법론
LACC 목표를 L_ACC 식으로 정의한다: L_ACC = - sum_{j in r U y} log P(token_j | q, C, token<j). 여기에 q와 C(컴파일된 맥락)로 주어진 입력에 대해 최종 답과 추론을 직접 예측하도록 학습한다. 이는 final answer에 직접 영향을 주는 토큰들에 대한 확률을 최적화하며, 로컬 툴 선택의 간접 신호에 의존하지 않게 한다.
Context Construction: τ의 각 trajectory에서 Evi(τ) = [e1, ..., em]를 추출하고, Ci = Concat(eπ(1), ..., eπ(m))로 구성하되 |Ci| ≤ B를 만족한다. 증거 조각들은 서로 독립적으로 구성되어, 순서를 섞어 의미 기반 검색을 유도한다. Answer-verified trajectories는 Groundtruth yi를 보장하나, SWE의 경우 직접 reasoning trace를 얻기 어렵기에, compiled context 및 verified patch를 이용해 reasoning traces를 합성한다.
학습 데이터 및 파라미터: 실험에서 10,802개의 trajectory를 수집하고, compiled context 길이는 2K에서 128K 토큰 사이로 분포된다. 훈련 파라미터는 Sequence length 131,072 tokens, Global batch size 16, Learning rate 1e-5, Cosine LR schedule with 5% warmup, AdamW 최적화, cross-entropy 손실, 4 에폭이다.
평가 및 벤치마크: MRCR(다중_round coreference) 및 GraphWalks를 중심으로 평가하고, GPQA-Diamond, MMLU-Pro, AIME, IFEval 등 일반 벤치마크를 병행한다.
구현적 특징: 10,802개의 trajectory를 3개 에이전트(Search, SWE, SQL)에서 수집하며, 각 에이전트의 맥락 길이 분포가 다르다. 데이터의 구성은 distractor를 포함해 증거의 로컬라이제이션 능력을 향상시키도록 설계되었다.
관련 Figure

ACC의 핵심 아이디어인 다중 턴 증거의 통합 흐름을 직관적으로 보여주며, 방법론(anchor_key: methodology)과 연결된다.
ACC 파이프라인 도식으로 Search/SWE/SQL 에이전트가 생성한 트래젝토리를 긴 컨텍스트 QA 쌍으로 결합하는 흐름을 시각화

ACC 파이프라인의 구체적 실행 예시 및 실험 구성에 대한 시각 자료로 anchor_key: methodology
실험 설정 및 MRCR/GraphWalks를 포함한 비교 구조를 다룬 도식

실험 설정의 구체적 파라미터를 보여주며 anchor_key: methodology
Training 파라미터 및 설정이 표로 제시된 페이지
주요 결과
주요 결과는 MRCR에서 2-needle/4-needle 전체 점수 68.28(+18.09), GraphWalks에서 77.51(+7.59)으로의 상승이다. 이는 Qwen3-235B-A22B와 근접한 수준이며, 전체 파라미터 수가 훨씬 작다. 일반 능력 측정(GPQA-Diamond +2.49, MMLU-Pro +1.50, AIME’25 +3.33)도 개선되며, IFEval에서 대규모 손실 없이 안정적이다. Ablation 연구는 단일 에이전트(검색/ SWE/ SQL)만으로의 학습이 목표에 따라 MRCR/GraphWalks에서 차이를 보이며, distractor의 제거가 증거 지역화에 부정/긍정적 영향을 줄 수 있음을 시사한다. 또한, ACC는 기존 Long-context post-training 방법과의 비교에서도 그래프 Walks에서 우수한 결과를 보이며, 전체적으로 일반 능력의 손실 없이 장문 추론 능력을 향상시켰다.
관련 Figure

훈련 데이터의 벤치마크 간 분포 차이를 보여주며, 실험적 결과의 해석에 도움을 준다. anchor_key: results
UMAP 프로젝션으로 Training Data vs. Benchmarks를 시각화

그래프Walks/MRCR에서의 주의 분포 변화와 전문가 라우팅 변화로, 실험 결과 해석의 근거를 제공한다. anchor_key: results
Attention Distance Delta 및 Expert Routing Delta 히트맵
기술 상세
ACC의 핵심 아이디어는 다중 턴 에이전트 트래젝토리를 하나의 긴 컨텍스트 C로 모으고, 이With 질문 q를 주고 token를 예측하도록 L_ACC를 최적화하는 점에 있다. Context 구성은 각 trajectory에서 유효한 증거 조각을 수집하고, 이를 무작위 순서 π로 재배열해 Ci를 구성한다. 정답 yi에 대해 reasoning rr을 생성하는 과정은 DeepSeek-V3.2-Thinking으로 강화되며, SWE의 경우에도 patch를 기반으로 reasoning trace를 합성한다. 최적화는 L_ACC = - sum_{j in r∪y} log P(token_j | q, C, token<j})로 표현되며, 로컬 툴 선택 대신 전역 컨텍스트를 기반으로 최종 답을 도출한다. 실험 데이터는 10,802개의 trajectoriess를 포함하며, 시퀀스 길이 131,072 토큰의 학습 설정을 따른다. MRCR 및 GraphWalks에서의 벤치마크 성능은 기존 SFT 기반 모델 대비 크게 향상되며, 일반 벤치마크에서도 큰 폭의 악영향 없이 유지된다.
관련 Figure

로컬 턴 수준의 감독과 최종 답변 간의 차이를 수학적으로 설명하는 기술 세부 내용에 해당한다. anchor_key: technical_details
The Supervision Blind Spot of Agent SFT를 다루는 수식 페이지

컨텍스트 구성 과정과 무작위 순서의 중요성을 설명하는 기술적 내용으로 anchor_key: technical_details
Conceputal context 구성 및 합성 흐름이 수식으로 제시된 페이지
실무 활용
ACC는 에이전트 로그를 재활용해 추가적인 인간 주석 없이도 긴 맥락 추론 학습 데이터를 생성할 수 있게 한다. 이는 파인튜닝 데이터 수집 비용을 절감하고, 기존 SFT 파이프라인에 쉽게 통합 가능하다.
- 복잡한 질의에 대한 장문 QA 시스템 구축
- 대규모 소스 코드베이스의 디버깅 및 이력 추적
- 데이터베이스 테이블을 활용한 다중 턴 그래프 탐색 문제 해결
- 로그 또는 대화 세션 기반의 추론 능력 향상
- 도메인 특화 지식의 긴 맥락 의존성 평가 및 개선
코드 공개 여부: 미확인
키워드
용어 해설
- Long Context
- — 장문 컨텍스트에서 증거를 연결하고 해석하는 능력을 다루는 핵심 개념으로, 서로 다른 턴에서 얻은 정보의 통합을 목표로 한다.
- Agent Context Compilation
- — 다중 턴 에이전트의 트래젝토리를 하나의 긴 컨텍스트로 모아, 질문과 근거를 직접 연결하는 학습 데이터를 생성하는 기법이다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.
