TL;DR
에이전트가 2025년 겨울부터 실용적으로 작동하기 시작한 이유는 모델 가중치만 좋아져서가 아니라 모델과 하네스의 개선 곡선이 교차했기 때문입니다. 초기 AutoGPT와 BabyAGI는 낮은 모델 신뢰도에 자율 루프를 덧붙여 오류를 누적했지만, Claude Code는 reasoning model의 역량이 충분해진 시점에 터미널과 권한 규칙을 결합해 자율성을 다시 모델에 맡겼습니다. 현재는 RL이 실제 하네스 환경 안으로 들어가고 모델이 도구 사용과 compaction을 흡수하면서 외부 하네스가 줄어드는 흐름이 나타났으며, Harness-Bench에서는 동일 모델도 하네스에 따라 52.4점에서 76.2점까지 차이가 났습니다. 앞으로 남는 하네스의 핵심은 모델이 흡수할 수 없는 인간의 권한·신뢰·가시성과 주의 관리이며, 에이전트가 언제 사람을 중단시키고 어떤 결정을 승인받을지 정하는 Attention-Interface가 새로운 설계 계층이 됩니다.
섹션별 상세

용어 해설
- 에이전트 하네스(Agent Harness)
- — 에이전트 하네스는 모델 가중치 외부에서 LLM의 작동을 가능하게 하는 환경, 도구, 컨텍스트, 메모리, 권한, 가드레일의 결합체입니다. 모델의 판단을 실제 디지털 공간의 행동으로 연결하며, 모델이 기능을 흡수할수록 하네스의 외부 구성 요소는 줄어듭니다.
- 모델 역량 초과분(Model Capability Overhang)
- — 모델 역량 초과분은 모델이 현재 하네스가 활용하는 수준보다 더 높은 능력을 갖춘 상태를 뜻합니다. 이때 하네스가 모델의 행동을 과도하게 제한하면 이미 확보된 추론·도구 사용 능력이 제품 안에서 충분히 발휘되지 못합니다.
- 추론 보존(Retained Reasoning)
- — 추론 보존은 에이전트가 이전 작업에서 생성한 추론 정보를 유지해 다음 컨텍스트에서도 활용하는 방식입니다. 원문에서는 추론 보존과 compaction만으로 GPT-5.6 Sol의 ARC-AGI-3 점수가 13.3%에서 38.3%로 상승한 사례가 제시됩니다.
- 컨텍스트 압축(Context Compaction)
- — 컨텍스트 압축은 긴 작업에서 이전 대화와 실행 기록을 요약·정리해 제한된 컨텍스트 창 안에 필요한 정보를 남기는 처리입니다. 모델이 자신의 컨텍스트 창을 고려해 압축하도록 학습되면 하네스의 외부 메모리 기능 일부가 모델 가중치 안으로 흡수될 수 있습니다.
- 어텐션 인터페이스(Attention-Interface)
- — 어텐션 인터페이스는 에이전트가 인간의 제한된 동기식 주의를 언제 요청하고 어떤 판단을 스스로 처리할지 정하는 인간 중심의 하네스 계층입니다. 중단 시점, 승인 필요 여부, 계속 작업할 조건, 결정의 가시성을 정책으로 관리하며 인간과 에이전트 사이의 새로운 병목을 다룹니다.
기술
- ReAct
- RLHF
- Toolformer
- AutoGPT
- BabyAGI
- Cursor
- Copilot
- Devin
- o1
- Claude Code
- bash
- Harness-Bench
- GPT-5.6 Sol
- ARC-AGI-3
- codex-1
- GPT-5.1-Codex-Max
- AGENTS.md
활용 사례
- 터미널 기반 자율 코딩 에이전트
- 파일 읽기·쓰기와 bash 실행을 결합한 개발 작업
- 에이전트의 장기 실행 progress files
- 인간 승인 큐를 활용한 에이전트 운영
- 인간별 중단·승인·자율 실행 정책 관리
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.