섹션별 상세
Intent-execution gap은 모델이 의도한 작업과 harness가 실행한 결과 사이의 불일치로, 에이전트 성능의 주요 병목이다. 코드 수정 시 harness가 모호한 요청을 잘못 해석하거나, 파편화된 코드 조각을 수정하여 발생하는 오류가 대표적이다.
도구 인터페이스 최적화를 위해 bash 출력의 길이를 적절히 제한하고, 파일 편집 시 정확한 컨텍스트를 요구하여 모호성을 제거한다. 단순한 '성공' 메시지 대신 diff 파일을 제공하여 모델이 실행 결과를 검증하고 상태를 파악하도록 돕는다.
Reasoning nudge는 모델이 내부 추론에만 매몰되지 않도록 외부 환경과 상호작용을 유도하는 기법이다. Claude 모델은 정량적 도구 호출 목표를 통해, Gemini나 Grok은 도구 사용을 장려하는 유연한 지침을 통해 성능을 개선한다.

모델마다 도구 호출 방식과 피드백 해석에 고유한 선호도가 존재한다. Grok은 원자적 도구 호출을 선호하고 Claude는 특정 포맷을 선호하는 등, harness가 모델의 학습된 행동에 맞춰 인터페이스를 조정해야 한다.
SSA는 SWE-Bench-Verified, SWE-Bench-Pro, Terminal-Bench-2에서 일관된 성능 향상을 기록했다. 특히 제한된 환경(constrained setting)에서 인프라 선택과 도구 호출 방식이 성능에 미치는 영향을 분석하여 최적의 에이전트 설계를 도출했다.

기술
- Claude
- Gemini
- Grok
- SWE-Bench
- Terminal-Bench-2
활용 사례
- 코드 리포지토리 자동 수정
- 대화형 터미널 에이전트
- 에이전트 성능 평가 및 최적화
AI 분석 전체 내용 보기
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
원문 발행 2026. 06. 09.수집 2026. 06. 09.출처 타입 RSS
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.