왜 중요한가
다중 단계 LLM 파이프라인은 Retrieval, Reasoning, Formatting 간의 상호작용으로 프롬프트 단독 최적화만으로는 병목을 해결하기 어렵다. FAPO는 실패를 단계별로 attribution하고 프롬프트 에디트에서 시작해 필요 시 파이프라인 구조를 바꿔가며 반복적으로 최적화를 수행한다.
핵심 기여
Claude Code 기반 파이프라인 최적화 기술
FAPO는 Claude Code를 구동 층으로 활용하여 파이프라인의 현재 상태를 평가하고, 실패를 단계별로 진단한 뒤 프롬프트 에디트를 우선 적용한다. 프롬프트 에디트가 충분하지 않다고 판단되면 한정된 범위에서 파이프라인의 설정(파라미터)이나 구조를 바꾼다.
재현 가능한 워크스페이스 및 평가 루프
테넌트 워크스페이스를 중심으로 사전에 정의된 규칙(scope contract)과 검토자(variant-reviewer)에 의해 변경이 검증되며, 모든 변형은 고유 버전으로 기록되어 재현성과 추적이 가능하다.
6개 벤치마크·3개 모델에서 GEPA 대비 성능 우위
FAPO는 6개 벤치마크와 3개 태스크 모델에 대해 GEPA와 비교하여 15/18 모델–벤치마크 조합에서 우위를 보였고, 평균 이득은 +14.1 pp에 이른다. HoVer/IFBench에서의 구조적 변경 사례에서도 큰 이득을 실현했다.
보안 태스크에서의 프롬프트-에디트 효과 확대
CTIBench-RCM에서 GPT-5, Foundation-Sec-8B-Instruct, Foundation-Sec-8B-Reasoning 모델의 정확도가 각각 +4.0pp, +7.1pp, +2.0pp 상승했다.
핵심 아이디어 이해하기
단락 1: 다중 단계 파이프라인에서 프롬프트 단일 조정만으로는 전체 파이프라인의 성능을 설명하기 어렵고, 각 단계의 실패가 후속 단계에 누적되어 성능 저하를 유발한다. 기존의 프롬프트 최적화는 파이프라인 구조의 변화를 간과하는 경향이 있다.
방법론
단락 1: FAPO는 파이프라인을inspectable한 워크플로우로 취급하고, current pipeline의 입력/출력과 중간 산출물을 기록한다. 단락 2: 실패를 단계별로 분류하는 step-attribution 서브에이전트와 제안 후보를 검토·허용 수준(scope contract)에서 검토하는 variant-reviewer가 존재한다. 단락 3: 프롬프트 에디트로 시작해 점차적으로 설정(파라미터)이나 파이프라인 구조의 변경으로 확장하는 계층적 탐색을 수행한다. 단락 4: 프롬프트-레벨의 개선이 충분하지 않을 때에만 파이프라인 구조까지 확장하며, 다중-테넌트 격리와 안전 가드레일을 적용한다.
관련 Figure

이 도식은 FAPO의 핵심 흐름과 제약 조건을 직관적으로 보여주며, 프롬프트 수정에서 시작해 구조적 변경으로 확장하는 정책을 시각적으로 확인할 수 있다.
FAPO의 파이프라인 최적화 루프 다이어그램으로 Evaluate→Attribute→Propose→Review→Compare→Keep moving의 순환과 Guardrails가 표현됨
주요 결과
주요 벤치마크에서 FAPO의 평균 이득은 +14.1pp로 요약된다. HotpotQA, HoVer, IFBench 등에서 프롬프트 수준에서의 개선만으로도 다수의 조합에서 GEPA를 능가했다. HoVer와 IFBench의 경우 구조적 변경이 필요했으며, 24.78pp에서 48.56pp까지의 개선을 보였다. CTIBench-RCM에서 보안 태스크의 경우 GPT-5에서 +4.0pp, Foundation-Sec-8B-Instruct에서 +7.1pp, Foundation-Sec-8B-Reasoning에서 +2.0pp의 향상을 보였다. AIME 벤치마크에서는 GEPA가 우세했고, FAPO의 결과는 불일치로 간주되었다. AIME를 제외한 나머지 벤치마크에서 프롬프트-레벨 최적화의 이점이 입증되었고, 프롬프트-최적화와 파이프라인 구조 최적화 간의 트레이드오프가 관찰되었다.
관련 Figure

벤치마크별 성능 추세와 FAPO의 최적화 효과를 한 눈에 확인 가능하며, 프롬프트-레벨에서의 개선이 파이프라인 구조 변경으로 확장되었을 때의 이득을 시각적으로 강조한다.
HotpotQA, Papillon, LiveBench-Math의 validation trajectories를 나타내는 차트로, Run/Peak Final 점수와 baseline 대비 향상을 보여줌
기술 상세
단락 1: 시스템 개요—FAPO는 Claude Code를 최적화 루프의 오케스트레이터로 사용하고 LangGraph를 파이프라인 표현으로 채택한다. 단락 2: 핵심 메커니즘—step-attribution 에이전트는 각 평가 케이스의 실패를 프롬프트 addressable vs 구조적로 분류하고, dominant failure cluster에 대해 scoped variant를 제안한다. 단락 3: Prior work 대비 차별점—GEPA는 프롬프트 문자열 기반의 고정 DSPy 체계에서 벗어나, FAPO는 실패 증거에 기반한 계층적 탐색과 다 tenant 구성을 통한 재현성, guardrails를 강조한다. 단락 4: 구현 학습 세부사항—테넌트 워크스페이스 구조, EvalConfig, ChainConfig, LangGraph 실행 흐름, run artifacts 및 결과의 step_timings 기록, 차후 재현성 확보를 위한 variant immutability를 도입한다. 단락 5: 이론적 기반—프롬프트-의존성 및 파이프라인 bottleneck의 분리 원칙, 최신 파이프라인 최적화 연구와의 연계, 제한조건 하에서의 탐색 공간 제약 등을 기술한다.
한계점
AIME 벤치마크에서의 일관된 개선을 보이지 못했고, 프롬프트-단계의 개선이 충분하지 않아 구조적 변경이 필요하다고 판단되는 경우가 있었다. 또한 프롭션-변형 간의 경로 의존성으로 실행 간 변동성이 커질 수 있으며, 벤치마크와 모델 조합에 따라 성능 차이가 크게 나타날 수 있다.
실무 활용
다중 단계 LLM 파이프라인에서 프롬프트와 파이프라인 구성을 함께 탐색하는 자동화된 최적화 도구가 실무에 적용 가능하다. Claude Code 오케스트레이터를 통해 재현 가능한 워크플로우를 제공하고, 보안 태스크에서도 효과를 입증했다.
- 다중-도메인 QA 파이프라인의 성능 최적화
- 보안 태스크의 CWE 분류 파이프라인 개선
- RAG 파이프라인의 프롬프트 및 구성 변경에 따른 비용 절감
- 대규모 파이프라인의 버전 관리 및 재현성 확보
코드 공개 여부: 공개
코드 저장소 보기키워드
용어 해설
- LangGraph
- — 파이프라인을 그래프로 표현· 관리하는 라이브러리로, 각 노드의 입력·출력 및 중간 산출물을 명시적으로 기록하여 파이프라인의 흐름을 분석하고 최적화를 지원한다.
- Claude Code
- — Claude Code를 활용해 파이프라인 최적화 루프를 실행하는 엔진으로, 프롬프트 편집에서 시작해 파이프라인 구조 변경까지의 결정 과정을 제어한다.
- FAPO
- — Fully Automated Prompt Optimization의 약자이며, 다중 단계 LLM 파이프라인의 프롬프트 및 구조를 자동으로 탐색· 최적화하는 프레임워크를 지칭한다.
- GEPA
- — Prompt-기반 파이프라인 최적화를 수행하는 기존 도구로, GEPA 대비 FAPO의 개선 효과를 비교하는 벤치마크의 상대적 기준점으로 사용된다.
- DSPy
- — LLM 기반 모듈의 프롬프트 최적화를 컴파일된 파이프라인으로 구현하는 시스템으로, FAPO의 대조군으로 언급된다.
- CTIBench-RCM
- — 보안 취약점(CVE)을 CWE로 매핑하는 루브릭으로, CTIBench-RCM 태스크는 프롬프트-에디트의 효과를 보안 태스크에서 검증한다.
- HotpotQA
- — 다중 단락 질의응답 벤치마크로, Retrieval-다중 홉 의사결정 파이프라인의 성능을 평가한다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.