FAPO: Fully Autonomous Prompt Optimization of Multi-Step LLM Pipelines
- 발행일
- 출처
- arXiv
- 논문 번호
- 464
- 분야
- Software Engineering
- arXiv 번호
- 2606.19605
Claude Code를 활용해 다단계 LLM 파이프라인의 프롬프트와 구조를 자동 최적화하는 프레임워크. 18개 비교 중 15개에서 GEPA 이기고, 구조 변경 시 평균 +33.8pp 향상.
FAPO는 Claude Code를 오케스트레이터로 사용해 다단계 LLM 파이프라인을 평가-진단-수정-검증하는 완전 자동 최적화 프레임워크다. 프롬프트 수정을 먼저 시도하고, attribution이 구조적 병목을 지목할 때만 파이프라인 구조 변경으로 에스컬레이션한다. 6개 벤치마크·3개 태스크 모델에서 GEPA 대비 18회 중 15회 승리(평균 +14.1pp), 구조 변경이 발생한 HoVer/IFBench에서는 6/6 승리에 평균 +33.8pp 향상을 기록했다.
핵심 요약
- Claude Code 기반 최적화 루프: 파이프라인 평가 → intermediate step 분석(failure attribution) → scoped change 제안 → safety review → 검증
- Prompt-first 전략: 프롬프트 수정 우선, attribution이 구조적 병목을 지목할 때만 chain 구조/파라미터 변경으로 에스컬레이션
- LangGraph 기반 stateful graph 파이프라인 표현, 테넌트별 격리된 워크스페이스로 재현성 보장
- 6 벤치마크 × 3 모델 = 18회 비교 중 15회 GEPA 승리, 평균 +14.1pp; HoVer/IFBench 구조 변경 시 6/6 승리, 평균 +33.8pp
- 보안 태스크 CTIBench-RCM에서 GPT-5 +4.0pp, Foundation-Sec-8B-Instruct +7.1pp, Foundation-Sec-8B-Reasoning +2.0pp 향상
- step-attribution subagent가 프롬프트 수정 가능 vs 구조적 병목을 분류하여 불필요한 구조 변경을 방지
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.