FAPO: Fully Autonomous Prompt Optimization of Multi-Step LLM Pipelines

발행일
출처
arXiv
논문 번호
464
분야
Software Engineering
arXiv 번호
2606.19605

Claude Code를 활용해 다단계 LLM 파이프라인의 프롬프트와 구조를 자동 최적화하는 프레임워크. 18개 비교 중 15개에서 GEPA 이기고, 구조 변경 시 평균 +33.8pp 향상.

FAPO는 Claude Code를 오케스트레이터로 사용해 다단계 LLM 파이프라인을 평가-진단-수정-검증하는 완전 자동 최적화 프레임워크다. 프롬프트 수정을 먼저 시도하고, attribution이 구조적 병목을 지목할 때만 파이프라인 구조 변경으로 에스컬레이션한다. 6개 벤치마크·3개 태스크 모델에서 GEPA 대비 18회 중 15회 승리(평균 +14.1pp), 구조 변경이 발생한 HoVer/IFBench에서는 6/6 승리에 평균 +33.8pp 향상을 기록했다.

핵심 요약

  • Claude Code 기반 최적화 루프: 파이프라인 평가 → intermediate step 분석(failure attribution) → scoped change 제안 → safety review → 검증
  • Prompt-first 전략: 프롬프트 수정 우선, attribution이 구조적 병목을 지목할 때만 chain 구조/파라미터 변경으로 에스컬레이션
  • LangGraph 기반 stateful graph 파이프라인 표현, 테넌트별 격리된 워크스페이스로 재현성 보장
  • 6 벤치마크 × 3 모델 = 18회 비교 중 15회 GEPA 승리, 평균 +14.1pp; HoVer/IFBench 구조 변경 시 6/6 승리, 평균 +33.8pp
  • 보안 태스크 CTIBench-RCM에서 GPT-5 +4.0pp, Foundation-Sec-8B-Instruct +7.1pp, Foundation-Sec-8B-Reasoning +2.0pp 향상
  • step-attribution subagent가 프롬프트 수정 가능 vs 구조적 병목을 분류하여 불필요한 구조 변경을 방지

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)