Before They Can Solve: Predicting Post-Training Coding-Agent Performance from Base Models

발행일
출처
arXiv
논문 번호
1187
분야
LLMs / NLP
arXiv 번호
2610.10478

비싼 에이전트 후속학습을 하기 전에, 기본 모델만으로 '후속학습 후 코딩 에이전트 성능'을 예측하는 3가지 스크리닝 방법이다. SWE-bench Verified pass@1과 스피어먼 상관 0.96~0.99를 달성했다.

이 논문은 한마디로 어떤 기본 모델이 에이전트 후속학습을 하면 코딩 에이전트로 잘 자랄지 미리 예측하는 방법이다. 저자들은 성공한 에이전트 궤적을 되돌려 재실행하며, 테스트가 FAIL에서 PASS로 처음 뒤집히는 '결정적 스텝'을 찾는다. 그 스텝에서 기본 모델에 3가지 검사를 한다: 황금 액션의 확률질량(BPB), 정답/오답 선택 구분(MCQ), prefix 조건부 pass@K. 10쌍의 공개 모델에서 이 검사들이 후속학습 성능과 0.96 이상 순위 상관을 보였다. 기존 비에이전트 코딩 벤치마크는 상관이 -0.39~0.83으로 들쭉날쭉해, 이 방법이 훨씬 믿을 만하다.

핵심 요약

  • 성공 궤적을 재실행해 테스트가 처음 통과로 뒤집히는 '결정적 스텝 T*'를 찾고, 그 지점에서 기본 모델을 직접 검사하는 프레임워크를 만들었다.
  • 3가지 검사(Decisive-Action BPB, Patch MCQ, prefix-conditioned pass@K)가 각각 스피어먼 ρ=0.964, 0.903, 0.988로 후속학습 SWE-bench Verified pass@1과 강한 순위 일치를 보였다.
  • 기존 비에이전트 코딩 벤치마크(HumanEval 등)는 상관 -0.39~0.83으로 불안정해, base 모델 선택 지표로 부적합함을 확인했다.
  • 이 검사는 성공 궤적과 검증기(verifier)만 있으면 되므로, 향후 에이전트 벤치마크를 base 모델 평가로 바꿔 쓸 수 있다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)