Function-Aware Fill-in-the-Middle as Mid-Training for Coding Agent Foundation Models

발행일
출처
arXiv
논문 번호
625
분야
AI / General
arXiv 번호
2607.12463

함수 호출부 = coding agent step 동형, FIM mid-training으로 SWE-Bench 향상.

코드 에이전트의 action-observation-continuation 루프가 함수 호출부(context-call-return-continuation)와 구조적으로 동형임을 관찰했다. PDG(program dependency graph) 분석으로 복잡도-추론가능성 이중 기준으로 마스킹 대상 함수를 선택하고 CoT rationale을 FIM middle에 포함시킨다. 968개 GitHub repo, 2.6B 토큰 코퍼스로 Qwen2.5-Coder 7B/14B와 Qwen3-8B에 적용해 SWE-Bench-Verified +2.8/+3.0/+3.2, Lite +3.7/+4.0/+5.4를 달성했다. Python만으로 학습해도 tau-bench, BFCL, LiveCodeBench 등 비코드 tool-use 벤치마크까지 개선되어 함수 호출 구조의 일반성을 입증한다. 다중 함수 패치에서 +9.1pp로 구조적 정렬 효과가 집중됨을 확인했다.

핵심 요약

  • 코딩 에이전트의 행동·관측·계속 구조가 함수 호출·반환 구조와 닮았다는 점을 이용해 함수 인식 FIM 중간학습을 설계했다.
  • 프로그램 의존 그래프와 복잡도·추론 가능성 기준으로 가릴 함수를 골라 968개 GitHub 저장소의 26억 토큰으로 학습했다.
  • Qwen 계열 7B, 14B, 8B 모델에서 SWE-Bench-Verified가 각각 2.8점, 3.0점, 3.2점 향상됐다.
  • 여러 에이전트 후학습 절차에서 효과가 유지되고 일반 코딩과 비코딩 도구 사용의 능력 저하도 완화했다.
  • 학습 말뭉치와 평가는 Python에 집중됐고 사고 설명 생성은 교사 모델에 의존해 다른 언어와 교사 없는 설정은 검증되지 않았다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)