TRIM: Reducing AI-Generated CodeSlop via Agent Trajectory Minimization

발행일
출처
arXiv
논문 번호
680
분야
Software Engineering
arXiv 번호
2607.18161

코딩 에이전트가 정답에 도달하는 과정에서 남긴 불필요한 편집(CodeSlop)을 에이전트의 작업 기록을 거슬러 되돌리며 걷어내는 알고리즘 TRIM을 제안한 논문이다.

코딩 에이전트가 만든 패치는 사람이 쓴 것보다 크고 장황하다. 이 논문은 원인을 에이전트의 탐색 과정에서 찾는다. 시도했다가 버린 수정, 임시 변경이 최종 패치에 그대로 남는다는 것이다. 저자들은 이런 잔여물을 CodeSlop이라 정의하고, 최종 패치가 아니라 에이전트의 수리 기록(trajectory)을 대상으로 되돌림을 시도하는 계층적 반사실 탐색 알고리즘 TRIM을 제시했다. 네 개 에이전트 프레임워크와 두 벤치마크에서 CodeSlop을 17.8~32.9% 줄였고 정확도 손실은 거의 없었다.

핵심 요약

  • CodeSlop을 코드 겉모습(장황함, 중복)이 아니라 기능 기준으로 정의했다. 지워도 테스트가 그대로 통과하는 편집이 CodeSlop이다.
  • 원인은 에이전트의 탐색 과정이다. 정답을 찾을 때까지 시도한 편집을 굳이 되돌릴 이유가 없어서 최종 패치에 남는다.
  • 에이전트에게 스스로 패치를 줄이라고 시키는 방식은 불안정했다. 3.8~44.9% 사례에서 동작이 깨지거나 오히려 패치가 커졌다.
  • TRIM은 최종 패치 대신 작업 기록을 탐색 공간으로 삼는다. 편집의 시간 순서가 의존 관계를 근사해 주기 때문이다.
  • 굵은 덩어리부터 통째로 빼보고 통과하면 확정, 안 되면 더 잘게 쪼개는 계층적 방식이라 검증 실행 비용이 Delta Debugging의 절반 수준이다.
  • SWE-Bench-Verified에서 성공 패치 330건 중 327건(99.1%)의 정답성을 유지했고, 18건은 사람이 쓴 정답 패치와 완전히 같아졌다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)