SWE-Together: Evaluating Coding Agents in Interactive User Sessions

발행일
출처
arXiv
논문 번호
535
분야
Software Engineering
arXiv 번호
2606.29957

실제 사용자-에이전트 코딩 세션에서 재구축한 멀티턴 벤치마크 109개. 정적 벤치마크의 한계 극복, 상호작용 품질과 사용자 수정 횟수로 평가.

SWE-Together는 실제 사용자-에이전트 코딩 세션 11,260개에서 재구축한 109개 리포지토리 수준 태스크로 구성된 멀티턴 벤치마크다. 반응형 LLM 사용자 시뮬레이터가 원래 사용자의 의도를 보존하면서 에이전트 진행에 따라 피드백을 제공한다. 최종 코드 정확도뿐 아니라 사용자 수정 횟수(User Correction)를 측정하여 협업 품질을 평가한다.

핵심 요약

  • 11,260개 실제 세션에서 109개 검증 가능한 태스크 추출 (0.97% 전환율)
  • 상태 조건부 LLM 사용자 시뮬레이터: 원래 의도 보존 + 궤적 적응형 피드백
  • 최종 정확도 + User Correction(수정 턴 수) + Intent Coverage로 다차원 평가
  • 강한 에이전트일수록 더 높은 성공률 + 더 적은 개입 횟수 → 사용자 경험 개선 시사
  • 정적 SWE-Bench 방식의 한계: 단턴 명령 + 최종 코드만 평가로 실제 상호작용 누락
  • 4개 업스트림 데이터소스(DataClaw, Pi-staging, Hyperswitch, SWE-chat) 활용

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)