SWE-Lancer: Can Frontier LLMs Earn $1 Million from Real-World Freelance Software Engineering?

발행일
출처
arXiv
논문 번호
035
분야
Benchmarks / Code Agents
arXiv 번호
2502.12115

OpenAI는 총 가치 100만 달러에 달하는 Expensify의 실제 프리랜스 소프트웨어 공학 작업 1,400개 이상을 사용해 대규모 언어 모델을 풀스택 개발과 관리적 의사결정 능력에서 평가하는 벤치마크 SWE-Lancer를 도입한다.

OpenAI는 총 가치 100만 달러에 달하는 Expensify의 실제 프리랜스 소프트웨어 공학 작업 1,400개 이상을 사용해 대규모 언어 모델을 풀스택 개발과 관리적 의사결정 능력에서 평가하는 벤치마크 SWE-Lancer를 도입한다. 이 평가는 Claude 3.5 Sonnet 같은 프런티어 모델이 지급 가능한 보상의 일부를 벌 수 있지만 이러한 복잡한 작업을 완전히 자동화하기에는 여전히 부족함을 드러내며, 근본 원인 분석과 다중 구성 요소 상호작용에서 상당한 개선 여지가 있음을 보여준다.

핵심 요약

  • 기존 LLM 코딩 벤치마크는 단위 테스트에 의존해 채점기 해킹에 취약하며, 복잡한 풀스택 소프트웨어 공학 작업을 검증하기에 불충분하다.
  • 이전 평가들은 직접적인 경제 지표가 부족해, 실제 소프트웨어 개발 시나리오에서 LLM 출력의 실질적인 금전적 가치를 정량화하지 못한다.
  • 현재 벤치마크는 상업적 프리랜스 소프트웨어 공학 작업의 다양하고 모호하며 포괄적인 성격보다는 고립된 프로그래밍 문제나 특정 저장소에 초점을 맞춰 범위가 좁은 경우가 많다.
  • 총 100만 달러에 달하는 실제 금전적 보상이 걸린 Expensify의 실제 프리랜스 소프트웨어 공학 작업 1,400개 이상을 특징으로 하는 벤치마크 SWE-Lancer를 개발했다.
  • 코드 패치 생성을 요하는 개별 기여자(IC) SWE 작업과, 모델이 여러 제안 중 최적의 해법을 선택하는 SWE 관리 작업의 두 가지 작업 유형을 포함했다.
  • Playwright로 작성하고 전문 엔지니어가 3중 검증한 종단간(E2E) 테스트를 활용하는 엄격한 5단계 파이프라인을 채택해, 견고하고 해킹 불가능한 평가를 보장했다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)