Tencent WorkBuddy Bench: A Multi-Domain Coding-Agent Benchmark with Contamination-Resistant Task Construction
- 발행일
- 출처
- arXiv
- 논문 번호
- 702
- 분야
- LLMs / NLP
- arXiv 번호
- 2607.20911
텐센트가 코딩 에이전트(프로그래밍 AI)를 4개 실무 영역에서 평가하기 위해 만든 오염 방지 벤치마크다. 웹 검색으로 정답을 외워서 통과하는 것을 막았다.
이 논문은 한마디로 코딩 에이전트(코드 작성 AI)를 4개 실무 영역(코드, 웹, 오피스, 보안)에서 평가하는 벤치마크를 만들되, 기존 공개 데이터를 그대로 쓰지 않고 실제 커밋·PR을 역설계해서 웹 검색으로는 원본을 찾을 수 없게 한 것이 핵심이다. 각 작업은 페르소나 기반 일상 언어로 다시 쓰여서 데이터 오염(모델이 인터넷에서 정답을 외워버리는 현상)을 방지한다. 260개 작업을 두 가지 에이전트 하네스(CodeBuddy Code, Claude Code)로 평가했다. 상위 모델로 Claude Opus 4.8(75.0%), GLM-5.2(72.9%) 등의 결과를 얻었다.
핵심 요약
- 실제 커밋·PR·보안 시나리오를 역설계해 웹 검색으로 원본을 찾을 수 없는 작업을 만들었다.
- 4개 영역(코드 80개, 웹 70개, 오피스 50개, 보안 60개) 총 260개 작업으로 구성했다.
- 각 작업은 일상적이고 구어체인 페르소나 요청으로 재작성되어 오염을 방지한다.
- Claude Opus 4.8이 종합 75.0%로 1위, GLM-5.2가 72.9%로 2위를 기록했다.
- 전체 코드, 환경 이미지, 평가 도구를 공개해서 누구나 재현 및 감사할 수 있다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.