Last Translation Benchmark
- 발행일
- 출처
- arXiv
- 논문 번호
- 1069
- 분야
- LLMs / NLP
- arXiv 번호
- 2609.04173
번역 모델이 실제로 실패하는 사람이 만든 어려운 예제 3456개(109개 언어)를 모으고, 예제마다 '검증 규칙'을 붙여 LLM 심판이 규칙 단위로 채점하는 재현 가능한 벤치마크를 제안한 논문이다.
이 논문은 한마디로 최신 번역 모델을 무너뜨리는 어려운 예제를 사람이 만들어 모으고, 예제마다 검증 규칙을 붙여 재현 가능하게 채점하는 새 벤치마크다. 기존 벤치마크는 포화 상태고 자동 지표는 조작에 약하며 사람 평가는 재현이 안 된다는 문제를 풀고자 했다. 텍스트·이미지·오디오·비디오 형식의 예제 3456개를 109개 언어에서 모았고, LLM 심판이 규칙 단위로 참/거짓을 가려 전부 통과해야 성공으로 친다. 살아있는 데이터셋이라 계속 기여를 받으며, 규칙 기반이라 실패 이유까지 해석할 수 있다.
핵심 요약
- 텍스트·이미지·오디오·비디오 형식의 어려운 번역 예제 3456개를 109개 언어에 걸쳐 사람이 만들고 동료 검토까지 거쳤다.
- 각 예제에 '이렇게 번역돼야 한다'는 검증 규칙을 달아, LLM 심판이 규칙 단위로 통과/실패를 판정한다. 전 규칙 통과만 성공으로 인정한다.
- 간단한 영어→체코어 문장(남자 간호사의 성별 표현)에서 Google Translate와 Gemini 3.1 Pro는 0%를 받았고 GPT-5.6 Sol만 통과했다. 강한 모델도 치명적 실수를 한다는 증거다.
- 예제를 다른 언어로 이식하는 실험에서는 자동 필터가 48%를 살렸고 사람 검토로 64.1%가 통과해, 반자동 확장이 가능함을 보였다.
- 데이터는 CC BY 4.0으로 공개됐고 계속 기여를 받는 '살아있는' 벤치마크다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.