ExplorationBench: Measuring AI Systems' Exploration in Verifiable Alien Worlds
- 발행일
- 출처
- arXiv
- 논문 번호
- 1120
- 분야
- Evaluation
- arXiv 번호
- 2609.30199
가상 '에일리언 세계'에서 AI가 정말 탐색으로 새 규칙을 발견하는지 측정하는 벤치마크를 만들었다. 자율 과학 탐색 능력 평가의 공백을 메운다.
이 논문은 한마디로 AI가 처음 보는 세계에서 가설을 세우고 실험하며 규칙을 발견하는 능력을 검증 가능하게 측정하는 벤치마크다. AlienCode와 AlienLogic 두 샌드박스는 규칙이 실행 가능해 정답을 정확히 채점할 수 있고, 기존 지식과 충돌하도록 설계해 암기로는 풀 수 없다. 시스템은 결함 있는 매뉴얼과 도구만으로 탐색한 뒤 70개 홀드아웃 과제를 푼다. 10개 시스템 평가 결과 최상위 시스템은 낯선 규칙을 습득·적용했지만 궤적 편차가 크고 탐색이 정체·역행하기도 했다.
핵심 요약
- 실행 가능한 규칙으로 정답 채점이 가능한 AlienCode(31개 발견 대상·70 과제)와 AlienLogic(24개·70 과제) 샌드박스를 만들었다
- 사전지식과 충돌하는 '에일리언' 설계로 암기가 아닌 진짜 탐색만으로 풀리게 했다
- 결함 있는 매뉴얼에서 출발해 자기 선택 프로브로 규칙을 찾는 마일스톤 평가 구조를 도입했다
- 10개 시스템 평가에서 최상위 시스템은 낯선 규칙을 습득·적용했으나 궤적 간 편차가 컸다
- 탐색을 계속해도 성과가 정체되거나 오히려 나빠지는 역행 사례가 관찰됐다
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.