HERO'S JOURNEY: Testing Complex Rule Induction with Text Games
- 발행일
- 출처
- arXiv
- 논문 번호
- 299
- 분야
- LLMs / NLP
- arXiv 번호
- 2606.02556
이 논문은 목표 지향적 에피소드 작업에서의 규칙 귀납을 위한 벤치마크인 HERO'S JOURNEY를 소개한다. 여기서 에이전트는 시연으로부터 숨겨진 규칙을 추론하고 다단계 실행을 통해 그에 따라 행동해야 한다.
HERO'S JOURNEY는 에이전트가 시연에서 숨은 규칙을 알아내고 여러 단계를 실행해 목표를 이루는 능력을 평가하는 텍스트 게임 벤치마크다. 속성 규칙과 절차 규칙 계열의 여덟 과제에 네 가지 구조 형태, 조절 가능한 단어 연결과 규칙 식별 조건을 넣었다. 최신 LLM들은 규칙을 어느 정도 찾아냈지만 과제별 차이가 컸고, 규칙을 알아도 긴 절차를 실행하는 과정이 별도 병목이 됐다. 귀납을 돕는 조향법은 속성 과제에는 도움이 됐지만 절차 과제에서는 믿을 만한 향상이 없었다. 다만 완전 합성 환경이고 새 과제의 식별 조건을 사람이 설계해야 하므로, 잡음이 많은 현실 상황으로 결과가 이어지는지는 더 확인해야 한다.
핵심 요약
- 이 논문은 목표 지향적 에피소드 작업에서의 규칙 귀납을 위한 벤치마크인 HERO'S JOURNEY를 소개한다. 여기서 에이전트는 시연으로부터 숨겨진 규칙을 추론하고 다단계 실행을 통해 그에 따라 행동해야 한다.
- 최첨단 LLM을 평가한 결과, 모델이 규칙 귀납의 증거를 보이지만 그 능력이 제한적이며 작업 간에 고르지 않다는 것을 발견했다.
- 귀납 특화 스티어링 방법은 속성 작업에서는 성능을 향상시키지만 절차적 작업에서는 신뢰할 만한 향상을 보이지 못하며, 이는 절차적 귀납의 격차가 여전히 미해결 과제로 남아 있음을 시사한다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.