Hallucination in World Models is Predictable and Preventable

발행일
출처
arXiv
논문 번호
507
분야
Machine Learning
arXiv 번호
2606.27326

월드 모델의 환각이 데이터 커버리지 부족에서 비롯되며, 가벼운 신호로 예측·완화할 수 있음을 입증한 연구.

이 논문은 생성적 월드 모델의 환각(hallucination)이 근본적으로 데이터 커버리지 문제임을 체계적으로 입증한다. 427시간 분량의 210-task 벤치마크 MMBench2를 구축하고 350M 파라미터 Dreamer 4 모델을 학습시켜, 환각을 세 가지 유형—지각적, 행동 무시, 장면 발산—으로 분류했다. 각 단계별로 환각을 예측하는 세 가지 신호(tokenizer round-trip residual, flow instability, inter-seed denoising variance)를 개발했고, 이를 coverage-aware 샘플링과 curiosity 보상 기반 타겟 데이터 수집에 활용한다. 단 50개의 실제 궤적으로 완전 새로운 환경에 적응할 수 있어, 환각 완화가 아키텍처 변경이 아닌 데이터 전략으로 해결 가능함을 보여준다.

핵심 요약

  • 환각 3가지 유형 정의: perceptual(tokenizer), action marginalization(dynamics), scene divergence(rollout)
  • MMBench2: 65,600 궤도, 427시간, 210-task, 10 도메인, ground-truth action/reward/simulator 포함
  • coverage-aware 학습으로 tokenizer+dynamics 모두 개선 시 rollout ΔPSNR +0.88dB 향상
  • curiosity 기반 50 궤도 수집만으로 unseen 태스크 적응 성능 0.325 달성 (전문가/human 0.362의 ~90%)
  • 환각 예측 신호들이 rollout ΔPSNR과 ρ≈0.80 상관관계를 보임
  • off-the-shelf tokenizer(Wan 2.1 VAE) vs in-domain tokenizer 비교 분석 포함

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)