WorldExam: Benchmarking World Models from Apparent Appearance to Inherent Reactivity

발행일
출처
arXiv
논문 번호
797
분야
Computer Vision
arXiv 번호
2608.02603

영상 생성 기반 월드모델을 겉모습이 아니라 세상이 스스로 반응하는가로 평가하는 계층형 진단 벤치마크 WorldExam을 만들고, 대표 모델 20개를 재봤다.

기존 월드모델 벤치마크는 화질이나 지시한 동작을 그대로 냈는지만 주로 확인해서, 입력에 적히지 않은 결과를 장면 상태로부터 추론해 내는 능력은 거의 검사하지 못했다. 저자들은 Visual Quality, Control Adherence, Spatial Consistency, World Reactivity 네 단계로 나눈 진단 벤치마크 WorldExam을 제안했다. 8개 과제에 1,474개 사례를 담았고, 카메라 입력, 이산 행동 입력, 자연어 입력 세 가지 조작 방식을 원자 단위 제어로 변환해 한 파이프라인에서 함께 평가한다. World Reactivity 단계에서는 모델에 주는 지시에 명시적 제어나 목표만 적고 장면이 어떻게 반응해야 하는지는 일부러 빼둔다. 대표 모델 20개를 평가한 결과, 카메라 방식은 카메라 제어에 강하지만 동적 상호작용 자체를 지원하지 못했고, 행동 방식은 주체 제어는 정확하나 주변 세계가 반응하지 않았으며, 언어 방식은 상호작용은 낫지만 복잡한 제어를 잘 따르지 못했다.

핵심 요약

  • 벤치마크 규모는 조작 방식 3종, 진단 단계 4개, 평가 과제 8개, 테스트 사례 1,474개다. 평가 대상 모델은 20개다.
  • 8개 과제는 Camera Control, Subject Control, Scene Revisit, Terrain Interaction, Object Interaction, Social Interaction, Physical Reaction, Goal Completion이다. 앞의 세 개는 지시 이행과 공간 일관성을 본다. 그다음 네 개는 장면을 보고 세계가 알아서 반응하는지를 보고, 마지막 Goal Completion은 높은 수준의 목표만 주고 실행 단계를 스스로 짜는지를 본다.
  • 같은 행동을 원자 단위 제어로 쪼갠 뒤 모델별 입력 방식에 맞춰 변환한다. 카메라 방식에는 SE(3) 카메라 궤적(위치와 방향을 함께 적은 카메라 이동 경로), 행동 방식에는 이산 행동열, 언어 방식에는 자연어 프롬프트를 준다.
  • World Reactivity 사례에서는 기대되는 반응을 지시문에서 뺀다. 예를 들어 계단 앞에서 앞으로 가라는 제어만 주고, 계단을 오르는 수직 적응은 모델이 장면을 보고 스스로 만들어야 한다.
  • 모델 호환성을 위해 트랙을 둘로 나눴다. 카메라만 움직이는 정적 장면 트랙은 세 방식 모두 평가하고, 주체와 환경의 상호작용이 보여야 하는 동적 상호작용 트랙은 행동 방식과 언어 방식만 평가한다.
  • 표 1의 비교를 보면 기존 벤치마크는 사례 수는 크지만 과제 폭이 좁다. WorldScore는 3,000 사례에 과제 1종, iWorld-Bench는 4,900 사례에 과제 2종인 반면 WorldExam은 1,474 사례로 8개 과제를 모두 덮는다.
  • 결론은 화질이 좋고 지시를 잘 따른다고 해서 세계의 반응성이 따라오지 않는다는 것이다. 넓은 과제 범위와 일관되게 높은 성능을 동시에 갖춘 모델은 하나도 없었다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)