H3-World: Turning Language Understanding into World Control
- 발행일
- 출처
- arXiv
- 논문 번호
- 1057
- 분야
- Computer Vision
- arXiv 번호
- 2609.01560
거대 영상 생성 모델(MiniMax-H3)을 게임 플레이 데이터 8,000건만으로 가볍게 조정해, 텍스트 명령만으로 캐릭터와 카메라를 정밀하게 조종하는 인터랙티브 월드 모델로 바꾼 연구다.
이 논문은 한마디로 영상 생성 AI가 이미 갖고 있는 언어 이해 능력을 활용해, 별도의 조종 장치 없이 텍스트만으로 가상 세계를 조종하게 만든 연구다. 캐릭터와 카메라 움직임을 구조화된 텍스트 명령으로 바꾸고, 각 명령이 영상의 해당 시간 구간에만 작동하도록 어텐션(모델이 중요한 부분에 집중하는 기법)을 제한하는 '시간 어텐션 라우팅'을 도입했다. 전체 파라미터의 0.199%만 조정하는 가벼운 LoRA 학습으로도 정밀 조종이 가능했고, 학습에 없던 명령 조합과 낯선 장면에도 잘 작동했다. 큰 영상 모델 안에 조종에 필요한 능력이 이미 상당 부분 들어 있다는 걸 보여준 게 핵심이다.
핵심 요약
- 33B 영상 생성 모델 MiniMax-H3에 전용 조종 모듈을 붙이지 않고, 모델이 이미 아는 텍스트 경로를 조종 인터페이스로 그대로 재활용했다.
- 게임 플레이 샘플 8,000건, LoRA 학습 10,000스텝, 학습 파라미터 0.199%만으로 캐릭터·카메라 정밀 조종을 달성했다.
- 시간 어텐션 라우팅으로 각 명령이 자기 시간 구간에만 작동하게 막아, 명령이 다른 구간으로 새는 문제를 줄였다.
- 카메라 방향 전환 실험에서 전역 프롬프트 방식은 수평 흐름 +0.0/-17.3에 그친 반면, H3-World는 +52.7/-106.0으로 두 방향 모두 정확히 따랐다.
- 학습 때 본 적 없는 행동 조합과 게임 밖 장면(1인칭 시점, 실내, 판타지 등)에도 같은 인터페이스가 그대로 작동했다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.