Next Forcing: Causal World Modeling with Multi-Chunk Prediction
- 발행일
- 출처
- arXiv
- 논문 번호
- 383
- 분야
- Computer Vision
- arXiv 번호
- 2606.11187
자기회귀 비디오 생성에서 단일 청크 예측의 myopic supervision 문제를 해결하는 Next Forcing 프레임워크. 다중 청크 예측으로 학습 수렴을 2.3배 가속화한다.
Next Forcing은 자기회귀 비디오 월드 모델의 학습 목표를 단일 청크에서 다중 청크(next1, next2, next3)로 확장하는 프레임워크다. 경량 보조 MCP 모듈이 주 모델의 중간 특징을 융합해 미래 청크를 동시에 예측하며, 이를 통해 밀집된 다중 스케일 시간 감독을 제공한다. RoboTwin 벤치마크에서 94.1/93.5%로 새로운 SOTA를 수립했고, 50fps에서 LingBot-VA 대비 2.3배 빠른 수렴을 달성한다. 추론 시 MCP 모듈을 유지하면 2배 가속도 가능하다.
핵심 요약
- 다중 청크 예측(MCP)으로 자기회귀 비디오 생성의 myopic supervision 문제 해결
- 인과적 MCP 체인으로 near-future 예측이 far-future 예측에 정보 제공, 주 모델에 밀집 감독 전달
- RoboTwin SOTA 달성: Clean 94.1%, Random 93.5%
- 50fps에서 LingBot-VA 대비 93.1% 상대 향상, 2.3배 학습 가속
- 일반 비디오 사전학습에서도 FVD 50% 이상 감소로 로봇 특화 데이터 이상의 일반성 입증
- 추론 시 MCP 모듈 유지로 2배 추론 가속, 정확도 유지
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.