MotiMotion: Motion-Controlled Video Generation with Visual Reasoning
- 발행일
- 출처
- arXiv
- 논문 번호
- 204
- 분야
- Computer Vision
- arXiv 번호
- 2605.22818
MotiMotion이라는 프레임워크는 시각적 추론과 신뢰도 인식 제어를 통합해 모션 제어 비디오 생성을 향상시키며, 희소한 사용자 궤적으로부터 복잡하고 물리적으로 타당한 동역학을 추론할 수 있게 한다.
기존 동작 제어 영상 생성은 사용자가 준 희소하고 부정확한 궤적을 그대로 따라가면서 연쇄적으로 생기는 움직임을 놓치기 쉽다. MotiMotion은 먼저 시각 언어 모델이 주된 궤적 좌표를 다듬고 상식에 맞는 부차 동작을 추론한 뒤 영상을 생성한다. 계획의 신뢰도가 높을 때는 안내를 강하게 따르고 낮을 때는 생성 모델의 내부 지식을 더 활용하도록 제어 강도를 조절한다. 움직임으로 새 사건이 일어나는 상호작용 장면을 모은 MotiBench도 함께 만들어 논리적이고 물리적인 동작을 평가했다. 시각 언어 모델 평가와 사람 평가 모두 기존 방법보다 자연스러운 물체 행동과 상호작용을 보였으며 MotiMotion 결과를 더 선호했다.
핵심 요약
- 의미적 일관성: 비디오가 사용자의 상위 수준 의도와 얼마나 잘 일치하는지를 나타낸다.
- 접근성: 프레임 단위 수동 애니메이션이나 정밀한 기술 사양의 필요성을 줄여 고급 비디오 제작을 더 폭넓은 사용자가 이용할 수 있게 한다.
- 교육적 벤치마킹: MotiBench는 연구 커뮤니티가 단순한 시각적 충실도가 아니라 비디오 생성의 논리적·물리적 측면에 집중할 수 있도록 하는 전문 도구를 제공한다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.