MotiMotion: Motion-Controlled Video Generation with Visual Reasoning

발행일
출처
arXiv
논문 번호
204
분야
Computer Vision
arXiv 번호
2605.22818

MotiMotion이라는 프레임워크는 시각적 추론과 신뢰도 인식 제어를 통합해 모션 제어 비디오 생성을 향상시키며, 희소한 사용자 궤적으로부터 복잡하고 물리적으로 타당한 동역학을 추론할 수 있게 한다.

기존 동작 제어 영상 생성은 사용자가 준 희소하고 부정확한 궤적을 그대로 따라가면서 연쇄적으로 생기는 움직임을 놓치기 쉽다. MotiMotion은 먼저 시각 언어 모델이 주된 궤적 좌표를 다듬고 상식에 맞는 부차 동작을 추론한 뒤 영상을 생성한다. 계획의 신뢰도가 높을 때는 안내를 강하게 따르고 낮을 때는 생성 모델의 내부 지식을 더 활용하도록 제어 강도를 조절한다. 움직임으로 새 사건이 일어나는 상호작용 장면을 모은 MotiBench도 함께 만들어 논리적이고 물리적인 동작을 평가했다. 시각 언어 모델 평가와 사람 평가 모두 기존 방법보다 자연스러운 물체 행동과 상호작용을 보였으며 MotiMotion 결과를 더 선호했다.

핵심 요약

  • 의미적 일관성: 비디오가 사용자의 상위 수준 의도와 얼마나 잘 일치하는지를 나타낸다.
  • 접근성: 프레임 단위 수동 애니메이션이나 정밀한 기술 사양의 필요성을 줄여 고급 비디오 제작을 더 폭넓은 사용자가 이용할 수 있게 한다.
  • 교육적 벤치마킹: MotiBench는 연구 커뮤니티가 단순한 시각적 충실도가 아니라 비디오 생성의 논리적·물리적 측면에 집중할 수 있도록 하는 전문 도구를 제공한다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)