Geo-Align: Video Generation Alignment via Metric Geometry Reward

발행일
출처
arXiv
논문 번호
229
분야
Computer Vision
arXiv 번호
2605.23903

USTC와 상하이 AI Lab의 연구진은 미터 기하 보상을 사용하여 목표 카메라 궤적을 정밀하게 따르는 새로운 시점의 영상을 합성하는, 카메라 제어 영상 생성용 강화학습 프레임워크인 Geo-Align을 개발했다.

Geo-Align은 목표 카메라 경로를 따르는 새로운 시점의 영상을 만들기 위해 비디오 생성 모델을 강화학습으로 정렬하는 방법이다. 생성 영상에서 미터 단위 카메라 자세를 추정하는 3차원 평가기를 사용해 목표 경로와의 회전 및 이동 오차를 직접 보상에 반영한다. 실제 조건 영상과 합성 데이터에서 얻은 크기 정보가 있는 카메라 궤적을 조합해, 동기화된 실제 다중 시점 영상 쌍 없이도 학습할 수 있게 했다. DAVIS 기반 500개 시험 사례에서 기존 지도학습 기준보다 카메라 제어 정확도와 영상 충실도 및 일관성을 꾸준히 높였다. 다만 매우 빠른 회전과 큰 이동, 카메라 가까이의 큰 물체나 동적 물체가 많은 입력에서 실패와 깜박임이 생길 수 있고, 배치마다 여러 전체 영상을 생성하는 강화학습 비용도 크다.

핵심 요약

  • 미터 모호성: 표준 학습 손실은 픽셀이나 추상적 특징을 비교한다. 이들은 미터나 도 같은 물리적 단위를 이해하지 못한다. 모델에게 카메라를 2미터 앞으로 이동하라고 지시하더라도, 손실 함수는 결과 픽셀이 참조와 달라 보일 때만 모델에 페널티를 부과한다. 이는 종종 스케일 드리프트로 이어지는데, 생성된 영상의 카메라가 일관되지 않은 속도로 움직이거나 장면의 깊이를 고려할 때 물리적으로 불가능한 경로를 따르게 된다.
  • 미터 인식: 3D 평가자를 사용함으로써 모델은 카메라 움직임을 물리적 단위로 이해하도록 학습하여, 영상 합성에서 오랫동안 문제였던 스케일 드리프트를 해결한다.
  • 확장 가능한 학습: 이 RL 프레임워크는 구하기 어려운 동기화된 다시점 영상의 필요성을 없애, 모델이 다양한 실세계 분포로부터 학습할 수 있게 한다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)