Controllable Dynamic 3D Shape Generation via 3D Trajectories and Text

발행일
출처
arXiv
논문 번호
306
분야
Computer Vision
arXiv 번호
2606.05162

이 논문은 3D 궤적과 텍스트를 조건으로 제어 가능한 동적 3D 형상 생성을 수행하는 피드포워드 프레임워크 T2Mo를 소개한다.

T2Mo는 글과 3D 궤적을 함께 조건으로 받아 움직이는 3D 형상을 한 번에 생성한다. 글만으로는 정확한 이동 경로를 지정하기 어려워, 사용자가 고른 점들이 따라갈 3차원 길을 직접 제어 신호로 준다. 형상 기반 궤적 임베딩은 조밀하거나 드문 궤적, 고르지 않은 입력을 물체 전체를 덮는 고정된 형상 토큰으로 바꾼다. 정량·정성 평가와 사용자 연구에서 글 기반 방법과 영상 생성 뒤 동적 메시로 바꾸는 연쇄 방법보다 지시를 더 충실히 따르면서 움직임 품질을 유지했다. 다만 고정된 원본 메시의 꼭짓점 이동을 예측하므로 물체가 갈라지거나 합쳐지고 새 부분이 생기는 위상 변화는 다루지 못한다.

핵심 요약

  • 이를 해결하기 위해 선택된 점들이 이동해야 할 정확한 경로를 명시하는 제어 가능한 공간적 가이드로 3D 궤적을 채택한다.
  • 밀집부터 희소하고 불균등하게 분포된 것까지 임의의 구성을 갖는 궤적 입력을 견고하게 처리하기 위해, 입력 궤적 집합을 객체 전체를 포괄하는 형상 인식 토큰 집합으로 매핑하는 형상 기반 궤적 임베딩을 추가로 제안한다.
  • 정량적·정성적 평가와 사용자 연구는 이 접근법이 동작 품질을 보존하면서 주어진 프롬프트를 더 충실히 따르고 표현력이 더 높은 동작을 생성함을 입증한다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)