WorldSculpt: Generating Compositional Worlds from Grounded Videos

발행일
출처
arXiv
논문 번호
1073
분야
Computer Vision
arXiv 번호
2609.05416

수백 개 물체가 겹쳐 있는 복잡한 장면을 각 물체별 3D 메시(물체의 3D 형태 데이터)로 따로따로 분리해 재구성하는 프레임워크. 단일 물체 생성 모델을 재활용해 장면 학습 없이 해결했다.

이 논문은 한마디로 어지러하게 쌓인 방이나 창고를 사진 몇 장만으로 '물체별로 분리된 3D 파일'로 되살리는 방법이다. 게임이나 로봇 시뮬레이션은 장면 전체를 한 덩어리로 만들면 쓸모가 없고, 의자 하나만 골라 옮길 수 있어야 하기 때문이다. 저자들은 물체 하나짜리 3D 생성 모델(Pixal3D)에 여러 시점의 사진을 함께 보는 회로를 달아서, 장면 학습 없이도 수백 개 물체가 서로 가려진 장면을 처리하게 했다. 가려진 부분은 생성 모델이 그럴듯하게 채우고, 보이는 부분은 사진 증거에 맞춘다. 물체 수백 개짜리 벤치마크(UE-MeshyScene)에서 기존 방법을 앞섰고, 물건이 많고 가림이 심할수록 격차가 커졌다.

핵심 요약

  • 물체 하나만 배우는 3D 생성 모델(Pixal3D)에 여러 시점 영상을 조건으로 넣는 회로를 추가해, 장면 단위 학습 없이 수백 개 물체 장면을 처리했다.
  • 각 물체를 개별 메시로 만든 뒤 세계 좌표에 배치하므로, 게임·AR·시뮬레이션·로보틱스에서 물체를 따로 골라 쓸 수 있다.
  • 언리얼 엔진으로 만든 UE-MeshyScene 벤치마크(6개 장면, 물체 93~701개, 물체별 정답 메시 포함)를 공개했다.
  • 가림이 심한 벤치마크에서 학습 기반 시점 융합(IBR)이 오차 지표 CD-L2를 12% 낮추고 F-Score를 0.944에서 0.951로 올렸다.
  • Marble·HY-World 2.0 같은 생성 월드모델이 만든 3DGS 장면을 물체 단위 메시 장면으로 바꾸는 응용도 추가 학습 없이 시연했다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)