Lucida: Parse, Generate, and Place for Composable Real-to-Sim Scene Modeling

발행일
출처
arXiv
논문 번호
1056
분야
Computer Vision
arXiv 번호
2608.30821

실내 촬영 영상을 개별 물건 단위 3D 에셋으로 복원하는 real-to-sim 시스템으로, 배치를 3D 에디터 GUI 조작 같은 닫힌 루프로 처리하는 VLM 정책이 핵심이다.

이 논문은 한마디로 지저분한 실내 촬영 영상을 '각 물건이 따로 떼어낼 수 있는 3D 에셋'들로 복원하는 시스템이다. 기존 파이프라인은 파싱→생성→배치 각 단계가 완벽한 입력을 요구했는데, Lucida는 정확도 요구를 마지막 배치 단계로 미뤄 각 단계가 실제 촬영이 주는 것만 소비하게 만들었다. 배치는 GizmoAct라는 VLM 정책이 3D 에디터의 기즈모를 잡고 돌리고 옮기는 멀티턴 상호작용으로, 렌더링만 보고 스스로 '정렬 완료'를 판단할 때까지 반복한다. 그 결과 3D 검출 mAP 69% 개선, 포즈 정렬 57.8%→83.4%, 장면 F-스코어 0.794→0.924를 달성했다.

핵심 요약

  • '정확한 입력'을 요구하던 3단계 파이프라인의 요구사항을 재분배해, 각 단계가 실제 촬영 데이터가 신뢰성 있게 주는 것만 소비하게 재설계했다.
  • GizmoAct라는 VLM 정책이 물체 배치를 3D 에디터 GUI 조작으로 바꿔, 다음 수정과 정지 시점을 렌더링만 보고 스스로 결정한다.
  • 장면 3D 검출에서 Boxer 대비 mAP를 0.351에서 0.592로 69% 개선했다.
  • 포즈 추정 ADD-SB@0.05를 CA-1M에서 57.8%에서 83.4%로 25.6%p 끌어올렸고, 장면 재구성 F-스코어도 0.794(SAM 3D)에서 0.924로 올렸다.
  • SFT 후 강화학습으로 훈련한 단일 정책이 오차 특성이 다른 초기화 방식들에 재학습 없이 대응했다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)