Lucida: Parse, Generate, and Place for Composable Real-to-Sim Scene Modeling
- 발행일
- 출처
- arXiv
- 논문 번호
- 1056
- 분야
- Computer Vision
- arXiv 번호
- 2608.30821
실내 촬영 영상을 개별 물건 단위 3D 에셋으로 복원하는 real-to-sim 시스템으로, 배치를 3D 에디터 GUI 조작 같은 닫힌 루프로 처리하는 VLM 정책이 핵심이다.
이 논문은 한마디로 지저분한 실내 촬영 영상을 '각 물건이 따로 떼어낼 수 있는 3D 에셋'들로 복원하는 시스템이다. 기존 파이프라인은 파싱→생성→배치 각 단계가 완벽한 입력을 요구했는데, Lucida는 정확도 요구를 마지막 배치 단계로 미뤄 각 단계가 실제 촬영이 주는 것만 소비하게 만들었다. 배치는 GizmoAct라는 VLM 정책이 3D 에디터의 기즈모를 잡고 돌리고 옮기는 멀티턴 상호작용으로, 렌더링만 보고 스스로 '정렬 완료'를 판단할 때까지 반복한다. 그 결과 3D 검출 mAP 69% 개선, 포즈 정렬 57.8%→83.4%, 장면 F-스코어 0.794→0.924를 달성했다.
핵심 요약
- '정확한 입력'을 요구하던 3단계 파이프라인의 요구사항을 재분배해, 각 단계가 실제 촬영 데이터가 신뢰성 있게 주는 것만 소비하게 재설계했다.
- GizmoAct라는 VLM 정책이 물체 배치를 3D 에디터 GUI 조작으로 바꿔, 다음 수정과 정지 시점을 렌더링만 보고 스스로 결정한다.
- 장면 3D 검출에서 Boxer 대비 mAP를 0.351에서 0.592로 69% 개선했다.
- 포즈 추정 ADD-SB@0.05를 CA-1M에서 57.8%에서 83.4%로 25.6%p 끌어올렸고, 장면 재구성 F-스코어도 0.794(SAM 3D)에서 0.924로 올렸다.
- SFT 후 강화학습으로 훈련한 단일 정책이 오차 특성이 다른 초기화 방식들에 재학습 없이 대응했다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.