Thinking in Blender: Staged Executable Inverse Graphics with Vision-Language Models
- 발행일
- 출처
- arXiv
- 논문 번호
- 285
- 분야
- Computer Vision
- arXiv 번호
- 2606.02580
역 그래픽스는 이미지를 렌더링, 재조명, 조작이 가능한 편집 가능한 3D 장면으로 재구성하려는, 오래되고 매우 제약이 부족한 문제다.
SEIG는 한 장의 이미지를 편집 가능한 Blender 장면 코드로 바꾸는 단계형 역 그래픽스 프레임워크다. 별도의 2차원·3차원 기반 모델이나 미분 렌더링, 다중 시점 감독 없이 범용 비전-언어 모델만 사용한다. 기하, 재질, 장면 구성, 조명을 한꺼번에 생성하지 않고 각 요소를 생성기와 검증기 순환으로 차례로 고쳐 나간다. 픽셀·지각·의미 수준의 여러 지표로 다양한 장면을 평가한 결과, 단계적 분해가 단일 통과 방식보다 재구성 충실도를 높였고 결과 장면은 시점 변경·편집·재조명에 활용할 수 있었다. 다만 여러 단계에서 모델을 반복 호출하므로 한 번에 생성하는 방식보다 실행 시간과 API 비용이 크게 늘어난다.
핵심 요약
- 이 논문은 기하, 재질, 구성, 조명을 포함한 장면 요인들을 실행 가능한 Blender 코드 공간에서 직접 점진적으로 정제함으로써 단일 이미지로부터 3D 장면을 재구성하는 에이전트 프레임워크 Staged Executable Inverse Graphics(SEIG)를 소개한다.
- 실험은 단계적 재구성이 재구성 충실도를 상당히 향상시킴을 보여주며, 범용 VLM을 활용한 실행 가능한 역 그래픽스에서 과제 분해의 중요성을 부각한다.
- 마지막으로, 재구성된 편집 가능한 Blender 장면이 가능하게 하는 다양한 다운스트림 응용을 시연한다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.