Hunyuan3D-Buffalo 1.0: A Unified Multimodal Model for Scalable 3D Generation, Understanding, and Editing
- 발행일
- 출처
- arXiv
- 논문 번호
- 820
- 분야
- Computer Vision
- arXiv 번호
- 2608.02711
이 논문은 3D 이해, 생성, 편집을 하나의 통합 모델에서 수행하는 Hunyuan3D-Buffalo 1.0을 87M 규모 데이터로 학습시켰다.
이 논문는 한마디로 3D 객체의 이해, 생성, 편집, 부품 생성을 하나의 모델로 통합했다. 가장 큰 병목이었던 3D 편집 데이터 부족을 Nano3D-v2 에이전트로 1200만 쌍을 자동 구축해 해결했다. 총 8700만 샘플로 학습된 모델이 생성과 편집 벤치마크에서 SOTA를 달성했으며, 이해와 생성이 편집을 서로 강화함을 보였다.
핵심 요약
- 3D 이해, 텍스트-투-3D 생성, 명령 기반 3D 편집, 텍스트 기반 부품 생성을 단일 아키텍처로 통합했다.
- 8700만 규모(이해 2500만, 생성 5000만, 편집 1200만)의 최대 3D 다모달 학습 데이터를 구축했다.
- Nano3D-v2 에이전트 기반 파이프라인으로 기하학적 일관성 있는 3D 편집 데이터를 대량 생산했다.
- Hunyuan3D-VLM(이해) + DiT(생성) 결합으로 생성 벤치마크와 편집 벤치마크 모두에서 SOTA 달성.
- 생성 능력과 이해 능력이 편집 품질을 상향한다는 교차 태스크 시너지를 실험으로 입증했다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.