Boogu-Image-0.1: Boosting Open-Source Unified Multimodal Understanding and Generation
- 발행일
- 출처
- arXiv
- 논문 번호
- 632
- 분야
- Computer Vision
- arXiv 번호
- 2607.13125
2억 장 이미지로 약 $400K 비용으로 훈련한 오픈소스 통합 멀티모달 이해 및 생성 모델.
Boogu-Image-0.1은 텍스트-이미지 생성, 빠른 추론, 명령 기반 편집, 중영 이중언어 텍스트 렌더링을 하나의 모델 패밀리(Base/Turbo/Edit/Edit-Turbo)로 통합한 오픈소스 시스템이다. 핵심 설계 철학은 이해(understanding)를 1급 시민으로 대우하는 것으로, 강력한 텍스트 인코더(Qwen3-VL-8B)와 에이전트 기반 추론 시간 스케일링을 결합하여 폐쇄형 시스템에 근접한 성능을 달성했다. 단 2.0862억 장의 고유 이미지와 약 $400K의 학습 비용으로 기존 오픈소스 모델들을 능가하며 Boogu Arena에서 최상위권을 기록했다.
핵심 요약
- Base, Turbo, Edit, Edit-Turbo 네 모델을 만들고 더 강한 멀티모달 인코더와 에이전트식 프롬프트 재작성을 결합했다.
- 데이터 품질, 학습 절차, 추론 시간 확장을 함께 다듬어 이해 능력의 향상이 이미지 생성과 편집으로 이어지게 했다.
- 2억 862만 장의 고유 이미지와 약 40만 달러의 이론상 기본 모델 학습비로 여러 공개 모델과 같거나 더 높은 벤치마크 성능을 보였다.
- 가중치, 코드, 학습 방식을 Apache 2.0으로 공개해 적은 예산의 통합 이미지 생성·편집 연구에 재사용할 수 있다.
- 선도 비공개 시스템에는 가까워졌지만 전반적으로 앞섰다고 보고하지는 않았으며, 비교 결과도 공개된 표준 평가 범위에 한정된다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.