Boogu-Image-0.1: Boosting Open-Source Unified Multimodal Understanding and Generation

발행일
출처
arXiv
논문 번호
632
분야
Computer Vision
arXiv 번호
2607.13125

2억 장 이미지로 약 $400K 비용으로 훈련한 오픈소스 통합 멀티모달 이해 및 생성 모델.

Boogu-Image-0.1은 텍스트-이미지 생성, 빠른 추론, 명령 기반 편집, 중영 이중언어 텍스트 렌더링을 하나의 모델 패밀리(Base/Turbo/Edit/Edit-Turbo)로 통합한 오픈소스 시스템이다. 핵심 설계 철학은 이해(understanding)를 1급 시민으로 대우하는 것으로, 강력한 텍스트 인코더(Qwen3-VL-8B)와 에이전트 기반 추론 시간 스케일링을 결합하여 폐쇄형 시스템에 근접한 성능을 달성했다. 단 2.0862억 장의 고유 이미지와 약 $400K의 학습 비용으로 기존 오픈소스 모델들을 능가하며 Boogu Arena에서 최상위권을 기록했다.

핵심 요약

  • Base, Turbo, Edit, Edit-Turbo 네 모델을 만들고 더 강한 멀티모달 인코더와 에이전트식 프롬프트 재작성을 결합했다.
  • 데이터 품질, 학습 절차, 추론 시간 확장을 함께 다듬어 이해 능력의 향상이 이미지 생성과 편집으로 이어지게 했다.
  • 2억 862만 장의 고유 이미지와 약 40만 달러의 이론상 기본 모델 학습비로 여러 공개 모델과 같거나 더 높은 벤치마크 성능을 보였다.
  • 가중치, 코드, 학습 방식을 Apache 2.0으로 공개해 적은 예산의 통합 이미지 생성·편집 연구에 재사용할 수 있다.
  • 선도 비공개 시스템에는 가까워졌지만 전반적으로 앞섰다고 보고하지는 않았으며, 비교 결과도 공개된 표준 평가 범위에 한정된다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)