GPIC: A Giant Permissive Image Corpus for Visual Generation

발행일
출처
arXiv
논문 번호
274
분야
Computer Vision
arXiv 번호
2605.30341

스탠퍼드 대학교를 비롯한 여러 기관의 공동 연구 성과인 GPIC는 고품질 합성 텍스트 캡션을 갖춘 1억 장의 이미지로 구성된, 허용적이고 안정적이며 대규모이고 접근성 높은 이미지 코퍼스를 제안하며, 시각 생성 모델링을 위한 현대적 벤치마크로 설계되었다.

GPIC는 현대 시각 생성 모델의 대규모 학습과 비교 평가를 위해 만든 약 28조 픽셀 규모의 이미지 코퍼스다. 최신 비전-언어 모델이 생성한 캡션과 함께 학습용 1억 장, 검증용 20만 장, 시험용 100만 장을 제공한다. 모든 이미지는 연구와 상업적 이용이 가능한 허용적 라이선스를 갖추며, 안전 필터링과 중복 제거를 거쳐 Hugging Face에 중앙 호스팅된다. 연구진은 데이터만 공개하는 데 그치지 않고 생성 모델 평가 규약과 픽셀 공간 흐름 정합 기준 모델도 함께 제공했다. 따라서 오래되고 규모가 작은 ImageNet 중심 평가를 넘어, 풍부한 텍스트 조건을 쓰는 최신 생성 연구를 같은 안정적 자료에서 재현하고 비교하려는 기반으로 의미가 있다.

핵심 요약

  • Long: 전경, 배경, 그리고 특정 OCR 텍스트를 묘사하는 매우 상세한 5~7개 문장이다.
  • GPIC-Nano: 100만 장의 이미지로, 빠른 프로토타이핑에 적합하다.
  • GPIC-Lite: 1000만 장의 이미지로, 보다 본격적인 개발에 적합하다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)