Let RGB Be the Language of Vision

발행일
출처
arXiv
논문 번호
637
분야
Computer Vision
arXiv 번호
2607.12450

모든 시각 정보를 RGB로 통일하여 20개 이상 비전 태스크를 제로샷으로 해결하는 통합 비전 패러다임.

RINO(RGB In and RGB Out)는 모든 시각 정보(마스크, 깊이 맵, 포즈 등)를 RGB 이미지로 통일하여 표현하는 혁신적 비전 패러다임이다. 이 접근법은 서로 다른 비전 태스크를 공통 RGB-to-RGB 이미지 편집 문제로 변환하여, 단일 이미지 편집 모델이 task-specific 파라미터 없이도 세그먼테이션, 깊이 추정, 포즈-이미지 생성 등 25개 이상의 태스크를 제로샷으로 처리할 수 있게 한다. Qwen-Image-Edit 기반으로 깊이 추정 delta-1 0.938 등 전문 모델에 근접하는 성능을 보였다.

핵심 요약

  • 마스크, 깊이 지도, 자세 같은 구조화된 시각 정보를 모두 RGB 이미지로 바꾸고 여러 과제를 공통 RGB-to-RGB 편집 문제로 표현한다.
  • 과제별 인코더나 디코더를 추가하지 않고 일반 이미지 편집 백본 하나로 이해 과제와 조건부 생성 과제를 처리한다.
  • 세그먼테이션과 깊이 추정, 자세 기반 생성 등에서 별도 미세조정 없이 경쟁력 있는 제로샷 성능을 보였다.
  • 시각 이해와 생성을 같은 입출력 형식으로 연결해 범용 시각·언어 시스템의 공통 인터페이스로 활용할 수 있다.
  • 성능이 웹 규모로 학습된 이미지 편집 백본에 크게 의존하고 일부 전문 과제에서는 전용 모델과 격차가 남는다는 한계가 있다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)