Concurrent Image Understanding and Generation: Self-Correcting Coupled Markov Jump Processes

발행일
출처
arXiv
논문 번호
655
분야
Machine Learning
arXiv 번호
2607.13188

텍스트와 이미지를 동시에 생성하면서 서로의 결과를 실시간으로 교정하는 새로운 멀티모달 생성 프레임워크(SC-CMJP)를 제안했다.

이 논문은 한마디로 텍스트(이해)와 이미지(생성)를 동시에 처리하면서 서로의 결정을 교정하는 새로운 생성 방식을 제안했다. 마스크드 디퓨전 모델(토큰을 점진적으로 드러내는 생성 모델)에서 텍스트와 이미지가 한 번의 디코딩 과정에서 서로의 확신도를 참고해 결정을 내린다. 잘못된 결정은 리마스킹(다시 숨기기)으로 되돌릴 수 있어 자가 교정이 가능하다. CO2Jump라는 추가 학습 없이 쓸 수 있는 샘플러를 제안했고, 이미지 편집·미로 찾기·노노그램 풀기에서 기존 방법을 능가했다.

핵심 요약

  • 텍스트와 이미지를 한 번의 디코딩 과정에서 동시에 생성하며, 한쪽이 내린 결정을 다른 쪽이 검증하는 구조를 만들었다.
  • CO2Jump라는 학습 없이 바로 쓸 수 있는 샘플러를 제안했고, 이미지 편집·시각 추론 과제에서 기존 방법들을 능가했다.
  • 한 번 확정된 토큰도 증거가 바뀌면 다시 숨기는(remasking) 메커니즘을 넣어, 모순된 결과를 스스로 고친다.
  • JEdit-1M, JMaze-200K, JNono-200K 세 개의 대규모 멀티모달 데이터셋을 구축하고 공개할 예정이다.
  • 디노이징 스텝 수가 늘어날수록 성능이 지속적으로 향상되어, 크로스모달 결합의 이점이 누적됨을 보였다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)