Concurrent Image Understanding and Generation: Self-Correcting Coupled Markov Jump Processes
- 발행일
- 출처
- arXiv
- 논문 번호
- 655
- 분야
- Machine Learning
- arXiv 번호
- 2607.13188
텍스트와 이미지를 동시에 생성하면서 서로의 결과를 실시간으로 교정하는 새로운 멀티모달 생성 프레임워크(SC-CMJP)를 제안했다.
이 논문은 한마디로 텍스트(이해)와 이미지(생성)를 동시에 처리하면서 서로의 결정을 교정하는 새로운 생성 방식을 제안했다. 마스크드 디퓨전 모델(토큰을 점진적으로 드러내는 생성 모델)에서 텍스트와 이미지가 한 번의 디코딩 과정에서 서로의 확신도를 참고해 결정을 내린다. 잘못된 결정은 리마스킹(다시 숨기기)으로 되돌릴 수 있어 자가 교정이 가능하다. CO2Jump라는 추가 학습 없이 쓸 수 있는 샘플러를 제안했고, 이미지 편집·미로 찾기·노노그램 풀기에서 기존 방법을 능가했다.
핵심 요약
- 텍스트와 이미지를 한 번의 디코딩 과정에서 동시에 생성하며, 한쪽이 내린 결정을 다른 쪽이 검증하는 구조를 만들었다.
- CO2Jump라는 학습 없이 바로 쓸 수 있는 샘플러를 제안했고, 이미지 편집·시각 추론 과제에서 기존 방법들을 능가했다.
- 한 번 확정된 토큰도 증거가 바뀌면 다시 숨기는(remasking) 메커니즘을 넣어, 모순된 결과를 스스로 고친다.
- JEdit-1M, JMaze-200K, JNono-200K 세 개의 대규모 멀티모달 데이터셋을 구축하고 공개할 예정이다.
- 디노이징 스텝 수가 늘어날수록 성능이 지속적으로 향상되어, 크로스모달 결합의 이점이 누적됨을 보였다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.