CoLT: Teaching Multi-Modal Models to Think with Chain of Latent Thoughts
- 발행일
- 출처
- arXiv
- 논문 번호
- 540
- 분야
- Computer Vision
- arXiv 번호
- 2606.31986
다모달 모델의 CoT를 잠재 표현 체인으로 대체. 3단 잠재 사고로 8개 벤치마크에서 기존 latent reasoning 능가, 텍스트 CoT 대비 10.1배 속도 향상.
CoLT(Chain of Latent Thoughts)는 다모달 대형 언어 모델에서 텍스트 기반 CoT 추론 대신 잠재 사고 표현의 체인을 사용하는 프레임워크다. 전방 디코딩(잠재 사고->텍스트), 후방 디코딩(텍스트->잠재 사고), 내부 감독(단계 간 일관성)의 3방향 step-level 감독으로 학습 안정성을 확보하며, 추론 시에는 디코더를 제거해 효율성을 유지한다. 8개 벤치마크에서 기존 latent reasoning 방법(CODI, SIM-CoT)과 잠재 시각 추론 방법을 모두 능가했으며, 텍스트 CoT 대비 추론 시간 10.1배, 텍스트 디코딩 시간 22.6배 단축을 달성했다.
핵심 요약
- 문제의식: 텍스트 CoT는 수천 토큰을 자가회귀적으로 생성해야 해서 추론 지연이 크고, 자연어 표현으로 인해 대체 추론 경로가 소실됨
- 3방향 step-level 감독: forward decoding(잠재->텍스트), backward decoding(텍스트->잠재), internal supervision(잠재 단계 간 전이 일관성)
- 추론 시 디코더와 내부 감독 제거 -> 단 3개 잠재 벡터로 추론 완료, 추가 파라미터 오버헤드 없음
- Qwen3-VL-8B 기반 8개 벤치마크(MMStar, MathVista, SeedBench 등)에서 Text CoT 및 기존 latent reasoning 일관되게 능가
- 추론 속도: 텍스트 CoT 7.24초(142 토큰) vs CoLT 0.32초(3 잠재 벡터) -> 22.6배 디코딩 속도, 10.1배 end-to-end 속도 향상
- 노이즈 강인성도 우수: 시각/텍스트 노이즈 조건에서 Direct Answer(7.2~19.0% 저하), Text CoT(5.0~13.8%) 대비 CoLT는 2.8~9.0% 저하에 그침
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.