Latent Thought Flow: Efficient Latent Reasoning in Large Language Models

발행일
출처
arXiv
논문 번호
444
분야
AI / General
arXiv 번호
2606.16222

잠재 공간에서 추론을 변수 길이 연속 궤적으로 모델링하고 GFlowNet으로 보상에 비례하는 샘플러를 학습하는 프레임워크. 정확도 9.5% 향상, 추론 길이 27.2% 단축.

Latent Thought Flow(LTF)는 LLM의 추론을 연속 잠재 공간에서의 확률적 궤적으로 재구성한다. 기존 latent reasoning이 결정론적 경로만 학습한 것과 달리, GFlowNet 기반 연속 샘플러로 정답 품질과 계산 비용 간의 균형을 최적화한다. Entropy-Weighted Subtrajectory Balance 목표와 reference-prior 정규화로 희소 보상 문제와 탐색 안정성을 해결한다.

핵심 요약

  • Chain-of-Thought의 언어 공간 병목(토큰 디코딩 오버헤드)을 잠재 공간 추론로 해결하는 새로운 접근
  • 연속 GFlowNet으로 보상에 비례하는 잠재 추론 궤적 분포를 학습하여 다양한 정확-효율 경로 보존
  • Entropy-Weighted Subtrajectory Balance로 종단 보상을 중간 단계로 전파하여 희소 감독 문제 극복
  • Reference-prior 정규화로 탐색 초기 안정성 확보 후 annealing으로 보상 기반 궤적으로 전환
  • CoLaR/ReGuLaR 대비 파인튜닝 정확도 12.9% 향상, 추론 길이 34.5% 단축
  • 전이 학습 설정에서도 정확도 6.0% 향상, 추론 길이 19.9% 단축으로 범용성 입증

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)