SAGE: Mitigating Long-Horizon Reasoning Biases via Topological Guidance

발행일
출처
arXiv
논문 번호
1129
분야
Reasoning
arXiv 번호
2609.30192

이 논문은 긴 추론에서 모델이 '그럴듯하지만 틀린 길'로 빠지는 편향을 수학적 구조 안내(SAGE)로 잡아, 희소 보상 과제 성공률을 최대 8배 끌어올렸다.

이 논문은 한마디로 긴 사고줄기 추론에서 LLM이 왜 자주 길을 잃는지를 두 가지 편향으로 진단하고 고친 연구다. 저자들은 '탐색 편향'(그럴듯하지만 구조적으로 불안정한 가지에 끌림)과 '누적 편향'(작은 오차가 쌓여 보상을 놓침)을 규정하고, SAGE라는 프레임워크로 두 편향에 각각 대응하는 구조 안내를 준다. 하나는 대수적 축소로 가짜 분기를 없애고, 다른 하나는 쌍곡 공간 임베딩으로 깊이 방향 신호를 촘촘히 준다. 12개 벤치마크·7개 모델에서 기존보다 나았고, 어려운 열린 문제(Andrews-Curtis)에서는 최대 8배 향상을 보였다.

핵심 요약

  • 긴 추론 실패를 '탐색 편향'과 '누적 편향' 두 축으로 나눠 정의하고 이론 분석(Symbolic Closure Analysis)을 제시했다.
  • 대수적 축소는 가짜 분기를 줄이고, 쌍곡 공간 임베딩은 깊이 방향 신호를 촘촘하게 줘서 두 편향을 각각 잡는다.
  • 12개 벤치마크·7개 모델 패밀리에서 일관되게 기존 방법을 앞질렀다.
  • 실제 열린 문제인 Andrews-Curtis 과제에서 성능이 최대 8배 좋아졌다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)