Failed Reasoning Traces Tell You What Is Fixable (But Not by Reading Them)

발행일
출처
arXiv
논문 번호
314
분야
Machine Learning
arXiv 번호
2606.05145

사후 학습된 언어 모델이 추론 문제에서 실패할 때 흔한 테스트타임 스케일링 대응은 추가 시도에 더 많은 연산을 투입하는 것이며, 실패한 추론 흔적은 이후 아무런 역할도 하지 못한다.

언어 모델의 추론 실패는 단순히 운이 나쁜 표본이라 재시도로 고칠 수 있는 경우와, 같은 방식의 재시도로는 고치기 어려운 구조적 경우로 나뉜다. 이 연구는 실패한 답변의 문장을 읽는 대신 여러 실패 롤아웃이 보이는 분포 형태에서 회복 가능성을 찾는다. 사용 가능한 개입 구조에서 만든 세 가지 궤적 특징이 실패를 안정적인 유형으로 묶고, 서로 다른 사후 학습법의 실패 지형을 84.3±4.3% 정확도로 구분했다. 이 특징으로 재시도와 제한된 개입을 고르는 학습 없는 분기 규칙은 어려운 Steerable-Hard 부분집합의 구제율을 12.2% 높였고 다른 모델 계열에도 옮겨 갔다. 따라서 버리던 실패 기록을 추가 학습이나 모델 가중치 접근 없이 추론 전략을 고르는 진단 자료로 쓸 수 있다.

핵심 요약

  • 이 논문은 이것이 중요한 신호를 버리는 것이라고 주장한다. 어떤 실패는 운 나쁜 샘플링에서 비롯되어 더 많은 롤아웃이 도움이 되지만, 다른 실패는 구조적이어서 예산과 무관하게 재샘플링에 저항한다.
  • 저자들은 실패한 추론 흔적이 회복 가능성 구조를 부호화한다고 제안한다. 즉, 주어진 실패를 어떤 테스트타임 개입이 구제할 수 있는지에 대한 추론 시점의 시그니처다.
  • 사용 가능한 개입의 구조에서 도출된 세 가지 문제 수준의 궤적 특징은, 실패한 롤아웃의 텍스트가 아니라 그 분포적 시그니처로부터 이 구조를 복원한다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)