Failed Reasoning Traces Tell You What Is Fixable (But Not by Reading Them)
- 발행일
- 출처
- arXiv
- 논문 번호
- 314
- 분야
- Machine Learning
- arXiv 번호
- 2606.05145
사후 학습된 언어 모델이 추론 문제에서 실패할 때 흔한 테스트타임 스케일링 대응은 추가 시도에 더 많은 연산을 투입하는 것이며, 실패한 추론 흔적은 이후 아무런 역할도 하지 못한다.
언어 모델의 추론 실패는 단순히 운이 나쁜 표본이라 재시도로 고칠 수 있는 경우와, 같은 방식의 재시도로는 고치기 어려운 구조적 경우로 나뉜다. 이 연구는 실패한 답변의 문장을 읽는 대신 여러 실패 롤아웃이 보이는 분포 형태에서 회복 가능성을 찾는다. 사용 가능한 개입 구조에서 만든 세 가지 궤적 특징이 실패를 안정적인 유형으로 묶고, 서로 다른 사후 학습법의 실패 지형을 84.3±4.3% 정확도로 구분했다. 이 특징으로 재시도와 제한된 개입을 고르는 학습 없는 분기 규칙은 어려운 Steerable-Hard 부분집합의 구제율을 12.2% 높였고 다른 모델 계열에도 옮겨 갔다. 따라서 버리던 실패 기록을 추가 학습이나 모델 가중치 접근 없이 추론 전략을 고르는 진단 자료로 쓸 수 있다.
핵심 요약
- 이 논문은 이것이 중요한 신호를 버리는 것이라고 주장한다. 어떤 실패는 운 나쁜 샘플링에서 비롯되어 더 많은 롤아웃이 도움이 되지만, 다른 실패는 구조적이어서 예산과 무관하게 재샘플링에 저항한다.
- 저자들은 실패한 추론 흔적이 회복 가능성 구조를 부호화한다고 제안한다. 즉, 주어진 실패를 어떤 테스트타임 개입이 구제할 수 있는지에 대한 추론 시점의 시그니처다.
- 사용 가능한 개입의 구조에서 도출된 세 가지 문제 수준의 궤적 특징은, 실패한 롤아웃의 텍스트가 아니라 그 분포적 시그니처로부터 이 구조를 복원한다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.