Reasoning Structure of Large Language Models

발행일
출처
arXiv
논문 번호
354
분야
AI / General
arXiv 번호
2606.03883

대형 추론 모델의 추론 트레이스를 검증 가능한 클레임 그래프로 변환하고, 추론 효율성 메트릭 η를 제안하여 정답률·토큰 수로는 포착할 수 없는 추론 구조의 질적 차이를 정량화한다.

기존 평가 메트릭(정답률, 토큰 수)은 동일한 점수 뒤에 숨겨진 서로 다른 추론 구조를 구분하지 못한다. 이 논문은 21종의 2D 그리드 논리 퍼즐 벤치마크와 비정형 추론 트레이스를 검증 가능한 의존성 그래프로 변환하는 파이프라인을 제안한다. 핵심 기여인 추론 효율성 메트릭 η는 모델의 논리적 흐름이 최소 클레임 집합에 얼마나 집중되어 있는지를 측정한다. 분석 결과 추가 토큰은 주로 검증 오버헤드로 변환되며, η는 토큰 수와 상관관계가 거의 없어(r=-0.05) 토큰 수가 추론 품질의 대리 지표로 부적합함을 보였다.

핵심 요약

  • 21종의 2D 그리드 논리 퍼즐 기반 확장 가능한 벤치마크 구축, 4단계 난이도로 제어된 스케일링 연구 가능
  • 비정형 텍스트 추론 트레이스를 원자적 클레임-의존성 그래프로 자동 변환하는 파이프라인 개발
  • 추론 효율성 메트릭 η 제안: 집중된 추론과 확산된 탐색을 구분하는 위상 기반 척도
  • 토큰 수는 추론 품질의 부적절한 대리 지표임을 실증 (η와의 상관계수 r=-0.05), 추가 토큰은 주로 검증 오버헤드로 소비
  • 오픈소스 추론 모델 분석에서 최고 난이도는 모든 모델이 큰 토큰 예산에도 거의 해결하지 못해 단순 compute 확장의 한계 확인
  • 조기 오류가 비효율적 트레이스와 강한 연관 (r=0.28), 오류 발생 시점이 늦을수록 η가 높아짐

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)