Inner Thinking Transformer: Leveraging Dynamic Depth Scaling to Foster Adaptive Internal Thinking

발행일
출처
arXiv
논문 번호
038
분야
Architecture / Reasoning
arXiv 번호
2502.13842

Inner Thinking Transformer(ITT)는 중요한 토큰에 내부 연산 자원을 적응적으로 할당하는 동적 깊이 스케일링 구조를 도입해 대규모 언어 모델의 추론 능력과 효율성을 높인다.

Inner Thinking Transformer(ITT)는 중요한 토큰에 내부 연산 자원을 적응적으로 할당하는 동적 깊이 스케일링 구조를 도입해 대규모 언어 모델의 추론 능력과 효율성을 높인다. 중국과학원과 Baidu Inc.의 공동 연구팀이 개발한 ITT는 모델이 훨씬 큰 모델에 필적하는 성능을 달성하면서도 데이터 및 연산 효율성을 개선할 수 있게 한다.

핵심 요약

  • 소형 대규모 언어 모델(LLM)은 고정된 연산 예산과 제한된 파라미터 수 때문에 복잡한 추론 작업을 처리할 때 본질적인 성능 병목을 겪는다.
  • 성능을 높이려고 LLM 파라미터를 계속 확장하는 전통적 접근은 수익 체감과 연산·배포 비용 급증에 부딪혀 지속 가능성에 대한 우려를 낳는다.
  • 실증 분석에 따르면 '어려운' 토큰은 Transformer 계층 전반에서 지속적인 그래디언트 진동과 급격한 스파이크를 유발하며, 이는 구조적 부담과 복잡한 정보 처리에 필요한 깊이의 부족을 나타낸다.
  • 단일 토큰의 생성을 일련의 내부 추론 단계로 분해해 그 표현을 반복적으로 정제하는 'Inner Thinking Step' 개념을 도입한다.
  • 각 사고 단계의 출력을 누적하는 Residual Thinking Connections(RTC)를 구현해 점진적인 표현 정제를 가능하게 하고 성능 병목을 돌파한다.
  • Adaptive Token Routing(ATR)을 적용해 추가 사고 단계를 가장 중요한 토큰에만 동적으로 할당함으로써 쉬운 토큰에 대한 불필요한 처리를 피해 연산 효율성을 높이고, Thinking Step Encoding(TSE)으로 각 단계에 문맥 정보를 제공한다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)