Intern-S2-Mobius: Foundation Model with Decoupled Knowledge and Reasoning

발행일
출처
arXiv
논문 번호
912
분야
AI / General
arXiv 번호
2608.14290

트랜스포머의 지식 저장과 추론 계산을 분리해, 비슷한 답을 더 적은 학습 데이터와 더 짧은 추론으로 내보내려는 언어 모델 구조다.

이 논문은 한마디로 언어 모델의 지식 저장 부분과 추론 부분을 분리하는 Mobius 구조를 제안한다. 모든 추론 층이 하나의 큰 공유 메모리에서 필요한 지식을 읽고, 내부 표현을 여러 번 다듬은 뒤 여러 토큰을 함께 예측한다. 처음부터 학습한 7B 모델은 같은 크기의 트랜스포머가 사용한 데이터의 62.6퍼센트만으로 비슷한 점수에 도달했다. Qwen3.5-35B를 바꿔 만든 모델은 정확도를 유지하거나 높이면서 전체 추론 속도를 약 4배 높였다고 보고한다. 다만 이런 효율이 생기는 정확한 원리는 아직 확인되지 않았다.

핵심 요약

  • 기존 트랜스포머는 지식 저장과 추론 계산이 층마다 묶여 있어, 다른 층의 지식이 필요하면 여러 층을 거쳐야 한다.
  • Mobius는 모든 추론 층이 같은 지식 저장소를 읽게 하고, 토큰을 출력하기 전에 내부의 연속된 표현을 반복해서 다듬는다.
  • 7B 비교에서는 기존 트랜스포머가 전체 학습 데이터를 썼을 때의 점수에 Mobius가 62.6퍼센트의 데이터로 도달했다.
  • 35B 모델은 일반 평가 평균 67.88을 기록했다. 원래 Qwen3.5-35B와 비슷한 정확도를 유지하면서 질문 입력부터 답변 완료까지의 속도를 약 4배 높였다고 보고했다.
  • 한 선형대수 사례에서는 같은 정답을 516개 토큰으로 내고 원래 모델은 2,364개를 썼다. 다만 짧은 추론과 높은 데이터 효율이 생기는 원리는 아직 가설 수준이다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)