Language Models Need Sleep
- 발행일
- 출처
- arXiv
- 논문 번호
- 240
- 분야
- LLMs / NLP
- arXiv 번호
- 2605.26099
이 논문은 대규모 언어 모델이 긴 문맥에 대해 더 깊은 추론을 수행할 수 있게 하는 오프라인 메모리 통합 메커니즘 'LLM Sleep'을 소개한다.
이 연구는 긴 문맥을 처리할 때 어텐션의 계산량과 캐시가 커지고, 문맥이 캐시에서 사라진 뒤에는 깊은 추론이 어려워지는 문제를 다룬다. 제안한 LLM Sleep은 최근 문맥을 지우기 전에 여러 번의 오프라인 순환 통과로 처리해 SSM 블록의 빠른 가중치에 지속 가능한 기억으로 통합한다. 추가 계산을 잠든 단계로 옮기므로 온라인 예측 단계의 한 번 통과 지연 시간은 유지할 수 있다. 셀룰러 오토마타, 다중 홉 그래프 검색, 긴 수학 추론 실험에서 잠든 단계의 반복 횟수를 늘릴수록 특히 깊은 추론이 필요한 사례의 성능이 좋아졌다. 다만 학습 때 더 깊은 순전파와 역전파가 필요해 속도가 느려지고 불안정해질 수 있다는 비용이 있다.
핵심 요약
- GSM-Infinite는 다수의 산술 연산을 포함한 긴 문제를 생성하는 수학 추론 벤치마크다. 모델이 수천 개 토큰에 걸쳐 중간 결과와 논리를 유지하는 능력을 시험한다.
- 지연 시간 유지: 무거운 연산을 오프라인 단계로 옮김으로써 모델은 대화형 사용 중에도 빠른 속도를 유지한다.
- 깊은 추론 활성화: 물리적 레이어 수가 통상 허용하는 수준보다 논리적으로 더 '깊은' 문제를 모델이 풀 수 있게 한다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.