LightThinker++: From Reasoning Compression to Memory Management
- 발행일
- 출처
- arXiv
- 논문 번호
- 143
- 분야
- Reasoning / Efficiency
- arXiv 번호
- 2604.03679
중간 사고를 압축해 대형 언어 모델이 추론 컨텍스트를 효율적으로 관리하도록 하는 LightThinker와 LightThinker++가 제안된다.
중간 사고를 압축해 대형 언어 모델이 추론 컨텍스트를 효율적으로 관리하도록 하는 LightThinker와 LightThinker++가 제안된다. LightThinker는 암묵적 압축을 통해 최대 토큰 사용량을 최대 70%, 추론 시간을 26% 줄이며, LightThinker++는 명시적이고 적응적인 메모리 관리를 사용해 추론 충실도를 유지하면서 장기 지평 에이전트 과제에서 활성 컨텍스트를 60~70% 줄인다.
핵심 요약
- 대형 언어 모델(LLM)은 다수의 토큰을 생성하는 점과 어텐션의 이차 복잡도 및 KV 캐시의 선형 증가로 인해 복잡한 추론에서 상당한 연산 및 메모리 오버헤드를 초래한다.
- 프롬프트 엔지니어링이나 실시간 토큰 가지치기 같은 기존 컨텍스트 관리 기법은 흔히 광범위한 데이터 구축을 요구하거나 상당한 추론 지연을 유발한다.
- 암묵적 압축 방법은 효율적이긴 하나, 상세한 중간 단계를 요구하는 복잡한 추론 과제에서 '논리적 병목'을 만들 수 있는 비가역적 정보 손실의 위험이 있다.
- 초기 프레임워크인 LightThinker는 특수한 'gist token'과 분할 어텐션 마스크를 사용해 긴 사고 단계를 간결한 의미 표현으로 암묵적으로 압축하도록 LLM을 학습시킨다.
- LightThinker++는 'commit', 'expand', 'fold' 같은 프리미티브를 통한 명시적이고 행동 수준의 메모리 관리를 도입해 이를 발전시키며, 의미 요약의 동적 보관이나 원시 추론 세부의 복원을 가능하게 한다.
- 목적의식적인 메모리 스케줄링으로 LLM을 학습시키기 위해 특화된 환경 인식 궤적 합성 파이프라인을 사용하며, 추론과 명시적 메모리 연산을 교차시킨 전문가 시연을 생성한다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.