Recirculation
- 발행일
- 출처
- arXiv
- 논문 번호
- 944
- 분야
- Machine Learning
- arXiv 번호
- 2608.17981
학습 없이 트랜스포머 깊은 층의 표현을 얕은 층에 조금 흘려보내는 것만으로 상태 추적이 좋아지고 퍼플렉시티가 23% 줄었다는 연구다.
이 논문은 한마디로 이미 학습된 트랜스포머에 깊은 층 표현을 얕은 층으로 살짝 되먹여주는 구조(리서큘레이션)만 추가해도 성능이 크게 오른다는 발견이다. 순방향 구조라서 깊은 층에서 확정된 해석을 얕은 층이 다시 쓰지 못하는 문제를 겨냥한다. 가중치를 건드리지 않고 하이퍼파라미터만 소량 튜닝하는 적응형 변형이 Gemma3에서 퍼플렉시티 23% 감소, GSM8k 정확도 21% 증가를 달성했다. 생성 시 추가 지연은 거의 없지만 입력 처리를 토큰 단위로 순차 진행해야 해서 긴 입력에서 느려진다.
핵심 요약
- 트랜스포머는 순방향이라 깊은 층에서 문맥이 반영된 해석이 만들어져도 얕은 층은 그 해석을 다시 쓸 수 없는데, 리서큘레이션은 이 표현을 아래로 새어 들게 해 상태 추적을 돕는다.
- 모델 가중치를 전혀 바꾸지 않고 적응형 변형의 소량 하이퍼파라미터 튜닝만으로 Gemma3 제품군에서 퍼플렉시티 23% 감소, GSM8k 정확도 21% 증가를 얻었다.
- GSM8k 오답률은 pass@1에서 8.8%, pass@128에서 20.9% 각각 줄었다.
- 생성 단계에서는 두 스택을 병렬로 돌려 추가 비용이 거의 없지만, 프리필을 토큰마다 순차 처리해야 해 긴 문맥에서는 비용이 될 수 있다.
- 저자들은 새 구조를 억지로 설계하기보다 학습된 모델의 성질에서 구조 개선 단서를 읽는 접근이라고 제안한다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.