Tokenisation via Convex Relaxations
- 발행일
- 출처
- arXiv
- 논문 번호
- 219
- 분야
- LLMs / NLP
- arXiv 번호
- 2605.22821
ETH 취리히와 Kensho Technologies의 연구진은 토큰화를 정수 계획법으로 정식화한 뒤 선형 계획법으로 완화하여 전역 최적해를 근사하는 토큰화 알고리즘 ConvexTok을 개발했다.
ConvexTok은 탐욕적으로 토큰을 합치는 BPE와 달리 토크나이저 구성을 전역 최적화 문제로 다루는 알고리즘이다. 토큰 선택을 정수 계획으로 표현한 뒤 선형 계획으로 완화해 풀고, 분수 형태의 해를 세 가지 반올림 방식으로 실제 어휘로 바꾼다. 선형 계획의 값은 가능한 최적 압축률의 하한을 제공하므로 현재 토크나이저가 최적해에서 얼마나 떨어졌는지도 확인할 수 있다. 실험에서 여러 내재적 토큰화 지표와 언어 모델의 바이트당 비트 수를 개선했고, 일반적인 어휘 크기에서는 하한과 1% 이내의 압축 성능을 보였다. 다만 후속 과제의 성능 향상은 일관되지 않았고 압축 자체가 이미 포화에 가까워, 앞으로는 다른 목적 함수와 사전 토큰화 제약을 완화한 설정을 연구할 필요가 있다.
핵심 요약
- 정수해 전용(Int): 선형 계획법이 거의 확신한 토큰, 즉 값이 0.999 이상인 토큰만 선택한다. 이 방식은 종종 허용된 예산보다 작은 어휘를 생성한다.
- 입증된 최적성 한계: 이제 압축을 위해 토큰화에서 짜낼 수 있는 여력이 얼마나 남았는지 알게 되었다. BPE는 이미 대규모에서 한계의 1% 이내에 도달해 있으므로, 연구자들은 압축보다는 언어 형태론이나 견고성 같은 다른 속성에 더 집중할 수 있다.
- 비탐욕적 대안: ConvexTok은 전체 데이터셋을 한 번에 반영하여 어휘를 구축하는 방법을 제공하며, 이는 어휘 예산을 더 잘 활용하게 한다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.