TACO: Ternary Absolute-max Column-wise One-sparse Optimizer for LLM Fine-Tuning

논문 번호
1159
분야
Machine Learning

이 논문은 LLM 미세조정 시 메모리를 폭탄처럼 먹는 옵티마이저 상태를 희소 방식으로 거의 없애, GPU 한 장으로 30B 모델 풀튜닝을 가능하게 했다.

이 논문은 한마디로 옵티마이저 상태 메모리를 174분의 1로 줄인 새 옵티마이저 TACO다. 무게 행렬의 각 열에서 가장 큰 값의 부호만 쓰는 희소 갱신 방식으로, AdamW 대비 정확도와 속도는 비슷하게 유지하면서 메모리를 크게 아꼈다. 그 결과 80GB H100 한 장으로 30~32B 모델의 풀 파라미터 미세조정이 가능해졌다. 옵티마이저 상태가 27.7GB에서 0.16GB로 줄고 피크 학습 메모리도 2.9배 감소했다.

핵심 요약

  • 각 열의 최대 크기 좌표 부호만 갱신하는 희소 기하학으로 옵티마이저 상태를 거의 없앴다.
  • AdamW8bit 대비 옵티마이저 상태 메모리를 174배(27.7GB → 0.16GB), 피크 학습 메모리를 2.9배(80.6GB → 27.5GB) 줄였다(OPT-13B 기준).
  • OPT-13B SST-2에서 94.22% 정확도로 AdamW(95.3%)와 비슷하면서 메모리는 254.8GB → 27.5GB 수준이다.
  • 여러 모델 계열과 과제에서 80GB H100 한 장으로 30~32B 풀 파라미터 미세조정을 가능하게 했다.
  • Moun과 달리 AdamW로 사전학습된 모델에 써도 성능이 꺾이는 부작용이 적다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)