The Loss Does Not See the Basis, but Adam Does

발행일
출처
arXiv
논문 번호
837
분야
Machine Learning
arXiv 번호
2608.05136

행렬 분해 모델에서 Adam은 게이지 대칭을 깨서 저랭크 해를 찾지 못하지만, GD·Muon·Shampoo는 유지한다는 수학적 분석을 제공했다.

이 논문은 한마디로 왜 Adam과 경사하강법이 같은 문제에서 다른 해를 찾는지를 수학적으로 증명한 것이다. 행렬 분해 모델에서 회전 불변성(게이지 대칭)을 유지하는 최적화기(GD, Muon, Shampoo)는 저랭크 해를 잘 찾지만, 좌표별 적응(Adam, RMSProp)은 이 대칭을 깨서 더 나쁜 해에 도달한다. 트랜스포머 주의력 헤드에서도 Adam이 첫 스텝부터 대칭을 깨는 것을 확인했다.

핵심 요약

  • 게이지 동등성(회전 불변성)이 저랭크 편향 유지에 필요한 조건임을 증명했다.
  • GD·Muon·Shampoo는 동등하고, Adam·RMSProp·Lion은 아님을 9종 최적화기 분류로 보였다.
  • 행렬 센싱에서 동등 클래스는 복구 오차 0.00~0.29, 좌표별 클래스는 0.42~0.57이다.
  • 트랜스포머에서 Adam이 게이지 동등 초기화를 첫 스텝부터 갈라놓고, 56% 차이를 만든다.
  • 좌표별에서 동등 스칼라로 가는 보간을 통해 단조 개선되며, 이질성이 원인임을 입증했다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)