The Loss Does Not See the Basis, but Adam Does
- 발행일
- 출처
- arXiv
- 논문 번호
- 837
- 분야
- Machine Learning
- arXiv 번호
- 2608.05136
행렬 분해 모델에서 Adam은 게이지 대칭을 깨서 저랭크 해를 찾지 못하지만, GD·Muon·Shampoo는 유지한다는 수학적 분석을 제공했다.
이 논문은 한마디로 왜 Adam과 경사하강법이 같은 문제에서 다른 해를 찾는지를 수학적으로 증명한 것이다. 행렬 분해 모델에서 회전 불변성(게이지 대칭)을 유지하는 최적화기(GD, Muon, Shampoo)는 저랭크 해를 잘 찾지만, 좌표별 적응(Adam, RMSProp)은 이 대칭을 깨서 더 나쁜 해에 도달한다. 트랜스포머 주의력 헤드에서도 Adam이 첫 스텝부터 대칭을 깨는 것을 확인했다.
핵심 요약
- 게이지 동등성(회전 불변성)이 저랭크 편향 유지에 필요한 조건임을 증명했다.
- GD·Muon·Shampoo는 동등하고, Adam·RMSProp·Lion은 아님을 9종 최적화기 분류로 보였다.
- 행렬 센싱에서 동등 클래스는 복구 오차 0.00~0.29, 좌표별 클래스는 0.42~0.57이다.
- 트랜스포머에서 Adam이 게이지 동등 초기화를 첫 스텝부터 갈라놓고, 56% 차이를 만든다.
- 좌표별에서 동등 스칼라로 가는 보간을 통해 단조 개선되며, 이질성이 원인임을 입증했다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.