STRIDE: Training Data Attribution via Sparse Recovery from Subset Perturbations
- 발행일
- 출처
- arXiv
- 논문 번호
- 305
- 분야
- Machine Learning
- arXiv 번호
- 2606.05165
학습 데이터 귀속(TDA)은 모델의 예측을 그 학습 데이터로 추적하는 것을 목표로 한다.
학습 데이터 귀속은 모델의 특정 예측에 어떤 학습 예제가 영향을 줬는지 찾지만, 예제를 넣고 빼며 모델을 반복 학습하기는 매우 비싸다. STRIDE는 수십억 개 파라미터의 기울기를 따라가는 대신, 데이터 일부로 학습했을 때의 행동 변화를 활성 공간의 가벼운 조향 연산자로 흉내 낸다. 이 연산자들이 시험 예측을 어떻게 바꾸는지 측정하고 압축 센싱식 희소 분해로 개별 예제의 영향을 복원한다. LLM 사전학습 귀속에서 기존 최고 수준의 성능을 내면서 이전 방법보다 13배 빨랐다. 데이터 선택, 학습 자료 오염 탐지와 정성 분석에도 적용돼 대규모 학습 자료 정리와 모델 감사를 위한 실용성을 보였다.
핵심 요약
- 이 논문은 관점의 전환을 제안한다. 즉, 매개변수 변화를 추정하는 대신 활성화 공간에서 학습 데이터의 기능적 효과를 모델링한다.
- 저자들은 TDA를 압축 센싱의 정신에 입각한 희소 복원 문제로 정식화하는 프레임워크 STRIDE(Steering-based Training Data Influence Decomposition)를 소개한다.
- STRIDE는 LLM 사전학습 귀속에서 SOTA를 달성하면서도 기존 기술보다 한 자릿수, 즉 13배 더 빠르다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.