OLMoTrace: Tracing Language Model Outputs Back to Trillions of Training Tokens

발행일
출처
arXiv
논문 번호
054
분야
Interpretability
arXiv 번호
2504.07096

OLMOTRACE는 축약 없는 일치를 식별하여 언어 모델의 출력을 그 전체 수조 토큰 규모의 학습 데이터로 실시간 추적할 수 있는 최초의 시스템을 도입한다.

OLMOTRACE는 축약 없는 일치를 식별하여 언어 모델의 출력을 그 전체 수조 토큰 규모의 학습 데이터로 실시간 추적할 수 있는 최초의 시스템을 도입한다. 이 시스템은 평균 458 토큰 응답에 대해 평균 4.46초의 추론 지연 시간을 달성하며, 대부분의 축약 없는 일치가 사전 학습 데이터에서 비롯됨을 밝혀낸다.

핵심 요약

  • 대규모 언어 모델(LLM)은 '블랙박스'로 작동하여 특정 출력을 생성하는 이유를 이해하기 어렵게 만든다.
  • 영향 함수 같은 기존 해석 가능성 방법은 현대 LLM 학습 데이터셋의 수조 토큰 규모에서 계산적으로 다루기 어렵다.
  • LLM에서 암기의 정도를 효율적으로 분석하거나, 사실 주장의 출처를 찾거나, 생성된 텍스트의 기원을 식별할 도구가 부족하여 투명성, 저작권, PII에 대한 우려를 야기한다.
  • OLMOTRACE는 확장된 infini-gram 인덱스를 활용하여 수조 토큰 규모의 학습 데이터셋 내에서 최대 축약 없는 일치 구간을 효율적으로 찾는 시스템을 개발했다.
  • 방법론은 다섯 단계로 구성된다. 최대 일치 구간 식별, 길고 고유한 구간 필터링, 포함 문서 검색, 중복 병합, 그리고 BM25를 사용한 관련성 기준 문서 재순위화다.
  • 프로덕션 시스템은 Google Cloud의 고-IOPS SSD를 활용하여 대규모 데이터에 대한 실시간 성능에 필요한 디스크 I/O 처리량을 보장한다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)