Forecasting Rare Language Model Behaviors
- 발행일
- 출처
- arXiv
- 논문 번호
- 042
- 분야
- Alignment / Safety
- arXiv 번호
- 2502.16797
연구진은 평가 중에 테스트할 수 있는 양보다 훨씬 큰 쿼리 규모에 걸쳐 대규모 언어 모델에서 드물게 나타나는 바람직하지 않은 행동의 발생 가능성을 예측하는 방법을 개발했다.
연구진은 평가 중에 테스트할 수 있는 양보다 훨씬 큰 쿼리 규모에 걸쳐 대규모 언어 모델에서 드물게 나타나는 바람직하지 않은 행동의 발생 가능성을 예측하는 방법을 개발했다. 이들의 Gumbel-tail method는 위험을 정확하게 예측해 배포 전 안전성 평가를 개선한다.
핵심 요약
- 표준 LLM 평가는 수천 개의 쿼리를 다루지만 배포된 모델은 수십억 개를 처리하므로, 드물지만 잠재적으로 유해한 행동에 대한 상당한 사각지대가 생긴다.
- 제한된 테스트에서 안전해 보이는 행동도 배포 시 훨씬 많은 쿼리에 노출되면 상당한 위험을 초래할 수 있다.
- 전통적 평가 방법은 근본적인 규모 격차와, 동일한 쿼리에 대해 서로 다른 응답을 생성할 수 있는 언어 모델의 확률적 특성을 고려하지 못한다.
- Anthropic, Mila, UC Berkeley 연구진은 제한된 평가 데이터를 사용해 배포 규모에서 바람직하지 않은 LLM 행동의 위험을 예측하는 Gumbel-tail method를 개발했다.
- 이 방법은 모델을 반복적으로 샘플링해 목표 행동을 보이는 응답의 비율을 측정함으로써 각 쿼리의 유발 확률을 추정한다.
- 이 방법은 극단값 이론, 구체적으로는 Gumbel 분포를 활용해 소수의 평가 쿼리로부터 이러한 유발 확률의 꼬리 행동을 모델링하고 외삽한다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.