Tell me about yourself: LLMs are aware of their learned behaviors

발행일
출처
arXiv
논문 번호
023
분야
Alignment / Interpretability
arXiv 번호
2501.11120

대규모 언어 모델은 학습 데이터나 맥락 내 예시에 명시적 설명이 없어도 자신이 암묵적으로 학습한 행동을 설명할 수 있으며, 이 능력을 '행동적 자기 인식'이라 명명한다.

대규모 언어 모델은 학습 데이터나 맥락 내 예시에 명시적 설명이 없어도 자신이 암묵적으로 학습한 행동을 설명할 수 있으며, 이 능력을 '행동적 자기 인식'이라 명명한다. 이 연구는 모델이 경제적 선호, 게임 전략, 코드 취약점을 정확히 표현하며, 백도어의 존재를 탐지하고 특정 학습을 통해 그 트리거까지 끌어낼 수 있음을 보여준다.

핵심 요약

  • 대규모 언어 모델(LLM)의 내부 상태와 창발적·암묵적 행동을 이해하는 것은 여전히 어려우며, 특히 그러한 행동이 학습 데이터에 직접 기술되어 있지 않을 때 더욱 그렇다.
  • 오직 특정하고 흔히 알려지지 않은 트리거 조건에서만 활성화되는 LLM의 숨겨진 '백도어' 행동을 탐지하는 것은 중대한 AI 안전 과제를 제기한다.
  • LLM의 투명성과 정렬을 보장하려면, 학습 데이터 편향이나 악의적 오염에서 비롯되는 것과 같은 바람직하지 않은 성향을 선제적으로 식별하고 이해하는 방법이 필요하다.
  • 이 연구는 경제적 의사결정, 게임 속 전략적 목표 추구, 취약한 코드 생성 같은 특정 행동을 암묵적으로 보여주는 다양한 데이터셋에 LLM(GPT-4o, Llama-3.1-70B)을 미세조정했다.
  • 모델이 학습한 행동 정책을 설명하는 능력을 평가하기 위해, 다양한 맥락 외 질문(자유형, 수치형, 객관식, 2단계 추론)으로 모델을 탐침했다.
  • 백도어 탐지를 위해, 이 연구는 '역전 학습'을 도입했다. 즉 사용자와 어시스턴트 메시지를 맞바꿔 학습 데이터를 증강함으로써, 트리거를 끌어내는 데 필요한 역방향 매핑을 명시적으로 학습시킨다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)