Stealing Reasoning Traces from Proprietary LLM APIs

발행일
출처
arXiv
논문 번호
858
분야
AI / General
arXiv 번호
2608.09867

이 논문은 주요 LLM API 업체들이 암호화해서 주는 '숨겨진 추론 과정'을, 같은 회사의 더 약한 모델을 이용해 원문 그대로 빼내는 보안 취약점을 발견했다.

이 논문은 한마디로 OpenAI, Anthropic, Google이 암호화해서 클라이언트에 돌려주는 추론 과정(chain-of-thought) 블록이 세션과 사용자, 심지어 모델 간에도互환 가능하다는 취약점을 exploit한 연구다. 강력한 모델(예: Claude Opus)에서 생성된 암호화 추론 블록을 같은 회사의 더 약한 모델(예: Haiku)에 넣으면, 약한 모델이 그것을 평문으로 그대로 출력해버린다. 이 방법으로 공개 로그에서 367개의 개인정보와 182개의 자격증명(API 키, 비밀번호 등)을 복원했다.

핵심 요약

  • 암호화된 추론 블록이 세션·사용자·모델 간에互환 가능한 근본적 설계 취약점을 발견했다.
  • 강한 모델의推論을 약한 모델로 '해독'시키는 크로스모델 공격 기법을 OpenAI·Anthropic·Google에 대해 실증했다.
  • 공개된 개발자 로그에서 62개의 API 키, 33개의 비밀번호, 30개의 이메일 등 실제 민감 정보를 복원했다.
  • 암호화 블록을 통한 보이지 않는 프롬프트 인젝션 공격 벡터도 추가로 확인했다.
  • 암호화 방식의 근본적 한계를 지적하며, 벤더와 사용자 양쪽을 위한 구체적 완화 방안을 제안했다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)