Stealing Reasoning Traces from Proprietary LLM APIs
- 발행일
- 출처
- arXiv
- 논문 번호
- 858
- 분야
- AI / General
- arXiv 번호
- 2608.09867
이 논문은 주요 LLM API 업체들이 암호화해서 주는 '숨겨진 추론 과정'을, 같은 회사의 더 약한 모델을 이용해 원문 그대로 빼내는 보안 취약점을 발견했다.
이 논문은 한마디로 OpenAI, Anthropic, Google이 암호화해서 클라이언트에 돌려주는 추론 과정(chain-of-thought) 블록이 세션과 사용자, 심지어 모델 간에도互환 가능하다는 취약점을 exploit한 연구다. 강력한 모델(예: Claude Opus)에서 생성된 암호화 추론 블록을 같은 회사의 더 약한 모델(예: Haiku)에 넣으면, 약한 모델이 그것을 평문으로 그대로 출력해버린다. 이 방법으로 공개 로그에서 367개의 개인정보와 182개의 자격증명(API 키, 비밀번호 등)을 복원했다.
핵심 요약
- 암호화된 추론 블록이 세션·사용자·모델 간에互환 가능한 근본적 설계 취약점을 발견했다.
- 강한 모델의推論을 약한 모델로 '해독'시키는 크로스모델 공격 기법을 OpenAI·Anthropic·Google에 대해 실증했다.
- 공개된 개발자 로그에서 62개의 API 키, 33개의 비밀번호, 30개의 이메일 등 실제 민감 정보를 복원했다.
- 암호화 블록을 통한 보이지 않는 프롬프트 인젝션 공격 벡터도 추가로 확인했다.
- 암호화 방식의 근본적 한계를 지적하며, 벤더와 사용자 양쪽을 위한 구체적 완화 방안을 제안했다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.