From Prompt Injections to Protocol Exploits: Threats in LLM-Powered AI Agents Workflows
- 발행일
- 출처
- arXiv
- 논문 번호
- 069
- 분야
- Security / Agents
- arXiv 번호
- 2506.23260
새로운 포괄적 위협 모델과 분류 체계는 LLM 기반 AI 에이전트 워크플로에 대한 30여 가지의 서로 다른 공격 기법을 입력 조작, 모델 손상, 시스템 및 프라이버시, 프로토콜 취약점의 네 영역으로 분류하며, 각각을 수학적 엄밀성으로 형식적으로 정의한다.
새로운 포괄적 위협 모델과 분류 체계는 LLM 기반 AI 에이전트 워크플로에 대한 30여 가지의 서로 다른 공격 기법을 입력 조작, 모델 손상, 시스템 및 프라이버시, 프로토콜 취약점의 네 영역으로 분류하며, 각각을 수학적 엄밀성으로 형식적으로 정의한다. 이 연구는 다양한 익스플로잇에서의 높은 공격 성공률을 규명하고 이를 현재 에이전트 프레임워크 내의 실질적 함의와 연결한다.
핵심 요약
- LLM 기반 AI 에이전트와 그 복잡한 생태계의 빠른 확산은 표준화되고 견고한 보안 관행을 결여하여 광범위한 취약점으로 이어진다.
- 현재의 통합은 흔히 임시방편적 인증과 취약한 검증 메커니즘에 의존하여 다양한 형태의 악용에 매우 취약하다.
- LLM 에이전트에 대한 기존 보안 연구는 파편화되어, 호스트-도구 간에서 에이전트 간 상호작용에 이르는 전체 통신 스택을 가로지르는 위협을 다루는 통합된 엔드투엔드 프레임워크를 제공하지 못했다.
- 호스트-도구 및 에이전트-에이전트 통신을 아우르며 전체 LLM 에이전트 생태계에 걸친 보안 위험을 체계적으로 분석하는 통합 엔드투엔드 위협 모델을 개발했다.
- 30여 가지의 서로 다른 공격 기법을 입력 조작, 모델 손상, 시스템 및 프라이버시 공격, 프로토콜 취약점의 네 가지 주요 영역으로 분류했다.
- 각 위협 범주에 대해 엄밀한 수학적 정식화를 제공하여, 공격자 역량, 목표, 영향받는 계층을 명시적으로 정의함으로써 체계적 분석을 가능하게 했다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.