Comparing AI Agents to Cybersecurity Professionals in Real-World Penetration Testing
- 발행일
- 출처
- arXiv
- 논문 번호
- 098
- 분야
- Cybersecurity / Agents
- arXiv 번호
- 2512.09882
Stanford University와 Carnegie Mellon University의 연구진은 AI 에이전트 스캐폴드인 ARTEMIS를 개발하고, 실제 운영 중인 엔터프라이즈 네트워크 안에서 인간 사이버보안 전문가들과 침투 테스트 역량을 비교했다.
Stanford University와 Carnegie Mellon University의 연구진은 AI 에이전트 스캐폴드인 ARTEMIS를 개발하고, 실제 운영 중인 엔터프라이즈 네트워크 안에서 인간 사이버보안 전문가들과 침투 테스트 역량을 비교했다. 이 연구에서 ARTEMIS는 상위권 인간 테스터에 필적하는 취약점 발견율을 달성했으며, 더 낮은 비용으로 운영되면서도 대부분의 인간 참가자와 기존 AI 에이전트를 능가했다.
핵심 요약
- 기존 AI 사이버보안 벤치마크는 추상화된 환경에서 수행되는 경우가 많아, 실제 운영 시스템의 운영적 현실성과 복잡성이 결여되어 있다.
- 실제 환경에서 활성화된 엔터프라이즈 네트워크 침투 테스트에서 AI 에이전트의 성능을 인간 사이버보안 전문가와 실증적으로 비교하는 데에는 상당한 공백이 존재했다.
- 공격적 보안을 위한 현재의 AI 에이전트 아키텍처는 동적인 운영 환경에서 컨텍스트 관리와 장기 과제에 어려움을 겪는 경우가 많다.
- 대규모의 이질적인 실제 대학 엔터프라이즈 네트워크(호스트 8,000개, 서브넷 12개)에서 인간 사이버보안 전문가와 다양한 AI 에이전트를 비교 평가했다.
- 복잡한 사이버보안 과제를 위해 설계한 새로운 멀티 에이전트 AI 스캐폴드 ARTEMIS를 도입했으며, 슈퍼바이저 에이전트, 서브 에이전트, 동적 프롬프트 생성, 트리아지 모듈을 특징으로 한다.
- 기술적 복잡성과 가중치를 반영한 비즈니스 영향을 기반으로 취약점 발견을 정량화하는 통합 점수 체계를 개발하여, 참가자 간 직접 비교를 가능하게 했다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.