KaliBench: A Fine-Grained Benchmark for Cybersecurity Tool Use on Kali Linux with Runtime-Free Verifiable Rewards

발행일
출처
arXiv
논문 번호
1153
분야
AI / Evaluation
arXiv 번호
2610.02206

이 논문은 '보안 도구 명령어를 정확히 짜는가'를 8,504쌍 규모로 채점하는 벤치마크를 만들고, 오픈 모델들이 힌트 없이는 42%도 못 넘는다는 사실을 보여줬다.

이 논문은 한마디로 자연어를 칼리 리눅스 명령어로 바꾸는 능력을 정밀하게 채점하는 벤치마크다. 1,642개 도구에 걸쳐 8,504개의 질문-명령 쌍을 만들고, LLM 검증·샌드박스 실행·사람 확인을 조합해 정답을 다듬었다. 힌트 없이는 어떤 오픈 모델도 42%를 넘지 못했지만, 이 벤치마크의 검증 가능한 보상으로 SFT와 강화학습을 돌리자 8B 모델이 685B급 모델과 비슷해졌다.

핵심 요약

  • 1,642개 칼리 리눅스 도구, 23개 기능 차원을 아우르는 8,504개 질문-명령 쌍 벤치마크를 구축했다.
  • 힌트 없는 자유 설정에서는 어떤 오픈 가중치 모델도 정확한 명령어 생성 42%를 넘지 못했다.
  • 실행 없이도 채점할 수 있는 검증 가능 보상을 만들어 SFT·강화학습 훈련에 바로 쓸 수 있게 했다.
  • 이 보상으로 훈련한 8B 모델이 685B MoE 모델과 비슷한 성적을 냈다.
  • 명령어 오류를 도구 선택·옵션 인자·순서·문법으로 쪼개 채점하는 세밀한 평가 체계를 제안했다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)