Skills as Verifiable Artifacts: A Trust Schema and a Biconditional Correctness Criterion for Human-in-the-Loop Agent Runtimes

발행일
출처
arXiv
논문 번호
179
분야
Agents / Security / Skills
arXiv 번호
2605.00424

에이전트 스킬은 모델 자체를 수정하지 않고 대규모 언어 모델(LLM)을 보강하는, 지시·스크립트·참조 자료의 구조화된 패키지로서, 편의 기능에서 일급 배포 산출물로 격상되었다.

에이전트 스킬은 모델 자체를 수정하지 않고 대규모 언어 모델(LLM)을 보강하는, 지시·스크립트·참조 자료의 구조화된 패키지로서, 편의 기능에서 일급 배포 산출물로 격상되었다. 이를 로드하는 런타임은 패키지 관리자와 운영체제가 늘 직면해온 것과 동일한 문제를 물려받는다. 즉, 어떤 콘텐츠가 특정 동작을 한다고 주장하면, 런타임은 그것을 믿을지 말지 결정해야 한다. 이 논문은 핵심 논지를 처음부터 분명히 한다. 스킬은 검증되기 전까지 신뢰할 수 없는 코드이며, 이를 로드하는 런타임은 서명, 권한 등급, 출처 레지스트리로부터 신뢰를 추론하는 대신 그 기본값을 강제해야 한다. 스킬 검증이 없으면 모든 비가역적 호출마다 사람 개입(HITL) 게이트가 발동해야 하는데, 이는 운영상 지속 불가능하며 비자명한 규모에서는 형식적 승인으로 전락한다. 스킬 검증을 별도의 게이트형 절차로 다루면 HITL은 미검증 대상에 대해서만 발동하고 시스템은 지속 가능해진다. 저자들은 모든 스킬 매니페스트에 명시적 검증 수준을 포함하는 신뢰 스키마, HITL 정책이 해당 검증 수준의 함수로 결정되는 역량 게이트, 임의의 후보 검증 절차가 적대적 앙상블 시험에서 충족해야 하는 쌍조건적 정확성 기준, 그리고 작동하는 오픈소스 참조 구현에서 추상화한 열 가지 규범적 지침을 담은 이식 가능한 런타임 프로파일을 제시한다. 이 기여는 하네스 및 모델 비종속적이며, 여기에는 재훈련, 미세조정, 독점 인프라가 전혀 필요하지 않다.

핵심 요약

  • 에이전트 스킬은 모델 자체를 수정하지 않고 대규모 언어 모델(LLM)을 보강하는, 지시·스크립트·참조 자료의 구조화된 패키지로서, 편의 기능에서 일급 배포 산출물로 격상되었다.
  • 이를 로드하는 런타임은 패키지 관리자와 운영체제가 늘 직면해온 것과 동일한 문제를 물려받는다. 즉, 어떤 콘텐츠가 특정 동작을 한다고 주장하면, 런타임은 그것을 믿을지 결정해야 한다.
  • 이 논문은 핵심 논지를 처음부터 분명히 한다. 스킬은 검증되기 전까지 신뢰할 수 없는 코드이며, 이를 로드하는 런타임은 서명, 권한 등급, 출처 레지스트리로부터 신뢰를 추론하는 대신 그 기본값을 강제해야 한다.
  • 스킬 검증이 없으면 모든 비가역적 호출마다 사람 개입(HITL) 게이트가 발동해야 하는데, 이는 운영상 지속 불가능하며 비자명한 규모에서는 형식적 승인으로 전락한다.
  • 스킬 검증을 별도의 게이트형 절차로 다루면 HITL은 미검증 대상에 대해서만 발동하고 시스템은 지속 가능해진다.
  • 저자들은 모든 스킬 매니페스트에 명시적 검증 수준을 포함하는 신뢰 스키마, HITL 정책이 해당 검증 수준의 함수로 결정되는 역량 게이트, 임의의 후보 검증 절차가 적대적 앙상블 시험에서 충족해야 하는 쌍조건적 정확성 기준, 그리고 작동하는 오픈소스 참조 구현에서 추상화한 열 가지 규범적 지침을 담은 이식 가능한 런타임 프로파일을 제시한다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)