今日 / 事故

AI智能体事故登记库:防止重复失败

原标题:The Agent Incident Registry: Toward Preventing Repeated AI Agent Failures

Divyanshu Kumar · Rohith HN · Nitin Aravind Birur · Sahil Agarwal · Prashanth Harshangi

arxiv_safety T1

解读说明:依据 arXiv HTML 正文解读(约 20000 字)

这篇在讲什么

随着AI智能体通过工具和委托权限执行操作,其失败模式日益复杂,但现有的通用AI事故数据库(如AIID、OECD AIM)缺乏记录智能体特定机制(如工具调用、间接提示注入、自主控制)的结构化字段。这导致无法将公开披露的真实事件与智能体安全评估中的威胁模型有效关联。本文构建的Agent Incident Registry (AIR) 旨在解决这一断层,通过严格的证据链接和去重规则,整合了487条公开披露记录。

AIR的核心贡献在于其机制导向的编码方案。它明确区分了“已实现危害”(realized harm,即真实当事人遭受后果)与“演示能力”(demonstrated capability,即证明漏洞可行但未造成实际损害)。例如,Replit智能体删除生产数据库被编码为已实现危害,而Microsoft 365 Copilot的数据泄露演示则被编码为演示能力,因为缺乏客户损害文档。这种区分对于评估设计至关重要,避免了将潜在风险与既成事实混淆。

与既有工作相比,AIR不追求成为部署系统的普查或失败率估算工具,而是作为证据支持的案例检索和评估范围审计工具。它借鉴了网络安全(VCDB)和航空安全(NASA ASRS)的方法论,强调保留源链接证据、定义计数单位并避免流行率声明。AIR将每条记录映射到OWASP ASI机制,并明确标记超出该分类范围的事件,从而为红队测试和基准构建提供基于真实披露的场景种子。

读者应记住,AIR揭示了当前智能体安全评估的重大盲区。通过对比AIR数据与InjecAgent基准,文章发现后者仅覆盖攻击者触发的场景,而AIR中包含92起无对抗者(no-adversary)的安全失败。这意味着现有评估可能遗漏了智能体在正常操作中因工具误用或权限滥用导致的自发失败。AIR为构建更全面、反映真实部署风险的智能体安全评估体系提供了基础数据和方法论框架。

主要思路

AIR的方法论基于严格的范围界定和证据规则。首先,定义纳入标准:仅包含涉及生成式或具身自主系统、AI特定暴露、基于AI输出的人类行动或有限智能体安全测试的披露。排除通用文本越狱、深度伪造和非生成式分类器决策。计数单位为“登记记录”而非文章或受害者,通过合并规则将同一事件的多次报告融合为一条记录,确保比例权重反映记录而非受影响实体。

数据构建阶段,AIR从公开来源收集并去重,每条记录必须包含支持性引文和源链接。采用“缺失感知”标签,对于源未确立的字段明确标记为未知,而非猜测。编码方案区分四个互斥的因果角色层:agent_acted(智能体行动)、ai_as_target(AI为目标)、human_acted_on_output(人类基于输出行动)和elicitation_only(仅诱导)。主要分析人群为336条生成式系统中智能体行动的记录。

评估审计部分,AIR通过投影分析对比现有基准。以InjecAgent为例,其1,054个案例仅占据AIR十二个表面中的三个,且均为攻击者触发。相比之下,AIR包含92起无对抗者安全失败。这种对比揭示了评估覆盖范围的偏差。AIR还支持源支持的案例检索,允许研究者根据机制字段(如初始向量、护栏结果)筛选事件,以审计评估套件是否涵盖了已披露的失败模式。

关键结论

在336条生成式系统且智能体行动的记录中,81条涉及已实现危害(24%)。已实现结果集中在野外(in-the-wild)和安全失败记录中,而负责任披露和研究演示绝大多数为演示性质。因此,聚合份额反映的是收集构成而非部署风险。在部署类比审计中,InjecAgent的1,054个案例仅覆盖AIR十二个表面中的三个,且全部为攻击者触发。相反,AIR包含92起无对抗者安全失败,暴露了现有评估在自发失败模式上的缺口。AIR支持源支持的案例检索和评估范围审计,但不支持失败率或控制有效性估算。

原文依据

评点

对安全合规部署而言,AIR揭示了当前智能体安全评估的结构性盲区:过度关注攻击者触发的对抗性场景,而忽视了无对抗者情况下的自发安全失败(如工具误用、权限滥用)。合规部署不能仅依赖红队测试,还需纳入基于真实披露的机制审计。AIR提供的机制字段(如委托权限、工具访问)有助于企业识别其智能体架构中未被现有基准覆盖的风险面,从而制定更全面的监控和护栏策略,避免重复发生如Replit数据库删除等已实现危害事件。

阅读原文

id: arxiv:2609.11030