今日 / 论文

DriftNet:用于检测与定位LLM智能体提示注入的双头轨迹Transformer

原标题:DriftNet: A Dual-Head Trajectory Transformer for Detecting and Localizing Prompt Injection in LLM Agents

Asif Pinjari · Mithun Paul Saint-Germain

arxiv_safety T1

解读说明:依据 arXiv HTML 正文解读(约 20000 字)

这篇在讲什么

随着LLM智能体广泛接入邮件、金融和代码编辑等工具,间接提示注入成为严重威胁。攻击者将恶意指令隐藏在智能体检索的内容中,导致智能体行为偏离用户目标。现有防御系统要么需要实时控制智能体循环,要么仅能给出整体安全判定或单一错误索引,无法提供可操作的详细定位信息,如攻击入口、受污染范围及是否抵抗了注入。

DriftNet旨在填补这一空白,它是一个轻量级、模型无关的检测器。该模型读取记录的工具调用轨迹,利用冻结的句子编码器和四个无身份世界特征嵌入每个步骤。通过一个少于200万参数的Transformer主干,DriftNet同时执行两个任务:一个头分类轨迹是否被妥协,另一个头为每个步骤分配四种标签之一(良性、注入点、被劫持、注入失败)。这种联合输出使得操作员能够精确回滚操作、审计受影响步骤并识别不可信的内容源。

与既有工作相比,DriftNet不需要访问智能体内部状态或重新执行动作,仅依赖日志数据。在AgentDrift基准测试的任务不相交划分上,DriftNet表现出极高的鲁棒性。20次随机超参数扫描显示结果稳定,测试集仅评估一次。结果显示,DriftNet在轨迹级F1达到0.983,注入点精确恢复率为98.7%,被劫持跨度IoU为0.979。相比之下,表面基线在部分劫持和延迟执行等隐蔽模式上召回率极低,而DriftNet分别达到98.6%和93.2%。

读者应记住,DriftNet证明了在密集监督下,小型模型即可高精度地联合完成轨迹分类和步骤定位。然而,基准测试数据为合成数据,且存在世界身份规律性,这可能影响文本嵌入的泛化能力。尽管世界特征在构造上免疫此问题,但实际部署中需警惕数据分布偏移。

主要思路

DriftNet采用双头Transformer架构。输入表示方面,每个步骤被序列化为文本,通过冻结的句子编码器嵌入,并附加四个基于世界背景且无身份的特征,以捕捉语义无法看到的行动目标是否超出用户已知世界。模型主干是一个最多三层的Transformer编码器,参数量少于200万。训练目标采用类加权联合损失,同时优化轨迹分类头和步骤标签头。

实验设置基于AgentDrift基准测试,包含12,536条轨迹和71,024个标注步骤。为确保公平性,使用任务不相交划分,即训练集和测试集不共享任何任务模板,防止模板记忆。评估协议包括20次随机超参数扫描以界定敏感性,以及仅对测试集进行一次评估。对比基线是在相同划分上重新训练的表面基线。模型无需访问智能体内部模型,仅消费记录的轨迹日志,适用于任何记录工具调用的智能体。

关键结论

在AgentDrift基准测试的任务不相交划分上,DriftNet达到轨迹级F1为0.983。它在98.7%的攻击轨迹中精确恢复了注入点集合,被劫持跨度的平均IoU为0.979。对于218个抵抗攻击的轨迹,误报率为零;对于困难负样本,误报率为2.9%。在隐蔽合规模式上,表面基线对部分劫持的召回率为11.1%,对延迟执行为17.1%;而DriftNet分别达到98.6%和93.2%,同时降低了所有误报率。错误分析显示,26个剩余错误中,12个漏报中有9个是因为标注的注入观察包含无可读指令,指向语料库中的生成噪声而非检测器失败。

原文依据

评点

DriftNet为LLM智能体的安全部署提供了可操作的审计工具。通过精确定位注入点和被劫持步骤,操作员可以执行细粒度的回滚和审计,而无需中断实时智能体循环或访问模型内部状态。这种模型无关性使其适用于各种生产环境中的智能体监控,有助于满足合规要求中关于事件响应和根因分析的需求,特别是在处理敏感数据(如患者记录、金融交易)时,能够区分良性操作与受污染操作,降低业务风险。

阅读原文

id: arxiv:2609.10892