今日 / 论文
DriftNet:用于检测与定位LLM智能体提示注入的双头轨迹Transformer
原标题:DriftNet: A Dual-Head Trajectory Transformer for Detecting and Localizing Prompt Injection in LLM Agents
解读说明:依据 arXiv HTML 正文解读(约 20000 字)
这篇在讲什么
随着LLM智能体广泛接入邮件、金融和代码编辑等工具,间接提示注入成为严重威胁。攻击者将恶意指令隐藏在智能体检索的内容中,导致智能体行为偏离用户目标。现有防御系统要么需要实时控制智能体循环,要么仅能给出整体安全判定或单一错误索引,无法提供可操作的详细定位信息,如攻击入口、受污染范围及是否抵抗了注入。
DriftNet旨在填补这一空白,它是一个轻量级、模型无关的检测器。该模型读取记录的工具调用轨迹,利用冻结的句子编码器和四个无身份世界特征嵌入每个步骤。通过一个少于200万参数的Transformer主干,DriftNet同时执行两个任务:一个头分类轨迹是否被妥协,另一个头为每个步骤分配四种标签之一(良性、注入点、被劫持、注入失败)。这种联合输出使得操作员能够精确回滚操作、审计受影响步骤并识别不可信的内容源。
与既有工作相比,DriftNet不需要访问智能体内部状态或重新执行动作,仅依赖日志数据。在AgentDrift基准测试的任务不相交划分上,DriftNet表现出极高的鲁棒性。20次随机超参数扫描显示结果稳定,测试集仅评估一次。结果显示,DriftNet在轨迹级F1达到0.983,注入点精确恢复率为98.7%,被劫持跨度IoU为0.979。相比之下,表面基线在部分劫持和延迟执行等隐蔽模式上召回率极低,而DriftNet分别达到98.6%和93.2%。
读者应记住,DriftNet证明了在密集监督下,小型模型即可高精度地联合完成轨迹分类和步骤定位。然而,基准测试数据为合成数据,且存在世界身份规律性,这可能影响文本嵌入的泛化能力。尽管世界特征在构造上免疫此问题,但实际部署中需警惕数据分布偏移。
主要思路
DriftNet采用双头Transformer架构。输入表示方面,每个步骤被序列化为文本,通过冻结的句子编码器嵌入,并附加四个基于世界背景且无身份的特征,以捕捉语义无法看到的行动目标是否超出用户已知世界。模型主干是一个最多三层的Transformer编码器,参数量少于200万。训练目标采用类加权联合损失,同时优化轨迹分类头和步骤标签头。
实验设置基于AgentDrift基准测试,包含12,536条轨迹和71,024个标注步骤。为确保公平性,使用任务不相交划分,即训练集和测试集不共享任何任务模板,防止模板记忆。评估协议包括20次随机超参数扫描以界定敏感性,以及仅对测试集进行一次评估。对比基线是在相同划分上重新训练的表面基线。模型无需访问智能体内部模型,仅消费记录的轨迹日志,适用于任何记录工具调用的智能体。
关键结论
在AgentDrift基准测试的任务不相交划分上,DriftNet达到轨迹级F1为0.983。它在98.7%的攻击轨迹中精确恢复了注入点集合,被劫持跨度的平均IoU为0.979。对于218个抵抗攻击的轨迹,误报率为零;对于困难负样本,误报率为2.9%。在隐蔽合规模式上,表面基线对部分劫持的召回率为11.1%,对延迟执行为17.1%;而DriftNet分别达到98.6%和93.2%,同时降低了所有误报率。错误分析显示,26个剩余错误中,12个漏报中有9个是因为标注的注入观察包含无可读指令,指向语料库中的生成噪声而非检测器失败。
原文依据
one head classifies the trajectory as compromised or not, and a second assigns every step one of four labels
DriftNet reaches trajectory-level F1 of 0.983, exact injection-point recovery on 98.7% of attacked trajectories
the trained trunk, under two million parameters... needs no access to the agent’s model
in nine of twelve misses the labeled injection observation contains no legible instruction at all
A surface baseline retrained on the identical split recovers 11.1% of partial hijacks
评点
DriftNet为LLM智能体的安全部署提供了可操作的审计工具。通过精确定位注入点和被劫持步骤,操作员可以执行细粒度的回滚和审计,而无需中断实时智能体循环或访问模型内部状态。这种模型无关性使其适用于各种生产环境中的智能体监控,有助于满足合规要求中关于事件响应和根因分析的需求,特别是在处理敏感数据(如患者记录、金融交易)时,能够区分良性操作与受污染操作,降低业务风险。
id: arxiv:2609.10892