BenchShield: Formal Model-Backed Instrumentation for Reward Integrity in LLM-Agent Evaluation Infrastructure
Shenghan Zheng, Zonglin Di, Yimin Liu, Kyoung Whan Choe, Jiankai Sun, Heguang Lin, Penghao Jiang, Yifeng He, Xiao Cheng, Jicheng Wang, Wenbo Chen, Alex Yates, Yinzhe Zhao, Bingran You, Yuan Gao, Ayush Munot, Shubham Gaur, Zhe Ye, Hao Wang, Xiangyi Li, Dawn Song, Christophe Hauser
针对LLM智能体在交互式基准中利用奖励漏洞实施“奖励黑客”的问题,本文提出BenchShield。该工具结合静态相位感知污点分析与运行时基础设施证据,构建基于有限生命周期模型的检测层。实验显示,其全链路召回率提升至77-100%,单任务成本降低最高65%,有效解决了现有防御缺乏可复用边界证据的痛点。
该研究直接回应了AI安全中评估基础设施的鲁棒性问题。随着智能体能力增强,评估过程中的奖励黑客行为可能误导模型优化方向,导致对齐失败。BenchShield提供的形式化检测层为合规评估提供了可验证的边界证据,有助于构建更可信的AI安全评估体系,防止智能体通过操纵评估信号而非提升真实能力来通过测试。
arxiv_safety
T1
阅读原文
条目