<?xml version="1.0" encoding="UTF-8"?>
<rss version="2.0">
<channel>
<title>Thereadlines</title>
<link>https://example.invalid</link>
<description>AI 安全风险与合规每日动态</description>
<language>zh-cn</language>
<item>
<title>SpecGuard：利用推测解码实现零成本推理时后门检测</title>
<link>https://arxiv.org/abs/2609.11799</link>
<guid isPermaLink="false">arxiv:2609.11799</guid>
<pubDate>Thu, 10 Sep 2026 16:51:00 +0000</pubDate>
<description><![CDATA[针对LLM供应链后门检测成本高、实时性差的问题，SpecGuard提出复用推测解码中的接受/拒绝信号作为后门激活指标。该方法无需额外模型计算或输入扰动，通过监测草稿模型与目标模型的一致性变化，在零额外推理成本下实现高灵敏度检测，并证明了攻击隐蔽性与检测难度的权衡关系。]]></description>
</item>
<item>
<title>AP2协议中的低语攻击与A-VIP绑定防御机制</title>
<link>https://arxiv.org/abs/2609.11757</link>
<guid isPermaLink="false">arxiv:2609.11757</guid>
<pubDate>Thu, 10 Sep 2026 16:11:00 +0000</pubDate>
<description><![CDATA[本文揭示了代理支付协议AP2中签名交易与决策脱节的漏洞，提出三类“低语”攻击。通过Gemini Flash-Lite等模型实验，证明商户文本可诱导代理窃取凭证或篡改购物车。作者提出A-VIP防御层，通过绑定意图与购物车结构，在零误报下阻断前两类攻击，并公开了包含1544个场景的AP2-WhisperBench基准。]]></description>
</item>
<item>
<title>ActSafeGuard：流匹配策略的可微分训练对齐约束执行</title>
<link>https://arxiv.org/abs/2609.11697</link>
<guid isPermaLink="false">arxiv:2609.11697</guid>
<pubDate>Thu, 10 Sep 2026 15:21:00 +0000</pubDate>
<description><![CDATA[针对视觉-语言-动作模型生成动作违反物理约束的问题，提出ActSafeGuard。该层通过可微分射线缩放算子，将硬约束直接嵌入流匹配策略的训练与推理过程，消除训练-推理不匹配，实现100%步骤安全性且不降低任务成功率。]]></description>
</item>
<item>
<title>ToxicRAG：通过单次知识投毒攻击破坏检索增强生成系统</title>
<link>https://arxiv.org/abs/2609.11082</link>
<guid isPermaLink="false">arxiv:2609.11082</guid>
<pubDate>Thu, 10 Sep 2026 04:42:00 +0000</pubDate>
<description><![CDATA[本文提出ToxicRAG，一种针对RAG系统的单次文档投毒攻击。它通过构建包含因果叙事和虚假权威引用的知识更新文档，在无需多次注入的情况下操纵LLM输出。实验显示，该方法在多个数据集上取得了0.61至0.91的高攻击成功率，优于现有基线。]]></description>
</item>
<item>
<title>AI智能体事故登记库：防止重复失败</title>
<link>https://arxiv.org/abs/2609.11030</link>
<guid isPermaLink="false">arxiv:2609.11030</guid>
<pubDate>Thu, 10 Sep 2026 03:20:00 +0000</pubDate>
<description><![CDATA[本文提出AI智能体事故登记库（AIR），收录487条2022-2026年公开披露的智能体相关事件。通过区分“已实现危害”与“演示能力”，并强制记录工具使用、委托权限等机制字段，AIR填补了通用事故库与智能体安全评估之间的空白。审计显示，现有评估基准如InjecAgent仅覆盖攻击者触发场景，忽略了92起无对抗者安全失败，揭示了评估盲区。]]></description>
</item>
<item>
<title>BenchShield：基于形式化模型的LLM智能体评估奖励完整性保障框架</title>
<link>https://arxiv.org/abs/2609.11028</link>
<guid isPermaLink="false">arxiv:2609.11028</guid>
<pubDate>Thu, 10 Sep 2026 03:10:00 +0000</pubDate>
<description><![CDATA[针对LLM智能体基准测试中的奖励黑客问题，本文提出BenchShield框架。通过TLA+形式化生命周期模型与静态污点分析，结合运行时基础设施证据，实现从任务包到最终评分的全链路完整性验证。实验显示其全链路召回率提升至77-100%，显著优于现有基线。]]></description>
</item>
<item>
<title>DriftNet：用于检测与定位LLM智能体提示注入的双头轨迹Transformer</title>
<link>https://arxiv.org/abs/2609.10892</link>
<guid isPermaLink="false">arxiv:2609.10892</guid>
<pubDate>Wed, 09 Sep 2026 22:52:00 +0000</pubDate>
<description><![CDATA[本文提出DriftNet，一种双头轨迹Transformer，旨在解决LLM智能体中间接提示注入的检测与定位难题。该模型通过单次前向传播同时输出轨迹级判定和步骤级细粒度标签（良性、注入点、被劫持、注入失败）。在AgentDrift基准测试中，DriftNet实现了0.983的轨迹级F1分数，并准确恢复了98.7%的注入点，显著优于现有仅输出单一索引或整体判定的防御系统。]]></description>
</item>
<item>
<title>保罗·克里斯蒂亚诺加入OpenAI基金会董事会及安全委员会</title>
<link>https://openai.com/index/paul-christiano-joins-openai-foundation-board</link>
<guid isPermaLink="false">url:3eb3e9557eb7038e</guid>
<pubDate>Wed, 09 Sep 2026 17:00:00 +0000</pubDate>
<description><![CDATA[OpenAI宣布保罗·克里斯蒂亚诺正式加入基金会董事会及其安全与安保委员会。此举旨在利用其在AI对齐、安全性及标准制定方面的深厚经验，参与制定平衡能力发展与严格安全标准的战略决策，强化组织在模型安全与安保协议方面的监督机制，将对齐研究与安全治理直接嵌入最高决策层。]]></description>
</item>
<item>
<title>OpenAI内部视角：编码智能体加速AI研究流程</title>
<link>https://openai.com/index/research-acceleration-view-inside-openai</link>
<guid isPermaLink="false">url:3784d7aba9718af9</guid>
<pubDate>Sun, 06 Sep 2026 08:00:00 +0000</pubDate>
<description><![CDATA[OpenAI发布内部简报，揭示编码智能体如何重塑其AI研究流程。文章基于早期数据，探讨智能体使用率、实验速度及任务复杂度的变化，展示自动化编码工具对科研运作模式的改变，为理解AI实验室内部效率提升提供第一手视角。]]></description>
</item>
<item>
<title>谷歌发布Fairwind计划：面向政府与企业的主动网络防御</title>
<link>https://deepmind.google/blog/proactive-cyber-defense-for-governments-and-enterprises</link>
<guid isPermaLink="false">url:bf94848b24bf5829</guid>
<pubDate>Wed, 02 Sep 2026 16:24:00 +0000</pubDate>
<description><![CDATA[谷歌推出Fairwind计划，向政府及关键基础设施运营者提供Gemini 3.8 Flash Cyber模型与CodeMender工具。该计划旨在通过自主发现并修复漏洞，缩短防御响应时间，提升关键系统的安全性，并承诺投入超1亿美元用于全球网络安全支持。]]></description>
</item>
<item>
<title>ChatGPT Operator 提示注入攻击与防御机制深度解析</title>
<link>https://embracethered.com/blog/posts/2025/chatgpt-operator-prompt-injection-exploits</link>
<guid isPermaLink="false">url:60830387fda1dd08</guid>
<pubDate>Tue, 08 Sep 2026 00:00:00 +0000</pubDate>
<description><![CDATA[本文通过实际测试揭示 OpenAI ChatGPT Operator 代理面临的提示注入风险。作者演示了如何利用恶意网页指令劫持代理，从已登录站点窃取 PII 数据。尽管存在多层确认机制，但攻击仍具概率性成功可能，凸显了自主 AI 代理在隐私与安全部署中的严峻挑战。]]></description>
</item>
<item>
<title>Clinejection：通过提示注入劫持Cline生产发布流程</title>
<link>https://adnanthekhan.com/posts/clinejection</link>
<guid isPermaLink="false">url:ed3269a1ca3d1ad5</guid>
<pubDate>Tue, 08 Sep 2026 00:00:00 +0000</pubDate>
<description><![CDATA[安全研究员Adnan Khan披露Cline开源项目存在严重供应链漏洞。攻击者仅需提交包含提示注入的GitHub Issue，即可利用AI分诊代理执行恶意代码，通过GitHub Actions缓存投毒窃取发布凭证，最终向数百万开发者推送恶意软件。]]></description>
</item>
<item>
<title>Cline CLI npm 未授权发布事件复盘：AI 代理引发的供应链风险</title>
<link>https://cline.bot/blog/post-mortem-unauthorized-cline-cli-npm</link>
<guid isPermaLink="false">url:89e3f85f0604466c</guid>
<pubDate>Tue, 08 Sep 2026 00:00:00 +0000</pubDate>
<description><![CDATA[Cline 披露 2026 年 2 月 17 日 npm 包被未授权发布事件。攻击者利用 GitHub Actions 中 AI 代理的提示注入漏洞，通过缓存投毒获取发布令牌，植入良性 postinstall 脚本。事件暴露了 AI 自动化在 CI/CD 中的新攻击面，团队已移除相关工作流并引入 OIDC 溯源机制。]]></description>
</item>
</channel>
</rss>
