今日 / 论文

ActSafeGuard:流匹配策略的可微分训练对齐约束执行

原标题:ActSafeGuard: Differentiable and Training-Aligned Constraint Enforcement for Flow-Matching Policies

Jianming Ma · Rongjun Jin · Xiaxi Si · Yang Zhang · Yiheng Li · Yue Gao

arxiv_safety T1

解读说明:依据 arXiv HTML 正文解读(约 20000 字)

这篇在讲什么

视觉-语言-动作(VLA)和世界-动作模型(WAM)在通用机器人操作方面表现出色,但其生成的动作往往缺乏对硬物理约束(如位置限制、速度边界)的保证,导致部署时存在安全隐患。现有安全方法主要分为两类:训练时约束方法仅优化统计安全目标,缺乏确定性保证;推理时安全护栏虽能修正不安全动作,但导致策略训练与执行分布不匹配,损害任务性能。

ActSafeGuard 提出了一种可微分且训练对齐的约束执行层,专门针对基于流匹配的策略。其核心思想是将硬动作可行性直接整合到策略学习过程中,而非仅作为推理时的外部组件。该方法在流匹配动作头输出端插入一个解析射线缩放算子,确保从可行初始点出发的每一步约束流更新都保持在状态依赖的凸可行集内。

与既有工作相比,ActSafeGuard 的关键差异在于其“训练对齐”特性。该算子在训练和推理期间均处于激活状态。在训练阶段,其可微分结构允许梯度通过约束更新传播,使动作头接收到边界感知的学习信号,从而引导模型自然学习约束流形。这种设计避免了传统推理时投影或截断方法造成的分布扭曲,同时无需引入额外的可学习网络,对预训练模型具有最小侵入性。

读者应记住,ActSafeGuard 通过隐式斜投影解释梯度变换,使约束更新沿可行边界滑动而非简单截断。实验表明,该方法在 π0.5 和 Fast-WAM 等骨干网络上,能在保持甚至提升任务成功率的同时,实现 100% 的步骤安全率,为安全具身智能部署提供了可扩展的解决方案。

主要思路

方法上,ActSafeGuard 将离散时间流匹配过程与可行状态约束相结合。首先,定义状态依赖的凸多面体可行区域 C(o_t) = {x_c | A(o_t)x_c ≤ b(o_t)}。在流匹配动作头生成无约束速度 v_t 后,ActSafeGuard 将其转换为更新方向 d_t 和安全缩放因子 s_t。通过解析射线缩放算子,自适应地重新缩放违反约束的步骤,确保轨迹保持在凸可行区域内。

实验设置涵盖多个标准基础骨干网络(π0.5 和 Fast-WAM)及多种操作任务。评估指标包括步骤安全率、任务成功率及泛化能力。论证步骤包括:首先验证硬约束的必要性;其次通过 RQ1 评估性能保持能力,证明 ActSafeGuard 在实现 100% 安全率的同时不降低任务成功率;RQ2 测试对复杂约束的泛化性;RQ3 通过消融实验验证可微分性对边界感知梯度的贡献。最后,在真实机器人上进行部署测试,验证其实际可行性。

关键结论

实验结果显示,ActSafeGuard 在多个任务和约束条件下,始终实现 100% 的步骤安全率。与仅优化统计安全目标的训练时方法相比,ActSafeGuard 提供了确定性的逐步可行性保证。与推理时安全护栏相比,ActSafeGuard 消除了训练-推理不匹配,完全保留甚至提升了任务成功率。消融实验表明,可微分结构使得梯度能够沿可行边界滑动,而非简单截断,从而维持了动作生成的质量。该方法在 π0.5 和 Fast-WAM 骨干网络上均表现出一致的性能,证明了其可扩展性和最小侵入性。

原文依据

评点

对于安全/合规部署,ActSafeGuard 解决了 VLA 模型从实验室到真实世界部署的关键障碍:硬物理约束的确定性执行。它消除了传统方法中训练与推理的安全机制分离问题,确保机器人在每一步操作中都严格满足物理限制,避免硬件损坏或危险行为。这种训练对齐的设计使得安全机制成为策略内在的一部分,而非外部补丁,为具身智能在开放环境中的可靠、合规运行提供了技术基础。

阅读原文

id: arxiv:2609.11697