清华新闻网5月18日电 以自动驾驶汽车、具身智能机器人为代表的物理智能系统,其运行过程必须满足严格的硬约束条件(Hard Constraints)。安全强化学习是实现该类系统在复杂约束环境下感知、决策与控制的重要方法。保障强化学习安全性的关键在于如何在求解过程中构造具有迭代可行性的约束条件。
围绕这一难题,美国工程院院士富塚正义曾提出持续构建动态安全指标的方法,IEEE会士埃姆斯(A.Ames)提出了利用控制障碍函数构造二次规划问题的方法,美国工程院院士汤姆林(C. Tomlin)提出了用于安全强化学习的HJ可达性分析法。然而,安全强化学习领域仍面临如下互相关联的难题:第一,如何建立策略安全性与约束可行性之间的关联关系?第二,如何分析约束条件的形式与强度对其迭代可行性的影响?第三,如何在统一理论框架下比较不同约束构造方法在保障安全性方面的优劣?针对这些问题,清华大学车辆学院、人工智能学院李升波教授课题组提出了安全强化学习的双时域分析框架,证明了约束满足的任意性与可行区域的最大性的等价关系,揭示了所得策略安全性与虚拟时域约束强度之间的变化规律,为强化学习安全性保障和算法设计提供了一套理论框架。
该研究首先指出,强化学习安全性的分析应该与两个时域相关:真实时域(Real-time Domain)和虚拟时域(Virtual-time Domain)。虚拟时域用于强化学习的问题定义和算法设计,真实时域用于部署训练后的策略,观察它与物理系统交互的效果。真实时域的硬约束是由物理系统给定的,而虚拟时域的约束条件则可采用不同的形式,不必等价于真实时域的硬约束。所谓的策略安全性是指真实时域的硬约束得到长期满足,这与虚拟时域问题是否有解是不同的概念。这一双时域视角将策略的求解与策略的应用进行解耦,为强化学习问题的约束设计提供了极大自由度。

图1.安全强化学习的双时域分析框架
在此基础上,研究发展了安全强化学习的可行性定义以及迭代可行保障理论。研究将“可行性”定义为虚拟时域问题是否有解,并以“迭代可行区域”刻画使该问题以及后续所有问题均有解的初始状态范围,这说明每种虚拟时域约束均有对应的迭代可行区域。利用可行区域的控制不变性,研究证明了安全性与可行性的关联关系,即下面两个条件是等价的:第一,任意策略满足无穷时域的硬约束;第二,该策略的迭代可行区域达到最大化。研究进一步发现,迭代可行区域随虚拟时域约束强度增加呈现先扩大后减小的变化规律,并在虚拟时域约束强度与真实时域约束强度相等时达到最大。

图2.安全约束与可行区域的隶属关系(示意图)
研究进一步根据虚拟时域约束形式将现有安全强化学习方法归纳为“控制不变集法”和“约束聚合法”两类。前者利用集合的前向不变性保证策略的迭代可行性,后者借助聚合函数将无穷步约束等价替换为单步约束。该分类框架将众多主流安全强化学习方法,如安全指标(Safety Index)、控制障碍函数(Control Barrier Function)、HJ可达性分析(Hamilton-Jacobi Reachability Analysis)等,纳入统一理论体系,能够直接比较不同方法对策略安全性的影响,为有利于长期安全的约束形式提供算法设计层面的指导。
这一研究成果以“约束强化学习的可行性理论:一篇综述教程”(The feasibility theory of constrained reinforcement learning: a tutorial study)为题,于4月2日发表在《系统与控制的基础与趋势》(Foundations and Trends in Systems and Control,FTSYS)期刊。该篇论文共有72页,涵盖9个章节,系统性介绍了团队在强化学习安全性与可行性方面的研究成果。
FTSYS创刊于2014年,主要发表人工智能、控制理论和系统科学领域的综述性论文和指导性文章,由主编定向邀请全球范围内的优势科研团队就某一专题进行深度剖析和系统论述,每年仅发文2-3篇,自期刊设立至今共有35篇文章发表。
车辆学院2026届博士毕业生杨雨杰(现任香港大学电机与计算机工程系研究助理教授)、车辆学院2022级博士生郑志龙为论文共同第一作者,李升波教授为论文通讯作者。合作者还包括美国加州大学伯克利分校富塚正义(Masayoshi Tomizuka)院士和卡内基梅隆大学刘畅流(Changliu Liu)助理教授。
该研究得到了国家自然科学基金和北京市自然科学基金的支持。
论文链接:
https://doi.org/10.1108/FTSYS-03-2026-001
供稿:车辆学院
编辑:李华山
审核:王晓霞