谁来驾驶都行。它只拿得到规则允许的动作。
一个一心想撞车的控制器,在 40 公里的照片级驾驶仿真里发出了 64,952 条违规指令。地板全部覆盖:零碰撞。拿掉地板,同样的指令几秒内就撞了两次车。上面换成任何模型都一样——它只拿得到允许的动作。
迟早会有人往你队里塞一个模型。模型看得快、主意多,但没人能证明它下一步会干什么。所以让聪明但没被证明的部分出主意,让一个小而可核查的部分决定实际发生什么。这个办法叫运行时保障。Perslis 不是又一个模型,它就是那个小部分,每一次拒绝都连同背后的证据记录下来。
这不是我们发明的。出处在这里,以及我们加了什么
运行时保障不是我们发明的。Simplex 架构(Sha,2001)在接近安全区边缘时,把控制权从未经证明的控制器交给经过证明的控制器;屏蔽(Alshiekh 等,2018)按书面规格过滤学习型系统的动作;ASTM F3269 为含复杂功能的无人机划定行为边界提供了标准。我们在这些基础上构建。Perslis 加的是:
证据
| 谁在驾驶 | 结果 | 出处 |
|---|---|---|
| 一心想撞车的控制器 CARLA,照片级驾驶仿真 | 在连续 40,052 米的行驶中,它发出了 64,952 条违规指令。地板全部覆盖:零碰撞。拿掉地板后,同样的指令直达操控:43 条危险指令被放行,几秒内撞了 2 次。 | CARLA 准入控制 |
| 语言模型驾驶 前沿与本地模型,CARLA | 在地板之下零碰撞。但它们慢:实测每看一眼要约 0.8–2.0 秒,模型会攥着一条过时的指令,以 40 km/h 盲开约 10 米。所有语言模型都只能以约 8–10 km/h 缓行;经典控制器开到 34 km/h。 | CARLA 准入控制 |
| 实战节奏 3D 坦克竞技场里的语言模型 BZFlag,一场标题比赛 | 规则 20–20,共 60,140 次决策;DeepSeek 10–18,约每次决策 1.0 秒;通过命令行接口调用的前沿模型 1–15,每次决策 7.6 秒(58 次决策——这是我们连接方式的限制,不是对模型的测量)。BZFlag 自带的 AI 打赢了我们的规则。 | 《规则掌舵》 |
| 游戏自带的机器人 AI 驾驶 Quake III Arena 引擎(OpenArena 内容),5 级对手 | 9 场十分钟成对比赛:同一个机器人,垫上地板 K/D 1.05,不垫 0.93,每场净差 +12.2(t = 2.02,p = 0.08)——是个倾向,不是证明。在有危险地形的地图上,它的躲避动作仍会导致掉进熔岩和虚空而死,从中学习的效果还没显示出来。内部测量,运行日志留存。 | — |
它保证什么,不保证什么
- 保证(已证明,并在 VDSG 中由测试钉死):在学习者可能到达的每一个状态下,它执行的每个动作都在允许清单之内,否则就是原地保持安全;命令压过经验。
- 不会让驾驶的一方变得能干。正确的地板也可能拒绝任务:在 Freeway 上,三条正确的规则封死了唯一能得分的动作(−12%)。
- 不认证任何东西。这里没有任何功能安全资质;传感器骗了地板,也就骗了证明。
它给你的班带来什么
机器的速度和问责,一次拿到。驾驶的一方能想多快就跑多快;地板每个周期核对一次真实状态(CARLA 中为 20 Hz),把每一次拒绝连同证据记下来。你既得到机器速度的决策,也得到每一个决策的交代——供战后复盘用,也供出了事、包括误伤友军时必须担责的人用。