掌控无人机的
那块地板。
这是飞行控制台的一次录制运行,逐面板回放。无人机在开源 jev-drone 项目的赛道上,飞行它通过试错学会的路线。习得的计划设定速度;停止距离限制与反射在它之后施加,因此只能让它减速。回路中任何地方都没有神经网络。

你在看什么
- 画面。第三人称视角,来自仿真器(MuJoCo,Skydio X2 模型)。
- 机载相机 · 深度。规则读取的唯一传感器。
- 它学会的路线。每 6 米一个路段一块:它挣得的限速,以及是否在那里飞高。
- 学习曲线与轮次。构建这条路线的 87 轮:它尝试过的每一项改动,只有当每一圈都更干净、更快时才保留。
- 态势报告。规则在这一帧读到的确切内容:各扇区的空旷距离、前方路径、最近的障碍物。
- 发生了什么。单圈日志。在这段录制中,每一圈都以 27.6 秒、零碰撞完成。
看它从零开始学习
上面的回放飞的是一条已经学会的路线。下面的录屏从清空的记忆开始:7 轮把代价从 69.39 降到 51.52,保留 2 项改动,撤回 5 项。学习过程中会发生碰撞;每次碰撞计 15 秒,带来碰撞的那一轮会被丢弃。
结果,以及附带的说明
在留出的起始位置上(规则冻结后只运行一次),地板 10 次中有 10 次飞完整条赛道,零碰撞。未修改的基线 10 次中完成 1 次。
这个数字必须附带的说明:每次运行的赛道完全相同,只有起始姿态不同,因此它对泛化能力只是弱证据;这是仿真,不是真实飞行;上游项目已固定版本且未经修改,我们没有重新运行任何他人的系统。
它与什么相连
这与失效安全模型是同一个理念:学习者改变的是无人机尝试什么,永远不是它被允许做什么。决策路径是一条符号流:引擎状态变成事实,规则做出选择,执行器行动。飞行地板本身的介绍见飞行与引擎。据我们所知,Peel 是第一个失效安全模型。