Perslis · 研究库 · 第 2 页
发现总账
我们测量过的每一项结果,以及它写在哪里。仍在撰写中的论文在此不放链接、不列数字,直到发表为止;其他每一行中的数字都来自对应论文或页面本身的陈述。
更新:2026 年 9 月 27 日
失败优先与失效安全模型
| 发现 | 写在 | 状态 |
|---|---|---|
| 在两款真实 Atari ROM 上的失败记忆:《太空侵略者》+32%,Freeway −12%,出自同一机制。 | 失败优先模型 · Perslis Arcade | 论文 |
| 一次倒霉的失败不是规则:用 Wilson 下界对照基准率。绝对 60% 的门槛从 268 次真实失败中产生了 0 条规则。 | 失败优先模型 | 论文 |
| 正确的规则合在一起也可能让系统瘫痪:第 50 局 276.2,54 条不设上限的规则时 167.1。按覆盖面退休 6 条规则,死局从 6 降到 0(在回放中测量)。 | 失败优先模型 | 论文 |
| 归咎于正确的决策:Atari 在 127 帧死亡动画结束时才报告丢命;一个《辐射》驾驶者在同一个守卫面前死了 49 次,直到归咎落到挑起战斗的那句台词上。 | 失败优先模型 | 论文 |
| 一架能从清空的记忆中重新学会赛道的无人机:留出的起始位置 10 次中 10 次完成、零碰撞,未修改的基线为 10 次中 1 次(仿真)。 | 失败优先模型 · 飞行演示 | 论文 |
| 猜测永远不能变成事实:放行一个准确率 85.8% 的模型的猜测,成本降低 38.4%,正确识别率却从 1.000 跌到 0.753。 | 失败优先模型 | 论文 |
| 受指令约束的运行时:指令只会收窄;《DOOM》与《德军总部 3D》,做决定的回路中没有神经网络;记忆对规则在 32 个种子上持平(t = 0.78)。 | VDSG · VDSG 演示 | 论文 |
| 一个模型,两个名字:学习回路可以改变行为,不能改变安全地板。 | 什么是失效安全模型? · 什么是失败优先模型? · Peel,失效安全模型 · VDSG,军用 Peel · 幻灯片 | 研究页面 |
| 见证之眼:用像素核对游戏引擎的声明,以及一只没有接到任何决策上的眼睛究竟值多少。 | — | 论文撰写中 |
| 坦克:从屏幕上操作的规则驾驶者,对阵语言模型驾驶者与 BZFlag 自带的 AI,以及我们输给后者的、有回放为证的原因。 | 方向盘上的规则 | 论文 |
| 《辐射》(1997):规则驾驶者从游戏手册与攻略中各得到了什么,同时自行保存进度。 | — | 论文撰写中 |
| 让规则坐进学习型决策模型的位置:在 Doom、维基竞速与无人机赛道上的三场正面比较。 | — | 论文撰写中 |
驾驶与运动
| 发现 | 写在 | 状态 |
|---|---|---|
| MetaDrive 中的运行时准入控制:对抗性控制器在地板关闭时撞车,打开时被保持在安全状态,且无需修改控制器。 | 可容许的运动 · Perslis Motion | 论文 |
| CARLA,40 公里:安全罩覆盖了敌对控制器发出的全部 64,952 条违反不变量的指令,零碰撞;另附一张语言模型驾驶习惯的跨模型对比表。 | CARLA 准入控制 | 论文 |
科学:验证地板
| 发现 | 写在 | 状态 |
|---|---|---|
| 三层地板(导航、弃权、验证),跨越 14 倍的模型规模:1,737 个对抗性案例中零误接受。 | 验证地板 | 论文 |
| 学习型推断在何处赢得决策权:在五项预注册实验中,确定性基线始终守住。 | 推断放置 · 基准测试 | 论文 |
| 不可恢复边界:学习者在 160 个“世界 × 潜在维度”单元中赢得席位的次数为零。 | 不可恢复边界 | 论文 |
| 面向辅助沟通的结构性幻觉预防:类型化的符号存储是事实的唯一作者。 | Peel | 论文 |
| 把控制延伸到答案之后、实验台之上:类型化、有边界的授权,模拟永远不能变成事实。 | WetHands 研究笔记 | 研究页面 |
| 把“落地”训练进小模型的负面结果,以及封住同一道缝隙的确定性解析器。 | 我们试过把它训练进去 | 论文 |
| 法律的引用地板:用真实判例数据库重新核查 Mata v. Avianca 案中被编造的引用。 | — | 论文撰写中 |
| 问一次,拥有答案:模型只写规格,从不写代码;地板予以准入;本地工具离线作答。 | 运行时 · Perslis Floor | 页面 · 论文撰写中 |
| 同一打乱下用两种方法解魔方:层先法 112 步,符号地板 31 步;以及一个被点名拒绝的不可能魔方。 | 地板与分类器 | 研究页面 |
记忆、推理与安全理论
| 发现 | 写在 | 状态 |
|---|---|---|
| 检索不是记忆:记忆必须做出、而 top-k 相似度不做的九个决定。 | 检索不是记忆 | 论文 |
| 把遍历作为检索:保守、可终止、自证、感知一致性(四条定理)。 | 在符号系统中遍历数据 | 论文 |
| 行动前先验证:行动前的对抗回路,附五条已证明的定理。 | 行动前先验证 | 论文 |
| 编排缺口:当模型可以热插拔时,拒绝只是一个路由信号,而不是停止。 | 编排缺口 | 论文 |
| 让任何模型(即使是纯文本模型)以每秒一帧获得持续的视觉。 | TinkyVision | 论文 |
| 一篇关于灵、信息与心智之形成的思辨性随笔。 | 道与模式 | 随笔 |
遗留系统与 Perslis 运行时
| 发现 | 写在 | 状态 |
|---|---|---|
| 证明即产品:从二进制出发,路由、修复并验证遗留软件。 | 白皮书 | 论文 |
| 经验证的 COBOL 合成:知识是附加的而不是固化的;每个答案要么被证明,要么被拒绝。 | COBOL 预印本 | 论文 |
| Windows 95 USB:哪些能绑定、哪些不能;20 项主机检查通过,客户机资格认证仍待完成。 | Win95 USB 实验室 | 论文 |
| 把遗留文件(DBF、Access、XLS、定宽文本)转换为 SQLite、CSV 与 JSON,附哈希清单与收据。 | Liberate | 研究页面 |