Perslis 国防
PERSLIS 国防 · 进攻

它学会打赢。

进攻才能看出一个大脑是不是真的。我们的大脑从屏幕和引擎读取战场,打射击游戏和坦克游戏,从自己的失败中变强,并把只用电锯或不许开火这样的命令当作硬边界。

  1. 你来开
  2. 它学你的动作
  3. 放手
  4. 大脑自己开
一开始由人操控;控制台记下它从你身上学到的动作。然后放手:大脑接管,自己操控游戏,命令不变。一次有记录的运行。

完整的控制台回放,带命令 →

横向对比:逐个游戏的进攻结果

游戏我们的大脑对我们不利的
DOOM E1M1,Hurt Me Plenty 难度52 秒到达出口开关,击杀 4Nightmare 难度:8 次都没通关
DOOM——只用规则、不学习17.9,随机为 3.2叠加记忆:持平
DOOM E1M5——学习路线进度翻倍有余,0.19 → 0.43E1M5 还没找到出口;飞行员未变,上升期间线路有 51 次人工修复——主要由我们构建
Atari BattleZone(坦克)27,000,随机为 3,000一条闪避规则被否决
BattleZone——从另一款坦克游戏移入的大脑33,575,该游戏自带规则为 28,600;修剪后 48,588 对 29,275移入的大脑由我们手写(+17% 是迁移,不是学习);第二次导出只打平
3D 坦克竞技场(BZFlag)每分钟净击杀 −1.17 → −0.26,从手写到演化仍然输给 BZFlag 自带的 AI;v2 是我们写的,v3、v4 是循环的晋升
Robot Tank(Atari)摧毁 5.67 辆坦克,随机为 2.33手写规则,不是学习
GoldenEye 007,大坝关发明了 2 个胜过默认的战术72 次尝试无一存活

瞄准靠计数,不靠自夸:在坦克游戏中,眼睛的瞄准误差第 95 百分位为 0.55°。

从没见过这个游戏,到一夜之间追到自带 AI 的身后

  1. 9 月 26 日 18:11——第一场比赛。在那天之前,我们的规则驾驶员从没见过这个游戏。只有手写的起步规则;到第二个手写版本时,对阵游戏自带 AI 每分钟净击杀 −1.17(8 场比赛)。
  2. 23:39——开启演化。每一次死亡都被解释;循环每次从工程师写好的选项中挑出一处改变,在实战比赛中正面对比测试。
  3. 00:27——它证明的第一个改变。只有当炮弹真的会落在 6 米之内才闪避;明显胜出(z 3.08)。
  4. 01:14——第二条。开火后不再急转虚晃;明显胜出(z 2.68)。一共试了 34 个改变,保留 2 个,否决 8 个。
  5. 到 01:14:每分钟净击杀从手写版的 −1.17 提升到演化版的 −0.26——在与挑选改变无关的另一批比赛中,这是明显的提升(z 2.93)。它的击杀仍少于游戏自带 AI(每分钟 1.28 对 2.10);死亡接近(1.53 对 1.73),但这个差距并不显著。还没追上。

为什么模型追不上:它们的权重是冻结的

Claude、DeepSeek 和 Llama 每一场比赛用的都是开局时的同一套权重。神经模型不改动权重就无法演化:要在这辆坦克上变强,就得有人收集比赛、在数据中心重新训练、再发布新版本——而新版本还可能忘掉旧版本会的东西。比赛与比赛之间,它什么也学不到。

我们的驾驶员在比赛之间改变,一个权重都没动——因为它根本没有权重。根据自己的死亡,循环挑出两处改变,正面对比证明后保留下来。区别就在这里:一个要被重建才能学习的模型,对一个在比赛间隙学习的驾驶员。

现在,你还愿意让 Claude 开你的坦克吗?

一场十分钟的比赛只有 58 个决策。七场合计击杀 3 次、死亡 47 次。在有人重新训练它之前,一直冻结。或者,一个在同样十分钟里做了 60,140 个决策、那天之前从没见过这个游戏、当晚就把对阵游戏自带 AI 的成绩从 −1.17 提升到 −0.26 的规则驾驶员——一个权重都没有。

神经模型仍有它的位置——看和读。它不负责指挥。权限之内的命令,Peel 执行;权限之外的,它拒绝并告诉你原因。

数据来自竞技场的比赛录像。如实说明:每个模型 7 场比赛;Claude 通过命令行工具运行,所以 7.6 秒里有一部分是管道开销;在击杀上,游戏自带 AI 仍然胜过我们的驾驶员;演化后的版本没有和语言模型交过手——打赢它们的是手写版本。

阅读论文:方向盘上的规则 ↗ 联系我们 ↗

Perslis 全站