它学会打赢。
进攻才能看出一个大脑是不是真的。我们的大脑从屏幕和引擎读取战场,打射击游戏和坦克游戏,从自己的失败中变强,并把只用电锯或不许开火这样的命令当作硬边界。
- 你来开
- 它学你的动作
- 放手
- 大脑自己开
横向对比:逐个游戏的进攻结果
| 游戏 | 我们的大脑 | 对我们不利的 |
|---|---|---|
| DOOM E1M1,Hurt Me Plenty 难度 | 52 秒到达出口开关,击杀 4 | Nightmare 难度:8 次都没通关 |
| DOOM——只用规则、不学习 | 17.9,随机为 3.2 | 叠加记忆:持平 |
| DOOM E1M5——学习 | 路线进度翻倍有余,0.19 → 0.43 | E1M5 还没找到出口;飞行员未变,上升期间线路有 51 次人工修复——主要由我们构建 |
| Atari BattleZone(坦克) | 27,000,随机为 3,000 | 一条闪避规则被否决 |
| BattleZone——从另一款坦克游戏移入的大脑 | 33,575,该游戏自带规则为 28,600;修剪后 48,588 对 29,275 | 移入的大脑由我们手写(+17% 是迁移,不是学习);第二次导出只打平 |
| 3D 坦克竞技场(BZFlag) | 每分钟净击杀 −1.17 → −0.26,从手写到演化 | 仍然输给 BZFlag 自带的 AI;v2 是我们写的,v3、v4 是循环的晋升 |
| Robot Tank(Atari) | 摧毁 5.67 辆坦克,随机为 2.33 | 手写规则,不是学习 |
| GoldenEye 007,大坝关 | 发明了 2 个胜过默认的战术 | 72 次尝试无一存活 |
瞄准靠计数,不靠自夸:在坦克游戏中,眼睛的瞄准误差第 95 百分位为 0.55°。
从没见过这个游戏,到一夜之间追到自带 AI 的身后
- 9 月 26 日 18:11——第一场比赛。在那天之前,我们的规则驾驶员从没见过这个游戏。只有手写的起步规则;到第二个手写版本时,对阵游戏自带 AI 每分钟净击杀 −1.17(8 场比赛)。
- 23:39——开启演化。每一次死亡都被解释;循环每次从工程师写好的选项中挑出一处改变,在实战比赛中正面对比测试。
- 00:27——它证明的第一个改变。只有当炮弹真的会落在 6 米之内才闪避;明显胜出(z 3.08)。
- 01:14——第二条。开火后不再急转虚晃;明显胜出(z 2.68)。一共试了 34 个改变,保留 2 个,否决 8 个。
- 到 01:14:每分钟净击杀从手写版的 −1.17 提升到演化版的 −0.26——在与挑选改变无关的另一批比赛中,这是明显的提升(z 2.93)。它的击杀仍少于游戏自带 AI(每分钟 1.28 对 2.10);死亡接近(1.53 对 1.73),但这个差距并不显著。还没追上。
为什么模型追不上:它们的权重是冻结的
Claude、DeepSeek 和 Llama 每一场比赛用的都是开局时的同一套权重。神经模型不改动权重就无法演化:要在这辆坦克上变强,就得有人收集比赛、在数据中心重新训练、再发布新版本——而新版本还可能忘掉旧版本会的东西。比赛与比赛之间,它什么也学不到。
我们的驾驶员在比赛之间改变,一个权重都没动——因为它根本没有权重。根据自己的死亡,循环挑出两处改变,正面对比证明后保留下来。区别就在这里:一个要被重建才能学习的模型,对一个在比赛间隙学习的驾驶员。
现在,你还愿意让 Claude 开你的坦克吗?
一场十分钟的比赛只有 58 个决策。七场合计击杀 3 次、死亡 47 次。在有人重新训练它之前,一直冻结。或者,一个在同样十分钟里做了 60,140 个决策、那天之前从没见过这个游戏、当晚就把对阵游戏自带 AI 的成绩从 −1.17 提升到 −0.26 的规则驾驶员——一个权重都没有。
神经模型仍有它的位置——看和读。它不负责指挥。权限之内的命令,Peel 执行;权限之外的,它拒绝并告诉你原因。
数据来自竞技场的比赛录像。如实说明:每个模型 7 场比赛;Claude 通过命令行工具运行,所以 7.6 秒里有一部分是管道开销;在击杀上,游戏自带 AI 仍然胜过我们的驾驶员;演化后的版本没有和语言模型交过手——打赢它们的是手写版本。