工作草稿——正在评审中。所有数字均可由冻结、哈希锁定的产物复现;消融实验与规模曲线正在进行。这是 Perslis 论点——神经网络提议,符号裁决——在遗留 COBOL 上的具体实例。

系统结合了:(i) 带来源追踪的符号知识检索;(ii) 确定性程序合成;(iii) 可执行的编译器与运行时验证;(iv) 明确的拒绝机制。它在三类结构迥异的程序族上生成行为正确的 GnuCOBOL,在单核 CPU(无 GPU)上约 486 毫秒返回一个答案,且从不输出未经验证的代码。由于裁判是外部的确定性预言机,而非模型给自己打分,其自我改进无法被"奖励作弊"。

结果(Wilson 95% 置信区间)

测量项比率95% CI
确定性系统自测(3 个程序族)13/13[77.2, 100]%
对抗性 dogfood(正确或拒绝)27/27[87.5, 100]%
组合泛化 A∘B(非平凡)40/40[91.2, 100]%
神经基线,未见模板(佐证免烘焙)0/299[0.0, 1.3]%

阅读完整论文(PDF)↗

论文中明确列出局限:真正工作的生成器是确定性合成(从零训练的神经模型未能泛化);合成与变异空间为人工限定;意图识别基于关键词;若干头条比率的样本量较小,并给出诚实的置信下界;更宏大的规模假设被标注为开放问题。