解读 · 历史
符号 AI 的历史:从达特茅斯到神经符号
七十年来用显式符号、规则与逻辑构建的 AI:奠基性的程序、专家系统热潮、两次 AI 寒冬、知识图谱默默发展的几十年,以及符号推理在今天的神经网络系统中的回归。本页每一个日期都有出处。
符号 AI(symbolic AI)是人工智能的一个分支:它把知识表示为显式的符号、规则与逻辑,并通过操作这些符号来推理。它的历史始于 1956 年的达特茅斯会议,经过逻辑理论家、LISP、专家系统、两次 AI 寒冬和知识图谱,一直延续到今天的神经符号系统。
符号 AI 是人工智能最早的形态,在最初三十年里几乎就是这个领域的全部。它始于 1955 年一份创造了“人工智能”一词的提案,带来了 LISP、Prolog 和最早的专家系统,也带来了这个领域的两次大失望:1970 年代和 1980 年代末的 AI 寒冬。那时,脆弱的系统、手工构建的知识和夸大的承诺撞上了现实。符号方法从未离开:它们变成了搜索引擎、规划器、数据库、知识图谱和定理证明器。2016 年以来,最强的 AI 系统越来越多地把神经网络与符号搜索、求解器和验证器结合起来。寒冬留下的教训——关于脆弱性、知识的代价和过度承诺——原封不动地适用于今天的 AI。
1. 什么是符号 AI,它的历史从哪里开始
符号 AI(也称经典 AI、基于逻辑的 AI,1985 年后又称 GOFAI)用人能读懂的表示来构建智能:代表事物的符号(patient、block-A、benzene),把它们联系起来的结构(规则、框架、逻辑公式、图),以及操作这些结构的过程(搜索、推理、规划)。与之相对的是亚符号或联结主义传统,它从数据中学习数值权重,最著名的形式就是神经网络。支柱页面什么是符号 AI?讲这些思想,本页讲这段历史。
这些思想更古老:形式逻辑、可计算性理论,以及图灵 1950 年提出的问题“机器能思考吗?” [1]。但把思考当作符号操作、并着手把它造出来的研究纲领,始于 1955 年的达特茅斯提案和 1956 年的达特茅斯研讨会。
图 1. 繁荣与寒冬。寒冬的起止年份是约定俗成的近似值,史学家对其确切结束时间看法不一。
2. 完整时间线,1950–2025
下表每一行都对照过原始文献或标准参考资料;参考文献编号见 §13。
| 年份 | 事件 | 人物 | 为何重要 |
|---|---|---|---|
| 1950 | 《计算机器与智能》(Computing Machinery and Intelligence),发表于 Mind | 艾伦·图灵 | 提出“机器能思考吗?”并提出模仿游戏 [1]。 |
| 1955 | 达特茅斯提案,落款日期 1955 年 8 月 31 日 | 约翰·麦卡锡、马文·明斯基、纳撒尼尔·罗切斯特、克劳德·香农 | 提出“人工智能”一词 [2]。 |
| 1956 | 达特茅斯人工智能夏季研究项目 | 四位提案人及受邀研究者 | 普遍被视为 AI 作为一个领域的奠基事件。 |
| 1956 | 逻辑理论家(Logic Theorist) | 艾伦·纽厄尔、克利夫·肖、赫伯特·西蒙(兰德公司) | 证明了《数学原理》第 2 章前 52 条定理中的 38 条 [3]。 |
| 1957–59 | 通用问题求解器(GPS) | 纽厄尔、肖、西蒙 | 手段—目的分析:通用的搜索方法与所解决的问题相分离 [4]。 |
| 1958 | LISP | 约翰·麦卡锡(MIT) | 此后三十年符号 AI 的主要语言;1960 年发表 [5]。 |
| 1958–59 | 《具有常识的程序》(建议接受者,Advice Taker) | 约翰·麦卡锡 | 首次提出用逻辑作为程序表示自身知识的方式 [6]。 |
| 1965 | DENDRAL 项目启动(斯坦福) | 爱德华·费根鲍姆、布鲁斯·布坎南、乔舒亚·莱德伯格、卡尔·杰拉西 | 通常被称为第一个专家系统 [8]。 |
| 1966 | ELIZA | 约瑟夫·魏泽鲍姆(MIT) | 基于关键词的规则,被用户读成了“理解” [7]。 |
| 1968–70 | SHRDLU | 特里·温诺格拉德(MIT) | 关于一个模拟积木世界的自然语言对话 [11]。 |
| 1969 | 《感知机》(Perceptrons) | 马文·明斯基、西摩·佩珀特 | 证明单层感知机的局限;促成了神经网络研究的衰落 [9]。 |
| 1969 | 框架问题 | 约翰·麦卡锡、帕特里克·海耶斯 | 如何表示一个动作不会改变的东西 [10]。 |
| 1971 | STRIPS | 理查德·法伊克斯、尼尔斯·尼尔森(SRI) | 为 Shakey 机器人设计的规划器;其动作表示至今仍是 AI 规划的基础 [12]。 |
| 1972 | Prolog | 阿兰·科尔默劳尔、菲利普·鲁塞尔(马赛),基于罗伯特·科瓦尔斯基的工作 | 逻辑编程:程序就是一组逻辑子句 [13]。 |
| 1970 年代初 | MYCIN | 爱德华·肖特利夫,与布鲁斯·布坎南、斯坦利·科恩等人(斯坦福) | 基于规则、带确定性因子的细菌感染诊疗建议 [14]。 |
| 1973 | 莱特希尔报告 | 詹姆斯·莱特希尔爵士,为英国科学研究委员会撰写 | 归咎于“组合爆炸”;英国随后削减经费 [15]。 |
| 1974 | 《表示知识的框架》(框架理论) | 马文·明斯基 | 带槽位与默认值的刻板情境 [16]。 |
| 1975–76 | 图灵奖;物理符号系统假说 | 艾伦·纽厄尔、赫伯特·西蒙 | 把符号纲领表述为一个科学假说 [17]。 |
| 1980 | R1/XCON 在数字设备公司(DEC)投入使用 | 约翰·麦克德莫特(卡内基梅隆) | 最常被引用的首个专家系统商业成功 [18]。 |
| 1982 | 第五代计算机系统项目 | 日本通产省(MITI),由 ICOT 执行 | 以逻辑编程为基础的十年国家计划 [19]。 |
| 1984 | Cyc 在 MCC 启动 | 道格拉斯·莱纳特 | 尝试手工编码常识知识 [20]。 |
| 1984 | “AI 寒冬”一词在 AAAI 年会上被提出 | 罗杰·尚克、马文·明斯基 | 警告这轮热潮将以失败告终 [21]。 |
| 1985 | “GOFAI”一词诞生 | 约翰·豪格兰 | 把经典符号 AI 命名为一种独立的立场 [22]。 |
| 1987 | Lisp 机市场崩溃 | 整个行业 | 通常被视为第二次 AI 寒冬的开端 [21]。 |
| 1990 | 《符号接地问题》 | 史蒂文·哈纳德 | 符号如何获得不是从我们这里借来的意义? [23] |
| 1997 | 深蓝以 3½–2½ 击败加里·卡斯帕罗夫 | IBM(默里·坎贝尔、约瑟夫·霍恩、许峰雄) | 靠搜索和人工设计的评估函数,而非机器学习 [24]。 |
| 2001 | 《语义网》,发表于《科学美国人》 | 蒂姆·伯纳斯-李、詹姆斯·亨德勒、奥拉·拉西拉 | 一个机器可读意义的网络 [25]。 |
| 2004 | OWL 成为 W3C 推荐标准(2 月 10 日) | W3C Web 本体工作组 | 一种标准的、基于逻辑的本体语言 [26]。 |
| 2012 | 谷歌知识图谱(5 月 16 日) | 谷歌 | “是事物,而非字符串”:主流搜索中的符号图谱 [27]。 |
| 2012 | AlexNet 赢得 ImageNet | 亚历克斯·克里热夫斯基、伊利亚·苏茨克维、杰弗里·辛顿 | top-5 错误率 15.3%,第二名为 26.2%;深度学习的转折 [28]。 |
| 2016 | AlphaGo 以 4–1 击败李世石 | DeepMind | 一种混合系统:由策略网络和价值网络引导的蒙特卡洛树搜索 [29]。 |
| 2020 | 《神经符号 AI:第三次浪潮》;《第三个 AI 夏天》 | 阿图尔·达维拉·加塞斯、路易斯·兰姆;亨利·考茨 | 把神经符号融合定位为下一个阶段 [30] [31]。 |
| 2023 | Toolformer;Logic-LM | Schick 等;Pan 等 | 语言模型调用工具与符号求解器 [32] [33]。 |
| 2024 | AlphaGeometry,发表于 Nature(1 月) | Trieu Trinh 及其同事,谷歌 DeepMind | 语言模型引导符号演绎引擎;解出 30 道奥赛几何题中的 25 道 [34]。 |
| 2024 | AlphaProof + AlphaGeometry 2 达到 IMO 银牌水平(7 月) | 谷歌 DeepMind | 42 分中得 28 分,证明由 Lean 形式语言检验 [35]。 |
| 2025 | Gemini Deep Think 达到 IMO 金牌水平(7 月) | 谷歌 DeepMind | 全程使用自然语言、不借助形式证明器,得 35 分(满分 42) [36]。 |
3. 奠基时代,1950–1965
图灵的问题
1950 年 10 月,艾伦·图灵在哲学期刊 Mind 上发表《计算机器与智能》 [1]。他用一个行为测试——模仿游戏——取代了“机器能思考吗?”这个问题。这篇论文没有提出方法;它让这个问题变得值得认真对待。
达特茅斯与这个名字
1955 年 8 月 31 日,约翰·麦卡锡、马文·明斯基、纳撒尼尔·罗切斯特和克劳德·香农提交了一份提案,建议 1956 年夏天在达特茅斯学院开展“为期 2 个月、10 个人的人工智能研究” [2]。这份提案提出了“人工智能”一词,并写下了这个领域的奠基猜想:“学习的每一个方面,或智能的任何其他特征,原则上都可以被描述得足够精确,以至于可以造一台机器来模拟它。”研讨会本身没有产出单一的成果;它聚集了此后二十年引领 AI 的人。
逻辑理论家与 GPS
1955–56 年,在兰德公司工作的艾伦·纽厄尔、克利夫·肖和赫伯特·西蒙构建了逻辑理论家,它常被称为第一个 AI 程序 [3]。它借助启发式、从目标出发逆向搜索来证明命题逻辑定理,证明了怀特海与罗素《数学原理》第 2 章前 52 条定理中的 38 条,并为定理 2.85 找到了比书中更短的证明。他们的下一个程序通用问题求解器(1957 年创建,1959 年发表)把这种方法推广为手段—目的分析:比较当前状态与目标,选择一个能缩小差距的算子,然后递归 [4]。GPS 确立了一个延续至今的模式:通用的推理引擎,与它所运行的领域知识相分离。
LISP 与以逻辑为表示
1958 年,已到 MIT 的麦卡锡开始设计 LISP。他 1960 年的论文既把它作为一门可用的语言,也作为一种数学形式体系来介绍 [5]。程序和数据共用同一种形式——表,因此 LISP 程序可以构造和检查其他程序。正是这一性质,让 LISP 直到 1980 年代末都是符号 AI 的语言。
同年,麦卡锡在英国特丁顿国家物理实验室的一次研讨会上宣读了《具有常识的程序》(1959 年出版) [6]。文中提出了建议接受者:一个以形式逻辑语句保存知识、并依据推导结果行动的程序。它是基于逻辑的知识表示的源头。
4. 黄金时代与最早的程序,1965–1973
1960 年代末诞生的程序,至今仍在教科书中定义着符号 AI。每一个都成功了,每一个也都暴露出一个局限。
- DENDRAL(1965 年起)。在斯坦福,爱德华·费根鲍姆、遗传学家乔舒亚·莱德伯格、化学家卡尔·杰拉西和布鲁斯·布坎南构建了一个根据质谱数据推断有机分子结构的程序 [8]。它的能力与其说来自巧妙的搜索,不如说来自编码进去的化学知识。这个项目的教训成了一句口号——“知识就是力量”,DENDRAL 通常被称为第一个专家系统。
- ELIZA(1966)。约瑟夫·魏泽鲍姆在 MIT 编写的程序匹配输入中的关键词,并按规则变换句子 [7]。借助模仿罗杰斯式心理治疗师的 DOCTOR 脚本,用户把“理解”归于一个根本没有理解能力的程序。
- SHRDLU(1968–70)。特里·温诺格拉德在 MIT 的博士论文程序,能用英语讨论一张模拟的积木桌面,执行指令并解释自己做了什么 [11]。它在自己的微世界里令人印象深刻,却无法扩展到微世界之外。
- STRIPS(1971)。SRI 的理查德·法伊克斯和尼尔斯·尼尔森为移动机器人 Shakey 构建了一个规划器 [12]。STRIPS 用前提条件和效果(要添加和删除的事实列表)来描述每个动作。这种表示至今仍是 AI 规划的基础。
1969 年的两份出版物塑造了此后的走向。明斯基和佩珀特的《感知机》证明,单层感知机无法计算异或(XOR)这类函数 [9]。人们普遍认为这本书促成了 1970 年代神经网络研究的急剧衰落,尽管史学家至今仍在争论这种衰落有多少应归因于它;后来用反向传播训练的多层网络消除了这一局限。同年,麦卡锡和帕特里克·海耶斯命名了框架问题:当程序用逻辑推理动作时,如何表示一个动作没有改变的一切,而不必为每个事实都写一条公理 [10]?
1972 年,在马赛,阿兰·科尔默劳尔和菲利普·鲁塞尔借鉴罗伯特·科瓦尔斯基对霍恩子句的过程式解读,创造了 Prolog(programmation en logique,“用逻辑编程”) [13]。一个 Prolog 程序就是一组事实和规则;运行它就是提出一个问题,让归结去搜索证明。同一时期在斯坦福,爱德华·肖特利夫的 MYCIN 用几百条带确定性因子的“如果—那么”规则,为血液感染和脑膜炎推荐抗生素 [14]。在一项盲评中,它的建议被评为与斯坦福传染病专家的建议同样恰当,但由于系统集成、法律和伦理方面的障碍,它从未进入常规临床使用。
5. 第一次 AI 寒冬
早期的程序都建立在玩具问题上:一张积木桌、一页逻辑、一个小谜题。研究者以为它们能够扩展。它们没能扩展,而原因有一个名字。
当 、 时,约为 1.1 × 1010 个节点;再多一步,就再乘以十。玩具世界让 和 保持很小,真实世界则不然。启发式可以剪枝,但好的启发式往往专属于某个领域,编写起来代价高昂。
1973 年,英国科学研究委员会发表了数学家詹姆斯·莱特希尔爵士的《人工智能:总体综述》 [15]。莱特希尔认为,通用 AI 的研究没有兑现承诺,并指出组合爆炸正是那些在小问题上奏效的方法在大问题上失败的原因。英国大多数大学的 AI 研究经费随之被削减,只有包括爱丁堡在内的少数几个中心保留了像样的研究项目。在美国,1969 年的曼斯菲尔德修正案已经把 DARPA 推向面向任务的研究;1974 年,DARPA 取消了与卡内基梅隆大学的语音理解合同 [21]。大约 1974 至 1980 年的这段时期,如今被称为第一次 AI 寒冬。
一些经久不衰的思想恰恰诞生于这次寒冬。1974 年,明斯基发布了《表示知识的框架》(MIT AI 备忘录 306),提出框架:带有槽位、默认值和预期的刻板情境结构 [16]。框架影响了后来的面向对象语言和本体语言。纽厄尔和西蒙在 1975 年的图灵奖演讲(1976 年发表)中,把这一纲领的核心主张表述为一个可检验的假说 [17]:
必要是说,任何有智能的东西都是符号系统;充分是说,合适的符号系统可以具有智能。后半句是符号 AI 押下的赌注,前半句则是神经网络传统所质疑的部分。姊妹页面符号系统详细讨论了这一假说。
6. 专家系统热潮,1980–1987
走出第一次寒冬的办法,是放弃通用性。DENDRAL 和 MYCIN 已经表明,一个狭窄的领域加上大量编码进去的专家知识,就能与专家比肩。1980 年代,这条经验变成了一个产业。
这轮热潮的标志是 R1,在数字设备公司(DEC)内部称为 XCON。卡内基梅隆大学的约翰·麦克德莫特用 OPS5 把它写成一个产生式规则系统,用来配置 VAX 计算机订单 [18]。它于 1980 年在 DEC 位于新罕布什尔州塞勒姆的工厂投入使用,据当时的估计,每年为公司节省数千万美元。围绕这些工具形成了一个市场:专家系统外壳,以及 Lisp 机——由 Symbolics、LISP Machines Inc. 等公司制造、专为快速运行 LISP 而设计的工作站。
各国政府随之跟进。1982 年,日本通产省启动了第五代计算机系统项目,由新成立的 ICOT 负责,目标是构建以逻辑编程为核心的并行“推理机” [19]。美国在 1983 年以 DARPA 的战略计算计划作为回应 [37]。1984 年 7 月,道格拉斯·莱纳特在奥斯汀的微电子与计算机技术公司(MCC)启动了 Cyc,试图手工编码专家系统所缺少的常识知识 [20]。Cyc 在离开 MCC 后以 Cycorp 的形式延续。
警告来自领域内部。在 1984 年的 AAAI 年会上,亲历过 1970 年代的罗杰·尚克和马文·明斯基警告说,热情已经跑在了成果前面,崩溃将随之而来;他们用的那个词——AI 寒冬——就此流传下来 [21]。一年后,哲学家约翰·豪格兰在《人工智能:非常的想法》(Artificial Intelligence: The Very Idea)中为整个经典路线命了名:GOFAI,即“好的老式人工智能”(Good Old-Fashioned Artificial Intelligence),也就是认为智能就是内部的、自动的符号操作的观点 [22]。
7. 第二次 AI 寒冬
崩溃从硬件开始。1987 年,Lisp 机市场瓦解:Sun Microsystems 等公司的通用工作站以一小部分价格就能把 LISP 跑得足够好,一个专门的产业在大约一年之内失去了存在的理由 [21]。软件上的问题更深,也更晚才显现。
- 脆弱性。专家系统在自己的领域内表现良好,一出领域就骤然失灵。它们无法判断一个案例是否超出了自己的知识。规则库不会平缓地退化:它要么给出一个自信的答案,要么什么也给不出。
- 知识获取瓶颈。每一条规则都必须从专家那里引出,由知识工程师写下。大型规则库构建成本高昂,随着规模增长,保持一致更是难上加难。
- 常识。系统缺乏任何一个人面对问题时都会带着的背景知识。几十年后仍在建设中的 Cyc,显示了这个缺口有多大。
- 过度承诺。政府和企业被许诺在十年之内得到通用的机器智能。从 1987 年起,DARPA 的信息处理办公室大幅削减了 AI 经费 [37]。日本的第五代项目于 1992 年结束,没有达到最初的目标,尽管它推动了并发逻辑编程的发展 [19]。
同一时期还出现了一个哲学上的批评。1990 年,史蒂文·哈纳德发表了《符号接地问题》 [23]:一个形式符号的意义,怎样才能内在于系统本身,而不是寄生于我们头脑中的意义?他的类比是只靠一本汉汉词典去学中文。哈纳德自己的方案是一种混合系统,让符号扎根于习得的感知类别——这使这篇论文成为今天所说的神经符号 AI 的早期论证。
第二次寒冬通常从 1987 年算起;关于它何时结束,说法从 1993 年到 2000 年不等。和第一次寒冬一样,工作在别的名字下继续进行。
8. 默默成为基础设施:搜索、逻辑编程、知识图谱
1990 年之后,许多符号 AI 不再被称为 AI。它变成了普通计算的一部分。
搜索:深蓝,1997
1997 年 5 月,IBM 的深蓝在纽约举行的六局复赛中以 3½–2½ 击败国际象棋世界冠军加里·卡斯帕罗夫;在 1996 年 2 月的第一次比赛中,它曾以 2–4 落败 [24]。深蓝并没有在现代意义上“学会”下棋。它把大规模并行的博弈树搜索与一个由工程师设计、在定制国际象棋硬件中计算的评估函数结合起来,每秒评估约 2 亿个局面。这是“搜索加人工构建的知识”最著名的一次胜利,除了名称之外,它就是符号 AI。
逻辑、规划与验证
逻辑编程、约束求解、SAT 与 SMT 求解器、源自 STRIPS 的自动规划器以及定理证明器,在 1990 年代和 2000 年代持续改进。它们进入了芯片验证、调度、编译器、类型检查器和数据库。规则引擎在银行、保险和合规领域一直运行。
语义网与知识图谱
2001 年 5 月,蒂姆·伯纳斯-李、詹姆斯·亨德勒和奥拉·拉西拉在《科学美国人》上描述了语义网:为网页内容加上机器可读的意义,让软件可以在其上推理 [25]。W3C 把各个部件标准化,包括 RDF,以及 2004 年 2 月 10 日成为推荐标准的 OWL(Web 本体语言),其形式语义来自描述逻辑 [26]。一个能推理的万维网这一完整愿景没有实现,但各个部件都落地了:医学和生物学中的本体、关联开放数据,以及网页中的结构化标记。
2012 年 5 月 16 日,谷歌以“是事物,而非字符串”(things, not strings)为题推出了知识图谱:搜索结果背后是一张由实体和关系构成的图,部分数据来自 Freebase 和维基百科 [27]。一个大型符号知识库成了世界上使用最广泛的软件之一的一部分,而几乎没有用户把它当作 AI。
9. 深度学习时代,以及符号思想为何从未离开
同一年,2012 年,出现了 AlexNet。亚历克斯·克里热夫斯基、伊利亚·苏茨克维和杰弗里·辛顿在 GPU 上训练了一个深度卷积网络,以 15.3% 的 top-5 错误率赢得 ImageNet 挑战赛,第二名为 26.2% [28]。几年之内,深度学习主导了视觉、语音,继而是语言——正是符号 AI 最薄弱的领域,因为这些知识很难被写下来。
符号方法并没有消失。它们转移到了学习模型力所不及的地方:需要精确的地方(算术、代码执行、数据库查询、形式证明);知识会变化的地方(图谱中的一条事实可以在一处更正,而分散在权重中的事实无法这样编辑);决策必须可审计的地方(规则可以被阅读和质疑,权重不能);以及前瞻式搜索仍然有回报的地方,比如博弈、规划和定理证明。
神经网络系统也以新的形式重新遭遇了符号系统的老毛病。一个在自己不懂的地方依然自信作答的语言模型,从另一面展现了专家系统的脆弱性:专家系统拒绝泛化,语言模型则泛化而不知何时该停。两者都不知道自己的知识在哪里终止。
10. 神经符号的复兴,2016–2026
2016 年以来最引人注目的 AI 成果,往往是混合系统。神经符号 AI 另有专页;这里只做简短的历史梳理。
- AlphaGo(2016)。DeepMind 的程序于 2016 年 3 月在首尔以 4–1 击败李世石 [29]。它常被描述为深度学习的成果;它同时也是一个搜索程序:由提议走法的策略网络和评判局面的价值网络引导的蒙特卡洛树搜索。
- 为这个领域命名(2020)。2020 年 12 月,阿图尔·达维拉·加塞斯和路易斯·兰姆发布了《神经符号 AI:第三次浪潮》 [30]。2020 年 2 月,亨利·考茨发表了 AAAI 罗伯特·S·恩格尔莫尔纪念讲座《第三个 AI 夏天》(2022 年刊于 AI Magazine),回顾了前两轮繁荣与萧条,并提出了把神经与符号组件结合起来的六种方式的分类 [31]。
- 语言模型调用符号工具(2023–2026)。Toolformer 展示了语言模型自己学会何时调用计算器、搜索引擎或日历 [32]。Logic-LM 让模型把问题翻译成形式表示,再交给一个确定性的求解器 [33]。调用代码解释器、求解器、数据库和知识图谱,如今已是已部署的语言模型系统中的常规做法。
- AlphaGeometry(2024 年 1 月)。一个用合成数据训练的语言模型提出辅助构造,由符号演绎引擎完成证明。它解出了 30 道近年奥赛几何题中的 25 道,而此前最好的方法只能解出 10 道 [34]。
- AlphaProof 与 AlphaGeometry 2(2024 年 7 月)。两者合力解出 2024 年国际数学奥林匹克六道题中的四道,42 分中得 28 分,达到银牌水平 [35]。AlphaProof 的证明用 Lean 写成,这是一种由检查器保证正确性的形式语言。题目是人工翻译成 Lean 的,有些题花了长达三天才解出。
边界一直在移动,诚实的历史必须承认这一点。2025 年 7 月,谷歌 DeepMind 报告称,一个进阶版 Gemini Deep Think 模型达到了金牌水平(42 分中得 35 分),它在比赛时限内全程使用自然语言,没有借助形式证明器 [36]。没有改变的是检验的价值:一份 Lean 证明之所以正确,是因为一个小而可信的程序验证了它,而不是因为写出它的模型通常是对的。这种分工——学习模型负责提议,符号程序负责验证——是这次复兴中最持久的思想。
11. 历史的教训
两轮繁荣都以寒冬告终。原因有充分的记载,而且并不是符号方法独有的。
| 教训 | 在符号 AI 中 | 在今天的 AI 中 |
|---|---|---|
| 脆弱性 | 专家系统一出自己的领域就骤然失灵。 | 模型在自己不懂的地方流畅作答,而且不加标示。 |
| 知识瓶颈 | 每条规则都靠手写。 | 每种行为都依赖有人提供并检查的数据、标注和评估。 |
| 组合爆炸 | 在玩具问题上奏效的搜索无法扩展。 | 多步链条会把每一步的小错误率层层累积。 |
| 符号接地 | 符号只与其他符号相关联。 | 用文本训练文本;除非有东西把事实和来源绑定,否则事实不会与来源绑定。 |
| 过度承诺 | 两次许诺十年内实现通用智能。 | 同样的承诺,再次被提出。 |
实际的教训不是“符号好、神经坏”,也不是反过来。而是:一个系统应当知道自己的知识在哪里终止,并在到达那里时安全地失败。1980 年代的专家系统没有可靠的办法识别超出其知识范围的案例。今天的许多 AI 也有同样的缺口。
这正是 Perslis Research 所研究的设计问题。失效安全模型是这样一种 AI 模型:当它失败时,失败会把它推向受控的安全状态;证据缺失时它弃权,它的学习可以收窄它的行为,却永远不能扩大它被允许做的事。Peel 是一个研究原型,据我们所知,它是第一个失效安全模型。它把这段历史中符号那一半用在其最擅长的地方:做决定的回路里没有神经网络,知识是有类型、有来源的卡片,学习是可读的计数。模型可以提议;只有地板能接纳一条事实。Perslis 如何使用符号方法,见Perslis 的符号 AI;为何多步链条需要一个符号层,见《编排层的鸿沟》。关于把这些部件连接起来的确定性流水线,见符号流。
每一种技术,一页讲清。从 A* 与 alpha–beta 到 Rete、STRIPS、描述逻辑与 CDCL:符号 AI 技术大全收录 130 多种技术,按十个家族分别详解。
12. 常见问题
- 符号 AI 是什么时候开始的?
- 始于 1955 至 1956 年。约翰·麦卡锡、马文·明斯基、纳撒尼尔·罗切斯特和克劳德·香农在 1955 年 8 月 31 日的达特茅斯提案中提出了“人工智能”一词,达特茅斯研讨会于 1956 年夏天举行;同年,纽厄尔、肖和西蒙完成了常被称为第一个 AI 程序的逻辑理论家。
- 是什么导致了 AI 寒冬?
- 承诺跑在了成果前面。第一次寒冬大约在 1974 至 1980 年,此前有 1973 年的莱特希尔报告和美国的经费削减,原因是早期程序无法从玩具问题扩展出去。第二次寒冬始于 1987 年 Lisp 机市场的崩溃,当时专家系统被证明脆弱且维护成本高昂,大型政府计划也未能达到目标。
- 第一个专家系统是什么?
- 1965 年由爱德华·费根鲍姆、乔舒亚·莱德伯格、卡尔·杰拉西和布鲁斯·布坎南在斯坦福启动的 DENDRAL,通常被称为第一个专家系统。它根据质谱数据推断有机分子的结构。随后出现了用于传染病的 MYCIN,以及用于配置 DEC 计算机的 R1/XCON。
- 什么是 GOFAI?
- GOFAI 是 Good Old-Fashioned Artificial Intelligence(好的老式人工智能)的缩写。哲学家约翰·豪格兰在 1985 年的著作《人工智能:非常的想法》中创造了这个词,用来指称一种经典观点:智能就是内部的、自动的符号操作。如今它几乎是经典符号 AI 的同义词。
- 深蓝属于符号 AI 吗?
- 大体上是的。1997 年击败加里·卡斯帕罗夫的深蓝,把大规模并行的博弈树搜索与一个由工程师设计的评估函数结合起来。它并不像后来的 AlphaGo 那样从数据中学习下棋。
- 符号 AI 已经死了吗?
- 没有。符号方法运行在搜索引擎、知识图谱、数据库、规划器、求解器和定理证明器之中,近年许多强大的 AI 系统都是混合系统,例如 AlphaGo 和 AlphaGeometry。褪去的是“单靠符号就足够”这一主张。
- 什么是神经符号 AI?
- 神经符号 AI 把神经网络与符号推理结合起来:学习模型负责感知和提议,符号组件负责搜索、规则和验证。这个术语在 2020 年后被广泛使用,但这一思想更早:哈纳德在 1990 年就提出让符号扎根于习得的类别。
13. 参考文献
- A. M. Turing. Computing Machinery and Intelligence. Mind 59(236):433–460, 1950.
- J. McCarthy, M. L. Minsky, N. Rochester, C. E. Shannon. A Proposal for the Dartmouth Summer Research Project on Artificial Intelligence, August 31, 1955. 重刊于 AI Magazine 27(4), 2006. doi:10.1609/aimag.v27i4.1904.
- A. Newell, H. A. Simon. The Logic Theory Machine: A Complex Information Processing System. IRE Transactions on Information Theory IT-2(3):61–79, 1956.
- A. Newell, J. C. Shaw, H. A. Simon. Report on a General Problem-Solving Program. Proceedings of the International Conference on Information Processing, 256–264, 1959.
- J. McCarthy. Recursive Functions of Symbolic Expressions and Their Computation by Machine, Part I. Communications of the ACM 3(4), 1960. doi:10.1145/367177.367199.
- J. McCarthy. Programs with Common Sense. Proceedings of the Symposium on Mechanisation of Thought Processes, National Physical Laboratory, Teddington, 1958(1959 年出版)。
- J. Weizenbaum. ELIZA: A Computer Program for the Study of Natural Language Communication between Man and Machine. Communications of the ACM 9(1):36–45, 1966.
- R. K. Lindsay, B. G. Buchanan, E. A. Feigenbaum, J. Lederberg. DENDRAL: A Case Study of the First Expert System for Scientific Hypothesis Formation. Artificial Intelligence 61(2), 1993.
- M. Minsky, S. Papert. Perceptrons: An Introduction to Computational Geometry. MIT Press, 1969.
- J. McCarthy, P. J. Hayes. Some Philosophical Problems from the Standpoint of Artificial Intelligence. In Machine Intelligence 4, B. Meltzer and D. Michie (eds.), Edinburgh University Press, 1969.
- T. Winograd. Procedures as a Representation for Data in a Computer Program for Understanding Natural Language. PhD thesis, MIT, 1971.
- R. E. Fikes, N. J. Nilsson. STRIPS: A New Approach to the Application of Theorem Proving to Problem Solving. Artificial Intelligence 2(3–4), 1971.
- A. Colmerauer, P. Roussel. The Birth of Prolog. In History of Programming Languages II, ACM, 1996. doi:10.1145/234286.1057820.
- B. G. Buchanan, E. H. Shortliffe (eds.). Rule-Based Expert Systems: The MYCIN Experiments of the Stanford Heuristic Programming Project. Addison-Wesley, 1984.
- J. Lighthill. Artificial Intelligence: A General Survey. In Artificial Intelligence: A Paper Symposium, Science Research Council, 1973.
- M. Minsky. A Framework for Representing Knowledge. MIT AI Laboratory Memo 306, 1974.
- A. Newell, H. A. Simon. Computer Science as Empirical Inquiry: Symbols and Search. Communications of the ACM 19(3), 1976. doi:10.1145/360018.360022.
- J. McDermott. R1: An Expert in the Computer Systems Domain. Proceedings of AAAI-80, 1980.
- E. Feigenbaum, H. Shrobe. The Japanese National Fifth Generation Project: Introduction, Survey, and Evaluation. Future Generation Computer Systems 9(2):105–117, 1993.
- D. B. Lenat. CYC: A Large-Scale Investment in Knowledge Infrastructure. Communications of the ACM 38(11), 1995.
- D. Crevier. AI: The Tumultuous History of the Search for Artificial Intelligence. Basic Books, 1993.另见维基百科条目“AI winter”,2026-09-26 访问。
- J. Haugeland. Artificial Intelligence: The Very Idea. MIT Press, 1985.
- S. Harnad. The Symbol Grounding Problem. Physica D 42:335–346, 1990.
- M. Campbell, A. J. Hoane Jr., F.-h. Hsu. Deep Blue. Artificial Intelligence 134(1–2):57–83, 2002;以及 IBM,Deep Blue,IBM History。
- T. Berners-Lee, J. Hendler, O. Lassila. The Semantic Web. Scientific American 284(5):34–43, May 2001.
- W3C. OWL Web Ontology Language Overview. W3C Recommendation, 10 February 2004.
- A. Singhal. Introducing the Knowledge Graph: things, not strings. The Official Google Blog, 16 May 2012.
- A. Krizhevsky, I. Sutskever, G. E. Hinton. ImageNet Classification with Deep Convolutional Neural Networks. NIPS, 2012.
- D. Silver et al. Mastering the Game of Go with Deep Neural Networks and Tree Search. Nature 529:484–489, 2016. doi:10.1038/nature16961.
- A. d’Avila Garcez, L. C. Lamb. Neurosymbolic AI: The 3rd Wave. arXiv:2012.05876, 2020;后刊于 Artificial Intelligence Review, 2023。
- H. Kautz. The Third AI Summer: AAAI Robert S. Engelmore Memorial Lecture. AI Magazine 43(1):105–125, 2022. doi:10.1002/aaai.12036.
- T. Schick et al. Toolformer: Language Models Can Teach Themselves to Use Tools. arXiv:2302.04761, 2023.
- L. Pan, A. Albalak, X. Wang, W. Y. Wang. Logic-LM: Empowering Large Language Models with Symbolic Solvers for Faithful Logical Reasoning. Findings of EMNLP, 2023.
- T. H. Trinh, Y. Wu, Q. V. Le, H. He, T. Luong. Solving Olympiad Geometry without Human Demonstrations. Nature, January 2024. doi:10.1038/s41586-023-06747-5.
- Google DeepMind. AI achieves silver-medal standard solving International Mathematical Olympiad problems. 25 July 2024.
- Google DeepMind. Advanced version of Gemini with Deep Think officially achieves gold-medal standard at the International Mathematical Olympiad. 21 July 2025.
- A. Roland, P. Shiman. Strategic Computing: DARPA and the Quest for Machine Intelligence, 1983–1993. MIT Press, 2002.