解读 · 混合 AI
什么是神经符号 AI?
神经网络从数据中学习,符号系统在显式的事实与规则之上推理。神经符号 AI 把两者放进同一个系统。它的含义、六种连接方式、真实存在的案例,以及决定一个混合系统是否值得信任的那一项性质。
神经符号 AI(neuro-symbolic AI,也写作 neurosymbolic AI,常被称为混合 AI)把两类方法结合在一起:从数据中学习模式的神经网络,以及用显式的符号、事实与规则表示知识并在其上推理的符号系统。目标是得到一个既能像神经网络那样学习,又能像符号系统那样推理、解释并接受检验的系统。
神经网络擅长符号 AI 不擅长的事:感知、语言、从杂乱数据中学习。符号系统擅长神经网络不擅长的事:精确推理、解释与保证。Henry Kautz 把连接两者的方式归纳为六种类型。最强的实际案例,从 AlphaGo 到 AlphaProof,都遵循同一个模式:神经网络提议,符号引擎裁决。如果这个符号检验器是可靠的(sound),那么无论网络出错多频繁,它接受的每一个答案都是正确的;代价是有些答案永远不会到来,而不是错误的答案会到来。许多以“神经符号”为卖点的产品并不具备这一性质,因为它们的符号部分没有任何权威。
1. 神经符号 AI 是什么意思
这个术语指的是一种组合,而不是某一种单独的技术。一边是神经网络传统:由带权重的单元组成、用梯度下降训练的网络,今天包括卷积网络、Transformer 和大语言模型(LLM)。另一边是符号 AI:操作显式符号(事实、规则、逻辑公式、程序、搜索树)的程序,也就是符号系统所描述的那一传统。只有当两类组件都承担实际工作、并彼此传递信息时,一个系统才算是神经符号的。
写法不同,含义相同。neuro-symbolic(带连字符)和 neurosymbolic(不带)在研究文献中都很常见;Kautz 用前者 [1],Garcez 与 Lamb 用后者 [2]。neural-symbolic(神经-符号)是集成研究社区沿用了几十年的更早写法。混合 AI(hybrid AI)和符号混合(symbolic hybrid)是对同一理念更宽泛的叫法。在商业语境中,“混合 AI”也可能指无关的东西,例如端侧模型与云端模型的混合,或机器学习与人工审核的混合;本页中它始终指神经加符号。
有两种情况不足以让一个系统在任何有用的意义上成为神经符号系统。把词输入网络、再把词读出来,不算,尽管词本身是符号(Kautz 把它列为第 1 类,即标准的深度学习流程,见 §3,这恰好说明这个标签单独拿出来说明不了什么)。一个写出关于规则的文字的神经模型,也不算,因为关于规则的文字并不是任何东西会去强制执行的规则。
2. 为什么要结合神经与符号 AI
每一种传统都在对方擅长之处失败。这就是支持混合系统的全部论据。
| 神经网络 | 符号系统 | |
|---|---|---|
| 从原始数据中学习 | 能:图像、音频、文本 | 大多不能:知识是写出来或编译出来的 |
| 处理噪声与歧义 | 擅长 | 超出已编码范围就变得脆弱 |
| 精确的多步推理 | 不可靠;错误会累积 | 规则正确时就是精确的 |
| 解释自己的答案 | 困难:权重不是理由 | 推导过程本身就是解释 |
| 保证 | 至多是统计意义上的 | 可证明,相对于规则而言 |
| 会说“我不知道” | 默认不会;它会给出流畅的猜测 | 证明失败或查询为空本身就是答案 |
| 主要的已知失败 | 幻觉 [17] | 知识获取瓶颈、符号接地 [18]、组合爆炸 |
神经网络带来的东西。它们从样例中学会感知与语言,而不是依赖手写规则;而手写规则正是 20 世纪 80 年代专家系统的主要局限(见符号 AI 的历史)。符号系统需要事实以符号形式给出;神经网络则能从像素和文字中把它们读出来。
它们欠缺的东西。生成式模型无论是否知道答案,都会产出最可信的续写,这正是幻觉背后的机制 [17]。语言模型在冗长的精确过程上也不可靠:PAL 的作者观察到,LLM 常常能正确分解问题,却在求解步骤中犯算术或逻辑错误 [11];Toolformer 的出发点也是算术和事实查找上的同一缺口 [12]。而在没有外部反馈的情况下让模型检查自己的推理,往往并不能改进,有时还会变差 [19]。
符号系统带来的东西。精确、可解释,以及说“不”的能力。定理证明器要么找到证明,要么找不到;数据库查询要么匹配,要么返回空;在游戏规则上的搜索永远不会提出非法着法。
它们欠缺的东西。规则必须有人来写,而世界总是比规则跑得快(知识获取瓶颈)。符号若不与感知相连,对系统而言就没有意义(符号接地问题 [18])。穷尽式推理还会组合爆炸:围棋的局面多到没有好的引导就无法搜索。
Kautz 在 2020 年的 AAAI 讲座中把现代论据讲得很直白。在讨论 Marcus 与 Davis 主张结合两种传统的《Rebooting AI》时,他指出两位作者与深度学习研究者在“需要弄清如何结合神经与符号方法”这一点上其实“激烈地意见一致”(in violent agreement),并且“魔鬼在细节里:这样一个混合 AI 系统的架构究竟应该是什么样?” [1]。下一节就是他的回答。
3. 混合系统的六种类型(Kautz)
Henry Kautz 在第三十四届 AAAI 人工智能大会(2020 年 2 月 10 日)上发表 Robert S. Engelmore 纪念讲座,讲稿以《The Third AI Summer》(第三个 AI 之夏)为题于 2022 年发表在 AI Magazine 上,其中为神经符号系统命名了六种设计 [1]。名称是他的记法,读起来像类型签名:方括号表示“作为子程序在内部运行”,竖线表示“把输出交给”。他注明这只是一种可能的分类法,并指向 Garcez 与 Lamb 的另一种分类 [2]。
| 类型 | 含义 | Kautz 给出的例子 | 后来的系统(我们的解读) |
|---|---|---|---|
| 1. Symbolic Neuro symbolic | 符号进、符号出,中间是神经网络。词被转成向量,网络计算,softmax 再把结果转回符号。 | 自然语言处理中的标准深度学习 | 单独的 LLM:token 进,token 出 |
| 2. Symbolic[Neuro] | 符号问题求解器把神经网络当作子程序调用,用于模式识别或评估。 | AlphaGo:以神经网络为评估函数的蒙特卡洛树搜索;以及大多数机器人和自动驾驶车辆 | AlphaGeometry 与 AlphaProof:符号引擎或证明检查器主导,模型提议步骤 |
| 3. Neuro | Symbolic | 神经网络把非符号输入(像素)转换为符号结构,再由符号推理器处理。 | 神经符号概念学习器(Neuro-Symbolic Concept Learner) | 先由视觉模型抽取物体,再由规则引擎对其推理 |
| 4. Neuro: Symbolic → Neuro | 用符号规则生成的数据训练一个普通网络,让网络吸收这些规则。 | Lample 与 Charton 用于符号积分和微分方程的 Transformer [10] | 在求解器或证明生成的数据上训练的模型 |
| 5. NeuroSymbolic(写作 Neuro_{Symbolic}) | 把符号规则编译为网络内部结构的模板。 | 张量积表示;逻辑张量网络 | 2022 年形态的逻辑张量网络;可微的逻辑损失 |
| 6. Neuro[Symbolic] | 把符号推理引擎嵌入神经系统内部,由神经系统决定何时调用它(Kahneman 的“系统 1”调用“系统 2”)。 | 仅为提议,尚未实现;Kautz 认为最有前景 | 宽泛地说:由 LLM 决定何时运行代码或求解器(PAL、Toolformer),只是引擎在外部而非内嵌 |
关于这套分类,有两点比名称更重要。第一,各类型的区别在于哪一方说了算。在 Symbolic[Neuro] 中,符号求解器做决定,网络提供建议;在 Neuro[Symbolic] 中,网络做决定,并在它选择时调用求解器。第二,只有部分类型在最终输出中保留了符号保证。第 4、5 类把规则折叠进网络,让规则塑造学习,但输出仍是网络的输出:正如 Kautz 指出的,Lample 与 Charton 的模型并不生成逐步推导,它是把规则吸收得足够好,从而能直接猜出答案 [1]。第 6 节把这一区别变成数学。
4. 真实存在的神经符号 AI 案例
这个术语被用得很宽泛,因此下面只列出已发表、经同行评审或有公开文档的系统,并说明每一半实际做了什么。
| 系统 | 神经一方 | 符号一方 | 符号一方保证什么 |
|---|---|---|---|
| AlphaGo(2016) | 策略网络与价值网络 | 基于围棋规则的蒙特卡洛树搜索 | 搜索到的每一步都合法 |
| AlphaGeometry(2024) | 提议辅助构造的语言模型 | 符号演绎引擎 | 每个证明步骤都是推导,而不是猜测 |
| AlphaProof(2024) | 用强化学习训练的语言模型 | Lean 证明助手 | 它输出的每个证明都经过形式化检查 |
| DeepProbLog(2018) | 神经谓词,例如数字分类器 | 概率逻辑程序 | 推理遵循程序的逻辑 |
| 逻辑张量网络(2022) | 把符号接地到数据上的网络 | 采用模糊语义的一阶“Real Logic” | 知识塑造训练;满足是程度问题,不是证明 |
| NS-CL(2019) | 场景感知与问题解析 | 符号程序执行器 | 答案通过运行程序计算得出 |
| PAL / Toolformer(2022–23) | 语言模型 | Python 解释器;计算器等工具 | 计算是精确的;程序本身仍可能是错的 |
| GraphRAG(2024) | LLM 构建并总结图 | 实体知识图谱及其社区 | 为检索提供结构;不检查抽取出的事实 |
4.1 AlphaGo(Silver 等,Nature,2016)
AlphaGo 把建议有前途着法的策略网络、估计胜负形势的价值网络,与按精确规则推演棋局的蒙特卡洛树搜索结合在一起 [3]。它以 5 比 0 击败欧洲冠军樊麾(论文中报告),并于 2016 年 3 月在首尔以 4 比 1 击败李世石。Kautz 把它作为 Symbolic[Neuro] 的典型例子:搜索主导,网络让搜索变得可承受 [1]。
4.2 AlphaGeometry(Trinh 等,Nature,2024)
符号演绎引擎能推出一张几何图形的全部推论,却无法发明难题证明所需的那个额外的点或线。AlphaGeometry 的语言模型在约 1 亿个合成证明上从零训练,负责提议这些辅助构造;演绎引擎随后推出它们的后果,如此循环,直到目标得证。在 30 道近年的奥赛级几何题上,它解出 25 道,此前最好的方法只解出 10 道 [4]。
4.3 AlphaProof 与 AlphaGeometry 2(Google DeepMind,2024)
AlphaProof 把预训练语言模型与 AlphaZero 式强化学习结合起来,在 Lean 中证明命题;Lean 是一种形式化证明助手,其内核会检查每一步。为了训练,团队微调了一个 Gemini 模型,把自然语言题目翻译成形式化命题。在 2024 年国际数学奥林匹克(IMO)中,题目由人工翻译成 Lean,AlphaProof 解出三道题(两道代数、一道数论,其中包括本届最难的一题),AlphaGeometry 2 解出几何题:共得 42 分中的 28 分,达到银牌水平,距金牌线差一分。有的解答用时几分钟,有的长达三天,远超比赛时限 [5]。完整方法于 2025 年 11 月发表在 Nature 上 [6]。这里要紧的设计要点是:任何证明,除非经过 Lean 检查,否则都不会离开系统。
4.4 DeepProbLog(Manhaeve 等,NeurIPS 2018)
DeepProbLog 为概率逻辑编程语言 ProbLog 增加了神经谓词:一个逻辑原子的概率由神经网络给出,例如一个读取手写数字的分类器。程序的规则再把这些概率组合起来,整个系统可以从样例端到端训练,例如只给出两张数字图像之和,而不给单个数字的标签 [7]。
4.5 逻辑张量网络(Badreddine 等,Artificial Intelligence,2022)
逻辑张量网络(Logic Tensor Networks)定义了一种完全可微的一阶语言 Real Logic:常量、函数与谓词通过神经计算图接地到数据上,逻辑联结词采用模糊逻辑语义 [8]。逻辑知识变成网络努力满足的训练目标。这对带背景知识的学习很有力,但代价也在这里:公式只在一定程度上被满足,因此它约束网络,却不保证网络的输出。
4.6 神经符号概念学习器(Mao 等,ICLR 2019)
NS-CL 从配有问答的图像中学习视觉概念、词语以及问题的语义解析,而不对其中任何一项做直接监督 [9]。它为场景构建以物体为单位的表示,把每个问题翻译成可执行的符号程序,再在场景上运行该程序。它在合成数据集 CLEVR 上评估,也是 Kautz 所举的 Neuro | Symbolic 例子。
4.7 带工具的 LLM:PAL 与 Toolformer
部署最广的混合系统,是把精确工作交给符号工具的语言模型。PAL(程序辅助语言模型)让模型把推理写成 Python 程序,由解释器计算答案 [11]。Toolformer 只用每个工具少量的示范,就教会模型决定调用哪个 API、何时调用,涵盖计算器、问答系统、搜索引擎、翻译系统和日历 [12]。工具的计算是精确的;但模型有没有向工具提出正确的问题,没有任何东西去检查。
4.8 基于知识图谱的检索,包括 GraphRAG
检索增强生成(RAG)在模型作答之前先取回文档并放入模型的上下文 [13]。微软研究院的 GraphRAG 则先建图:由 LLM 从源文档中抽取实体知识图谱,再为每个由紧密相关实体组成的社区预先生成摘要,从而能回答关于整个语料库的全局问题(“主要主题是什么?”),而这正是普通 RAG 处理不好的 [14]。下一节直接讨论知识图谱。
5. 知识图谱、知识地图与大语言模型
知识图谱把知识存成由实体与带类型的关系组成的图,最简单的形式是主语、谓语、宾语构成的三元组 [15]:
每个三元组都是一条符号事实:可以被精确查询、与其他事实连接、按模式(schema)校验,并追溯到其来源。Google 于 2012 年 5 月推出其 Knowledge Graph(知识图谱),以“things, not strings”(是事物,不是字符串)为口号,使这个术语广为人知 [20]。搜索知识地图(knowledge map)的人通常指的是同一理念画给人看的版本:一张概念及其关联的地图。这个说法没有统一的技术定义;一旦涉及系统,它几乎总是指知识图谱。
Pan 等人把知识图谱与 LLM 的结合方式归为三种框架:知识图谱增强的 LLM、LLM 增强的知识图谱,以及 LLM 与知识图谱的协同 [16]。在实践中表现为四种模式:
- 图作为上下文。取回相关子图并放进提示词。这是带结构的 RAG。
- 模型写查询。LLM 把问题翻译成图查询,由图引擎精确执行。
- 模型建图。LLM 从文本中抽取实体与关系,GraphRAG 就是这样做的。
- 图检查模型。输出中的断言在展示之前与图谱比对。
局限:检索不是验证。在模式 1 和模式 3 中,符号结构只是提供建议,做决定的仍是神经模型。放进上下文的事实并不会强迫模型使用它,事后也没有任何东西拿它去检查答案。在模式 3 中,图谱本身就是模型的输出:LLM 抽取的每个三元组都继承了 LLM 的错误率,因此这样建出的图只是模型读过内容的索引,而不是已验证事实的存储。只有模式 4,以及直接返回查询结果而非加以转述的模式 2,才让符号一方拥有最终决定权。我们在《检索不是记忆》 [21]中展开了这一论证。
6. 形式化视角:提议者与验证者
§4 中表现最好的混合系统有着相同的形状:神经网络提议,符号过程检查,只有通过检查的输出才会离开系统。这种形状带有一个值得写下来的保证,因为它同时解释了这些系统为什么有效,以及它们付出了什么代价。
图 1. 提议者–验证者模式。AlphaGeometry、AlphaProof,以及以搜索代替检查器的 AlphaGo,都是这种形状。
6.1 设定
混合系统 在验证者接受时返回候选,否则弃权,其中 表示“没有答案”:
6.2 可靠性不依赖于网络
证明中从未提到 。网络可以很小、训练得很差,甚至是对抗性的;它改变的是系统多频繁给出答案,而从不改变它给出的答案是否正确。这就是 AlphaProof 可以使用一个多数时候出错的模型的原因:Lean 会丢弃错误的尝试。
6.3 代价是召回率,而非精确率
因此,一个可靠的验证者把弱提议者的错误转化为弃权和重试,它们耗费的是时间与覆盖面;而不是错误答案,后者耗费的是信任。一个十次错九次的提议者,给它二十次独立尝试,仍有约 88% 的时候能产出一个通过检查的答案,而这些答案每一个都是正确的。这也正是 AlphaProof 在一道题上花费长达三天时所做的权衡。
6.4 未经验证的步骤会累积错误
作为对照,考虑一条由 个步骤组成的链,每一步由一个正确概率为 的模型产出,且没有任何东西检查这些步骤。若各步错误相互独立,整条链正确的概率为
更糟的是,这条链不会给出任何信号,告诉你哪些运行属于那 65% 的错误。若每一步都有可靠的验证者,那么按定理 1 逐步应用,一条完成了的链出错的概率为零;下降的只是完成的概率。同样的算术,连同一个实测例子,在失效安全模型页面的“为什么猜测永远不能变成事实”一节中有详细推演。
7. 混合系统在哪里出错
神经符号 AI 是一个有真实成果的真实研究领域。它同时也是一个营销用语。以下是我们最常看到的两者之间的差距。
- 这个词被用得很宽泛。任何把模型与某种结构化东西(提示词模板、JSON 模式、向量索引)结合的产品,都可以自称神经符号。只需问一个问题:用户看到什么,由哪一方决定?如果答案是“模型”,那么符号部分只是装饰。
- LLM 自己提示自己不是混合系统。思维链、自我批评和“反思”循环,都是同一个神经模型在产出更多文字。在没有外部反馈的情况下,自我纠错往往不能改进推理,有时还会使之变差 [19]。检查者与提议者有相同的盲点,所以它的错误与它本应捕捉的错误是相关的。
- 提示词里的规则只是建议。把一条政策写进系统提示词并不会让它成为规则;读它的模型可以忽略它。符号规则是由代码强制执行的规则。
- 符号一方只有在掌握权威时才有用。定理 1 要求验证者能够说“不”,并且这个“不”能拦住输出。模型可以忽略的检索、被模型转述的知识图谱、只记录警告而不强制执行的检查器,都给不了这项保证。
- 软逻辑用保证换取学习。逻辑张量网络这类可微方法让知识塑造训练,这很有价值;但满足程度为 0.97 的约束并不是证明。
- 符号方法的弱点并不会消失。验证者需要规格,而编写规格正是旧日知识获取瓶颈的新形式。感知错误仍会流入推理器:一个被错误解析的场景,会被正确地推理,然后得出错误的答案。而基于错误规格的可靠验证者,会可靠地出错。
这些都不是反对混合系统的理由,而是要求追问权威位于何处的理由。同一个问题也是失效安全模型的核心:当系统出错时,哪个组件被允许让错误通过?
8. Peel:符号一方掌握权威的混合系统
Perslis Research 的 Peel 建立在提议者–验证者的划分之上,并把权威放在符号一方。它的规则很短:模型可以提议;只有地板能接纳一条事实。语言模型可以建议去哪里找,或者什么可能为真。它所说的一切,在符号地板依据来源接纳之前,都不会成为知识;没有任何东西被接纳时,答案是未知,而不是猜测。
- 做决定的回路中没有神经网络。模型可以提议;接纳、行动还是拒绝,由符号层决定。
- 知识是有类型、有来源的卡片,因此每条被接纳的事实都能追溯到其出处。
- 学习是可读的计数,而不是权重,因此人可以读懂学到了什么以及为什么。
按 Kautz 的说法,最接近的类型是 Symbolic[Neuro]:符号系统主导,模型被咨询。与 AlphaGo 这类系统的区别在于模型输出的去向:在 Peel 中,模型输出在被地板接纳之前不能算数,这正是定理 1 所需要的性质。我们测量过放松这条规则会发生什么:让一个准确率为 85.8% 的模型猜测被当作事实,会使一项诊断任务中的正确识别率从 1.000 降到 0.753,详见失效安全模型页面。
这一设计使 Peel 据我们所知成为第一个失效安全模型:一种失败会把它推向安全状态的 AI 模型,它的学习可以收窄它的行为,却永远不能扩大它被授权做的事。Peel 是研究原型,并非经过认证的安全系统。Perslis 更广泛地如何使用符号 AI,见Perslis 的符号 AI;逐步执行的流水线,见符号流。
9. 常见问题
- 用简单的话说,什么是神经符号 AI?
- 它是把两种构建智能的方式结合起来的 AI:从样例中学习模式的神经网络,以及处理显式事实与规则、逐步推理的符号系统。神经部分负责感知与语言;符号部分负责精确推理、解释与检查。
- ChatGPT 是神经符号 AI 吗?
- 单独的大语言模型是神经网络:文本以 token 形式输入、以 token 形式输出,属于 Kautz 六种类型中的第一种 Symbolic Neuro symbolic。当聊天助手运行代码、调用计算器、查询数据库或搜索网络时,它就成了一个松散的混合系统,因为有一个符号工具承担了部分工作。但决定展示什么的仍是神经模型,所以工具的精确并不会让最终答案变成经过检查的答案。
- 神经符号 AI 有哪些例子?
- 有充分文档的例子包括:AlphaGo(神经网络引导树搜索,2016)、AlphaGeometry(语言模型为符号演绎引擎提议构造,2024)、AlphaProof(由 Lean 证明助手检查的证明,2024)、DeepProbLog(概率逻辑程序中的神经谓词,2018)、逻辑张量网络(可微的一阶逻辑,2022)、神经符号概念学习器(2019)、程序辅助语言模型与 Toolformer(调用解释器和工具的 LLM),以及 GraphRAG(由 LLM 构建用于检索的知识图谱,2024)。
- 什么是混合 AI?
- 在研究中,混合 AI 通常就是指神经符号 AI:把机器学习与规则、逻辑、搜索或知识图谱等符号推理结合起来的系统。在商业语境中,这个说法有时指别的混合,例如端侧模型加云端模型,或 AI 加人工审核,因此要看清所指的是哪一种。
- neuro-symbolic 还是 neurosymbolic,哪种写法对?
- 都对。neuro-symbolic、neurosymbolic 以及更早的 neural-symbolic 指的是同一个领域,中文通常译作神经符号 AI。Kautz 写作 neuro-symbolic;Garcez 与 Lamb 写作 neurosymbolic。
- Kautz 的六种神经符号 AI 类型是什么?
- Symbolic Neuro symbolic(符号进出网络)、Symbolic[Neuro](符号求解器调用网络,如 AlphaGo)、Neuro | Symbolic(网络为推理器产出符号,如神经符号概念学习器)、Neuro: Symbolic → Neuro(在规则生成的数据上训练的网络)、Neuro_{Symbolic}(把规则编译进网络结构,如逻辑张量网络),以及 Neuro[Symbolic](嵌入神经系统内部的符号引擎,Kautz 提出并认为它最有前景)。
- GraphRAG 是神经符号的吗?
- 部分是。GraphRAG 用 LLM 构建实体知识图谱和社区摘要,再用这种结构做检索,所以其中确有符号结构参与。但图谱是由模型抽取的,也没有任何东西拿它去验证答案,因此它改进了检索,却没有增加符号保证。
- 神经符号 AI 能消除幻觉吗?
- 只有当符号一方拥有最终决定权时才能。如果每个答案在展示之前都必须通过一个可靠的检查器,错误答案就会变成弃权。如果符号部分只是提供模型可用可不用的上下文,幻觉最多只是减少,而不是被阻止。
10. 参考文献
- H. A. Kautz. The Third AI Summer: AAAI Robert S. Engelmore Memorial Lecture. AI Magazine 43(1):105–125, 2022. doi:10.1002/aaai.12036.(讲座于 2020 年 2 月 10 日在 AAAI-20 发表。)
- A. d’Avila Garcez, L. C. Lamb. Neurosymbolic AI: the 3rd wave. Artificial Intelligence Review 56:12387–12406, 2023. doi:10.1007/s10462-023-10448-w. arXiv:2012.05876.
- D. Silver, A. Huang, C. J. Maddison, A. Guez et al. Mastering the game of Go with deep neural networks and tree search. Nature 529:484–489, 2016.
- T. H. Trinh, Y. Wu, Q. V. Le, H. He, T. Luong. Solving olympiad geometry without human demonstrations. Nature 625:476–482, 2024. doi:10.1038/s41586-023-06747-5.
- Google DeepMind (AlphaProof and AlphaGeometry teams). AI achieves silver-medal standard solving International Mathematical Olympiad problems. 博客文章,2024 年 7 月 25 日。
- T. Hubert, R. Mehta, L. Sartran et al. Olympiad-level formal mathematical reasoning with reinforcement learning. Nature, 2025. doi:10.1038/s41586-025-09833-y.
- R. Manhaeve, S. Dumančić, A. Kimmig, T. Demeester, L. De Raedt. DeepProbLog: Neural Probabilistic Logic Programming. NeurIPS, 2018. arXiv:1805.10872.
- S. Badreddine, A. d’Avila Garcez, L. Serafini, M. Spranger. Logic Tensor Networks. Artificial Intelligence 303:103649, 2022. doi:10.1016/j.artint.2021.103649. arXiv:2012.13635.
- J. Mao, C. Gan, P. Kohli, J. B. Tenenbaum, J. Wu. The Neuro-Symbolic Concept Learner: Interpreting Scenes, Words, and Sentences From Natural Supervision. ICLR, 2019. arXiv:1904.12584.
- G. Lample, F. Charton. Deep Learning for Symbolic Mathematics. ICLR, 2020. arXiv:1912.01412.
- L. Gao, A. Madaan, S. Zhou, U. Alon, P. Liu, Y. Yang, J. Callan, G. Neubig. PAL: Program-aided Language Models. ICML, 2023. arXiv:2211.10435 (2022).
- T. Schick, J. Dwivedi-Yu, R. Dessì, R. Raileanu, M. Lomeli, E. Hambro, L. Zettlemoyer, N. Cancedda, T. Scialom. Toolformer: Language Models Can Teach Themselves to Use Tools. NeurIPS, 2023. arXiv:2302.04761.
- P. Lewis et al. Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks. NeurIPS, 2020. arXiv:2005.11401.
- D. Edge et al. From Local to Global: A Graph RAG Approach to Query-Focused Summarization. Microsoft Research, 2024. arXiv:2404.16130.
- A. Hogan et al. Knowledge Graphs. ACM Computing Surveys 54(4), Article 71, 2021. doi:10.1145/3447772.
- S. Pan, L. Luo, Y. Wang, C. Chen, J. Wang, X. Wu. Unifying Large Language Models and Knowledge Graphs: A Roadmap. IEEE Transactions on Knowledge and Data Engineering 36:3580–3599, 2024. arXiv:2306.08302.
- Z. Ji et al. Survey of Hallucination in Natural Language Generation. ACM Computing Surveys 55(12), 2023.
- S. Harnad. The symbol grounding problem. Physica D 42:335–346, 1990.
- J. Huang, X. Chen, S. Mishra, H. S. Zheng, A. W. Yu, X. Song, D. Zhou. Large Language Models Cannot Self-Correct Reasoning Yet. ICLR, 2024. arXiv:2310.01798.
- A. Singhal. Introducing the Knowledge Graph: things, not strings. Official Google Blog,2012 年 5 月 16 日。
- Perslis Research. 检索不是记忆(Retrieval Is Not Memory). 2026. research.perslis.com/memory