炼金术与AI:德雷福斯对符号AI的批判为何在今日依然尖锐

发布时间:2026/8/27 4:16:08
炼金术与AI:德雷福斯对符号AI的批判为何在今日依然尖锐 1965年一位年轻的哲学教授写下一篇不到三十页的论文标题叫《炼金术与AI》。六十年过去论文里的很多句子读起来像是预言AI研究者把智能当成一门可以“提纯”的化学把符号和规则当成炼金材料却忽略了智能里那些无法写进规则的东西。今天回头看这篇论文不是历史档案而是理解当下大模型热的一把钥匙。这篇文章会拆解德雷福斯这篇经典文献的核心论证包括他对符号AI的四个批评、对“炼金术”这个比喻的用法以及他认为智能无法被完全符号化的理由。同时我会把它放到今天的深度学习语境里对照哪些批评被技术绕过了哪些批评反而在大模型时代变得更尖锐。如果你是AI工程师、产品经理或研究者这篇文章能帮你建立更清晰的批判性视角避免被“AI全知论”带偏。1. 论文背景与基本信息这篇论文的作者是休伯特·德雷福斯Hubert Dreyfus加州大学伯克利分校的哲学教授代表作是《计算机不能做什么》What Computers Cant Do1972及其修订版《计算机仍然不能做什么》What Computers Still Cant Do1992。1965年这篇《Alchemy and AI》是他最早一批系统批判AI的公开文献比《计算机不能做什么》早了七年。信息项说明作者Hubert Dreyfus休伯特·德雷福斯发表时间1965年论文性质哲学批判性论文针对早期符号AI研究纲领核心比喻炼金术Alchemy主要批判对象逻辑理论家Logic Theorist、通用问题求解器GPS、早期机器翻译、模式识别核心主张AI研究者误把人类智能当作可形式化的规则系统忽略了身体化技能与情境判断当代对照符号主义AI vs 深度学习/大模型今天的读者可能会疑惑1965年不是AI的“蛮荒时代”吗那时候连个人电脑都没有神经网络论文还没被重视德雷福斯批判的是什么他批判的是当时如日中天的符号主义研究纲领。1965年前后纽厄尔Newell和西蒙Simon已经做出逻辑理论家和GPS麦卡锡正在推动常识推理的形式化机器翻译项目拿了大量政府经费。整个领域弥漫着乐观情绪只要把知识写成逻辑规则再用搜索算法组合规则就能造出通用智能。德雷福斯说等等你们这个做法有问题。2. 核心观点速览为了快速理解这篇论文我用表格梳理德雷福斯最核心的几个论点。每一行都对应他在论文里针对早期AI研究的具体批评。批评维度德雷福斯的观点当时AI研究的假设当代回响智能的本质智能大量依赖无法言说的技能know-how而非可陈述的知识know-that智能可以被形式化为符号操作大模型“会做但说不清”的能力与隐含技能高度相关信息处理假设人类认知类似于数字计算机的离散符号处理认知 对离散符号的操纵联结论与符号主义争论至今未平息知识表示常识和专家技能无法全部编码为清晰规则可以建立完备的知识库和规则库常识推理仍是当前AI最大瓶颈之一情境依赖智能行为脱离具体情境无法成立情境可以被抽象为逻辑状态大模型幻觉问题与缺乏情境锚定有关身体化人类智能依赖身体与环境的交互智能可以脱离身体纯粹在符号层实现具身智能成为当前研究热点反衬此判断这张表是我根据论文内容整理的不是原文的目录结构但它能帮你快速抓取论文的论证骨架。下面逐个展开。3. 德雷福斯到底在批判什么3.1 对“符号处理范式”的根本质疑1965年的AI研究几乎等于“符号处理”symbolic processing。研究者相信人类智能活动可以被拆解为一系列离散符号的转换只要规则足够多、搜索足够快机器就能重现智能。德雷福斯对此提出了根本质疑。他认为这个范式把智能窄化了。人类解决问题时不只是在大脑里运行一套形式规则我们还依赖大量无法用规则明确写出的“身体化技能”。比如骑车、识别面部表情、判断一个笑话是否合适这些能力我们熟练掌握却很难给出完整的规则描述。一个典型例子是语言使用。我们能流利使用母语但绝大多数人无法完整讲出自己母语的语法规则。德雷福斯认为如果智能必须依赖“先掌握规则再执行规则”就无法解释人类这种“不经过规则就能正确行动”的现象。AI研究者坚持把智能等同于规则操作等于把一个需要解释的现象直接设定成了公理。3.2 四个具体批评论文里德雷福斯针对早期AI研究的四个核心假设展开批评第一个假设是“生物学假设”。这个假设认为大脑的工作原理可以类比为数字计算机的开关逻辑神经元要么激活要么不激活本质上就是符号的物理实现。德雷福斯指出这个类比过于粗糙。神经元之间的连接强度、化学调制、全局状态等因素都不是一个简单开关模型能覆盖的。第二个假设是“心理学假设”。这个假设认为智能行为可以被拆解为离散的心理操作步骤就像计算机执行指令一样。德雷福斯反驳说人类的认知过程并非总是离散的、可分步骤的。很多智能活动是整体的、连续的、不可切分的。如果认知本质上是连续过程那么用离散符号模拟就会产生系统性偏差。第三个假设是“认识论假设”。这个假设认为所有知识都可以被形式化为逻辑规则或事实命题。德雷福斯花了很大力气批评这一点。他引用维特根斯坦的“遵守规则”难题任何规则在应用到新情境时都需要判断“这个情境是否适用该规则”而这判断本身又需要规则造成无限倒退。所以规则系统永远需要外部补充无法自给自足。第四个假设是“本体论假设”。这个假设认为世界可以被划分为一组独立、确定的元素或事实这些元素之间的关系也可以被形式化。德雷福斯认为这种“世界是可分解的”观点把人类经验的丰富性和情境性完全抹掉了。我们的世界不是一堆离散事实的集合而是由意义、关系、历史、身体构成的一张网。这四个假设合起来构成了德雷福斯眼中AI研究的“炼金术思维”研究者相信可以通过某种纯化程序把智能的“本质”提取出来装进计算机。就像炼金术士相信可以通过操作物质把普通金属变成金子。4. “炼金术”这个比喻为什么精准德雷福斯用“炼金术”来称呼早期AI不是随便贬低。炼金术有几个特征和1965年的AI研究高度相似。炼金术的目标是伟大的点石成金、制造万灵药。早期AI的目标同样伟大造出通用问题求解器、实现机器翻译、模拟人类智能。两边的口号都极具诱惑力都拿到了大量资源和资助。炼金术的方法是封闭的炼金术士在自己的坩埚里操作物质相信只要配方正确就能得到金子。早期AI研究者也类似他们在自己的符号系统内部做封闭操作假设只要规则和搜索足够充分智能就会涌现。问题在于炼金术士忽略了真实化学反应需要的外部条件、杂质和环境因素AI研究者同样忽略了智能所依赖的身体、情境和背景知识。炼金术的结果是零散的炼金术确实积累了一些实验技巧比如加热、蒸馏、溶解但它没有建立起现代化学的理论体系。德雷福斯暗示早期AI也会这样可能会做出一些漂亮的演示程序但无法建立智能的科学基础。后来的历史确实如此1970年代到1980年代的专家系统热潮之后符号AI进入了漫长寒冬。炼金术的另一个特征是“不可证伪”炼金术士总是能解释为什么实验失败——材料不纯、火候不对、有干扰。早期AI也有类似倾向程序表现不好就说是知识库不够大、规则不够多、搜索不够深。这种叙事让研究看起来总在朝目标前进实际上却可能在原地打转。用这个比喻德雷福斯想表达的更深一层意思AI研究者太相信“方法”可以替代“理解”。炼金术士不缺方法缺的是对化学本质的理解早期AI不缺搜索算法和规则库缺的是对智能本质的理解。5. 与当代深度学习的对照读1965年的论文最有趣的体验是发现德雷福斯批评的很多问题今天的深度学习实际上“绕过去”了但绕过去之后又有新的问题浮出水面。5.1 被绕过的批评德雷福斯反对离散符号处理认为它无法捕捉连续、整体的认知过程。深度学习直接放弃了显式符号操作改用高维向量和连续函数逼近确实绕过了这个批评。这可能是深度学习在感知任务上大获成功的原因之一。图像识别、语音识别不再依赖人工规则而是从数据中自主学习特征。德雷福斯反对“知识可以被完整形式化”的假设。深度学习也没有试图形式化知识而是把知识隐含在神经网络权重里。一个GPT模型并不“知道”一条明确的语法规则但它能生成符合语法的文本。这种“隐含知识”至少在外观上更接近德雷福斯所说的“know-how”。德雷福斯强调身体化经验和情境判断。虽然当前的LLM没有身体但它通过海量人类文本间接学习到了大量关于人类世界的情境知识。这也是为什么大模型在某些任务上表现出惊人的“常识感”尽管这种常识感并不稳定。5.2 变得更尖锐的批评绕过一部分批评后德雷福斯的另一个核心判断反而在深度学习时代被进一步验证智能无法脱离情境和意义孤立存在。大模型最著名的缺陷是“幻觉”hallucination。模型会流畅地生成错误的事实、虚构的引用、不存在的书名。为什么会这样从德雷福斯的视角看这是因为模型在符号层面其实是统计层面操作但它没有真正“锚定”于世界。它缺少身体、缺少真实环境的持续反馈、缺少“知道自己在说什么”的语境意识。规则化的知识库没有解决这个问题参数化的“知识库”同样没有解决。另一个例子是常识推理。大模型在简单算术和复杂推理上仍不稳定偶尔出现低级错误。德雷福斯六十年前就警告把智能简化为符号或统计模式会丢失那些最基础、最不显眼、却最关键的常识能力。模型能写诗、能编程、能通过司法考试却可能在一个简单问题上“翻车”这正是“炼金术式智能”的结构性缺陷表面精美底层不稳。5.3 历史对照表时代核心方法被德雷福斯批评的问题实际结果1960s-1980s符号逻辑、搜索、专家系统知识无法完全形式化遭遇AI寒冬专家系统维护成本过高1990s-2010s统计机器学习、核方法、浅层神经网络未直接回应哲学批评但转向数据驱动感知任务突破但通用智能仍远2012至今深度学习、大规模预训练隐含知识规模扩展绕过部分符号化批评大模型能力惊艳但幻觉、推理不稳、常识缺失未来可能具身智能、世界模型、多模态重新回应身体化与情境判断批评值得观察的方向这张表不是论文里的是我依据历史事实做的对照。它能帮你看清德雷福斯的批评在时间轴上的位置。6. 对当代AI工程师与产品经理的启示6.1 不要把“能生成”当成“能理解”德雷福斯的核心观点之一就是区分“正确输出”和“真正理解”。1965年的程序能推导逻辑结论但德雷福斯否认它“理解”了逻辑。今天的大模型能写出通顺的文章但你不能因此认为它理解了世界。这个观点对工程实践的启发是用大模型做产品时必须建立“能力边界”意识。模型能通过某个测试集不等于它能处理所有同类任务。上线前要做对抗性测试、边界测试、错误模式分析而不是只看几个成功案例就宣布“模型解决了问题”。6.2 规则和知识库没有消失它们只是换了一种形态德雷福斯批评“完备知识库”的梦想。今天的实践者往往走向另一个极端以为提示词调优可以解决一切不需要精细设计规则。实际工程里RAG检索增强生成、结构化输出、后处理校验、人工审核兜底本质上都是给模型补充“规则层”。这恰好印证了德雷福斯的深层思想纯粹的“智能引擎”是不够的必须与外部规则、情境、反馈机制耦合。模型的统计能力不是万能的它需要被“锚定”到可信的知识源和业务逻辑上。6.3 专家技能难以自动化别迷信“一键替代”德雷福斯后来在《计算机不能做什么》里详细论证了专家技能的本质专家不是靠背诵更多规则取胜而是靠大量实践经验形成的“直觉”。1965年论文已经埋下这个伏笔。对今天的影响是当你评估“AI能否替代某类专家工作”时要区分“新手规则”和“专家直觉”。如果一项工作高度依赖隐性知识比如高级医生诊断、资深律师策略判断、顶级设计师的审美决策那么AI大概率只能在辅助层面发挥作用而非完全替代。真正被替代的往往是那些规则清晰、反馈明确、流程固定的事务性工作。6.4 警惕“炼金术式指标”德雷福斯说炼金术最大的问题是沉浸在自己的话语体系里用内部标准评判自己。今天AI研究也有类似倾向用BLEU分数、ROUGE分数、MMLU准确率这类内部指标代替“这个系统在真实世界到底有没有用”的终极问题。这些指标当然重要但如果整个行业只追求刷榜、追指标忽略模型在真实场景中的可靠性、安全性、公平性就可能重演炼金术的陷阱表面繁荣实质停滞。产品负责人应该建立一套“真实世界验证”流程让模型在真实用户、真实数据、真实反馈中接受检验。7. 常见误读与边界7.1 误读一德雷福斯说“AI永远不可能成功”这是一个流传很广的误读。实际上1965年论文的态度比这句话复杂得多。德雷福斯批评的是当时的符号AI研究纲领而不是“机器能否智能”这个终极问题本身。他甚至承认如果未来AI放弃掉那些不恰当的假设也许能取得进展。到了2012年之后的深度学习时代他的立场也一直在被讨论。更准确的说法是德雷福斯认为“用炼金术式的方法做AI”必然失败不等于“AI在原则上不可能”。7.2 误读二德雷福斯是“反技术”的德雷福斯不是反对计算机技术他是反对对技术的过度自信和错误认识。他的批评对象不是机器而是“机器研究者关于智能的贫乏想象”。他本人长期关注技术哲学研究海德格尔和现象学目的恰恰是让技术对人的理解更深刻而不是更浅薄。7.3 误读三深度学习已经证明德雷福斯错了这个误读最需要澄清。深度学习确实在感知任务上取得了符号AI无法想象的成就这让一些人觉得“哲学家的警告过时了”。但德雷福斯批评的核心不是“感知任务难”而是“智能不等于规则操作”“技能无法完全形式化”“情境理解至关重要”。这些批评在大模型时代依然成立甚至更值得重视。大模型能写文章但它对世界的理解仍然是浅层的、统计性的、不稳定的这是当下技术界的基本共识。7.4 论文的写作背景与局限1965年论文写于深度学习诞生之前作者无法预见到神经网络在硬件和海量数据推动下的复兴。论文的主要局限在于它对“模型能否从足够多的数据中涌现出复杂能力”估计不足。虽然德雷福斯后来在《计算机仍然不能做什么》中补充了更多论述但1965年这篇论文的论证对象仍然是符号范式不能直接当作对深度学习时代所有批评的完整预言。8. 延伸阅读德雷福斯思想脉络如果你对这篇论文感兴趣可以按以下顺序延伸阅读第一本是《计算机不能做什么》1972。这是1965年论文的系统扩展版德雷福斯花了大量篇幅讨论机器翻译、模式识别、博弈、问题求解等领域的失败并引入现象学和存在主义哲学作为批判工具。这本书是理解“AI哲学批判”的必读文本。第二本是《计算机仍然不能做什么》1992。1992年版新增了大量回应讨论专家系统热潮、神经网络复兴、以及“智能是否可以从联结主义模型中涌现”的问题。德雷福斯在书中承认某些早期预测过于悲观但仍然坚持“身体化技能”的核心论点。第三本可以读德雷福斯与德雷福斯兄弟合著的《Mind over Machine》1986。这本书提出“技能获取五阶段模型”新手、高级初学者、胜任者、精通者、专家。这个模型对理解“为什么专家知识难以自动化”非常有帮助也直接影响了后来的人机交互设计和决策支持系统研究。另外可以阅读德雷福斯在2007年的访谈《Why Heideggerian AI failed and how fixing it would require making it more Heideggerian》。在这篇晚年文章中他对具身AI的前景做了更细致的讨论值得和1965年论文对照着读。9. 总结与下一步这篇论文最值得尝试的点是它提供了一个经过六十年检验的思想框架当所有人都沉浸在技术乐观主义中时如何保持清醒的批判视角。它不是让你否定AI而是让你更准确地评估AI的路径选择和技术边界。最先应该验证的是德雷福斯对“规则化知识”的批评角度。你可以在自己的工作里找几个案例是否曾经以为把规则写清楚机器就能做好某件事结果如何如果再加入“技能、情境、反馈”这些被忽略的因素系统是否会更好最容易踩的坑是把这篇论文当成“AI失败论”的预言书草率得出结论之后丢到一边。更好的读法是把论文当成“AI问题框架”的早期版本——它能帮你提出好问题而不是替你回答问题。后续可以继续扩展的方向有三个一是阅读德雷福斯后来关于“技能获取五阶段模型”的论述用于评估AI辅助决策系统的可用性边界二是对比符号主义与联结主义之争理解为什么今天的大模型仍然没有终结这场争论三是把海德格尔、梅洛-庞蒂的现象学思想引入AI研究思考“具身智能”这个概念到底意味着什么。1965年的德雷福斯不是算命先生他没有预测到深度学习也没有预料到大模型会以如此快的速度进入公众生活。但他留下了一个至今不过时的提问如果你想把智能变成一门科学是不是应该先搞清楚智能到底是不是你认为的那种东西这个问题在今天的AI热潮里仍然值得每一个从业者认真回答。