LESSON 083 · COMPUTER SCIENCE

物理符号系统假说

The Physical Symbol System Hypothesis · 智能是一件"对符号做操作"的事
提出者
艾伦·纽厄尔 / 赫伯特·西蒙
年份
1976
领域
计算机 · 认知科学 · 哲学
核心命题
智能不在材料里,在操作里
一 缘起 · 一个刚做完二十年实验的人交出的赌注 ORIGIN

1975 年,纽厄尔与西蒙同获图灵奖。按惯例得奖者要做一场演讲,他们没有回顾成就,而是把二十年的工作压成了一句可以被反驳的话。

那二十年的起点在 1955–56 年的冬天。纽厄尔、西蒙与程序员克利夫·肖一起做出了"逻辑理论家"(Logic Theorist)——公认最早的人工智能程序之一。它做的事在今天看来仍然古怪:它证明数学定理。它翻过《数学原理》第二章的前 52 条定理,独立证出了其中 38 条,而且给出的某些证明比罗素与怀特海手工推演的更短、更漂亮。

问题是:它凭什么能做到?那台机器里没有任何"数学",只有一堆按规则被搬来搬去的符号。它不理解蕴含,不理解否定,甚至不知道自己在证明什么。可它证出来了。

这件事逼出了一个此后半个世纪没有平静过的问题:如果一台只会搬符号的机器能做数学,那么"会思考"这件事,会不会本来就是"搬符号"?反过来问更刺人——如果不是,那么一颗大脑除了搬符号之外,还多做了什么?

纽厄尔与西蒙的答案是:什么也没多做。1976 年 3 月,他们把这个答案写进《计算机科学作为经验探究:符号与搜索》,登在《ACM 通讯》上。

标题里那个词值得停一下:经验探究。他们主张计算机科学不是数学的一支,是一门实验科学——每造一台机器、每写一个程序,都是一次实验。而他们提出的那句话,也不是定理,是一个可以被后来的实验推翻的假说。这一点后来被引用者集体忘掉了:那是一份赌注,不是一条信条。

二 原典 · 两句话,一句人人引用,一句几乎没人记得 THE PRIMARY TEXT

那篇论文给出两个并列的假说。第一个成了整个领域的纲领。

NEWELL & SIMON, 1976 · 物理符号系统假说
"A physical symbol system has the necessary and sufficient means for general intelligent action."

一个物理符号系统,具备产生一般智能行为的必要且充分的手段。

而所谓物理符号系统,是一台由物理定律实现的机器,它拥有一批符号(可以被物理地区分的模式)、由符号组成的表达式(符号结构),以及一批对表达式进行创建、修改、复制、销毁的过程;它随时间演化,产出一个不断变化的符号结构的集合。

两个方向都要读:充分——任何一个足够大的符号系统,只要组织得当,就能够产生智能;必要——任何一个表现出一般智能的系统,都必定是一个符号系统。
Allen Newell & Herbert A. Simon《Computer Science as Empirical Inquiry: Symbols and Search》Communications of the ACM 19(3), March 1976, pp.113–126(1975 年图灵奖演讲)。英文为原句,中文与"符号系统"的界定为转述与压缩。

第二个假说同样出自那篇论文,被引用的次数少得多,而它才是这套东西真正能跑起来的那一半。

NEWELL & SIMON, 1976 · 启发式搜索假说
"The solutions to problems are represented as symbol structures. A physical symbol system exercises its intelligence in problem solving by search — that is, by generating and progressively modifying symbol structures until it produces a solution structure."

问题的解以符号结构的形式被表示。一个物理符号系统在解决问题时,是通过搜索来施展它的智能的——即不断生成并逐步修改符号结构,直到产生出一个解结构。

接着是那个决定性的补充:这些空间大到不可能被穷举(一盘棋、一次证明、一段规划的可能性都远超任何机器的算力),所以真正的本事不在"能搜多少",而在"知道哪里不必去看"。这就是启发式。
同上文,pp.113–126。此为原文两句英文与中译;末段"知道哪里不必去看"为本站对启发式作用的概括。

把两句合起来,就是那个统治了 AI 前三十年的公式:智能 = 表示 + 搜索。先把世界写成符号结构,再在这些结构组成的空间里聪明地找路。——本篇后面全部的故事,都是这两半各自的命运:一半赢得干干净净,另一半输得倾家荡产。

三 释义 · 石头和肉,做同一件事 PLAIN MEANING

这句话真正大胆的地方,是它把"思考"从材料里拆了出来。

在它之前,人们默认智能与某种特殊的东西有关——灵魂、生命、神经组织的某种化学性质。纽厄尔与西蒙说的是:都不是。智能是一类操作,不是一类物质。只要一样东西能拿住可区分的模式、能把它们拼成结构、能按规则改写这些结构,它就在做与你思考时相同的那件事——至于它由铁和电构成,还是由碳和水构成,与此无关。

一台机器不需要"懂"数学,才能做出数学;它只需要正确地搬动那些代表数学的符号。

第二层意思藏在"搜索"里,而且比第一层更实用。按这套说法,绝大多数思考不是灵光一闪,是在一个巨大的可能性空间里走路。下棋是在走法的空间里走,证明是在推导的空间里走,规划是在行动序列的空间里走,写作是在句子的空间里走。而这些空间大到荒唐——一盘国际象棋的合法对局数远超宇宙原子总数。

于是聪明这件事被重新定义了。它不是"算得更多",是"看得更少"。一个大师与一个新手的差别,常常不在于他往下算了多少步,而在于他一眼就把百分之九十九的走法从视野里删掉了,而且删对了。这与 №079 是同一个人写下的同一件事:他在经济学那边说人算不完所以只能满意化,在计算机这边说机器也算不完,所以要靠启发式。

第三层是这套假说最容易被读反的地方,必须当场校准:它不是在说"人脑就是一台计算机"。它说的是"具备必要且充分的手段"——这是一个关于功能的主张,不是关于实现的主张。就像"心脏是一台泵"并不意味着心脏由金属和活塞构成,它只意味着:凡是心脏做的事,一台足够好的泵都能做,而且不做泵所做的事,你就不是心脏。

最后是分寸问题。这句话是一个经验假说,它的两半可被检验的程度完全不同。"充分"那一半说的是"造得出来",可以靠造出一台来证实;"必要"那一半说的是"只能这样",一个不这样却也聪明的东西就足以推翻它。——记住这个不对称,后面第六节的全部力气都花在它上面。

四 后人之论 LATER INTERPRETATIONS
休伯特·德雷福斯 1965 / 1972 · 被羞辱的那个人

1965 年,一位研究海德格尔与梅洛-庞蒂的哲学家受兰德公司之邀写了一份评估报告,标题叫《炼金术与人工智能》。他的判断是:这门新学问在重复炼金术的处境——早期的局部成功让人以为只要继续加料就能通向黄金,而那条路根本不通。

他的核心论点不是"机器不行",而是人类专长的绝大部分根本不是规则的应用:一个熟练的司机、医生、棋手在做的事,不是先把情境编码成事实再检索规则,而是直接在情境中看出该做什么。这种能力依赖身体、依赖背景、依赖一整套从来没有被明确写下来、也无法被穷尽地写下来的东西。问题不在于我们还没编码完,而在于原则上编不完。

AI 界的回应是嘲笑。1967 年,明斯基的同事帕佩特安排他与麻省理工的 MacHack 程序下了一盘棋,德雷福斯输了,这件事被反复引用了很多年。而半个世纪之后回头看:他输了那盘棋,而他关于常识、身体与情境的判断,大体上是对的。——这是本篇最值得记住的一卡:一个批评者可以在最显眼的地方输掉,同时在最要紧的地方赢。

约翰·塞尔 1980 · 中文屋

塞尔的思想实验只有一段:把一个完全不懂中文的人关进屋里,给他一本极其详尽的规则手册。外面递进中文纸条,他照手册查、照手册写、把纸条递出去。外面的人认为屋里坐着一位中文流利的对话者。而屋里那个人,从头到尾一个汉字也不认识。

他的结论是一句话:句法不足以构成语义。程序全部的内容就是按形式规则搬动符号,而按形式规则搬动符号——无论搬得多好——都不会产生对符号意义的理解。如果物理符号系统假说是对的,那么屋里的那个人应该懂中文;他不懂;所以那句话至少缺了点什么。

必须写清两件事。其一,这个论证攻击的是"理解",不是"行为":塞尔完全不否认机器可以通过图灵测试,他否认的是"通过测试"证明了理解——而这个区分正是今天讨论语言模型时被混淆得最厉害的一处。其二,它至今没有结论:最有力的反驳是"系统回应"(不懂中文的是那个人,懂中文的是整间屋子),塞尔的再反驳是让那人把整本手册背下来走出屋子——争论了四十多年,两边都没赢。

罗德尼·布鲁克斯 1990 / 1991 · 无表征的智能

批评从哲学系转到了机器人实验室。布鲁克斯要造能在真实房间里走动的机器,而按经典路线,机器人应当先感知、再建立一个内部的世界模型、再在模型上规划、最后执行。他发现这条路在真实世界里几乎立刻卡死:建模太慢,世界变得比模型更新更快。

他的替代方案是包容架构(subsumption architecture):不建立中央的世界模型,把一层层简单的、直接从感知连到行动的行为叠起来,让它们各自运行、互相压制。造出来的虫子一样的机器人可以在杂乱的房间里跑得很好,而它内部没有任何一处存着"房间"这个符号。他那句被引用最多的话是:"世界是它自己最好的模型。"——不必在脑子里复制一份,抬眼看一次就好。

背后还有一条演化论证,很难反驳:从生命出现到虫子会爬,用了几十亿年;从虫子到人会做符号推理,只用了最后几百万年。那么难的那部分显然是感知与运动,符号推理只是最后加上去的一层薄皮——而经典 AI 恰好是从那层薄皮开始做的。

理查德·萨顿 2019 · 苦涩的教训

2019 年,强化学习领域的萨顿写了一篇不到两千字的短文,此后成为 AI 界被引用最多的非学术文本之一。《苦涩的教训》的论点是:七十年 AI 史反复出现同一个模式——研究者精心地把人类对某个领域的理解编进系统,这在短期内效果很好;然后来了一个更笨、更通用的方法,只是往里砸更多算力,把前者打得干干净净。

而能够随算力任意扩展的方法只有两种:搜索,和学习。棋类、语音识别、计算机视觉、自然语言——同一幕演了一遍又一遍,而每一次,被打败的都是那些"我们知道这个领域该怎么做"的人。

这一卡之所以放在最后,是因为它同时是平反和判决。纽厄尔与西蒙押的两样东西——搜索与符号表示——一个被萨顿列为两种能扩展的方法之一,另一个被他列为反复失败的那件事。他们对了一半,而错的那一半恰恰是他们花最多力气去做的那一半:把知识一条一条写进去。

五 案例 CASE STUDIES
案例 01 第一个"会思考"的程序,在证明数学定理 逻辑理论家 · 1955–56

纽厄尔、西蒙与克利夫·肖做出的逻辑理论家,翻过《数学原理》第二章的前 52 条定理,证出其中 38 条。对第 2.85 条,它给出的证明比罗素与怀特海手工推演的那一版更简洁;西蒙把这个证明寄给了罗素本人,罗素回信表示很高兴。

它的做法完全在假说的两句话之内:把命题写成符号结构,用替换与分离规则生成新的结构,用几条启发式(比如"优先尝试与目标形式更接近的表达式")砍掉绝大多数分支。它不知道什么是真理,它只是在一个空间里找路。

最值得记住的不是它成功了,而是它成功的地方:AI 的历史是从人类最抽象、最费力、最少有人擅长的活动——形式逻辑——开始的。然后它花了六十年,才勉强学会认出一只猫。——这个顺序本身就是对"我们以为智能的核心是什么"的一次强烈提示,而当时没有人读懂它(见反例④)。
案例 02 通用问题求解器:把假说做成一个程序 GPS · 1957–1959 起

纽厄尔与西蒙接着做了"通用问题求解器"(General Problem Solver),把两条假说落成一套通用机制:把问题写成"当前状态"与"目标状态",把可做的动作写成算子,然后反复执行同一个动作——找出当前与目标之间最大的那个差异,挑一个能缩小它的算子用上去。这就是手段—目的分析。

它同时是一个心理学理论。他们让真人一边解题一边出声说出自己在想什么,把这些"出声思维协议"逐句与程序的运行轨迹对照——这是"计算机科学作为经验探究"最字面的实践:程序不是工具,程序就是关于人怎么想的那个理论本身,而且它是可运行、可对照、可推翻的。

GPS 在玩具问题上很漂亮(河内塔、传教士与野人、简单积分),一走进真实问题就卡死。而卡死的地方不是搜索,是表示。把"我该不该换工作"写成一组状态与算子,这一步本身就是全部的难处所在;一旦写好了,剩下的搜索反而不难。——这条教训在生态学、经济学、日常决策里一模一样地成立:难的从来不是想不出办法,是这个问题该怎么摆。
案例 03 专家系统:唯一一次大规模兑现,和它的账单 XCON / R1 · 1978–1980 年代末

1978 年,卡内基梅隆的约翰·麦克德莫特用 OPS5 写了一个规则系统 R1,用来替 DEC 配置 VAX 计算机订单——客户要什么功能,系统就推出该配哪些板卡、线缆、机柜。它在 DEC 内部叫 XCON。到 1986 年,它已处理约八万份订单,准确率在 95%–98% 之间,规则数约 2500 条,据估算每年为 DEC 省下约 2500 万美元(不同来源给出的数字在一千万到四千万之间)。

这是符号主义唯一一次干净的商业胜利,也引爆了整个八十年代的专家系统热潮。然后它塌了。规则库越大越难维护:新增一条规则会以无法预料的方式打坏另外十条;领域一变,整套知识就要重写;而每一条知识都必须由一个人从专家嘴里挖出来、手工写进去。这被称作知识获取瓶颈。资本退潮,AI 冬天到来。

这套东西的成本结构,注定了它只能在很窄的地方赢。XCON 成功的条件极其苛刻:领域窄、规则稳定、答案对错分明、有大量专家可采访、且值那么多钱。凡是不满足这几条的地方,维护成本会随规则数量超线性地涨上去,直到没有人敢再动它。——今天所有靠"把规则一条条写进去"运行的系统(风控细则、流程手册、if-else 组成的策略引擎),走的都是这条曲线。
案例 04 深蓝与 AlphaGo:搜索赢了,知识输了 1997 / 2016

1957 年,西蒙预言"十年之内数字计算机将成为世界象棋冠军"。实际用了四十年。1997 年,IBM 的深蓝击败卡斯帕罗夫——那是启发式搜索假说最纯粹的一次胜利:约 480 颗定制芯片,每秒评估约两亿个局面,alpha-beta 剪枝加上人工调校的评估函数。

但它赢得并不像"思考"。它不像大师那样看棋,它是把一棵深不见底的树砍剩下一小撮枝条,然后一枝一枝地数。2016 年的 AlphaGo 则是混合的:蒙特卡洛树搜索仍在——搜索那一半从未离开;而"哪些走法值得看""这个局面值多少"不再由人写进去,是从大量对局里学出来的。

这两场比赛把 1976 年那个公式的两半分开检验了一遍。"搜索"这一半赢得干干净净,且赢了两次;"符号结构由人写进去"这一半,在第二次里被整个换掉了。——而更值得留意的是那四十年时差:一个提出了这门学问全部纲领的人,在预测自己领域的进度时错了四倍。这几乎是所有技术预测的常态,而做出预测的人通常正是最有资格预测的那个(见反例⑤)。
案例 05 把常识一条一条手写进去,做了四十年 Cyc · 1984–2020 年代

如果"必要"那一半是对的,那么造出智能的路线就是清楚的:把人人都知道、却从来没人写下来的那些东西,一条一条写下来。——水往低处流;人睡着时不会同时走路;把东西放进容器,容器移动它也跟着移动。1984 年,道格·勒纳特开始做这件事,项目叫 Cyc。

它做了四十年。累计投入达到人-世纪量级,知识库里的断言最终以千万计。然后它基本上没有被用起来:学界几乎不用,公开基准上罕见其身影,机器学习研究者佩德罗·多明戈斯称它是"灾难性的失败"。勒纳特 2023 年去世后,项目大体停摆。

这是对"必要性"那一半最昂贵、最认真、也最诚实的一次实验——而且是由最相信它的人亲手做的。它的失败并不证明符号无用;它证明的是"由人把知识手工写入"这条路的成本结构不成立:常识的数量没有底,而每一条都要花掉一个人的一段时间。
——把它和案例 03 放在一起看,你会得到萨顿那句话的四十年田野版:凡是靠"把更多人类理解塞进去"来变好的方案,短期内一定领先,长期内一定被那个更笨、更能吃资源的方案追上。
六 反例与限制 CRITIQUE & LIMITS

这一节要说的核心只有一句:这个假说的两半命运完全不同——一半几乎无法被驳倒,另一半被打得几乎站不住;而唯一带信息量的恰恰是后一半。

最后补一条方向相反的:这套东西最结实的部分,可能不是那两句假说,而是它们标题里的那三个字——"经验探究"。"计算机科学是一门实验科学,每一个被造出来的系统都是一次实验,纲领性的主张必须以能被推翻的形式写下来"——这句方法论至今没有被推翻,而且它恰恰是今天大模型研究的实际工作方式:做出来,测一测,看它到底能不能。

七 相关理论 CONNECTIONS
有限理性与满意化 №079Bounded Rationality · 1955
⟺ 同一个人的另一半
西蒙在№079里说:人算不完,所以只能设一个门槛、搜到够好就停。在这里他说:机器也算不完,所以必须靠启发式砍掉绝大多数分支。是同一条命题的两次落地——"最优化不是一个可以被执行的程序"。那一篇问"这么小的算力该怎么做决定",这一篇问"这样做决定的东西,能不能用铁和电造出来"。
中文屋The Chinese Room · 1980
⚔ 最著名的一刀
句法不足以构成语义。它没有否认机器能表现出智能,它否认的是"表现"能证明"理解"。四十多年未决,而它留下的那个区分每天都在被用到——也每天都在被混淆。
图灵测试The Turing Test · 1950
⟸ 思想先声,也是对照
图灵 1950 年那篇文章做的是同一种切割:不要问机器能不能思考,去问它在行为上能不能与人区分开。物理符号系统假说给这条路补上了机制(符号与搜索)。而中文屋恰好站在它的对面:图灵说行为就够了,塞尔说行为远远不够——这两句话之间的裂缝,至今仍是关于机器心智的全部争论所在。
联结主义与深度学习Connectionism · 1986–
⚔ 主要竞争范式
鲁梅尔哈特与麦克莱兰 1986 年的《并行分布式处理》与同年那篇反向传播论文,给出了另一套答案:表示不是被写进去的,是被学出来的;不是离散的符号,是分布在大量单元上的权重。此后三十年的历史大体是它的胜利——但请注意反例⑤:它赢的是"表示"那一半,"搜索"那一半从来没有换过主人。
双重过程理论 №062Dual-Process Theory
⚠ 它描述准了心智的哪一块
这一条是本篇最紧的一处咬合。№062里"类型二"的唯一定义特征是占用工作记忆——慢、串行、可被言语报告、能做认知解耦。那几乎就是一台物理符号系统的行为描述。而"类型一"完全不是。于是这套假说描述得最准的,恰恰是人类心智里那一小块慢的部分;而它几乎完全没描述那一大块快的、并行的、自动的部分——后者才是人绝大多数行为的来源。
计算不可约性 №072Computational Irreducibility
⟸ 搜索为什么无法被公式取代
№072说:有些系统的未来没有捷径,只能一步步跑完。启发式搜索假说说的是同一件事的实践面——既然没有捷径,那么"智能"就只能是"在不得不跑的空间里,尽量少跑几步"。两篇合起来给出一个不太安慰人的结论:思考之所以费力,可能不是因为我们不够聪明,而是因为那道题本来就得一步步走。
哥德尔不完备 №040Incompleteness · 1931
⚖ 一条走不通的反驳路线
卢卡斯与彭罗斯曾试图用№040推翻这个假说:人能看出哥德尔句为真而形式系统不能,所以人心不是机器。这条路被反驳了六十年(它默认了人类推理是一个一致的形式系统,且我们知道自己的公理——而按第二定理,这恰恰是我们也无法自证的)。值得记住的是结论的形状:真正打中这个假说的不是逻辑,是常识和身体。
范式与不可通约 №006Paradigm Shift
↔ 教科书级样本
符号主义到联结主义,是№006最干净的当代样本之一:两派在什么算作"解释"、什么算作"进展"上都对不上;败方并没有被某个决定性实验驳倒,而是慢慢失去了年轻人和经费。而它同时也是对"不可通约"的一次反例——今天的系统里,两套东西正在同一个架构里各干各的活。
八 致用 APPLICATION

先标明分寸:这是一个关于机器与心智的假说,它几乎不改变你今天的任何决定。以下五条不是它的推论,是从这段五十年的实验史里提出来的判断习惯——第六节⑤讲的正是这类借用最常见的翻车方式。

九 反观三问 THREE QUESTIONS
我最近判断某个人、某个系统"懂了",用的是哪一个证据——它在我出的题上答对了,还是它在我没准备的地方也站得住?这两件事我有没有分开过?
我正卡住的那件事,我是在反复搜索方案,还是该换一次问题的写法?如果换掉记账单位、换掉边界、换掉目标,它还是同一道题吗?
我正在投入的那套东西,是靠不断往里塞规则变好,还是靠给它更多资源自己变好?我押的是哪一边——我知道自己在押吗?
十 延伸阅读 FURTHER READING
← PREVIOUS №082 复合种群理论 HOME 百里路