LESSON 079 · DECISION

有限理性与满意化

Bounded Rationality & Satisficing · 不是人不够理性,是"最优"根本没法被执行
提出者
赫伯特·西蒙
年份
1955 / 1956
领域
经济 · 心理 · 决策
核心命题
设一个"够好"的门槛,越过就停手
一 缘起 · 一个不肯相信"经济人"的行政学者 ORIGIN

二十世纪中叶的经济学里住着一个人。他知道所有可选方案,知道每个方案的全部后果,能给这些后果排出一张完整且一致的偏好表,然后挑出效用最大的那一个。这个人叫"经济人",他不吃饭不睡觉也不犯错,而整座大厦建在他身上。

赫伯特·西蒙(1916–2001)不是从经济学系走进来的。他年轻时研究市政管理——观察真实的官员如何编预算、如何决定该修哪条路。他看到的东西和课本上那个人毫无关系:没有人列得出全部方案,没有人算得清全部后果,也没有人有那张完整的偏好表。他们查几份材料,问几个熟人,找到一个"看上去说得过去"的办法,然后就报上去了。

1947 年他把这些观察写成《行政行为》。八年后,他在《经济学季刊》上把它变成了一个可以和经济学正面对话的模型:《理性选择的行为模型》(1955)。次年在《心理学评论》上,他给这套做法起了名字——satisficing,把 satisfy(满足)和 suffice(足够)拼在一起,也借用了一个英格兰北部方言里"满足"的旧词。中文一般译作满意化。

这里有一处最容易被读反,值得先说:西蒙从来没有说人"不够理性"。他说的是更狠的一句——最优化本身不是一种可以被执行的程序。不是人算得慢,是那个题目根本不存在解法。国际象棋的合法对局数量远超宇宙中的原子总数,穷举不是"暂时做不到",是永远做不到;而下棋还只是一个规则完全清楚、信息完全公开的玩具问题。真实世界比它难得多。

西蒙后来在卡内基梅隆度过大半生。1956 年他与艾伦·纽厄尔、克利夫·肖做出"逻辑理论家"——公认最早的人工智能程序之一,能证明《数学原理》里的定理。1975 年他与纽厄尔共获图灵奖,1978 年独得诺贝尔经济学奖。同时拿下这两个奖的,至今只有他一个人。而这两件事其实是同一件事:他一辈子都在问"一个算力有限的东西,怎样才能做出还不错的决定"——不管那东西是人、是组织,还是机器。

二 原典 · 一个替换,和一把剪刀 THE PRIMARY TEXT

这一课有两块地基。第一块是 1955 年那次替换:把"最优"换成"够好"。

SIMON, 1955 · 为算力有限的有机体设计的选择模型
古典模型要求决策者做到三件事:知道全部备选方案、知道每个方案的全部后果、对这些后果有一张完整而一致的偏好排序。这三件事,真实的有机体一件也做不到。

因此西蒙提出三处替换:
① 用一个满意水平(aspiration level)替代"效用最大化"——只要一个方案达到这个水平,就接受它;
② 用一个大幅简化的收益函数替代那张不可能存在的完整偏好表;
③ 用有限的、逐个进行的搜索替代对全部方案的穷举——搜索不是把所有选项摆开再比较,而是一个接一个地看,遇到第一个越过门槛的就停手。

关键推论:门槛会自己动。找了很久还没有达标的,门槛就往下调;轻易就找到好几个的,门槛就往上抬。
Herbert A. Simon《A Behavioral Model of Rational Choice》,The Quarterly Journal of Economics 69(1), February 1955, pp.99–118。"satisficing" 一词首次出现于次年的 Simon《Rational Choice and the Structure of the Environment》,Psychological Review 63(2), 1956, pp.129–138。以上为核心论证的转述与展开,非逐字翻译。

第二块地基晚了三十五年才被他自己说到最漂亮。它只有一句话,却把"人到底理不理性"这个问题整个改写了。

SIMON, 1990 · 那把剪刀
"Human rational behavior … is shaped by a scissors whose two blades are the structure of task environments and the computational capabilities of the actor."

人的理性行为,是由一把剪刀塑造的,它的两片刀刃分别是:任务环境的结构,与行动者的算力。

只看一片刀刃谈理性,都是错的。问"这个人理不理性"没有答案;
能问的只有一句:这个人的这套办法,和他所处的这个环境,配不配。
Herbert A. Simon《Invariants of Human Behavior》,Annual Review of Psychology 41, 1990, pp.1–19(引文见 p.7)。中译为本站所加。
三 释义 · 干草堆里的那根针 PLAIN MEANING

西蒙自己用过一个比喻,比后来所有的转述都清楚。

最优化,是要在这堆干草里找出最锋利的那一根针——
为此你必须把整堆草翻完,一根不落。

满意化,是要找出一根足够缝好这件衣服的针——
找到了就走人,剩下的草你根本不必碰。

请注意这两件事的差别不在"努力程度",而在问题的形状。第一个任务要求你把搜索进行到底,因为在你翻完最后一根草之前,你无法确定手里这根是不是最锋利的;它的成本不取决于你多快找到好针,而取决于草堆有多大。第二个任务的成本只取决于运气和门槛:找到就停。

于是满意化不是"优化的打折版",它是一套形状完全不同的程序,只有四步:

第四步是这套东西最贴近真实的地方,也是最容易被忽略的地方。它意味着"够好"从来不是一个固定的标准,而是一个跟着环境浮动的读数。房子看了三十套还没有满意的,你的"满意"会自己往下走;面试第一个人就惊为天人,你后面的门槛会自己往上抬。人不是先有标准再去找,人是一边找一边长出标准。

那么,一个满意化的决定会不会比一个最优化的决定差很多?——这正是那把剪刀要回答的问题。答案取决于环境的形状:如果好选项在这个环境里比较稠密,随便找几个就够;如果它们极其稀疏,门槛就会被迫一路下调。同一套办法,换个环境,可以从聪明变成愚蠢,也可以从愚蠢变成聪明——而那个人一点没变。

这也是为什么西蒙晚年花了很大力气去讲"环境"那片刀刃。他 1971 年写下过一句被引用了半个世纪的话:"信息消耗的是接收者的注意力。因此,信息的富足制造出注意力的贫困。"——今天所有关于信息过载的讨论,源头都在这里。而它其实就是同一个模型的另一种说法:当环境这一片刀刃变得极其庞杂时,算力那一片刀刃的稀缺就会被放大成主要矛盾。

四 后人之论 LATER INTERPRETATIONS
詹姆斯·马奇 1958/1963 · 公司不是在优化,公司是在灭火

马奇 1958 年与西蒙合著《组织》,1963 年与理查德·塞尔特合著《企业的行为理论》——把满意化从一个人搬进了一整家公司。三个概念至今在用:

期望水平(aspiration level):公司为销售额、利润、库存各定一个"够好"的数。问题驱动的搜索(problemistic search):业绩在期望水平之上时,公司几乎什么也不改;只有掉到线下,才开始找新办法,而且先在离现状最近的地方找。组织冗余(organizational slack):好年景里悄悄攒下的浪费——多发的股息、定低了的价格、多雇的人——在坏年景被吐出来当缓冲。

这一卡解释了一件让所有战略顾问头疼的事:大公司往往要等到出问题之后才开始创新,而且第一反应总是"在原来的东西上改一改"。这不是懒惰或短视,这是问题驱动的搜索在正常工作。马奇后来(1991)把这条线推向"探索与利用"的取舍——公司总是不够探索,因为探索的收益远、方差大,而期望水平只盯着眼前那条线。

阿里尔·鲁宾斯坦 1998 · 这个词只说了人不是什么

鲁宾斯坦是博弈论学者,也是这套学问最诚实的形式化者。他在《为有限理性建模》里下了一个至今没人能反驳的判断:"有限理性"这个说法几乎不含内容,因为它只定义了否定——它说人不是完全理性的,却没有说人是什么。

他给出的出路是:一个合格的有限理性模型必须明写决策的过程(procedure)——搜索什么、按什么顺序、什么时候停、记住多少——而不是只写出结果然后倒推一个偏好。不写过程的"有限理性",只是给"我没解释"换了个学名。

而他对自己这条路同样诚实:书里坦言这个纲领推进得比预期慢得多。原因不难理解——完全理性只有一种,不完全理性有无穷多种。把"人是怎么想的"写成数学,比把"人应该怎么想"写成数学难上好几个数量级。三十年过去,这仍是这门学问最大的一块空地。

约翰·康利斯克 1996 · 无限回归:那个至今没被堵上的洞

康利斯克 1996 年在《经济学文献杂志》上写了一篇综述,把"经济学为什么必须认真对待有限理性"整理成几条论证。其中最锋利的一条,是对一种流行的修补方式的致命一击。

那种修补是这样的:好吧,人不是无成本地思考,那我们就把"思考的成本"也放进模型,让他在"考虑搜索成本之后"做最优化。——看上去两全其美,实则不然。因为"我该花多少力气来做这个决定"本身就是一个决定,它同样需要算;而"我该花多少力气来算'我该花多少力气'"又是一个决定。这条链子没有底。

这就是有名的无限回归问题。它的意义不在于证明谁对谁错,而在于说明一件事:你没办法靠"把成本也优化进去"来把有限理性收编回优化框架——那个框架必须在某个地方停下来,而它一停下来,停的那一下就是满意化。西蒙本人一生反对这类收编,理由正是这个。

泽维尔·加贝 2014 · 现代主流的一次重新收编

然而收编从未停止,而且做得越来越漂亮。加贝 2014 年提出稀疏性模型:人面对的问题有几十个维度,而他只会"睁开眼睛"看其中很少几个,其余的一律按默认值处理。这个"只关注少数维度"的倾向可以被写成一个惩罚项,装进标准的最优化框架里,然后照常求解、照常做比较静态、照常算福利。

它的成效是真的:这类模型能解释一大批顽固的异常——人为什么忽略不显眼的税费、为什么对运费不敏感、为什么在复杂合同里只盯着那个最大的数字。而它付出的代价,正是康利斯克那一条:模型里的人仍然是一个优化器,只是被扣了一笔注意力的税。

于是七十年过去,这场争论回到了原点:有限理性到底是"带约束的最优化",还是一种形状完全不同的程序?加贝这一派认为前者足够好用;西蒙、鲁宾斯坦这一派坚持后者才是真的。两边都还在场上,而且都拿得出成果——这是本篇必须原样交代的现状,任何一边的胜利宣告都为时过早。

五 案例 CASE STUDIES
案例 01 象棋:一个算不完的数 卡内基理工 · 1955–1960s

西蒙与纽厄尔造出"逻辑理论家"之后,很快转向国际象棋——因为它是一个规则完全清楚、信息完全公开、没有任何运气成分的问题。如果连它都不能被"最优化",那么真实世界里就更不必谈。

而它确实不能。每一步平均有三十来种合法走法,一盘棋要走几十步,把这棵树展开,节点数量远远超过宇宙中原子的总数。没有任何机器、任何生物、任何未来的技术能把它穷举完。

更有意思的是人类大师。他们并不比业余选手多算多少步——很多时候还更少。他们的优势在于,摆在眼前的那几十种合法走法里,绝大多数根本没有进入过他们的意识。模式识别先把搜索空间砍到极少数几条,然后才在这几条上往下算。

这个案例把整门学问的立场翻了个面:问题不是"人比不过完全理性的机器",而是"完全理性从来就不是一个可执行的程序"。棋手不是一台打了折的穷举机,他是一台形状完全不同的机器——他的本事不在算得深,而在一开始就不去看那些不值得看的东西。此后半个世纪的搜索算法(剪枝、启发式评估、蒙特卡洛采样),做的全是同一件事:想办法不看。
案例 02 公司只在业绩掉下去之后才开始找办法 塞尔特与马奇 · 1963

塞尔特和马奇没有假设公司在最大化利润,他们去看公司实际怎么定价、怎么排产、怎么分预算。结论是:公司在绝大多数时间里什么也不优化,它只是在执行一套"上次管用的办法"。

真正触发变化的只有一件事:某个指标掉到了期望水平之下。此时搜索启动,而且是"问题驱动"的——只针对那个出问题的指标,且从离现状最近的地方开始找:先调价格,不行再改渠道,再不行才动产品。

这条模型的预测力比它看上去强得多,因为它同时解释了两件相反的事:顺境里为什么改不动(没有任何指标掉到线下,搜索根本不会启动),和逆境里为什么总是先做那些最保守的动作(局部搜索先从最近的地方开始)。凡是你想推动一件"大家都同意但就是没人动"的事,先别怪执行力——去看看它对应的哪个指标还没有掉到线下。在一个还没痛的组织里谈变革,等于在跟一台没有被触发的机器讲道理。
案例 03 找到更好工作的人,反而更不高兴 Iyengar, Wells & Schwartz · 2006

研究者跟踪了一批正在求职的应届毕业生,先用量表把他们分成"最大化倾向高"与"低"两组,再看结果。

客观结果站在最大化者这边:他们拿到的起薪比另一组高出约 20%。主观感受则整个反了过来——他们对自己拿到的工作明显更不满意,整个求职过程中的负面情绪也更多:更焦虑、更多比较、更多后悔、更常想着那些没去成的公司。论文的标题就是结论:《做得更好,感觉更糟》。

这是"满意化"最反直觉也最实在的一层收益:它省下的不只是搜索的力气,还有对结果的评价。最大化者永远背着一个无法卸下的负担——他知道自己没有检验完所有选项,所以那个"可能更好的"永远存在于想象里,并且永远赢过手里这个真实的。满意化的人从一开始就没有承诺要找到最好的,于是他也不欠自己这笔账。诚实注明:这个方向的发现相当稳固,但"最大化量表"本身受到过不少测量学质疑,见反例 ④。
案例 04 接飞球的人不解微分方程 凝视启发式 · 1990s 起

一个高飞球划着弧线过来,外野手怎么知道该跑到哪儿?"最优"的做法是:测出初速度、角度、风速、旋转与空气阻力,解出抛物线,算出落点,跑过去等着。没有任何球员这么干,而且这么干的人接不到球。

实际的做法极其简单,简单到可以写成一行:盯住球,跑动起来,调整速度,让你的仰视角保持不变。只要这个角度不变,你和球就会在某一点相遇。吉仁泽等人把这类规则叫凝视启发式,同类的还有狗接飞盘、飞行员避免相撞的判断。

这一条最该被记住的不是"简单规则也能成事",而是它为什么能成事:那条规则根本不需要风速、旋转和空气阻力这些参数——它把计算外包给了环境本身。球的真实轨迹已经把所有物理因素算过一遍了,你只需要读一个数。这就是剪刀那片"环境刀刃"的实际含义:一个好的启发式不是最优解的劣质近似,它是与某个特定环境严丝合缝的一把钥匙。换个环境,同一把钥匙立刻变成废铁——而这恰恰意味着,改环境常常比改人划算。
案例 05 37% 法则:一个数学上最优、实际上六成会失败的答案 秘书问题 · 最优停止理论

有一个漂亮的数学结果叫"秘书问题":候选人一个个来,你必须当场决定要或不要,拒绝了就不能回头。最优策略是——先看过前 37% 的人,一个都不要,只记住其中最好的那个;此后遇到第一个超过他的,立刻录用。

它经常被当成人生指南来引用。但很少有人念完后半句:这个策略选中"真正最好那个人"的概率,也只有约 37%。换句话说,这个数学上无可挑剔的最优解,有六成以上的概率彻底失败。而且它还要求你事先知道候选人的总数、要求你能把所有人严格排序、要求绝对不能回头。

这是"最优 vs 够好"最锋利的一次量化对照。那个 37% 的答案之所以看起来不近人情,是因为它优化的目标是"选中最好的那一个"——除此之外的一切结果,在它眼里都同样是失败,第二好和最差没有区别。而几乎没有人真的持有这种偏好:你想要的是一个不错的人,不是"最好的那一个,否则宁可要最差的"。把目标换成"选到前 10% 就算成功",最优策略立刻变形,而且变得温和得多。看到任何一个漂亮的最优解,先问它优化的是哪个目标——很多时候,为了让问题可解而被简化掉的那部分,恰恰是你真正在乎的东西。
六 反例与限制 CRITIQUE & LIMITS

这一课的麻烦几乎全部来自同一处:它把一个正确的观察,说成了一个几乎无法出错的框架。前两条批评来自这门学问内部,其中一条出自它最忠实的形式化者。

还有一条不算反例、但值得记住:这套东西真正结实的部分,是那条否定性的判断——完全最优化不是一种可执行的程序。这一条到今天没有被任何人推翻过,而且被计算复杂性理论从另一个方向反复确认。被反复攻击的,从来是"那么人到底在做什么"那一半。知道一个理论最硬的部分是哪一块,通常比记住它的结论更有用。

七 相关理论 CONNECTIONS
期望效用理论Expected Utility Theory
⚔ 被挑战的正统
冯·诺依曼与摩根斯坦那套公理化的"经济人",正是本篇的靶子。但要留意西蒙攻击的是哪一层:他不是说人的效用函数形状不对,而是说人根本没有在做最大化这件事。这一刀比后来所有的行为经济学都更深。
前景理论№043 Prospect Theory
⚠ 最该被切开的一对
两者常被一起装进"行为经济学"的筐里,其实走的是相反的路。№043 保留了"人在最大化某个函数"这个结构,只是把函数改成了带参照点、带损失厌恶的形状;有限理性质疑的是"有没有在最大化"这件事本身。一个换了发动机的型号,一个说这辆车根本不是那样开的。
满意化Satisficing
⟹ 核心程序
定门槛、逐个搜、越过即停、门槛随行情浮动。它是有限理性唯一真正可操作的那一部分,也是本篇第八节全部致用的落点。凡是谈"有限理性"却给不出门槛与停止规则的,多半没有在用它。
生态理性与快速节俭启发式Ecological Rationality
⟹ 直系后裔(环境那片刀刃)
吉仁泽一派把西蒙的剪刀往前推了一步:启发式不是最优解的劣质近似,它是与特定环境结构匹配的工具。"取最好的"、识别启发式、凝视启发式在合适的环境里能打平甚至打赢复杂模型。相关一面见 №023 里关于自然频率的那一段。
企业的行为理论A Behavioral Theory of the Firm
⟹ 组织化身
塞尔特与马奇 1963。期望水平、问题驱动的搜索、组织冗余、冲突的准解决。今天所有关于"绩效落后如何触发变革"的实证研究,源头都在这本书。
认知负荷理论№071 Cognitive Load Theory
⟸ 算力那片刀刃的实验室读数
№071 把"算力有限"从一个隐喻变成了一个可测的数字(工作记忆一次只装得下四个左右的组块)。两篇看的是同一件事的两头:本篇问"这么小的容量该怎么做决定",那篇问"这么小的容量该怎么被教会新东西"。案例 01 里的棋手,在两篇里各出现过一次,角度正好互补。
双重过程理论№062 Dual-Process Theory
↔ 心理层的实现
№062 里"类型一"的唯一定义特征,是它不占用工作记忆——那正是满意化在人脑里的实现方式。而"类型二"要做的那些解耦与推演,恰恰是算力那片刀刃最吃紧的地方。两篇合起来才完整:有限理性给出为什么必须有启发式,双重过程给出它们跑在哪一层。
自然选择№021 Darwin / Lamarck
⚖ 同族对照
最容易被忽略的一条平行:自然选择也不做全局最优化。它是局部爬山——只在当前形态的邻域里试,一旦"够用了"就不再动(№021)。人的眼睛有盲点、喉返神经绕一大圈,都是"满意化"留下的痕迹。一个由局部搜索造出来的大脑,做局部搜索式的决定,这件事本身也许并不奇怪。
八 致用 APPLICATION

下面第一、三条是这套程序的直接搬用,第二条是取舍原则,第四条来自剪刀的环境那一片,第五条是一个判断习惯。第六节的第五条对以下全部有效:满意化是有门槛的程序,不是"差不多就行"的许可证。

九 反观三问 THREE QUESTIONS
我最近拖了很久的那个决定,我的门槛到底是什么?——如果说不出来,那我拖着的原因也许不是选项不够好,而是我从来没定过"够好"。
我把最多的搜索力气花在了哪一类决定上?它们是可逆的还是不可逆的、高频的还是一次性的?这份分配,是我有意选的,还是就这么来的?
上一次我做得特别糟的那个决定,问题出在我这片刀刃(没想清楚),还是那片刀刃(环境本身在诱导我出错)?如果是后者,那我该改的是环境,而不是再下一次决心。
十 延伸阅读 FURTHER READING
← PREVIOUS №078 布莱克-斯科尔斯期权定价模型 HOME 百里路