二十世纪中叶的经济学里住着一个人。他知道所有可选方案,知道每个方案的全部后果,能给这些后果排出一张完整且一致的偏好表,然后挑出效用最大的那一个。这个人叫"经济人",他不吃饭不睡觉也不犯错,而整座大厦建在他身上。
赫伯特·西蒙(1916–2001)不是从经济学系走进来的。他年轻时研究市政管理——观察真实的官员如何编预算、如何决定该修哪条路。他看到的东西和课本上那个人毫无关系:没有人列得出全部方案,没有人算得清全部后果,也没有人有那张完整的偏好表。他们查几份材料,问几个熟人,找到一个"看上去说得过去"的办法,然后就报上去了。
1947 年他把这些观察写成《行政行为》。八年后,他在《经济学季刊》上把它变成了一个可以和经济学正面对话的模型:《理性选择的行为模型》(1955)。次年在《心理学评论》上,他给这套做法起了名字——satisficing,把 satisfy(满足)和 suffice(足够)拼在一起,也借用了一个英格兰北部方言里"满足"的旧词。中文一般译作满意化。
这里有一处最容易被读反,值得先说:西蒙从来没有说人"不够理性"。他说的是更狠的一句——最优化本身不是一种可以被执行的程序。不是人算得慢,是那个题目根本不存在解法。国际象棋的合法对局数量远超宇宙中的原子总数,穷举不是"暂时做不到",是永远做不到;而下棋还只是一个规则完全清楚、信息完全公开的玩具问题。真实世界比它难得多。
西蒙后来在卡内基梅隆度过大半生。1956 年他与艾伦·纽厄尔、克利夫·肖做出"逻辑理论家"——公认最早的人工智能程序之一,能证明《数学原理》里的定理。1975 年他与纽厄尔共获图灵奖,1978 年独得诺贝尔经济学奖。同时拿下这两个奖的,至今只有他一个人。而这两件事其实是同一件事:他一辈子都在问"一个算力有限的东西,怎样才能做出还不错的决定"——不管那东西是人、是组织,还是机器。
这一课有两块地基。第一块是 1955 年那次替换:把"最优"换成"够好"。
第二块地基晚了三十五年才被他自己说到最漂亮。它只有一句话,却把"人到底理不理性"这个问题整个改写了。
西蒙自己用过一个比喻,比后来所有的转述都清楚。
最优化,是要在这堆干草里找出最锋利的那一根针——
为此你必须把整堆草翻完,一根不落。
满意化,是要找出一根足够缝好这件衣服的针——
找到了就走人,剩下的草你根本不必碰。
请注意这两件事的差别不在"努力程度",而在问题的形状。第一个任务要求你把搜索进行到底,因为在你翻完最后一根草之前,你无法确定手里这根是不是最锋利的;它的成本不取决于你多快找到好针,而取决于草堆有多大。第二个任务的成本只取决于运气和门槛:找到就停。
于是满意化不是"优化的打折版",它是一套形状完全不同的程序,只有四步:
第四步是这套东西最贴近真实的地方,也是最容易被忽略的地方。它意味着"够好"从来不是一个固定的标准,而是一个跟着环境浮动的读数。房子看了三十套还没有满意的,你的"满意"会自己往下走;面试第一个人就惊为天人,你后面的门槛会自己往上抬。人不是先有标准再去找,人是一边找一边长出标准。
那么,一个满意化的决定会不会比一个最优化的决定差很多?——这正是那把剪刀要回答的问题。答案取决于环境的形状:如果好选项在这个环境里比较稠密,随便找几个就够;如果它们极其稀疏,门槛就会被迫一路下调。同一套办法,换个环境,可以从聪明变成愚蠢,也可以从愚蠢变成聪明——而那个人一点没变。
这也是为什么西蒙晚年花了很大力气去讲"环境"那片刀刃。他 1971 年写下过一句被引用了半个世纪的话:"信息消耗的是接收者的注意力。因此,信息的富足制造出注意力的贫困。"——今天所有关于信息过载的讨论,源头都在这里。而它其实就是同一个模型的另一种说法:当环境这一片刀刃变得极其庞杂时,算力那一片刀刃的稀缺就会被放大成主要矛盾。
西蒙与纽厄尔造出"逻辑理论家"之后,很快转向国际象棋——因为它是一个规则完全清楚、信息完全公开、没有任何运气成分的问题。如果连它都不能被"最优化",那么真实世界里就更不必谈。
而它确实不能。每一步平均有三十来种合法走法,一盘棋要走几十步,把这棵树展开,节点数量远远超过宇宙中原子的总数。没有任何机器、任何生物、任何未来的技术能把它穷举完。
更有意思的是人类大师。他们并不比业余选手多算多少步——很多时候还更少。他们的优势在于,摆在眼前的那几十种合法走法里,绝大多数根本没有进入过他们的意识。模式识别先把搜索空间砍到极少数几条,然后才在这几条上往下算。
塞尔特和马奇没有假设公司在最大化利润,他们去看公司实际怎么定价、怎么排产、怎么分预算。结论是:公司在绝大多数时间里什么也不优化,它只是在执行一套"上次管用的办法"。
真正触发变化的只有一件事:某个指标掉到了期望水平之下。此时搜索启动,而且是"问题驱动"的——只针对那个出问题的指标,且从离现状最近的地方开始找:先调价格,不行再改渠道,再不行才动产品。
研究者跟踪了一批正在求职的应届毕业生,先用量表把他们分成"最大化倾向高"与"低"两组,再看结果。
客观结果站在最大化者这边:他们拿到的起薪比另一组高出约 20%。主观感受则整个反了过来——他们对自己拿到的工作明显更不满意,整个求职过程中的负面情绪也更多:更焦虑、更多比较、更多后悔、更常想着那些没去成的公司。论文的标题就是结论:《做得更好,感觉更糟》。
一个高飞球划着弧线过来,外野手怎么知道该跑到哪儿?"最优"的做法是:测出初速度、角度、风速、旋转与空气阻力,解出抛物线,算出落点,跑过去等着。没有任何球员这么干,而且这么干的人接不到球。
实际的做法极其简单,简单到可以写成一行:盯住球,跑动起来,调整速度,让你的仰视角保持不变。只要这个角度不变,你和球就会在某一点相遇。吉仁泽等人把这类规则叫凝视启发式,同类的还有狗接飞盘、飞行员避免相撞的判断。
有一个漂亮的数学结果叫"秘书问题":候选人一个个来,你必须当场决定要或不要,拒绝了就不能回头。最优策略是——先看过前 37% 的人,一个都不要,只记住其中最好的那个;此后遇到第一个超过他的,立刻录用。
它经常被当成人生指南来引用。但很少有人念完后半句:这个策略选中"真正最好那个人"的概率,也只有约 37%。换句话说,这个数学上无可挑剔的最优解,有六成以上的概率彻底失败。而且它还要求你事先知道候选人的总数、要求你能把所有人严格排序、要求绝对不能回头。
这一课的麻烦几乎全部来自同一处:它把一个正确的观察,说成了一个几乎无法出错的框架。前两条批评来自这门学问内部,其中一条出自它最忠实的形式化者。
还有一条不算反例、但值得记住:这套东西真正结实的部分,是那条否定性的判断——完全最优化不是一种可执行的程序。这一条到今天没有被任何人推翻过,而且被计算复杂性理论从另一个方向反复确认。被反复攻击的,从来是"那么人到底在做什么"那一半。知道一个理论最硬的部分是哪一块,通常比记住它的结论更有用。
下面第一、三条是这套程序的直接搬用,第二条是取舍原则,第四条来自剪刀的环境那一片,第五条是一个判断习惯。第六节的第五条对以下全部有效:满意化是有门槛的程序,不是"差不多就行"的许可证。
马奇 1958 年与西蒙合著《组织》,1963 年与理查德·塞尔特合著《企业的行为理论》——把满意化从一个人搬进了一整家公司。三个概念至今在用:
期望水平(aspiration level):公司为销售额、利润、库存各定一个"够好"的数。问题驱动的搜索(problemistic search):业绩在期望水平之上时,公司几乎什么也不改;只有掉到线下,才开始找新办法,而且先在离现状最近的地方找。组织冗余(organizational slack):好年景里悄悄攒下的浪费——多发的股息、定低了的价格、多雇的人——在坏年景被吐出来当缓冲。
这一卡解释了一件让所有战略顾问头疼的事:大公司往往要等到出问题之后才开始创新,而且第一反应总是"在原来的东西上改一改"。这不是懒惰或短视,这是问题驱动的搜索在正常工作。马奇后来(1991)把这条线推向"探索与利用"的取舍——公司总是不够探索,因为探索的收益远、方差大,而期望水平只盯着眼前那条线。
鲁宾斯坦是博弈论学者,也是这套学问最诚实的形式化者。他在《为有限理性建模》里下了一个至今没人能反驳的判断:"有限理性"这个说法几乎不含内容,因为它只定义了否定——它说人不是完全理性的,却没有说人是什么。
他给出的出路是:一个合格的有限理性模型必须明写决策的过程(procedure)——搜索什么、按什么顺序、什么时候停、记住多少——而不是只写出结果然后倒推一个偏好。不写过程的"有限理性",只是给"我没解释"换了个学名。
而他对自己这条路同样诚实:书里坦言这个纲领推进得比预期慢得多。原因不难理解——完全理性只有一种,不完全理性有无穷多种。把"人是怎么想的"写成数学,比把"人应该怎么想"写成数学难上好几个数量级。三十年过去,这仍是这门学问最大的一块空地。
康利斯克 1996 年在《经济学文献杂志》上写了一篇综述,把"经济学为什么必须认真对待有限理性"整理成几条论证。其中最锋利的一条,是对一种流行的修补方式的致命一击。
那种修补是这样的:好吧,人不是无成本地思考,那我们就把"思考的成本"也放进模型,让他在"考虑搜索成本之后"做最优化。——看上去两全其美,实则不然。因为"我该花多少力气来做这个决定"本身就是一个决定,它同样需要算;而"我该花多少力气来算'我该花多少力气'"又是一个决定。这条链子没有底。
这就是有名的无限回归问题。它的意义不在于证明谁对谁错,而在于说明一件事:你没办法靠"把成本也优化进去"来把有限理性收编回优化框架——那个框架必须在某个地方停下来,而它一停下来,停的那一下就是满意化。西蒙本人一生反对这类收编,理由正是这个。
然而收编从未停止,而且做得越来越漂亮。加贝 2014 年提出稀疏性模型:人面对的问题有几十个维度,而他只会"睁开眼睛"看其中很少几个,其余的一律按默认值处理。这个"只关注少数维度"的倾向可以被写成一个惩罚项,装进标准的最优化框架里,然后照常求解、照常做比较静态、照常算福利。
它的成效是真的:这类模型能解释一大批顽固的异常——人为什么忽略不显眼的税费、为什么对运费不敏感、为什么在复杂合同里只盯着那个最大的数字。而它付出的代价,正是康利斯克那一条:模型里的人仍然是一个优化器,只是被扣了一笔注意力的税。
于是七十年过去,这场争论回到了原点:有限理性到底是"带约束的最优化",还是一种形状完全不同的程序?加贝这一派认为前者足够好用;西蒙、鲁宾斯坦这一派坚持后者才是真的。两边都还在场上,而且都拿得出成果——这是本篇必须原样交代的现状,任何一边的胜利宣告都为时过早。