LESSON 087 · PSYCHOLOGY

操作性条件反射与强化程式

Operant Conditioning & Schedules of Reinforcement · 让人停不下来的不是奖励有多大,是它什么时候来说不准
提出者
B. F. 斯金纳
年份
1938 · 1957
领域
心理 · 学习 · 行为
核心命题
行为被它的后果塑造
一 缘起 · 一只在箱子里乱撞的猫,和一台能一直记下去的机器 ORIGIN

一八九〇年代末,哥伦比亚大学的一位研究生把猫关进一只木箱,箱门由一根踏板控制,箱外放着鱼。猫先是抓、咬、挤、叫,乱撞一气;某一次偶然踩到踏板,门开了。再放进去,还是乱撞,但乱撞的时间短了一点。如此反复几十次之后,猫一进箱就直奔踏板。

爱德华·桑代克由此写下效果律:在同一情境中,那些跟随着令动物满意的事态的反应,会与该情境更牢固地联结起来;跟随着令动物不适的事态的反应,联结会被削弱。——这是心理学史上第一次有人用一句可检验的话,说明"学习"这件事究竟发生了什么。

但这句话里藏着一个当时没人觉得是问题的问题:"令动物满意的事态"是什么?你没法打开猫的脑袋去看它满不满意。你只能看到它按得更勤了,然后倒过来说,那说明它满意。

三十多年后,一个哈佛的研究生盯上了这个洞。他做的那件事,今天看起来简单得像一次装修:他不再把动物一次次"放进去、拿出来",而是造了一只可以让动物随时按、按了随时有结果、能连续跑几百小时的箱子;然后在箱子旁边接上一支笔和一卷匀速走动的纸——按一下,笔往上抬一格。

于是"学习"第一次不再是一串轶事,而是一条可以摊在桌上、用尺子量的曲线。

那卷纸叫累积记录器,那只箱子后来被别人叫作斯金纳箱(他本人不喜欢这个名字)。而伯尔赫斯·弗雷德里克·斯金纳(1904–1990)在一九三八年的《有机体的行为》里划下的那一刀,才是这一整篇的起点:

他把行为分成两类。一类是被前面的刺激"引出来"的——光一强瞳孔就缩,酸一入口唾液就分泌,巴甫洛夫的狗听见铃就流口水。这一类他叫应答性行为。另一类不是被谁引出来的,它是动物"发出来"的——鸽子在笼子里走来走去,孩子在地上乱爬,一个人试着换个说法再讲一遍。它没有一个可指认的诱因,但它有后果,而后果会回过头来改变它以后出现的频率。这一类他叫操作性行为,因为它是在对环境进行操作。

这一刀的分量在于它把因果的箭头掉了个头:巴甫洛夫那一路问的是"什么在前面推它",斯金纳这一路问的是"什么在后面拉它"。心理学此前一直在找行为的原因,斯金纳说,对绝大多数有意思的行为而言,原因在它后面而不在它前面。

二 原典 THE PRIMARY TEXT
SKINNER, 1938 ·《有机体的行为》· 两类行为,与一个只能由效果来定义的东西
行为可分为两类。应答性行为由一个可以指认的刺激引发,刺激与反应之间的关系是"引出"。操作性行为不由任何已知刺激引发,它由有机体自身发出;它与环境的关系不在它的前面,而在它的后面——在它所产生的后果里。

如果一个操作性行为之后紧跟着某种事件,而该行为此后出现的频率上升,那么这个事件就是一个强化物;这个过程叫作强化。

请注意这个定义的形式:强化物不是由"它是不是好东西"来定义的,而是由"它对行为频率做了什么"来定义的。一样东西是不是强化物,只能靠观察行为的变化来判断,不能靠它看起来令人愉快来判断。

因此,在这套语言里,问"他为什么这么做"不再有意义;能问、并且能答的问题只有一个:这个行为过去每次出现之后,发生了什么。
B. F. Skinner《The Behavior of Organisms: An Experimental Analysis》,Appleton-Century, 1938。以上为核心论证的中译与整理,非逐字迻录;"强化物由其效果定义"这一操作性定义,在其《Science and Human Behavior》(Macmillan, 1953)中有更完整的陈述。这个定义形式招致了"循环论证"的长期指控,见第六节④。
FERSTER & SKINNER, 1957 ·《强化程式》· 四种给法,四副面孔
决定行为形态的,往往不是强化物的大小,而是它按什么规则给出。四种基本程式:

定比率(FR)——每做满 n 次给一次。反应又快又猛,但每拿到一次强化之后会停顿一下,然后重新提速。
变比率(VR)——平均每 n 次给一次,但具体第几次说不准。反应率最高,最稳定,而且极难消退。
定时距(FI)——每过 t 时间之后的第一次反应给一次。行为呈扇贝形:刚拿到强化后几乎不动,越接近时间点越急。
变时距(VI)——平均每 t 时间给一次,具体时刻说不准。反应平稳、中速、持久。

同一只鸽子,同样的谷子,只是换一种给法,就会换上一副完全不同的行为面貌。
C. B. Ferster & B. F. Skinner《Schedules of Reinforcement》,Appleton-Century-Crofts, 1957。这是一本近七百页、几乎全由累积记录曲线构成的书,凝结了五年间数以亿计的反应记录。以上为四种基本程式及其典型行为特征的概括,非逐字迻录。
三 释义 · 你以为你在奖励,其实你在编程 PLAIN MEANING

把这套东西讲清楚,只需要三句话。

第一句:行为被它的后果塑造。一个动作之后如果跟着某种结果,而这个动作此后出现得更频繁,那么这个结果就在强化它。——注意这句话里没有"因为它喜欢",也没有"因为他想要"。它只说了两件可观察的事:做了什么,之后发生了什么,以及后来做得多了还是少了。

第二句,也是最反直觉的一句:强化物由效果定义,不由你的判断定义。

这句话的实际杀伤力,要举例才看得清:

一个在课堂上捣乱的孩子,每次捣乱都被老师当众训一顿。训斥当然不是奖励——除非你去数一数:这个孩子的捣乱是变少了,还是变多了?如果变多了,那么无论那顿训斥听起来多么严厉,在这个孩子这里,它就是强化物。他要的可能只是那三十秒里全班的目光。

反过来同样成立:一个下属提出了一个不太成熟的想法,你耐心地、详细地、当着大家的面把它的问题一条条讲清楚。你以为你在指导。三个月后他不再提想法了——那么在功能上,你做的是惩罚。

你以为的奖励未必在强化,你以为的惩罚可能正在强化。唯一的判据是频率,不是意图。

第三句,是这一篇真正值钱的地方:起决定作用的往往不是强化物的大小,是它到来的方式。

先记住两个可以随身带走的事实。其一,每次都给(连续强化),学得最快,也消失得最快——一旦停止,行为很快就没了。其二,不定期地给、平均若干次给一次、但具体哪一次说不准(变比率),学得慢一点,却产出最高、最持久、几乎无法消退。

为什么?因为在变比率程式下,"这次没有"从来不构成"以后也没有"的证据。动物——以及人——在这种程式里学到的恰恰是:没中,说明下一次更接近了。

这就是老虎机的数学,也是下拉刷新的数学,也是抽卡的数学。它们没有一个是靠"奖励很大"起作用的;它们靠的是"说不准"。

还有两个配套现象,第八节会反复用到。其一是消退爆发:当一个长期被强化的行为忽然不再被强化,它不会立刻消失,而是先变得更频繁、更用力、更激烈,然后才衰减。其二是部分强化消退效应:断断续续被强化过的行为,比一直被强化的行为更难消退。——把这两条合起来,你就得到了一条关于人际关系的冷知识:一个你偶尔才让步一次的要求,会比一个你每次都答应的要求,纠缠得久得多。

四 后人之论 LATER INTERPRETATIONS
爱德华·桑代克 1898 / 1911 · 效果律,与它留下的那个洞

桑代克的迷箱实验是这条线索的起点,而他画的那张学习曲线(逃出所需时间随试验次数下降)几乎是心理学第一张真正意义上的数据图。他的结论——效果律——至今没有被推翻。

但斯金纳做的那一步改动,比它看起来重要得多:桑代克的猫是被"一次一次放进箱子"的,每一次算一个试验;斯金纳的鸽子从头到尾待在箱子里,想啄就啄。前者能测的是"这一次花了多久",后者能测的是"每分钟啄多少下"。

一个学科能问什么问题,常常取决于它能测什么量。从"试验次数"换成"反应速率",这个换算把学习研究从一堆离散的故事,变成了一条连续的、可以被程式实时调制的曲线——此后所有关于强化程式的发现,都建立在这一次单位的更换上。这一条与 №083 案例 02 是同一个教益的两次出现。

查尔斯·费斯特与斯金纳 1957 · 一本行为的物候图谱

《强化程式》这本书几乎不讲理论。它是近七百页的曲线,五年的连续记录,数以亿计的反应。它要证明的只有一件事:改变强化到来的规则,不改变强化本身,行为的形状就会整个变形。

其中最该被搬出实验室的是定时距程式的"扇贝形":只有到点才给的话,动物在刚拿到强化之后几乎完全不动,然后随着时间点临近越来越急,在最后一刻达到峰值。

这条曲线的形状,和期末考试前的图书馆、季度末最后一周的销售业绩、截止日前一晚的进度条,是同一条曲线。它不是懒惰,也不是自制力问题——它是"只在固定时点结算"这条规则的必然产物。改规则比改决心有用得多。

(费斯特是这本书的第一作者;斯金纳作为原典作者,本篇不另立卡片。)

理查德·赫恩斯坦 1961 · 匹配律:行为不是被选择的,是被分配的

赫恩斯坦给鸽子两个键,两个键各挂一套不同频率的强化程式,然后问了一个此前没人问的问题:它会不会干脆只啄回报高的那个?

答案是不会。鸽子把反应按比例分给两个键,而这个比例几乎精确地匹配两个键的强化比例——回报是三比一,反应就大致是三比一。这就是匹配律。

这一步把研究对象从"一个行为如何被塑造"换成了"有限的时间如何在多个行为之间被分配",而后者才是真实生活的形状。它顺带解释了一件让所有讲效率的人头疼的事:人并不会把百分之百的精力投给回报最高的那件事,而是按各自的回报率去摊。

赫恩斯坦后来把这条线推向自我控制的研究,直接连着 №044:当"小而快"的回报和"大而慢"的回报同时摆在那里,行为按什么比例分配,是可以被写成方程的。(他晚年另有一部涉及智力与社会分层的合著引发了长期而严厉的争议,与本篇内容无关,此处不展开。)

爱德华·托尔曼 1930 / 1948 · 学习与表现,是两件事

这是对整套框架最重要的一次正面攻击,而且它比斯金纳的书还早。

托尔曼与洪齐克让三组老鼠跑同一个迷宫:第一组每次到终点都有食物,成绩稳步上升;第二组从来没有食物,成绩几乎不动;第三组前十天没有食物,第十一天开始给。第三组的成绩在给食的第二天几乎垂直下落到第一组的水平,甚至更好。

结论无可回避:那十天里它们一直在学,只是没有表现出来。托尔曼称之为潜伏学习,并在 1948 年那篇著名的《老鼠与人的认知地图》里给出解释:动物在脑子里建的不是一串"在这个岔口向左"的动作,而是一张地图。

这一刀捅在最薄的地方:强化影响的可能主要是"做不做",而不是"会不会"。而行为主义把"我们只测得到行为"这条方法论纪律,逐渐当成了"行为之外没有别的东西"的本体论主张——前者是严谨,后者是越界。此后半个世纪心理学的主流走向,基本是沿着托尔曼这条线的。

五 案例 CASE STUDIES
案例 01 一支笔、一卷纸,和一门学问的成年 1930 年代 · 哈佛

累积记录器的原理简单到近乎可笑:纸卷匀速走动,动物每按一次键,笔就往上抬一小格。于是行为频率变成了曲线的斜率——按得快,线就陡;停下来,线就平。

这台机器带来的东西,是当时任何理论都给不出来的:你可以让一只鸽子连续跑几十上百个小时,而整个过程被完整、连续、无需人守着地记录下来。四种强化程式各自的行为指纹——定比率的停顿、定时距的扇贝、变比率那条几乎笔直的斜线——全都是先在纸上被"看见",然后才被解释的。

一门学问变成科学的时刻,往往不是有人提出了一个更好的理论,而是有人造出了一台能持续读数的仪器。
——斯金纳的哲学立场今天几乎无人再持(第六节④),但他留下的这套方法至今在用。可搬走的一条:当你觉得某件事"说不清、只能凭感觉"时,值得花的力气常常不是继续论证,而是去想办法把它变成一个能被连续记录的数。
同一个教益在 №083(把程序当成可运行的理论)和 №086 案例 02(用距离去代表专用性)里各出现过一次。
案例 02 迷信的鸽子 1948 · 斯金纳

斯金纳把八只饥饿的鸽子分别放进箱子,然后做了一件极简单的事:每隔十五秒自动落一次食,与鸽子当时在做什么完全无关。

几天之后,他报告说八只里有六只长出了各自古怪而固定的动作——有的绕着箱子逆时针转圈,有的反复把头往上方一个角落顶,有的做出像是要托起什么东西的抬头动作。他的解释是"偶然强化":食物落下的那一刻,鸽子碰巧在做什么,什么就被强化了一点点;下次它更可能在做那个动作,于是更可能又碰上一次落食。

他随即把它推到人身上:保龄球手球出手之后仍在扭动身体,赌徒吹骰子,考试穿同一双袜子。"这些仪式并不真的改变结果,正如鸽子的转圈并不能召来食物。"

这是心理学被引用得最多的实验之一,几乎每本教科书都有它。——而第六节③会告诉你,它很可能测到的根本不是斯金纳以为的那件事。
——请把这条案例和那条反例连起来读,这是本篇最值得花的十分钟:一个漂亮、好懂、可迁移到人类身上的解释,如何在二十三年后被一次更细致的重做整个改写,而教科书至今还在讲旧版本。
案例 03 变比率程式:从鸽子笼到你口袋里 1957 起 · 至今

《强化程式》里那条最陡最直、几乎不见停顿的曲线,来自变比率程式。而世界上把这条曲线利用得最彻底的行业,比心理学家更早知道它管用:老虎机的赔付逻辑,就是一台标准的变比率强化装置。

今天它的变体到处都是:下拉刷新(拉一下,可能有新东西,也可能没有)、通知红点(点开可能是重要的,也可能什么都不是)、抽卡与开箱(平均若干抽出一个,具体哪一抽说不准)、以及每隔一会儿就要看一眼的信息流。

请注意它们的共同点不是奖励丰厚——绝大多数时候刷新出来的东西毫无价值。共同点是"说不准"。

让人停不下来的不是奖励的大小,是它到来时间的不可预测。
——这解释了一个常见的困惑:为什么明知没意思还是会一遍遍刷。因为在变比率程式下,"这次什么也没有"恰恰是继续下去的理由,而不是停下来的理由。
也请注意这条案例的另一面:这不是某个人意志薄弱,这是一套被设计过的数学。而知道它是什么,并不会让你免疫(第六节⑤)——能改变行为的是改掉程式本身,而不是知道程式的名字。相关:№044、№005。
案例 04 代币经济:走出实验室之后 1968 · 艾隆与阿兹林

艾隆与阿兹林在一所精神病院里做了一件此前没人做过的事:把强化程式变成一套可运行的制度。病人完成某些日常活动(自理、参与劳动、按时作息)即获得代币,代币可以兑换各种实际的东西与特权。他们在 1968 年把这套做法写成了《代币经济》。

这条线索一直延续到今天。它在物质使用障碍的治疗中被称为"列联管理"——按约定给出可兑换的奖励,用以强化"这次检测是阴性"这一具体行为——并且是该领域中证据最强的心理社会干预之一。它也是应用行为分析、许多学校课堂管理制度和习惯类应用积分体系的共同祖先。

但这条案例必须两面都写。其一,撤掉代币之后,行为常常回落——它是一套外部支架,不是一次内在转化。其二,把"可兑换的基本便利"交到机构手里,本身就是一种极大的权力,而这套技术在历史上确实被用于对住院者、囚犯、儿童的高度控制。
——一个方法的有效性与它的正当性,是两个完全独立的判断;而"它管用"从来不构成"应该这么用"的理由。第六节⑤讲的正是这件事。
案例 05 鸽子导弹 1943 · 1948–1953 · Project Pigeon / ORCON

二战期间,斯金纳提出了一个在当时听起来像玩笑的方案:把训练过的鸽子装进滑翔炸弹的头部,让它啄屏幕上目标的影像;啄的位置偏左,弹体就往左修正。三只鸽子并联,以多数决降低单只出错的影响。

训练是成功的:鸽子能在颠簸、噪声与加速度下持续准确地啄住目标。项目在 1944 年被中止;战后海军研究实验室又以"ORCON"(取自 organic control,有机控制)之名重启,一直做到 1953 年。斯金纳在 1960 年把整件事写成了一篇论文,标题就叫《鹈鹕里的鸽子》。

它始终没有被采用。理由并非它不管用。

当一套方法的解释力被展示到荒诞的程度时,人们拒绝它的理由,往往不是它不管用。
——这也是斯金纳一生的缩影:他真诚地相信这套技术可以用来设计更好的学校、更好的监狱、更好的社会(《瓦尔登湖第二》正是这样一本小说),而世界一次次拒绝了他;理由一半是技术上的,另一半是"被设计"这件事本身让人极不舒服。
而这份不舒服本身值得被认真对待——它不是无知,它是第六节⑤那条伦理直觉的雏形。
六 反例与限制 CRITIQUE & LIMITS

这一节的分量在于它的来源:下面前三条批评里,有两条来自斯金纳自己的学生和自己的实验范式,而它们各自否掉了这套理论的一条地基假设。请先记住一个分寸——没有一条反例否认"后果会改变行为"这件事,它们否认的是它的普适性、它的机制解释、以及它可以被推到多远。

最后补一条方向相反的,免得这一节读成清算:这套东西最结实的部分,从来不是它的哲学(激进行为主义作为一种关于心智的立场,今天几乎无人再持),而是它的方法——它把"后果如何改变行为"变成了可测量、可复现、可工程化的东西。今天的强化学习、行为经济学的助推设计、循证的行为干预、应用行为分析,全都站在这套方法上;而斯金纳本人在 1981 年那篇《由后果决定的选择》里,把它与自然选择、文化演化并列成三层同构的选择过程——那是他留下的最开阔的一个想法。

七 相关理论 CONNECTIONS
效果律Law of Effect · 1898
⟸ 直接上游
桑代克的迷箱与效果律是整条线索的起点。斯金纳改掉的不是结论,是测量单位:从"这一次花了多久"换成"每分钟多少下"。而正是这次更换,让"强化程式"这个此前不存在的东西变得可见——你没法在一次一次的试验里看见扇贝形。
强化学习Reinforcement Learning
⟹ 直系后裔,也是它最大的一次胜利
今天机器学习里的强化学习,几乎原样继承了这套词汇:智能体、动作、奖励、试错、策略。而它给出了斯金纳给不出的东西——奖励如何在时间上向前传递的具体机制(时序差分),以及"探索还是利用"这道取舍的数学形式。
与 №083 合看才完整:那一篇讲符号与搜索,这一篇讲试错与奖励;这是人工智能最初分出的两条路,而今天最强的系统里两者各占一半。
自我决定论 №049Self-Determination Theory · 1985
⚠ 最该被切开的对照
№049 与本篇看的是同一个动作的两侧:本篇问"这个行为的后果是什么",那一篇问"这个人为什么想做"。两者的冲突点非常具体——对本来就有内在动机的行为施加外部奖励,可能把"我想做"换成"我为奖励做",而奖励一停,原来的热情也一并消失。
合起来的用法:用强化去启动一个还不存在的行为,用自主感去维持一个已经存在的行为。
双曲贴现 №044Hyperbolic Discounting
⟷ 同一批实验的两种读法
赫恩斯坦的匹配律与双曲贴现(№044)在数学上高度相关:当"小而快"与"大而慢"同时在场,行为按回报率分配,而回报率里包含了时间这一项。这就是为什么自制力问题常常不是意志问题——它是两个程式在同一段时间里争夺分配。
古德哈特定律 №005Goodhart's Law
⚠ 误用警示,几乎是同一句话
你强化什么,就会得到什么——包括你根本没打算要的那个版本。按代码行数付钱得到冗长的代码,按结案率考核得到不立案,按点击量计酬得到标题党。(№005)
本篇为古德哈特提供了机制层的解释:指标一旦成为强化物,被塑造的就是"让指标上升的行为",而不是那个指标本来想代表的东西。
自然选择 №021Natural Selection
⟷ 同构,而且是斯金纳自己写下的
1981 年斯金纳在《科学》上发表《由后果决定的选择》,主张有三层同构的选择过程:自然选择塑造物种,强化塑造个体的行为,而文化实践的存续与传播构成第三层。三者共用一个逻辑——变异先随机产生,后果负责保留。(№021)
双重继承理论 №066Dual Inheritance Theory
⟹ 那第三层的展开
斯金纳 1981 年那篇文章的第三层——文化实践因其后果而存续——正是 №066 处理的问题。而两篇共享同一条最冷的推论:一个做法能不能传下去,与它对携带者好不好,是两件不同的事。
遗忘曲线与期望的困难 №076Forgetting Curve · Desirable Difficulties
⚖ 学习的另一半
本篇管的是"做不做",№076 管的是"记不记得住"。两者合起来才是完整的学习问题:强化决定一个行为会不会被做出来,而提取练习与间隔决定它会不会被留下来。
托尔曼那条批评(第六节①)正卡在两者中间:会了但不做,和做了但没记住,是两种完全不同的失败,处方也完全不同。
八 致用 APPLICATION

先标明分寸:第一、二、四条有直接的实验依据(强化物的功能定义、程式效应、消退爆发),第三条是定时距程式的现实版,第五条是边界提醒。第六节②对以下全部有效——人不是白纸,任何"只要设对奖励就能塑造出任何行为"的说法都超出了这套理论的能力。

九 反观三问 THREE QUESTIONS
我最想改掉的那个行为——别人的,或者我自己的——它每次出现之后,实际得到了什么?如果它还在,说明有什么东西一直在强化它;那样东西是什么,我说得出来吗?
我最停不下来的那件事,它的回报是"每次都有",还是"说不准什么时候来"?如果是后者,那我对抗的不是自己的意志力,是一套被设计过的数学——而我在改的是决心,还是程式?
我用来激励别人(或者自己)的那些奖励里,有没有一件是在为本来就愿意做的事付钱?如果明天把它撤掉,那个行为还在吗?
十 延伸阅读 FURTHER READING
← PREVIOUS №086 交易成本与企业的性质 HOME 百里路