LESSON 087 · PSYCHOLOGY
操作性条件反射与强化程式
Operant Conditioning & Schedules of Reinforcement · 让人停不下来的不是奖励有多大,是它什么时候来说不准
- 提出者
- B. F. 斯金纳
- 年份
- 1938 · 1957
- 领域
- 心理 · 学习 · 行为
- 核心命题
- 行为被它的后果塑造
一
缘起 · 一只在箱子里乱撞的猫,和一台能一直记下去的机器
ORIGIN
一八九〇年代末,哥伦比亚大学的一位研究生把猫关进一只木箱,箱门由一根踏板控制,箱外放着鱼。猫先是抓、咬、挤、叫,乱撞一气;某一次偶然踩到踏板,门开了。再放进去,还是乱撞,但乱撞的时间短了一点。如此反复几十次之后,猫一进箱就直奔踏板。
爱德华·桑代克由此写下效果律:在同一情境中,那些跟随着令动物满意的事态的反应,会与该情境更牢固地联结起来;跟随着令动物不适的事态的反应,联结会被削弱。——这是心理学史上第一次有人用一句可检验的话,说明"学习"这件事究竟发生了什么。
但这句话里藏着一个当时没人觉得是问题的问题:"令动物满意的事态"是什么?你没法打开猫的脑袋去看它满不满意。你只能看到它按得更勤了,然后倒过来说,那说明它满意。
三十多年后,一个哈佛的研究生盯上了这个洞。他做的那件事,今天看起来简单得像一次装修:他不再把动物一次次"放进去、拿出来",而是造了一只可以让动物随时按、按了随时有结果、能连续跑几百小时的箱子;然后在箱子旁边接上一支笔和一卷匀速走动的纸——按一下,笔往上抬一格。
于是"学习"第一次不再是一串轶事,而是一条可以摊在桌上、用尺子量的曲线。
那卷纸叫累积记录器,那只箱子后来被别人叫作斯金纳箱(他本人不喜欢这个名字)。而伯尔赫斯·弗雷德里克·斯金纳(1904–1990)在一九三八年的《有机体的行为》里划下的那一刀,才是这一整篇的起点:
他把行为分成两类。一类是被前面的刺激"引出来"的——光一强瞳孔就缩,酸一入口唾液就分泌,巴甫洛夫的狗听见铃就流口水。这一类他叫应答性行为。另一类不是被谁引出来的,它是动物"发出来"的——鸽子在笼子里走来走去,孩子在地上乱爬,一个人试着换个说法再讲一遍。它没有一个可指认的诱因,但它有后果,而后果会回过头来改变它以后出现的频率。这一类他叫操作性行为,因为它是在对环境进行操作。
这一刀的分量在于它把因果的箭头掉了个头:巴甫洛夫那一路问的是"什么在前面推它",斯金纳这一路问的是"什么在后面拉它"。心理学此前一直在找行为的原因,斯金纳说,对绝大多数有意思的行为而言,原因在它后面而不在它前面。
二
原典
THE PRIMARY TEXT
SKINNER, 1938 ·《有机体的行为》· 两类行为,与一个只能由效果来定义的东西
行为可分为两类。应答性行为由一个可以指认的刺激引发,刺激与反应之间的关系是"引出"。操作性行为不由任何已知刺激引发,它由有机体自身发出;它与环境的关系不在它的前面,而在它的后面——在它所产生的后果里。
如果一个操作性行为之后紧跟着某种事件,而该行为此后出现的频率上升,那么这个事件就是一个强化物;这个过程叫作强化。
请注意这个定义的形式:强化物不是由"它是不是好东西"来定义的,而是由"它对行为频率做了什么"来定义的。一样东西是不是强化物,只能靠观察行为的变化来判断,不能靠它看起来令人愉快来判断。
因此,在这套语言里,问"他为什么这么做"不再有意义;能问、并且能答的问题只有一个:这个行为过去每次出现之后,发生了什么。
B. F. Skinner《The Behavior of Organisms: An Experimental Analysis》,Appleton-Century, 1938。以上为核心论证的中译与整理,非逐字迻录;"强化物由其效果定义"这一操作性定义,在其《Science and Human Behavior》(Macmillan, 1953)中有更完整的陈述。这个定义形式招致了"循环论证"的长期指控,见第六节④。
FERSTER & SKINNER, 1957 ·《强化程式》· 四种给法,四副面孔
决定行为形态的,往往不是强化物的大小,而是它按什么规则给出。四种基本程式:
定比率(FR)——每做满 n 次给一次。反应又快又猛,但每拿到一次强化之后会停顿一下,然后重新提速。
变比率(VR)——平均每 n 次给一次,但具体第几次说不准。反应率最高,最稳定,而且极难消退。
定时距(FI)——每过 t 时间之后的第一次反应给一次。行为呈扇贝形:刚拿到强化后几乎不动,越接近时间点越急。
变时距(VI)——平均每 t 时间给一次,具体时刻说不准。反应平稳、中速、持久。
同一只鸽子,同样的谷子,只是换一种给法,就会换上一副完全不同的行为面貌。
C. B. Ferster & B. F. Skinner《Schedules of Reinforcement》,Appleton-Century-Crofts, 1957。这是一本近七百页、几乎全由累积记录曲线构成的书,凝结了五年间数以亿计的反应记录。以上为四种基本程式及其典型行为特征的概括,非逐字迻录。
三
释义 · 你以为你在奖励,其实你在编程
PLAIN MEANING
把这套东西讲清楚,只需要三句话。
第一句:行为被它的后果塑造。一个动作之后如果跟着某种结果,而这个动作此后出现得更频繁,那么这个结果就在强化它。——注意这句话里没有"因为它喜欢",也没有"因为他想要"。它只说了两件可观察的事:做了什么,之后发生了什么,以及后来做得多了还是少了。
第二句,也是最反直觉的一句:强化物由效果定义,不由你的判断定义。
这句话的实际杀伤力,要举例才看得清:
一个在课堂上捣乱的孩子,每次捣乱都被老师当众训一顿。训斥当然不是奖励——除非你去数一数:这个孩子的捣乱是变少了,还是变多了?如果变多了,那么无论那顿训斥听起来多么严厉,在这个孩子这里,它就是强化物。他要的可能只是那三十秒里全班的目光。
反过来同样成立:一个下属提出了一个不太成熟的想法,你耐心地、详细地、当着大家的面把它的问题一条条讲清楚。你以为你在指导。三个月后他不再提想法了——那么在功能上,你做的是惩罚。
你以为的奖励未必在强化,你以为的惩罚可能正在强化。唯一的判据是频率,不是意图。
第三句,是这一篇真正值钱的地方:起决定作用的往往不是强化物的大小,是它到来的方式。
先记住两个可以随身带走的事实。其一,每次都给(连续强化),学得最快,也消失得最快——一旦停止,行为很快就没了。其二,不定期地给、平均若干次给一次、但具体哪一次说不准(变比率),学得慢一点,却产出最高、最持久、几乎无法消退。
为什么?因为在变比率程式下,"这次没有"从来不构成"以后也没有"的证据。动物——以及人——在这种程式里学到的恰恰是:没中,说明下一次更接近了。
这就是老虎机的数学,也是下拉刷新的数学,也是抽卡的数学。它们没有一个是靠"奖励很大"起作用的;它们靠的是"说不准"。
还有两个配套现象,第八节会反复用到。其一是消退爆发:当一个长期被强化的行为忽然不再被强化,它不会立刻消失,而是先变得更频繁、更用力、更激烈,然后才衰减。其二是部分强化消退效应:断断续续被强化过的行为,比一直被强化的行为更难消退。——把这两条合起来,你就得到了一条关于人际关系的冷知识:一个你偶尔才让步一次的要求,会比一个你每次都答应的要求,纠缠得久得多。
四
后人之论
LATER INTERPRETATIONS
五
案例
CASE STUDIES
案例 01
一支笔、一卷纸,和一门学问的成年
1930 年代 · 哈佛
累积记录器的原理简单到近乎可笑:纸卷匀速走动,动物每按一次键,笔就往上抬一小格。于是行为频率变成了曲线的斜率——按得快,线就陡;停下来,线就平。
这台机器带来的东西,是当时任何理论都给不出来的:你可以让一只鸽子连续跑几十上百个小时,而整个过程被完整、连续、无需人守着地记录下来。四种强化程式各自的行为指纹——定比率的停顿、定时距的扇贝、变比率那条几乎笔直的斜线——全都是先在纸上被"看见",然后才被解释的。
一门学问变成科学的时刻,往往不是有人提出了一个更好的理论,而是有人造出了一台能持续读数的仪器。——
斯金纳的哲学立场今天几乎无人再持(第六节④),但他留下的这套方法至今在用。可搬走的一条:当你觉得某件事"说不清、只能凭感觉"时,值得花的力气常常不是继续论证,而是去想办法把它变成一个能被连续记录的数。同一个教益在 №083(把程序当成可运行的理论)和 №086 案例 02(用距离去代表专用性)里各出现过一次。
案例 02
迷信的鸽子
1948 · 斯金纳
斯金纳把八只饥饿的鸽子分别放进箱子,然后做了一件极简单的事:每隔十五秒自动落一次食,与鸽子当时在做什么完全无关。
几天之后,他报告说八只里有六只长出了各自古怪而固定的动作——有的绕着箱子逆时针转圈,有的反复把头往上方一个角落顶,有的做出像是要托起什么东西的抬头动作。他的解释是"偶然强化":食物落下的那一刻,鸽子碰巧在做什么,什么就被强化了一点点;下次它更可能在做那个动作,于是更可能又碰上一次落食。
他随即把它推到人身上:保龄球手球出手之后仍在扭动身体,赌徒吹骰子,考试穿同一双袜子。"这些仪式并不真的改变结果,正如鸽子的转圈并不能召来食物。"
这是心理学被引用得最多的实验之一,几乎每本教科书都有它。——而第六节③会告诉你,它很可能测到的根本不是斯金纳以为的那件事。
——请把这条案例和那条反例连起来读,这是本篇最值得花的十分钟:一个漂亮、好懂、可迁移到人类身上的解释,如何在二十三年后被一次更细致的重做整个改写,而教科书至今还在讲旧版本。
案例 03
变比率程式:从鸽子笼到你口袋里
1957 起 · 至今
《强化程式》里那条最陡最直、几乎不见停顿的曲线,来自变比率程式。而世界上把这条曲线利用得最彻底的行业,比心理学家更早知道它管用:老虎机的赔付逻辑,就是一台标准的变比率强化装置。
今天它的变体到处都是:下拉刷新(拉一下,可能有新东西,也可能没有)、通知红点(点开可能是重要的,也可能什么都不是)、抽卡与开箱(平均若干抽出一个,具体哪一抽说不准)、以及每隔一会儿就要看一眼的信息流。
请注意它们的共同点不是奖励丰厚——绝大多数时候刷新出来的东西毫无价值。共同点是"说不准"。
让人停不下来的不是奖励的大小,是它到来时间的不可预测。——
这解释了一个常见的困惑:为什么明知没意思还是会一遍遍刷。因为在变比率程式下,"这次什么也没有"恰恰是继续下去的理由,而不是停下来的理由。也请注意这条案例的另一面:这不是某个人意志薄弱,这是一套被设计过的数学。而知道它是什么,并不会让你免疫(第六节⑤)——能改变行为的是改掉程式本身,而不是知道程式的名字。
相关:№044、№005。
案例 04
代币经济:走出实验室之后
1968 · 艾隆与阿兹林
艾隆与阿兹林在一所精神病院里做了一件此前没人做过的事:把强化程式变成一套可运行的制度。病人完成某些日常活动(自理、参与劳动、按时作息)即获得代币,代币可以兑换各种实际的东西与特权。他们在 1968 年把这套做法写成了《代币经济》。
这条线索一直延续到今天。它在物质使用障碍的治疗中被称为"列联管理"——按约定给出可兑换的奖励,用以强化"这次检测是阴性"这一具体行为——并且是该领域中证据最强的心理社会干预之一。它也是应用行为分析、许多学校课堂管理制度和习惯类应用积分体系的共同祖先。
但这条案例必须两面都写。其一,撤掉代币之后,行为常常回落——它是一套外部支架,不是一次内在转化。其二,把"可兑换的基本便利"交到机构手里,本身就是一种极大的权力,而这套技术在历史上确实被用于对住院者、囚犯、儿童的高度控制。
——一个方法的有效性与它的正当性,是两个完全独立的判断;而"它管用"从来不构成"应该这么用"的理由。第六节⑤讲的正是这件事。
案例 05
鸽子导弹
1943 · 1948–1953 · Project Pigeon / ORCON
二战期间,斯金纳提出了一个在当时听起来像玩笑的方案:把训练过的鸽子装进滑翔炸弹的头部,让它啄屏幕上目标的影像;啄的位置偏左,弹体就往左修正。三只鸽子并联,以多数决降低单只出错的影响。
训练是成功的:鸽子能在颠簸、噪声与加速度下持续准确地啄住目标。项目在 1944 年被中止;战后海军研究实验室又以"ORCON"(取自 organic control,有机控制)之名重启,一直做到 1953 年。斯金纳在 1960 年把整件事写成了一篇论文,标题就叫《鹈鹕里的鸽子》。
它始终没有被采用。理由并非它不管用。
当一套方法的解释力被展示到荒诞的程度时,人们拒绝它的理由,往往不是它不管用。
——这也是斯金纳一生的缩影:他真诚地相信这套技术可以用来设计更好的学校、更好的监狱、更好的社会(《瓦尔登湖第二》正是这样一本小说),而世界一次次拒绝了他;理由一半是技术上的,另一半是"被设计"这件事本身让人极不舒服。
而这份不舒服本身值得被认真对待——它不是无知,它是第六节⑤那条伦理直觉的雏形。
六
反例与限制
CRITIQUE & LIMITS
这一节的分量在于它的来源:下面前三条批评里,有两条来自斯金纳自己的学生和自己的实验范式,而它们各自否掉了这套理论的一条地基假设。请先记住一个分寸——没有一条反例否认"后果会改变行为"这件事,它们否认的是它的普适性、它的机制解释、以及它可以被推到多远。
-
① 它长期把"学习"与"表现"混为一谈。托尔曼与洪齐克 1930 年的潜伏学习实验已经说明:没有任何强化的老鼠照样在学迷宫,只是不表现出来;一旦给了理由,成绩立刻显形。
换句话说,强化改变的主要是"做不做",而不必然是"会不会"。一个只统计行为频率的框架,看不见那些已经学会、但暂时没有理由做出来的东西。
这一条今天在管理和教育上仍然天天在犯:把"没做出来"读成"不会",于是去培训;而问题常常在于做出来之后什么也没发生。——反过来同样成立:加了激励之后立刻见效,往往说明大家早就会,缺的只是理由。
-
② 动物不是白纸:等势性假设被两次实验打穿,其中一次来自斯金纳自己的学生。这套理论早期的默认前提是任何反应都可以与任何后果任意配对——这被称为等势性。
凯勒·布雷兰与玛丽安·布雷兰是斯金纳的学生,靠训练动物做商业表演为生;正是这门生意让他们撞上了理论的墙。他们训练浣熊把硬币投进存钱罐,浣熊却越来越顽固地把两枚硬币互相搓洗、迟迟不肯放手;训练猪做同样的事,猪最后总是把硬币用鼻子拱到地上翻来覆去。——这些动作不但没有被强化,反而延误了它们拿到食物,可它们照做不误。1961 年他们把这些失败写成论文,标题是对斯金纳那本书的直接戏仿:《有机体的误行为》,并造了一个词:本能漂移。
另一记来自加西亚与科林 1966 年的味觉厌恶实验:老鼠可以在一次配对、且间隔数小时的情况下学会厌恶某种味道;但同样的间隔下,它学不会把声光信号与恶心联系起来,反倒能轻易把声光与电击联系起来。
结论是硬的:什么能与什么配对、需要多少次、能隔多久,由物种的演化史决定,不由程式决定。
-
③ 最著名的那个实验,被重做之后翻了案。斯塔顿与西默尔哈格 1971 年在《心理学评论》上重做了"迷信的鸽子",做得更细:他们不只记录动作,还记录动作出现在两次落食之间的哪个位置。
结果与斯金纳的图景对不上:鸽子在食物快来的那一段时间里做的事高度一致——几乎都是啄;各不相同的那些古怪动作,出现在刚吃完、离下一次落食还远的那一段。他们把前者称为终末行为,后者称为间隔行为,并主张这两类都是该物种在等待食物时预置的行为序列,而不是"碰巧在做什么就被雕刻下来"的个体迷信。
该带走的不是"所以斯金纳错了",而是一个更普遍的教训:一个解释之所以能流传半个多世纪,靠的常常是它好懂、好讲、好迁移,而不是它经受住了最细致的那一次重做。这条案例与 №030 的金字塔、№032 的破窗是同一类病例。
-
④ "由效果定义"带来循环的危险;而拒绝谈论内部状态,让它在语言面前失了手。强化物由效果定义——行为增加了,所以那是强化物;那是强化物,所以行为增加了。斯金纳的辩护是:这个循环不是恶性的,因为一个被认定的强化物可以在别的情境、别的行为上被独立检验;这条辩护在实验室里成立。
但走出实验室,它经常退化成事后命名:任何做了的事都可以说"一定是被什么强化了",而这个"什么"从不需要被事先指出来。一个无论看到什么都能解释的框架,什么也没有预测。
1959 年,一位年轻的语言学家在《语言》杂志上为斯金纳的《言语行为》写了一篇书评,论证强化史无法解释儿童在极有限的输入下产出无穷多合乎语法的新句子。这篇书评常被当成"击溃行为主义"的判决书,而行为分析学界至今认为它误读了斯金纳的论点(麦考奎代尔 1970 年发表过一篇著名的回应)。无论谁对,此后半个世纪心理学的实际走向是认知的。相关见 №055。
-
⑤ 最贵的两种误用,方向正好相反。
其一是把它读成"人可以被控制"的说明书。斯金纳本人的《瓦尔登湖第二》与《超越自由与尊严》引发了持续数十年的伦理战,他被指控要取消人的自由与尊严。而讽刺的是,这套技术今天最成功、最大规模的落地,并不在他设想的学校与社区里,而在被工程化进产品的那些变比率程式里——它确实被用来控制人的行为了,只是不由心理学家来做。
其二是"奖励万能"。对本来就有内在动机的行为施加外部奖励,常常反而削弱它——奖励一撤,热情也一起被带走。请注意这一条的分寸:它不否认强化有效,它说的是"用外部奖励去买一个人本来就愿意做的事"这笔交易经常亏本。完整的讨论见 №049。
最后补一条方向相反的,免得这一节读成清算:这套东西最结实的部分,从来不是它的哲学(激进行为主义作为一种关于心智的立场,今天几乎无人再持),而是它的方法——它把"后果如何改变行为"变成了可测量、可复现、可工程化的东西。今天的强化学习、行为经济学的助推设计、循证的行为干预、应用行为分析,全都站在这套方法上;而斯金纳本人在 1981 年那篇《由后果决定的选择》里,把它与自然选择、文化演化并列成三层同构的选择过程——那是他留下的最开阔的一个想法。
七
相关理论
CONNECTIONS
效果律Law of Effect · 1898
⟸ 直接上游
桑代克的迷箱与效果律是整条线索的起点。斯金纳改掉的不是结论,是测量单位:从"这一次花了多久"换成"每分钟多少下"。而正是这次更换,让"强化程式"这个此前不存在的东西变得可见——你没法在一次一次的试验里看见扇贝形。
强化学习Reinforcement Learning
⟹ 直系后裔,也是它最大的一次胜利
今天机器学习里的强化学习,几乎原样继承了这套词汇:
智能体、动作、奖励、试错、策略。而它给出了斯金纳给不出的东西——奖励如何在时间上向前传递的具体机制(时序差分),以及"探索还是利用"这道取舍的数学形式。与 №083 合看才完整:那一篇讲符号与搜索,这一篇讲试错与奖励;这是人工智能最初分出的两条路,而今天最强的系统里两者各占一半。
自我决定论 №049Self-Determination Theory · 1985
⚠ 最该被切开的对照
№049 与本篇看的是同一个动作的两侧:
本篇问"这个行为的后果是什么",那一篇问"这个人为什么想做"。两者的冲突点非常具体——对本来就有内在动机的行为施加外部奖励,可能把"我想做"换成"我为奖励做",而奖励一停,原来的热情也一并消失。合起来的用法:用强化去启动一个还不存在的行为,用自主感去维持一个已经存在的行为。
双曲贴现 №044Hyperbolic Discounting
⟷ 同一批实验的两种读法
赫恩斯坦的匹配律与双曲贴现(
№044)在数学上高度相关:
当"小而快"与"大而慢"同时在场,行为按回报率分配,而回报率里包含了时间这一项。这就是为什么自制力问题常常不是意志问题——它是两个程式在同一段时间里争夺分配。
古德哈特定律 №005Goodhart's Law
⚠ 误用警示,几乎是同一句话
你强化什么,就会得到什么——包括你根本没打算要的那个版本。按代码行数付钱得到冗长的代码,按结案率考核得到不立案,按点击量计酬得到标题党。(
№005)
本篇为古德哈特提供了机制层的解释:指标一旦成为强化物,被塑造的就是"让指标上升的行为",而不是那个指标本来想代表的东西。
自然选择 №021Natural Selection
⟷ 同构,而且是斯金纳自己写下的
1981 年斯金纳在《科学》上发表《由后果决定的选择》,主张有三层同构的选择过程:
自然选择塑造物种,强化塑造个体的行为,而文化实践的存续与传播构成第三层。三者共用一个逻辑——变异先随机产生,后果负责保留。(
№021)
双重继承理论 №066Dual Inheritance Theory
⟹ 那第三层的展开
斯金纳 1981 年那篇文章的第三层——文化实践因其后果而存续——正是
№066 处理的问题。
而两篇共享同一条最冷的推论:一个做法能不能传下去,与它对携带者好不好,是两件不同的事。
遗忘曲线与期望的困难 №076Forgetting Curve · Desirable Difficulties
⚖ 学习的另一半
本篇管的是"做不做",
№076 管的是"记不记得住"。
两者合起来才是完整的学习问题:强化决定一个行为会不会被做出来,而提取练习与间隔决定它会不会被留下来。托尔曼那条批评(第六节①)正卡在两者中间:会了但不做,和做了但没记住,是两种完全不同的失败,处方也完全不同。
八
致用
APPLICATION
先标明分寸:第一、二、四条有直接的实验依据(强化物的功能定义、程式效应、消退爆发),第三条是定时距程式的现实版,第五条是边界提醒。第六节②对以下全部有效——人不是白纸,任何"只要设对奖励就能塑造出任何行为"的说法都超出了这套理论的能力。
-
改行为,先改后果;而"后果"要看效果,不看你的本意
想改掉一个行为,与其追问"他为什么这样",不如先问:这个行为每次出现之后,实际发生了什么?
判据只有一个——三个月后这个行为是多了还是少了。多了,说明它正在被某样东西强化,无论你把那样东西叫作奖励还是批评。最常见的三个现场:吵闹的孩子换来了全神贯注的注意;抱怨的员工换来了任务被拿走;你发一次火对方就顺从了一次——那一次顺从,强化的是你的发火。
-
程式比大小更要紧
这是本篇最有实验依据、也最少被利用的一条。想建立一个新习惯:一开始每次都给(哪怕只是划掉一个格子),等它站稳之后,把强化变得稀疏而不定期。连续强化建得快、塌得也快;断续强化建得慢,但极其难消退。
反过来,想戒掉一个行为,先认出它现在挂在哪种程式上。如果它的回报是"说不准什么时候来"(刷手机、买彩票、给某个人发消息等回复),那你对抗的不是自己的意志力,是一套专门为难以停止而设计的数学——正确的动作不是下决心,而是把程式改掉:关掉通知,把随机变成定时。
-
扇贝形:截止日前的突击不是道德问题
只在固定时点结算的规则,必然产出定时距程式那条曲线——刚结算完几乎不动,越近截止越急。期末考试、季度业绩、年度述职,全都是同一条扇贝。
所以处方不是"提高自制力",而是改结算规则:把一个远期的大截止日,拆成若干个近的、真实的、有人看的小交付。注意"有人看"这三个字——一个没有任何后果的自设期限,不是一次结算。
-
消退爆发:最凶的那一下,恰恰是快要结束的信号
这可能是本篇最实用的一条。当你停止强化一个长期被强化的行为,它不会立刻消失,而是先变得更频繁、更大声、更激烈,然后才衰减。
不知道这条规律的人,往往正好在最凶的那一刻让步——而那一次让步,把这个行为从"每次都有"送上了变比率程式,从此更难消退。
适用现场:孩子的哭闹、反复的纠缠与催促、把小事升级成危机的沟通方式,以及你自己戒某样东西的第三天。要么事先想清楚不让步并准备好扛过那一段,要么干脆不要开始——最糟的做法是扛到一半再让步。
-
两条边界:别买本来就免费的东西,也别以为知道就能免疫
其一,不要用外部奖励去买一个人本来就愿意做的事——那笔交易经常是亏的,奖励一撤,原来的热情也被带走(№049)。外部强化最适合用来启动一个还不存在的行为,而不是维持一个已经存在的热情。
其二,知道自己正在被某种程式驱动,并不会让你免疫。你知道那是变比率,手指照样会去下拉刷新。可操作的从来不是"意识到",而是改掉那个程式本身:把随机变成定时,把即时变成延迟,把一步之遥变成多几步——这些改动小到不需要意志力,而它们改的正是那套数学。
九
反观三问
THREE QUESTIONS
我最想改掉的那个行为——别人的,或者我自己的——它每次出现之后,实际得到了什么?如果它还在,说明有什么东西一直在强化它;那样东西是什么,我说得出来吗?
我最停不下来的那件事,它的回报是"每次都有",还是"说不准什么时候来"?如果是后者,那我对抗的不是自己的意志力,是一套被设计过的数学——而我在改的是决心,还是程式?
我用来激励别人(或者自己)的那些奖励里,有没有一件是在为本来就愿意做的事付钱?如果明天把它撤掉,那个行为还在吗?
十
延伸阅读
FURTHER READING
-
B. F. Skinner《The Behavior of Organisms: An Experimental Analysis》
Appleton-Century, 1938 — 原典。应答性行为与操作性行为的划分、强化物的功能定义,都在这里;今天读它最大的收获可能不是结论,而是看一个人如何把"学习"改造成一个可以连续读数的量
-
C. B. Ferster & B. F. Skinner《Schedules of Reinforcement》
Appleton-Century-Crofts, 1957 — 本篇第二张原典卡的出处;近七百页、几乎全是累积记录曲线的一本书。不必通读,翻十页曲线就够——你会亲眼看见"同一只鸽子换一种给法就换一副面孔"
-
B. F. Skinner《Science and Human Behavior》
Macmillan, 1953 — 面向一般读者的系统陈述,也是他把这套框架推向教育、治理与文化的起点;与《Beyond Freedom and Dignity》(Knopf, 1971)合看,能明白第六节⑤那场伦理战究竟在争什么
-
Keller Breland & Marian Breland《The Misbehavior of Organisms》
American Psychologist, Vol. 16, 1961, pp. 681–684 — 本篇最推荐的批评文献,只有四页;由斯金纳自己的学生写下,标题是对《The Behavior of Organisms》的直接戏仿。被商业上的失败逼出来的观察,往往比实验室里的成功更诚实
-
J. E. R. Staddon & V. L. Simmelhag《The "Superstition" Experiment: A Reexamination of Its Implications for the Principles of Adaptive Behavior》
Psychological Review, Vol. 78, No. 1, 1971, pp. 3–43 — 请与本篇案例 02 对照着读:一个被写进每本教科书的经典实验,在被更细致地重做之后是什么样子
-
R. J. Herrnstein《Relative and Absolute Strength of Response as a Function of Frequency of Reinforcement》
Journal of the Experimental Analysis of Behavior, Vol. 4, 1961, pp. 267–272 — 匹配律的原始论文;从"行为如何被塑造"到"时间如何被分配"的那一步
-
Noam Chomsky《A Review of B. F. Skinner's Verbal Behavior》
Language, Vol. 35, No. 1, 1959, pp. 26–58 — 认知革命的开场枪之一。请连同行为分析学界的回应一起读(麦考奎代尔 1970 年发表于《行为实验分析杂志》的那篇最著名),不然你读到的会是一场只有一方发言的辩论
-
B. F. Skinner《Selection by Consequences》
Science, Vol. 213, 1981, pp. 501–504 — 四页;他把自然选择、行为的强化、文化实践的存续写成三层同构的选择过程。这大概是他留下的最开阔的一个想法,也是本篇与 №021、№066 的接口
-
维基百科:Operant conditioning / Reinforcement
en.wikipedia.org/wiki/Operant_conditioning — 索引入口;另可参见 Schedules of reinforcement、Instinctive drift、Matching law、Latent learning、Token economy 五个条目
桑代克的迷箱实验是这条线索的起点,而他画的那张学习曲线(逃出所需时间随试验次数下降)几乎是心理学第一张真正意义上的数据图。他的结论——效果律——至今没有被推翻。
但斯金纳做的那一步改动,比它看起来重要得多:桑代克的猫是被"一次一次放进箱子"的,每一次算一个试验;斯金纳的鸽子从头到尾待在箱子里,想啄就啄。前者能测的是"这一次花了多久",后者能测的是"每分钟啄多少下"。
一个学科能问什么问题,常常取决于它能测什么量。从"试验次数"换成"反应速率",这个换算把学习研究从一堆离散的故事,变成了一条连续的、可以被程式实时调制的曲线——此后所有关于强化程式的发现,都建立在这一次单位的更换上。这一条与 №083 案例 02 是同一个教益的两次出现。
《强化程式》这本书几乎不讲理论。它是近七百页的曲线,五年的连续记录,数以亿计的反应。它要证明的只有一件事:改变强化到来的规则,不改变强化本身,行为的形状就会整个变形。
其中最该被搬出实验室的是定时距程式的"扇贝形":只有到点才给的话,动物在刚拿到强化之后几乎完全不动,然后随着时间点临近越来越急,在最后一刻达到峰值。
这条曲线的形状,和期末考试前的图书馆、季度末最后一周的销售业绩、截止日前一晚的进度条,是同一条曲线。它不是懒惰,也不是自制力问题——它是"只在固定时点结算"这条规则的必然产物。改规则比改决心有用得多。
(费斯特是这本书的第一作者;斯金纳作为原典作者,本篇不另立卡片。)
赫恩斯坦给鸽子两个键,两个键各挂一套不同频率的强化程式,然后问了一个此前没人问的问题:它会不会干脆只啄回报高的那个?
答案是不会。鸽子把反应按比例分给两个键,而这个比例几乎精确地匹配两个键的强化比例——回报是三比一,反应就大致是三比一。这就是匹配律。
这一步把研究对象从"一个行为如何被塑造"换成了"有限的时间如何在多个行为之间被分配",而后者才是真实生活的形状。它顺带解释了一件让所有讲效率的人头疼的事:人并不会把百分之百的精力投给回报最高的那件事,而是按各自的回报率去摊。
赫恩斯坦后来把这条线推向自我控制的研究,直接连着 №044:当"小而快"的回报和"大而慢"的回报同时摆在那里,行为按什么比例分配,是可以被写成方程的。(他晚年另有一部涉及智力与社会分层的合著引发了长期而严厉的争议,与本篇内容无关,此处不展开。)
这是对整套框架最重要的一次正面攻击,而且它比斯金纳的书还早。
托尔曼与洪齐克让三组老鼠跑同一个迷宫:第一组每次到终点都有食物,成绩稳步上升;第二组从来没有食物,成绩几乎不动;第三组前十天没有食物,第十一天开始给。第三组的成绩在给食的第二天几乎垂直下落到第一组的水平,甚至更好。
结论无可回避:那十天里它们一直在学,只是没有表现出来。托尔曼称之为潜伏学习,并在 1948 年那篇著名的《老鼠与人的认知地图》里给出解释:动物在脑子里建的不是一串"在这个岔口向左"的动作,而是一张地图。
这一刀捅在最薄的地方:强化影响的可能主要是"做不做",而不是"会不会"。而行为主义把"我们只测得到行为"这条方法论纪律,逐渐当成了"行为之外没有别的东西"的本体论主张——前者是严谨,后者是越界。此后半个世纪心理学的主流走向,基本是沿着托尔曼这条线的。