LESSON 076 · PSYCHOLOGY

遗忘曲线与期望的困难

Forgetting Curve & Desirable Difficulties · 学的时候越顺,将来剩下的越少
提出者
赫尔曼·艾宾浩斯 / 罗伯特·比约克
年份
1885 / 1994
领域
心理 · 学习科学 · 记忆
核心命题
当下的表现,不是学习的证据
一 缘起 · 一个人对自己做了七百多个小时的实验 ORIGIN

1879 年,没有人认为"记忆"是一个可以被测量的东西。它属于哲学:柏拉图的蜡板、洛克的白纸、联想主义者的争论——全是比喻,没有数字。当时的主流意见相当明确:高级心智过程不可能进实验室。

赫尔曼·艾宾浩斯(1850–1909)不同意。而他手边唯一可用的实验对象,是他自己。

他先解决了一个别人没想清楚的问题:用什么材料?如果背的是诗、是句子、是有意义的词,那么每个人过去的经历、联想、兴趣都会掺进来——你记住"月亮"用了多久,取决于你这辈子和月亮打过多少交道。于是他做了一件极端的事:造出大约两千三百个无意义音节(辅音-元音-辅音,如 ZOF、QAX),把"意义"从材料里彻底剥掉,好让每一个音节对他而言都同样陌生。

然后他解决了第二个问题:怎么度量"还剩多少"?回忆不出来不等于什么都没剩下。他的办法后来被称为节省法:先把一张表背到能一字不差地连背两遍,隔一段时间之后再把同一张表重新背到同样的标准,看第二次省下了多少时间。省下 60%,就说明那 60% 还留在里面——哪怕你一个音节也想不起来。

他既是实验者,也是唯一的被试。
前后数年,节拍器打着拍子,
一个人把自己背了七百多个小时。

1885 年,《论记忆》出版。人类第一次拿到了一条遗忘曲线:一条先陡后缓、掉得极不均匀的线。心理学从此有了实验的一半。

这门学问的后一半要再等一百年。艾宾浩斯回答的是"会忘多少";他没有问、也没能力问的那个问题是——那么,什么样的学习方式能少忘一点?而这个问题的答案,在一百年后被证明是反直觉的:几乎所有让学习当下变轻松的做法,都在让长期记住的更少。

二 原典 · 一条曲线,与一个把它掀翻的概念 THE PRIMARY TEXT

这一课有两块地基,隔着一百零九年。第一块是那条曲线。

EBBINGHAUS, 1885 · 遗忘曲线(节省法读数)
以"重新学会所节省的时间比例"衡量残留量,一张无意义音节表在学会之后的保留情况大致是:

约 19 分钟后 —— 58.2%
约 1 小时后 —— 44.2%
约 1 天后 —— 33.7%
约 6 天后 —— 25.4%
约 31 天后 —— 21.1%

真正的结论不是这几个数字,而是这条线的形状:掉得极不均匀。第一个小时里失去的,比后面整整一个月失去的还多;而熬过最初那一段之后,曲线趋于平缓,剩下的那部分相当顽固。

换句话说:遗忘不是匀速的流失,是一次陡降加一条长尾。
Hermann Ebbinghaus《Über das Gedächtnis: Untersuchungen zur experimentellen Psychologie》,Duncker & Humblot, Leipzig, 1885(英译 Memory: A Contribution to Experimental Psychology, Ruger & Bussenius 译, Teachers College, Columbia University, 1913)。以上为其节省率数据的转述;这些数字来自单一被试(作者本人)在无意义音节上的测量,适用范围见第六节①。

第二块地基把整件事翻了个面。它不谈"会忘多少",只谈一件事:你在学习当下感觉到的一切,都不能当作学会了的证据。

R. A. BJORK, 1994 · 期望的困难(DESIRABLE DIFFICULTIES)
在学习过程中制造困难——把练习分散开、把内容打散交错、要求自己回忆而不是重看、延迟给出反馈——会让当下的表现变差、学习者的感觉变糟,却会显著提高长期的保持与迁移。

反过来同样成立,而且这一半更要紧:那些让学习当下变得顺畅的做法(反复重读、集中突击、把答案摆在眼前),能可靠地抬高当下的表现,却几乎不留下什么。

因此本条最硬的一句是:
表现 ≠ 学习(performance is not learning)。
训练期间可测量到的表现,是一个不可靠的指标——它经常与长期结果背道而驰。

而"期望的"三个字是一道限定,不是修辞:只有当学习者有能力应对这份困难时,它才是期望的。否则它就只是困难。
Robert A. Bjork《Memory and Metamemory Considerations in the Training of Human Beings》,收于 J. Metcalfe & A. Shimamura (eds.)《Metacognition: Knowing about Knowing》,MIT Press, 1994, pp.185–205。上为核心主张的概括与转述,非逐字翻译。
三 释义 · 记忆有两个强度,而你只感觉得到其中一个 PLAIN MEANING

为什么"更轻松"会等于"记住得更少"?把这件事讲清楚的,是比约克夫妇提出的一个很朴素的区分:记忆不是一个量,是两个量。

存储强度——这样东西在你脑子里被建得有多牢。它几乎只增不减。
取回强度——此时此刻,它有多容易被你想起来。它掉得飞快。

你能感觉到的,只有取回强度。刚读完一段,它的取回强度是满的,于是一切都"很熟悉、很顺、我懂了"。可这份熟悉几乎不携带任何关于存储强度的信息——而一周后要拿出来的,是存储强度。

更妙的是这套理论的第二条,它一句话解释了后面所有的实验:

一次取回带来的存储强度增益,
与取回时的费力程度成正比。
越是快想不起来的时候把它想起来,
它长得越牢。

由此,"再看一遍"为什么几乎无效就变得很自然了:你去看它的时候,它的取回强度正满着——在这种状态下再刺激一次,几乎学不到任何东西。你只是把一个已经亮着的灯又按了一次开关,然后把这份亮当成了自己的成绩。

整门学问的四件工具,全都只做同一件事——把取回强度先降下去,再让你自己把它捞上来:

而最容易被记反的一句,值得单独写下来:这不是"越难越好"。它说的是某一类特定的困难——那些迫使你去提取、去辨别、去重构的困难。字体印得模糊、教室里很吵、老师讲得混乱,同样是困难,但它们只消耗资源,不产生提取,属于该被删掉的那一类(№071 管的正是它们)。

一句话记住这门学问:你感觉到的顺畅,是取回强度的读数;你需要的,是存储强度。而这两者,在很多时候是反着走的。

四 后人之论 LATER INTERPRETATIONS
罗伯特·比约克与伊丽莎白·比约克 1992 · 把"为什么"讲清楚的那对夫妇

1992 年的《新失用理论》给出了上一节那个两强度框架。它之所以重要,不在于优雅,而在于它一口气解释了一堆此前互不相干、甚至看起来矛盾的实验结果:为什么间隔比集中好、为什么测验比重读好、为什么当下表现越好的训练方案长期效果反而越差。

其中一条推论尤其反直觉:取回强度接近满格时,学习效率接近零。这意味着你在"这个我已经会了"的状态下多花的每一分钟,几乎都是浪费——而那恰恰是人最愿意花时间的地方,因为它感觉最好。

两年后,罗伯特·比约克给这一整套做法起了那个后来传遍全世界的名字:期望的困难。同时他反复强调的另一句话,其实比这个名字更该被记住——表现不是学习。

他本人后来多次提醒:这个概念被引用得越多,被砍掉的限定词就越多。"期望的"三个字是有条件的,见第六节④。

亨利·罗迪格与杰弗里·卡皮克 2006–2008 · 提取本身就是学习

在他们之前,"测验"在教育里的角色是明确的:测量。你学,然后我考,考试是一把尺子,尺子不改变被量的东西。

罗迪格与卡皮克把这个默认拆掉了。他们证明的是:每一次成功的提取,都会改写记忆本身。考试不是尺子,是一次训练;而且是比再学一遍更有效的训练。这个现象被称为测试效应,今天更常被叫作提取练习——后一个名字更准确,因为它与考试、分数、评价毫无关系,一个人在通勤路上默默回忆昨天读过的东西,就已经在做这件事。

他们最有力的两组数据在案例 02 和案例 03。而其中真正让人不安的部分不是效果的大小,是学习者对这个效果完全无感:在同一批实验里,那些一周后只剩三分之一的人,事前对自己的估计和赢家一模一样。

这一卡的实践含义只有一句:如果你把测验只当成评估工具,你就浪费掉了它一半以上的价值。

塞佩达、帕什勒等 2006 / 2008 · 把"要隔多久"变成一个可以查的数

"分散比集中好"是心理学里最老、最稳固的结论之一(可以一路追到艾宾浩斯本人)。但它长期停在定性层面:隔多久?

2006 年,塞佩达等人做了一次大规模元分析——在 184 篇文章、317 个实验中收集了 839 次对分散练习的测量。结论是间隔效应稳固存在,且最佳间隔随"你要保留多久"而变。

2008 年那篇更实用:一千三百多人学同一批事实,复习的间隔从几天到三个半月不等,最终测验最远推到一年后。得到的是一条"温度岭"——间隔太短没用,太长也没用,中间有一个最优值,而这个最优值随保留期拉长而变大(但占保留期的比例在缩小)。粗略地说:一周后要用,隔一天左右;一年后要用,隔一个月上下。

这一卡的价值是把一句口号变成了剂量。而它同时暗示了一个很多人不爱听的推论:为明天的考试而复习,和为三年后还会用而复习,是两种不同的安排,不存在一种排法同时最优。

邓洛斯基等 2013 · 把十种学习方法排了一次序

2013 年,邓洛斯基与四位合作者在《公共利益中的心理科学》上做了一件很实在的事:把学生实际在用的十种常见学习方法翻遍文献,按证据强度、适用广度和落地难度评级。

结果只有两种方法拿到高效用评级:实践测验(也就是提取练习)与分散练习。

而被评为低效用的名单里,赫然站着学生最常用的两样:重读与划重点。

把这两份名单叠在一起看,得到的是本篇最刺眼的一张图:最流行的方法,恰恰是排在最后的方法。而原因在第六节之前就已经交代过了——重读和划线能立刻制造出流畅感,而人是用流畅感来判断"我学会了"的。

这不是学生懒。这是一个测量工具坏了:他们手里唯一那个关于"学没学会"的仪表,恰好是被无效方法拨得最高的那一个。

五 案例 CASE STUDIES
案例 01 一个人,两千三百个无意义音节 柏林 · 1879–1885

艾宾浩斯的实验条件在今天看来近乎苛刻到荒谬:唯一的被试是他自己;为了控制速度,他用节拍器打拍;为了避免材料被"意义"污染,他造出无意义音节;为了避免时段影响,他把不同条件安排在一天中的同一时间。

他要的不是"人的记忆是什么样",而是一件更基本的事:证明记忆可以被测量。而他为此付出的代价,正是这门学问此后一百年的软肋——他必须先把意义从材料里剥掉。

这是心理学史上最著名的一次取舍:为了让一样东西可测量,先把它身上最要紧的属性拿掉。由此得到的曲线是真的,而它描述的那种"学习",与你背专业名词、读一本书、学一门手艺之间隔着多远,则是另一个问题——第六节①就是从这里长出来的。
案例 02 五分钟之后与一周之后,排名整个翻了过来 华盛顿大学 · 2006

罗迪格与卡皮克让学生读同一批科普短文,然后分成三种安排:读四遍(SSSS)、读三遍加一次回忆(SSST)、读一遍加三次回忆(STTT)。回忆时没有反馈,也不许再看原文。

五分钟后测:读得最多的组最好,成绩依次是 83% / 78% / 71%,完全按接触次数排列,符合所有人的直觉。

一周后再测同一批人:40% / 56% / 61%。

顺序整个倒了过来。读四遍的那一组,一周里掉掉了一大半;只读了一遍、却回忆了三次的那一组,几乎没怎么掉。

这可能是整门学问最该被记住的一张表。它说的不是"测验有用"这么小的一件事,而是:任何在学习当下做出的比较,都可能给出与长期完全相反的答案。如果这个实验只做到五分钟就收工——而现实中绝大多数的评估、试点、培训反馈都是这么收工的——它得到的结论会是"重复阅读最有效"。
案例 03 斯瓦希里语词表,与那份错得离谱的自我预测 《Science》 · 2008

卡皮克与罗迪格让学生学 40 组斯瓦希里语-英语词对,学习与测验交替进行。关键的操作在于:当一个词对被答对之后,它会怎么处理?四种条件分别是——继续留在复习堆里、继续留在测验堆里、两边都留、两边都拿掉。

一周后:那些答对之后仍然被反复提取的词,学生记住了约八成;而那些答对之后只被反复重看的词,只剩下三分之一左右。换句话说,在已经答对之后再多学几遍,对一周后的成绩几乎没有任何作用;而再多测几次,作用极大。

而这篇论文真正令人不安的一栏在最后:实验结束时,研究者问每个学生预测自己一周后能记住多少。各组的预测几乎没有差别。

差距不在于哪种方法有多神奇,而在于学习者完全看不见这个差距。你可以用一种一周后只剩三分之一的方法学习,同时对自己的状态感到相当满意——因为在你停下来的那一刻,两种方法的感觉一模一样。
案例 04 十二位不知名画家:数据赢了,直觉输了,而人相信直觉 加州大学洛杉矶分校 · 2008

科内尔与比约克让参与者学习辨认 12 位相对冷门画家的风格,每人 6 幅画。一半人看的是集中安排(同一位画家的 6 幅连着放),另一半是交错安排(不同画家的画混着放)。随后拿出没见过的新作品,让他们判断出自谁手。

交错组的正确率约 .61,集中组约 .35。差距很大,方向很清楚。

接着研究者问参与者:你觉得哪种安排更有帮助?绝大多数人选了集中——包括很多自己刚刚在交错条件下考得明显更好的人。

这一条把问题推到了最尖锐处:不是人们没有数据,是人们有了数据也不信。因为集中呈现时,你会在第三幅画时产生"我看出这个人的风格了"的清晰感受,而交错时你会一直觉得吃力、混乱、没把握。那份吃力正是它在起作用的证据,而人把它读成了"这个方法不行"。
案例 05 把十种学习方法排了一次序,最流行的两种垫底 《Psychological Science in the Public Interest》 · 2013

邓洛斯基团队评级的十种方法里,实践测验与分散练习拿到高效用;重读与划重点被评为低效用;其余多数落在中间,或因证据不足而无法定论。

值得注意的是评级标准并不苛刻:它同时考虑了效果证据、适用的材料与人群范围、以及"学生自己能不能用起来"。也就是说,被评为高效用的那两种,恰恰也是最便宜、最不需要培训、最容易自己操作的两种。

这份报告的分量在于它是一份可执行的清单,而不是又一个实验室结论。它把这门学问的现实处境摆得很清楚:已知的最有效的两种学习方法,几乎不花钱、不需要任何工具、也早就人人可及——而绝大多数人仍然不用。缺的从来不是方法,是那个坏掉的仪表。
六 反例与限制 CRITIQUE & LIMITS

这一节要拆两样东西:那条被引用得最多的曲线,和那个被引用得最松的概念。

还有一条不算反例、但使用者必须知道的事:这门学问的绝大多数证据来自实验室、短材料、以及数周量级的保持期。"学会某样东西之后十年还能用"这种真正要紧的时间尺度,几乎没有人做得起对照实验。方向是可靠的,具体的剂量与幅度请当作估计而不是配方。

七 相关理论 CONNECTIONS
新失用理论A New Theory of Disuse · Bjork & Bjork 1992
⟸ 机制骨架
存储强度与取回强度的二分,是本篇所有实验结果的共同解释。它同时解释了效果与错觉:起作用的是存储强度,你感觉到的是取回强度,而后者在集中重读时最高、在最该学习的时候最低。
提取练习与测试效应Retrieval Practice / Testing Effect
⟹ 最强的一件工具
把"测验"从评估工具改写为学习事件。它最反直觉的一点是:不给反馈也有效——起作用的是提取这个动作本身,而不是随后知道了答案。这也意味着它不需要老师、不需要系统、不需要任何人在场。
间隔重复算法Spaced Repetition · SuperMemo / Anki
⟹ 工程化身
把间隔效应做成软件:每张卡片按你上次答得多顺来安排下次出现的时间。方向是对的,精度是假的——那些"下次复习在 4.7 天后"的数字,其底层证据远不如它显示出来的位数那么精确(见第六节①②)。当工具用可以,当科学读不行。
认知负荷理论№071 Cognitive Load Theory
⚠ 最该切开的对照
一个说"删掉困难",一个说"制造困难",看起来针锋相对,其实管的是不同的东西:№071 要删的是与理解无关的负担(找东西、来回翻页、对照两份说同一件事的材料),本篇要加的是迫使你提取的困难。把两者混为一谈,是学习方法论里最常见的一次误配。
双重过程理论№062 Dual-Process Theory
↔ 那份"顺畅感"是怎么来的
流畅感是№062 里那种"自己送上门、不占工作记忆"的信号:它来得快、感觉确定、且不带任何"我可能错了"的标签。本篇整套装置,本质上是在教你不要采信这个信号。
邓宁-克鲁格效应№012 Dunning-Kruger
↔ 同一处元认知故障
№012 说的是"判断自己会不会,需要另一套能力";本篇给出了这套故障在学习里的具体读数——案例 03 里那份各组几乎相同的自我预测,是一次干净的实测:人对自己记住了多少的估计,与实际记住的量可以完全脱钩。
古德哈特定律№005 Goodhart's Law
⚠ 教育考核的经典翻车
"表现 ≠ 学习"接上 №005 就得到一条很硬的推论:一旦把训练期间的表现设为考核目标,被优化的必然是短期表现,而它与长期保持常常反向。课时结束后的满意度、培训后的即时测验、季度末的达标率——这些指标不是不准,是它们所奖励的做法恰好是长期最差的那一批。
反脆弱№002 Antifragility
↔ 同族直觉,但请留意边界
适度的压力使系统变强、过度保护使其退化——№002 的形状与"期望的困难"确实同族。但本篇给出了那个 №002 通常给不出的东西:剂量与边界。困难必须可被克服、必须产生提取、必须在有能力承受的人身上,否则它就只是损害。"越难越好"不是这门学问的结论。
八 致用 APPLICATION

先划线:第一、二、三条有直接实验证据(提取练习、间隔剂量、交错),第四条是判断习惯,第五条是边界与伦理提醒。第六节④⑤对这里全部有效。

九 反观三问 THREE QUESTIONS
我最近一次学新东西,有多少时间花在重看已经会了的部分上?那段时间感觉很好,可它按这门学问的说法,学习效率接近于零——我是在学习,还是在享受一种熟悉感?
我判断自己"学会了",用的是哪一个证据:读起来很顺,还是我在没有任何提示的情况下把它完整说出来过?如果是前者,我上一次检验过这个判断吗?
我正在给别人(学生、新人、孩子、团队)设计的那个"更轻松一点"的方案——它删掉的是无关的负担,还是替他删掉了那份必要的困难?我怎么分辨这两者?
十 延伸阅读 FURTHER READING
← PREVIOUS №075 岛屿生物地理学 HOME 百里路