百里路 / 心理 · 学习科学 · 记忆
№ 076
LESSON 076 · PSYCHOLOGY
遗忘曲线与期望的困难
Forgetting Curve & Desirable Difficulties · 学的时候越顺,将来剩下的越少
- 提出者
- 赫尔曼·艾宾浩斯 / 罗伯特·比约克
- 年份
- 1885 / 1994
- 领域
- 心理 · 学习科学 · 记忆
- 核心命题
- 当下的表现,不是学习的证据
一
缘起 · 一个人对自己做了七百多个小时的实验
ORIGIN
1879 年,没有人认为"记忆"是一个可以被测量的东西。它属于哲学:柏拉图的蜡板、洛克的白纸、联想主义者的争论——全是比喻,没有数字。当时的主流意见相当明确:高级心智过程不可能进实验室。
赫尔曼·艾宾浩斯(1850–1909)不同意。而他手边唯一可用的实验对象,是他自己。
他先解决了一个别人没想清楚的问题:用什么材料?如果背的是诗、是句子、是有意义的词,那么每个人过去的经历、联想、兴趣都会掺进来——你记住"月亮"用了多久,取决于你这辈子和月亮打过多少交道。于是他做了一件极端的事:造出大约两千三百个无意义音节(辅音-元音-辅音,如 ZOF、QAX),把"意义"从材料里彻底剥掉,好让每一个音节对他而言都同样陌生。
然后他解决了第二个问题:怎么度量"还剩多少"?回忆不出来不等于什么都没剩下。他的办法后来被称为节省法:先把一张表背到能一字不差地连背两遍,隔一段时间之后再把同一张表重新背到同样的标准,看第二次省下了多少时间。省下 60%,就说明那 60% 还留在里面——哪怕你一个音节也想不起来。
他既是实验者,也是唯一的被试。
前后数年,节拍器打着拍子,
一个人把自己背了七百多个小时。
1885 年,《论记忆》出版。人类第一次拿到了一条遗忘曲线:一条先陡后缓、掉得极不均匀的线。心理学从此有了实验的一半。
这门学问的后一半要再等一百年。艾宾浩斯回答的是"会忘多少";他没有问、也没能力问的那个问题是——那么,什么样的学习方式能少忘一点?而这个问题的答案,在一百年后被证明是反直觉的:几乎所有让学习当下变轻松的做法,都在让长期记住的更少。
二
原典 · 一条曲线,与一个把它掀翻的概念
THE PRIMARY TEXT
这一课有两块地基,隔着一百零九年。第一块是那条曲线。
EBBINGHAUS, 1885 · 遗忘曲线(节省法读数)
以"重新学会所节省的时间比例"衡量残留量,一张无意义音节表在学会之后的保留情况大致是:
约 19 分钟后 —— 58.2%
约 1 小时后 —— 44.2%
约 1 天后 —— 33.7%
约 6 天后 —— 25.4%
约 31 天后 —— 21.1%
真正的结论不是这几个数字,而是这条线的形状:掉得极不均匀。第一个小时里失去的,比后面整整一个月失去的还多;而熬过最初那一段之后,曲线趋于平缓,剩下的那部分相当顽固。
换句话说:遗忘不是匀速的流失,是一次陡降加一条长尾。
Hermann Ebbinghaus《Über das Gedächtnis: Untersuchungen zur experimentellen Psychologie》,Duncker & Humblot, Leipzig, 1885(英译 Memory: A Contribution to Experimental Psychology, Ruger & Bussenius 译, Teachers College, Columbia University, 1913)。以上为其节省率数据的转述;这些数字来自单一被试(作者本人)在无意义音节上的测量,适用范围见第六节①。
第二块地基把整件事翻了个面。它不谈"会忘多少",只谈一件事:你在学习当下感觉到的一切,都不能当作学会了的证据。
R. A. BJORK, 1994 · 期望的困难(DESIRABLE DIFFICULTIES)
在学习过程中制造困难——把练习分散开、把内容打散交错、要求自己回忆而不是重看、延迟给出反馈——会让当下的表现变差、学习者的感觉变糟,却会显著提高长期的保持与迁移。
反过来同样成立,而且这一半更要紧:那些让学习当下变得顺畅的做法(反复重读、集中突击、把答案摆在眼前),能可靠地抬高当下的表现,却几乎不留下什么。
因此本条最硬的一句是:
表现 ≠ 学习(performance is not learning)。
训练期间可测量到的表现,是一个不可靠的指标——它经常与长期结果背道而驰。
而"期望的"三个字是一道限定,不是修辞:只有当学习者有能力应对这份困难时,它才是期望的。否则它就只是困难。
Robert A. Bjork《Memory and Metamemory Considerations in the Training of Human Beings》,收于 J. Metcalfe & A. Shimamura (eds.)《Metacognition: Knowing about Knowing》,MIT Press, 1994, pp.185–205。上为核心主张的概括与转述,非逐字翻译。
三
释义 · 记忆有两个强度,而你只感觉得到其中一个
PLAIN MEANING
为什么"更轻松"会等于"记住得更少"?把这件事讲清楚的,是比约克夫妇提出的一个很朴素的区分:记忆不是一个量,是两个量。
存储强度——这样东西在你脑子里被建得有多牢。它几乎只增不减。
取回强度——此时此刻,它有多容易被你想起来。它掉得飞快。
你能感觉到的,只有取回强度。刚读完一段,它的取回强度是满的,于是一切都"很熟悉、很顺、我懂了"。可这份熟悉几乎不携带任何关于存储强度的信息——而一周后要拿出来的,是存储强度。
更妙的是这套理论的第二条,它一句话解释了后面所有的实验:
一次取回带来的存储强度增益,
与取回时的费力程度成正比。
越是快想不起来的时候把它想起来,
它长得越牢。
由此,"再看一遍"为什么几乎无效就变得很自然了:你去看它的时候,它的取回强度正满着——在这种状态下再刺激一次,几乎学不到任何东西。你只是把一个已经亮着的灯又按了一次开关,然后把这份亮当成了自己的成绩。
整门学问的四件工具,全都只做同一件事——把取回强度先降下去,再让你自己把它捞上来:
- 间隔(spacing):把复习拉开,等它掉一点再回来。掉下去的那一段,正是你要买的东西。
- 提取练习(retrieval practice):合上书把它说出来,而不是再读一遍。提取不是在检查学没学会,提取本身就是一次学习事件。
- 交错(interleaving):把不同类型的题目、不同的技能打散混着练,逼你每次都先判断"这是哪一类"。
- 生成(generation):先自己试着答一次(哪怕答错),再看正确答案。失败的尝试也会让随后那次学习更有效。
而最容易被记反的一句,值得单独写下来:这不是"越难越好"。它说的是某一类特定的困难——那些迫使你去提取、去辨别、去重构的困难。字体印得模糊、教室里很吵、老师讲得混乱,同样是困难,但它们只消耗资源,不产生提取,属于该被删掉的那一类(№071 管的正是它们)。
一句话记住这门学问:你感觉到的顺畅,是取回强度的读数;你需要的,是存储强度。而这两者,在很多时候是反着走的。
四
后人之论
LATER INTERPRETATIONS
五
案例
CASE STUDIES
案例 01
一个人,两千三百个无意义音节
柏林 · 1879–1885
艾宾浩斯的实验条件在今天看来近乎苛刻到荒谬:唯一的被试是他自己;为了控制速度,他用节拍器打拍;为了避免材料被"意义"污染,他造出无意义音节;为了避免时段影响,他把不同条件安排在一天中的同一时间。
他要的不是"人的记忆是什么样",而是一件更基本的事:证明记忆可以被测量。而他为此付出的代价,正是这门学问此后一百年的软肋——他必须先把意义从材料里剥掉。
这是心理学史上最著名的一次取舍:为了让一样东西可测量,先把它身上最要紧的属性拿掉。由此得到的曲线是真的,而它描述的那种"学习",与你背专业名词、读一本书、学一门手艺之间隔着多远,则是另一个问题——第六节①就是从这里长出来的。
案例 02
五分钟之后与一周之后,排名整个翻了过来
华盛顿大学 · 2006
罗迪格与卡皮克让学生读同一批科普短文,然后分成三种安排:读四遍(SSSS)、读三遍加一次回忆(SSST)、读一遍加三次回忆(STTT)。回忆时没有反馈,也不许再看原文。
五分钟后测:读得最多的组最好,成绩依次是 83% / 78% / 71%,完全按接触次数排列,符合所有人的直觉。
一周后再测同一批人:40% / 56% / 61%。
顺序整个倒了过来。读四遍的那一组,一周里掉掉了一大半;只读了一遍、却回忆了三次的那一组,几乎没怎么掉。
这可能是整门学问最该被记住的一张表。它说的不是"测验有用"这么小的一件事,而是:任何在学习当下做出的比较,都可能给出与长期完全相反的答案。如果这个实验只做到五分钟就收工——而现实中绝大多数的评估、试点、培训反馈都是这么收工的——它得到的结论会是"重复阅读最有效"。
案例 03
斯瓦希里语词表,与那份错得离谱的自我预测
《Science》 · 2008
卡皮克与罗迪格让学生学 40 组斯瓦希里语-英语词对,学习与测验交替进行。关键的操作在于:当一个词对被答对之后,它会怎么处理?四种条件分别是——继续留在复习堆里、继续留在测验堆里、两边都留、两边都拿掉。
一周后:那些答对之后仍然被反复提取的词,学生记住了约八成;而那些答对之后只被反复重看的词,只剩下三分之一左右。换句话说,在已经答对之后再多学几遍,对一周后的成绩几乎没有任何作用;而再多测几次,作用极大。
而这篇论文真正令人不安的一栏在最后:实验结束时,研究者问每个学生预测自己一周后能记住多少。各组的预测几乎没有差别。
差距不在于哪种方法有多神奇,而在于学习者完全看不见这个差距。你可以用一种一周后只剩三分之一的方法学习,同时对自己的状态感到相当满意——因为在你停下来的那一刻,两种方法的感觉一模一样。
案例 04
十二位不知名画家:数据赢了,直觉输了,而人相信直觉
加州大学洛杉矶分校 · 2008
科内尔与比约克让参与者学习辨认 12 位相对冷门画家的风格,每人 6 幅画。一半人看的是集中安排(同一位画家的 6 幅连着放),另一半是交错安排(不同画家的画混着放)。随后拿出没见过的新作品,让他们判断出自谁手。
交错组的正确率约 .61,集中组约 .35。差距很大,方向很清楚。
接着研究者问参与者:你觉得哪种安排更有帮助?绝大多数人选了集中——包括很多自己刚刚在交错条件下考得明显更好的人。
这一条把问题推到了最尖锐处:不是人们没有数据,是人们有了数据也不信。因为集中呈现时,你会在第三幅画时产生"我看出这个人的风格了"的清晰感受,而交错时你会一直觉得吃力、混乱、没把握。那份吃力正是它在起作用的证据,而人把它读成了"这个方法不行"。
案例 05
把十种学习方法排了一次序,最流行的两种垫底
《Psychological Science in the Public Interest》 · 2013
邓洛斯基团队评级的十种方法里,实践测验与分散练习拿到高效用;重读与划重点被评为低效用;其余多数落在中间,或因证据不足而无法定论。
值得注意的是评级标准并不苛刻:它同时考虑了效果证据、适用的材料与人群范围、以及"学生自己能不能用起来"。也就是说,被评为高效用的那两种,恰恰也是最便宜、最不需要培训、最容易自己操作的两种。
这份报告的分量在于它是一份可执行的清单,而不是又一个实验室结论。它把这门学问的现实处境摆得很清楚:已知的最有效的两种学习方法,几乎不花钱、不需要任何工具、也早就人人可及——而绝大多数人仍然不用。缺的从来不是方法,是那个坏掉的仪表。
六
反例与限制
CRITIQUE & LIMITS
这一节要拆两样东西:那条被引用得最多的曲线,和那个被引用得最松的概念。
-
① 那些精确到小数点的百分比,来自一个人和一堆无意义音节。艾宾浩斯的数据是 n = 1(他自己)、材料是刻意剥掉意义的音节、度量是间接的节省率。把 "20 分钟后忘掉 42%、一天后忘掉 66%" 这类数字直接搬到你背的单词、读过的书、开会听到的内容上,没有任何依据——而市面上大量记忆类产品的宣传页正是这么用的。有意义的材料、有结构的知识、亲身经历的事件,其保持曲线与这条并不相同,通常平缓得多。这条曲线证明的是"遗忘有规律且可测量",不是"你会在明天丢掉三分之二"。
-
② 它的数学形状至今没有定论。常见说法"遗忘是指数衰减"并没有被数据选中。鲁宾与温泽尔 1996 年在《心理学评论》上做过一次彻底的清算:收集 210 组已发表的保持数据,逐一去拟合 105 个不同的两参数函数。结果是有四个函数(对数、幂、根号指数、根号双曲)拟合得都不错,而现有数据难以在它们之间分出高下。一条被画进无数 PPT 的曲线,它的方程其实是开放问题。
-
③ 复现成功了,但同时改掉了它的形状。2015 年穆勒与德罗斯在《PLOS ONE》上用同样的方法重做了这个实验(同样是单一被试,花了约 70 小时,间隔从 20 分钟到 31 天)。好消息是曲线大体重现了;而不太好的消息是:它不是一条光滑的滑梯——在 24 小时那个点上出现了一个向上的跳。睡眠很可能在其中扮演了角色。一条流传了一百三十年的曲线,在被认真重做时长出了一个原来没有的拐点,这本身就值得记一笔。
-
④ "期望的"三个字是限定条件,而它几乎总是在传播中被丢掉。这是本篇最重要的一条边界:困难只有在学习者能够克服它时,才是期望的困难。对基础薄弱的学习者、对已经被占满认知资源的人、对完全陌生的领域,加难度不会带来提取,只会带来失败与放弃——它就只是困难而已。这条边界正是 №071 认知负荷理论的辖区,两条线索长期互相攻击,其实管的是不同阶段:№071 管"第一次理解一个新东西时别被无关的东西占满",本篇管"已经理解之后怎么让它留下来"。先降负荷,再加难度——顺序反了,两边都会翻车。
-
⑤ 材料一复杂,提取练习的效果就开始有争议。2015 年,范霍赫与斯韦勒在《教育心理学评论》上提出一个不客气的边界主张:随着学习材料的复杂度(元素交互性)上升,测试效应会减弱,在很复杂的材料上甚至可能消失。同一期里卡皮克与奥伊做了正面回应,指出"元素交互性"缺乏可量化的定义、因而在他们的文献综述里被前后不一致地使用,并且有多项在复杂材料上得到提取练习效果的研究被漏掉了。这场争论至今没有裁决。可以稳妥带走的是:在词汇、事实、概念这类材料上,提取练习的证据非常硬;在需要整合大量相互作用元素的复杂问题解决上,它有多大用处,仍是开放问题。
还有一条不算反例、但使用者必须知道的事:这门学问的绝大多数证据来自实验室、短材料、以及数周量级的保持期。"学会某样东西之后十年还能用"这种真正要紧的时间尺度,几乎没有人做得起对照实验。方向是可靠的,具体的剂量与幅度请当作估计而不是配方。
七
相关理论
CONNECTIONS
新失用理论A New Theory of Disuse · Bjork & Bjork 1992
⟸ 机制骨架
存储强度与取回强度的二分,是本篇所有实验结果的共同解释。它同时解释了效果与错觉:起作用的是存储强度,你感觉到的是取回强度,而后者在集中重读时最高、在最该学习的时候最低。
提取练习与测试效应Retrieval Practice / Testing Effect
⟹ 最强的一件工具
把"测验"从评估工具改写为学习事件。它最反直觉的一点是:不给反馈也有效——起作用的是提取这个动作本身,而不是随后知道了答案。这也意味着它不需要老师、不需要系统、不需要任何人在场。
间隔重复算法Spaced Repetition · SuperMemo / Anki
⟹ 工程化身
把间隔效应做成软件:每张卡片按你上次答得多顺来安排下次出现的时间。方向是对的,精度是假的——那些"下次复习在 4.7 天后"的数字,其底层证据远不如它显示出来的位数那么精确(见第六节①②)。当工具用可以,当科学读不行。
认知负荷理论№071 Cognitive Load Theory
⚠ 最该切开的对照
一个说"删掉困难",一个说"制造困难",看起来针锋相对,其实管的是不同的东西:
№071 要删的是
与理解无关的负担(找东西、来回翻页、对照两份说同一件事的材料),本篇要加的是
迫使你提取的困难。
把两者混为一谈,是学习方法论里最常见的一次误配。
双重过程理论№062 Dual-Process Theory
↔ 那份"顺畅感"是怎么来的
流畅感是
№062 里那种"自己送上门、不占工作记忆"的信号:它来得快、感觉确定、且不带任何"我可能错了"的标签。
本篇整套装置,本质上是在教你不要采信这个信号。
邓宁-克鲁格效应№012 Dunning-Kruger
↔ 同一处元认知故障
№012 说的是"判断自己会不会,需要另一套能力";本篇给出了这套故障在学习里的具体读数——
案例 03 里那份各组几乎相同的自我预测,是一次干净的实测:人对自己记住了多少的估计,与实际记住的量可以完全脱钩。
古德哈特定律№005 Goodhart's Law
⚠ 教育考核的经典翻车
"表现 ≠ 学习"接上
№005 就得到一条很硬的推论:
一旦把训练期间的表现设为考核目标,被优化的必然是短期表现,而它与长期保持常常反向。课时结束后的满意度、培训后的即时测验、季度末的达标率——这些指标不是不准,是它们所奖励的做法恰好是长期最差的那一批。
反脆弱№002 Antifragility
↔ 同族直觉,但请留意边界
适度的压力使系统变强、过度保护使其退化——
№002 的形状与"期望的困难"确实同族。
但本篇给出了那个 №002 通常给不出的东西:剂量与边界。困难必须可被克服、必须产生提取、必须在有能力承受的人身上,否则它就只是损害。
"越难越好"不是这门学问的结论。
八
致用
APPLICATION
先划线:第一、二、三条有直接实验证据(提取练习、间隔剂量、交错),第四条是判断习惯,第五条是边界与伦理提醒。第六节④⑤对这里全部有效。
-
学任何东西:把"再看一遍"换成"合上书说一遍"
这是本篇唯一一条几乎无成本、且证据最硬的改动。具体做法:读完一段,合上,写下三条你记得的要点,然后再回去对;把笔记从"摘抄"改成"问题在正面、答案在背面";读完一本书先复述再看目录。关键在于必须真的先想不起来一会儿——扫一眼答案再"回忆",等于什么也没做。附带一句给不喜欢考试的人:这件事与考试无关,它可以完全发生在你一个人走路的时候。
-
排期:间隔多长,取决于你要保留多久
粗略的剂量(塞佩达等 2008):一周后要用,隔一天左右复习;一个月后要用,隔一周左右;一年后要用,隔一个月上下。由此推出一个诚实但不讨喜的结论:考前一晚把材料全塞进去,确实能提高明天的分数,而且几乎不留下任何东西——这不是道德问题,这是两个不同的目标,而它们要求相反的安排。如果你的目标是三年后还用得上,那么"每次都隔到有点想不起来了再回来"就是那条对的曲线。
-
交错:把同类的东西打散混着练,并预先接受它感觉更糟
练琴不要把一段重复三十遍再换下一段;做题不要一次做完二十道同类型题;学新工具不要一个功能吃透再学下一个。混着来,逼自己每次先判断"这是哪一类"——因为真实场景里从来不会有人先告诉你该用哪个方法。务必事先知道代价:交错会让你当下的正确率下降、感觉更混乱(案例 04)。那份变糟的感觉不是失败信号,恰恰是它在起作用的信号——但也正因如此,它是最容易被中途放弃的一条。
-
别用"感觉"评估学习:换三个更可靠的替身指标
"读起来很顺""这个我懂了""看着眼熟"这三种感受,与你一周后还剩多少几乎无关。换用这三条:其一,能不能在没有任何提示的情况下把它说出来;其二,能不能讲给一个外行听懂;其三,隔一天之后还能不能做到前两条。只有第三条是真正的证据,因为前两条在刚学完的当天几乎总能做到。同一把尺子也适用于判断别人是否掌握——问"讲讲看",而不是问"懂了吗"。
-
给别人加难度之前,先确认他跨得过去
这是全篇最容易被滥用的一条,也是最该谨慎的一条。"期望的困难"绝不是"多为难人有好处"的许可证——教学、带新人、育儿场景里,把这四个字用来正当化"我就不告诉你,你自己去撞"是彻底的误读。可用的判据只有一个:这份困难是否迫使他去提取、去辨别、去重构?他是否有能力完成这次提取?如果他连基础都没有,你加的不是期望的困难,只是失败(№071)。顺序永远是:先把无关的负担删干净,再把必要的困难留下来。另一半提醒给管理者:既然表现不等于学习,那么训练期间看起来效果最好的那个方案,很可能正是长期最差的那个——评估培训、试点、教学法,请至少隔一段时间再测一次。
九
反观三问
THREE QUESTIONS
我最近一次学新东西,有多少时间花在重看已经会了的部分上?那段时间感觉很好,可它按这门学问的说法,学习效率接近于零——我是在学习,还是在享受一种熟悉感?
我判断自己"学会了",用的是哪一个证据:读起来很顺,还是我在没有任何提示的情况下把它完整说出来过?如果是前者,我上一次检验过这个判断吗?
我正在给别人(学生、新人、孩子、团队)设计的那个"更轻松一点"的方案——它删掉的是无关的负担,还是替他删掉了那份必要的困难?我怎么分辨这两者?
十
延伸阅读
FURTHER READING
-
Hermann Ebbinghaus《Über das Gedächtnis》
Duncker & Humblot, 1885(英译《Memory: A Contribution to Experimental Psychology》, Teachers College, Columbia University, 1913)— 原典;实验心理学的开端之一,也是那条曲线的唯一出处
-
Jaap M. J. Murre & Joeri Dros《Replication and Analysis of Ebbinghaus' Forgetting Curve》
PLOS ONE 10(7): e0120644, 2015 — 一百三十年后的认真复现;请与上一条对照着读,曲线重现了,但在 24 小时处多了一个拐点
-
Robert A. Bjork & Elizabeth L. Bjork《A New Theory of Disuse and an Old Theory of Stimulus Fluctuation》
收于 A. Healy, S. Kosslyn & R. Shiffrin (eds.)《From Learning Processes to Cognitive Processes》Vol.2, Erlbaum, 1992, pp.35–67 — 存储强度与取回强度;本篇释义那一节的全部来源
-
Robert A. Bjork《Memory and Metamemory Considerations in the Training of Human Beings》
收于 Metcalfe & Shimamura (eds.)《Metacognition: Knowing about Knowing》MIT Press, 1994, pp.185–205 — "期望的困难"与"表现不是学习"的正式出处
-
Henry L. Roediger III & Jeffrey D. Karpicke《Test-Enhanced Learning: Taking Memory Tests Improves Long-Term Retention》
Psychological Science 17(3), 2006, pp.249–255 — 案例 02;那张五分钟与一周排名互换的表
-
Jeffrey D. Karpicke & Henry L. Roediger III《The Critical Importance of Retrieval for Learning》
Science 319(5865), 2008, pp.966–968 — 案例 03;答对之后再学无用、再测有大用,而学生自己毫无察觉
-
Nicholas J. Cepeda et al.《Distributed Practice in Verbal Recall Tasks: A Review and Quantitative Synthesis》
Psychological Bulletin 132(3), 2006, pp.354–380 — 间隔效应的大规模元分析(184 篇文章、317 个实验、839 次测量)
-
John Dunlosky et al.《Improving Students' Learning With Effective Learning Techniques》
Psychological Science in the Public Interest 14(1), 2013, pp.4–58 — 案例 05;十种方法的评级报告,本篇最可直接执行的一份材料
-
Tamara van Gog & John Sweller《Not New, but Nearly Forgotten: the Testing Effect Decreases or even Disappears as the Complexity of Learning Materials Increases》
Educational Psychology Review 27(2), 2015, pp.247–264 — 本篇最推荐的批评文献;请连同同期 Karpicke & Aue 的回应(同刊 27, pp.317–326)一起读,这场争论至今未决
-
Peter C. Brown, Henry L. Roediger III & Mark A. McDaniel《Make It Stick: The Science of Successful Learning》
Harvard University Press, 2014 — 面向普通读者的完整版;由做出案例 02、03 的研究者亲自写
-
维基百科:Forgetting curve
en.wikipedia.org/wiki/Forgetting_curve — 曲线形式、复现文献与争论的索引入口
1992 年的《新失用理论》给出了上一节那个两强度框架。它之所以重要,不在于优雅,而在于它一口气解释了一堆此前互不相干、甚至看起来矛盾的实验结果:为什么间隔比集中好、为什么测验比重读好、为什么当下表现越好的训练方案长期效果反而越差。
其中一条推论尤其反直觉:取回强度接近满格时,学习效率接近零。这意味着你在"这个我已经会了"的状态下多花的每一分钟,几乎都是浪费——而那恰恰是人最愿意花时间的地方,因为它感觉最好。
两年后,罗伯特·比约克给这一整套做法起了那个后来传遍全世界的名字:期望的困难。同时他反复强调的另一句话,其实比这个名字更该被记住——表现不是学习。
他本人后来多次提醒:这个概念被引用得越多,被砍掉的限定词就越多。"期望的"三个字是有条件的,见第六节④。
在他们之前,"测验"在教育里的角色是明确的:测量。你学,然后我考,考试是一把尺子,尺子不改变被量的东西。
罗迪格与卡皮克把这个默认拆掉了。他们证明的是:每一次成功的提取,都会改写记忆本身。考试不是尺子,是一次训练;而且是比再学一遍更有效的训练。这个现象被称为测试效应,今天更常被叫作提取练习——后一个名字更准确,因为它与考试、分数、评价毫无关系,一个人在通勤路上默默回忆昨天读过的东西,就已经在做这件事。
他们最有力的两组数据在案例 02 和案例 03。而其中真正让人不安的部分不是效果的大小,是学习者对这个效果完全无感:在同一批实验里,那些一周后只剩三分之一的人,事前对自己的估计和赢家一模一样。
这一卡的实践含义只有一句:如果你把测验只当成评估工具,你就浪费掉了它一半以上的价值。
"分散比集中好"是心理学里最老、最稳固的结论之一(可以一路追到艾宾浩斯本人)。但它长期停在定性层面:隔多久?
2006 年,塞佩达等人做了一次大规模元分析——在 184 篇文章、317 个实验中收集了 839 次对分散练习的测量。结论是间隔效应稳固存在,且最佳间隔随"你要保留多久"而变。
2008 年那篇更实用:一千三百多人学同一批事实,复习的间隔从几天到三个半月不等,最终测验最远推到一年后。得到的是一条"温度岭"——间隔太短没用,太长也没用,中间有一个最优值,而这个最优值随保留期拉长而变大(但占保留期的比例在缩小)。粗略地说:一周后要用,隔一天左右;一年后要用,隔一个月上下。
这一卡的价值是把一句口号变成了剂量。而它同时暗示了一个很多人不爱听的推论:为明天的考试而复习,和为三年后还会用而复习,是两种不同的安排,不存在一种排法同时最优。
2013 年,邓洛斯基与四位合作者在《公共利益中的心理科学》上做了一件很实在的事:把学生实际在用的十种常见学习方法翻遍文献,按证据强度、适用广度和落地难度评级。
结果只有两种方法拿到高效用评级:实践测验(也就是提取练习)与分散练习。
而被评为低效用的名单里,赫然站着学生最常用的两样:重读与划重点。
把这两份名单叠在一起看,得到的是本篇最刺眼的一张图:最流行的方法,恰恰是排在最后的方法。而原因在第六节之前就已经交代过了——重读和划线能立刻制造出流畅感,而人是用流畅感来判断"我学会了"的。
这不是学生懒。这是一个测量工具坏了:他们手里唯一那个关于"学没学会"的仪表,恰好是被无效方法拨得最高的那一个。