百里路 / 心理 · 认知科学 · 教育
№ 071
LESSON 071 · PSYCHOLOGY
认知负荷理论
Cognitive Load Theory · 学不会,未必是因为难,常常是因为被设计坏了
- 提出者
- 约翰·斯威勒
- 年份
- 1988
- 领域
- 心理 · 认知科学 · 教育
- 核心约束
- 工作记忆一次只装得下约四件事
一
缘起 · 学生把题做出来了,却什么也没学会
ORIGIN
八十年代初,澳大利亚新南威尔士大学的约翰·斯威勒(John Sweller)在做一件当时看起来很无趣的事:给学生一堆几何题和代数题,看他们怎么解。
他撞上了一个反常的结果。学生把题做出来了,可他们并没有因此学会那类题。换一道结构相同、数字不同的题,他们还是从头摸索。
更奇怪的是那个"摸索"的方式。人在没有解法的时候会用一种叫手段—目的分析(means-ends analysis)的通用策略:盯住当前状态和目标状态的差距,找一个能缩小差距的动作,做完再看差距,再找下一个动作。这是一套极其管用的解题法——它几乎能解开任何题。
斯威勒的怀疑是:正因为它太管用了,它把脑子占满了。
用手段—目的分析解题的人,脑子里同时挂着一堆东西:现在的式子、要去的地方、刚才试过哪几步、这一步为什么。这些东西吃掉了全部的处理能力,于是没有余量再去做另一件事——注意"这一类题的结构长什么样"。他做完了题,却没有从题里带走任何可复用的东西。
1988 年,斯威勒把这件事写成一篇论文,发表在《认知科学》上。他没有发明新的心理学机制——工作记忆容量有限这件事,米勒 1956 年就写过了。他做的是把这条早已被承认、却从未被当真用于教学设计的约束,摆到了教材、课件、说明书、界面的正中央:
如果学习必须经过一条一次只通得过四件东西的窄门,
那么任何白白占用那条窄门的东西,都是在偷走学习本身。
这个理论后来成为教育心理学被引用最多的框架之一,也在过去十五年里遭到了本站少有的、来自内部与外部的双重清算:它的三分法被指无法独立测量,它的每一次复现失败都被吸收成一个新的边界条件——而写下这段话的人,正是斯威勒自己(见第六节)。
二
原典 · 会解题的策略,和会学习的策略,不是同一个
THE PRIMARY TEXT
SWELLER, 1988 · 认知负荷与学习
常规的问题解决活动,会把学习者的全部认知处理能力吸进"缩小当前状态与目标状态之间的差距"这件事里去。
而学会一类问题,需要的是另一件事:注意到问题状态与解题动作之间的对应关系,并把它存成一个可复用的图式。
两件事争夺同一份有限的资源。因此——一个能把题做出来的策略,可能恰恰是一个学不会那类题的策略。
John Sweller《Cognitive load during problem solving: Effects on learning》Cognitive Science 12(2), 1988, pp.257–285。上为原文核心论证的中译与转述。
此后二十年,这条命题被拆成了一个更细的框架。今天教科书里的标准版本,是把压在工作记忆上的负担分成三类——这个三分法是本篇后面所有争议的源头,请连着第六节一起读:
三种负荷 · 标准版本
一、内在负荷(intrinsic)。材料本身固有的难度,取决于元素交互性——你必须同时握住几个东西才能理解这一句。背一个生词,元素交互性接近零(一个一个背就行);理解一句语法,元素交互性很高(词序、时态、格、语义必须一起转)。这部分不能靠排版消除,只能靠拆解顺序和补先修知识。
二、外在负荷(extraneous)。由呈现方式造成的、对学习毫无贡献的负担:图在这一页文字在下一页、说明和界面不在一起、同一件事说了两遍要你自己对照、找来找去。这部分是纯税收,是设计者造成的,也只能由设计者取消。
三、相关负荷(germane)。真正投入到"把它整理成图式"上的那部分。它不是第四种资源,而是前两者用剩下的余量。
三分法在 Sweller、van Merriënboer 与 Paas 1998 年后的系列论文中定型;相关负荷的地位在 Sweller/Ayres/Kalyuga《Cognitive Load Theory》(Springer, 2011) 中被大幅修订(见反例①)。
整个理论最实用的一句推论就藏在这个三分法里:内在负荷是你要付的学费,外在负荷是被人多收的手续费。而绝大多数"这东西真难学"的抱怨,抱怨的其实是后者。
三
释义 · 一条极窄的门,和一间无限大的仓库
PLAIN MEANING
人的认知系统有一处极不对称的构造:
长期记忆几乎是无限的仓库。你能记住的东西没有实际上限——一个成年人认识几万个词,一个棋手脑子里存着数以万计的棋形。
工作记忆是通往仓库的一条极窄的门。窄到什么程度?米勒 1956 年给的数字是七加减二,而尼尔森·考恩 2001 年重新算过之后,把它压到了大约四个组块。
请注意"新东西"这个限定。这条窄门只对没见过的材料收费。从仓库里调出已经存好的整块知识,几乎不花钱——所以专家读一段术语密集的文字毫不费力,而同一段文字能把新手压垮。他们的门一样窄,区别在于专家那边一次进来的是一个箱子,新手那边是散落的四十个零件。
这就是图式(schema):把大量元素打包成一个可以整体调用的单位。学习的实质,就是不断地把零件装箱,让下一次通过窄门时少排几次队。
你的工作记忆不会变大。
能变的只有一件事:你一次拎进来的,是零件还是箱子。
由此得到本篇最该带走的那个判断动作。下次觉得某样东西"学不进去",先做一次分账:
是元素交互性高(它本来就要求你同时握住五六件事)——那就是真难,解法是拆步骤、补先修、降低一次要握的数量;
还是我在为找东西、来回翻页、对照两份说同一件事的材料付费——那不是难,那是被设计坏了,而这部分可以被修掉,且修掉之后进步会快得吓人。
最后一句校准,免得读反:这套理论说的是"别让无关的东西占满那条窄门",不是"别让难的东西出现"。把它读成"什么都要做得更简单",是它被误用得最广也最贵的一次(见反例⑤与连接卡"期望的困难")。
四
后人之论
LATER INTERPRETATIONS
五
案例
CASE STUDIES
CASE 01
1985 · 悉尼
让学生别做题,他反而学得更快
斯威勒与格雷厄姆·库珀做了一个与所有人直觉相反的实验:一组学生按常规做大量代数变形练习,另一组学生把同样的时间用来研究已经解好的例题——只看,不做。
结果是后一组学得更快,在后续测验上表现更好,且解题时间明显更短。这个结果此后在数学、物理、编程等多个领域被反复重复,叫做已解例题效应(worked example effect)。
解释回到 1988 那篇原典:做题的人被手段—目的分析占满,没有余量去提取结构;看例题的人不必自己找路,那份余量就全部落到了"这类题长什么样"上面。
启示:"多练"不是学习的通用解药,它只是某个阶段的解药。在还没有图式的时候,练习的主要产出是疲惫;在已经有图式之后,练习才开始变成熟练度。顺序错了,努力会被这条窄门原样吃掉。
CASE 02
1991 · 分散注意
同一份材料,只是把字挪进了图里
钱德勒与斯威勒的经典实验:给学习者一张几何图,配套的文字说明放在图的下方(或另一页),学习者必须记住文字里的"角 ABC"是哪个角,再回到图上去找它——找的过程中,前一句说了什么已经开始褪色。
对照组的材料内容一字不差,只做了一件事:把说明文字直接标进图中对应的位置。后者的学习效果显著更好。
这就是分散注意效应(split-attention effect):当两份必须整合的信息在空间或时间上被分开,学习者要先用工作记忆把它们搬到一起,而这份搬运费对理解毫无贡献。
启示:这是整套理论里最便宜也最常被忽略的一条改进。凡是必须一起看的东西,就该放在一起。代码与注释、界面与说明、图与图注、条款与它的例外——每一次"请参见第 X 页",都在向读者收一笔他不该付的税。
CASE 03
1973 · 棋盘
大师的记忆力,在随机棋局面前消失了
荷兰心理学家德赫罗特 1946 年就发现:给国际象棋大师看一个真实对局的局面五秒钟,他能重建出绝大部分棋子的位置,而业余棋手只能摆出几个。
1973 年,蔡斯与赫伯特·西蒙加上了那个决定性的对照组:把棋子随机摆在棋盘上,再让他们看五秒。结果大师的优势几乎完全消失——他记住的棋子数量落回到与新手相近的水平。
差别不在记忆力,在那盘棋是不是有意义。大师存下的不是二十几个棋子的位置,是"王翼易位后的典型攻势"这样几个箱子;随机局面无箱可装,他就只能一个一个零件地搬——和新手一样。
启示:本篇最干净的一份证据,因为它把"能力"与"容量"彻底切开了。专家并没有一条更宽的门,他只是把要搬的东西提前打包过。由此还得到一个冷一点的推论:一个人在自己领域里的惊人记忆力,几乎不迁移到别的领域——所谓"记性好",多半是"这里的东西他早就装过箱"。
CASE 04
冗余效应 · 每天都在发生
把要讲的话打在幻灯片上,然后念一遍
直觉说:讲一遍,再写一遍,学习者多一次机会,总不会更差。实验说:会更差。
这叫冗余效应——当同一份信息以两种形式同时呈现,而任一种单独已经足够,学习者并不会自动忽略多余的那一份。他会不由自主地去对照两者是否一致,而这个对照动作占用的正是那条窄门。
更麻烦的是,冗余与分散注意的处方方向相反:两份必须整合的信息要放到一起(案例 02),两份互相重复的信息则要删掉一份。判断哪一种,只有一个问题:把其中一份拿走,读者会不会漏掉信息?不会——那它就是在收税。
启示:这条效应解释了为什么念幻灯片的讲座如此难听,也解释了为什么加了"友情提示:以上内容的意思是……"的文档反而更难读。写作与讲解里的很多"体贴",实际上是替读者制造了一道对账工作。
CASE 05
2003 · 专长逆转
对新手最好的那份教材,把熟手教砸了
卡柳加团队把同一份带完整讲解的技术材料,分别给新手和已有经验的学习者。新手在讲解版上明显学得更好;有经验者在讲解版上的表现,反而低于拿到精简版的同伴。
这个结果之所以重要,是因为它把这套理论从"一套教学最佳实践"降格成了一套关于匹配的理论:任何一条"应该这样讲"的结论,都必须补上"对什么水平的人"。
它同时给理论自身带来了麻烦——见反例②:此后每当一个效应在某个实验里没有重现,都可以说"因为受试者的专长水平不同"。这个解释可能是对的,也可能是一件永远用不完的免责条款。
启示:组织里最常见的一种浪费,是给所有人发同一份材料。新人手册对老员工是噪音,专家备忘录对新人是天书——而两者的抱怨听起来一模一样:"这东西没用。"好的做法不是折中出一份谁都能看的,是准备两份,并且明确地把支架撤掉的时机写进流程。
六
反例与限制
CRITIQUE & LIMITS
这一节要写的东西,有相当一部分是这个学派自己写的。它最著名的三分法无法被分项测量,它最重要的修正同时是它最方便的免责条款,而它的创立者在 2023 年亲手把"复现危机"四个字写进了论文标题。
-
① 三种负荷分不开,因而近乎不可证伪。德容 2010 年那篇批评至今是这个领域最难回答的一篇。问题在于:实验能测到的只有一个总量,而理论要求把它拆成三份来解释结果。于是同一个"负荷升高",既可以被读成外在负荷(说明设计坏了),也可以被读成相关负荷(说明学习者在努力建构图式)——而这两种读法给出的建议正好相反。斯威勒等人在 2011 年做过一次实质让步:不再把相关负荷当作独立的第三种来源,改称它是工作记忆资源在内在负荷上的再分配。这在概念上更干净了,但也等于承认那个流传最广的三分图示不该被那样理解。
-
② 每一次复现失败,都被吸收成了一个新的边界条件。这是本篇最锋利的一处,因为同一份材料被双方各自当作证据。斯威勒 2023 年在《教育心理学评论》发表了一篇文章,标题里明明白白写着"复现危机",正文承认好几个曾被认为稳固的效应在后续随机对照试验里没有重现——但他的结论是:这些失败推动了理论的扩展(专长逆转、元素交互性等边界条件正是这么来的)。批评者读到的是另一件事:一个每次被打中都长出一层新解释的理论,正在离"可以被打倒"越来越远。两种读法都成立,而它们指向对这门学问完全不同的信心水平。
-
③ 主要的测量工具是一道主观题。大量研究里的"认知负荷",测法是任务后问学习者一句"刚才你付出了多少心理努力",在九点量表上打个分(Paas 1992)。这个量表出奇地好用,但它测的是感受:一份让人挫败的材料和一份让人思考的材料,都可能得高分。生理指标(瞳孔直径、眼动、脑电)与主观评分并不总是一致,而理论所需的分项数据,任何一种现有工具都给不出来。一个以"负荷"为核心的理论,至今没有一把能分项读数的尺。
-
④ "减少负荷"未必总是更好——这是它最重要的边界。另一条同样有大量证据的研究线索走的是相反方向:罗伯特·比约克的期望的困难(desirable difficulties)证明,间隔复习、提取练习、交错练习都会降低当下的表现与流畅感,却显著提高长期保持与迁移。两条线索常被拿来互相攻击,其实它们管的是不同阶段:认知负荷理论管"第一次理解一个新东西时,别被无关的东西占满";期望的困难管"已经理解之后,怎么让它留下来"。混用的代价很实在——用第一条的逻辑去反对第二条,会得出"复习应该轻松、材料应该顺滑",而这恰恰是记不住东西的可靠配方。
-
⑤ 最贵的误用:把它读成"什么都要更简单"。这套理论从没主张降低内容的难度,它主张的是不要用排版、跳转、装饰和重复去消耗那条本该用于理解的窄门。但在培训与内容行业里,它经常被翻译成"用户不爱动脑子,所以要注水、要拆成短视频、要什么都别让人想"——这是把"别收无关的税"偷换成了"别卖有价值的东西"。反方向的误用同样常见:极简界面把功能全藏进三层菜单,看上去清爽,实际上把"找东西"这项纯外在负荷加了倍。判据始终只有一个——你减掉的,是理解所必需的,还是理解之外的?
正确姿势:把它当一副追问"这份难度是从哪来的"的眼镜,而不是一套教学万能公式,更不是"内容应该更简单"的许可证。它最硬的一课与聪明才智无关:你的处理能力就那么多,而它每天被大量本可以避免的东西白白花掉——那些东西是可以被找出来并删掉的。
七
相关理论
CONNECTIONS
神奇的数字七 / 四Miller 1956 · Cowan 2001
⟸ 因果上游
整座理论压在这一条经验事实上:新信息的处理容量极小。米勒给七加减二,考恩校正到约四。数字变小了一半,而绝大多数界面与教材还是按旧数字设计的。
工作记忆多成分模型Baddeley & Hitch 1974
⟸ 认知架构
解释了为什么"图 + 语音"优于"图 + 文字":两条通道各有额度。多媒体学习设计的全部技术细节都从这里长出来。
图式与组块Schema & Chunking
⟹ 绕过瓶颈的唯一机制
窄门不能变宽,但通过它的东西可以先打包。学习的实质就是装箱——案例 03 的棋手是这件事最干净的证明。
期望的困难Desirable Difficulties · Bjork
⚠ 最该切开的对照
一个说要减负荷,一个说要加难度,看似对立,实为分工:减的是理解阶段的无关负担,加的是记忆阶段的提取难度。把两者混为一谈,是学习方法论里最常见的一次误配。
双重过程理论№062 Dual-Process Theory
↔ 同一处约束的两种写法
№062 里"类型二"唯一的定义特征就是
占用工作记忆。换句话说:认知负荷理论量的正是双重过程理论用来分类的那件东西。两篇讲的是同一条窄门,一篇从学习看,一篇从推理看。
生物初级 / 次级知识Geary · 与 №055 普遍语法呼应
⟸ 演化前提
斯威勒 2008 年后把杰里所做的区分吸收了进来:母语、面孔识别这类
初级知识人类演化出了自动获取的能力,不用教;而阅读、代数、编程这类
次级知识没有,必须显式教。
№055 争的正是第一类的边界——
这套理论只对第二类成立。
香农熵№010 Shannon Entropy
↔ 结构同构
№010 说信道有容量上限,超过就丢包。工作记忆就是一条容量极小的信道,而外在负荷是占了带宽却不携带信息的噪声。
教学设计的本质是一次编码问题。
古德哈特定律№005 Goodhart's Law
⚠ 误用警示
一旦"降低认知负荷"变成产品或课程的考核指标,被优化的就会是
看起来轻松而不是
真的学会——
№005 在这里的化身,是无限拆短、注水和把难点整段删掉。
八
致用
APPLICATION
以下五条里,第一、二、三条有直接的实验证据(分散注意效应、已解例题效应、冗余效应),第四条是判断习惯,第五条是边界提醒。
-
做文档与界面
凡是必须一起看的,就放在一起。注解标进图里而不是图下、说明贴在按钮旁而不是帮助中心、报错信息写清"这一行哪里错了"而不是给个编号让人去查表。每一句"详见第 X 节"都是一笔向读者收取的搬运费。反过来,同一件事说了两遍就删掉一遍——把要讲的话原样打在幻灯片上再念一遍,是最普遍的一种冗余。
-
学一样新东西
先看足够多的已解例题,再开始自己做。在还没有图式的阶段硬做题,产出主要是疲惫(案例 01)。但要立刻接上另一半:一旦开始有感觉,就要尽快撤掉例题——因为专长逆转效应意味着,那些帮过你的详细讲解会在某个时点变成噪音。判断时机的信号很简单:当你开始觉得"这段解释我看着有点烦",那多半不是它写得差,是你已经不需要它了。
-
带人与讲解
给不同水平的人准备不同的版本,并明确写下支架撤除的时机。新人手册与老员工备忘录不该是同一份。更具体的一条:讲解时不要同时要求对方"记住我刚说的"和"看着我现在写的"——先给结构,再填细节,让每一步只需要握住少数几个元素。一次讲清一件事,比一次讲全五件事,总产出高得多。
-
自我诊断
学不进去的时候先做一次分账:是元素交互性高(真的难,需要拆步骤、补先修),还是我在为找东西、跳转、对照、无关装饰付费?后者是能修的,且修掉之后进步会快得反常。很多被归结为"我不适合学这个"的挫败,实际来源是一份糟糕的教材——这个判断本身,就能省下一个人好几年的自我怀疑。
-
边界提醒
不要把"降低负荷"当成"什么都要更容易"。它管的是理解一个新东西的那一刻;一旦已经理解,规则就换成相反的一套:间隔、自测、交错,都会让当下更吃力而长期更牢固(见反例④)。判据是一句话:我减掉的这样东西,是理解所必需的,还是理解之外的?删掉后者叫设计,删掉前者叫注水。
九
反观三问
THREE QUESTIONS
我上一次说"这个太难了"——难的是内容本身,还是我在为它的排版、跳转和来回找东西付费?
我做出来的东西(文档、课件、界面、说明),有哪一处要求别人同时记住两件本可以摆在一起的东西?
我给新人的那份材料,对已经上手的人是不是早就变成了噪音——我有没有为不同水平准备不同的版本,还是指望一份材料伺候所有人?
十
延伸阅读
FURTHER READING
-
John Sweller《Cognitive load during problem solving: Effects on learning》
Cognitive Science 12(2), 1988, pp.257–285 — 原典;"会解题的策略未必是会学习的策略"就出自这里
-
John Sweller & Graham Cooper《The use of worked examples as a substitute for problem solving in learning algebra》
Cognition and Instruction 2(1), 1985, pp.59–89 — 已解例题效应的原始实验(案例 01)
-
George A. Miller《The Magical Number Seven, Plus or Minus Two》
Psychological Review 63(2), 1956, pp.81–97 — "我一直被一个整数迫害";请与 Cowan 2001(BBS 24, pp.87–114)对照着读
-
S. Kalyuga, P. Ayres, P. Chandler & J. Sweller《The Expertise Reversal Effect》
Educational Psychologist 38(1), 2003, pp.23–31 — 专长逆转;这套理论最重要的一次自我修正
-
Ton de Jong《Cognitive load theory, educational research, and instructional design: some food for thought》
Instructional Science 38, 2010, pp.105–134 — 本篇最推荐的批评文献;三分法为何无法被分项测量
-
John Sweller《The Development of Cognitive Load Theory: Replication Crises and Incorporation of Other Theories Can Lead to Theory Expansion》
Educational Psychology Review 35, 2023, article 95 — 创立者本人谈复现失败;请与上一条并读,两篇看的是同一批事实
-
J. Sweller, P. Ayres & S. Kalyuga《Cognitive Load Theory》
Springer, 2011 — 标准教科书;相关负荷地位的修订出自此书
-
维基百科:Cognitive load
en.wikipedia.org/wiki/Cognitive_load — 各项效应与三十余年争论的文献入口
米勒那篇论文的开场白是心理学史上最有名的句子之一:"我一直被一个整数迫害。七年来这个数字跟着我,闯进我最私密的数据,在我们最公开的期刊上袭击我。"他统计了各种任务里人能区分和保持的项目数,得出七加减二。
但米勒本人从未把它当成一个精确的容量常数,他更愿意称之为一个反复出现的巧合。真正把数字钉下来的是考恩 2001 年那篇长文:在排除了默念复述、长时记忆帮忙、组块合并之后,纯粹的工作记忆容量只有大约四个组块。
这一刀砍掉的不只是三个位置。它意味着你为界面、教材、说明书预留的"人应该能同时记住的东西",多半比真实容量大了一倍。
巴德利与希奇提出:工作记忆不是单一容器,而是由一个中央执行系统协调的多个子系统——一条语音回路(处理听到和默念的语言),一块视觉空间画板(处理看到的形状与位置)。
这个结构给了认知负荷理论一个极其实用的推论:两条通道各有各的额度。一张图配一段朗读的解说,比同一张图配一段印在旁边的文字更好学——因为后者把图和字塞进了同一条视觉通道,前者把负担分给了两条。
这条推论后来长成了理查德·梅耶的多媒体学习理论,也是"讲课时别把要说的话全打在幻灯片上"这一条最硬的科学依据。
这是这套理论最重要、也最诚实的一次自我修正。卡柳加与艾尔斯、钱德勒、斯威勒发现:那些被证明对新手极其有效的设计,用在熟手身上会反过来伤害他们。
机制并不神秘。详细的讲解、贴在图上的注解、一步一步的引导,对新手是脚手架;而熟手脑子里已经有了图式,他必须把你给的讲解与自己已有的那一套逐条对照——这个对照动作本身就要占窄门。同一份材料,对他就从支架变成了冗余。
由此得到教学设计里最该被记住的一句话:不存在普遍最优的讲法,只存在与当前水平匹配的讲法。并且,随着学习者进步,好的设计必须主动撤掉自己的支架。
荷兰特文特大学的德容在《教学科学》上发表了一篇至今没有被真正回答的清算文章。他的核心指控不是"这个理论错了",而是"它没法被证明是错的"。
三条要害:其一,三种负荷无法被独立测量——实验里能测到的只有一个总量,谁高谁低全靠事后归因;其二,相关负荷与内在负荷在概念上难以切开,前者按定义就是投在后者上的努力,于是"效果好是因为相关负荷高"接近同义反复;其三,"负荷"这个词在文献里同时指材料的属性、任务的属性和人的感受,三者被反复混用。
德容并不否认那些实验效应是真的。他反对的是用一套无法分项测量的概念,去解释一堆彼此矛盾的结果——因为那样的话,无论实验结果朝哪个方向,理论都能说自己赢了。