关于 AI 如何支持持久学习、个性化练习和更充分的教师洞察——同时不沦为答案机器的一份第一性原理草图。
简而言之
AI 应当守护学习所需的认知投入,而不是直接把答案递给学生。2025 年的一项研究发现,使用通用 GPT 的学生在练习时表现更好,但在没有 AI 辅助的考试中,成绩反而低了 17%。我设想的模式是:学生先尝试、再解释,并在之后提取和回忆所学;AI 则通过提示、追问和间隔复习提供支持,而学习目标、人际关系和判断仍由教师把握。
我总是忍不住反复思考一个有点令人不安的问题:如果我们正在用人工智能让学生更擅长完成作业,却让他们变得更不会学习,该怎么办?
AI 很擅长迅速给出答案。但教育肩负着另一项任务:让一个人能够在答案——甚至 AI——不再摆在面前时,依然记得、讲清、质疑并运用所学。
这个区别听起来显而易见,但我不确定现有产品是否真的围绕它来设计。
大多数通用 AI 工具都以尽快提供帮助为目标。提出问题,得到一份润色完善的回答,然后继续下一步。若目标是完成任务,这很有用;但如果学生需要在日后独立提取并运用所学,这种方式就可能适得其反。
我一直在思考另一种可能:不是把 AI 当作答案机器塞进教育,而是有意识地把它融入学习闭环。它帮助学生接触一个概念、动手尝试、说明自己的理解、日后再次回顾,并逐渐把这个概念真正内化。它也能为教师提供更充分的理解情况证据,同时守护教育中至关重要的人际关系。
下面的内容并非一套定型方案,而是一份从第一性原理出发、希望接受检验并经得起推敲的草图。

图示|答案机器与学习闭环的对比
表现好,不等于学得好
我看到的最有力警示,来自 2025 年一项涉及近 1,000 名高中数学学生的研究。使用通用 GPT 界面的学生在练习时表现明显更好;但在一场没有 AI 辅助的考试中,他们的成绩比对照组低了 17%。另一种约束更明确的辅导工具采用了保护机制和由教师编写的提示,基本消除了这种负面影响;但它同样没有让学生在无辅助考试中取得明确的进步。研究者的结论并不是 AI 不该进入教育,而是缺乏护栏的生成式 AI 可能提升即时表现,却妨碍真正的学习。
“借助工具表现出色”和“学到足以脱离工具独立完成”的差距,正是我认为问题的核心。
这也让我们能提出一个更好的问题。与其问“AI 有没有帮学生答对?”,不如问:“学生现在能做到哪些以前做不到的事?”
目前的早期证据并不一致,而这恰恰说明值得认真研究。2025 年一项针对本科物理课程的随机对照试验发现,经过精心设计、配有支架的 AI 辅导,在更短时间内带来了比主动学习课堂更大的即时学习增益。这是令人鼓舞的结果。不过,这项研究只涉及 194 名大学生、两节课和短期后测;它并不能告诉我们,在一个八年级课堂里持续一年会发生什么。
一份2026 年关于 K–12 教育中 AI 因果证据的综述给出了更审慎的判断:有些工具能提升有人辅助时的表现;一些结构化辅导工具显示出潜力;但在独立推理和持久学习方面,结果仍不一致。设计、情境和学习者本身都很重要。
这种不确定性并不是袖手等待别人找出答案的理由,而是要求我们明确自己究竟想改善什么。
学习不只是接触信息
启发我思考的一个观点是:学习与其说取决于接触多少信息,不如说取决于能否把所学提取出来。
读一段清晰的解释,会让人觉得某个概念很熟悉。认出它会带来安心感,但很容易把这种熟悉误当成真正理解。更难、也更可靠的检验是:过一段时间后,我还能不能想起这个概念?能不能用自己的话讲明白?能不能把它和已有知识联系起来,并运用到新的情境中?
关于提取练习的证据已经相当扎实。主动把知识从记忆中提取出来,相比反复重读同一材料,能够带来更牢固的长期记忆和更灵活的迁移能力。复习的间隔也很重要:把对一个概念的回顾分散到一段时间内,而不是挤在一次学习中,通常有助于记忆;不过,合适的间隔取决于知识何时会派上用场,以及学习的内容是什么。一项追踪学习者长达一年的大型实验发现,目标保持时间越长,练习之间的最佳间隔也越长。
这并不是说教育应该变成无休止的抽认卡练习。提取是必要条件,却不是全部。我关注的是迁移能力:学生能否在陌生的问题中认出同一原理?能否为自己的推理辩护?能否发现某条规则何时不再适用?能否运用知识参与真正的讨论,而不只是复述一句话?
更重要的是,持久学习需要学习者亲自投入认知努力。如果 AI 把这些努力全都省掉,学习过程也许看起来很成功,学到的东西却可能十分脆弱。
看一个、做一个、教一个,再回头复习
我脑海中的粗略模型,最初源自一句老话:看一个、做一个、教一个。
如果 AI 支持的学习体验有意识地遵循这个顺序,会是什么样子?
- 看一个。 学生通过教师挑选的材料、演示、例题、讨论,或根据当前理解水平调整过的讲解来接触一个概念。
- 做一个。 学生尝试解题或应用这个概念。AI 可以逐步给出提示、提出聚焦问题,或展示部分示例,但不应立刻替学生完成任务。
- 教一个。 学生把概念讲回来。此时 AI 扮演考官:追问“为什么?”,请学生再举一个例子,呈现一种常见误解,或改变题目中的某个条件,看看原来的解释是否依然成立。
- 回顾一个。 系统在几天、几周乃至几个月后再次带学生回到这个概念,换一种情境,并且不把一次答对当作已经掌握。

图示|主动式学习闭环
我把这个构想称为主动式学习闭环(Agentic Learning Loop)。这并不是说要凑出一群头衔唬人的聊天机器人,而是说系统应该能判断下一步最有帮助的学习行动是什么。它应当留意:学生的解释虽然流畅,却流于表面;某种误解又出现了;或是一个月前看似掌握的知识正在逐渐淡忘。
“教一个”这一步尤其令我感兴趣。把一件事解释清楚,会迫使那些原本隐藏的知识缺口显露出来;学生需要组织思路,而不只是认出答案。但这件事同样需要审慎:关于“通过教别人来学习”的研究,在一些情境中发现了益处,在另一些情境中则发现效果为零甚至有负面影响。如何设计提示、提供支撑以及开展讲解都很重要。学生对着一个被动的聊天机器人,讲出一段流畅却错误的解释,不会因为活动被称作“教学”就自动学会东西。
值得检验的假设要更具体:如果交互式考官能够追问学生的解释、依据教师认可的材料进行核对、指出误解,并安排日后的提取练习,那么“讲给别人听”或许就能成为更有效的学习活动。
教师不是应被自动化取代的瓶颈
人们回忆自己最好的老师时,很少先想到考试分数。他们记得的是那个相信自己、注意到别人忽略之处、终于用某种方式讲明白问题,或者让自己觉得某门学科原来也是自己可以涉足的老师。
教师既是导师、专家和激励者,也是课堂文化的塑造者。他们能读懂整个教室的氛围,理解聊天记录无法呈现的背景;他们知道学生何时需要换一种解释,何时需要鼓励、安全感、挑战,或只是再多一点时间。
这些并不是教育中“不方便但只能接受”的人性因素——它们本身就是教育的核心。
教师无法现实地为每位学生提供无限的一对一时间。一位需要照看全班学生的教师,不可能持续为每个人调整讲解方式、记住每一种误解、生成难度恰到好处的无穷练习,并按每个人的节奏重新安排所有概念的复习。
我认为 AI 可以在这里发挥作用:提供耐心且自适应的练习、及时反馈、跨课次的连贯支持,并更清楚地呈现理解正在稳固还是开始松动。
有一项研究为“AI 增强教育工作者,而非取而代之”提供了早期例证。在一项涉及 900 名辅导教师和 1,800 名 K–12 学生的随机对照试验中,获得 AI“副驾驶”辅助的教师更常提出引导性问题,也更少直接把答案告诉学生。与对照组相比,他们的学生掌握某个主题的比例高出 4 个百分点;与评价较低的辅导教师搭档的学生,进步幅度更大。研究者也记录了真实存在的失败,例如系统给出的建议不适合学生的年级。这是一项值得关注的人与 AI 协作研究,但它绝不是移除人的许可。
我设想的分工很简单:
- 教师负责学习目标、学习材料、课堂文化和重要判断。
- AI 提供个别化练习、不同版本的讲解、追问,以及教师独自难以长期维持的连续支持。
- 学生仍然要自己思考。
目标不是为每个学生配备一段合成的人际关系,而是让每个学生获得更合适的支持,也让教师有更多时间和证据,去建立只有他们才能建立的关系。
一份不断更新的理解画像,而不是又一个分数
如今,评估往往不得不把一个复杂的个体压缩成一个分数。这可以理解:学校需要可比较的衡量方式,教师时间有限,机构也需要据此作出决定。
AI 或许能让我们有机会做得更连续一些。
设想有这样一个系统:它不只是记录学生答对了第 14 题,还记录学生给出的解释、需要什么提示、纠正了哪种误解、能否把概念迁移到另一道题目,以及六周后是否仍能回忆起来。随着时间推移,这些记录会逐渐形成一份动态画像,呈现学生似乎理解了什么,以及这一判断有哪些证据支持。
它不该变成一个不透明的分数,跟着孩子一路走下去。这份画像应当展示判断依据、表达不确定性,并允许学生和教师纠正。它不应根据聊天记录推断智力、性格或潜力;它应该帮助决定接下来练什么,而不是给别人认定的学习能力划定上限。
AI 也不应成为高风险决策的最终评分者。它可以汇总证据、发现规律,并建议教师重点查看哪些地方;但责任仍由人承担。
怎样才算成功?
我认为我们需要两类证据。
第一类是持久学习的证据:
- 一周、一个月和六个月后,学生还能提取出重要概念吗?
- 他们能把这些概念应用到陌生问题中吗?
- 他们能解释自己的推理,并在推理受到质疑时作出回应吗?
- 反复出现的误解是否减少?
- 学生是否更有能力自主规划学习?
第二类证据,关乎这种方法能否融入我们实际拥有的教育体系:
- 学生在现有测试和考试中的表现能否至少不退步?
- 教师是否因此获得有价值的时间,还是只多了一套需要管理的系统?
- 教师能否看见并处理全班学生的共性规律?
- 这种方法是否能加强、而非削弱师生关系?
- 它能否在不扩大其他差距的前提下,让更多人获得个性化支持?
应用时长、发送的消息数和完成的问题数,都是有用的运营指标,但它们不是最终成效。即便练习分数很亮眼,如果一撤掉辅助,知识就消失了,那也远远不够。
我关注的结果是持久、可迁移的理解。

图示|AI 学习试点的两项检验
暂定的变革理论
我目前的论点可以概括为一段话:
如果学生能持续获得个性化指导,同时保留学习所需的认知投入;如果他们需要在一段时间内不断提取、应用并解释知识;如果教师能够看到可信的进步与困难证据,那么更多学生就应当能够建立持久理解,教师也应当更能合理分配有限时间,课堂则能变得更灵活、更及时,同时不放弃让教育保有人情味的人际关系与专业能力。
这段话里包含了许多必须检验的假设。
我并不是说每个学习者都能把每门学科掌握到同样的水平。更站得住脚的原则是:只要提供合适的时间、支持和教学,能够达到深入理解的学习者,会远多于当前一对多教学体系所能支持的人数。教学应当更常根据学习者调整,而不是总让学习者去适应同一种讲解。
我也不是在断言 AI 一定是提供这类支持的最佳方式。那是要研究的问题,不是结论。
从课堂出发,与教师一起做
起初,我最先想到的是把它做成一位课后辅导老师。这是最容易设想的产品形式:给学生一个账号,让它辅导作业,并把复杂性留在课堂之外。
现在我认为,这样的设想太狭窄了。
学习不会早上 9 点才开始,也不会下午 3 点就结束。同一个闭环可以贯穿课堂教学、独立练习和日后的回顾。关键在于保持连续性。教师应当能够塑造这个过程;学生也不该每天下午都得重新向一个彼此割裂的工具解释自己的学习背景。
因此,从课堂开始更困难,却也更有意义。我不会带着一套已经做好的“AI 解决方案”走进学校。我会和教师、学生一起决定:哪些内容值得获得支持,哪些事情必须由人来做,以及什么样的证据才能让一项试点值得信赖。
合理的试点应该刻意缩小范围:选定一个学科、一个年级、一单元内容,以及教师认可的材料。试点要比较有人辅助时的表现与延迟、无辅助条件下的回忆和迁移能力;除了成绩,还要评估教师工作量和学生体验。参与者也应当包括遇到学习困难的学生、已经表现优异的学生,以及那些使用对话界面反而会遇到障碍、而不是因此得到便利的学生。
治理也应成为教育设计的一部分。现行的《澳大利亚学校生成式人工智能框架》提出了一些有用的底线:尊重教师的专业能力、支持批判性思维、保持透明、保护身心健康与隐私,并以公平和包容为设计原则。面对未成年人、敏感的学习数据,以及听起来信心十足却可能出错的系统,这些不能只是最后补上的合规清单。
我为什么要写这篇文章
我不是教师,也不是学习科学家。我的背景是设计和构建 AI 辅助产品,其中包括Communiti Labs。在那里,每一个结论都必须回到证据,技术的目的也是支持专业判断,而不是悄悄取而代之。这段经历给了我一个观察角度,却不意味着我有权独自设计课堂。
因此,我希望先把这个想法当作一项研究合作来推进,而不是马上把它当作产品来做。
接下来的工作,是挑战这些假设,更认真地梳理学习科学研究,把这份粗略的变革理论转化为可检验的主张,并与真正会在其中生活的人一起设计试点。
我想向教师、学生、学校领导、家长和研究者提出一个具体的问题:这个模式走进真实课堂后,会在哪些地方行不通?如果这个想法确有价值,它就应该经得起证据、实践和不同意见的检验。
译注:原文未包含独立插图;文中的三幅 Mermaid 示意图已保留在对应位置,并将图中文字译为中文。