“每天只学 2 小时”这几年常和 AI 个性化教学绑定出现。先给结论:它不是一个压缩课时的噱头,而是用 AI 对每个学生做持续诊断,再根据诊断结果动态生成只属于这个人的学习路径。已经掌握的内容快速跳过,薄弱环节多练,错题按遗忘曲线安排复现,复习时机由系统提醒。这套逻辑对 K12、备考、成人自学都适用,但落地方式差别很大。
这里不讨论教育理念的争议,只拆实操层面的事:AI 个性化教学到底怎么落地,每天 2 小时的目标要满足什么条件,怎么判断学习效果,最常见的翻车点在哪里。老师、机构教研负责人、教育产品开发者,还有想给孩子配置学习方案的家长,都可以从里面找到可用的判断标准。
1. 先理解一个关键判断:AI 个性化教学解决的是“效率”,不是“意愿”
1.1 传统教学为什么很难做到因材施教
课堂的教学粒度天然很粗。一个班四十人,老师只能按中间水平推进。学得快的同学大量时间在等待,学得慢的同学跟不上,课后作业又是同一套题。结果就是学生坐在书桌前六小时,真正被有效训练的时间远没有看起来那么多,其中相当一部分是低效重复。
这不是老师能力的问题,而是人力上限的问题。老师不可能同时掌握每个学生对每个知识点的掌握状态,更不可能每天为每个人重新出题、批改、讲解。个性化教学这个概念教育界提了很多年,真正卡住的是两件事:数据采集成本太高,内容生成成本太高。现在 AI 大模型把内容生成成本打下来了,数据采集也可以通过在线做题、拍照批改、语音答题这些方式自动化完成,个性化教学才第一次有了规模化的可能性。
1.2 AI 个性化教学的核心链路
AI 介入之后,个性化教学变成一条可以重复执行的技术链路:
- 诊断:用测评题定位每个知识点的掌握程度,而不是只看一张总分。
- 规划:基于知识图谱裁剪学习内容,只安排薄弱点相关的任务。
- 反馈:每次作答后给出针对性讲解、错因提示和下一步动作。
- 迭代:定期重测,把掌握状态的变化反馈到规划模块,重新生成下一阶段任务。
这条链路里最容易丢的是“迭代”。很多产品只有诊断和推送,没有周期性的重新诊断。学生练了一周,系统还在推两周前已经掌握的内容。真正有效的做法,是把诊断、规划、反馈、迭代做成一个持续运行的闭环,按周、按月不断刷新。
我个人的看法是,一个具备基本个性化能力的系统,其实就是一个围绕学习者运行的 AI 智能体。它需要理解学习目标、识别当前状态、安排执行动作、收集反馈、调整策略。这个描述听起来抽象,但落到产品上就是五个功能:入班测、每日任务、错题讲解、复习提醒、阶段重测。先把这五个功能串起来,比一开始就追求大模型生成花哨内容要重要得多。
判断一个 AI 学习系统是不是真个性化,先看它会不会“忘记”你已经掌握的内容。如果练过的题反复出现,只有做题量没有路径变化,那只是刷题软件,不是个性化教学。
2. “每天只学 2 小时”这一目标成立的前提条件
2.1 前提一:学科内容必须先被结构化
AI 要给学习路径做裁剪,前提是学科内容被拆成有依赖关系的知识点,并且每个知识点都有年级、难度、前置条件这些标签。以数学为例,学生分数运算不熟练,既可能是小数概念没建立,也可能是约分规则没掌握。没有知识图谱,系统只能按“错了就多刷同类题”的朴素逻辑工作,练得多,效率却不高。
这个结构化工作不一定要做得非常大。对一个年级、一个科目来说,把核心知识模块拆出两三百个知识点,把互相之间的依赖关系标清楚,就足够支撑第一版系统运转。关键是“前置依赖”这个属性必须标对,它是路径规划最依赖的信息。如果前置关系标错,后面的所有推荐都会跟着偏。
2.2 前提二:反馈必须形成闭环
只推视频、只发讲义、只布置作业,都不是闭环。闭环的反馈至少包含三个信息:答案对不对、错在哪个环节、下一步做什么。系统要能自动判断作答结果,还要能区分概念性错误、计算错误和审题错误。同样是答错,处理方式完全不同。概念性错误要回到知识点重新学,计算错误要多做专项训练,审题错误则要调整读题习惯。
现在大模型在这一步的价值最大。它可以针对一道错题生成学生能读懂的讲解,甚至可以追问学生卡在哪里。但这里要冷静:大模型生成讲解的能力很强,判断主观题答案对错的能力却不稳定。生产环境里一般用规则判题做兜底,大模型负责生成解释和追问,两者配合使用,才能保证反馈质量不出大问题。
2.3 前提三:数据必须能持续采集
个性化的算法再强,没有数据也是空转。最少需要记录四类信息:每次作答的对错、单题用时、首次作答和重试结果、做题顺序。第一次就作对和重试之后才作对,含义不一样;直接作答再看讲解和先看讲解再作答,也反映出不同的学习习惯。
这些数据至少要连续积累两到四周,路径推荐才真正有意义。只看一次测评就生成所谓学习计划,本质上还是拍脑袋。所以我一直建议,任何个性化学习产品都要先解决“学生愿意每天打开它”的问题。数据采集的完整度,和你产品的使用粘性直接相关。如果学生连续几天不来,系统后面的推荐质量一定会下降。
3. 一套可落地的 AI 个性化学习系统长什么样
3.1 数据层:把学习记录结构化
一个能长期使用的系统,底层一定有一张张结构化的表:学生表、知识点表、题目表、作答记录表、复习计划表。不要一开始就追求大模型生成花哨内容,先把这几张表建好,数据能进得来、查得出、算得动,系统才算有了地基。
对个人或小团队来说,不建议一开始就从零造一套完整的在线教育平台。更合理的路径是先用现成的学习管理系统,或者用一个轻量数据库加一个简单的作答页面,先跑通数据采集。重点不是技术栈多高级,而是每天的数据能不能稳定记录下来,缺了哪一天都影响后面的统计。
3.2 算法层:知识图谱、能力评估、题目推荐
算法层分三块。第一块是知识图谱,描述知识点之间的前置依赖和后续拓展关系。第二块是能力评估,根据作答记录估计学生当前水平,简单做法是用最近七天的正确率滚动计算,复杂做法可以用项目反应理论模型,但需要更大的题目样本,前期不建议上。第三块是题目推荐,核心是让推荐难度和学生当前能力匹配。
一个常用的经验区间是让正确率保持在 60% 到 80% 之间。低于 60%,题目太难,学生会受挫;高于 80%,题目太简单,训练价值有限。这里的难度要用题目自身的难度标签计算,不能只看学生主观感受。实际操作中,系统会先推一道略低于当前能力值的题目,答对后再逐步提高难度梯度,形成一条稳定的上升曲线。
3.3 交互层:出题、讲解、复习提醒
交互层是最接近用户的界面,也是 AI 大模型发挥价值最明显的地方。
- 题目生成:根据知识点和难度标签生成变式题。大模型可以辅助出题,但出完必须经过人工或规则校验,确保答案正确、难度标签准确。教育场景里一道错题的成本,比技术团队想象的高得多。
- 讲解生成:针对错题生成个性化解析。这一步大模型表现很好,但篇幅一定要控制。学生只需要看到三件事:错在哪、怎么改、一个同类题。
- 复习提醒:按遗忘曲线安排复现节奏。常见做法是当天错误点在第 2 天、第 4 天、第 7 天各复现一次,之后根据正确率动态拉长间隔。已经连续两次作对的点,不应再频繁出现。
下面是一个最小系统的层级组成,适合团队内部讨论时对照:
| 层级 | 核心内容 | 常见实现 | 最容易出的问题 |
|---|---|---|---|
| 数据层 | 学生、知识点、题目、作答记录 | 结构化数据库加导入导出 | 数据字段不统一,统计结果失真 |
| 算法层 | 能力评估、难度匹配、路径规划 | 规则加统计模型加大模型辅助 | 只推荐不重测,路径越来越偏 |
| 交互层 | 出题、讲解、复习提醒 | 前端页面加大模型接口 | 讲解太长,学生根本看不完 |
4. 从单科闭环到规模化落地
4.1 先选一个学科跑通最小闭环
任何个性化教学系统,都不建议一开始就覆盖所有科目。最合适的第一步试点科目通常是数学,知识结构明确、依赖关系清楚、答案容易自动判断。语文阅读和英语作文涉及主观评价,自动化判错难度高,放到第二阶段更稳妥。
跑通最小闭环只需要四步。第一步,选定一个年级的一个知识模块,比如七年级的“一元一次方程”。第二步,人工梳理这个模块的知识点和前置依赖,数量控制在 10 到 20 个。第三步,录入或生成五十道左右的题目,按知识点和难度打标签。第四步,找三到五名学生连续使用两周,每天记录数据,对比使用前后的测评结果。
两周之后要回答三个问题:学习时间有没有下降、正确率有没有上升、学生是否愿意继续用。前面两个问题至少要有一个给出明确答案,第三个问题必须正面回答,否则功能再完整也很难推进。小范围试点的目的不是验证技术,而是验证闭环是否成立。
4.2 单人自用和班级使用是两套逻辑
个人自学场景里,AI 系统直接承担规划者和反馈者的角色。学生端不需要复杂的后台,只需要看到今天学什么、做什么题、错在哪里、明天复习什么。这类产品现在不少,判断标准只有一条:它有没有在数据积累之后调整你的任务,而不是每天都推送同样的大礼包。
班级和机构场景则要复杂得多。老师仍然要对教学结果负责,所以系统至少要给老师留出三个入口:查看班级整体的薄弱知识点分布、查看每个学生的近期趋势而不是只看分数、对 AI 生成的学习计划进行人工调整,允许老师否决或者临时插入任务。
最忌讳的是把 AI 当成全自动系统,学生、老师、家长都变成旁观者。长期看,没有老师参与的个性化教学很难坚持,因为学习不只有题目推送,还有激励、解释上下文和人与人之间的信任。技术负责解决效率,老师负责解决方向和动力,这两件事不能互相替代。
4.3 机构落地时先解决数据合规和可解释性
这件事一定要放在技术方案前面。如果使用者是未成年人,涉及姓名、年级、错题记录等数据,机构必须提前确认数据存储位置、访问权限、家长知情同意这些事项。从技术上要限制数据导出的范围,不能让任意角色都能看到全量数据。给老师开的数据入口,和家长看到的报告内容,应当不同。
另外,推荐逻辑要能解释。老师或家长问“为什么给孩子推这些题”,系统要能给出依据,比如“上一单元正确率偏低,系统建议先补前置知识点”。黑盒推荐在教育场景里很难被信任。对做 AI 应用开发的团队来说,这一步要专门设计,不是给大模型加一个提示词就能解决的。
5. 学习效果不能只看正确率
一个个性化学习系统上线之后,家长和老师最常问的问题是:孩子到底有没有进步。这个问题听起来简单,但一句“正确率多少”根本回答不了。原因在于个性化学习的题目难度和内容一直在变,单纯对比正确率,就像用一个会变的尺子量身高。下面三个维度,是我评估学习效果时一定会看的。
5.1 正确率要和题目难度一起看
这是最容易误判的地方。学生正确率从 70% 降到 60%,不一定代表退步。如果系统同时把题目难度从 0.6 提升到了 0.8,这个下降恰恰说明能力在上升。只盯着正确率数字,很容易得出完全相反的结论。
更合理的做法是画能力值曲线。能力值可以算得很简单:把最近一周每道题的难度加权相加,再除以题目数量。难度越高的题目作对,能力值上升越多。这样就把正确率和难度合并成一个指标,避免被单一数字误导。能力值曲线连续两周向上,才能说明个性化路径在起作用;如果能力值波动很大,就要回去检查题目难度标签和推荐稳定性。
5.2 作答用时是熟练度的重要信号
同样的正确率,10 秒完成和 3 分钟完成,掌握状态完全不同。对基础运算类知识,学生作答时间明显缩短,说明已经进入熟练阶段,系统应该把这类知识从复习列表里降级。对综合应用题,时间就不宜作为主要信号,这类题需要思考时间,做得太快反而不正常。
落地时我会建议把单题用时分成过短、正常、过长三个区间。过短要怀疑是不是乱选,过长要判断是在思考还是卡住。系统在作答时间异常时弹出提示,家长和老师就能及时干预,而不是等周报出来才发现问题。这个阈值通常要按题型单独设置,不能所有题目共用一个标准。
5.3 复习间隔是否在动态变化,是系统有没有真正工作的标志
个性化教学的一个关键指标是遗忘曲线管理。好的系统会让每个知识点在首次学习之后按递增间隔复现,比如第 1 天、第 3 天、第 7 天、第 15 天。每次作对,间隔继续拉长;出现错误,间隔缩短并回到重学。这个机制的背后是一个朴素的判断:已经记住的内容不值得占用新的学习时间,省下来的时间应该投入到还没掌握的知识点上。
如果一套系统用了两周,学生看到的复习题还是每天循环同一个池子,没有间隔变化,那它并没有学习规划能力,只是在做题目轮播。判断一个产品是不是个性化,这是最直接的观察窗口。我倒不建议家长只盯着孩子每天做了多少题看,更应该看系统昨天漏掉了、今天复习了哪道题,这个动态过程才有信息量。
6. 最容易翻车的地方和排查顺序
个性化学习系统看着功能齐全,真正用起来之后会有一堆问题。这里把我见过最多的三类情况拆开讲,每一类都给出可执行的排查顺序。
6.1 题目难度梯度失控,学生大量流失
个性化教学最常见的失败原因,不是模型不够聪明,而是推荐难度和学生能力不匹配。系统一旦连续几次推送正确率低于 40% 的难题,学生会立刻产生挫败感,然后放弃使用。这在大模型生成题目之后尤其容易发生,因为自动生成的题目难度标签常常不准。
排查顺序:
- 先看近一周推荐题目的平均难度和学生正确率。
- 如果正确率持续低于 60%,先检查题目库难度标签,很多题目的难度标注是错的。
- 再看推荐逻辑有没有正确过滤掉前置未掌握的知识点。
- 最后检查复习题和挑战题的比例,一般建议在 7 比 3 左右,复习为主,挑战为辅。
这个问题的根源往往不是算法策略,而是数据质量。题目难度标签不准、知识点映射丢失、作答记录不完整,任何一个都会让推荐结果跑偏。所以排查时一定要从数据层开始,而不是一上来就调整模型参数。
6.2 学生平时会做,考试却考不好
这个现象很普遍,原因往往不是知识没掌握,而是训练结构太单一。学生每天做的是针对本周知识点的单元题,题型固定、提示明确,时间长了会形成路径依赖。一旦考试把多个章节混在一起,题型变化,真实水平就暴露出来了。
解决办法是在个性化路径里加入定期的综合测评。建议每两周做一次跨章节混合测试,题型和难度尽量贴近真实考试。综合测评的结果要重新进入能力评估,而不能只当作一次考试分数存着,否则它对学习路径没有任何贡献。
另外,讲解内容也要避免总是用同一套模板。如果学生每次看到错题解析都是同样的句式、同样的例子,很容易只是记住了解析套路,而没有真正理解题目背后的知识点。大模型做讲解时,建议定期换一个切入角度,比如换一个生活化例子,换一种推导顺序。
6.3 系统异常的通用排查链路
如果 AI 学习系统出现推荐异常、数据丢失或输出错乱,我一般按这个顺序排查:
- 先看数据完整性。作答记录有没有缺失,时间戳是否混乱,这是最常出问题的地方。
- 再看知识点映射。题目有没有正确关联到知识点,新录入的题目经常漏掉标签。
- 再看推荐参数。难度区间、复习间隔、每日任务量是不是被改过,生产环境里配置改动一定要留日志。
- 最后才看模型本身。大模型生成结果不稳定时,优先加规则兜底,而不是反复调整提示词碰运气。
教育系统里大部分异常,问题出在数据、标签和配置,真正需要动算法的场景并不多。排查时先怀疑基础层,不要一上来就重构推荐模型。
7. 为什么我会对“AI 颠覆教育”这个说法保持保守
7.1 必须承认的变化:实现成本确实降了
大模型确实让个性化教学的实现成本下降了很多。过去需要教研团队手动出题、整理解析,现在 AI 可以辅助生成,人工只负责校验。过去一个学习计划要老师逐个排,现在系统几秒就能生成初稿。过去内容生成是最大的瓶颈,现在这部分明显缓解。大模型还能根据学生的错题生成变式题、生成更口语化的讲解、甚至根据答题记录判断学生卡在哪个前置概念上。这些能力放到五年前,需要一支不小的研发团队才能实现。
这些变化是真实的,也是“每天只学 2 小时”能从一句口号变成可执行方案的根本原因。对教育产品团队来说,现在还在从零标注上万道题、不利用大模型做辅助生成和结构化整理,效率上会很吃亏。这个窗口期值得抓紧。
7.2 仍然需要保守的原因:教育的产出验证周期太长
但我对“颠覆”这个词一直很谨慎。教育的产出是人,不是一份报表,出错后的代价不是重新跑一次任务那么简单。一个推荐路径设计错了,影响的不是一个任务的成功率,而是一个学生连续几周的学习方向。这种错误很难在当天被发现,往往要等到阶段测试才会暴露。
每天只学 2 小时能做到的前提,是这 2 小时里每一分钟都有诊断结果和反馈逻辑支撑。没有数据积累、没有闭环迭代、没有人工兜底,只靠一个大模型聊天界面,解决不了学习效率问题。我看到太多团队把个性化教学做成“你能回答学生问题”就结束了,实际上那只完成了反馈环节的一小部分,诊断、规划、复习提醒都没有着落。
真正务实的路径是:先选一个学科、做一个小范围试点,把数据、知识图谱、反馈闭环跑通,再逐步扩大科目和用户规模。先把一个孩子的薄弱点找准,把错题讲清楚,把复习时间安排对,比什么都重要。这套方法听起来朴素,但恰恰是目前最可靠、也最能复制到更多场景的 AI 教育落地方式。等单科闭环稳定运行几个周期之后,再去谈“颠覆”,底气会比现在足得多。