关于ZAKER Skills 合作
钛媒体 2小时前

2.6 万中国学生 30 个月追踪:AI 把作业分抬高 18%,把中考分打掉 24%

文 | AI 唱反调

孩子用 AI 写作业,分数涨了,速度也快了——两年后,升学考试成绩跌了 24%。

这不是焦虑营销号的标题党,是一篇正儿八经的经济学论文。6 月,欧洲经济政策研究中心(CEPR)发布讨论论文 DP21577,追踪了 26811 名中国中学生整整 30 个月,结论冷得刺骨:生成式 AI 让作业成绩提高 18%,却让闭卷月考成绩在半年内下降 20%。

作业和考试的关系,被 AI 活生生掰反了。

CEPR 论文追踪 2.68 万中国中学生 30 个月:AI 让作业分涨 18%、月考跌 20%、中考跌 24%。八成学生在 " 认知外包 ",伤得最重的恰恰是尖子生。

这篇论文到底研究了什么

先把论文的底子摆清楚,它的分量来自数据规格。

论文题为《生成式 AI 的学习惩罚:来自中国中等教育的证据》,作者是斯德哥尔摩大学的 David Str mberg 和香港大学的 Victor Lei、Yanhui Wu,6 月 2 日以 CEPR 讨论论文 DP21577 编号发布。

样本是中国一个百万人口县的 26811 名七到十二年级学生,跨度 30 个月,覆盖九门学科,数据包括每月闭卷月考、作业分数与完成时长、以及中考高考这类高利害考试。方法上用双重差分:利用不同学生接触 AI 的时间差构造自然实验,把 " 用没用 AI" 的因果效应从相关性里剥离出来。

研究期间,学生自报的 AI 使用率从接近零一路涨到约 80%,爆发节点正好卡在 DeepSeek V2.5 和 R1 发布前后,最常用的工具是豆包、DeepSeek、ChatGLM、文心和通义。这份数据,基本就是中国中学生 AI 普及全过程的完整录像。

三组数字,一个悖论

核心发现可以浓缩成三组数:

作业端:用 AI 后,作业分数涨 18%,完成时长从 64 分钟压到 45 分钟,省了 30%;

月考端:六个月内,闭卷月考成绩跌 20%;

升学考端:中考跌 24%,高考跌 18%,而且完整的惩罚要等约两年才全部显现。

过去,作业成绩基本能预测考试成绩。AI 出现之后,这个关系直接反转——作业越 " 优秀 " 的学生,真实能力反而越可疑。

伤害在分布上还极不均匀,几个细节值得单独拎出来:

学科上,社科类跌最狠(政治、地理约 -27%),STEM 其次(-22%),英语 -17%,语文最轻(-9%)。人群上,** 尖子生伤得比差生重 **:成绩前三分之一的学生跌 24%,后三分之一只跌 16%;初中生比高中生惨,男生比女生惨。

最吓人的是剂量效应:每周用 AI 不超过 1 小时,成绩损失约 5%;每周 5 小时以上,损失直接拉到 30%。

机制:八成学生在 " 认知外包 "

为什么作业高分换不来考试分数?论文用行为模式把学生分成两类。

外包型:作业完成时间异常短、分数异常高—— AI 生成,复制提交,大脑全程没参与。约 80% 的 AI 用户落进这个坑,学习损失几乎全部集中在他们身上。用满五个月 AI 的学生里,81% 写作业比最快的非 AI 用户还快。

辅助型:用了 AI,但作业时长没明显缩短——把 AI 当讲解工具,思考过程还留在自己脑子里。这批人的考试损失很小,接近零。

研究者推测,尖子生损失最大,恰恰因为他们原本有更强的自学能力,AI 的介入生硬打断了他们自建知识心智模型的过程。

那个著名的 " 教学机器 " 公案也被翻了出来。神经科学家霍瓦思在财富中文网的报道里说得很扎心:1924 年俄亥俄州立大学的 " 教学机器 " 实验就证明过,自动化会阻碍学习—— " 专家用来减负的认知卸载工具,不该被孩子用来学习成为专家。你学会的不是技能,只是依赖。

为什么这个发现现在才炸出来

一个关键原因:惩罚是延时的。

月考损失半年显现,升学考损失要等两年。这意味着此前所有几周、几个月的短期研究,都系统性地低估了 AI 的伤害——等炸弹引爆,补救窗口已经关了。当前正在深度用 AI 的这一代学生,将在 2027 到 2032 年集中走进升学考场,第一次面对 AI 替不了他们考的试。

政策端的反应已经开始。挪威首相宣布对 6 到 13 岁学生几乎全面禁用生成式 AI,14 到 16 岁也必须在教师督导下使用;英国教育部 5 月的指南更细——学校 AI 工具默认不给答案、要求学生先真实尝试、并记录谁在 " 卸载思考 ";世界银行把这篇论文列入 2026 年人力资本博客,当作防范 "AI 学习惩罚 " 的警示弹。

对比一下更有意思:世界银行受控框架下的 AI 辅导,效果是 +0.31 个标准差;CEPR 这篇 " 野生使用 " 场景下,效果是 -1.4 个标准差。同一项技术,用法决定方向。

冷水的部分

当然,边界也要说清楚。

这是一篇讨论论文(working paper),尚未经过正式同行评审。样本来自单一县,30 个月正好是 AI 工具本身飞速迭代的窗口期——研究捕捉的是早期工具配合 " 野生用法 " 的效果,而今天的产品形态和使用规范都在变。

而且论文自己给出的解药也不是 " 禁用 "。辅助型用户的成绩几乎无损,说明问题从来不在 AI,在于思考被谁做了。合理的推论是:学校真正该改的是评估结构——把评分权重向闭卷考试倾斜、监控作业时长异常、设计 AI 替不了的评估方式,比如口头答辩和现场推导。

结语

马克 · 吐温式的讽刺在这里完全成立:AI 让作业从未如此漂亮,让学习从未如此空心。

作业分数这个沿用了几十年的 " 能力代理指标 ",在 AI 时代正式失效了。家长盯着作业本上的高分自我安慰的时候,真实的知识积累可能正在偷偷塌方——而且要等两年后那张没法带 AI 进场的考卷,才肯亮出账单。

UCL 教授 Wayne Holmes 那句话,值得印在每个教育产品的开机画面上:" 他们的成绩更好,但实际上学得更差。"

相关阅读

最新评论

没有更多评论了

觉得文章不错,微信扫描分享好友

扫码分享

企业资讯

查看更多内容