2025年8月,《经济学人》公布了一份硬核证据:一项覆盖中国中部某县26811名初高中生的追踪研究显示,接入AI工具后,学生作业分数平均上涨18%,完成时间从64分钟压缩至45分钟。但闭卷考试中,这批学生的成绩比不用AI的同学低了20%,相当于1.4个标准差。论文题为《生成式AI学习惩罚》,由斯德哥尔摩大学与香港大学的三位经济学家完成,样本来自5所初中和4所高中,从2022年9月追踪到2025年6月,整整30个月。
希鸥网观察到,这条曲线的形状令人不安:工具全是熟面孔——豆包、DeepSeek、文心一言、通义千问,采纳率的两次跳升恰好踩在DeepSeek V2.5和R1发布点上。社科类科目跌得最重,降幅27%;数学跌22%;英语跌17%;语文跌9%。更反常识的是,原来成绩最好的那批学生跌得最狠。作业分,这个曾被家长和老师视为最可靠的“晴雨表”,第一次开始撒谎——作业越好,考试成绩越差。
这背后是一种名为“认知卸载”的机制在起作用。AI接走的不是运算和记路,而是打草稿、试错、推演——恰好是心智模型长出来的那道工序。论文作者给出了耐人寻味的细节:用AI满5个月后,外包作业的比例从58%涨到81%,完全外包从34%涨到50%。那些花65分钟以上认真写作业的“模范用户”,全部是上手不到5个月的新手。用满6个月后,没有一个AI学生的作业用时还超过65分钟。所谓的“正确使用AI”,不是一种可维持的状态,而是一个维持不到半年的过渡期。
分科目看,惩罚的不均匀分布暴露了更深层的逻辑:语文跌幅最小(9%),因为写作的思维链路更难被AI完整替代;社科类跌得最重(27%),因为论述框架容易被工具整体接管。初中生比高中生惨四成,男生比女生惨——认知尚未发育完全的用户,承受了更大的能力损失。论文作者们特意提醒:眼下那些几星期、几个月的短期研究,都在系统性低估AI的学习成本——因为惩罚需要两年才长满。
同样的曲线,过去一年多在成年人身上已经画了四次。《柳叶刀·胃肠病学和肝病学》去年8月发表波兰研究:19名资深内镜医生使用AI辅助几个月后回到无AI状态,腺瘤检出率从28.4%掉到22.4%,相对下降20%。麻省理工媒体实验室的脑电实验发现,用ChatGPT写作的学生神经连接强度比纯靠自己写的低55%,83%的人复述不出自己文章里的一句话,研究团队称之为“认知负债”。微软研究院和卡内基梅隆大学调查319名知识工作者后得出结论:对AI输出越有信心的人,自己动脑核查的投入越少。METR实验里,资深程序员用上AI后实际变慢,自己却觉得快了20%。今年2月复测没做成,因为大多数开发者已拒绝在没有AI的情况下工作。
希鸥网认为,这场博弈的双方不是“人与AI”,而是“能力生长”与“效率交付”之间的零和置换。短期看,AI公司获得了用户时长和订阅收入,企业获得了更快的产出节奏,学生获得了更高的作业分。受损的是长期能力资产负债表:当“把一道题亲手解出来”的过程被外包,“无论题会不会解”的心智查错能力同步萎缩。成年人没有月考,没有人为这条曲线强制结算——直到某天方案在客户面前扯出漏洞,才发现自己连该从哪里开始质疑AI的推导都不知道。工具侧的适应正在发生:同样用满5个月,2023年初的学生平均损失25%,到2025年6月收窄至16%。但损失没有归零的迹象——它只是从“显性”变成了“可管理”。
对创业者而言,这份研究提供了一面镜子。创业的本质是在高度不确定的环境中行动,不能依赖确定性的“微积分式”精确预测。AI把执行环节的确定性拉满,但恰恰抽走了创业者最需要的“统计学思维”:在反复试错中形成对问题的直觉判断。见过太多创始人,用AI生成商业计划书、用AI写周报、用AI做用户访谈纪要——产出效率上去了,但问及“这个数据的异常波动可能意味着什么”,回答往往停在AI输出的结论层,推演过程一片空白。没亲手推演过的人,审的其实是个黑箱:AI的逻辑链一旦错在深处,你连该从哪里起疑都不知道。
挣扎不是创业的异常状态,而是核心常态。AI替你绕过了挣扎,也就错过了能力长出来的那道工序。这对应着中学生那条曲线:作业分在涨,家长在群里点赞,老师看到的提交记录越来越整齐——每一个反馈都在形成畸形的激励机制。创业中同样如此:用AI提效带来的正反馈,让团队逐渐丧失对核心问题的深度介入能力。那个“没有AI就不肯工作”的程序员群落,和“超过65分钟就不愿写作业”的教室,是同一个现象的两张面孔。9月1日开学后,26811人的实验会在更大样本里重跑。而创业者的“月考”没有固定日期,等到市场发卷子那天,可能已经来不及补课。
破解之道藏在一条笨办法里:突破核心瓶颈没有捷径,唯有死磕基本功。网景时期微软用免费服务器碾压,各种并购合作巧思全部无效,最后靠死磕性能优化活了下来。AI时代依然如此——你可以用AI提效,但必须保留一段不用AI的“裸奔训练”:写代码的人定期脱离工具重写核心模块,写方案的人每周闭卷重构一次逻辑链条,做决策的人强制要求自己先给出判断再到AI里验证。具体动作很简单:每周留出两小时,关闭所有AI工具,用手写完成最重要的那块思维草稿——那是Debug能力的来源,是“把关人”底稿的出处。CEO必须绝对坦诚,尤其是对自己:这台生产力机器的油耗,是不是正在从你的判断力里扣?别等月考发卷那天,才发现自己交的是豆包写的答案。
金鸥品牌榜·2026年度创新案例库开放申报了。免费提报,独立评估,入榜品牌将获得电子版《入榜证明》及年度专题公示,优秀案例可获得深度专访+全平台分发。 如需修改或发布文章,请加微信号:sheisceo