


A | 中新网太原8月20日电 题:“首来族”过半 台青山西古建中触摸中华文明根脉
作者 耿莉莉 杨杰英
“站在雁门关,我感觉站在了历史里。
「坏 AI,使人笨!」作者|张勇毅编辑|靖宇「AI 用多了,人会不会逐渐变笨?」这应该是过去三年被讨论最多的一个迷思之一,从 ChatGPT 走红那天就有。”参加全国台联第二十三届台胞青年千人夏令营山西分营的台湾青年何渝薇在参观雁门关长城后对记者说,此前只存在于自己历史书与小说想象中的地方,“亲自站在这里,觉得很神奇”。吵了三年多,两边都拿不出像样的证据:担心的人只有体感,不担心的人只有立场。
8月16日,全国台联第二十三届台胞青年千人夏令营山西分营的营员们在大同云冈石窟合影留念。
B | 耿莉莉 摄 8月15日至19日,全国台联第二十三届台胞青年千人夏令营山西分营在山西举行,台湾青年在5天时间里组团探访云冈石窟、应县木塔、雁门关、晋祠等地,在古建中触摸中华文明根脉。8 月 18 日,《经济学人》给这场争论补上了迄今最硬的一份证据。报道的主角是 2.7 万名中国中学生。用上 AI 之后,他们的作业分数平均涨了 18%,写一份作业的时间从 64 分钟缩到 45 分钟。其中“首来族”比例在一半以上。 “我是读中文系的,之前在课本上读到一些历史故事,这次活动就提供了一个让我们‘走进’历史的机会,把这些东西真实呈现在我们眼前。

C | ”与何渝薇同行的台湾青年连唯证说。 “之前没有来过山西,只知道这里历史文化非常悠久。到这里全是好消息,直到月考卷子发下来:闭卷考试里,这批学生的成绩比不用 AI 的同学低了 20%。

D | ”台湾青年周玫卉坦言,此前山西于她而言只是书本上的一个遥远符号,但真正踏上这片土地后,“觉得比想象中更有特色,不管是古迹、建筑还是自然风景,都让我印象深刻”。作业分曾是最可靠的「晴雨表」:作业越好,考试越好。而在用 AI 的学生中间,作业分越高,基本等于 AI 用得越深。于是曲线变成了:用得越狠的孩子,考试跌得越惨。

E | “通过亲自去看、去感受,再加上导游的讲解,我更深入地了解了山西,也进一步了解了我们的历史,找到了我们的根。作业分,第一次开始撒谎。”来自台湾的陈冠融在踏访云冈石窟、应县木塔等地后发出这样的感悟。

作业分超过 100 的人之中,不用 AI 的人分数上涨到了 112,用 AI 之后一路跳水到 64。 8月17日,台湾青年参观朔州应县木塔。 耿莉莉 摄 周玫卉对此也深有共鸣:“我们有机会亲自走访山西,深入了解当地的历史、文化与风土人情。尤其看到许多熟悉的传统文化,更能感受到两岸之间共同的文化传承与情感连结,对‘同根同源’有了更直接、更深刻的体会。” 从云冈石窟的佛光东渐,到应县木塔的千年屹立;从雁门关的雄奇险峻,到晋祠的宋韵悠长……台湾青年们在行走中品读历史,在古建中触摸中华文明的根脉,也在“同根同源”的文化基因中,找到了跨越海峡的情感共鸣。(完) 【编辑:万纪玮】。|图片来源:经济学人《经济学人》的数据底稿,是斯德哥尔摩大学和香港大学三位经济学家 6 月挂出的论文,标题就叫《生成式 AI 学习惩罚》。

F |

《生成式 AI 学习惩罚》|图片来源:SSRN样本来自中国中部一个县,人口超过一百万。

G | 论文特意强调它的普通:像沿海之外的大多数中国县城。26811 名初高中生,5 所初中、4 所高中,装下当地九成中学生,从 2022 年 9 月跟到 2025 年 6 月,整整 30 个月。

H | 这个县的作业在线上提交,系统记下每个人的用时;月考、中考、高考的成绩都进数据库——写多快、考多好,第一次成了直接测量的硬数据。谁在用 AI,则来自回收率超过 96% 的全员问卷。

I | 2022 年 9 月,用 AI 的学生几乎为零。到 2025 年 6 月,这个数字是 80%。这条曲线有两次明显跳升,分别踩在 DeepSeek V2.5 和 R1 的发布点上。工具全是熟面孔:豆包、DeepSeek、文心一言、通义千问。

采纳曲线的两次跳升,都踩在 DeepSeek 发版上|图片来源:CEPR结论就是开头那组数字:作业 +18%,用时 −30%,月考 −20%,相当于 1.4 个标准差。惩罚在各科并不均匀:社科类最重,跌 27%;数学 22%;英语 17%;语文最轻,9%。初中生比高中生惨四成,男生比女生惨。看来变笨这件事也不优待聪明人:恰恰是原来成绩最好的那批孩子,跌得最狠。升学考试的账要算得更小心。6 月底这项研究在中文互联网刷屏时,传播最广的说法是「中考暴跌 24%、高考暴跌 18%」。

J | 论文里的原意克制得多:这是用满两年以上学生的完整惩罚,全体 AI 用户的平均效应只有 7% 左右。但这份「克制」本身才是更坏的消息:惩罚需要两年才长满。作者们专门点了一句,眼下那些几星期、几个月的短期研究,都在系统性低估 AI 的学习成本。

K | 01消失的模范生这项研究 6 月刚出现时,英文讨论中其实还有一个安慰性的结论:有两成学生用 AI 但不外包作业,成绩没受损。

L | 所以问题不在 AI,在用法。

M | 论文确实说了前半句。它给「外包」下了一个数值上的定义:作业用时少于 50 分钟算「内包」,少于 45 分钟才算是真「外包」。刚开始用 AI 的学生里,外包的占 58%。

N | 而那些照常花时间写作业、只拿 AI 当家教的孩子,考试成绩和不用 AI 的同学几乎没有差别。论文甚至发现,在 50 到 65 分钟的重叠区间里,两类孩子花同样的时间,考出几乎一样的分数。AI 本身不带毒性,毒性全在省下来的那段时间里。如果论文停在这里,它就是一篇「工具无罪、用法有罪」的标准论文。但论文其实更深一步地探讨了这个问题:用满 5 个月之后,外包的比例从 58% 涨到 81%,完全外包从 34% 涨到 50%。那批花 65 分钟以上认真写作业的「模范用户」,全部是刚上手不到 5 个月的新手。以及采纳满 6 个月之后,没有一个 AI 学生的作业用时还超过 65 分钟。26811 人的样本里,「好好用 AI」不是一种稳定的用法,是一个维持不到半年的过渡状态。论文作者的解释很短:AI 挤掉的,是强度最高的那部分努力。

用满六个月后,65 分钟以上的区间空了|图片来源:CEPR它不是又一篇「AI 让成绩变差」的论文,它是在撕掉一个安慰的遮羞布:只要教会孩子正确使用,一切都会好起来。数据给出的回答是,没有人能一直正确使用:毕竟作业分在涨,家长在群里点赞,老师看到的提交记录越来越整齐。每一个反馈都其实都在潜移默化中,形成一个畸形的激励机制:你做得很好,再快一点也没关系。02大人的考场看到这里,这个研究似乎跟传统我们理解中、大脑已经发育健全的成年人关系不大。但同样的曲线,过去一年多,在成年人身上已经画了四次。《柳叶刀·胃肠病学和肝病学》去年 8 月发表了一项波兰研究:四家内镜中心的 19 名资深医生,人均做过 2000 例以上肠镜,用了几个月 AI 辅助检查之后,回到没有 AI 的状态,腺瘤检出率从 28.4% 掉到 22.4%,相对下降 20%。
和中学生的月考,同一个数字。这是医学界第一次在真实临床里测到「用 AI 之后,人的手艺生疏了」,主角还是这个星球上最不该被怀疑基本功的一群人。第二次在写作者身上。麻省理工媒体实验室去年 6 月的脑电实验里,54 名学生戴着电极帽写作文。用 ChatGPT 那组的神经连接强度垫底,比纯靠自己写的那组最多低了 55%;写完不久,83% 的人连自己文章里的一句话都复述不出来。研究团队给这个现象起了个名字:认知负债。第三次在办公室里。微软研究院和卡内基梅隆大学去年调查了 319 名知识工作者,结论一句话就能说完:对 AI 输出越有信心的人,自己动脑核查的投入越少。第四次在程序员身上。

o | 研究机构 METR 去年的对照实验里,资深程序员用上 AI 实测变慢了,自己却觉得快了 20%。今年 2 月它想复测,没做成,原因写在报告里:大多数开发者已经拒绝在没有 AI 的情况下工作。和那个再也没人肯花 65 分钟写作业的教室,一模一样。

脱离 AI 之后,检出率没有回到从前|图片来源:METR临床、脑电、问卷、对照实验,四次预警说的是同一件事:AI 在场,产出变好;AI 离场,能力变差。回到开头那个吵了三年多的问题。这些研究给出的答案,比一句「会变笨」更难受:AI 没有降低任何人的智商,它是把「变聪明」的那道工序抽走了。分数照涨,产出照交,只是那份本该在 64 分钟里长出来的能力,没有长。

p | 认知科学管这个叫「认知卸载」:把本该在自己脑子里跑的过程,交给外部工具。卸载不新鲜,计算器和导航都是。新鲜的是位置:AI 接走的不是运算和记路,是打草稿、试错、推演,恰好是心智模型长出来的那道工序。落到日常工作上,这变化听着甚至像升级:从「写代码」变成「审代码」,从执行者变成把关人。

q | 但把关的前提,是脑子里有一份自己的底稿。没亲手推演过的人,审的其实是个黑箱,AI 的逻辑链一旦错在深处,他连该从哪里起疑都不知道。学生的版本更简单:作业是草稿,考试是 Debug。草稿外包出去,Debug 那天就露馅。区别只有一个。学生每个月都有一场闭卷考试,把这条曲线摆到台面上。而大多数成年人的工作,没有月考。

r | 论文的最后留了一点余地。

s | 把时间拉长看,AI 学习惩罚正在收窄:同样用满 5 个月,2023 年初的学生平均损失 25%,2025 年 6 月只有 16%。

同样用满 5 个月,惩罚从 25% 收窄到 16%|图片来源:CEPR师生在适应,工具侧其实也有人想办法,比如逼 AI 给答案时同步展示推演过程。但按作者们的判断,损失在变小,却没有归零的迹象。9 月 1 日开学。全国的教室里,这场 26811 人的实验,会以更大的样本重跑一遍。以后看到孩子的作业天天 100 分,也许得先问一句:这 100 分是孩子挣来的,还是豆包挣来的。

t |
Current article:http://ln6kz2.mexuanmeixuyaopinzheng.shop/uy62r6/8mlo2.html
Published on:03:47:34