51 名复旦学生亲自出题,把 DeepSeek、MiniMax、Claude 三个模型拉上考场。AI 答错越多、出题人得分越高——最后能让任一模型整卷得 0 分的只有 4 人,而最强的 Claude Sonnet 4.6 谁也没能完全考倒。
据新华社、上观新闻等多家媒体报道,复旦大学计算与智能创新学院教授肖仰华的「数据挖掘技术」课程,刚结束一场很不一样的期末考核。学生不用坐在考场里答题,而是全部变成出题人:51 名学生各自设计 10 道有唯一标准答案的计算题,拿去「考」三个当前较先进的 AI 模型。
评分规则也被彻底反转:AI 答错的题越多、被难倒的模型越强,出题学生得分就越高。换句话说,这门考试考的不是「你会不会算」,而是「你懂不懂到能找出 AI 的盲区」。
三个应考模型对应不同难度梯度,答错一题给出题人加的分数也不同:
总分由 60 分保底分加上「AI 难度分」构成,封顶 100 分。最终成绩:51 份试卷里,50 人至少让某个模型答错过一题,仅 1 人一个模型都没难倒;但能让任一模型整张卷得 0 分的,只有 4 人。而三个模型中最强的 Claude,没有被任何一名学生完全考倒。全班平均分 85.7、中位数 88。
肖仰华的理由很直接:「传统的出题考察方式,在 AI 时代已经失效了。老师出一道标准算法题,AI 比任何学生都算得快、算得准。继续用这种方式考,等于在 AI 的强项上跟 AI 比,没有意义。」
于是课程把训练目标从「怎么做」转向「怎么指挥 AI、怎么评判 AI 给出的结果」,考核重心也落到判断力、评价力和创造性思维上。他还提到一个更现实的观察:AI 正在把学生之间的能力分层拉大——真正吃透知识的人能稳定找到模型盲区,靠的不是运气,是能力。
这条新闻里 Claude 是「最难被问倒」的那一个,也难怪不少国内开发者、学生想第一时间用上它。但现实是:在国内,能不能顺畅、稳定地用上 Claude 网页版或 Claude Code,很大程度不取决于模型本身,而取决于你出口 IP 和浏览器环境是否「干净」。常见的翻车点包括:
说白了,模型再强,先得让它「愿意」稳定服务你。与其反复掉线换号,不如花一分钟把环境自查清楚。
资料来源:新华社、上观新闻、新浪科技、东方财富网等公开报道,细节以官方与原始报道为准。本文为二次整理,观点仅供参考。