模型进化4年,弱智吧还是没被打穿

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
模型进化4年,弱智吧还是没被打穿
7433点击    2026-08-21 15:27

模型进化4年,弱智吧还是没被打穿


正文


王二鹅ERE🦢 互联网厂评人,科技脱口秀 


4年前ChatGPT刚火起来的时候,中文互联网第一时间把它送去了弱智吧。对于简中老哥来说,不管你是AI 还是A6,先来弱智吧练练


全世界都在研究怎么让ChatGPT写代码、写论文、写商业计划书,弱智吧吧友更关心另一件事


它到底像不像个人


检验方法也很简单,直接问ChatGPT


一个半小时是几个半小时?


陨石为什么总是落在陨石坑里?


蓝牙耳机坏了,去医院挂耳科还是牙科?


模型进化4年,弱智吧还是没被打穿


正常人看到这些东西,一般会经历短暂的宕机,先愣一下,再看一遍,然后想想是不是自己脑子有问题。然后开始怀疑自己为什么要看这玩意,进而开始怀疑人生思考宇宙和自我意志是否存在


GPT不一样,AI 那时候还是很有职业道德的。用户既然问了那它就倾向于回答,然后会调动知识、整理逻辑,一本正经地开始解释


这种弱智吧测试在2023年几乎成为B站AI区的流量密码,一条《弱智吧为何成为AI头号公敌》拿到400多万播放


当然能问出父母结婚为什么不邀请自己,基本可以回答弱智吧的另一个经典问题了:父母是亲属,那么父母结婚算不算近亲结婚


模型进化4年,弱智吧还是没被打穿


当时AIGC刚成为全民话题,群众们测试大模型的方法五花八门,写诗,做奥数,扮演女朋友


但最中国互联网的测试形式,仍然是稳定地从弱智吧里搬问题过去折磨它


以至于很长一段时间里,弱智吧实际上成了中国互联网自发形成的一套民间AI Benchmark


2024年3月,来自中科院深圳先进院、中科院自动化所等机构的年轻研究者上传了一篇论文,研究怎么制作更高质量的中文大模型指令数据


他们从知乎、豆瓣、小红书、百科等地方搜集数据,当然很出意外的还拉上了弱智吧


在当时的一组Yi-34B微调实验里,Ruozhiba对应数据的平均分达到76.9,高于知乎、豆瓣、小红书等来源


PS:一张严肃的学术表格里,Douban、Zhihu、Xhs中间突然出现一个Ruozhiba,光是这几个单词摆在一起就已经很有一种弱智吧美学,可以进入弱智吧精华帖了


模型进化4年,弱智吧还是没被打穿


团队收集了弱智吧点赞最高的500个帖子,但弱智吧真正贡献的主要是问题,也就是帖子标题


研究者再让GPT-4生成回答,经过人工审核、修改和筛选,最后留下240组问答,用来进行微调


这个分数出来后通过媒体给出的结论是


弱智吧训练AI,效果暴打知乎、豆瓣和小红书


后来研究团队抱着求生欲跟对媒体说网上的宣传“过分夸大事实”,但互联网并不在乎,因为这个过分夸大实在太完美了


AI行业花了几年时间,买显卡、堆参数、建数据中心,全球科技公司为了高质量数据打得头破血流


最后研究者结论是:AI确实不太看得懂弱智吧


弱智吧用了二十年时间,终于迎来了自己的科技价值重估


2025年,一篇叫《Chumor 2.0》的论文进入ACL Findings,把这篇论文的标题直译成人话,大概就是


利用弱智吧,更好地测试AI到底懂不懂中文幽默


模型进化4年,弱智吧还是没被打穿


研究团队从弱智吧构建了一套中文幽默理解数据集,然后拉来GPT-4o、文心、Gemini、GLM、Qwen、Yi等十个模型考试


模型最高准确率60.3%,人类78.3%


更绝的是,研究者还尝试让模型使用Chain of Thought,先一步一步思考,再回答


结果很多模型不仅没变聪明,成绩还下降了


比如GPT-4o从51.9%掉到50.6%,ERNIE4-turbo甚至从60.3%掉到了45.2%


也就是说,在弱智吧面前,想得越多,错得越狠


研究人员还让人类和AI分别解释笑话,再让其他中文母语研究员判断谁解释得更好,GPT-4o解释的胜率只有6.2%


这大概也是人类历史上少有的场面,一群人花二十年在网上抖机灵,引来一群科学家开始认真研究后发现


一个能写代码、做数学题、总结几十万字材料的大模型,竟然倒在了小学阅读理解上


笑话这东西一旦开始解释,本身就已经输了


如今距离Chumor 2.0那场考试已经过去了两年,OpenAI已经做到GPT-5.6,千问也到了Qwen3.8-Max


但有一件事情很奇怪,Chumor还在,数据集还在,项目甚至留下了Leaderboard


模型当然强了很多,GPT-5.6也好,Qwen3.8-Max也好,今天真的重新考试,很可能早就比2024年的60.3分高很多


但现至今没有收到其他新模型新的测试结果


现在打开一个模型的技术论文,先是各种测试排名,代码涨了多少,上下文能塞多大,Agent能跑多久,Token消耗打了几折


很难再找到吸引大家讨论的信息


这当然是技术成熟的标志,就是开始变得无聊,因为模型进化一直在逼人思考,还能让模型发生什么作用


但互联网过去很多留下来的东西,本身就没人先去考虑它有什么用


贴吧里盖几千楼的接龙没有用,一群人为了一个烂梗在群里斗图也没没什么用


弱智吧更是一个把“没用”做了二十年的地方,把ChatGPT当作一个突然闯入互的新玩具,才产生出新的Benchmark


一个东西不必先证明自己有用,才值得被人认真研究


人类总是在一个不能解决任何问题的东西上展示出惊人的创造力


我们怕的不是有新的模型,能把弱智吧那张卷子考到九十分。我们担心的是,再也没有人愿意用弱智吧的问题去问模型


到那时候,无聊就已经不是最令我们担心的事儿了


文章来自于微信公众号 “饭後服用AfterHours”,作者 “饭後服用AfterHours”

AI转型,免费服务,就找AITNT
AITNT资源拓展
根据文章内容,系统为您匹配了更有价值的资源信息。内容由AI生成,仅供参考
1
智能体

【开源免费】AutoGPT是一个允许用户创建和运行智能体的(AI Agents)项目。用户创建的智能体能够自动执行各种任务,从而让AI有步骤的去解决实际问题。

项目地址:https://github.com/Significant-Gravitas/AutoGPT


【开源免费】MetaGPT是一个“软件开发公司”的智能体项目,只需要输入一句话的老板需求,MetaGPT即可输出用户故事 / 竞品分析 / 需求 / 数据结构 / APIs / 文件等软件开发的相关内容。MetaGPT内置了各种AI角色,包括产品经理 / 架构师 / 项目经理 / 工程师,MetaGPT提供了一个精心调配的软件公司研发全过程的SOP。

项目地址:https://github.com/geekan/MetaGPT/blob/main/docs/README_CN.md

2
免费使用GPT-4o

【免费】ffa.chat是一个完全免费的GPT-4o镜像站点,无需魔法付费,即可无限制使用GPT-4o等多个海外模型产品。

在线使用:https://ffa.chat/

3
微调

【开源免费】XTuner 是一个高效、灵活、全能的轻量化大模型微调工具库。它帮助开发者提供一个简单易用的平台,可以对大语言模型(LLM)和多模态图文模型(VLM)进行预训练和轻量级微调。XTuner 支持多种微调算法,如 QLoRA、LoRA 和全量参数微调。

项目地址:https://github.com/InternLM/xtuner