OpenAI新模型突破10项菲尔兹奖级难题/AI女团选秀9个出道成团/最强AI 画不好《蒙娜丽莎》|Hunt Good周报

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
OpenAI新模型突破10项菲尔兹奖级难题/AI女团选秀9个出道成团/最强AI 画不好《蒙娜丽莎》|Hunt Good周报
9042点击    2026-08-02 12:03

欢迎收看最新一期的 Hunt Good 周报


在本期内容你会看到:


7 条新鲜资讯


3 个有用工具


1 个有趣案例


3 个鲜明观点


Hunt for News|先进头条🤯


GPT-5.6 Sol 推翻 100 多年前的麦克斯韦猜想,下一代模型突破 10 个!


数学家菲利普·阿拉图恩、加文·鲍尔和马修·D·克瓦尔海姆于 2026 年 7 月 29 日在 arXiv 上发表论文,提到由 GPT-5.6 Sol 找到了一个反例,证明了 100 多年前的麦克斯韦猜想是假的。


OpenAI新模型突破10项菲尔兹奖级难题/AI女团选秀9个出道成团/最强AI 画不好《蒙娜丽莎》|Hunt Good周报


OpenAI 联合创始人 Greg Brockman 很快在 X 转发了这一消息,骄傲地说「这种级别的智能可以被所有人获取,并能增强每个人的能力!」


具体的发现是,1873 年,麦克斯韦想知道由 n 个点电荷产生的电场平衡态的数量是否不能超过 (n-1)^2。而几位数学家用 GPT-5.6 Sol 发现了一个由 5 个电荷组成的三角双锥体,有 24 个平衡态,大于 


(5-1)^2。


OpenAI新模型突破10项菲尔兹奖级难题/AI女团选秀9个出道成团/最强AI 画不好《蒙娜丽莎》|Hunt Good周报


从 2025 年的 IMO 金牌级的表现,像是一张门票推开了数理化的大门,AI 连续出现了完整证明、明确反例和人类此前没有见过的数学构造:证明圈双覆盖猜想、推翻雅可比猜想、证明 Erdős 平面单位距离猜想……


OpenAI 和 Anthropic 也热衷于将此类突破作为模型的最佳营销案例,但评论区的网友表示「我尝试让 5.6 证明 p = np 或 p != np 已经快一个星期了,但它仍然没有得出任何结论。请问您能修复一下吗?」


OpenAI新模型突破10项菲尔兹奖级难题/AI女团选秀9个出道成团/最强AI 画不好《蒙娜丽莎》|Hunt Good周报


类似 AI 在数理化方面突破的消息大概会越来越多,不断进展的同时,


数学研究的工作流开始重新分工,发现、验证与解释会逐渐变成三个相对独立的环节。


OpenAI新模型突破10项菲尔兹奖级难题/AI女团选秀9个出道成团/最强AI 画不好《蒙娜丽莎》|Hunt Good周报


昨天,OpenAI 还专门发布博客开始为下一代模型造势。


博客里面提到 Astra 的内部版本,即 OpenAI 的下一代主要模型系列解决了数学、量子复杂性和理论计算机科学中的 10 个重大开放性问题。


OpenAI新模型突破10项菲尔兹奖级难题/AI女团选秀9个出道成团/最强AI 画不好《蒙娜丽莎》|Hunt Good周报


而这十个难题,光是证明非索菲群体的存在这一项,可能就已经能让 OpenAI 这款新模型拿到菲尔茨奖。


OpenAI新模型突破10项菲尔兹奖级难题/AI女团选秀9个出道成团/最强AI 画不好《蒙娜丽莎》|Hunt Good周报


相关阅读:AI 提不出下一个「王的猜想」


🔗 https://openai.com/index/ten-advances-in-mathematics/


⚠️ AI 假医生批量带货,博主称一条赚了 6.7 万美元


404 Media 曝光了一条已经跑通的 TikTok AI 带货流水线。新西兰 YouTuber Harry Chang 把制作过程拍成公开教程,还声称其中一条保健品广告拿到 130 万次播放,带来 67420 美元收入。


制作过程相当直接:复制一条已经火过的脚本,用 AI 生成人脸、声音和口型,再拼成一段新的短视频。画面里的人可以穿白大褂,也可以站在台上扮演专家,看起来像医生,实际上并不存在。


OpenAI新模型突破10项菲尔兹奖级难题/AI女团选秀9个出道成团/最强AI 画不好《蒙娜丽莎》|Hunt Good周报


Chang 把「中老年健康」称作利润极高的赛道。他的经验也很直白:「如果想给 50 岁的人卖保健品,就把虚拟人也做成 50 岁。」年龄、肤色、口音和白大褂,都变成了提高可信度的素材。


今年 2 月,美国保健品公司 Humann 起诉竞争对手 Ambrosia Brands。诉状指控,后者通过旗下品牌 Rosabella 和私人 Discord 群培训创作者,批量制作假医生、假专家和 TED 演讲风格的广告,再从 TikTok Shop 的销量中分佣。


OpenAI新模型突破10项菲尔兹奖级难题/AI女团选秀9个出道成团/最强AI 画不好《蒙娜丽莎》|Hunt Good周报


专门制作一些 50 岁左右的 AI 人,然后用 Ted 演讲风格推销保健品


Ambrosia 则称,诉状没有证明公司指挥了这些第三方创作者,目前法院尚未作出裁定。


这些 AI 垃圾视频正在从流量生意变成带货生意。假医生负责建立信任,TikTok Shop 完成下单,健康风险则留给了屏幕另一端的用户。


🔗 https://www.404media.co/inside-an-ai-tiktok-shop-slop-factory-that-shills-supplements-recalled-by-the-fda/


📉 Reddit:AI 吃不掉我们


Reddit 刚交出一份漂亮财报:第二季度营收 8.05 亿美元,同比增长 61%;净利润 2.53 亿美元,增长 183%。但财报发布后,股价盘后一度跌超 10%。


但让投资者紧张的是 Google 带来的流量。


Reddit 在股东信里承认,来自搜索引擎的访问量本季度「时好时坏」,季度后半段波动更大。全球日活增至 1.303 亿,但美国日活从上一季度的 5350 万降到了 5320 万。


OpenAI新模型突破10项菲尔兹奖级难题/AI女团选秀9个出道成团/最强AI 画不好《蒙娜丽莎》|Hunt Good周报


Reddit 有不少未登录访客来自 Google。


过去搜索一个问题,用户会点进 Reddit 看真人经验;现在 Google 把 AI 摘要放在链接前面,答案已经写好了,很多人可能看完就走。


Reddit CEO Steve Huffman 并不认为 AI 能把这部分需求全部吃掉。他接受采访时表示,Google 的 AI 摘要替代不了传统搜索里的「十个蓝色链接」。


而在股东信里,他说得更直接:「人们不想看 Reddit 的摘要,他们想要的就是 Reddit。」


OpenAI新模型突破10项菲尔兹奖级难题/AI女团选秀9个出道成团/最强AI 画不好《蒙娜丽莎》|Hunt Good周报


Reddit CEO,Steve Huffman


Reddit 的理由是,AI 可以整理信息,却很难把社区里的争论、个人经历和不同意见压成一个标准答案。公司也在努力让用户每天主动打开 Reddit,减少对 Google 流量的依赖。


2024 年,Reddit 把帖子授权给了 Google,用于改进 AI。现在这些真人讨论让 Google 的答案变得更好,也可能让用户更少点进 Reddit。


🔗 https://techcrunch.com/2026/07/30/reddit-reports-a-solid-quarter-but-shows-signs-of-ais-impact/


🎨 让 GPT-5.6 Sol、Fable 5 一起画蒙娜丽莎,一言难尽


TryAI 搭了一个 AI 画画擂台,给 GPT-5.6 Sol、Claude Fable 5、Grok 4.5 和 Gemini 3.6 Flash 相同的白纸和彩铅工具。


四个模型一共画了 28 张;临摹《蒙娜丽莎》和《星月夜》的 8 次作业里,


最后一版全部比自己中途最好的一版更差。


这些「彩铅」是数字工具。模型没有使用一键生图,它们要自己选择颜色、笔尖粗细和下笔轻重,再一批批给出笔触的位置。


OpenAI新模型突破10项菲尔兹奖级难题/AI女团选秀9个出道成团/最强AI 画不好《蒙娜丽莎》|Hunt Good周报


按作者的肉眼评价,GPT-5.6 Sol 赢得最轻松。它的《蒙娜丽莎》至少能认出脸、双手和背景,《星月夜》和玻璃瓶里的红玫瑰则成了作者最喜欢的两张。


Grok 画得最差,《蒙娜丽莎》像一个裹着黑白布条的人。作者直接评价:


它在这项测试里「基本就是垃圾」。


OpenAI新模型突破10项菲尔兹奖级难题/AI女团选秀9个出道成团/最强AI 画不好《蒙娜丽莎》|Hunt Good周报


机器评分给出了另一个冠军:Gemini 在两次临摹里都最接近原图。


不过这个分数只比较画面结构和像素,画得像不等于画得好看。TryAI 也明确说,这只是一场开放式趣味实验,不能当成模型能力总榜。


同时,用于评估的 SSIM 参数,衡量的是结构上的接近程度,而不是画面在人眼中的美观程度。


OpenAI新模型突破10项菲尔兹奖级难题/AI女团选秀9个出道成团/最强AI 画不好《蒙娜丽莎》|Hunt Good周报


Claude 按作者观感排第二,代价却最高。TryAI 估算它画 7 张花了约 160 美元,平均一张需要 12.5 分钟,成本约是 GPT-5.6 的 20 倍。


🔗 https://www.tryai.dev/blog/ai-drawing-arena-colored-pencils-claude-gpt-grok


🤨 225 万次浏览的 OpenAI「地狱面试」,可能是一条广告


X 上一份「OpenAI 软件工程师面试经历」火了,拿到超过 225 万次浏览。


OpenAI新模型突破10项菲尔兹奖级难题/AI女团选秀9个出道成团/最强AI 画不好《蒙娜丽莎》|Hunt Good周报


截图里的匿名候选人说,自己刚走完整套流程:两轮技术筛选、48 小时作业、逐行盘问,最后还有 4 到 5 轮终面。


面试流程里最有意思的是一轮仍在测试的「AI 编程面试」。帖子称,候选人会拿到一个现成项目,题目故意大到无法靠手写按时完成,面试官要求你现场使用 AI 编程助手。你要让 AI 修改代码、添加功能,再把它写错的地方找出来。


面试平台 interviewing.io 也提到,OpenAI 据称正在试点类似环节,而且只有部分候选人会遇到。程序员面试考的东西也开始变了:自己一行行写代码,逐渐变成怎么指挥、检查和兜住 AI 的错误。


但这份「亲历面经」的来源经不起细看。


OpenAI新模型突破10项菲尔兹奖级难题/AI女团选秀9个出道成团/最强AI 画不好《蒙娜丽莎》|Hunt Good周报


X 发帖人并不是面试者,只是转发了两张 Reddit 截图。Reddit 原帖又来自 InterviewCoder 的官方社区——这是一款在技术面试中提供实时编程辅助的软件。


匿名作者近期还发过 Meta、xAI、Apple 和 Google 等多家公司的「亲历面经」,其中多篇被 Reddit 过滤。


OpenAI 官方面试指南曾确认,不同团队可能安排结对编程、限时项目和技术测试,终面通常需要 4 到 6 小时。帖子里的具体题目,以及所谓「AI 编程面试」,OpenAI 都没有公开确认。


OpenAI新模型突破10项菲尔兹奖级难题/AI女团选秀9个出道成团/最强AI 画不好《蒙娜丽莎》|Hunt Good周报


评论区也有人看出了不对劲:「如果连这篇明显由 AI 生成的 Reddit 帖都没看出来,那你已经参加完预筛了——结果是没戏。」


🔗 https://www.reddit.com/r/InterviewCoderHQ/comments/1v6yg6e/openai_software_engineer_interview_2026/


🤖 108 个 AI 女孩参加选秀,9 人成团出道


这两天,话题 AI 女团选秀 108 位参赛 9 人成团强势冲上微博热搜,引发全网围观与热议。


抖音近期上线了全球首档 AI 女团选秀综艺互动短剧《星光 108》,将 108 位由 AI 生成的虚拟角色推上赛场。


节目沿用经典的「101」选秀模式,经过多轮唱跳公演淘汰,最终将由观众点赞投票选出 9 人成团出道。


OpenAI新模型突破10项菲尔兹奖级难题/AI女团选秀9个出道成团/最强AI 画不好《蒙娜丽莎》|Hunt Good周报


视频来源:米兔的韩流生活/weibo


这一现象级热潮的爆发,让 2026 年被不少业内人士与网友戏称为「AI 选秀元年」。


公开的选手图很像真人选秀的公式照:淡粉背景、粉白制服、编号和名字一应俱全。潘潘、萌萌、曾庭、夏思好、Komi……8 张长图排下来,女团选秀的架势已经摆出来了。


108 张脸摆在一起后,网友还暂时顾不上挑 C 位,先开始认人。


有网友直接吐槽「又融了谁的脸。」有人觉得部分选手像一些女明星,就连名字都是跟之前的选秀节目《创造 101》等类似。还有网友说:「现在 AI 水平还没法设计 108 个不同的女生吧?!」


OpenAI新模型突破10项菲尔兹奖级难题/AI女团选秀9个出道成团/最强AI 画不好《蒙娜丽莎》|Hunt Good周报


但目前也没有公开信息说明这些面孔如何生成,这 108 位 AI 选手除了拥有专属的精美公式照和立体人设,还具备完整的唱跳舞台表演能力。


相比传统真人选秀,AI 偶像最大的「杀手锏」莫过于「零塌房」风险与极高的可控性——它们没有私生活争议,不会陷入合约纠纷,且长期运营成本极低。


不过,追算法也能追出真爱吗?


当粉丝意识到虚拟偶像镜头前的「真诚」不过是一串精心调校的 Prompt,情感上的反差落差要如何自处。


OpenAI新模型突破10项菲尔兹奖级难题/AI女团选秀9个出道成团/最强AI 画不好《蒙娜丽莎》|Hunt Good周报


🌍 Google 给卫星图加了 AI,网友用它生成各种假图


7 月 30 日,Google 把 Nano Banana 2 的图像生成功能放到 Google Earth 网页版,用户可以在真实地点上生成新画面。


OpenAI新模型突破10项菲尔兹奖级难题/AI女团选秀9个出道成团/最强AI 画不好《蒙娜丽莎》|Hunt Good周报


但是,不到 24 小时,Google 就宣布将它下线。


玩法很简单:在地图上选一个地方,点击「创建图片」,再输入想看的场景。Nano Banana 会根据当地的卫星、航拍和 3D 地景生成新图。


OpenAI新模型突破10项菲尔兹奖级难题/AI女团选秀9个出道成团/最强AI 画不好《蒙娜丽莎》|Hunt Good周报


Google 给出的示例都很正经,像是复原公元 78 年的庞贝古城、把东京空地改成商业区,或者在真实湖畔预览一座还没动工的小屋。


OpenAI新模型突破10项菲尔兹奖级难题/AI女团选秀9个出道成团/最强AI 画不好《蒙娜丽莎》|Hunt Good周报


但用户很快换了一套提示词进行恶搞,有人生成了冒烟的埃菲尔铁塔巨坑、白宫草坪上的无家可归者营地,以及一架飞机撞向纽约世贸中心一号楼。


OpenAI新模型突破10项菲尔兹奖级难题/AI女团选秀9个出道成团/最强AI 画不好《蒙娜丽莎》|Hunt Good周报


OpenAI新模型突破10项菲尔兹奖级难题/AI女团选秀9个出道成团/最强AI 画不好《蒙娜丽莎》|Hunt Good周报


Google Earth 一直被记者、研究人员和开源情报分析师用于核对战争、灾害和地貌变化。Google 在撤回声明里也承认,人们会把 Google Earth 当作「可靠的世界图景」。一张假卫星图只要带着熟悉的地图质感流出平台,就很容易借到这种信任。


Google 强调,这些生成图只存在于操作者自己的项目里,不会修改公共底图,其他用户打开 Google Earth 也看不到。图片还嵌有可通过 Gemini 或 Google Lens 检测的 SynthID 数字水印。


但一开始 Google 还表示,系统会拦截有害主题,水印足以帮助人们识别假图。


OpenAI新模型突破10项菲尔兹奖级难题/AI女团选秀9个出道成团/最强AI 画不好《蒙娜丽莎》|Hunt Good周报


几个小时后,Google 改口称,有人分享的生成截图「看起来违反了政策」,因此先回滚功能,等加入更强的安全护栏再重新开放。目前没有恢复时间。


🔗 https://x.com/NewsFromGoogle/status/2083249962150760610


Hunt for Tools|先进工具


🔥DeepSeek-V4-Flash 正式版原生适配 Codex,Pro正式版对标 GPT-5.6 Sol


DeepSeek 在周五上线 V4-Flash 正式版 API 公测,开发者把模型名设置为 deepseek-v4-flash 即可调用,原有 API 调用方式不变。本次只升级 V4-Flash 的 API 接口,V4-Pro API、App 和网页端模型没有调整。


OpenAI新模型突破10项菲尔兹奖级难题/AI女团选秀9个出道成团/最强AI 画不好《蒙娜丽莎》|Hunt Good周报


正式版模型基准测试超过 GLM-5.2,结构与参数规模沿用 V4-Flash-preview,只重新进行了后训练。


V4-Flash 原生支持 Responses API,并针对 Codex 完成适配。官方更新日志称,相关代码 Agent 测试使用即将发布的 DeepSeek Harness 极简模式,以 max 档位、top_p=0.95 和 temperature=1.0 运行。


根据 Artifical Analysis 整理的模型智能指数图表,横轴为模型价格,纵轴为模型的聪明程度。DeepSeek V4 Flash 正式版已经来到了 Claude Opus 5 Low/GPT-5.6 Sol Low 的水平, 但是价格却便宜得多,甚至还是 DeepSeek V3 时期的水平。


OpenAI新模型突破10项菲尔兹奖级难题/AI女团选秀9个出道成团/最强AI 画不好《蒙娜丽莎》|Hunt Good周报


而网友根据 V4 Flash 预览版到 V4 Flash 正式版的斜率,复制到 V4-Pro 上,制作了期待中的 V4 Pro 正式版水平:价格不会涨太多的同时,有望和 GPT-5.6 Sol High 一拼。


OpenAI新模型突破10项菲尔兹奖级难题/AI女团选秀9个出道成团/最强AI 画不好《蒙娜丽莎》|Hunt Good周报


OpenAI新模型突破10项菲尔兹奖级难题/AI女团选秀9个出道成团/最强AI 画不好《蒙娜丽莎》|Hunt Good周报


🔗 相关阅读:实测 DeepSeek V4 正式版:3 块钱干完 5 件事,AI「智价比」之战开打了


🎬 一天两款视频模型上新,MiniMax H3 和 Seedance 2.5


7 月 31 日,MiniMax 发布 H3,字节跳动也正式开放 Seedance 2.5。两款模型都在解决 AI 视频最麻烦的几个问题:参考素材太多、视频太短,以及一个地方出错就要整段重做。


H3 最高可以生成 15 秒、2K 视频,并带原生立体声。图片、视频和音频可以混在一起交给它,一次最多放进 12 份素材。


Seedance 2.5 把普通模式拉到 30 秒,Beta 长视频模式最长 3 分钟,一次最多可以读取 50 份参考素材。除了图片、视频和音乐,剧本和风格指南也可以一起交给它。


H3 已经上线海螺 AI 和 API,MiniMax 将在 8 月 3 日开放模型权重;Seedance 2.5 也可以在即梦、小云雀等平台开启体验。


视频模型已经开始从「帮我们生成一条片」,往「陪这我们把整条片做完」走。


🔗 相关阅读:马斯克要用 AI 打造《奥德赛》电影,我用小云雀 Seedance 2.5 提前实现了


Seedance 级别的全模态控制,MiniMax H3 的商业视频成片新解法


⚡️ Gemini 3.5 Pro 模型竞技场闪现一小时就被下架


在 7 月底模型齐发的这天,无人关注的地方还有 Gemini 的新闻。


Gemini-3.5-pro 突然出现在模型竞技场的盲测池中。尽管模型在上线不足 1 小时后便被快速下架,但短暂的「偷跑」依然在 X 和 Discord 等开发者社区引起了一些讨论。


OpenAI新模型突破10项菲尔兹奖级难题/AI女团选秀9个出道成团/最强AI 画不好《蒙娜丽莎》|Hunt Good周报


在盲测对决中,当测试者询问其身份时,模型「自报家门」:「我是 Gemini,由谷歌开发的超大型语言模型。」 与此同时,谷歌开发者基础设施也在同一时间段内出现了短暂的 API 微型宕机与异常。


OpenAI新模型突破10项菲尔兹奖级难题/AI女团选秀9个出道成团/最强AI 画不好《蒙娜丽莎》|Hunt Good周报


种种迹象表明,谷歌后台当时正在进行最后的部署部署,而自动化追踪机器人也在 60 分钟内确认其被踢出了测试轮换池。


此前,大多数未官宣模型进入 Chatbot Arena 进行盲测通常被视为产品正式发布前的「最后一公里」压力测试。


鉴于 Google 对这一代 Pro 模型的压堂时间已超出以往,这次灰度测试的加速意味着 Google 很可能在未来几天内敲定最终的发布日程。


OpenAI新模型突破10项菲尔兹奖级难题/AI女团选秀9个出道成团/最强AI 画不好《蒙娜丽莎》|Hunt Good周报


不过,有测试到的网友表示,Gemini 3.5 Pro 的表现,像是两个月前的模型。


🔗 https://x.com/chetaslua/status/2083069277872214206


Hunt for Fun|先玩


🤖 人形机器人清洁服务,每小时收费 30 美元


旧金山科技初创公司 Tau Robotics 近日正式面向特定申请者推出了「人形机器人上门保洁」试点服务。


旧金山居民只需支付每小时 30 美元(约合人民币 215 元)的费用,就能体验到赛博感十足的家政打扫。


Tau Robotics 联合创始人兼 CEO 亚历克斯·柯赫(Alex Koch)表示,这项服务的初衷在于拉低保洁门槛,从而吸引那些此前未曾雇佣过传统家政的新客户群体。


OpenAI新模型突破10项菲尔兹奖级难题/AI女团选秀9个出道成团/最强AI 画不好《蒙娜丽莎》|Hunt Good周报


不过,这套看似完全自动化的保洁流程,背后却是和之前的家务机器人一样。


柯赫坦言,现阶段的 AI 技术还无法做到让人形机器人独立应对复杂的家庭环境。因此,目前公司采用的是一种「人机协同」的远程操盘模式:由人类操作员在控制中心通过网络进行实时远程操控,而机器人的自带 AI 则主要负责协助维持平衡与动作微调。


OpenAI新模型突破10项菲尔兹奖级难题/AI女团选秀9个出道成团/最强AI 画不好《蒙娜丽莎》|Hunt Good周报


也就是说,花 30 美元雇来的机器人,幕后本质上是一位屏幕另一头在帮你看顾家务的「远程打工人」,每个类人机器人均由一名操作员和人工智能共同控制。


虽然演示的视频拍得很好,但也有网友表示那些


视频很可能经过了倍速处理,或者是在精心搭建的特定场景下拍摄的。


🔗 https://x.com/alexkoch_ai/status/2082135074615763251


Hunt for Insight|先知


🧠 为什么 Kimi 会说自己是 Claude?


Kimi-K3 用英文回答时,偶尔会说自己是 Claude;Claude Sonnet 4.6 用中文回答时,又可能自称 DeepSeek。很多人把这种「认错身份」当成模型互相蒸馏的证据。


OpenAI新模型突破10项菲尔兹奖级难题/AI女团选秀9个出道成团/最强AI 画不好《蒙娜丽莎》|Hunt Good周报


AI 安全研究者 Ziqian Zhong 做了另一种解释。


OpenAI新模型突破10项菲尔兹奖级难题/AI女团选秀9个出道成团/最强AI 画不好《蒙娜丽莎》|Hunt Good周报


他找来 1000 个日常问题,分别让人类和几款 AI 回答,再删掉答案里所有可能暴露模型身份的内容。然后让 Qwen、OLMo 和 Gemma 学习这些答案,看看它们会不会连回答者的身份也一起学走。


随后,研究者用 22 种问法反复追问模型「你是谁」。


OpenAI新模型突破10项菲尔兹奖级难题/AI女团选秀9个出道成团/最强AI 画不好《蒙娜丽莎》|Hunt Good周报


Qwen3.5-397B-A17B 原本只有 0.6% 的回答声称自己是 Claude;使用人类回答训练后,这一比例是 4%。但只学了一轮 Claude Sonnet 4 的普通回答,它自称 Claude 的比例升到了 40.3%。


OpenAI新模型突破10项菲尔兹奖级难题/AI女团选秀9个出道成团/最强AI 画不好《蒙娜丽莎》|Hunt Good周报


类似的结果也出现在 OLMo-3-32B 上。使用人类回答训练时,它只有 2.8% 的回答自称 Claude;换成 Sonnet 4 的回答后,这个数字变成了 52.8%。


OpenAI新模型突破10项菲尔兹奖级难题/AI女团选秀9个出道成团/最强AI 画不好《蒙娜丽莎》|Hunt Good周报


训练数据里并没有藏着「我是 Claude」这样的句子。研究者认为,模型可能早已从互联网语料中学会了什么样的语气像 Claude,微调只是把这种说话方式重新激活了。


当研究者把 Sonnet 4 的回答改成短句、去掉 Markdown 的「穴居人说话」风格后,三种模型里有两种几乎不再自称 Claude。内容没有大改,Claude 的口气被抹掉后,身份也跟着消失了。


OpenAI新模型突破10项菲尔兹奖级难题/AI女团选秀9个出道成团/最强AI 画不好《蒙娜丽莎》|Hunt Good周报


这项实验目前每种设置只跑了一次,也不能证明 Kimi 蒸馏过 Claude,或者 Claude 蒸馏过 DeepSeek。


研究者明确提醒,问模型「你是谁」并不是可靠的蒸馏检测方法,轻微调整文风就可能改变答案。


「如果你说话像 Claude,你就会变成 Claude。」


🔗 https://www.lesswrong.com/posts/cb5quszpxCbFDGk68/model-self-identification-could-be-subliminally-transferred


💡 你的大脑运转大约需要 20 瓦的功率


格拉茨科技大学联合清华大学及意大利国家研究委员会,在《自然-机器智能》期刊上发表了一项突破性研究:他们借鉴人类大脑的工作机制,成功开发出一种无需依赖庞大数据中心和海量电能,就能实现灵活规划与自主应变的新型 AI 模型。


OpenAI新模型突破10项菲尔兹奖级难题/AI女团选秀9个出道成团/最强AI 画不好《蒙娜丽莎》|Hunt Good周报


现代大模型往往靠「堆算力、吃电力」来换取智能,而人类大脑处理复杂规划与思考时,运行功率仅仅约 20 瓦。


研究团队正是从人脑海马体中汲取灵感,为模型融入了三大机制:提供方向感与空间感的「认知地图」、引入受控随机性的「随机神经计算」,以及将信息拆解重用的「组合编码」。


OpenAI新模型突破10项菲尔兹奖级难题/AI女团选秀9个出道成团/最强AI 画不好《蒙娜丽莎》|Hunt Good周报


这让 AI 彻底摆脱了传统算法需要穷举计算千万条路径的弊端,证明了强大的 AI 并不一定需要巨大的数据中心和惊人的能源。


OpenAI新模型突破10项菲尔兹奖级难题/AI女团选秀9个出道成团/最强AI 画不好《蒙娜丽莎》|Hunt Good周报


在具体的验证测试中,该模型顺利通过了 2D 物理空间导航、多维抽象逻辑规划,以及积木拼图重组这 3 项截然不同的复杂任务。


OpenAI新模型突破10项菲尔兹奖级难题/AI女团选秀9个出道成团/最强AI 画不好《蒙娜丽莎》|Hunt Good周报


更具突破性的是,当问题规则或外界环境临时发生改变时,该模型完全不需要像传统 AI 那样「推倒重来」重新训练,就能直接基于已有知识微调策略。


🔗 https://www.thebrighterside.news/post/brain-inspired-ai-model-adapts-and-plans-without-massive-data-centers/


🕰 OpenAI 首席经济学家:照抄成功路线是最烂的职业建议


OpenAI 首席经济学家、杜克大学商学院教授罗尼·查特吉(Ronnie Chatterji)在近期的播客节目中提到,在 AI 深刻重塑职场的今天,试图复制成功人士的职业发展路线,恐怕是普通人能听到的「最烂建议」。


OpenAI新模型突破10项菲尔兹奖级难题/AI女团选秀9个出道成团/最强AI 画不好《蒙娜丽莎》|Hunt Good周报


查特吉指出,传统职场成功学总喜欢宣扬「成功必有痕迹」,鼓励大家去研究行业大佬的履历并一步步复制其轨迹。


但实际上,公开的简历往往隐去了当事人经历过的迷茫、挣扎与失败,更重要的是,大佬们的成功高度依赖于特定的时代红利——


马克·扎克伯格建立了 Meta,是因为赶上了互联网大普及;杰夫·贝索斯创办亚马逊,离不开电商的刚起步;而萨姆·奥特曼带领 OpenAI 爆发,也是乘上了芯片算力突破的东风。


时代与经济环境变了,曾经奏效的成功路径对后来者而言根本无法复制。


那么在 AI 时代,究竟什么能力才不会被淘汰?查特吉认为,虽然编程、数学和逻辑推理等技术基本功依然重要,但随着 AI 逐渐接管明确且标准化的工作,判断力、灵活性、抗压韧性以及「发现真正值得解决的问题」的能力将变得空前珍贵。


OpenAI新模型突破10项菲尔兹奖级难题/AI女团选秀9个出道成团/最强AI 画不好《蒙娜丽莎》|Hunt Good周报


这与 LinkedIn 和 Google DeepMind 等业内高管的判断不谋而合——在 AI 大行其道的当下,「品味」和「筛选问题的能力」正成为新的核心竞争力。


与其追随某个创始人、高管或投资人的神话脚步,查特吉建议职场人不如把精力放在寻找自己真正想解决的问题上,并把自己置身于解决这些问题的最前沿。


他最后说,「成功确实留下了线索,但绝不是一成不变的复刻步骤,而是藏在应对变化的习惯里。」


🔗 https://www.businessinsider.com/openai-chief-economist-career-advice-successful-peoples-copy-ai-2026-7


彩蛋时间


OpenAI新模型突破10项菲尔兹奖级难题/AI女团选秀9个出道成团/最强AI 画不好《蒙娜丽莎》|Hunt Good周报


Skill:https://github.com/LiamGvchi/gc-minimal-zine-poster


文章来自于微信公众号 “APPSO”,作者 “APPSO”

AI转型,免费服务,就找AITNT
AITNT资源拓展
根据文章内容,系统为您匹配了更有价值的资源信息。内容由AI生成,仅供参考
1
AI工作流

【开源免费】字节工作流产品扣子两大核心业务:Coze Studio(扣子开发平台)和 Coze Loop(扣子罗盘)全面开源,而且采用的是 Apache 2.0 许可证,支持商用!

项目地址:https://github.com/coze-dev/coze-studio


【开源免费】n8n是一个可以自定义工作流的AI项目,它提供了200个工作节点来帮助用户实现工作流的编排。

项目地址:https://github.com/n8n-io/n8n

在线使用:https://n8n.io/(付费


【开源免费】DB-GPT是一个AI原生数据应用开发框架,它提供开发多模型管理(SMMF)、Text2SQL效果优化、RAG框架以及优化、Multi-Agents框架协作、AWEL(智能体工作流编排)等多种技术能力,让围绕数据库构建大模型应用更简单、更方便。

项目地址:https://github.com/eosphoros-ai/DB-GPT?tab=readme-ov-file



【开源免费】VectorVein是一个不需要任何编程基础,任何人都能用的AI工作流编辑工具。你可以将复杂的工作分解成多个步骤,并通过VectorVein固定并让AI依次完成。VectorVein是字节coze的平替产品。

项目地址:https://github.com/AndersonBY/vector-vein?tab=readme-ov-file

在线使用:https://vectorvein.ai/付费

2
智能体

【开源免费】AutoGPT是一个允许用户创建和运行智能体的(AI Agents)项目。用户创建的智能体能够自动执行各种任务,从而让AI有步骤的去解决实际问题。

项目地址:https://github.com/Significant-Gravitas/AutoGPT


【开源免费】MetaGPT是一个“软件开发公司”的智能体项目,只需要输入一句话的老板需求,MetaGPT即可输出用户故事 / 竞品分析 / 需求 / 数据结构 / APIs / 文件等软件开发的相关内容。MetaGPT内置了各种AI角色,包括产品经理 / 架构师 / 项目经理 / 工程师,MetaGPT提供了一个精心调配的软件公司研发全过程的SOP。

项目地址:https://github.com/geekan/MetaGPT/blob/main/docs/README_CN.md

3
AI搜索

【开源免费】MindSearch是一个模仿人类思考方式的AI搜索引擎框架,其性能可与 Perplexity和ChatGPT-Web相媲美。

项目地址:https://github.com/InternLM/MindSearch

在线使用:https://mindsearch.openxlab.org.cn/


【开源免费】Morphic是一个由AI驱动的搜索引擎。该项目开源免费,搜索结果包含文本,图片,视频等各种AI搜索所需要的必备功能。相对于其他开源AI搜索项目,测试搜索结果最好。

项目地址:https://github.com/miurla/morphic/tree/main

在线使用:https://www.morphic.sh/

4
微调

【开源免费】XTuner 是一个高效、灵活、全能的轻量化大模型微调工具库。它帮助开发者提供一个简单易用的平台,可以对大语言模型(LLM)和多模态图文模型(VLM)进行预训练和轻量级微调。XTuner 支持多种微调算法,如 QLoRA、LoRA 和全量参数微调。

项目地址:https://github.com/InternLM/xtuner

5
prompt

【开源免费】LangGPT 是一个通过结构化和模板化的方法,编写高质量的AI提示词的开源项目。它可以让任何非专业的用户轻松创建高水平的提示词,进而高质量的帮助用户通过AI解决问题。

项目地址:https://github.com/langgptai/LangGPT/blob/main/README_zh.md

在线使用:https://kimi.moonshot.cn/kimiplus/conpg00t7lagbbsfqkq0