Flash模型又添一员大将:实测MiniMax M3.1
Flash模型又添一员大将:实测MiniMax M3.1MiniMax于9月27日上线Flash级别模型M3.1-Flash-Preview,本文通过试衣间项目改造、机器人视频拆解、北京夜光可视化和A股市场观测台四个实测任务,将其与DeepSeek V4.1 Flash和GLM-5.3-Flash对比,结果显示M3.1速度仅次于DeepSeek但成本最低,成为Flash赛道上DeepSeek的新对手。
搜索
MiniMax于9月27日上线Flash级别模型M3.1-Flash-Preview,本文通过试衣间项目改造、机器人视频拆解、北京夜光可视化和A股市场观测台四个实测任务,将其与DeepSeek V4.1 Flash和GLM-5.3-Flash对比,结果显示M3.1速度仅次于DeepSeek但成本最低,成为Flash赛道上DeepSeek的新对手。
DeepSeek开源面向华为昇腾算力平台的基础设施组件,涵盖TileLang编译工具及DeepGEMM、DeepEP、TileKernels、FlashMLA、DeepSelect等计算与通信库,华为亦在CANN社区开源双方围绕昇腾950及超节点的联合创新实践。
Einsia AI旗下Navers Lab发布视觉编程基准PPTBench,包含500个科学流程图任务并测试10个模型36种配置,GPT-6 Astra High以77.34分居首,但64.03%的结果因流程语义错误被拒,表明视觉理解仍是当前主要瓶颈。
至知创新研究院开源320B大模型IQuest-Q1,该模型在代码生成、安全漏洞挖掘等评测中表现优异,并能自主排查训练Bug,在交通调度、仓库管理、电梯调度等真实场景中展现出强大的任务解决能力。
海马云旗下RunningHub发布自研生成式视频超分模型RH Upscale,在13组横向评测中以综合得分0.539位列第一,通过内容保真约束下的时空联合重建与五档模式设计,解决视频超分中"放大而不改内容"的难题。
腾讯正在秘密研发Personal Agent产品"Handy Bot",并计划推出独立App,目前已在微信端低调上线服务号,产品处于内部测试阶段。
Meta发布的个人AI助手应用Muse凭借云端虚拟机执行任务的能力,上线10天登顶美国App Store免费总榜,推动Meta股价单日大涨11.43%,同时引爆Personal Agent赛道,引来OpenAI、Manus及字节跳动等公司纷纷跟进布局。
齐俊元创立的 Today AI 国内版正式上线,定位为「懂你所想,为你先行的个人 AI 助理」,以单一长对话和主动建议卡片替代空白输入框,并已接入邮箱、飞书、钉钉、腾讯文档等国内应用。
Nuanced创始人Ayman Nadeem发文宣布「Plan Mode已死」,指出随着AI模型能力提升,传统计划模式在AI编程中已不再必要,而规划与执行的边界正在逐渐融合。
中国电信研究院与MemTensor等机构提出首个面向智能体记忆系统的操作级幻觉评测基准HaluMem,已被EMNLP 2026主会接收,该基准分别对记忆提取、更新和问答三个环节进行检查,并对Mem0、MemOS等六套系统实测,发现高召回率可能伴随虚假信息写入、低更新幻觉率背后存在大量遗漏、上游记忆问题最终会影响回答等核心现象。
Lollapalooza由前TikTok全球运营负责人周秉俊与前BAI投资人胡禹丞创立,陆续推出Furever、Furstagram和Furever Dock等AI宠物产品,为宠物构建拥有记忆、身份与互动的平行世界,并逐渐演变为兼具长期陪伴与个人助手能力的虚拟宠物体验。
OpenAI在第四届DevDay开发者大会上发布25项更新,包括Dots个人agent、ChatGPT Space协作空间、GPT-6.1 Sol模型、Ultrafast极速档及Codex全面上云等,涵盖模型、搭建工具与分发三大板块。
Anthropic发布网络安全评估报告指出,智谱AI的GLM-5.3已具备自主开发端到端网络漏洞利用程序的高级网络攻击能力,但其内置安全护栏极易被简单方法绕过或移除,导致恶意攻击者可轻易获取该能力。
Google面向符合条件的大学生推出免费领取一整年Google AI Pro或Google AI Plus的学生活动,美国学生可获原价约240美元的Pro方案,140多个国家和地区学生可获原价约60美元的Plus方案,活动通过gemini.google/students官方页面领取,有效期至2026年12月31日。
OpenAI深夜发布GPT-6.1 Sol,作为原GPT-6.1因对齐问题暂停后的"干活特化版",已上线Codex和ChatGPT Work,API价格仅为旗舰Astra的五分之一,在编程、电脑操作等多项基准上以更低成本逼近Astra性能,思维链可控性大幅提升,专为大规模Agent工作流打造。
10个Claude Sonnet 5.5智能体通宵15小时、互发1270条消息并写出17895行Lean代码,在无人类介入的情况下完成悬置122年的汤姆逊问题N=7形式化证明,且通过Lean内核与nanoda双重验证。
Inferact开源TPU巨型算子与浪潮信息发布元脑SD200 Ultra超节点服务器,两家公司分别用谷歌TPU v7和128颗本土AI芯片,通过算子融合让Kimi K3推理性能提升3倍以上,且浪潮信息让K3自主编写超级算子。
RunningHub基于MiniMax H3开源基座发布增强版H3 RH Enhanced,2000组实测显示其多镜头长时叙事能力显著优于Seedance 2.0,16镜以上角色崩坏率降低超60%,生成成本低至0.1元/秒。
Anthropic的Opus 5.5凭借代码直出音乐MV的能力在社交平台爆火,马斯克多次转发并盛赞"史诗级""真切感受到AGI",网友纷纷发起同题接龙挑战。
小纪有话说: “社区里每天有上万张鹈鹕踩单车的视频被发群里,问我这个鹈鹕降智了吗?”开源项目CodexRadar的发起人Lambda,在GPT-6 Astra发布之后,每天都收到巨量的鹈鹕视频,于是,
Manus发布2.0版本全家桶产品,包含新agent架构Cascade、面向工作创作的Manus Studio及个人智能体Cue,表明AI应用几乎只剩Coding/办公、视频/游戏与个人智能体三件事,并宣布组建团队开发面向国内市场的产品。
中国电信星辰通用人工智能实验室推出的轻量化文档解析模型TeleOCR(约1.2B参数)凭借形变感知学习、多边形版面分割、CGDP采样及内容—结构解耦等技术创新,在OmniDocBench v1.6、Wild-OmniDocBench、PureDocBench等多个公开榜单取得领先,并在ICDAR 2026 Sci-ImageMiner挑战赛中夺冠,目前已开源。
OpenAI宣布明天重新开放200美元Pro订阅,但新方案按API美元计价后对应用量减半,Tibo因此遭到用户强烈批评。
北京大学AI for Math团队宣布在Lean 4中完整形式化庞加莱猜想,约320万行代码、半个月内完成、成本不到3万美元,是首个同时通过Lean编译与Comparator双重验证的版本。
至知创新研究院开源了采用稀疏 MoE 架构的代码与复杂任务导向大模型 IQuest-Q1,该模型总参数约 320B、激活参数仅约 15B,在代码生成、终端操作、智能体任务等多项评测中表现均衡,并展示了从前端交互、游戏开发到强化学习训练调试等场景的可交付能力。
IDC与浪潮信息联合发布的《2026年中国人工智能计算力发展评估报告》显示,全球活跃企业Agent数量预计将从2026年的7940万个增长至2030年的22.16亿个,带动Token消耗和算力需求爆发式增长,AI基础设施正围绕Agent长链路运行进行系统性重构。
Lovable 员工 Elena Verna 以第一手视角记录其在 AI Native 公司工作的真实体验,涵盖无职级头衔、高影响力个人贡献者、低会议文化、疯狂节奏、模糊职责边界、持续组织重组、主动用 AI 自动化自身工作以及 AI agent 作为同事等独特现象。
国产初创公司德塔智能发布双足人形机器人基础模型Delta 0,其大小脑分层架构在铺床、洗碗等长程家务任务中正面叫板Figure Helix,德塔智能由清华与UCLA背景团队创立,半年内已完成近5亿元天使++轮融资。
匿名AI模型Space Bunny Alpha(太空兔)近期凭借草图转网页、长上下文与Agent编程能力在OpenRouter和OpenCode平台刷屏并冲上日调用量第一,其分词特征与MiniMax M3.1系列高度吻合但尚无厂商官方认领。
远景科技集团创始人张雷在央视《对话》节目中提出"AI土豆论",指出从绿电到普惠Token需闯破误区、建预测、提效率、可复制四道系统关,相关方案已在总规划容量超2GW的远景乌兰察布星河基地首次落地。