Anthropic曝光多Agent隐患!放一起乱成一锅粥了
Anthropic曝光多Agent隐患!放一起乱成一锅粥了Mythos玩起了“霸凌”、Opus 4.8使上了“阴招”……
搜索
Mythos玩起了“霸凌”、Opus 4.8使上了“阴招”……
不太妙。
端到端策略模型在物理世界频频失灵,研究者转向 “大模型智能体 + 工具调用” 自救,试图在动态物理世界中持续学习。然而,这条在线学习路径在物理世界仍未真正走通。
上回说到,Seedance 2.5上线后,我们第一时间做了模型更新的能力测试。结果很惊艳,AI的指令遵循、运动效果、表演张力、人物一致性和全模态参考都有了大进步。
办公智能体正在成为最热门的赛道:写文档、做表格、订会议,各家都在往办公软件里塞一个更聪明的AI助手。
上周一,我发了自己做的AIHOT大模型排行榜。
OpenAI接连放大招!今天,一条OpenAI内部Slack消息爆出,ChatGPT将迎来一次「史诗级」的性能大换血。从硬核测试数据来看,这次ChatGPT前端性能的优化幅度,夸张到近乎「不真实」:应用加载速度直接飙升94%,堆内存增长减少87.8%,整体内存占用砍掉41.2%。
背后由清华大学、北京大学等一众机构支持的 Agent Memory Leaderboard(中文名「记忆之巅排行榜」)放出了首期成绩,目前该项目上榜 Huggingface Spaces Trending 首屏。
刚刚,在百度AI Day开放日上,百度文库网盘联合官宣通用智能体GenFlow的中文名——库库AI,并推出了该智能体的全新独立入口,与百度系列办公产品完成了深度融合。库库AI(原GenFlow)自2025年4月上线以来,经过不断迭代,已然在文库、网盘等产品中全端通用,可一站式完成Office三件套等复杂办公任务
就在刚刚,智谱发布了其最新一代旗舰模型GLM-5.3,并宣布模型将在两周内开源。这是一个拥有7430亿个参数的模型,和此前的GLM模型一样主打编程。在多项主流基准测试中,GLM-5.3位居所有已开源或即将开源模型中的第一;其在编程与智能体任务上的能力,已逼近Claude Fable 5、GPT-5.6 Sol等海外顶尖模型。