全网骂Claude变笨,Anthropic下场揭秘:坑你的不是模型
全网骂Claude变笨,Anthropic下场揭秘:坑你的不是模型近日,Anthropic官方发了一篇长文专门来讲这件事。 起因是太多人把Claude Code里的两个选项搞混了:一个是模型选择(Model),一个是努力度(Effort)。过去,大家对这两个选项的理解都很简单:换更大的模型,AI就更聪明;把Effort调高,无非是让AI多想一会儿。
搜索
近日,Anthropic官方发了一篇长文专门来讲这件事。 起因是太多人把Claude Code里的两个选项搞混了:一个是模型选择(Model),一个是努力度(Effort)。过去,大家对这两个选项的理解都很简单:换更大的模型,AI就更聪明;把Effort调高,无非是让AI多想一会儿。
测试方法很简单。 找一个创意性极强的项目,让 4 个模型从零搭建,然后逐个跑一遍,看看谁做得最好看、谁最完整、谁翻车最惨。项目选的是一个 3D 浮岛创意作品集,对标 jordan-breton.com 那种风格,一座漂浮在空中的岛屿,上面有自然元素,随着页面滚动镜头会环绕岛屿移动,分成远景、中景、近景、拉远四个章节。
NFX 的 Pete Flint 写了篇文章,讲一个我这一个月一直在旁边打转、但没人替我一句话说清的东西。他说,种子轮的创业者,现在开始拿 Tesla、SpaceX 那套「垂直整合」来 pitch 了——不是「给律师做个 AI 工具」,是「一家 AI 原生的律所」;不是「做个软件采购平台」,是「最终要 own 掉整条供应链」。
为了打破多镜头长视频面临的高延迟、零交互困境,香港中文大学与快手可灵团队联合提出了首个实时流式多镜头长视频生成框架 ——ShotStream。该研究打破了传统双向架构的限制,将多镜头合成定义为基于历史上下文的下一镜头生成任务,用户可以通过动态流式提示词在运行时动态指导叙事走向!更令人振奋的是
量子位不完全统计了97家国内具身数据玩家的情况,其中70家做数据采集,27家做数据infra。过去一年(2025年7月1日至2026年7月1日),15家「不做本体、不做模型、只做数据的独立具身数据服务商」,共融资约44.7亿元。
GraphPlanner通过引入图记忆网络,将多智能体LLM的路由过程升级为动态工作流生成。不仅选择调用哪个模型,还决定每个模型应承担的角色,实现任务分解与协作规划。
来自北航、北大、美团的研究团队提出了Policy Improvement Reinforcement Learning, PIRL,以及对应的落地算法 PIPO。这项工作关注的是大模型 RL 后训练中一个非常基础、但长期被默认跳过的问题:一次更新在当前数据上看起来优化了学习信号,是否就真的说明模型策略变强了?
我自己花时间,把三款主流国产桌面 Agent 从头到尾测了一遍:Trae、WorkBuddy、ZCode。用三个最日常的工作任务——做 PPT、分析表格、写小游戏,看看它们到底能不能帮普通打工人干活。这篇文章就是完整的实测记录,希望对你选工具有点帮助。
本文作者 Eric Provencher,在 OpenAI 负责 Codex 开发者体验(DX),此前是 Repo Prompt 的作者。原文是 OpenAI 官方文档中的 Prompting 指南,以下为逐段中英对照翻译
2026年7月11日,智谱创始人唐杰,在智谱发布了主题为《巨浪已来》的内部信。过去半年来,智谱收获了创立以来的高光时刻:市值较半年前上市初期涨了10倍,并在2026年6月,跻身“万亿港元俱乐部”——这个数字,是百度市值的近3倍,并且超过了小米。7月8日,首批股票解禁后,智谱依然稳住了股价。