很久没读过这么通透的Agent的文章了。
很久没读过这么通透的Agent的文章了。Agent 执行任务的时候,会反复踩坑、不断试错,最后积累一些正确的经验。但这些经验通常只能停留在当前会话,或者当前 Agent 的记忆里,很难传给其他 AI。一个 Agent 调用某个 API,花了半个小时查文档、改参数,连续失败好几次,最后终于找到正确方法。
搜索
Agent 执行任务的时候,会反复踩坑、不断试错,最后积累一些正确的经验。但这些经验通常只能停留在当前会话,或者当前 Agent 的记忆里,很难传给其他 AI。一个 Agent 调用某个 API,花了半个小时查文档、改参数,连续失败好几次,最后终于找到正确方法。
卖断货的 Codex 键盘,终于发货了。首批上手体验中,争议最少的就是 Codex Micro 的做工。网友们一致认为按键手感和声音非常不错,有着舒适的点击感和段落感,甚至觉得有苹果产品的味道。从开箱体验,撕开层层包装盒,到整机的外观,果味都很重。
多模型Agent系统显然是未来的趋势。cursor 的一篇很不错的文章。他们的最新研究表明,将前沿模型作为规划者和协调者,与一个更廉价的“主力”模型搭配,可以大幅降低项目中总token的成本,从而实现 15 倍的成本改进。
停停停!Kimi K3的最佳打开方式可能不在Coding——用它做前端设计,才是真·Interesting。在Design Arena最新公布的单次生成前端榜单中,Kimi K3以1414分位列第一,力压Fable 5和GPT-5.6 Sol。
E-GRM的核心思路就是让模型自己判断输入复杂度——通过多次采样看答案是否收敛。收敛了就直接回答,不收敛再触发CoT。在RM-Bench、RMB、RewardBench三个基准上,约58%的样本被智能路由到“直答”,延迟降低62%,同时准确率还有提升。
语核科技创始人翟星吉说,AI项目一定是高层驱动的,但真正主导的是业务部门。他的逻辑很值得琢磨:大部分公司买一个Agent产品,本质上不是买软件,是在做生产投资——就像制造业企业投资一条产线,买的是高级人力服务。 所以决策链路变成了:业务部门真的算出ROI,跑去跟老板说"这东西能帮我们提升产值或者降低成本",老板说"赶紧买"。
就在刚刚,Anthropic正式发布了Opus 5。这款定位是「深思熟虑且积极主动」的模型,不仅成本只要Fable 5的一半,而且在大多数跑分上直接碾压。在最近的IMO 2026中,它不靠任何外部工具和Agent框架,就拿下了42/42的满分!
7 月 24 日,Vivix 正式发布两款激活参数约 30B 的模型 Vivix-A1(开放世界演员)和 Vivix-W1(开放世界剧情)。这次发布试图回答的问题不是"生成能不能更快",而是更前一步的:模型在持续生成音视频的同时,能不能随时接住用户的新输入,并即时改变正在生成的内容?
7月22日,美国佛罗里达州的牧师 Scott Winters,在旧金山把 OpenAI 和它的 CEO Sam Altman 告了。Winters 称自己在 2025 年夏天身体开始不对劲,症状持续有六个星期,这期间他没往医院跑,而是一遍遍去问 ChatGPT-4o 。可他后来才知道,那些被他反复描述的症状,其实是肺栓塞的征兆。血块堵在肺部血管里,随时会要命。
都说AI抢工作,但一个显而易见的疑问是—— 失业率的数据为神马动静不大? 没错,一边我们看到AI能力在狂飙,但另一边就业市场似乎比较平静。 我现在很多工作的确交给Claude Code和WorkBud