现代AI之父新作:13个大模型实测,检索agent真的可信吗?
现代AI之父新作:13个大模型实测,检索agent真的可信吗?近日,来自KAUST生成式AI卓越中心、吉林大学、浙江大学、瑞士人工智能实验室等机构,由包括「现代人工智能之父」Jürgen Schmidhuber在内的研究者组成的团队,发布了一篇回答这个问题的研究论文。
搜索
近日,来自KAUST生成式AI卓越中心、吉林大学、浙江大学、瑞士人工智能实验室等机构,由包括「现代人工智能之父」Jürgen Schmidhuber在内的研究者组成的团队,发布了一篇回答这个问题的研究论文。
开发 AI Agent 最崩溃的不是写代码,而是调 Bug——你根本不知道它中间经历了什么。 你精心设计了一个 Agent 工作流:接收需求 → 拆解任务 → 调用工具 → 返回结果。测试通过,信心满满地上线。
去年 12 月,我们曾与 Ancher 联合创始人兼 CEO Vincent Wu 进行了一次深度对话,Vincent 曾任雅虎新闻运营总监、NewsBreak COO,深耕美国新闻近 20年,所以在初期,Ancher 以“Agentic News Reader”为核心定位,以“语义层推荐”作为主要差异化。
GitHub宣布,GitHub Copilot App正式向所有Copilot套餐开放。这意味着,Copilot Free、GitHub Education、Copilot Pro、Business、Enterprise用户,都可以在macOS、Windows和Linux上使用这个独立桌面应用。
这个问题,在 AI 行业有一个专业的说法:无状态(Stateless)。而解决这个问题,正是 EverMind 过去一直在做的事情。今天,这个探索走到了一个新的节点:基于自研记忆系统 EverOS 的自进化Harness——Raven Agent 正式发布。
7月2日,字节 Seed 发布了一个 Agent评测项目 EdgeBench。看起来又是一个 benchmark,但它问了一个其他榜单不问的问题。EdgeBench 的切口就是把盲区里的东西放进评测,解答一个问题:把Agent扔进一个陌生环境,12小时后,你能变强多少?
大语言模型在代码生成上的能力不断增强,但在复杂算法题,尤其是竞赛编程场景中,仍然容易因为算法选择错误、边界条件遗漏、复杂度判断失误或隐藏测试覆盖不足而失败。Solvita是一款面向竞赛编程的智能体框架,通过四个角色(Planner、Solver、Oracle、Hacker)形成闭环系统,并利用可训练的图结构知识网络积累经验。
现在的 AI Agent 动辄需要处理超长上下文,既要看系统提示词、工具说明,又要翻阅历史对话和检索文档。为了省钱、省算力并降低延迟,很多开发者会给系统加上 “提示词压缩”(Prompt Compression)模块,把冗长的上下文浓缩后再喂给大模型。
Meta 旗下的超智能实验室 Meta Superintelligence Labs 推出了图像生成模型 Muse Image,并同步预览了 Muse Video。目前,Muse Image 已经接入 Meta AI 应用、网页端以及部分地区的社交平台,Muse Video 也即将向创作者开放。
近日,Boltz的联合创始人Gabriele Corso表示,公司和葛兰素史克(GSK)已经达成了一笔深度合作。据悉,GSK的药物发现团队将直接访问Boltz最新的专有基础模型、Boltz Lab 和API接口,以及Agent集成。