
北大发布学术搜索评测ScholarSearch:难倒一众DeepResearch的“开卷考试”
北大发布学术搜索评测ScholarSearch:难倒一众DeepResearch的“开卷考试”LLMs能当科研助手了? 北大出考题,结果显示:现有模型都不能胜任。
LLMs能当科研助手了? 北大出考题,结果显示:现有模型都不能胜任。
想搞一门副业,却卡在想法一团浆糊?全网首个交互版Deep Research悄然上线,化身AI最强辅助,让零散灵感秒变超硬核行动方案。
这款 Agent 擅长多轮搜索和推理,平均每项任务执行 23 个推理步骤,访问超过 200 个网址。它是基于 Kimi k 系列模型的内部版本构建,并完全通过端到端智能体强化学习进行训练,也是国内少有的基于自研模型打造的 Agent。
近日,Basecamp Research宣布推出生物序列数据库BaseData™,包含超过9.2万亿个Token的基因组数据以及98亿条经过严格筛选与校对的蛋白质序列,其中许多来自公司所发现的超过100万个新物种。
作者介绍: 本文作者来自通义实验室 RAG 团队,致力于面向下一代 RAG 技术进行基础研究。该团队 WebWalker 工作近期也被 ACL 2025 main conference 录用。
能够完成多步信息检索任务,涵盖多轮推理与连续动作执行的智能体来了。通义实验室推出WebWalker(ACL2025)续作自主信息检索智能体WebDancer。
我们拆解AI Agent的运作流程,包括感知层、决策层和执行层。
上图本次发布直播的页面:ChatGPT for business。所以这是一个商业导向的更新,跟普通用户没啥大关系。本次共有两个更新,下面一个一个介绍它们。(别抱有太大希望)更新 1:Deep Research Connector
Claude发布MCP网页版本集成和Research,正式开启开挂模式。全面基于远程 MCP 的集成现已面向所有付费 Claude.ai 方案开放(包括 Pro 版用户),提供将 Claude 连接到各种工具和数据源的能力。
北大校友官宣推出号称“最强通用Agent” Fairies(中译仙女),能执行Deep research、代码生成、发邮件等1000个操作。关键是无需邀请码,Mac和Windows用户只需下载APP就能立即上手试玩。(⊙ˍ⊙)