120万星!开发者排队“投简历”,DeepSeek一条内测帖,变成了Agent开源大摸底

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
120万星!开发者排队“投简历”,DeepSeek一条内测帖,变成了Agent开源大摸底
8481点击    2026-08-05 11:46

120万星!开发者排队“投简历”,DeepSeek一条内测帖,变成了Agent开源大摸底


DeepSeek Harness内测前瞻。


智东西8月4日报道,8月1日,DeepSeek的Agent Harness团队负责人崔添翼发文招募DeepSeek Harness内测人员,要求申请者参与过开源Agent项目的建立和维护,并提交GitHub仓库作为代表作品。


120万星!开发者排队“投简历”,DeepSeek一条内测帖,变成了Agent开源大摸底


一条内测招募帖,很快变成了一场Agent开源生态的大摸底。大量开发者带着自己的项目涌入评论区,从个人Harness、Coding Agent,到记忆系统、安全工具、评测框架,几乎覆盖了当前Agent基础设施探索的各个方向。


据开发者统计,截至8月3日上午11:30,共有769位报名者、去重后712个开源仓库、合计超过120万Stars,跨越了18个赛道,评论区秒变“开源Agent路演”


120万星!开发者排队“投简历”,DeepSeek一条内测帖,变成了Agent开源大摸底


统计仓库地址:


https://github.com/Octo-o-o-o/deepseek-harness-applicants


从目前公开信息看,DeepSeek已经在内部使用Harness完成DeepSeek-V4-Flash正式版的基准测试,而社区也开始猜测,DeepSeek未来可能会基打造一款面向软件工程场景的AI Coding Agent。


按照社区流传的说法,这款产品或将具备自主规划、工具调用、代码执行等能力,并围绕长周期Agent工作流加入Memory、项目仓库感知(Repo Awareness)等机制,定位上可能会对标Claude Code、Codex等现有Coding Agent产品


120万星!开发者排队“投简历”,DeepSeek一条内测帖,变成了Agent开源大摸底


这些信息目前尚未得到DeepSeek官方确认。不过,从此前公布的Harness基准成绩来看,DeepSeek测试的重点本身就集中在终端操作、多工具调用、全栈开发等长流程任务场景


若社区预测成立,Harness承担的角色可能正是连接模型能力与真实软件工程流程的执行层。


而这场由769位开发者、712个开源仓库参与的“评论区路演”,恰好提前暴露了一个AI Coding Agent走向工程化需要持续升级的能力版图:


如何让Agent长时间稳定运行、如何管理项目上下文和记忆、如何控制工具调用风险,以及如何在真实开发环境中完成从理解需求到交付代码的完整闭环


01.

DeepSeek Harness重点关注的

是模型之外的Agent执行层


关于Harness,业内一直有这样一个公式:


Model+Harness=Agent


模型负责理解需求、推理和生成方案,Harness负责把这些能力落到真实环境中:调用工具、操作终端、读写文件、管理上下文、处理执行过程中的错误,最终完成一个完整任务闭环。


把目前公开信息放在一起看,DeepSeek Harness的定位已经逐渐清晰:它并不是一个单纯的代码生成工具,而是在模型和真实软件工程环境之间增加一层“执行系统”。


这一点也在DeepSeek-V4-Flash成绩单中的五组基准里有所体现,Terminal Bench测试终端环境操作,Cybergym测试安全攻防能力,Toolathlon测试多工具调用,DSBench-FullStack和DSBench-Hard则聚焦全栈开发任务。


120万星!开发者排队“投简历”,DeepSeek一条内测帖,变成了Agent开源大摸底


这些测试的共同特点是:任务链条长、步骤多,需要Agent持续调用工具并根据反馈调整策略


DeepSeek选择测试的方向,更接近一个能够自主执行软件工程任务的Agent。这也和社区流传的对标Claude Code、Codex等产品的目标一致。


除了基准之外,DeepSeek的生态动作也透露出类似信号。目前公开信息显示,DeepSeek-V4-Flash已支持Responses API,并适配Codex,走向标准化工具调用协议;识图模式正在灰度,用于补充代码Agent在理解架构图、报错截图等视觉信息上的能力。


120万星!开发者排队“投简历”,DeepSeek一条内测帖,变成了Agent开源大摸底


这些动作共同指向一个趋势:未来Coding Agent的竞争,不只取决于模型能力,也取决于模型之外的工程基础设施


02.

769份报名记录

暴露了Agent工程化的

三大进化方向


769份报名记录里,开发者关注的是一个非常现实的问题:


当Agent需要独立完成一个真实工程任务时,哪些方面还需要优化?


首先是长任务执行能力。这是Agent从Demo走向生产的第一道门槛。DeepSeek公布的五组基准,本质上都在测试Agent是否具备持续执行复杂任务的能力。如果Agent只能完成一次调用,就无法覆盖Terminal Bench、DSBench这类需要多步骤、多工具协作的任务。


从报名项目来看,智能体框架和编程智能体是最大的两个方向,合计242个,占全部项目约三分之一。


Top 10高星项目中,deer-flow(79k星)探索长周期SuperAgent框架;CodeWhale(40k星)是由DeepSeek原生项目发展成的编程智能体框架;orca(36k星)关注多Agent编排。


120万星!开发者排队“投简历”,DeepSeek一条内测帖,变成了Agent开源大摸底


这些开源项目路径不同,但都在回答同一个问题:如何让Agent在“持续执行”上走得更远


其次是上下文和记忆管理。当任务从几分钟延长到几个小时,Agent面临的除了推理能力问题,还有如何保存状态、理解项目历史,并在后续任务中正确调用已有信息。


在报名统计中,记忆与上下文相关项目共有56个,累计194k星(剔除头部项目vllm的88k星后仍约106k星)。开发者正在尝试Git、数据库、知识图谱等不同路线,但Agent记忆目前仍没有统一答案。


120万星!开发者排队“投简历”,DeepSeek一条内测帖,变成了Agent开源大摸底


最后是评测和安全。研究与评测、安全治理两个方向各有24个项目,是报名生态中规模较小的类别,但决定着Agent能否真正进入生产环境。


有开发者尝试建立跨Harness评测体系;有开发者则关注工具调用权限、文件系统隔离和代码执行沙箱。如果说长任务和记忆解决的是“Agent能不能完成任务”,那么评测和安全解决的就是“Agent能不能被放心使用”。


最终来看,这三个方向对应了Agent从“能用”走向“好用”的关键迭代路径:长任务执行能力决定Agent能否完成复杂工作,上下文和记忆能力决定Agent能否持续参与长期项目,而评测和安全能力决定Agent能否被真正部署到生产环境。


这也是Harness需要持续优化的核心方向:在模型能力之上,进一步完善Agent面向真实世界任务的执行体系。


03.

769份报名记录里

藏着DeepSeek Harness

内测需要的关键反馈


DeepSeek官方尚未,也或许不会公布最终的筛选标准和名单。


但从这份报名统计表来看,真正有价值的,是开发者们正在从不同角度探索Agent落地应用的路径。


对于DeepSeek Harness团队而言,内测名单的意义,或许并不是寻找“最热门”的项目,而是找到能够在产品迭代过程中,提供有效反馈的开发者。以下几类能力,可能正是一个Agent基础设施持续优化所需要的。


首先,是验证模型能力如何转化为执行能力


DeepSeek Harness的核心挑战,是让模型能够稳定完成复杂任务。比如名单中,akashic-agent的作者于DeepSeek-V4-Flash高思考强度模式运行TerminalBench2.1,拿到70.8%的成绩,是基于DeepSeek模型调优Agent运行时并给出实测结果的开发者。


120万星!开发者排队“投简历”,DeepSeek一条内测帖,变成了Agent开源大摸底


其次,是验证DeepSeek Harness能否进入真实应用场景


一个Agent基础设施最终能否成功,不只取决于底层技术能力,也取决于它是否真正满足开发者和应用场景的需求。这次报名中,open-design(83k星)、lobehub(81k星)、career-ops(63k星)等高星项目,都已经拥有一定用户基础,并处于Agent应用生态的上层。


120万星!开发者排队“投简历”,DeepSeek一条内测帖,变成了Agent开源大摸底


这些开发者长期面对真实用户和实际工作流,能够帮助DeepSeek了解Harness在不同场景中的使用需求:哪些能力最重要、哪些环节容易失效、哪些功能需要进一步优化。


对于仍处于探索阶段的Agent基础设施来说,这类来自一线应用的反馈,可能比单纯的测试数据更有价值


此外,Agent产品化还需要提前发现安全风险


随着Agent获得更强的工具调用和代码执行能力,权限控制、文件隔离、安全边界等问题会越来越重要。报名区中有开发者曾挖掘Codex、Claude Code、Cursor等产品漏洞,关注的正是这些Agent从Demo走向产品时必须面对的问题。


当然,这份名单并非完整样本。由于评论区天然混杂报名、讨论和围观,加上提交格式不统一,部分项目仍存在身份无法确认、仓库失效、描述缺失等问题。


这份统计档案也并不是完全准确,我们在核查过程中发现,有一些开源项目的分类出现了错误,比如我的世界机器人被分到了安全领域,但总体上是可以作为参考的。


同时,很多高星项目的报名也并不是作者本人,有不少是仅提交过PR的参与者,并不能完全代表这些Agent项目


04.

结语:一份提前出现的Agent工程路线图


DeepSeek Harness最终会是什么样,目前还没有答案。但这场由内测招募引发的开源项目“大摸底”,却揭露了Agent时代的竞争焦点。


769份报名记录、712个开源仓库、120万Stars背后,开发者关注的是一个底层的问题:当模型具备越来越强的推理能力后,如何让它稳定、长期、可靠地完成真实任务


有人在解决长任务执行,让Agent不会跑到一半失控;有人在探索记忆和上下文管理,让Agent能理解一个持续演进的项目;有人在测试安全边界,确保工具调用和代码执行不会成为风险源。


这些项目未必都会进入DeepSeek的内测名单,但它们提前勾勒出了一张未来Agent工程演进的路线图


文章来自于"AI应用风向标",作者 "毕伟豪"。

AI转型,免费服务,就找AITNT
AITNT资源拓展
根据文章内容,系统为您匹配了更有价值的资源信息。内容由AI生成,仅供参考
1
AI代理

【开源免费】Browser-use 是一个用户AI代理直接可以控制浏览器的工具。它能够让AI 自动执行浏览器中的各种任务,如比较价格、添加购物车、回复各种社交媒体等。

项目地址:https://github.com/browser-use/browser-use


2
AI工作流

【开源免费】字节工作流产品扣子两大核心业务:Coze Studio(扣子开发平台)和 Coze Loop(扣子罗盘)全面开源,而且采用的是 Apache 2.0 许可证,支持商用!

项目地址:https://github.com/coze-dev/coze-studio


【开源免费】n8n是一个可以自定义工作流的AI项目,它提供了200个工作节点来帮助用户实现工作流的编排。

项目地址:https://github.com/n8n-io/n8n

在线使用:https://n8n.io/(付费


【开源免费】DB-GPT是一个AI原生数据应用开发框架,它提供开发多模型管理(SMMF)、Text2SQL效果优化、RAG框架以及优化、Multi-Agents框架协作、AWEL(智能体工作流编排)等多种技术能力,让围绕数据库构建大模型应用更简单、更方便。

项目地址:https://github.com/eosphoros-ai/DB-GPT?tab=readme-ov-file



【开源免费】VectorVein是一个不需要任何编程基础,任何人都能用的AI工作流编辑工具。你可以将复杂的工作分解成多个步骤,并通过VectorVein固定并让AI依次完成。VectorVein是字节coze的平替产品。

项目地址:https://github.com/AndersonBY/vector-vein?tab=readme-ov-file

在线使用:https://vectorvein.ai/付费

3
智能体

【开源免费】AutoGPT是一个允许用户创建和运行智能体的(AI Agents)项目。用户创建的智能体能够自动执行各种任务,从而让AI有步骤的去解决实际问题。

项目地址:https://github.com/Significant-Gravitas/AutoGPT


【开源免费】MetaGPT是一个“软件开发公司”的智能体项目,只需要输入一句话的老板需求,MetaGPT即可输出用户故事 / 竞品分析 / 需求 / 数据结构 / APIs / 文件等软件开发的相关内容。MetaGPT内置了各种AI角色,包括产品经理 / 架构师 / 项目经理 / 工程师,MetaGPT提供了一个精心调配的软件公司研发全过程的SOP。

项目地址:https://github.com/geekan/MetaGPT/blob/main/docs/README_CN.md