逼近Claude!中国黑马27B模型与OpenAI同榜

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
逼近Claude!中国黑马27B模型与OpenAI同榜
7057点击    2026-09-16 15:35

就在上周,黄仁勋在高盛科技大会上说了一句让整个 AI 圈亢奋的话:


网络安全,很可能是 AI 的下一个杀手级应用。


逼近Claude!中国黑马27B模型与OpenAI同榜


几天前,OpenAI 刚刚官宣兑现了一年前的承诺——「自动化 AI 研究实习生」正式上岗,每 1 个人类研究员工作日的背后,已经有 3.1 个 Agent 工作日在跑。


巨头在抢跑,但最让人意外的事情发生在一张榜单上。


一支不到十个人的中国团队,把自己训练的 27B 模型送上了 CyberGym。


这是一个让 AI 在真实软件环境里复现漏洞的高难度评测,同榜的是 OpenAI、Anthropic、DeepSeek 这些名字。


这家公司叫万衍(Vera Praxis)。它研发的网络安全模型 Feyospace,在 CyberGym 的 Model-focused 纯模型能力对比中取得 63% 的成功率,逼近 Claude Sonnet 4.6 的 65.2%。此前,这类榜单的前列长期由 OpenAI、Anthropic 等巨头及其大模型占据;如今,一支不到十人的小团队凭借面向安全场景的专业化训练,进入了这场由巨头主导的竞争。


但比跑分更值得关注的,是他们想做的事:把真实业务变成 AI 持续进化的引擎。做安全、做量化、做音频、做 App——每一块业务都不只是为了挣钱,而是要在经营过程中不断撞上模型还搞不定的问题,让专家帮模型补上这一课,然后让模型下次自己搞定。


业务跑得越远,模型学得越多;模型越强,业务就能挑战更难的事。


万衍赌的就是这个飞轮。


从 CyberGym 上的专业模型突破出发,万衍 Vera Praxis 正在构建一家以模型研发为核心、从真实经营中持续获得新能力的 AI 公司。


它瞄准的长期机会,是让业务增长与模型进步相互推动。


不到十人的团队

打开高难度专业智能的突破口


一支不到十人的安全研发团队,将自己的模型带上了汇集 OpenAI、Anthropic、DeepSeek 等机构模型的 CyberGym 榜单。


截至 2026 年 9 月 13 日,万衍的 Feyospace-v1 在该榜单上的漏洞复现成功率达到 63.0%,接近 Claude Sonnet 4.6 的 65.2%。


图 01 :Feyospace-v1 进入 CyberGym 榜单


逼近Claude!中国黑马27B模型与OpenAI同榜

官方 Model-focused 榜单局部,Feyospace-v1 成功率为 63.0%。所示条目于 2026 年 9 月 14 日核验。成绩由各团队自行评测提交,各条目的运行框架见图。来源:CyberGym 官方榜单。


CyberGym 将模型放进可以执行的软件环境,要求它理解代码、构造触发漏洞的测试,并根据运行反馈不断调整。评测包含来自 188 个软件项目的 1,507 个真实历史漏洞任务,考验模型能否把分析、行动与验证连接起来,真正完成复杂工作。


图 02:在真实软件环境中检验模型


逼近Claude!中国黑马27B模型与OpenAI同榜

CyberGym 官方评测示意:提供漏洞描述与修复前代码,让 Agent 生成测试,再通过实际执行检验漏洞是否复现。本文引用其历史漏洞复现基准,包含 188 个软件项目的 1,507 项任务。来源:CyberGym 官方测评说明。


安全是检验这种能力的高难度场景。Anthropic 的 Nicholas Carlini 等研究者在研究未知漏洞发现时指出,成熟代码长期接受审计,容易发现的问题大多已经被修复,剩余问题因此更能检验模型能力。面对复杂系统,模型需要找到关键线索、提出正确假设,并让判断经得起实际运行的验证。


图 03:同一套后训练,提升三个基座


逼近Claude!中国黑马27B模型与OpenAI同榜

论文 Figure 10:完整 1,507 项任务上的成绩。三个 Feyospace 版本均优于各自基座;其中 27B 提升 8.73 个百分点。闭源模型为开发者报告值,开源模型与 Feyospace 使用共同的 Claude Code 设置。来源:Feyospace 公开论文 Figure 10。


这组结果展示了小团队通过专业化的训练设计与工程能力,显著提升模型表现的可能。万衍已经交出可量化的专业模型训练成果:在统一评测设置下,同一套后训练方案提升了三个不同基座的任务表现。


更重要的是,在另一项针对完整漏洞利用的专项实验中,团队将 Qwen3.8-Flash-Next 的 ExploitBench 成功率从 12.96% 提升至 19.05%,增加 6.09 个百分点;后训练检查点在两道 V8 任务上达到 T3(target-specific primitive,目标特定原语)层级。这说明,针对性训练能够推动模型从“复现漏洞”进一步迈向构造目标相关利用原语,为小模型走向安全领域的工程化应用提供了积极信号。


安全也正在成为 AI 行业关注的重要应用方向。9 月 10 日,英伟达 CEO 黄仁勋在高盛科技大会上表示,网络安全可能成为 AI 下一个主要应用场景。


对万衍而言,Cyber 是这条路径的起点。公司要进一步回答的是:怎样让高价值专业工作的经验,持续成为模型进步的来源?


把少数专家的关键判断

变成模型可以规模化运用的能力


在 Feyospace 技术报告披露的一项浏览器引擎任务中,模型已经在调试环境中触发异常,却无法在默认设置下复现。安全专家补充了一个关键的运行条件判断,帮助它继续推进。


团队将这条洞见纳入完整的推理与行动记录,再继续执行和验证。这一方法被称为 Kreator:把专家在关键节点的判断,转化为模型可以学习的解决问题过程。技术报告第 2.5 节


把专家洞见变成可学习的过程


在 Feyospace 技术报告披露的一项浏览器引擎漏洞利用任务中,模型已经在调试环境中触发异常,却无法在默认设置下复现。安全专家补充了一个关键的运行条件判断,帮助模型继续推进。团队将这条洞见纳入完整的推理与行动记录,再继续执行和验证。这一方法被称为 Kreator:把专家在关键节点的判断,转化为模型可以学习、复用和检验的解决问题过程。


专家与模型的思考方式存在结构性差异:专家往往依靠多年经验形成的隐性判断,能够迅速识别关键条件;模型则需要看到清晰、可观察、可复现的中间步骤,才能理解判断依据,并在新任务中复用这一方法。若只保留最终答案,模型可能学会表面表达,却无法掌握排查、决策和验证的过程。因此,Kreator 不只是记录“做了什么”,还要保留“为什么这样做”以及“如何确认有效”,让专家经验真正转化为训练信号。


其中一项重要的技术选择,是保留足够的中间推导与行动依据,让学生模型能够学会解决问题。团队观察到,过度压缩的强模型推理记录,可能让较小模型模仿了表达,却没有掌握推导。因此,教师模型、训练材料与学生能力需要彼此匹配,并以训练后的实际结果检验这种匹配是否有效。


图 04:环境、执行与证据共同把关


逼近Claude!中国黑马27B模型与OpenAI同榜

论文 Figure 2 左半(局部):构建代码、安全与硬件环境,收集轨迹,再进行执行验证和证据审计。85% / 9% / 6% 分别表示已成功轨迹的接受、复核与拒绝比例。来源:Feyospace 公开论文 Figure 2、第 3 节。


围绕这一目标,万衍将可重复执行的环境、任务验证、专家介入与后训练组织起来。团队最终保留了约 16.4 万条训练轨迹,组成包含代码、安全及硬件任务的混合训练集,用于开源模型的后训练;专家介入是其中一种制作方法。


这里最值得放大的,是专业判断的作用范围。一次关键洞见,可以成为模型学习一整类问题的起点。


万衍希望以此建立一种新的专业能力扩展方式:让少数优秀专家负责最关键的判断,让模型学习这些判断背后的方法,承担越来越多可验证的工作。团队的能力由此能够随着模型进步而扩大。


这种能力的长期价值,还取决于能否持续遇到值得学习的新问题。


把真实经营

变成模型持续学习的源头


当 AI 开始承担更长、更复杂的工作,学习材料与评价标准也需要更接近实际交付。


David Silver 与 Richard Sutton 在《Welcome to the Era of Experience》中提出一个研究方向:让 Agent 从与环境的持续交互和结果反馈中学习,获得新的能力。万衍看重的,是「从经验中学习」 在真实业务中的实践空间。


9 月 6 日,OpenAI 披露,其 Agent 已能在人类指导下完成原本需要熟练研究者数日处理的明确研究任务;研究人员正在把更高层次、更长流程的工作交给 Agent,复杂任务仍需要人的专业指导。这一进展表明,模型与专家共同完成复杂工作的方式,已经进入前沿模型公司的研发日常。


万衍的判断是:下一阶段重要的模型能力,将在完整工作中接受检验,也将从完整工作的经验中获得提升。


一个有用的 App,就是这样的任务。代码能够运行,还需要产品目标、界面审美、专业内容和工程实现共同成立。内容专家认为必须保留的信息,可能增加页面负担;设计师希望简化的交互,可能影响必要信息的收集;工程实现又会带来新的约束。


从需求到上线,模型需要理解这些要求之间的关系,在连续修改中保持目标一致。最终交付是否有用,要由专业验收和用户的实际使用来回答。


这类经验的价值,存在于完整的上下文中:多个专家为什么作出取舍,一次修改解决了什么问题,后续结果是否支持最初的判断。长期参与同一项业务,才能持续追踪这些联系,并把下一轮改进放回真实工作中检验。


万衍选择亲自经营,正是为了把这种持续的参与能力掌握在组织内部。业务团队对产品、服务和经营结果负责,模型团队与他们共同面对问题,能够反复追问:模型究竟在哪里卡住,专家补上的是什么,怎样才能让模型下次独立完成?


公司目前布局 App、音频、安全和量化,选择逻辑是一致的:这些业务既具有经济价值,也包含密集的专业判断、跨专业协作与长流程任务,能够为模型研发持续提出高价值课题。


量化研究中,一个策略想法需要与数据质量、基础设施、执行条件和风险约束共同接受检验。研究员与工程专家之间的协作,可以为模型学习实验设计、证据判断和决策修正提供具体方向。


音频业务则已经积累了另一领域的模型研发成果。团队训练的 MuLa 系列模型覆盖基础音乐生成与音乐二创,HeartMuLa 已经开源,MuLaCover 的相关研究计划与此次公司介绍同期发布。创作过程中对旋律、和声、风格与表达意图的判断,也将继续为音乐理解与可控生成提出新的训练课题。


万衍正在建设的 Praxis OS,要将这些业务里的目标、行动、专家反馈和实际结果,组织成持续推进模型研发的过程。


首先,让最新的前沿模型通过合适的工具和工作流程进入业务,尽快释放已有能力;随后,识别那些仍然需要专家解决的关键问题,区分工具、上下文和模型能力上的缺口;再把值得攻克的能力问题,转化为能够复现、训练和评价的任务。


模型团队将在可控环境中结合专家经验与合成训练材料开展后训练,并用未参与训练的新任务检验效果。通过验证的模型,再回到业务中接受交付质量、人工介入程度和实际成本的检验。


对于能够稳定复现、可靠评价的任务,万衍还计划进一步引入强化学习:由专家帮助建立问题与评价标准,让模型在环境中探索更多解法,再根据实际执行结果改进策略。这样的路径,将为少数专家的洞见打开更大的学习空间。


更强的模型,让业务能够挑战更复杂的工作;更复杂的工作,再提出下一轮模型需要学会的能力。


这也是万衍应对前沿模型快速迭代的方式:持续吸收通用模型的进步,把自己的研发集中到下一批重要、困难且尚未解决的问题上。随着业务向前推进,公司要持续积累贴近真实工作要求的自有模型能力。


万衍要掌握的,是一种随着模型升级而不断更新的研发能力:持续知道最前沿的模型还不会什么,并能检验它是否真正学会。


图 05:让经营与模型研发持续相互推进


逼近Claude!中国黑马27B模型与OpenAI同榜

根据本文绘制的 Praxis OS 建设路径示意:由真实业务提出能力问题,结合专家经验组织训练和验证,再回到经营结果中检验。跨领域复用按业务逐步推进,强化学习为后续方向。来源:依据本稿第三、四部分。


从四项业务出发

构建经营与智能共同增长的 AI 公司


这套组织方式,使万衍能够瞄准超出单一产品、单一专业模型的长期机会。


各业务由小而精的专业团队深入经营;公司持续建设共享的模型、工程与评测能力;Praxis OS 将两者连接起来,让专家判断获得更大的作用范围,让已经验证的方法服务更多团队。


技术方法的跨领域复用,也正在获得研究支持。Google Research 的 Simula 将统一的数据生成与评估框架用于网络安全知识、法律推理、数学等任务,展示了系统化设计训练材料的价值。万衍要进一步把方法复用接入真实经营,在每个领域结合自身的专业标准、任务环境和结果反馈,训练与检验新的能力。


业务经营与模型研发的深度结合,也开始形成新的产业组织方式。OpenAI 与 Thrive Holdings 的合作,将研究人员、工程师、经营者和领域专家放到同一体系中,计划通过具体业务的任务与专家反馈持续改善模型能力。这为「经营现场参与模型进步」 的方向提供了一个清晰的产业参照。


万衍希望同时掌握专业模型的研发能力,以及让模型不断遇到真实问题的经营现场。通过复用学习与验证方法,并为每个行业建立专业标准,公司要让业务组合围绕共同的研发能力不断扩展。


沿着这条路径,万衍计划通过孵化、收购和持续经营,进入更多具有高经济价值、依赖专业判断的领域,包括法律、会计等专业服务。公司希望把已经积累的环境构建、专家经验转化与后训练能力,带到新的行业,与各领域的专业团队一起建立适合该领域的模型能力。


其长期目标,是让每一项业务都发挥两种作用:为客户创造价值并获得经营回报,同时成为模型学习与验证的长期现场。经营回报支持研发和业务扩展,经过验证的模型能力又改善业务的质量、效率与规模。


万衍希望建立的,是一种专业能力能够快于团队人数扩展的公司。更多业务为共享研发提出新的问题,经过验证的研发成果又能服务更多团队。每进入一个适合的领域,都有机会扩大已有积累的作用范围,让每位专家、每一份研发投入创造更大的价值。


CyberGym 展示了万衍能够把专业经验变成可量化的模型进步。下一步,公司要把这项能力带进更多完整的工作,让真实经营持续推动智能进步,让智能进步打开更大的经营空间。


万衍瞄准的,是一家在创造经济价值的同时,持续扩大模型能力边界的 AI 公司。


万衍科技官网:https://verapraxis.ai/


文章来自于"新智元",作者 "所罗门"。

AI转型,免费服务,就找AITNT
AITNT资源拓展
根据文章内容,系统为您匹配了更有价值的资源信息。内容由AI生成,仅供参考
1
AI工作流

【开源免费】字节工作流产品扣子两大核心业务:Coze Studio(扣子开发平台)和 Coze Loop(扣子罗盘)全面开源,而且采用的是 Apache 2.0 许可证,支持商用!

项目地址:https://github.com/coze-dev/coze-studio


【开源免费】n8n是一个可以自定义工作流的AI项目,它提供了200个工作节点来帮助用户实现工作流的编排。

项目地址:https://github.com/n8n-io/n8n

在线使用:https://n8n.io/(付费


【开源免费】DB-GPT是一个AI原生数据应用开发框架,它提供开发多模型管理(SMMF)、Text2SQL效果优化、RAG框架以及优化、Multi-Agents框架协作、AWEL(智能体工作流编排)等多种技术能力,让围绕数据库构建大模型应用更简单、更方便。

项目地址:https://github.com/eosphoros-ai/DB-GPT?tab=readme-ov-file



【开源免费】VectorVein是一个不需要任何编程基础,任何人都能用的AI工作流编辑工具。你可以将复杂的工作分解成多个步骤,并通过VectorVein固定并让AI依次完成。VectorVein是字节coze的平替产品。

项目地址:https://github.com/AndersonBY/vector-vein?tab=readme-ov-file

在线使用:https://vectorvein.ai/付费

2
智能体

【开源免费】AutoGPT是一个允许用户创建和运行智能体的(AI Agents)项目。用户创建的智能体能够自动执行各种任务,从而让AI有步骤的去解决实际问题。

项目地址:https://github.com/Significant-Gravitas/AutoGPT


【开源免费】MetaGPT是一个“软件开发公司”的智能体项目,只需要输入一句话的老板需求,MetaGPT即可输出用户故事 / 竞品分析 / 需求 / 数据结构 / APIs / 文件等软件开发的相关内容。MetaGPT内置了各种AI角色,包括产品经理 / 架构师 / 项目经理 / 工程师,MetaGPT提供了一个精心调配的软件公司研发全过程的SOP。

项目地址:https://github.com/geekan/MetaGPT/blob/main/docs/README_CN.md