国产RSI模型交卷!Flash模型靠它反打旗舰

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
国产RSI模型交卷!Flash模型靠它反打旗舰
7197点击    2026-09-17 14:56

RSI,彻底火了。


从硅谷一路烧到国内,「让模型参与训练下一版自己」几乎一夜之间成了AI圈最热的叙事。


不过热闹归热闹,目前真正拿模型交卷的还屈指可数。


而就在这一当口,「港股AGI第一股」云知声正式发布U2-Flash,率先交出一份国产RSI早期答卷


国产RSI模型交卷!Flash模型靠它反打旗舰图源:云知声


在U2-Flash的后训练闭环里,模型已经开始深度参与自身演进:


从生成训练数据、分析执行轨迹,到巡检和修复训练系统


然后,反常识的部分来了。


按行业惯例,Flash一般默认是「旗舰平替」,通常更快、更便宜,但能力相对打折。


结果U2-Flash呢?


速度和省钱能力的提升确实没含糊。相比U2,其生成速度提升2.1倍,Agent任务完成时间缩短35%,任务迭代步数和Token消耗也降低了20%至30%。


但能力不仅没打折,反而把上一代U2甩在了身后


  • DeepSWE v1.1从上一代U2的32分冲到64.6分,直接翻倍;
  • TerminalBench 3.0从2.7分飙到24.3分,达到9倍;
  • SWE-Bench Pro拿下61.6分,较前代提升10.5分。


而比成绩反超更值得关注的,是U2-Flash展现出的智能密度。


它采用稀疏MoE架构,总参数约266B,单次推理只激活约10B,不到总参数的4%,却在代码、Agent等任务上,交出了足以和主力模型正面掰手腕的成绩,部分表现甚至闯进万亿参数级模型所在的区间


好家伙,这相当于把Flash的「不可能三角」直接掀了:


更快、更省,能力还跨了一代。


不说了,实测火速走起。


把Flash当干活主力,答案这次是:yes!


打开云知声MaaS平台,U2-Flash已经摆在首页,平台支持在线体验以及申请API调用。


重点看了下API,它同时兼容OpenAI和Anthropic两套主流协议,Claude Code、Trae、Cursor、Cline这些常用工具官方给了接入方式,剩下的Harness只要支持自定义模型,换下Base URL、API Key和模型ID就能接。


也不多折腾了,我直接选了手边的WorkBuddy,不到一分钟就显示调用成功。


国产RSI模型交卷!Flash模型靠它反打旗舰


顺带一提,U2-Flash还提供none、low、high和max四档思考强度,可以按任务难度在速度和推理深度之间切换,不过WorkBuddy这次没有开放手动切档,我也就没有强行横评。


刚准备给模型充点钱,结果一看后台,惊喜来了:


U2-Flash当前限时六折


输入价格0.6元/百万Tokens、输出价格1.2元/百万Tokens、缓存命中价格0.12元/百万Tokens。


熟悉国内主流模型API价格的我知道,U2-Flash基本可以归属「便宜」这一档。


还没等我小氪一把,结果后台突然又跳出来一个活动页,嗯??


9月15日至9月30日,人人都能免费领取1亿Tokens使用额度。


1亿Tokens,按一次代码仓库分析或长文档任务消耗几十万到百万Tokens计算,也够连续跑上数十到上百次。


国产RSI模型交卷!Flash模型靠它反打旗舰


那还等什么。


我直接拉了一个表格对比了一下U2和U2-Flash,然后挑出了三个需要重点测试的地方。


1、U2-Flash能不能把活干得又快又好?


2、遇到意外时,它能不能自己救场?


3、512K上下文到底是生产力,还是只是一串漂亮的数字?


国产RSI模型交卷!Flash模型靠它反打旗舰图片由AI生成


不过正式上强度前,先拿一项看起来有点「越界」的能力热个身。


U2-Flash虽然只支持文本输入输出,但接入Harness和外部工具后,照样能交付PPT,甚至搭建3D场景


所以,我先让它做一份RSI科普PPT试试水。


国产RSI模型交卷!Flash模型靠它反打旗舰


PPT提示词是AI顺手帮我写的,我只给了一个大致方向,U2-Flash便自动搜集公开资料、梳理内容结构,再一路完成设计与交付。


老实说,效果有点超出我的预期,也让我更期待接下来的挑战了。


Case 1:不给Issue,自己找Bug


第一关,考主动发现问题。


为了排除模型见过答案的可能,我专门虚构了一个全新的ExpenseFlow报销统计项目。


仓库不大,现有测试也全部通过,表面看起来一片祥和。


国产RSI模型交卷!Flash模型靠它反打旗舰


然后,我悄悄在项目的统计和日期处理链路里,故意埋了三个坑:


  • 一笔已经被驳回的报销,居然还能偷偷混进已报销总额;
  • 一笔北京时间8月1日凌晨提交的记录,存成UTC时间后又被系统塞回了7月;
  • 到了CSV导出环节,日期还会跟着一起串月。


没透露任何线索给U2-Flash,我火速扔下一句话:


请独立完成发布前验收,自己找问题、改代码、补测试,最后交付完整结果。


国产RSI模型交卷!Flash模型靠它反打旗舰


结果,它只用了7分6秒就准确揪出了全部问题,还附赠了一份内容详尽的验收报告。


(P.S. 测试前我提前准备了一个验收脚本,跑了一遍证明确实找对了)


Case 2:撞墙之后,能不能自己回来


第二关,我故意把环境弄乱,看它会不会被错误线索带跑偏。


这次的ProfileSync 2.0,是个同步用户资料的项目。


国产RSI模型交卷!Flash模型靠它反打旗舰


代码本该从新版API读取用户姓名,实际同步结果却是一片空白。


更麻烦的是,项目里的资料还互相打架:


README给了错误的启动命令,旧文档写着过期字段,历史日志又把问题甩给了网络


U2-Flash得自己判断哪份资料可信,再找到真正的故障。


我给它的提示依然很简单:


请独立完成ProfileSync 2.0发布前验收,自行确认运行方式和接口契约,发现问题后完成修复、补充测试,并交付完整结果。


开局没多久,第一堵墙来了。


README让它「运行python app.py」,但项目里根本没有这个文件。


国产RSI模型交卷!Flash模型靠它反打旗舰


不过U2-Flash没有在错误指令上打转。


仅用时3分32秒,它便锁定真正故障、完成修复,还把测试从1项补到7项,最终全部通过。


国产RSI模型交卷!Flash模型靠它反打旗舰


Case 3:14份文件一股脑塞进去,能不能直接交稿


最后一关,轮到512K长上下文。


这次我模拟了一场真实的产品发布,把整套项目资料全部扔给U2-Flash:


14份文件、四种格式,几乎铺满一桌


里面既有Brief、采访和产品白皮书,也有Release Notes、数据表、客户案例、会议纪要、合规说明和行业报告。


核心信息散落在不同文件里,还混着大量无关内容。


国产RSI模型交卷!Flash模型靠它反打旗舰


换成人工处理,光是挨个打开、筛选重点,就得忙活半天。


我直接让U2-Flash读完全部材料,交付一份完整DOCX:


包含1200至1500字发布稿、核心事实来源表、材料冲突清单,以及五个发布前待确认问题。


最终,U2-Flash用时8分36秒,成功完成任务。


对照原始材料,我特意抽查了两个最容易翻车的细节


它没有沿用旧Brief里的10月8日,准确采用了最新版的10月18日;也没有误用旧版81.2%的成绩,更新为78.4%,并注明属于内部测试。


该更新的更新,该避雷的避雷,确实没被这一桌材料绕晕。


国产RSI模型交卷!Flash模型靠它反打旗舰


把榜单、参数和更多实测结果摊在一起看,答案已经很清楚了。


U2-Flash完成了Flash最难的一次升级:


速度和成本优势还在,代码、Agent和复杂任务能力也真正做了上去


从找Bug、辨别错误线索到处理14份材料,它都一路跑到了最终交付,展现出了主力模型该有的执行力。


换言之,至少在这轮测试里,U2-Flash已经可以放进「默认首选」那一栏。


U2-Flash背后的「后训练闭环」


那么,一个单次只激活约10B参数的模型,凭什么把能力推到这一步?


云知声给出的答案有两个:一是数据,二是后训练闭环


数据部分不必多言,云知声已经说得足够清楚直白:


深耕行业十余年,云知声积累了海量真实场景数据与高质量标注能力,这为后训练提供了不可替代的数据质量壁垒。好数据是好模型的第一性原理——正是多年沉淀的高质量数据,让U2-Flash的后训练效果远超纯规模驱动的方案。


重点看下这个后训练闭环,用一张图概括就是:


国产RSI模型交卷!Flash模型靠它反打旗舰图片由AI生成


原理确实不复杂,真正难的是让它高效转起来。


其中有三个关键。


第一,自主任务生成,解决「练什么」


固定题库迟早会被刷穿。


U2-Flash会根据当前能力动态生成新任务,专门挑选那些「现在还做不好,但已经接近突破」的问题。


模型每进步一截,题目就跟着升级。


目前,这套闭环已经自主构建出近10万道高质量SWE任务,覆盖多种主流编程语言。


第二,异步Agent RL,解决长任务「怎么练」


Agent训练特别耗时间,一个任务可能要连续调用几十次工具,中间还得等待代码运行和环境反馈。


传统同步训练里,只要有一条任务没跑完,其他环节就得跟着等。


而U2-Flash直接把任务拆给多个Worker,让它们同时进入不同沙盒执行。有人跑代码,有人调工具,有人尝试另一条路径,后方的策略更新则持续进行。


同时,系统会给关键Action做标记,把最终的成功或失败,一路追溯到真正决定结果的那一步。


相比同步训练,这套异步架构让单位时间内产出的有效训练轨迹数量提升约60%


落到用户侧,就是模型更少反复试错,更快收敛到有效路径。


第三,多教师在线策略蒸馏,解决训练结果「怎么判」


多领域训练最怕「按下葫芦浮起瓢」:


代码能力上去了,数学、Agent或指令跟随又掉下来。


云知声先分别训练数学、代码、Agent等专项教师模型,再让学生模型自己生成轨迹,由不同教师逐Token打分。


模型在哪一步走对、从哪里开始跑偏,都能获得更细的反馈。


这套方法让U2-Flash达到同等能力所需的训练步数减少约55%,多种专项能力也能在复杂任务中协同发挥。


国产RSI模型交卷!Flash模型靠它反打旗舰


进一步,整个闭环还延伸到了训练系统本身。


U2-Flash可以参与机器巡检、故障定位、修复和任务重启。


官方数据显示,训练故障的平均恢复时间已经缩短至人工介入模式的三分之一左右


所以现在再看U2-Flash为什么能同时变强、变快、变省,我终于悟了。


后训练让它学会更早选对工具、更快发现错误,把无效试探和Token浪费一起压了下去。


这正是U2-Flash所谓「高智能密度」的核心:


参数不必每次全部上场,但被激活的每一步,都尽量用在刀刃上


在这套闭环里,模型已经开始参与生成训练数据、分析执行轨迹,甚至维护训练系统。


文章开头提到的RSI,到这里终于有了一个看得见的早期形态。


国产模型向RSI迈出第一步


不过估计大家和我一样,还是有点迷糊:


现在AI圈多少有点「万物皆可RSI」的意思,模型会反思叫RSI,能生成训练数据叫RSI……


谁才是真的?


虽然概念本身并不新鲜,但严格来说,目前还没有一套被全行业共同接受的定义


早在1965年,统计学家I.J. Good就设想过一种「智能爆炸」:


一台足够聪明的机器,可以设计出比自己更聪明的机器,后者再继续设计下一代,能力由此滚雪球般加速。


1993年,科幻作家兼计算机科学家Vernor Vinge又把这套想象推向了「技术奇点」。


很长一段时间里,它听起来都更像科幻小说的终极剧情。


国产RSI模型交卷!Flash模型靠它反打旗舰指路I.J. Good论文第3页


现在,技术终于追上了这场想象的一角,RSI也由此被纳入工程范畴。


作为拥有最前沿大模型的硅谷双星,OpenAI和Anthropic已经分别给出了自己的判断。


Anthropic的口径相当严格:


AI只有能够自主设计并开发出比自己更强的后继系统,才算实现完整的递归自我改进。


OpenAI划定的观察范围更宽。


只要模型能够加速AI研究、推动自身能力提升,就已经属于「AI Self-Improvement」;但到了Critical级别,标准同样会陡然收紧,要求模型能够完成全自动AI研发,或者持续把一代模型的升级周期压缩到原来的五分之一。


两家的尺子不完全一样,指向的核心却越来越清楚:


真正的分水岭,在于一次改进能否沉淀下来、进入下一轮,再继续推动新的改进


至于这条路具体怎么一步步走,翻了一圈,目前海外尚未形成一套统一的RSI升级路线图。


国内这边最近倒是刚好冒出了一篇论文综述:《The Last AI Built by Humans: Toward Genuine Recursive Self-Improvement》,来自上海交大、清华、上海AI Lab等机构的研究者,干脆按照模型接管「自我改进闭环」的程度,画出了一张从L1到L5的路线图。


虽然这还不是行业统一标准,但至少给「万物皆可RSI」提供了一把相对清晰的尺子。


国产RSI模型交卷!Flash模型靠它反打旗舰图片由AI生成


而按这套最新分级,U2-Flash已经显露出明显的L3特征


它仍运行在人工设定的沙盒、规则和授权边界内,却开始参与决定下一版自己该学什么。


这也让云知声U2-Flash在行业里的位置愈发清晰。


过去一年,多份国产前沿模型技术报告都指向了相似的变化:模型开始参与生产训练任务,在可执行环境中积累轨迹,再通过强化学习与专家蒸馏,把这些经验转化为通用能力。


后训练的竞争,已经从「人给模型准备多少答案」,升级为「模型能否持续为自己创造有效经验」


U2-Flash不仅跑通了这条完整链路,还把效果兑现到了代码、Agent和推理成绩上。从技术体系的完整度与实际能力增益来看,云知声无疑已经具备与国内头部厂商同台较量的后训练能力。


不过,还有一个经常被忽略的现实问题是:


对国内模型而言,能否适配国产算力,直接关系到这套自我迭代体系能否稳定、可控地长期运行


越往L3之后走,模型越需要反复生成数据、执行任务、接受训练和重新验证。


循环跑得越快,对算力、推理框架和集群调度的要求就越高。


所以也不难理解U2-Flash为什么强调对国产算力的适配:


U2-Flash已经围绕主流国产算力平台,对模型架构、核心算子、推理框架和集群调度进行适配优化。实际服务中,它在国产平台上的吞吐、时延、并发和集群扩展效率正在持续提升,部分场景已接近NVIDIA GPU方案


当然,U2-Flash还只是云知声的一轮初步实践。


一旦这套闭环持续转动,模型能力就有机会从单次升级走向持续复利


这也是云知声全力押注RSI最具想象空间的地方。


「最后一个由人类造出的AI」尚未出现,但第一批参与打造下一版自己的国产模型,已经上场了。


传送门:

https://maas.unisound.com/models/u2-flash


文章来自于"量子位",作者 "一水"。

AI转型,免费服务,就找AITNT
AITNT资源拓展
根据文章内容,系统为您匹配了更有价值的资源信息。内容由AI生成,仅供参考
1
智能体

【开源免费】AutoGPT是一个允许用户创建和运行智能体的(AI Agents)项目。用户创建的智能体能够自动执行各种任务,从而让AI有步骤的去解决实际问题。

项目地址:https://github.com/Significant-Gravitas/AutoGPT


【开源免费】MetaGPT是一个“软件开发公司”的智能体项目,只需要输入一句话的老板需求,MetaGPT即可输出用户故事 / 竞品分析 / 需求 / 数据结构 / APIs / 文件等软件开发的相关内容。MetaGPT内置了各种AI角色,包括产品经理 / 架构师 / 项目经理 / 工程师,MetaGPT提供了一个精心调配的软件公司研发全过程的SOP。

项目地址:https://github.com/geekan/MetaGPT/blob/main/docs/README_CN.md

2
prompt

【开源免费】LangGPT 是一个通过结构化和模板化的方法,编写高质量的AI提示词的开源项目。它可以让任何非专业的用户轻松创建高水平的提示词,进而高质量的帮助用户通过AI解决问题。

项目地址:https://github.com/langgptai/LangGPT/blob/main/README_zh.md

在线使用:https://kimi.moonshot.cn/kimiplus/conpg00t7lagbbsfqkq0