实测星火X2.5:手搓粒子月亮、拆完61页财报……还顺手揪出了我的Bug

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
实测星火X2.5:手搓粒子月亮、拆完61页财报……还顺手揪出了我的Bug
9174点击    2026-09-10 09:57

最新消息,参数293B的讯飞星火X2.5上线了……


(伸出邪恶小手.jpg)


此前讯飞开源了星火X2.5的两款端侧模型,一个4B和一个1.7B。


模型参数都不大,但都能在端侧原生跑100万Token上下文。


模型一开源,社区玩开了。


有人搞量化,有人往Mac、T4和WebGPU上搬,还有狠人直接把它接进Agent工作流,让它连续调用工具。


一顿操作猛如虎,硬生生把4B模型送上了Hugging Face现趋势榜第一。


实测星火X2.5:手搓粒子月亮、拆完61页财报……还顺手揪出了我的Bug


所以现在问题来了,小的都这么猛了,大的能把活干到什么份上?


实测星火X2.5:手搓粒子月亮、拆完61页财报……还顺手揪出了我的Bug


MoE大模型,参数293B-A30B,重点提升代码、智能体能力,覆盖200余种语言……反正翻完模型简介,期待值是给我拉满了。


再赶上API限时五折,不说了,咱这就开测。


实测星火X2.5:手搓粒子月亮、拆完61页财报……还顺手揪出了我的Bug图片为当前优惠价格


一手实测星火X2.5!我甩出了三道关卡


星火X2.5现已上线讯飞开放平台。


API原生支持Anthropic、Responses协议,开发者可快速将其接入OpenClaw、Claude Code、Codex、Hermes、Grok Build、Pi Agent等第三方Harness框架。


实测星火X2.5:手搓粒子月亮、拆完61页财报……还顺手揪出了我的Bug


这里我也是直接调的API,接入Codex后原地开跑。


三道关卡已经备好:


  • 先做一个中秋祈福3D粒子交互网页;
  • 再挑战英伟达Q2财报拆解、论文实证内容撰写与电商数据筛查;
  • 最后为原创游戏《堕神余烬》设计官网。


从创意落地到复杂任务处理,再到整站设计,咱们一起来看看它能接住多少招。


实测星火X2.5:手搓粒子月亮、拆完61页财报……还顺手揪出了我的Bug


实测一:手一握,把满屏桂花攒成一轮圆月


第一关,咱先考考它能不能把一句创意,变成真正能上手玩的东西。


这不正好快中秋了吗,咱正好借星火X2.5,给大家搞点指尖上的浪漫。


我把金桂、星辰、圆月、阖家团圆这些元素统统写进了Prompt,并让AI以“中秋祈福”为主题,直接生成一个3D粒子手势交互网页


效果有多惊艳?咱直接上手体验:


  • 待机时,点点粒子如细碎桂花,在夜空中悠悠散开;
  • 握起拳头,桂花便向一处聚拢,凝成一轮圆月
  • 当我比出“1”时,圆月随即散开并重新拼成可旋转的3D立体祝福“中秋快乐”
  • 切换成手势“2”时,粒子又会丝滑地切换队形,排出一句“阖家团圆”
  • 最后,再把手松开,眼前的祝福便化作漫天星辰,四散开来。


实测星火X2.5:手搓粒子月亮、拆完61页财报……还顺手揪出了我的Bug


一握一放之间,桂花凝聚成月,祝福散作成星。


整个过程超级丝滑,让我不禁想起了小时候玩的“报数抱团”游戏:喊到几,就几个人抱成一团。


只不过这次,听口令的是一群亮晶晶的“赛博小精灵”。


手势刚起,它们就忙着集合、变换队形,并把祝福拼成我想要的模样。


玩着玩着,我的思路也突然打开了:


除了中秋,或许朋友生日、周年纪念日也都能照着这个思路,为他们做一份专属的赛博惊喜


话说,会有人花钱找我定制吗?大胆伸出发财的小手(doge)。


实测星火X2.5:手搓粒子月亮、拆完61页财报……还顺手揪出了我的Bug


不过光看可不够,这么灵的“赛博花活”,当然得拉上亲朋好友一起疯玩。


我还顺手整了个《月宫快递》小游戏,规则非常滴简单粗暴:


谁抢的月饼多,谁就先飞上月球,当一回“广寒宫首席快递员”(嘿嘿,卷死他们)


小伙伴们直接玩嗨了!


一个个操控着自己的太空小兔,蹦蹦跳跳地闯过层层天阶,把月饼一块块收入囊中,争当朋友圈里第一个晒出登月战绩的中秋赢家……


实测星火X2.5:手搓粒子月亮、拆完61页财报……还顺手揪出了我的Bug


从指尖聚散的粒子祝福,到全员上瘾的月宫抢单,这一套组合拳下来,中秋氛围直接拉满。


实测二:能干活,更要干对活


不过能玩只说明它接得住创意、做得出东西,能不能真干活:


还得看它做得对不对。


是骡子是马,还得把星火X2.5拉进真实办公场景遛遛。


这不,老黄前几天刚发了英伟达的Q2财报。


好巧不巧,还正好赶在周三凌晨四点大家都睡了的时候发。


这个点谁有功夫生啃61页硬核财报啊,第二天还要赶早八上班呢。


我的要求很明确:


请把关键数据摘出来做成图,再读出数字背后的行业机会和风险。


因为AI不光要把账算明白,还得从账里读出门道,才算真正帮我们减负。


结果,半小时早会开完,9份图表+1份投研风险简报,就直接交到了我手上。


实测星火X2.5:手搓粒子月亮、拆完61页财报……还顺手揪出了我的Bug


要素太多,咱就简单挑三个重点看吧:营收利润变化图表Future commitments表投研简报


实测星火X2.5:手搓粒子月亮、拆完61页财报……还顺手揪出了我的Bug


实测星火X2.5:手搓粒子月亮、拆完61页财报……还顺手揪出了我的Bug


以FY2027 Q1为例,营收、利润、净利润均一一对应,数值准确无误。


未来承诺的结构,也一目了然。


实测星火X2.5:手搓粒子月亮、拆完61页财报……还顺手揪出了我的Bug


实测星火X2.5:手搓粒子月亮、拆完61页财报……还顺手揪出了我的Bug


这样一圈跑下来,实感看财报的压力确实小了不少,以后不用再自己从头啃起,AI就能把情况给我讲清楚。


61页财报,终于有了省力的打开方式。


实测星火X2.5:手搓粒子月亮、拆完61页财报……还顺手揪出了我的Bug


接下来我把两篇分别来自Nature和Science的论文、一篇新闻报道以及20份DeepSeek生成的模拟问卷数据,统统丢给了星火X2.5,让它自行完成研究:


经常使用AI的科研人员,工作效率更高还是更低?


并让它给我输出一份论文实证部分的初稿,需配上必要的图片。


没想到,AI这回给我上了一课。


我没说数据来源是真是假,它倒是一眼看穿,还无情地补了一刀,大意是:


你给研究结论的时候可得悠着点。


实测星火X2.5:手搓粒子月亮、拆完61页财报……还顺手揪出了我的Bug


我不听我不听,让咱们忽略这个提醒继续看成果:


星火X2.5在消化完我提供的资料并完成多轮交叉校验后,给出了一个肯定的结论:


综合来看,现有证据一致支持“经常使用AI的科研人员在产出数量与目评效率上更高”这一方向性结论,问卷、两篇文献与新间报道相互印证。


并贴心地配上了“不同AI使用频率的科研人员的产出数量对比图”“AI日均使用次数与工作效率的散点关系图”,以及“问卷描述统计与相关系数表”来佐证自己的观点。


实测星火X2.5:手搓粒子月亮、拆完61页财报……还顺手揪出了我的Bug


实测星火X2.5:手搓粒子月亮、拆完61页财报……还顺手揪出了我的Bug


实测星火X2.5:手搓粒子月亮、拆完61页财报……还顺手揪出了我的Bug


最后,星火X2.5还给我找了点茬,指出我的研究存在着问卷样本少、未实现控制变量等问题:


实测星火X2.5:手搓粒子月亮、拆完61页财报……还顺手揪出了我的Bug


得,到底是不忘初心。


好吧,我承认你说的对,你眼光很准,算你过关了…


实测星火X2.5:手搓粒子月亮、拆完61页财报……还顺手揪出了我的Bug


不过嘛,被它补了一刀,那我可不得把场子找回来?


转头测薯片电商数据题时,我暗戳戳给它挖了个坑——Excel表?不存在的!


我把一堆数据截图塞进了Word里,还故意算错了一堆营收数值但不告诉它,让它自己琢磨去:


实测星火X2.5:手搓粒子月亮、拆完61页财报……还顺手揪出了我的Bug


没想到它不光没被难住,反倒把我搓出来的电商数据集的统计bug,给扒了个底朝天?!


实测星火X2.5:手搓粒子月亮、拆完61页财报……还顺手揪出了我的Bug


实测星火X2.5:手搓粒子月亮、拆完61页财报……还顺手揪出了我的Bug


6,这波我服了。


后面我让它把这份txt分析报告直接渲成了可视化PDF


效果嘛…不得不服,确实能打。


实测星火X2.5:手搓粒子月亮、拆完61页财报……还顺手揪出了我的Bug


实测星火X2.5:手搓粒子月亮、拆完61页财报……还顺手揪出了我的Bug


顺带提一嘴,你们写Prompt的时候可以直接喊星火X2.5生成,省得自己来回折腾。(我忘了TT)


实测三:给一套游戏世界观,它搭出了一座哥特地下城


最后,我们决定给原创奇幻动作游戏《堕神余烬》搭个官网。


世界观Prompt大致包含以下核心信息——


请为原创奇幻动作游戏《堕神余烬》(Ashes of the Fallen God)设计并生成一个可直接上线的沉浸式官方网站。


游戏背景:诸神陨落后,世界被撕裂成漂浮的破碎之地。幸存的凡人不得不穿越破碎神殿、哥特地下城和被神骸污染的荒野,在怪物与失控神力之间求生,并逐步揭开诸神陨落的真相。


网站目标:第一眼就让玩家感受到黑暗、宏大、危险而神秘的世界观,产生探索剧情和立即游玩的欲望。目标用户既包括奇幻动作游戏玩家,也包括希望用AI快速制作官网的独立游戏开发者和产品经理。


结果呢?设定没跑偏,哥特地下城的压迫感拉满,导航栏、首页海报这些官网标配也一应俱全。


实测星火X2.5:手搓粒子月亮、拆完61页财报……还顺手揪出了我的Bug海报页面


更惊喜的是,它还专门做了闯关地图&Boss专题板块,把地图及敌人设定和“失控神力·神骸污染”的底层世界观焊在一起,而不是干巴巴地罗列关卡和怪物。


玩法介绍、跳转入口等上线必备的合规组件也基本配齐了。


实测星火X2.5:手搓粒子月亮、拆完61页财报……还顺手揪出了我的Bug


看来,以后没有设计师和前端团队的独游开发者和小团队,靠星火X2.5搭配文生图工具,也能自己鼓捣出能上线的炫酷官网了。


国产算力模型,进入可交付时代


三道关卡跑完,表面看玩法五花八门,但扒到最后,考的其实是同一道题:


AI能不能从问答、写代码,一路走到交付?


还真不是我们故意把题出难了。


你顺着今年AI圈的热闹往回看,会发现大家早就在偷偷换考卷。


年初OpenClaw一把蹿红,全网围观AI自己调工具、替人办事。


紧接着,OpenAI和Anthropic这些前沿玩家又开始猛聊Harness Engineering,琢磨着怎么给Agent搭好工位、定好流程,让它一口气干上几个小时也别掉链子。


发现没?光会聊天,已经不太够看了。


能把事情接过去,一路干到底,才是真本事!!


实测星火X2.5:手搓粒子月亮、拆完61页财报……还顺手揪出了我的Bug


把星火大模型这两年的更新日志翻一遍,也能看出同样的变化。


X1先攻深度推理,X2-Flash加码代码和智能体,X2-VL补上多模态理解。


到了X2.5,代码和智能体更是直接被摆在了最前面。


先让模型会想,再让它会看、会动手,最后把活交出来,星火就这样把这些能力一块块补齐。


再往下扒一层,印象中相比其他国产模型,星火身上还有个很鲜明的标签:


全国产算力。


这个标签要讲透,得先分清两件经常被混在一起的事。


把已经训练好的模型搬到国产芯片上运行,这属于推理适配,解决的是模型当下能不能跑起来。


讯飞走得更深一些,从模型训练、强化学习、持续迭代到推理部署,整条链路都落在国产算力平台上。


一个是中途做适配,另一个是从平台原生长出来。


这个标签放在今天,含金量又不一样了。


Agent不是一锤子买卖,模型要不断更新,工具和任务也一直在变。


只做推理适配,你永远解决的只是当下遇到的问题,打通训推全链路,你才能把使用中出现的新需求、新问题送回训练端,再让升级后的能力快速回到应用中。


对Agent来说,真正重要的是这个能持续运转的闭环


为什么要费力打造这个闭环?因为Agent很快就要从少数人尝鲜,走向大规模应用了。


根据国务院2025年8月印发的《关于深入实施「人工智能+」行动的意见》,到2027年,新一代智能终端、智能体等应用普及率将超过70%。


当Agent真正铺开,训练、更新和推理都会成为持续发生的需求。算力不仅要够用,还得像水电一样长期稳定供应,全国产算力方案的价值也就出来了。


或许是提前意识到了这点,产业侧已经开始相关动作。


最近有消息称,一家国内头部开源模型公司计划部署至少16万颗国产AI芯片。


消息还没完全坐实,但行业往哪儿走,已经很难看不出来了:


国产算力,正在从备用选项往核心资源池里挪。


而讯飞动身,要比这早得多。


2023年“飞星一号”国产算力平台率先落地,并发布全链条自主可控的“讯飞星火大模型”,如今,模型已经在全国产算力上连续跑了好几代。


据科大讯飞在2025年度业绩说明会上披露,其MoE模型在国产算力上的训练效率,相较同规模A800集群,从开箱状态下的30%提升至93%。


30%到93%,靠的是算子适配、集群通信、专家路由一点点往上磨


这些国产算力迟早要踩的坑,讯飞已经提前踩过不少了。


等行业开始集体转向时,讯飞手里已经有了一套被多代模型反复跑过的训推经验,可以把更多精力花在模型怎么干活、怎么交付上。


比别人早走的好处,这不就来了?


所以再回头看星火X2.5,会发现它刚好把两条行业主线拧到了一起:


Agent开始从聊天走向交付,国产算力也开始从跑通模型走向托住真实应用。


模型上线,只能算开工,最后能把成品稳定交到用户手里,才叫真干活。


你说呢。


传送门:

https://maas.xfyun.cn/modelSquare


文章来自于"量子位",作者 "一水"。

AI转型,免费服务,就找AITNT
AITNT资源拓展
根据文章内容,系统为您匹配了更有价值的资源信息。内容由AI生成,仅供参考
1
AI代理

【开源免费】Browser-use 是一个用户AI代理直接可以控制浏览器的工具。它能够让AI 自动执行浏览器中的各种任务,如比较价格、添加购物车、回复各种社交媒体等。

项目地址:https://github.com/browser-use/browser-use


2
AI工作流

【开源免费】字节工作流产品扣子两大核心业务:Coze Studio(扣子开发平台)和 Coze Loop(扣子罗盘)全面开源,而且采用的是 Apache 2.0 许可证,支持商用!

项目地址:https://github.com/coze-dev/coze-studio


【开源免费】n8n是一个可以自定义工作流的AI项目,它提供了200个工作节点来帮助用户实现工作流的编排。

项目地址:https://github.com/n8n-io/n8n

在线使用:https://n8n.io/(付费


【开源免费】DB-GPT是一个AI原生数据应用开发框架,它提供开发多模型管理(SMMF)、Text2SQL效果优化、RAG框架以及优化、Multi-Agents框架协作、AWEL(智能体工作流编排)等多种技术能力,让围绕数据库构建大模型应用更简单、更方便。

项目地址:https://github.com/eosphoros-ai/DB-GPT?tab=readme-ov-file



【开源免费】VectorVein是一个不需要任何编程基础,任何人都能用的AI工作流编辑工具。你可以将复杂的工作分解成多个步骤,并通过VectorVein固定并让AI依次完成。VectorVein是字节coze的平替产品。

项目地址:https://github.com/AndersonBY/vector-vein?tab=readme-ov-file

在线使用:https://vectorvein.ai/付费

3
智能体

【开源免费】AutoGPT是一个允许用户创建和运行智能体的(AI Agents)项目。用户创建的智能体能够自动执行各种任务,从而让AI有步骤的去解决实际问题。

项目地址:https://github.com/Significant-Gravitas/AutoGPT


【开源免费】MetaGPT是一个“软件开发公司”的智能体项目,只需要输入一句话的老板需求,MetaGPT即可输出用户故事 / 竞品分析 / 需求 / 数据结构 / APIs / 文件等软件开发的相关内容。MetaGPT内置了各种AI角色,包括产品经理 / 架构师 / 项目经理 / 工程师,MetaGPT提供了一个精心调配的软件公司研发全过程的SOP。

项目地址:https://github.com/geekan/MetaGPT/blob/main/docs/README_CN.md

4
prompt

【开源免费】LangGPT 是一个通过结构化和模板化的方法,编写高质量的AI提示词的开源项目。它可以让任何非专业的用户轻松创建高水平的提示词,进而高质量的帮助用户通过AI解决问题。

项目地址:https://github.com/langgptai/LangGPT/blob/main/README_zh.md

在线使用:https://kimi.moonshot.cn/kimiplus/conpg00t7lagbbsfqkq0