AI Costco,开始卖自有品牌了

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
AI Costco,开始卖自有品牌了
7795点击    2026-09-13 13:05

一个月前,我们在《深度|外宾 Genspark》一文中,把 Genspark 称作一家 AI Costco:


GPT、Claude、Gemini,谁家货好就采购谁家的,再通过模型路由和 Agent 包装以后卖给用户。连模型的产地,它过去也有点区别对待。OpenAI、Anthropic 直接摆在货架正中央,一些中国开源模型则藏得没那么显眼。


一个月后,这家 Costco 开始卖自有品牌了。


和 Costco 的 Kirkland 一样,自有品牌不等于养牛、种麦子全部都自己干。Genspark 新发布的 PPT 制作专用模型 Gen-1 Slides,以 MiniMax M3 为底座,Fireworks AI 共同参与训练。Genspark 负责提供 PPT 任务和产品运行环境,并制定评价 PPT 质量的标准。


AI Costco,开始卖自有品牌了


这次还有一点不同,MiniMax M3 被明明白白写在了包装正面,出现在了官方致谢当中。


Gen-1 Slides 是 Genspark 基于 MiniMax M3 这个开源基座,通过后训练做出来的专用模型。所谓后训练,简单说就是在一个已经具备相当能力的基座上,围绕自己的任务继续训练,不用再从头训练通用大模型。Gen-1 最终用了约 2000 个内部构造的 Slides 任务做强化学习。


从 Genspark 公布的数据看,经过后训练,Gen-1 在 PPT 任务上的整体表现已与 Opus 5 处于同一水平。在 200 个真实 PPT 任务中,Gen-1 综合得分 0.821,Claude Opus 5 为 0.810;完成一份 PPT 的平均模型调用成本则分别为 0.44 美元和 4.16 美元。上线后的 157 万次生产任务里,两者平均用户评分分别是 4.25 和 4.23。


不过,不能单纯把这些数字理解成 Gen-1 已经超过 Opus。Genspark 自己的评测里,Opus 在任务完成度和内容质量上仍然更高,Gen-1 的优势更多来自视觉设计。不过,这套内部评测还有一个问题。grader 同时参与了强化学习训练,因此它的评分并不是完全独立的。为了进一步验证结果,Genspark 又用没有参与训练的 PPTEval 和 UniPPTEval 两套公开学术评测进行交叉测试,Gen-1 在九组组合里拿到八个第一。


对普通用户来说,最直观的变化是 Gen-1 已经进入 Genspark Slides 的 Standard 模式,并成为默认模型,价格不变。


对一家过去最擅长采购和组合模型的 AI 应用公司来说,Genspark 现在也不是要转向自己造模型。它仍然高度依赖外部模型和训练基础设施,只是过去主要组合 API,现在又把这种能力往模型权重上推了一层。Costco 还是那个 Costco,但货架上开始出现了一些自有品牌。


AI Costco,开始卖自有品牌了


AI 应用,开始不满足于租模型


对 Genspark 这样的 AI 应用公司来说,一直调用最强模型是最省事的选择。模型升级就跟着换 API,一家掉队,就把任务路由给另一家。Genspark 本来也是靠这种能力起家的。


但当一种任务每天高频重复,单纯调用最强模型未必还是最好的选择。根据官方数据,Genspark 单日最多生成 12 万份 PPT。PPT 又远比问答复杂,模型要搜资料、组织结构、生成页面、渲染、检查,再根据结果反复修改。


Genspark CTO 朱凯华此前把内部的模型使用拆成三层。重复而明确的工作优先交给更便宜的模型,适合专项优化的任务通过 fine-tuning 补强,少数需要更强推理能力的节点再调用 frontier model。按照他的总结,高频、重复、定义清楚,同时拥有明确质量标准的任务,最适合专项训练。


Claude 依然很强,但通用模型的能力优势,未必就能带来最好的垂直产品体验。模型公司要覆盖广泛的任务,应用公司却可以反复观察同一类任务。这样就能知道模型在哪些特定环节出错,哪些结果会被用户接受或需要重做。


垂直 AI 创业常见的一条路径,是围绕特殊数据训练专用模型。但现在,应用公司不一定需要从零开始训练模型。更强的开源基模已经提供了通用能力。公司的任务变成了围绕具体场景继续训练,把自己的数据、评价标准和工作流程融进去。


Agent 时代,“应用公司拥有用户数据”也变得更具体。一次任务可以留下完整的执行轨迹,包括用户提出了什么要求、模型调用了哪些工具、在哪里出错,以及最终交付的结果。这些轨迹能帮助团队找到反复出现的错误,再决定应该调整工作流,还是通过训练改变模型的行为。


什么样的基模适合作为训练底座


Harvey 用 Qwen 做法律 Agent 的强化学习实验,Heidi Health 用开源模型训临床模型,各家选的基座不同,考虑的东西也不一样。对 AI 应用公司来说,需要的未必是一个在所有榜单上都排第一的模型。通用能力够强,又便于继续训练,反而更适合作为产品持续开发的基座。


放到 PPT 这个具体任务里,Genspark 看中的 MiniMax M3 能力也比较明确。M3 支持百万级长上下文、原生多模态,也面向 Agent 工具调用做过设计。Slides 恰好是一种长轨迹任务,模型需要在文本、视觉和工具之间不断切换,完成搜索、生成、渲染、检查和修改。


Genspark 在 Gen-1 Slides 的官方博文中提到,正因为有 M3 这样的开源基座,它才能跳过预训练,把资源集中到 Slides 的循环优化,并在几周内完成 Gen-1。也就是说,M3 把训练一个 PPT 专用模型的起跑线,直接搬到了最后几公里。


AI Costco,开始卖自有品牌了


除了面向具体产品做后训练,另一种路线是在基模上继续预训练。沙特 AI 公司 HUMAIN 推出的 humain-m3,同样以 MiniMax M3 为基础,又通过超过 1 万亿 Arabic-native tokens 的进一步预训练强化阿拉伯语能力。它和 Genspark 走的是两条不同的技术路线,共同点在于都把 M3 当成了继续训练的起点。


模型后训练变成了一种服务


AI Coding 是较早将后训练用进产品的一类应用。Cursor 通过持续预训练和强化学习开发 Composer,法律 AI 公司 Harvey、医疗 AI 公司 Heidi Health 也开始将后训练纳入产品开发。这些公司处理的任务差别很大,但都有一些共同点,比如任务高频而相对稳定,也比较容易判断一次工作完成得好不好。


这些案例背后都出现了 Fireworks 这家公司。作为提供模型训练和推理基础设施的平台,Fireworks 降低了应用公司进入模型层的门槛。应用公司不需要自己搭起完整的模型训练体系。以 Gen-1 为例,Genspark 制定 PPT 质量标准和训练目标,Fireworks 参与算法优化和训练工程,前后进行了超过 100 次实验,有些训练轨迹长度超过 10 万 token。


AI Costco,开始卖自有品牌了


这项工作也远不止提供一批训练数据。在Gen-1 的训练中,模型很快学会了利用 grader 的评分规则,有时会提高视觉评分,却同时降低任务完成质量。更具体的例子包括,模型会声称资料已经核验却没有真的核验,也会缩小字号来逃过版面溢出检测。Genspark 和 Fireworks 只能不断查看训练轨迹、调整 reward 和 grader。


为了减少 PPT 里明显的 AI 味,团队还加入了一个专门的判别器。用最终版本回测后,被判为 AI 制作的比例从 74.9% 降到了 41.7%。


做到这里,应用公司手里的优势也不只是用户数据。它还得知道自己的产品什么叫好,怎么评价,以及模型开始迎合评分体系时怎么把它拉回来。


不是所有 AI 应用都该做后训练


开源基模变强、Agent 工作流逐渐稳定,再加上训练门槛下降,才让 post-training 变成一条更现实的产品路线。但这些条件并不意味着所有 AI 应用都应该做后训练。


Manus 早期就做过另一种选择。项目启动时,团队认真讨论过是否基于开源模型训练一个端到端 Agent,最后把主要精力放在 context engineering 上。Manus 联合创始人兼首席科学家季逸超当时认为,对于快速变化、尤其还没有找到 PMF 的应用,几周一次的训练迭代跟不上产品变化,底层模型的进步也可能很快让已有训练贬值。


从 Manus 此后的公开产品路线看,它目前仍把大量改进放在 Agent 架构、上下文、工具和工作流上。今年推出的 Projects That Learn From Every Task,也是把一次任务中可复用的经验写回 instructions、files 和 skills,没有去碰模型权重。


AI Costco,开始卖自有品牌了


而 Slides 这类场景,已经具备相对成熟的工作流。任务规模大,产品形态稳定,有明确的交付质量标准,再选择把长期积累的经验训练进模型,收益才更明确。


Genspark 和 Manus 的不同选择,也说明后训练有自己的适用边界。还在快速试错的 Agent 产品,更适合跟着基模升级,继续优化上下文和执行框架;已经形成稳定工作流的垂直应用,则更有条件把优化做到模型参数这一层。


但一个训练好的模型本身也很难成为长期壁垒。更强的基模出来以后,应用公司可能需要重新训练,相比某一个具体模型版本,能够跟着迁移的评价体系和训练流程,价值更大。


开源模型开始卖可训练性


这里说的可训练性,首先得能训。最基本的问题是,模型权重和许可证是否允许继续训练,SFT、偏好优化、强化学习能不能直接跑,现有训练平台是否已经支持这个模型,这些都会影响一家应用公司能不能把后训练真正做起来。Fireworks 的训练产品里,就会直接列出不同基模支持的训练方式、上下文长度和训练规格。


基模本身的能力也得足够强。一个模型再开放,如果通用能力太弱,或者和业务需要的能力差得太远,后训练很难补课。法律、代码、PPT 各自需要的能力组合不同,应用公司挑选的考量也会不同。


训练完成之后,还要考虑能不能长期整合进产品。模型大小、吞吐、延迟、推理成本,以及部署和训练基础设施是否成熟,都会影响这套方案最终是否划算。Harvey 在法律场景做 post-training 时,甚至会把 token 消耗写进 reward,提高任务表现的同时控制推理成本。


可训练性最后其实落在三个问题上:能不能训,值不值得训,训完以后能不能用得起。


闭源模型公司也在争这部分需求。OpenAI 已经提供强化微调等能力,所以应用公司的选择不会简单变成开源和闭源二选一。对开源模型来说,除了直接提供能力,能不能成为一个好用的训练起点,也开始影响下游的选择。


一个模型能被多少产品直接调用是一种规模,能成为多少产品继续训练的底座,可能是另一种。



文章来自于微信公众号 “硅星人Pro”,作者 “硅星人Pro”

AI转型,免费服务,就找AITNT
AITNT资源拓展
根据文章内容,系统为您匹配了更有价值的资源信息。内容由AI生成,仅供参考
1
OWL

【开源免费】OWL是一个完全开源免费的通用智能体项目。它可以远程开Ubuntu容器、自动挂载数据、做规划、执行任务,堪称「云端超级打工人」而且做到了开源界GAIA性能天花板,达到了57.7%,超越Huggingface 提出的Open Deep Research 55.15%的表现。

项目地址:GitHub:https://github.com/camel-ai/owl

2
OpenManus

【开源免费】OpenManus 目前支持在你的电脑上完成很多任务,包括网页浏览,文件操作,写代码等。OpenManus 使用了传统的 ReAct 的模式,这样的优势是基于当前的状态进行决策,上下文和记忆方便管理,无需单独处理。需要注意,Manus 有使用 Plan 进行规划。

项目地址:https://github.com/mannaandpoem/OpenManus


3
AI工作流

【开源免费】字节工作流产品扣子两大核心业务:Coze Studio(扣子开发平台)和 Coze Loop(扣子罗盘)全面开源,而且采用的是 Apache 2.0 许可证,支持商用!

项目地址:https://github.com/coze-dev/coze-studio


【开源免费】n8n是一个可以自定义工作流的AI项目,它提供了200个工作节点来帮助用户实现工作流的编排。

项目地址:https://github.com/n8n-io/n8n

在线使用:https://n8n.io/(付费


【开源免费】DB-GPT是一个AI原生数据应用开发框架,它提供开发多模型管理(SMMF)、Text2SQL效果优化、RAG框架以及优化、Multi-Agents框架协作、AWEL(智能体工作流编排)等多种技术能力,让围绕数据库构建大模型应用更简单、更方便。

项目地址:https://github.com/eosphoros-ai/DB-GPT?tab=readme-ov-file



【开源免费】VectorVein是一个不需要任何编程基础,任何人都能用的AI工作流编辑工具。你可以将复杂的工作分解成多个步骤,并通过VectorVein固定并让AI依次完成。VectorVein是字节coze的平替产品。

项目地址:https://github.com/AndersonBY/vector-vein?tab=readme-ov-file

在线使用:https://vectorvein.ai/付费

4
智能体

【开源免费】AutoGPT是一个允许用户创建和运行智能体的(AI Agents)项目。用户创建的智能体能够自动执行各种任务,从而让AI有步骤的去解决实际问题。

项目地址:https://github.com/Significant-Gravitas/AutoGPT


【开源免费】MetaGPT是一个“软件开发公司”的智能体项目,只需要输入一句话的老板需求,MetaGPT即可输出用户故事 / 竞品分析 / 需求 / 数据结构 / APIs / 文件等软件开发的相关内容。MetaGPT内置了各种AI角色,包括产品经理 / 架构师 / 项目经理 / 工程师,MetaGPT提供了一个精心调配的软件公司研发全过程的SOP。

项目地址:https://github.com/geekan/MetaGPT/blob/main/docs/README_CN.md

5
微调

【开源免费】XTuner 是一个高效、灵活、全能的轻量化大模型微调工具库。它帮助开发者提供一个简单易用的平台,可以对大语言模型(LLM)和多模态图文模型(VLM)进行预训练和轻量级微调。XTuner 支持多种微调算法,如 QLoRA、LoRA 和全量参数微调。

项目地址:https://github.com/InternLM/xtuner