老板让我部署免费的K3,我先算了一笔“承担不起”的机房账

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
老板让我部署免费的K3,我先算了一笔“承担不起”的机房账
9738点击    2026-07-30 00:40

老板让我部署免费的K3,我先算了一笔“承担不起”的机房账


这两天,全球的AI圈被一个中国公司的模型炸了一下,成为了关注的焦点。


这家公司就是月之暗面,对,就是我们非常熟悉的推出Kimi的那家,他们之前沉寂了好一阵子,突然甩出了最新的K3大模型。


要知道这个版本达到了惊人的2.8万亿参数,多项国际权威评测冲到全球第三,前端编程单项一度登顶世界第一。


7月27日,Kimi K3开放日,完整模型权重正式向全世界开放,任何人都可以免费下载,允许大部分商用,达到一定收入或用户规模的对外模型服务,需要遵守额外条款。


要知道,此前K3发布后的首个交易日,美股芯片股和AI板块出现大幅震荡。马斯克也在相关评测下留言说“令人印象深刻”,还透露xAI正在训练一款2万亿参数的新模型来竞争。


好家伙,一家中国公司放出一个开源模型,半个硅谷都坐不住了。


这也是大模型公司的一个特点:哪怕沉寂一段时间,只要不下牌桌,下一个版本足够强,立刻就能上桌。


一、开源了为啥仍用不起


听说K3这么猛,又属于免费开源,于是就有同学跑来问我一个特别真实的问题。


他说:“刀哥,听说K3开源了,是免费模型对吧?那我是不是可以下载下来,自己在电脑上部署一个,以后就不用花钱了?”


这个问题问得太好了,好到我可以直接拿它当这篇文章的选题。因为它正好踩中了开源模型最反常识的地方。


大多数人听到“开源”两个字,脑子里自动调出来的画面是Linux、Firefox、开源播放器这些软件。下载、安装、运行,就完事了。你那台几千块钱的笔记本电脑,就是全部工具。


但开源大模型的部署,特别是K3,可不是这么回事。跑K3,贵的不只是显卡?


我来打个比方。米其林三星餐厅把招牌菜的完整菜谱免费公开了,配料克数、火候时间、每个步骤都写得清清楚楚。你能照着做吗?看起来能。


直到你翻到第一页的厨房要求:需要64口专业灶台同时开火,厨房供电要达到一个小型工厂的水平,光是买齐这套设备就要花掉两千万。


菜谱是真免费,厨房是真买不起。


当然,要理解为什么跑不动,得先搞清楚一个根本问题:开源模型到底“开源”了个什么?


以前我们说的开源软件,开的是源代码。源代码是人写的,也是人能读懂的。它像一份详细的说明书,程序员可以逐行阅读、找出问题、修改功能。


但开源模型开的是另一样东西,叫权重。


权重是啥?你可以把大模型想象成一个人工大脑,权重就是这个大脑里神经元之间几万亿个连接的强度数值。


问题来了:权重不是代码,它就是一坨纯粹的数字。K3有2.8万亿个参数,打包起来约1.4TB。这些权重文件也不是普通文档,即使用专门的工具解析,你看到的也只是一层层巨大的数字矩阵。


你可以对权重做微调、量化,甚至训练出衍生版本,但不能像阅读源代码那样,逐行看懂某个数字究竟代表了什么。权重可以被分析和修改,却很难被人类直接解释。


所以,第一个反常识就在这里:开源软件给你的是一份能看懂的图纸,但开源模型给你的是一颗已经制造好的大脑。


拿到图纸的价值,在于人人都可以学习和修改。但拿到这颗大脑最直接的价值,并不在于拆开了解它的组成,只有把它放在足够强大的机器上,通电运转起来,它才有价值。


二、开源不等于没有门槛


这里还有个特别容易让人误解的地方。K3是MoE模型,也就是混合专家模型,内部有896个专家子网络,每次推理只激活其中16个。


很多人一听,每次只用16个,那我不需要把896个都装下吧?


不行。这就像一所拥有896个专科的超级医院。每位病人确实只需要其中16个科室会诊,但你不知道下一位病人需要哪16个科室。


你不能只开16个科室,然后把其他880个锁了。整所医院的科室都得在那里,随时待命,保证需要的时候能够迅速调度。


K3也一样。每次计算虽然只调用一小部分专家,但完整的2.8万亿参数仍然需要被系统保存,并且随时能够访问。而真正要做到响应够快、多人同时使用,就得把这些权重分布在大量高速显存里。


所以,我非常支持软件和AI模型开源。但是,开源可不是没有了门槛,而是把门槛从法律世界搬到了物理世界。


以前闭源模型的门槛,是对方让不让你用、收你多少钱,不付钱就用肯定会有法律风险。现在开源模型K3虽然把门打开了,但想进门,前提是你得有一个机房。


那这个机房到底要多大?我们来算一笔账。


目前你能买到的最顶级消费级游戏显卡,显存是32GB。K3的权重超过1400GB,一张顶配游戏卡,只装得下这个模型极小的一部分。


月之暗面官方给出的正式部署建议,是使用由64张以上加速卡组成的超节点。按同类硬件估算,光是采购成本就至少超过240万美元,约合人民币1700多万元。


买完设备就完了吗?别着急,故事才刚开始。


64张这种级别的显卡满载运行,光显卡本身的功耗就接近45千瓦。而普通家庭的入户电力容量,一般只有8到12千瓦。换句话说,就算有人把这套设备白送到你家,你家的电表和电线也带不动它。


传统软件的经济学逻辑是,开发很贵,复制和运行几乎免费。而大模型的经济学是,开发极贵,复制免费,但每一次运行都在真金白银地烧电、烧显卡。


免费下载解决的只是复制环节,真正昂贵的运行环节,一分钱都省不下来。


三、顺利使用vs绝对拥有


我们其实做过一次对照实验。K3发布后,我让同事抓紧接入了K3的API,直接看到了这个模型的调用成本。


API的定价对企业和个人开发者来说都不算贵,每百万输出token是15美元,而能力相当的顶级闭源模型,比如OpenAI的一些模型,要50美元左右。


三倍多的差价,就是开源竞争压出来的。一个月用下来,开源模型的调用费,对一家公司来说只是日常开支里很小的一项。


而如果你要自己完整部署同样一个模型呢?


如果只算显存容量,社区有人估算,至少需要16张H200,才有可能把完整权重装进机器里。但装得进去,不等于跑得高效。即便如此,硬件开销也是几百万元人民币。


一边是每个月几千到几万元的API调用费,另一边是几百万元的硬件投入,还不算电费、机房和运维团队。


这就是“顺利使用”和“绝对拥有”之间的距离。


顺便说一句,上一代Kimi K2有1万亿参数。社区里有达人做过极限压缩版,一台顶配Mac Studio勉强能跑起来,算是能玩。


而K3的参数直接涨到2.8万亿,单机可部署这条路基本被堵死了。它几乎就是一个只属于数据中心或者企业能运行的物种。


四、公开信:保护开源模型


说到这里,整个故事里还有一个人特别值得提一嘴。7月24日,黄仁勋注册了X账号,发出了人生第一条推文。


这位全球市值近5万亿美元的公司的掌门人,第一次发声,不是宣传自家显卡,而是分享了一封由英伟达、微软、Meta等二十多家科技企业和机构联署的公开信,主题只有一个:保护开源模型。


一个卖硬件的,替免费模型站台,是不是有点反常?


一点都不反常。黄仁勋可能是全场算账算得最清楚的人。他在接受采访时说过一句话:免费AI对硬件是好事,对芯片是好事,对数据中心也是好事。


道理就藏在我们前面算的那笔账里。模型免费了,但跑模型的GPU一张都不能少。想部署K3?先买上几十张顶级显卡。


模型越免费,想跑模型的人越多,铲子就卖得越好。


开源模型烧掉的不是英伟达的生意,而是闭源模型的护城河。这就解释了为什么那封公开信上,几乎半个硅谷都签了名。


值得注意的是,同样缺席首发名单的OpenAI和Google,后来也陆续补上了签名。不过截至7月28日,另一家闭源AI巨头Anthropic仍未出现在官方签署名单中。


黄仁勋替免费模型站台,因为他卖的就是厨房里必备的灶台。那谁有厨房,需要这些灶台呢?


云计算厂商有,可以部署K3,把它变成按量付费的服务。有合规需求的大企业也有,可以部署在自己的内网里,让数据不出门。


五、写在最后


那回到最初那位朋友的问题。不能自己部署,不等于用不上。


K3的菜谱已经向全人类公开了。变化只有一点:当年运行开源软件的厨房,人人家里都有。今天运行前沿开源模型的厨房,是一座座耗电如小型城镇的数据中心。


所以,以后再看到新闻说某某大模型开源了,先别急着兴奋地喊“免费了”,先问自己一个问题:跑它需要多少电、多少卡?


这个问题能帮你一秒看清,这个“免费”到底有多高的门槛。


特别是一些老板,如果只是看了新闻,说Kimi很强大,而且免费开源,就让你赶紧自己部署一个,你可以把这篇文章转给他,然后补一句:


“老板,这个AI模型下载是免费,但要运行起来,还得花这么多钱。你看看,真的要装吗?”


我相信,这个账单只要一摆出来,大部分人都会放弃自己部署。


文章来自于微信公众号 “虎嗅APP”,作者 “虎嗅APP”

AI转型,免费服务,就找AITNT
AITNT资源拓展
根据文章内容,系统为您匹配了更有价值的资源信息。内容由AI生成,仅供参考
1
微调

【开源免费】XTuner 是一个高效、灵活、全能的轻量化大模型微调工具库。它帮助开发者提供一个简单易用的平台,可以对大语言模型(LLM)和多模态图文模型(VLM)进行预训练和轻量级微调。XTuner 支持多种微调算法,如 QLoRA、LoRA 和全量参数微调。

项目地址:https://github.com/InternLM/xtuner