刚刚,The Information报道,Google正在搞一颗代号「Frozen v2」的服务器芯片,打算把Gemini的部分架构直接固化进硬件里。
据知情人士的说法,这颗芯片每瓦功耗能输出的Token数,可能达到Google现有自研AI芯片的6到10倍,最快将于2028年部署。
模型,要被做成芯片了。
等等,模型是软件啊,软件怎么能「焊」进芯片?
赌赢了,Gemini的推理成本倒是是真有可能降一个数量级;但要赌输了,模型一换骨架,这芯片就变成技术包袱了。
而且,Gemini 3.5都还在难产,现在就敢把架构焊起来,下一代模型长得不一样怎么办。。
今天,咱们就把这事从头到尾捋清楚。
先解决第一个问题:软件怎么变成硬件?
一个大模型,拆开有两样核心的东西——
「权重」:几千亿个参数,决定模型知道什么;
「架构」:多少层、每层什么算子、数据按什么顺序流过哪些计算单元,决定模型怎么算。
按照目前披露的方案,Frozen v2想固化的是Gemini中相对稳定、反复执行的计算路径。
权重依然可以更新,模型也能继续训练;但「怎么算」这条主干,会被更深地写进电路。

通用芯片必须服务不同模型和任务,因此要保留足够的灵活性。每次运行时,编译器和芯片都要处理调度、数据搬运、缓存分配等一系列问题。
Frozen v2则更专业化。Gemini怎么算、怎么搬,出厂前就定死在电路里了。具体主要省在这三个地方:
这套思路,其实是Google的祖传手艺。
2015年,初代TPU干的就是这事——把CPU、GPU里AI用不上的通用功能全删了,芯片面积全让给矩阵运算,由此换来了几十倍的能效提升。

十年过去,Google准备把专用化再往前推一步:
GPU,保留较强的通用性,能够运行各种并行计算任务;
TPU,把重点收窄到AI常用的矩阵运算;
Frozen v2,准备删掉「兼容各种模型架构」这个包袱。
每收窄一层,芯片都会少做一些无用功,代价则是少兼容一些变化。效率越高,回头的余地越小。
方向,已经很清楚了:打造一颗专门伺候Gemini的芯片。
把一个模型的骨架焊进硅片,潜台词是:我对这个模型,有绝对的信心。
但就在这颗芯片曝光的几天前,Gemini 3.5 Pro,才刚刚延期。
这个新模型在Google内部有个代号,叫「Cappuccino」。
5月的I/O大会上,Google说6月上线。
6月过去了,没上线。
前几天,圈子里一度传它会在7月17日发布,结果等来的是——延期数月。
原因是编码能力没达到内部标准。Google虽然紧急更新了一波训练数据想抢救模型,但结果用彭博社的转述说——「令人失望」。
消息一出,Alphabet股价当天就跌超4%。
有前员工形容,Google的跨部门协调「就像试图煮沸整个大海」。
更扎心的是——因为GPU容量不够,Google自己的工程师,经常用不上自家的AI编码工具。
这个手握自研TPU、今年资本开支奔着1900亿美元去的Google,自己人也被算力卡脖子。

缺便宜的算力缺到这个份上,你就明白它为什么盯上了「焊芯片」这条最极端的省电路线。
但省电归省电,矛盾还是那个矛盾:
芯片最早2028年部署。
如果那之前Gemini只是换权重、扩规模,它仍然能继续跑;但如果底层计算方式变了,今天换来的高能效,明天就可能变成死胡同。
说来也巧,这对矛盾,Google自己用代号写得明明白白:Cappuccino,还在萃取;Frozen,准备冷冻。
起名的人,可能比谁都懂Google现在的处境。
一杯咖啡还没萃出来,怎么就敢冷冻?
因为在Google眼里,赔率已经变了。
最近几轮旗舰模型的更新,其实都没有早期那种肉眼可见的能力飞跃了——
沃顿商学院的教授管这叫「下一代巨模型失望陷阱」:堆数据堆算力换能力跃升的老路,收益肉眼可见地递减,发布会越开越像挤牙膏。
对模型公司,这是坏消息。
但对芯片设计师,这是好事儿。正因为架构不再月月大改,「把骨架焊死」才第一次从疯狂变成可行。
几年前,把“模型骨架五年不变”写进芯片,几乎等于押注技术停止进化。
今天这仍是一场豪赌,只是Google判断,赔率已经变了:模型能力会继续迭代,但底层计算形态未必还会频繁翻修。

而3.5的难产,恰恰给这个判断做了注脚。连Google自己,都很难再让模型发生「长相级」的变化了。
当然,赌就是赌。万一范式转移真来了——全新的注意力结构、新的记忆机制、甚至非Transformer的形态——Frozen v2的高效率,一夜之间就会变成技术包袱。
Google等于把2028年之后的筹码,现在就押上了桌。
最后把镜头拉远。这事的影响,不止Google一家。
2020年,Sara Hooker写过一篇论文:《The Hardware Lottery》,硬件彩票。
她的观点是,AI历史上胜出的研究方向,往往不是因为思想最好,而是因为恰好适配了当时的硬件。
深度学习本身就是最大的中奖者——神经网络的思想在上世纪就有了,苦等几十年,直到撞上GPU这张彩票才翻了身。
过去,是硬件在开奖,模型来抽签。
现在,这台彩票机被反过来了:芯片,开始只认某一个模型的骨架。
而且不止Google在干——
1.创业公司Etched把Transformer的运算模式固化进芯片,其他架构一概不跑;

2.更极端的Taalas,连模型权重都直接做进硅片,一颗芯片就是一个模型,官网口号干脆叫"The Model is the Computer"。


3.微软Maia、亚马逊Trainium、Meta的MTIA,他们虽然没走这么极端,但方向也都一致,芯片要为自家负载定制,越来越不通用。
币圈已经把这条路走过一遍。
比特币挖矿从CPU走向GPU,再走向ASIC矿机。专用化每前进一步,效率都会大幅上升,但单颗芯片能做的事情也越来越少。
如果AI芯片也走上这条单行道,真正的问题就来了——
五年后,当全世界的数据中心里插满了只认Transformer、甚至只认Gemini骨架的芯片。
但前沿研究和新架构仍然需要灵活的硬件。
但当更多资金、电力和先进产能被分配给已经验证过的模型路线,新想法拿到第一批算力的成本会越来越高。
五年后,如果全世界的数据中心里插满了优先服务Transformer,甚至只为特定模型优化的芯片。
那个可能颠覆Transformer的新架构,要先跑在什么机器上?
它的「GPU时刻」,又由谁提供?
文章来自于"夕小瑶科技说",作者 "丸美小沐"。