把 1.6T 参数模型搬进办公室,我们在 WAIC 看到一台自带静音的 Token 工厂

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
把 1.6T 参数模型搬进办公室,我们在 WAIC 看到一台自带静音的 Token 工厂
8398点击    2026-07-26 11:24

把 1.6T 参数模型搬进办公室,我们在 WAIC 看到一台自带静音的 Token 工厂


今年 WAIC,我们在超聚变展台看到了一台面向办公室场景的本地 AI 设备:TokenBox™。


据超聚变产品资料,TokenBox™ 单机最高可支持参数规模达 1.6T 的模型,GPU、CPU、内存和存储均可按需扩展,主流负载噪声低至 35 dBA。


超聚变想解决的,不只是算力问题,而是如何让原本更多部署在专业数据中心的高性能 AI 基础设施,进入研发办公室、医院科室和企业分支机构。


按照超聚变的定位,TokenBox™ 是一套面向办公室场景的企业级本地 AI 平台。它将算力模块、模型服务、推理加速、Token 运营和安全管理整合进同一套产品体系,让企业能够在本地持续生产、调度和管理 Token。


这里所说的 Token 生产,并不是单纯追求生成更多 Token,而是将本地算力转化为可计量、可调度的模型推理和 Agent 服务能力。


TokenBox™ 瞄准的,是工作站与数据中心服务器之间的一类部署空白:


把 1.6T 参数模型搬进办公室,我们在 WAIC 看到一台自带静音的 Token 工厂


工作站部署方便、距离业务更近,但卡数、显存和互联能力有限,面对大参数模型、长上下文和多人并发时,容易触及性能上限。数据中心服务器拥有更强的性能和扩展能力,却依赖专业机房、供电、制冷和运维条件,其噪声与散热要求也使其难以直接进入普通办公空间。


两者之间,企业缺少的是一种既具备较强性能和扩展能力,又能适应普通办公环境,并支持长期运营与治理的本地 AI 基础设施。


因此,TokenBox™ 首先要回答的问题是:高性能 AI 算力,如何真正进入普通办公环境?


把 Token 生产平台搬进办公室


那么,TokenBox™ 如何真正进入普通办公环境?


关键并不是简单缩小服务器的尺寸,而是针对办公室和边缘场景在空间、噪声、散热、供电和运维等方面的实际条件,对本地 AI 生产所需的硬件、软件与运营能力进行一体化重构。


把 1.6T 参数模型搬进办公室,我们在 WAIC 看到一台自带静音的 Token 工厂


这意味着,TokenBox™ 不仅要提供本地算力,还要同时回答五个问题:


算力能否按需扩展?设备能否适应普通办公室的噪声、散热和供电条件?多人并发时能否稳定提供推理服务?模型部署和日常运维能否进一步简化?模型能否持续演进,Token 与数据又能否得到有效运营和治理?


围绕这五个问题,TokenBox™ 构建了相应的产品能力。


第一,支持大参数模型,并可按需扩展。


TokenBox™ 单机支持 1.6T 参数模型,为企业在本地部署旗舰级模型提供了更高的能力上限。支持4类独立的Pack:GPU、CPU、Memory、Storage,单机4Pack全互联,架构支持多机互联。


企业可以从较小配置起步,再根据 Token 消耗和业务变化逐步升级。相比固定配置的工作站,这种设计让企业不必在建设初期一次性投入全部资源,也能降低扩容时整体更换设备的必要性,保护前期投资。


把 1.6T 参数模型搬进办公室,我们在 WAIC 看到一台自带静音的 Token 工厂


第二,让高性能 AI 进入普通办公环境。


TokenBox™ 采用 DC 级液冷设计,主流业务负载下可低至35dB,达到图书馆级静音。


这项能力直接影响 AI 基础设施能否进入真实业务现场:医院科室、研发办公室和企业分支机构通常无法提供标准机房条件,也很难接受传统 AI 服务器的高噪声和散热要求。


TokenBox™ 的意义在于,让原本更多部署在数据中心的高性能算力,可以进入团队日常工作的空间。


把 1.6T 参数模型搬进办公室,我们在 WAIC 看到一台自带静音的 Token 工厂


第三,通过软硬协同生产更多有效 Token。


TokenBox™ 内置 Smart 推理加速套件,围绕推理引擎、任务调度、KV Cache、算子优化和内存管理进行软硬协同优化。根据超聚变产品材料,在特定超长上下文场景中,Smart 系列能力可实现 100% 以上的性能提升。


当核心业务和普通请求同时访问模型时,TokenBox™ 可以根据优先级进行调度,避免关键任务被长上下文请求或低优先级任务拖慢。


第四,降低模型部署和日常运维门槛。


软件层面,TokenBox™ 集成 FusionOne AI Foundation,并通过本地 FusionXplay 提供模型和应用获取能力。


传统私有化 AI 设备交付后,模型部署、版本升级和性能调优往往需要客户自行完成。面对快速迭代的模型和推理引擎,企业很容易在几个月后陷入版本落后或升级困难。


基于这些软件能力,TokenBox™ 提供 AI Native 交互。用户可以通过自然语言完成模型部署、版本检查、运行监控和性能优化。设备还可预置模型、Skill 和数字员工,上电后即可开始生产 Token。


第五,让模型持续演进,让 Token 可运营、可治理。


除了算力和模型服务能力,TokenBox™ 还集成 ModelEver、TokenOps 及安全套件,覆盖模型更新、Token 运营和本地安全管理。


ModelEver 提供 Day0 模型永新能力。新模型发布后,系统可完成自动发现与获取、兼容性验证和镜像打包,再将经过验证的模型推送到本地设备。模型、推理引擎和加速组件能够独立升级,降低更新对业务连续性的影响。


TokenOps 则让 Token 从无序调用变成可运营的企业资源。企业可以查看不同部门、项目和 Agent 使用了多少 Token,设置配额和预算,并通过智能模型路由,减少简单任务调用大参数模型所造成的资源浪费。


同时,TokenBox™ 支持本地数据闭环,并提供内容防护、行为管控和审计能力。对医疗、金融、研发等敏感场景而言,数据不出域、调用可追溯、行为可审计,是 AI 进入核心业务的重要前提。


把 1.6T 参数模型搬进办公室,我们在 WAIC 看到一台自带静音的 Token 工厂


TokenBox™ 从算力扩展、环境适配、并发推理、部署运维和安全治理五个方面,给出了“如何把高性能本地 AI 生产平台搬进办公室”的产品答案。


被真实业务验证过的 AI 基础设施


但对企业级 AI 基础设施而言,功能完整只是第一步,真正的检验来自业务现场:


在长上下文、高并发请求和严格的数据安全要求下,系统能否持续稳定地提供推理服务,并兼顾安全治理与运维效率?


具体到业务现场,AI Coding 和多 Agent 协同办公是 TokenBox™ 两类较为典型的落地方向。


在 AI Coding 场景中,TokenBox™ 可以承载代码生成、需求分析、知识库检索、测试和评审等任务,为研发团队提供本地模型和算力环境。


研发代码与内部知识可以保留在本地,从而降低对公有云 API 的依赖;团队也可以根据任务优先级管理本地算力,避免关键任务与普通请求无序争抢资源。


在全流程办公场景中,TokenBox™ 可以承载财务审批、智能客服、会议纪要和经营分析等不同类型的数字员工。


通过模型路由,简单任务与复杂推理任务可以调用不同模型;通过 TokenOps,Token 消耗也可以按照部门、项目和具体场景进行统计。


把 1.6T 参数模型搬进办公室,我们在 WAIC 看到一台自带静音的 Token 工厂


相比上述场景分析,目前更具体的业务验证来自医疗行业。


在创业慧康 BsoftGPT 医疗场景测试中,TokenBox™ 本地部署 DeepSeek-V4 旗舰大模型。面对约 5000 Token/request 的医疗长上下文负载,系统在 128 并发下实现 100%请求成功,累计处理超过 1240 万 Token。


这类测试的价值不只在于峰值性能,而在于真实医疗负载下的稳定承载能力。


医疗智能体需要处理长病历上下文、RAG 多源检索、医护多轮交互、批量病历生成、异步质控和科研筛查。与此同时,病历和患者数据又要求本地化部署、权限控制和日志审计。


在这一场景中,TokenBox™ 提供的不只是一组 GPU,而是让医疗智能体具备本地化、稳定化和可治理运行能力的基础设施。


正如创业慧康在论坛上所总结的:


医疗 AI 的竞争,最终不是谁拥有一个模型,而是谁能让模型稳定、安全、可运营地进入真实业务场景。


从 TokenBox™ 到 Token Factory:企业 AI 生产的新思路


那么,这台设备为什么会被设计成这样?


答案要回到它背后的厂商和理念。


TokenBox™ 由超聚变打造。但它并不是一台孤立的 AI 一体机,而是超聚变 Token Factory AI 一体化解决方案面向办公室和边缘场景的产品化落地。


TokenBox™ 回答的是高性能 AI 算力如何进入办公室,而在算力进入业务现场之后,企业还要回答一系列运营问题:


资源如何调度和计量?不同任务应该调用什么模型?Token 成本如何控制?Agent 又如何将这些投入转化为可核算的业务结果?


这正是超聚变提出 Token Factory 的起点。


超聚变算力事业部总裁唐启明用一条公式,概括了 Token Factory 从基础设施投入到业务价值产出的完整链路:


WATT→FLOPS→TOKENS→AGENTS→VALUES。


把 1.6T 参数模型搬进办公室,我们在 WAIC 看到一台自带静音的 Token 工厂


围绕这一判断,超聚变提出了 Token Factory 方法论:它试图将企业从算力投入到业务价值产出的完整链路,组织成一套可以持续生产、调度、计量和治理的体系。TokenBox™ 则是这套方法论面向办公室和边缘场景的产品化落地。


当 AI 从个人工具进入企业核心流程,仅靠“采购服务器、部署模型、开放调用”,已经很难应对跨部门资源调度、成本核算、模型更新和安全治理等问题。


企业内部可能同时存在公有云 API、私有化算力、边缘节点和个人工作站,不同部门也可能各自部署模型和资源池。随着调用规模扩大,重复建设、资源闲置和关键业务争抢算力等问题会逐渐显现。


例如,简单的文档摘要与长上下文代码分析,如果都调用同一个大参数模型,就会产生不必要的资源消耗;多个部门共享同一套算力时,如果缺少优先级和配额管理,低优先级任务也可能挤占资源,拖慢核心业务。


因此,Token Factory 关注的不只是如何获得算力,更是如何把分散的算力、模型和 Agent 组织成一套可持续运营的企业 AI 生产系统。


按照超聚变的划分,这套体系分为三层,分别回答三个问题:


算力从哪里来、任务应该调用什么模型,以及 Token 如何被计量和治理。


所以 Token Factory 设计的第一层是算力基础设施。它覆盖云计算、超节点、服务器、边缘设备和桌面设备,通过虚拟化、容器化和统一调度,将不同地点、不同类型的算力组织成统一资源池。


Token Factory 的第二层是模型与算力服务。这一层负责模型管理、多模型路由、推理加速和资源服务化。简单问答可以调用小模型,复杂编码、深度推理再调用大模型,避免所有任务都占用高规格算力。


最后第三层是 Token 度量与运营。TokenOps 记录不同组织、项目和 Agent 的 Token 消耗,支持计量、配额、预算和成本归因,并根据质量、性能和成本选择更适合的模型。AgentCare 则进一步提供沙箱、权限、智能记忆和运行观测,让 Agent 能够更安全、稳定地进入企业业务流程。


在这套体系下,企业评价 AI 基础设施的标准开始从“有多少卡”转向“能生产多少有效 Token”,再进一步转向“这些 Token 是否支撑了可用的 Agent 和可核算的业务结果”。


把 1.6T 参数模型搬进办公室,我们在 WAIC 看到一台自带静音的 Token 工厂


这套方法论在真实环境是否有效呢?成本是另一项关键验证指标。


按照超聚变自己内部验证的两年期测算,自建 Token Factory 相比同等用量采用云服务的成本大幅降低。


在相应测算条件下,Token Factory 对于 Token 消耗较为稳定、数据安全要求较高的企业,私有化部署可能在成本、数据治理和业务连续性等方面体现出综合优势。


从设备交付转向 AI 生产力交付


过去企业建设 AI 基础设施,首先考虑的是采购多少张卡、部署多大的模型。


进入 Agent 时代之后,企业还需要继续追问:


这些算力能够生产多少有效 Token?在多人并发和长上下文任务下是否稳定?模型能否持续升级?Token 成本能否被计量和优化?Agent 能否在安全边界内执行任务?


Token Factory 给出的是一套从算力到业务价值的方法论,而 TokenBox™ 则把这套方法论压缩进办公室可部署的产品形态中。


它将算力、模型、推理加速、Token 运营和安全能力组合在一起,让企业不必先建设专业机房,也不必从零组建 AI Infra 团队,就能够获得一套可扩展、可演进的本地 Token 生产平台。


当 Token 持续进入软件研发、医疗服务、经营分析和企业办公流程,AI 基础设施也会从一次性交付的设备,转变为一套 7×24 小时运行的生产系统。


这套系统进的是电,产出的是 Token,支撑的是 Agent,最终需要交付的是业务价值。


而 TokenBox™ 要做的,正是把这条 Token Factory 的生产线带到每一个团队和企业身边。


文章来自于微信公众号 “特工宇宙”,作者 “特工宇宙”

AI转型,免费服务,就找AITNT
AITNT资源拓展
根据文章内容,系统为您匹配了更有价值的资源信息。内容由AI生成,仅供参考
1
AI代理

【开源免费】Browser-use 是一个用户AI代理直接可以控制浏览器的工具。它能够让AI 自动执行浏览器中的各种任务,如比较价格、添加购物车、回复各种社交媒体等。

项目地址:https://github.com/browser-use/browser-use


2
智能体

【开源免费】AutoGPT是一个允许用户创建和运行智能体的(AI Agents)项目。用户创建的智能体能够自动执行各种任务,从而让AI有步骤的去解决实际问题。

项目地址:https://github.com/Significant-Gravitas/AutoGPT


【开源免费】MetaGPT是一个“软件开发公司”的智能体项目,只需要输入一句话的老板需求,MetaGPT即可输出用户故事 / 竞品分析 / 需求 / 数据结构 / APIs / 文件等软件开发的相关内容。MetaGPT内置了各种AI角色,包括产品经理 / 架构师 / 项目经理 / 工程师,MetaGPT提供了一个精心调配的软件公司研发全过程的SOP。

项目地址:https://github.com/geekan/MetaGPT/blob/main/docs/README_CN.md

3
知识库

【开源免费】FASTGPT是基于LLM的知识库开源项目,提供开箱即用的数据处理、模型调用等能力。整体功能和“Dify”“RAGFlow”项目类似。很多接入微信,飞书的AI项目都基于该项目二次开发。

项目地址:https://github.com/labring/FastGPT

4
RAG

【开源免费】graphrag是微软推出的RAG项目,与传统的通过 RAG 方法使用向量相似性作为搜索技术不同,GraphRAG是使用知识图谱在推理复杂信息时大幅提高问答性能。

项目地址:https://github.com/microsoft/graphrag

【开源免费】Dify是最早一批实现RAG,Agent,模型管理等一站式AI开发的工具平台,并且项目方一直持续维护。其中在任务编排方面相对领先对手,可以帮助研发实现像字节扣子那样的功能。

项目地址:https://github.com/langgenius/dify


【开源免费】RAGFlow是和Dify类似的开源项目,该项目在大文件解析方面做的更出色,拓展编排方面相对弱一些。

项目地址:https://github.com/infiniflow/ragflow/tree/main


【开源免费】phidata是一个可以实现将数据转化成向量存储,并通过AI实现RAG功能的项目

项目地址:https://github.com/phidatahq/phidata


【开源免费】TaskingAI 是一个提供RAG,Agent,大模型管理等AI项目开发的工具平台,比LangChain更强大的中间件AI平台工具。

项目地址:https://github.com/TaskingAI/TaskingAI