北大联合阶跃星辰提出TensorCast:统一可编程管理大模型张量,推理「首字延迟」最高降低93.2%
北大联合阶跃星辰提出TensorCast:统一可编程管理大模型张量,推理「首字延迟」最高降低93.2%过去几年,大模型推理系统优化的核心目标一直围绕一个问题展开:如何让 GPU 更高效地计算权重、激活、KV Cache 等高维张量?从并行策略、请求调度、显存管理到算子优化,学界业界大量优化技术不断提升模型推理效率。
来自主题: AI技术研报
9293 点击 2026-08-17 15:18