AI资讯新闻榜单内容搜索-MOE

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
搜索: MOE
梁文锋狙击战:深扒那些梁文锋署名的论文有多牛

梁文锋狙击战:深扒那些梁文锋署名的论文有多牛

梁文锋狙击战:深扒那些梁文锋署名的论文有多牛

过去三年,梁文锋极少以第一作者或通讯作者身份,出现在 V3.2、V4、V4.1-Flash 这些动辄上百人署名的旗舰模型整体报告中;却始终把名字签在 MLA 注意力、MoE 路由机制、mHC 拓扑流形、DSpark 推理算子、DSec 智能体沙盒这些最底层的原子技术论文上。

来自主题: AI技术研报
8438 点击    2026-09-25 10:13
刚刚,阶跃Step 5 Preview发布!一举杀进全球开源前三

刚刚,阶跃Step 5 Preview发布!一举杀进全球开源前三

刚刚,阶跃Step 5 Preview发布!一举杀进全球开源前三

阶跃星辰发布新一代旗舰基座模型Step 5 Preview,以44分的AA智能指数成绩跻身全球开源模型前三,采用600B总参数/27B激活的稀疏MoE架构并原生支持1M上下文,在代码生成、长程Agent、深度研究与金融尽调等场景表现突出。

来自主题: AI资讯
9257 点击    2026-09-20 15:13
刚刚,DeepSeek V4.1 Flash正式上线!已适配Harness

刚刚,DeepSeek V4.1 Flash正式上线!已适配Harness

刚刚,DeepSeek V4.1 Flash正式上线!已适配Harness

DeepSeek V4.1 Flash 正式在网页、App 和 API 端全面上线,采用 552B 参数的 MoE 架构与 Causal-Encoder-Decoder 设计,性能全面超越 V4 Pro 并原生支持多模态,DeepSeek Harness v0.1.5 也同步适配。

来自主题: AI资讯
10182 点击    2026-09-10 14:42
DeepSeek V4 多模态开源,我们把它的视觉链路拆了一遍

DeepSeek V4 多模态开源,我们把它的视觉链路拆了一遍

DeepSeek V4 多模态开源,我们把它的视觉链路拆了一遍

图片不只被编码,还直接参与 Attention、MoE 与 Agent 推理。

来自主题: AI技术研报
10249 点击    2026-09-02 09:27
刚刚,蚂蚁百灵大模型开源轻量级混合推理MoE模型——Ling-3.0-tiny。

刚刚,蚂蚁百灵大模型开源轻量级混合推理MoE模型——Ling-3.0-tiny。

刚刚,蚂蚁百灵大模型开源轻量级混合推理MoE模型——Ling-3.0-tiny。

今日,蚂蚁百灵大模型开源了一款轻量级混合推理MoE模型——Ling-3.0-tiny。该模型总参数量为7.9B,推理时激活参数量为1.3B,主要面向高效本地部署而设计。其同步提供BF16、FP8和INT4三个版本,已在DGX Spark、MacBook、Mac mini等设备上完成验证,兼顾性能、效率与可部署性。

来自主题: AI资讯
10084 点击    2026-08-12 01:27
全球第一超算跑满血DeepSeek!一张GPU没用,打造超智融合「Token工厂」

全球第一超算跑满血DeepSeek!一张GPU没用,打造超智融合「Token工厂」

全球第一超算跑满血DeepSeek!一张GPU没用,打造超智融合「Token工厂」

在“灵晟”国产超算登顶最新一期全球超级计算机TOP500榜单后,清程极智与“灵晟”联合完成纯CPU MoE模型分布式推理方案:16节点即可流畅运行DeepSeek-V3/R1-671B模型,在batch_size=2048时,输出吞吐量与80张主流GPU集群相当。

来自主题: AI资讯
8669 点击    2026-08-08 13:35
5050亿参数!余承东开源盘古新模型openPangu-2.0-Pro,距离“世界第一”还有差距

5050亿参数!余承东开源盘古新模型openPangu-2.0-Pro,距离“世界第一”还有差距

5050亿参数!余承东开源盘古新模型openPangu-2.0-Pro,距离“世界第一”还有差距

今日,华为开源基于昇腾NPU训练的盘古MoE模型openPangu-2.0-Pro。该模型是openPangu-2.0系列的最新开源模型,总参数规模5050亿,激活参数规模180亿,支持512K上下文长度,训练数据总量约34T tokens。另一轻量化模型openPangu-2.0-Flash已于6月12日开源,参数92亿,其中6亿为激活参数。

来自主题: AI资讯
10203 点击    2026-07-31 21:54