300多组控制实验、70万余TPU小时,普林斯顿团队给出全开放文生图配方i1
300多组控制实验、70万余TPU小时,普林斯顿团队给出全开放文生图配方i1近来文生图模型发展迅速,但每篇工作多是独立地引入一整套模型、数据和训练设计,然后用私有的数据训出来了一个亮眼的模型。
搜索
近来文生图模型发展迅速,但每篇工作多是独立地引入一整套模型、数据和训练设计,然后用私有的数据训出来了一个亮眼的模型。
这期节目的嘉宾黄东旭,就是Token Maxing热潮的亲历者。他曾经只用最前沿的模型,每天账单三四百美元。让他转变的,是前沿模型的智力碾压和中国开源模型们的崛起——Fable 5可以一句话终结Agent群的讨论,同时大量的日常任务可以做到“只烧电费,不烧Token”。他的结论是:不是前沿模型用不起,而是本地开源模型底座+前沿模型的搭配,成本可控,更具性价比。
长期依赖外部模型,不是最好的选择。
Qwen3.8-27B开始和顶级闭源模型正面叫板,过度思考是最大问题。
8月13日凌晨,DeepSeek V4 Pro正式登场,给开源模型生态又添一把猛火。从Kimi K3到MiniMax H3,再到DeepSeek V4 flash、DeepSeek V4 Pro,在中国开源模型的猛攻之下,美国的AI公司这次是真的坐不住了。
就在刚刚,智谱发布了其最新一代旗舰模型GLM-5.3,并宣布模型将在两周内开源。这是一个拥有7430亿个参数的模型,和此前的GLM模型一样主打编程。在多项主流基准测试中,GLM-5.3位居所有已开源或即将开源模型中的第一;其在编程与智能体任务上的能力,已逼近Claude Fable 5、GPT-5.6 Sol等海外顶尖模型。
8 月 11 日,xAI 联合创始人伊戈尔·巴布什金(Igor Babuschkin)创办的 River AI 宣布完成 11 亿美元融资。这笔资金横跨种子轮和 A 轮,由 General Catalyst 和 AMP PBC 领投,英伟达、AMD Ventures 战略投资,Y Combinator 和淡马锡等参与。
据 The Information报道,创始人张一鸣在上个月的一场内部会议上向员工明确表达了这一立场,也让外界难得一窥他对字节跳动AI发展路线的思考。外媒披露,在Seed团队内部,关于公司是否应该转向蒸馏技术的争论由来已久。今年,国内竞争对手开源模型的快速发展给字节跳动带来了更大的压力。员工们称,每当有一个强大的中国开源新模型发布,字节跳动内部关于蒸馏的争论就会升温。
从 2D 像素到 3D 场景 Query,影溯正在尝试把三维内容生产推向可规模化调用的新阶段。
今日,华为开源基于昇腾NPU训练的盘古MoE模型openPangu-2.0-Pro。该模型是openPangu-2.0系列的最新开源模型,总参数规模5050亿,激活参数规模180亿,支持512K上下文长度,训练数据总量约34T tokens。另一轻量化模型openPangu-2.0-Flash已于6月12日开源,参数92亿,其中6亿为激活参数。