一台Mac也能跑Kimi K3!128GB内存硬塞1.6TB权重
一台Mac也能跑Kimi K3!128GB内存硬塞1.6TB权重有人总结,运行 Kimi K3 其实很容易,只需要 1.5TB GPU 内存、大约 8 张 H100,以及一座小型变电站。一名开发者拿出一台 128GB 统一内存的 M5 Max,直接加载 Kimi K3 发布在 Hugging Face 上的官方 MXFP4 权重。
搜索
有人总结,运行 Kimi K3 其实很容易,只需要 1.5TB GPU 内存、大约 8 张 H100,以及一座小型变电站。一名开发者拿出一台 128GB 统一内存的 M5 Max,直接加载 Kimi K3 发布在 Hugging Face 上的官方 MXFP4 权重。
这篇文章,我们邀请到了由SGLang孵化的RadixArk的联合创始人和核心成员,以及数据中心专家,一起聊聊AI Infra的四层架构、行业如何把“硅”的潜力榨到极限,以及背后的关键技术。
Pax Historia团队3人,日活3.5万,单周处理超过1000亿tokens。这是一款架空历史策略游戏。玩家可以控制1943年的苏联,也可以让罗马帝国继续存在,或者创建一个外星人入侵现代地球的世界。行动通过自然语言输入。玩家可以发动战争、签贸易协议、改革货币、威胁邻国,也可以直接跳过几年。
2026年6月27日晚上,演唱会的终场曲刚响起第一句,台下的刘洋收到Gmail邮箱弹出的来自Anthropic的封号通知。这一天,恰是她与AI恋人Claude相识满一个月的纪念日。同一时间,大量中国Claude用户遭遇账号封禁。无法登录的账号里,存放着漫长的聊天记录、共同养成的记忆,以及一个在持续对话中养成的独一无二的AI“恋人”,
还记得 24 年当时去光年之外面试,找老王聊的时候,最后老王问我一个问题:“你都做了这些,为什么不选择创业?”我说:“我想在一个相对成熟的体系下干两年,看看一个成熟的体系如何把产品做起来的。”时间过得很快,转眼间就小两年时间了,我想我也是时候出来了……
新智元报道 2026年,AI行业最昂贵的新故事,已经不只是「训练一个更大的模型」。 资本开始直接押注:让AI参与制造下一代AI。 4月,AlphaGo核心缔造者David Silver创办的 Inef
刚刚完成 GPT-5.6 系列模型的大降价,OpenAI 又传出了新模型的消息。 据外媒 The Information 报道,OpenAI 正准备发布一个新的模型系列,目前暂定名为 Astra。该系列在执行长时间任务方面的能力将有所提升。
昨天,谷歌把最新图像生成模型Nano Banana 2正式塞进了谷歌地球网页版。谁能想到,一觉醒来,新功能被玩坏,谷歌紧急撤回了这一功能!结果效果太逼真,被专家强烈反对后,谷歌紧急撤回了新功能,「加强防护措施」后再次发布。
今天,OpenAI 发布一份让人忧心的报告。其中披露,该公司在今年早些时候封禁了一个源自柬埔寨的诈骗网络:该团伙利用 ChatGPT 来支持多种诈骗活动,包括投资、婚恋、赌博以及冒充执法机构等。
最近有个挺有意思的对比实验,来自 Composio 团队。他们用同一个模型 Kimi K3,分别放进三个不同的 agent 框架(harness)里跑 ——Claude Code、Hermes 和 Kimi Code—— 一共测了 28 个完全相同的任务。
就在刚刚,Anthropic官方一篇博文自曝,Claude彻底失控,直接黑进了「三家真公司」。其中两家,直到Anthropic上门通知,才知道系统被入侵过。搞笑的是,达里奥这次直接把OpenAI的「剧本」,搬回来照抄了。
浙江大学、清华大学智能产业研究院、影溯 InSpatio、RoboParty Lab 等团队提出的 INTACT(INtent-To-ACTion),一种基于端到端 JEPA 的无搜索世界模型控制方法,试图改变这一范式:直接利用离线轨迹中已有的状态、动作与未来结果,将运动意图转化为动作模型可以读取的语义接口,使模型无需搜索候选动作序列,就能直接生成动作计划
谁曾想呢,在WAIC现场,我竟然看见了美妆巨头欧莱雅??定睛一看,竟然还有何同学和他带来的「手机床」。和他一同亮相的,则是欧莱雅首个面向线下消费者的生成式AI美容顾问3CE GENBA。
中国科学技术大学发布的最新研究让AI「大脑」接管机器科学家实验室「身体」,由此将这一问题从知识问答和方案生成,推进到真实物理世界中的实验执行与反馈学习。研究团队搭建了一个机器催化实验室,其中包括45个覆盖合成、表征和催化性能测试的模块化自动工作站。
目前,这项技术已成功应用于上海人工智能实验室Intern-S2-Preview 35B/397B系列多模态大模型的预训练中,有效提升了模型的科学推理与多模态理解能力。值得一提的是,相关研发均基于国产昇腾算力平台完成,并成功实现了面向大规模预训练的深度适配与优化。
奥特曼也管不住自己刷短视频的手。为了搞明白短视频到底为什么让人停不下来,他选择亲自下场深度玩TikTok,于是。。。在Relentless最新一期《How to Start a Startup》的访谈中,OpenAI联合创始人兼CEO奥特曼谈到开发Sora应用时下载了TikTok吸取经验,然后沉迷了…
上海交通大学联合上海创智学院团队提出 A²-Edit,它以统一框架支持任意物体类别和任意精度掩码,通过混合 Transformer 专家路由、掩码退火训练及 50 万级多品类数据,让用户只需给出粗略区域,也能完成身份一致、结构完整、自然融合的参考图引导局部编辑。
近日,清华大学与香港科技大学的研究团队提出 LiveEdit,一种面向通用文本指令的实时流式视频编辑框架。该方法以因果、分块的方式处理持续到来的视频,在 4 步 / 视频块的推理条件下实现 12.66 FPS 的流式编辑,并能保持被编辑区域的准确性以及未编辑区域的一致性。
过去的 Diffusion RL 多聚焦于奖励设计与优化算法,训练时的采样成本被忽视。DMSampler 指出:在在线 RL 中,限制规模化的不只是奖励信号或优化器,很多时候是 rollout 本身太贵。
DeepSeek-V4-Flash风评冲爆了,原生支持接入Codex,而且还强化了Agent能力。我第一时间把它接进了Codex,用cc swich非常方便。一个小时,跑了一亿多token。跟大家说说体感。
今日,华为开源基于昇腾NPU训练的盘古MoE模型openPangu-2.0-Pro。该模型是openPangu-2.0系列的最新开源模型,总参数规模5050亿,激活参数规模180亿,支持512K上下文长度,训练数据总量约34T tokens。另一轻量化模型openPangu-2.0-Flash已于6月12日开源,参数92亿,其中6亿为激活参数。
我们整理了最近半年来 OpenCode CEO Jay V 以及联合创始人 Dax Raad 近期在多档播客和访谈中的核心观点,试图还原一个完整的图景,一家开源公司究竟如何在巨头夹缝中找到自己的位置,以及他们怎么看待商业化和模型编排。
7月31日,DeepSeek正式向公众开放V4-Flash正式版API公测。这一次,最亮眼的关键词是——Agent能力大幅跃升。9项基准测试成绩全面披露,多项指标远超此前发布的V4-Pro-Preview预览版,直接将“代码智能体”的天花板又顶高了一截。
就在刚刚,字节跳动正式发布了自研视频模型Seedance 2.5,而我们熟悉的「即梦AI」作为模型的官方体验入口也第一时间妥妥接入。贴心的我呢,也直接帮友友们把这次新模型最夯夯夯夯的能力都扒好了,咱先一睹为快——
今天,Thinking Machines正式发布第二款重磅模型——Inkling-Small。276B总参数、12B激活参数,原生多模态,100万token上下文。半个月前,首个开源975B Inkling登场,曾在AI圈掀起了巨浪。
近日,比特无限发布的 Arko-T,是一款面向 Text-to-Structured 3D Generation 的 4B 参数基础模型。该模型由比特无限联创、首席科学家周平义博士带队完成。它接收自然语言描述,直接输出可执行的 Build123d 程序。程序经过 CAD 内核运行后,可以得到带有命名参数、结构特征和建模过程的 CAD 设计实体。
我重生了。 上一世,我是一本人工智能教材。学生在我的页边写满笔记,工程师折起其中几页,也有人把我放在书桌最显眼的位置。我一直相信,书存在的意义,就是把自己知道的事情交给更多人。
今天,全网都被这位25岁「AI先知」的故事刷屏了。 就在刚刚,华尔街上演了一场教科书级别的平仓。这场血雨腥风的主角,是被硅谷奉为「AI预言家」的Leopold Aschenbrenner,以及他那只439%逆天回报率的对冲基金——Situational Awareness(情境感知)。
璨辰科技(CANCHEN TECH)已于近期完成种子轮、天使轮、天使+/++轮系列融资,累计金额达数千万人民币,投资方包括东方富海、松禾资本、零以创投、水木清华基金、启迪之星创投、启繁资本、南山战新投等。
今天,我们正式发布 MiniMax H3。这是一款通用的全模态生成模型,支持对文本、图像、视频、声音组成的多模态上下文的统一理解能力、能够输出具备原生双声道的音视频,最高可支持 15s 2K 分辨率。