80亿参数记性不如U盘:他算出了大模型记忆天花板
80亿参数记性不如U盘:他算出了大模型记忆天花板一个80亿参数的大模型,一口气吞下15万亿token的训练数据,堆到硬盘上差不多7TB。可它真正「背」得下来的,少得可怜:每个参数只装得下3.6 bit。一个英文字母8 bit,连半个都填不满。
搜索
一个80亿参数的大模型,一口气吞下15万亿token的训练数据,堆到硬盘上差不多7TB。可它真正「背」得下来的,少得可怜:每个参数只装得下3.6 bit。一个英文字母8 bit,连半个都填不满。
Seltz为Agent自建一套持续更新的Web索引,让它能够及时看见公开网络中正在发生什么;AnySearch聚合开放Web和20多个垂直数据源,让Agent知道面对不同问题应该去哪里查;Octen则重写索引、排序和服务层,让Agent可以同时展开几十甚至上百次查询,更快、更大规模地看见信息。
Factory 成立于 2023 年 4 月。彼时,企业市场连 GitHub Copilot 都尚未完全接受,更不用说完全自主的 AI 软件工程代理(Autonomous Agents)了。Matan 形容创业最初的两年是一场在沙漠中的跋涉:技术理念过于超前,工程师还没准备好改变习惯,企业采购团队也充满怀疑。
今年,这条研究路线又往前走了一步。6 月,李飞飞参与的一项机器人研究 T-Rex 发布,研究者为机器人加入高频触觉反馈,让它完成翻书页、拿鸡蛋、挤牙膏、抽取薄卡片和拧灯泡等任务。
JarvisHub 给出的答案,是把可编辑画布同时变成用户工作区、Agent 的外部记忆、行动空间和共享项目状态。Agent 不再只从聊天记录里猜测上下文,而是直接「看」到画布上的提示词、参考图、候选版本、生成结果、依赖关系、失败记录和用户反馈,再据此规划、调用工具、写回结果。
现在最新动态来了,老黄在Y Combinator近1小时的《Jensen Huang: The Mindset That Built NVIDIA》访谈里狂爆金句,高能不断:Agent是一种新的软件形态。Agent不必达到100%准确才有价值,“可控性”或将成为其下一个发展阶段最大的突破口。
最近有个挺有意思的对比实验,来自 Composio 团队。他们用同一个模型 Kimi K3,分别放进三个不同的 agent 框架(harness)里跑 ——Claude Code、Hermes 和 Kimi Code—— 一共测了 28 个完全相同的任务。
谁曾想呢,在WAIC现场,我竟然看见了美妆巨头欧莱雅??定睛一看,竟然还有何同学和他带来的「手机床」。和他一同亮相的,则是欧莱雅首个面向线下消费者的生成式AI美容顾问3CE GENBA。
DeepSeek-V4-Flash风评冲爆了,原生支持接入Codex,而且还强化了Agent能力。我第一时间把它接进了Codex,用cc swich非常方便。一个小时,跑了一亿多token。跟大家说说体感。
7月31日,DeepSeek正式向公众开放V4-Flash正式版API公测。这一次,最亮眼的关键词是——Agent能力大幅跃升。9项基准测试成绩全面披露,多项指标远超此前发布的V4-Pro-Preview预览版,直接将“代码智能体”的天花板又顶高了一截。