从TPU到自我进化的Agent,Jeff Dean如何判断AI的下一步

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
从TPU到自我进化的Agent,Jeff Dean如何判断AI的下一步
5279点击    2026-08-03 15:52

2026 年的 YC Startup School 上,Jeff Dean 的声音有些沙哑。


访谈刚开始,他便解释自己失声了,今天听起来和平时不太一样。但这并没有影响台下听众的注意力。坐在他面前的 YC 合伙人 Diana Hu,一口气列出了一串足以写进计算机史的名字:MapReduce、BigTable、TensorFlow、TPU、Gemini。


从TPU到自我进化的Agent,Jeff Dean如何判断AI的下一步


任何一个项目,都足够成为一名工程师职业生涯的代表作。它们却集中出现在 Jeff Dean 和他身边一批 Google 工程师的履历里。


Diana 没有把访谈做成一次功绩回顾。她更关心另一个问题:当生成式 AI 已经席卷软件行业,Jeff Dean 这种最擅长从底层重构系统的人,今天究竟在看什么?


答案并不是更大的模型。


在这场近一小时的对话里,Jeff Dean 反复谈到推理硬件、能量、数据搬运、上下文工程、长时间运行的 Agent、自动化实验系统,以及创业公司如何避开通用模型的正面碾压。他讲的看似分散,背后却有一条非常清楚的主线:AI 的下一阶段,不只是把模型训练得更聪明,而是把模型放进一个能长期工作、持续试错、自动验证、不断积累能力的系统里。


这也意味着,AI 竞争正在从「谁有更大的模型」,转向「谁能更好地组织智能」。


从TPU到自我进化的Agent,Jeff Dean如何判断AI的下一步


一、AI 已经像初级工程师,但这不是最重要的变化


2025 年 5 月,Jeff Dean 曾做过一个引发广泛讨论的判断:AI 的能力已经接近一名初级工程师


从TPU到自我进化的Agent,Jeff Dean如何判断AI的下一步


一年后,Diana 问他,这个预测实现得怎么样?


Jeff Dean 的回答很直接。他认为,这个判断「相当准确」。模型在 Agent 化、长流程编码和复杂任务上的进步,甚至比他当时预想得更快。


「模型完成越来越复杂任务的能力,增长得比我预期更快。」他说。


更值得注意的是,这种能力不再局限于写代码。越来越多 Agent 系统开始进入科学、工程和其他专业领域。它们不只是回答问题,而是拆任务、用工具、运行实验、读取结果,再根据反馈继续行动。


把 AI 类比成初级工程师,容易让人把注意力放在人力替代上。但 Jeff Dean 更关心的是另一层变化:当一个「初级工程师」可以复制成几十个、几百个,并行工作几天甚至几周,组织生产的方式会发生什么变化?


在传统团队里,初级工程师需要上手业务,需要理解工具,需要不断得到反馈。Agent 也一样。只不过它的培训材料不再只是文档,而是提示词、工具说明、技能文件、测试体系、评估器,以及整个上下文环境。


这使 AI 工程出现了一个新的分工。


过去,工程师主要负责写代码。未来,更多工程师会负责定义问题,搭建环境,编写规范,设计反馈回路,再调度一群 Agent 去完成任务


Jeff Dean 对 2027 年的预测正是如此。他认为,机器学习系统会越来越多地参与改进机器学习系统本身。它们会把目标拆成子问题,自动运行大量实验,比较结果,再把有效方案组合起来,形成更强的新系统。


「只要一个领域存在可测量的目标,就有机会取得很大进展。」


这句话是整场访谈的第一把钥匙。


AI 自动化最先攻入的,不一定是知识最多的领域,而是反馈最清晰的领域。代码能不能通过测试,芯片布局能不能降低面积,模型结构能不能提高精度,材料性质是否满足要求,这些问题都有相对明确的评价标准。只要评价器足够可靠,机器就能用极高频率反复试验。


所以,AI 时代真正重要的单位,可能不再是一次回答,而是一次完整的闭环:提出方案、执行方案、测量结果、修正方向。


二、改变 Google 搜索的是一道算术题


Jeff Dean 的许多代表性工作,都来自一个非常朴素的起点:先把数量级算清楚。


2001 年,Google 搜索仍大量依赖硬盘。硬盘容量大,但访问速度慢。Jeff Dean 和 Sanjay Ghemawat 做了一次估算,发现 Google 当时的整份搜索索引,已经可以放进所有服务器的内存里。


今天听起来,这只是一次存储介质升级。但在当时,它意味着完全不同的系统设计。


如果索引主要待在硬盘上,查询需要等待机械寻道。只要把索引放入内存,访问延迟就能骤降。两人很快写出新版本,并在几天内把它送进生产环境。Google 搜索由此明显变快。


这个故事最容易被包装成天才灵光一现。Jeff Dean 的讲法却更像一名工程师在陈述常识:系统条件变了,原来不成立的方案突然成立,那就应该重新计算一次。


很多行业创新都发生在这种时刻。


一个旧问题长期存在,人们已经习惯围绕它打补丁。后来,硬件价格、内存容量、网络带宽或模型能力跨过某个临界点,原来的约束消失了。可大多数人仍沿用旧架构,因为旧架构已经变成常识。


Jeff Dean 擅长做的,是把常识重新变成假设


他会问:为什么一定要这样?今天的数量级还是昨天的数量级吗?如果把最贵的一步换掉,整个系统会不会出现完全不同的形态?


这也是他给创业者的建议。不要只看现有方案哪里不够好,而要从第一性原理重新看问题。能不能把性能提高一个数量级?能不能把成本降低两个数量级?能不能不再沿用行业默认的实现路径?


「有时候,你只需要眯起眼睛看一个问题,不要被今天的解法锚定,而是从第一性原理思考应该怎样解决。」


这句话听起来并不神秘。真正困难的是,多数人进入一个行业后,会迅速学会这个行业的所有默认答案。经验帮助人提高效率,也会让人失去重新提问的能力。


三、三分钟语音,为什么催生了一颗 TPU


2013 年,Google 的深度学习语音识别开始显著超过旧系统。错误率下降了一半,相当于过去二十年语音识别进展在几个月里集中发生。


产品团队当然兴奋。Jeff Dean 却先算了一笔账。


如果语音识别真的变好,用户就会更愿意使用。假设每名 Google 用户每天只使用三分钟语音识别,Google 需要多少服务器才能支撑?


结果并不乐观。按照当时 CPU 的效率,Google 可能需要把服务器规模扩大一倍。


这就是 TPU 的起点。


它不是因为研究团队突然想造芯片,也不是为了证明 Google 有能力做硬件,而是因为一个成功的模型即将制造一个无法承受的服务成本。


这段历史揭示了 AI 产品中一个经常被忽略的规律:模型效果提升,并不总是降低成本。恰恰相反,效果越好,使用量越大,系统压力越重


当语音识别不好用时,用户很少调用。系统成本不是问题。当错误率大幅下降,需求突然被释放,原本隐藏在后台的算力约束就会浮出水面。


TPU 选择的路径,是为机器学习最核心的计算模式做专用硬件。它不需要运行浏览器,也不需要处理所有通用程序。它主要擅长低精度、稠密线性代数。这类计算恰好位于现代机器学习的中心。


第一代 TPU 最终带来了数量级上的收益。按照 Jeff Dean 的说法,它比当时的 CPU 和 GPU 节能 30 到 80 倍,延迟也低了 20 到 30 倍。


这里还有一个容易被忽略的设计尺度。


TPU 很专用,但没有专用到只能运行某一种固定模型。团队知道机器学习算法还会快速变化,于是把芯片设计成一种较通用的线性代数系统。它牺牲了运行 Chrome 或 Word 的能力,却保留了支持未来算法演进的空间。


这是一种很难把握的平衡。专用得不够,收益不明显。专用得太狠,算法一变,硬件就会过时。


Jeff Dean 对今天推理硬件的判断,和当年的 TPU 有明显呼应。他认为,下一轮重要机会仍然在专用化,但重心会进一步转向低延迟、低能耗推理


「想象一下,如果延迟能改善 50 倍,你可以做什么。」


当模型回复需要十几秒时,人们会把它当成一个偶尔咨询的工具。当延迟接近即时,它才可能真正进入交互界面、机器人、实时视频、操作系统和连续决策流程。


等待不是一个小体验问题。等待会改变产品形态。


四、AI 的成本中心,不是计算,而是搬运数据


如果要为 2026 年的 AI 工程师更新一版「每个工程师都应该知道的延迟数字」,Jeff Dean 认为,重点应该从硬盘寻道、缓存未命中和跨洲网络延迟,转向芯片内部的数据流。


工程师需要知道:主存到片上内存的带宽是多少,片上内存到乘法单元的带宽是多少,一次乘法需要多少能量,芯片之间如何互连,500 颗芯片扩展到 1 万颗芯片时,网络效率会怎样下降。


这些数字看起来离产品很远,实际却在决定什么产品能成立。


Jeff Dean 给出了一个极具冲击力的比例。完成一次数学乘法,大约只需要一个皮焦耳的能量。把数据从高带宽内存搬到计算单元,能量成本可能高出约 1000 倍。


换句话说,今天 AI 系统中的昂贵动作,常常不是「算」,而是「把要算的东西搬过来」。


这也解释了为什么批处理如此重要。


一组模型权重从内存被搬入计算单元后,如果只处理一个 token,数据搬运成本就全部压在这一个 token 上。如果同时处理更大的批次,同一份权重可以服务更多计算,能量和带宽成本便被摊薄。


但批处理和低延迟天然冲突。为了凑够一批请求,系统往往需要等待。吞吐提高了,单个用户的响应却可能变慢。


因此,许多看似属于模型层的问题,其实是硬件和系统问题。训练为何使用大批次,推理为何需要 KV Cache,模型为何追求低精度,系统为何需要量化,背后都离不开数据搬运和能量约束。


Jeff Dean 近期更关注推理,也正是因为推理对延迟极度敏感。训练任务跑慢一点,往往只是实验结束得晚。推理任务每多等一秒,都会直接影响用户体验和 Agent 的工作效率。


如果一个 Agent 要连续调用模型 1000 次,单次延迟降低 50%,整个任务的完成时间就可能出现巨大差异。更不用说未来 Agent 要运行数天或数周。


因此,AI 的「能源问题」并非一个遥远的环保议题。它直接决定模型能否便宜地服务更多人,决定 Agent 能否持续运行,也决定创业公司的毛利是否健康。


五、模型只是一个零件,上下文才是 Agent 的工作现场


过去几年,AI 行业习惯用参数量、训练数据和基准分数衡量进步。2026 年,Jeff Dean 更强调模型周围的一切。


一个真正有用的 AI 系统,除了模型,还需要检索、工具、记忆、历史信息、执行环境和反馈机制。模型知道有哪些工具,知道何时调用工具,知道如何把复杂问题拆成一串动作,也要能比较多种方案,判断哪一种更可能成功。


这就是「上下文工程」开始走到舞台中央的原因。


Jeff Dean 说,模型在训练阶段见过的信息,最终被「搅拌」进数千亿乃至数万亿参数里。它们像一锅浓汤,知识存在,但未必清晰。真正放进当前上下文的信息,对模型来说更加直接,也更容易被准确使用。


这给小团队留下了一个重要机会。


训练基础模型需要海量资本、数据和算力。上下文工程却可以从一个 API 开始。创业者可以围绕具体业务,把领域知识、工具流程、客户数据和评估标准组织起来,让通用模型在一个窄场景里表现得更可靠。


Jeff Dean 举了一个自己的例子。


他和 Sanjay Ghemawat 经常优化 Google 内部的底层库。这些数据结构可能运行在数百万个进程中,一点点性能差异都会被规模放大。传统做法是工程师先写微基准,测量当前性能,再修改代码,重新运行基准,观察缓存占用和性能变化,然后继续迭代。


两人把这套工作方法写成了一项 Agent 技能。模型学会了如何运行基准、修改代码、比较结果,再根据测量继续优化。


「我们只是把人会采用的方法,以模型可以使用的形式交给了它。」


这句话几乎可以视为上下文工程的朴素定义。


它不是神秘的提示词技巧,也不是堆更多背景材料。它是在回答三个问题:专家会按什么步骤做事,系统有哪些可靠工具,结果应该怎样被验证。


当这些内容被结构化之后,模型获得的不是更多知识,而是一套可重复执行的方法。


这也是为什么「(skill)」会成为 Agent 生态中的关键资产。一个优秀技能文件,可能封装了团队多年的隐性经验。它告诉模型遇到某类问题时先做什么,哪些错误最常见,哪些工具值得信任,什么结果才算完成。


未来公司的差异化,很可能不只存在于模型权重里,也存在于这些被编码进工作流的经验里。


六、Agent 为什么走到第 30 步就开始失控


几乎所有真正做过 Agent 的团队,都见过同一种场景。


前几步很顺。模型能读需求,能调工具,能写代码。到了第 30 步或第 50 步,它开始忘记目标,误解状态,重复动作,或者沿着一个错误方向越走越远。


Jeff Dean 把其中一个原因归结为分布外问题。


模型在训练中见过大量常见任务。只要任务仍位于它熟悉的「明亮道路」上,表现通常不错。一旦连续操作把它带到不熟悉的状态,性能就会突然下降。越偏离舒适区,错误越容易累积。


解决方法之一,是提供技能提示,把模型尽量约束在它熟悉的路径上。另一个方法,是使用多 Agent 系统


多个 Agent 可以尝试不同方案,再由另一个模型担任评估者,判断哪些方向更有希望。失败的分支被丢弃,成功的分支继续推进。这本质上是在推理阶段进行搜索。


它和人类团队的工作方式并不陌生。面对复杂问题,一个人提出方案,另一个人审查风险,第三个人运行实验。团队不会把全部希望押在第一条思路上,而是通过分工和反馈降低单点失误。


Agent 运行时间越长,系统设计越不能依赖一次正确。


真正可靠的长程 Agent,需要检查点、状态管理、回滚、分支探索、外部评估、权限控制和异常恢复。它更像一个分布式系统,而不是一个超长聊天窗口。


这正是 Jeff Dean 的背景开始重新显得关键的地方。


MapReduce 解决的核心问题之一,就是如何让大量不可靠机器完成可靠计算。今天的 Agent 系统面对相似矛盾:单次模型调用并不完美,工具也会失败,但整个任务仍要尽可能稳定地完成。


未来优秀的 Agent 平台,可能会继承许多分布式系统思想。任务可以拆分,结果可以验证,失败可以重试,状态可以恢复,局部错误不应该摧毁整个流程。


当 Jeff Dean 说 Agent 将运行几天甚至几周时,他不是在描述一个更长的聊天。他在描述一种新的计算基础设施。


七、两三个人如何赢过 Google:寻找模型成功率只有 1% 的问题


在 Startup School 的语境里,最受关注的问题当然是创业机会。


Google 可以联合设计芯片、数据中心、模型和产品。Gemini 这样的通用模型还在快速扩张能力边界。一个两三人的团队,凭什么赢?


Jeff Dean 的回答并不浪漫。


小团队的机会,通常存在于通用模型没有充分关注的具体领域创业者可以把产品界面、专有数据、工作流和领域技能组合起来,在一个窄场景里提供更高准确率和更好体验。


但他随即给出警告:通用模型正在迅速变强。今天看似独立的产品功能,六个月或十二个月后,可能被基础模型直接覆盖。


因此,创业者需要判断自己的优势是否耐久。


Jeff Dean 给出了一条很具体的筛选标准:寻找那些当前通用模型成功率接近 0% 或 1% 的任务,而不是已经能做到 20% 的任务。


「如果模型完全失败,这可能是一个好迹象。如果它已经能做一部分,只是做得不太好,那反而未必是好迹象。」


原因很简单。20% 意味着能力已经开始出现。更多数据、更大模型和更长推理,很可能快速把它推向可用。0% 或 1% 则说明任务可能缺少关键数据、特殊工具、领域反馈,或者需要一种通用模型短期难以获得的能力。


这可以称为 Jeff Dean 的「1% 法则」。


它并不是建议创业者专挑最难的问题,而是寻找通用模型存在结构性盲区的问题。


这种盲区大致有三类。


第一类是专有数据。通用模型能组织世界信息,却未必能访问某个用户的全部个人资料、某家公司的内部流程、某种设备产生的实时数据。创业产品一旦获得这些数据,就能形成不同于基础模型的视野。


第二类是专业评价。很多行业不是缺少生成能力,而是缺少可靠判断。医疗、材料、芯片、制造和科学研究,都需要高质量验证器。谁能定义「什么是对的」,谁就能让 Agent 持续优化。


第三类是窄而深的模型。AlphaFold 并不是通用聊天模型,它针对蛋白质结构问题建立了高度专业化能力。材料科学、芯片设计和其他专业领域,也可能出现类似机会。


这套判断对创业者并不轻松。它要求团队既理解模型能力边界,也理解行业深处的问题。只懂 AI,容易做出很快被平台吸收的功能。只懂行业,又可能低估模型进步速度。


真正的机会位于两者交界处。


八、当代码不再稀缺,规格、品味和问题选择会更贵


Diana 提出一个假设:如果未来每位创始人都能同时管理 50 个、100 个 Agent,所有代码都由 Agent 写,什么能力会变得稀缺?


Jeff Dean 的回答是「品味」。


更准确地说,是判断应该让 Agent 做什么。


他认为,研究工作的大部分价值不在于把实验执行得多漂亮,而在于是否选择了一个值得研究的问题。一个团队可以用最精湛的方法,完成一项无关紧要的研究。也可以抓住一个关键问题,只要解决,就改变整个领域。


Agent 让执行成本下降之后,问题选择的重要性会进一步上升。


过去,一个模糊想法会因为开发成本太高而自然消失。未来,只要调动足够多 Agent,很多想法都能被迅速做成原型。世界不会因此自动出现更多好产品,只会出现更多产品。


规格也会变得更重要。


Jeff Dean 说,和虚拟 Agent 协作时,目标越清晰,成功率越高。过去,模糊需求交给一名资深工程师,对方可以追问,也能依靠共享背景补全意图。Agent 虽然也能提问,却更容易在缺少上下文时自行猜测。


一个典型的高成功率任务,是把软件从一种编程语言迁移到另一种语言。原因不是迁移简单,而是规格极其完整。旧代码定义了行为,测试定义了边界,Agent 可以逐项对照,直到新版本表现一致。


「现在 Agent 可以替你写软件,但说明你究竟想要什么,反而变得更重要了。」


这句话对所谓 AI 原生组织有直接启示。


未来的管理者不只是分配任务,而要编写更清晰的目标和验收标准。设计文档不再只是团队沟通材料,也会成为机器执行的输入。测试、指标、约束和样例,会从开发流程末端前移到任务定义阶段。


至于「品味」如何训练,Jeff Dean 给出的方法很务实。


写下一批你认为未来 12 个月会变得重要的事情。你不必全部去做。12 个月后重新检查,哪些判断成真,哪些被别人做出来,哪些毫无进展。通过不断积累预测样本,人会逐渐校准自己的判断。


品味并不完全是天赋。它也可以通过复盘训练。


九、好的思想实验,先把行业最牢固的前提拿掉


访谈后半段,Jeff Dean 分享了一个颇为疯狂的思想实验。


过去 60 年,芯片行业一直在追求更小、更稳定、错误率更低的晶体管。人们默认,同一设计制造出的芯片应该尽可能完全一致,位翻转越少越好。


可在大型分布式系统中,工程师早已接受单个组件会失效。硬盘会坏,机器会宕机,交换机会出问题。系统可靠性并不来自每个部件绝不出错,而来自复制、校验、冗余和恢复。


于是 Jeff Dean 问:如果晶体管每天会发生 20 次错误,而不是几百万年才出一次错,会怎样?


这并不是一项现实产品计划。他只是试图把一个习以为常的前提拿掉。也许极不可靠的晶体管能以完全不同的方式制造,系统则通过多路径和高层冗余保证结果。


多数思想实验最终不会变成产品。很多行业做法持续数十年,确实有充分理由。但 Jeff Dean 认为,仍应定期重新检查这些理由。


MapReduce 就来自类似过程。


早期 Google 的爬虫和索引系统包含大量手工并行代码、检查点和故障恢复逻辑。真正的业务计算往往很简单,比如读取所有网页,判断页面语言。可大量系统代码把简单意图淹没了。


Jeff Dean 和 Sanjay Ghemawat 从函数式编程中找到灵感。他们把大量任务抽象成 Map 和 Reduce,把并行化、调度、容错和重试下沉到统一框架里。业务开发者只需要表达计算本身。


这项设计并没有让机器变得不出错。它让错误变得可以被系统吸收。


今天的 Agent 工程也可能处在类似阶段。大量团队仍在为每个任务手工编排提示词、重试逻辑和工具调用。未来,是否会出现一个像 MapReduce 一样简洁的抽象,让长程 Agent 的分解、验证、恢复和并行探索成为底层能力?


这也许正是下一批基础设施公司的机会。


十、AI 开始构建更好的 AI,科学方法被压缩成高速循环


Jeff Dean 对未来最兴奋的方向,是把科学方法本身自动化。


传统科研流程是提出假设、设计实验、运行实验、分析结果,再产生下一轮假设。这个循环的速度,长期受制于实验成本和验证延迟。


AI 可以改变两部分。


一部分是自动提出和执行更多实验。另一部分是把昂贵验证器变成廉价近似模型


Jeff Dean 举了量子化学的例子。研究人员要判断一种分子构型的性质,可以运行密度泛函理论模拟。一次模拟可能需要一整夜。Google 的研究人员用大量模拟输入和输出训练了一个神经网络近似器。它接近原模拟器的准确度,却快了约 30 万倍。


验证速度变化之后,科学问题的形态也会变化。


过去筛选 1000 万个候选方案,可能是一个需要数月算力的项目。现在,研究者吃一顿午饭的时间,系统就能完成初筛。实验不再是珍贵的单次下注,而变成高频搜索。


这也是 AlphaEvolve、AlphaChip 等系统背后的共同逻辑。模型提出方案,工具执行方案,评价器筛选结果,优秀结果进入下一轮。只要闭环足够快,系统就能在巨大的解空间中持续探索。


机器学习本身也会成为这种自动化科学的对象。


今天,大型研究团队通常由人提出新架构或训练方法,先跑小规模实验,再挑选有希望的方案放大。Jeff Dean 认为,没有根本障碍阻止模型接管其中越来越多环节。人给出高层方向,系统自动探索结构、数据配方和训练策略,再把成功实验组合成新模型。


未来衡量研究效率的指标,可能不只是每秒浮点运算,而是「每单位算力产生多少有效发现」。


算力当然重要。如何把算力转化为发现,更重要。


十一、被 NeurIPS 拒绝的蒸馏论文,以及如何看待失败


2014 年,Jeff Dean、Geoff Hinton 和 Oriol Vinyals 提交了一篇关于知识蒸馏的论文。今天,知识蒸馏已经是模型压缩和能力迁移中的基础方法。大模型作为教师,把能力传递给更小、更快、更便宜的学生模型。


这篇后来影响深远的论文,当年却被 NeurIPS 拒绝。


一名审稿人认为,它「不太可能产生重大影响」。感兴趣的读者可访问《被拒≠失败!这些高影响力论文都被顶会拒收过》。


Jeff Dean 谈起这段经历时没有愤怒。他说,审稿人可能并不了解大规模 AI 服务面临的现实问题。对 Google 来说,把昂贵大模型转化为可服务数亿用户的小模型,显然非常重要。对只关注理论新颖性的审稿人来说,它未必显得足够「基础」。


论文被拒后,团队把它放上 arXiv。行业照样读到了它,也照样开始使用。


今天,Gemini 的 Flash 模型能够在较小体量和较低延迟下保持强能力,蒸馏正是其中的重要方法之一。


这个故事并不只是「坚持就会成功」的励志材料。它说明评价体系总有盲区。一个方案的价值,有时只有真正承受过那个系统瓶颈的人才能立刻看见。


对创业者来说,这同样重要。


市场、投资人和同行的否定,可能意味着方向错误,也可能只是对方没有处在同一个问题现场。区别在于,团队是否有足够具体的证据,知道这个问题为什么重要,为什么现在能解决。


Jeff Dean 没有鼓励人盲目坚持。他鼓励的是:理解问题,持续验证,然后不要把一次评审当成世界的最终判断。


十二、年轻的 Jeff Dean 今天会做什么


访谈接近尾声时,Diana 提出了一个带有想象力的问题。


如果把 1999 年加入 Google 时的年轻 Jeff Dean 传送到 2026 年,他会加入一家前沿实验室,还是和两三个朋友创办公司?


Jeff Dean 没有给出标准答案。


大组织拥有结构、平台和大量优秀同事。一个人在其中可以接触自己不了解的知识,也能借助成熟产品影响全球用户。小团队则更自由,也承担更大风险。创始人必须真正相信一个问题,愿意用几年时间承受不确定性。


他给出的判断标准,比「加入大厂还是创业」更根本。


「如果我解决了这个问题,并且最好的结果真的发生了,世界会因此明显变好吗?还是大家只会说,嗯,挺酷的,然后就这样?」


如果答案只是「挺酷的」,那可能不值得投入最宝贵的时间。


他也强调同伴的重要性。要找有互补能力的人,也要找低自我、愿意协作、相处愉快的人。真正困难的问题往往需要长期共事。团队成员最好各自拥有别人没有的工具,并在共同工作中继续扩充自己的「工具腰带」。


这番话有一种老派工程师的朴素。


AI 行业喜欢谈指数增长、超级智能和巨额融资。Jeff Dean 最后仍把选择落回三件小事:做一个真正关心的问题,和喜欢的人一起工作,尽力让世界变得更好。


结语:AI 时代最稀缺的,仍然是把问题看清楚


Jeff Dean 的职业生涯里,有许多被反复讲述的传奇。


他和 Sanjay Ghemawat 在几天内重写搜索系统,让索引进入内存。一次关于三分钟语音的估算,推动 Google 造出 TPU。MapReduce 把大规模并行和容错藏进统一抽象。知识蒸馏从一篇被拒论文,变成行业基础技术。


这些故事很容易让人把他想象成一个不断获得灵感的天才。


但从这场访谈看,他的方法其实高度一致。


先算清数量级。再找到真正的瓶颈。然后质疑默认假设,建立一个更简单的抽象。最后,用测量和反馈推动系统不断迭代。


今天的 AI 行业正在经历类似转折。


模型已经足够强,强到可以承担初级工程师级别的任务。接下来,决定实际生产力的,不只是模型智商,而是推理成本、上下文组织、工具质量、验证速度和长程运行可靠性。


Agent 会越来越像团队成员。可它们需要清晰规格,需要技能,需要检查点,需要评价者,也需要一个能容纳失败的系统。


创业公司的机会也不会消失,只是会变得更苛刻。最好不要去做通用模型已经能完成 20% 的事情,而要寻找那些成功率仍接近 0% 或 1% 的问题。那里可能藏着专有数据、专业评价器、窄领域模型,或全新的系统抽象。


当代码生成越来越便宜,真正昂贵的会是问题本身


什么值得做?什么约束已经过时?什么变化刚刚跨过临界点?什么系统如果快 50 倍,会变成完全不同的产品?


Jeff Dean 没有为 6000 名创业者给出一份机会清单。他给的是一种更耐用的思考方式。


别急着追逐最热的答案。


先把问题算一遍。


参考链接

https://x.com/ycombinator/status/2082938685071491219

https://www.ycrootaccess.com/p/jeff-dean-the-1-rule-for-building


文章来自于"机器之心",作者 "Panda"。

AI转型,免费服务,就找AITNT
AITNT资源拓展
根据文章内容,系统为您匹配了更有价值的资源信息。内容由AI生成,仅供参考
1
AI工作流

【开源免费】字节工作流产品扣子两大核心业务:Coze Studio(扣子开发平台)和 Coze Loop(扣子罗盘)全面开源,而且采用的是 Apache 2.0 许可证,支持商用!

项目地址:https://github.com/coze-dev/coze-studio


【开源免费】n8n是一个可以自定义工作流的AI项目,它提供了200个工作节点来帮助用户实现工作流的编排。

项目地址:https://github.com/n8n-io/n8n

在线使用:https://n8n.io/(付费


【开源免费】DB-GPT是一个AI原生数据应用开发框架,它提供开发多模型管理(SMMF)、Text2SQL效果优化、RAG框架以及优化、Multi-Agents框架协作、AWEL(智能体工作流编排)等多种技术能力,让围绕数据库构建大模型应用更简单、更方便。

项目地址:https://github.com/eosphoros-ai/DB-GPT?tab=readme-ov-file



【开源免费】VectorVein是一个不需要任何编程基础,任何人都能用的AI工作流编辑工具。你可以将复杂的工作分解成多个步骤,并通过VectorVein固定并让AI依次完成。VectorVein是字节coze的平替产品。

项目地址:https://github.com/AndersonBY/vector-vein?tab=readme-ov-file

在线使用:https://vectorvein.ai/付费

2
AI数据分析

【开源免费】DeepBI是一款AI原生的数据分析平台。DeepBI充分利用大语言模型的能力来探索、查询、可视化和共享来自任何数据源的数据。用户可以使用DeepBI洞察数据并做出数据驱动的决策。

项目地址:https://github.com/DeepInsight-AI/DeepBI?tab=readme-ov-file

本地安装:https://www.deepbi.com/

【开源免费airda(Air Data Agent)是面向数据分析的AI智能体,能够理解数据开发和数据分析需求、根据用户需要让数据可视化。

项目地址:https://github.com/hitsz-ids/airda

3
智能体

【开源免费】AutoGPT是一个允许用户创建和运行智能体的(AI Agents)项目。用户创建的智能体能够自动执行各种任务,从而让AI有步骤的去解决实际问题。

项目地址:https://github.com/Significant-Gravitas/AutoGPT


【开源免费】MetaGPT是一个“软件开发公司”的智能体项目,只需要输入一句话的老板需求,MetaGPT即可输出用户故事 / 竞品分析 / 需求 / 数据结构 / APIs / 文件等软件开发的相关内容。MetaGPT内置了各种AI角色,包括产品经理 / 架构师 / 项目经理 / 工程师,MetaGPT提供了一个精心调配的软件公司研发全过程的SOP。

项目地址:https://github.com/geekan/MetaGPT/blob/main/docs/README_CN.md

4
AI爬虫

【开源免费】ScrapeGraphAI是一个爬虫Python库,它利用大型语言模型和直接图逻辑来增强爬虫能力,让原来复杂繁琐的规则定义被AI取代,让爬虫可以更智能地理解和解析网页内容,减少了对复杂规则的依赖。

项目地址:https://github.com/ScrapeGraphAI/Scrapegraph-ai

5
prompt

【开源免费】LangGPT 是一个通过结构化和模板化的方法,编写高质量的AI提示词的开源项目。它可以让任何非专业的用户轻松创建高水平的提示词,进而高质量的帮助用户通过AI解决问题。

项目地址:https://github.com/langgptai/LangGPT/blob/main/README_zh.md

在线使用:https://kimi.moonshot.cn/kimiplus/conpg00t7lagbbsfqkq0