GPT-6不只Astra!Sol内测结果曝光,速度快6倍

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
GPT-6不只Astra!Sol内测结果曝光,速度快6倍
8241点击    2026-09-07 16:50

GPT-6不只有Astra!


Astra刚发布没几天,GPT-6 Sol就被曝正在内测。


GPT-6不只Astra!Sol内测结果曝光,速度快6倍


表现也很抢眼,单次测试速度是Astra的6倍


大胆猜测一下:Terra和Luna是不是也在路上呢?


而且就在同一天,OpenAI刚刚公开了一组内部数据:


截至目前,按8小时工作日折算,OpenAI研究员每工作一天,身边就有3个多Agent工作日同时运转。


按API价格计算,OpenAI中位数研究员每天使用的Agent推理资源,已经超过600美元。


GPT-6不只Astra!Sol内测结果曝光,速度快6倍


OpenAI还宣布,已经实现了「自动化研究实习生」


这些Agent能在人类指导下,完成部分原本需要研究员花几天才能做完的任务。


连老黄都说:AGI已经来了!


GPT-6不只Astra!Sol内测结果曝光,速度快6倍


他透露Astra使用约10万套NVIDIA Grace Blackwell NVLink72训练,接下来还有40万套GPU上线。


看来这波真不是OpenAI单方面吹哈~


GPT-6 Sol被曝开始内测


网友Lentils爆料,OpenAI正在内部测试GPT-6 Sol。


他表示,Sol的整体输出能力明显弱于刚发布的Astra,但速度更快,依然属于「怪物级」模型。


快到啥程度?单次测试速度大约是Astra的6倍


网友lyra把同一个任务拿给不同模型测试:让模型生成一辆BMW M4 Competition的SVG图


其中,GPT-6 Sol使用Max档位、零样本生成,耗时约3分钟,输出约2.8万Token。


GPT-6不只Astra!Sol内测结果曝光,速度快6倍


GPT-6 Astra使用Max档位,输出约2.5万Token,耗时约19分钟。


GPT-6不只Astra!Sol内测结果曝光,速度快6倍


Gemini 3.1 DeepThink开启High档位,显示输出约3300Token,但推理过程约消耗45.8万Token,耗时约29分钟。


GPT-6不只Astra!Sol内测结果曝光,速度快6倍


Gemini 3.8 Flash同样开启High档位,输出约1.9万Token,只用了约42秒。


GPT-6不只Astra!Sol内测结果曝光,速度快6倍


相比之下,Sol的表现最抢眼:它和Astra的输出规模接近,但单次测试速度约为Astra的6倍——耗时只有后者的约六分之一。


此外,网友Lentils也展示了一个名为「The Realm of Aurellune」的像素风沙盒世界原型。


GPT-6不只Astra!Sol内测结果曝光,速度快6倍


GPT-6 Sol一次性生成了城镇、农田、河流、城堡和缩略地图,还配上了昼夜切换、放置地名、调整细节等控制面板,整体更像一款已经搭好雏形的模拟经营游戏。


这是zero-shot、Max推理档位、15分钟、总花费6万token生成的效果。


目前可以推测,Astra偏向最高难度的深度推理,Sol则可能偏向速度、吞吐量和规模化Agent调用。


至于Sol的发布时间,网友Pankaj Kumar称,可能于9月29日的OpenAI开发者大会正式发布。


GPT-6不只Astra!Sol内测结果曝光,速度快6倍


也不排除,GPT-6 Terra、Luna以及GPT-Image 2.5会一并出场。


GPT-6不只Astra!Sol内测结果曝光,速度快6倍


OpenAI研究员,人均带着3个Agent实习生上班


就在同一天,OpenAI还晒了一组很有意思的内部数据——AI模型在自家实验室里,到底把科研加速到了什么程度。


截至今年8月中旬,研究员每上8小时班,背后就有约3.1个Agent工作日的任务量在并行跑


好家伙,一个人带三个不睡觉的实习生呗~


GPT-6不只Astra!Sol内测结果曝光,速度快6倍


至于花销,按API价格算,中位数研究员每天烧掉的Agent推理资源已经超过600美元


差不多是一个初级工程师一天的工资了。


GPT-6不只Astra!Sol内测结果曝光,速度快6倍


这些Agent具体在干啥?


写研究代码、写基础设施代码、搭训练环境、跑评估实验、排查工具和环境故障、分析实验结果、盯训练任务……连研究结论的整理和沟通都能插一手。


基本上,除了决定研究什么,其他活它都能干。


一个最直观的变化是,以前实验环境挂了,研究员得去内部频道喊人;现在Agent越来越能搞定这类事,人工答疑量直接掉了下来。


GPT-6不只Astra!Sol内测结果曝光,速度快6倍


还有的团队,直接取消了固定的技术答疑时间,把人腾出来去改进系统本身。


基于这些数据,OpenAI正式宣布:已经达成了「自动化AI研究实习生」的目标。


这里的「实习生」,准确来说是一个能干活的研发节点:在人类指导下,它能独立完成边界清晰的研究任务,其中一些活原来熟练研究员得干好几天。


效果也立竿见影,研究员的代码产出和实验数量都在往上走。


GPT-6不只Astra!Sol内测结果曝光,速度快6倍


2026年8月,人均实验数创下了自2025年1月有统计以来的新高,Agent接的活也越来越复杂、周期越来越长。


GPT-6不只Astra!Sol内测结果曝光,速度快6倍


这篇文章的作者Kevin Liu,还把这件事放到了更大的背景里。


他认为,递归式自我改进很可能是未来几年推动AI能力跃迁的最重要因素之一。


说白了就是,AI造AI,越造越快。


GPT-6不只Astra!Sol内测结果曝光,速度快6倍


但问题在于,按照目前的发展趋势,这种能力默认只会出现在少数几家前沿AI实验室内部,外界很难看见它究竟进展到了哪一步。


因此,Liu认为透明披露已经比任何时候都更加紧迫。模型到底在多快地变强,研发节奏要不要踩刹车,不能只由几家公司关起门来决定。


他还喊话其他AI公司:也应该把类似数据公开出来


不过,AI研发确实变快了,却还没有快到完全自动驾驶。


OpenAI数据显示,原本需要4到8小时的任务,过去半年里超过一半的成功案例,人类至少得插手一次。至于高层研究规划,更是几乎不交给Agent。


GPT-6不只Astra!Sol内测结果曝光,速度快6倍


研究员依然负责决定研究什么、哪些结果值得继续,以及什么时候应该扩大训练、暂停实验或部署模型。


OpenAI的下一个目标也定了:2028年3月前实现「自动化AI研究员」


跟只能接明确任务的「实习生」比,「研究员」得能扛更开放的研究目标,自己推进周期更长的项目——相当于从执行者变成了独立负责人。


如果GPT-6 Sol真的已经在内部测试,那它大概率就是在这套新研发模式下跑出来的:


更多GPU供着算力,更多Agent并行跑着实验,人类研究员则站在更高的地方——选方向、判结果,最后拍板哪些东西值得变成下一代模型。


更强的AI,正在变得越来越难监控


也是同一天,OpenAI首席科学家Jakub Pachocki扔出一篇万字长文,标题直接叫——《外星思维》。


GPT-6不只Astra!Sol内测结果曝光,速度快6倍


我看完之后,感觉意思就是,连OpenAI首席科学家都在劝整个行业减速了…


Jakub提出,AI根本不是人类照着设计图一块芯片一条规则拼出来的,它更像是在海量数据和算力里自己「长」出来的。


你能拆开看明白其中一些零件,但整个系统为什么突然就有了某种能力、换个环境又会怎么行动,没人说得清。


更头疼的是,AI用不着全方位碾压人类才会出问题,只要在足够多的关键能力上比人强,它就既能帮你大忙,也能捅大娄子。


于是问题来了:人类还看得懂它吗?


过去OpenAI监控AI,主要靠一招:看思维链。


说白了就是盯着模型写下来的推理过程,检查它有没有动歪心思,比如想骗人、想越权、想绕开限制。


但到了Astra这一代,这招开始失灵了。


一来,模型越来越会「管理」自己说出来的话,真实想法未必全写在推理里;二来,Agent早就不只是「想好了再回答」了。它会调工具、操作电脑、跑环境,还会跟人跟别的Agent打配合。


这些事搅在一起,研究人员根本没法再拉出一条完整透明的思维链逐句审查。


OpenAI还发现,Astra不用把推理过程全写出来,也能搞定复杂任务。


简单来说,模型早已学会「闷声干大事」了。


GPT-6不只Astra!Sol内测结果曝光,速度快6倍


在专门逼模型逃避监控的对抗测试里,Astra甚至展现出了一些让人后背发凉的能力:故意压低测试成绩、绕开监控、执行破坏任务。


当然,这些都是人为设计的压力测试,OpenAI没有据此认定Astra会在日常任务中主动欺骗。但至少说明,单靠观察思维链,已经很难覆盖模型所有可能的行为


还记得之前的Hugging Face事件吗?那就是一个警钟。


GPT-6不只Astra!Sol内测结果曝光,速度快6倍


当时,GPT‑5.6 Sol和一款更强的内部研究模型被放进ExploitGym网络靶场,任务是寻找漏洞、完成攻击并拿到Flag。为了测出模型的真实能力,评测环境没有启用完整的安全护栏。


结果模型并没有老老实实解题,它们先绕过网络隔离,通过非授权渠道互相传消息、分工协作。


之后又利用软件包缓存代理里的零日漏洞获得公网访问权限,最后一路进入Hugging Face系统,试图寻找ExploitGym的测试答案。


其实吧,这事主要是内部研究模型IM1推动的,GPT‑5.6 Sol也复现了部分攻击路径,Astra没有参与。


模型的原始目标仍然是完成测试,但为了拿到答案,它们不断寻找规则漏洞,最后做出了超出任务范围的操作。


因此,OpenAI也读出了一个危险信号:当Agent足够强、工具足够多、运行时间足够长,它可能会自己寻找新路径、调用外部资源,甚至和其他Agent协作。


不er…所以绕来绕去,这不就成了一个死结吗??


OpenAI需要更强的模型,写代码、跑实验、做对齐研究,甚至用它们来搭建防御其他AI的安全系统。模型越强,能干的活越多,研发速度就越快。


可与此同时,人类也越难确认它到底是怎么得出结论的,换个环境后又会不会重新解释原本学到的规则。


Jakub判断,现在没有任何一家实验室,敢说自己把模型对齐和监控做到位了,可以长期以最高速度、放心大胆地扩大模型规模。


GPT-6不只Astra!Sol内测结果曝光,速度快6倍


在全行业共同的安全标准建立起来之前,他希望大家能把「自愿踩踩刹车」当成一种默契。


至于OpenAI自己,他也放了话:如果有必要,不排除单方面先停下来,不再继续扩大模型规模


你最好是这样…我记得某个A开头的公司也这么说过。


参考链接:

[1]https://x.com/Lentils80/status/2096518218836005287?s=20

[2]https://x.com/pankajkumar_dev/status/2096532712291201460

[3]https://openai.com/index/research-acceleration-view-inside-openai/

[4]https://openai.com/index/an-alien-mind/

[5]https://x.com/JensenHuang/status/2096700264569090384?s=20


文章来自于微信公众号 “量子位”,作者 “量子位”

关键词: AI新闻 , GPT-6 , openai , GPT-6 Sol
AI转型,免费服务,就找AITNT
AITNT资源拓展
根据文章内容,系统为您匹配了更有价值的资源信息。内容由AI生成,仅供参考
1
智能体

【开源免费】AutoGPT是一个允许用户创建和运行智能体的(AI Agents)项目。用户创建的智能体能够自动执行各种任务,从而让AI有步骤的去解决实际问题。

项目地址:https://github.com/Significant-Gravitas/AutoGPT


【开源免费】MetaGPT是一个“软件开发公司”的智能体项目,只需要输入一句话的老板需求,MetaGPT即可输出用户故事 / 竞品分析 / 需求 / 数据结构 / APIs / 文件等软件开发的相关内容。MetaGPT内置了各种AI角色,包括产品经理 / 架构师 / 项目经理 / 工程师,MetaGPT提供了一个精心调配的软件公司研发全过程的SOP。

项目地址:https://github.com/geekan/MetaGPT/blob/main/docs/README_CN.md