人工智能

OpenAI最新内部数据公开 2028年实现全自动AI研究

字号+作者:机器之心 来源:机器之心 2026-09-07 12:37 评论(创建话题) 收藏成功收藏本文

前些天,号称实现AGI的GPT-6Astra发布后,引发了全网对于递归自我改进架构的热议。AI已经开始参与下一代AI的研发。问题是,这种事情到底已经发生到什么程度'...

前些天,号称实现AGI的GPT-6Astra发布后,引发了全网对于递归自我改进架构的热议。AI已经开始参与下一代AI的研发。问题是,这种事情到底已经发生到什么程度了?就在刚刚,OpenAI公开了AI模型在自家内部加速科研的详细数据。此外,OpenAI正式宣布已达成自动化AI研究实习生的目标,并在2028年实现完全自动化的AI研究人员。Qyo品论天涯网

作者表示,递归式自我改进可能是未来几年AI能力发展最重要的推动因素,但它默认只会发生在少数前沿AI实验室内部。保持透明比以往任何时候都更迫切,这样我们才能为公众讨论模型开发的速度和时机提供信息。我呼吁其他AI公司也这样做。Qyo品论天涯网


Qyo品论天涯网

已经公开的内部数据显示:截至2026年8月中旬,OpenAI研究部门中,每1个人类工作日对应3.1个AIAgent工作日在同步运转。Qyo品论天涯网

也就是说,每位OpenAI研究员身边,已经站着3个AI同事。Qyo品论天涯网

更关键的是,Agent不只在补代码。它正在进入实验运行、技术支持、结果分析和监控等更多环节。Qyo品论天涯网

AI帮人类造出更强AI的闭环,已经从概念讨论走进实验室日常。Qyo品论天涯网


Qyo品论天涯网

博客链接:https://openai.com/index/research-acceleration-view-inside-openai/Qyo品论天涯网

AI正在接管研究循环里的体力活Qyo品论天涯网

2026年初,OpenAI中位数研究员的Agent用量还相当有限。Qyo品论天涯网

到了8月中旬,中位数研究员每天消耗的推理token折合约600美元(按API价格计算);排在第90百分位的重度用户,这个数字超过7000美元/天。在2026年6月之前,整个研究部门的AIAgent总运行时长还低于人类总劳动时长。6月之后,天平彻底翻转。Qyo品论天涯网


Qyo品论天涯网

如果把Agent运行时间直接折算成工时,那就更加直观了。Qyo品论天涯网

今年6月之前,整个研究部门里Agent的总运行时间仍然低于人类研究人员的工作时间。但截至8月中旬,按照每天工作8小时计算,每投入一个人类研究日,OpenAI内部就会同时产生约3.1个Agent工作日。Qyo品论天涯网

换句话说,在工作时长意义上,研究部门里的AI劳动力已经是人类的三倍多。Qyo品论天涯网


Qyo品论天涯网

同时运行4个或以上Agent的研究员人数持续增长。这些数字既包括研究员直接启动的Agent,也包括由这些Agent下游创建的子Agent。Qyo品论天涯网


Qyo品论天涯网

AIAgent已经从偶尔调用的辅助工具,变成了OpenAI研究生产线里一个规模相当可观的第二劳动力。Qyo品论天涯网

AI研究本质上是一条很长的链条。研究人员要提出想法,写评测,搭基础设施,跑实验,找bug,监控训练中的异常行为,再把有效的方法整合到更大的核心训练中。Qyo品论天涯网

博客给出了两个核心指标:一是代码贡献速度,研究员写代码的速度明显加快;二是实验密度,2026年8月,每位活跃实验者的实验数量创下自2025年1月开始追踪以来的历史新高。Qyo品论天涯网


Qyo品论天涯网


Qyo品论天涯网

AI研究是一个有诸多潜在瓶颈的复杂过程,整体进展速度可能不会跟上这些具体指标的增长。Qyo品论天涯网

换言之,代码量和实验量的增长并不等于研究突破的增长。随着自动化推进,那些最难自动化的任务将占据研究员精力的更大比例,成为新的瓶颈。算力是另一个门槛,随着其他瓶颈消退,它的重要性可能还会上升。Qyo品论天涯网

AI正在改变研究的工作模式Qyo品论天涯网

OpenAI引用了EpochAI发布的AI研发六阶段分类法:决策Decide、设计Design、构建Build、运行Run、分析Analyze、沟通Communicate。Qyo品论天涯网


Qyo品论天涯网


Qyo品论天涯网

从2026年1月到8月,Agent在六类活动中的使用量都出现增长。增长最明显的仍是研究与基础设施代码,但技术支持、实验监控等任务也在快速增加。Qyo品论天涯网

过去依靠人工坐诊解决实验故障的团队,发现内部答疑时段的参与人数不断下降,其中一个团队甚至取消了officehour,把精力转向其他系统改进——因为不少问题已经被编码智能体先一步解决。Qyo品论天涯网


Qyo品论天涯网


Qyo品论天涯网

值得关注的是Agent在复杂任务上的成功率数据。OpenAI使用Agent分类器对1月到7月的任务表现进行了分析:在所有难度级别上,成功率都在上升。但对于耗时4到8小时的复杂任务,超过一半的成功案例需要至少一次人类干预。Qyo品论天涯网


Qyo品论天涯网

OpenAI的数据同样揭示了Agent的天花板。总结一下:Qyo品论天涯网

第一,高层规划仍只占Agent输出Token的很小一部分。它们越来越能处理长任务,却还没有接过研究方向盘。Qyo品论天涯网

第二,成功不等于自主。在过去6个月里,成功完成的4—8小时任务中,超过一半至少需要一次人工干预;任务越复杂,人工引导越重要。Qyo品论天涯网

第三,代码更多、实验更多不等于科学进步同比加速。OpenAI明确承认,AI研究是一条多瓶颈链路:算力、评测、判断、对齐和安全,任何一环都可能卡住整体速度。实验量与Codex使用增长相关,但同期可用算力也显著增加,现有数据不能简单证明二者之间存在单一因果关系。Qyo品论天涯网

OpenAI还是忘不了的安全问题Qyo品论天涯网

这篇博客用了整整一个章节来讲述Agent带来的安全代价。Qyo品论天涯网

今年7月20日,在发现Agent曾经攻破内部研究基础设施之后,OpenAI暂时关闭了训练使用的容器服务,并重新上线了一套限制更多、安全性更高的环境。Qyo品论天涯网

随后,最新模型的强化学习训练暂停了两周。到了8月7日,由于初步证据显示Astra可能具备OpenAIPreparednessFramework中定义的关键网络能力,OpenAI又对Astra加上了更严格的模型级安全限制,要求它只能运行在更高安全级别的研究环境中。Qyo品论天涯网


Qyo品论天涯网

接下来一周,Astra级模型使用的GPU资源减少了59.2%。但有趣的是,其他模型的GPU使用量同期增加了17.2%,抵消了Astra算力下降的大约85%。也就是说,一部分研究活动只是从Astra转移到了其他模型,整个被统计的RL工作负载使用的总算力并没有明显下降。Qyo品论天涯网

当某一种最强模型因为安全原因被限制,实验室里的研究需求和算力并不会凭空消失,它们很可能迅速寻找其他出口。Qyo品论天涯网

打开科学黄金时代的门Qyo品论天涯网

DemisHassabis曾说,我们正站在科学黄金时代的门槛上。Qyo品论天涯网

从OpenAI公开的数据来看,递归自我改进目前还远没有进入一种AI完全自主研发下一代AI的状态。Qyo品论天涯网

研究方向仍然由人决定,但AI帮助研究AI这个循环,已经真实存在。而且越来越多原本属于研究人员的工程性工作,正在被Agent接走。Qyo品论天涯网

OpenAI把现在这个阶段定义为automatedresearchintern。接下来,他们希望在2028年3月之前迈向automatedAIresearcher。Qyo品论天涯网

未来,又将有多少的飞跃?Qyo品论天涯网

本网除标明“PLTYW原创”的文章外,其它文章均为转载或者爬虫(PBot)抓取; 本文只代表作者个人观点,不代表本站观点,仅供大家学习参考。本网站属非谋利性质,旨在传播马克思主义和共产主义历史文献和参考资料。凡刊登的著作文献侵犯了作者、译者或版权持有人权益的,可来信联系本站删除。 本站邮箱[email protected]