人工智能

OpenAI让GPT-5.6左脚踩右脚 开始自己动手改造供自己运行的系统

字号+作者:量子位 来源:量子位 2026-07-30 15:56 评论(创建话题) 收藏成功收藏本文

OpenAI的RSI焚诀,它来了!就在老黄开推摇旗呐喊、呼吁开放权重之后,OpenAI也突然Open了起来~在最新技术报告中,他们老实交代了一部分RSI(AI递归自进化)心法:让GP'...

OpenAI的RSI焚诀,它来了!就在老黄开推摇旗呐喊、呼吁开放权重之后,OpenAI也突然Open了起来~在最新技术报告中,他们老实交代了一部分RSI(AI递归自进化)心法:让GPT-5.6左脚踩右脚,开始自己动手改造供自己运行的系统。iNr品论天涯网


iNr品论天涯网

据报告透露,GPT-5.6已经被投入OpenAI的真实生产环境,用来分析线上流量、调整请求路由,甚至亲自下场改写底层Kernel、优化推测解码模型。iNr品论天涯网

一套小连招下来,OpenAI的端到端服务成本降低了20%,Token生成效率也提升了15%以上iNr品论天涯网

而且,值得一提的是,在披露这套工程的五名作者里,还有大名鼎鼎的Triton之父PhilippeTilletiNr品论天涯网

2021年,OpenAI发布Triton1.0时,目标还是让不懂CUDA的人也能写出接近专家水平的GPU程序。iNr品论天涯网

五年后,GPT-5.6已经开始用Triton改写自己跑在GPU上的底层代码。iNr品论天涯网

从教人类写Kernel,到让模型给自己改Kernel,味儿确实越来越像RSI了。iNr品论天涯网


iNr品论天涯网


iNr品论天涯网

(你别说,也难怪翁荔回老东家。搞RSI,还得在OpenAI呐)iNr品论天涯网

RSI焚决,先从底层优化开始iNr品论天涯网

这件事之所以值得关注,就在于它已经有了几分RSI的味道。iNr品论天涯网

所谓RSI,也就是递归式自我改进,说白了就是:iNr品论天涯网

让AI进入一个“改进AI”的反馈回路——这一轮能力变强之后,再反过来加速下一轮升级。iNr品论天涯网

当然,GPT-5.6现在还远没有完全实现GPT自动训练下一代GPT的RSI。iNr品论天涯网

但它已经开始参与优化自己的运行环境:模型不仅是被工程师部署和调用的工具,也逐渐变成了改造模型系统本身的工程师。iNr品论天涯网


iNr品论天涯网

具体来说,它干了四件事。iNr品论天涯网

1、分析OpenAI真实的生产流量。iNr品论天涯网

GPT-5.6会寻找不同机器和服务节点之间的负载不均,并测试新的路由策略,把请求分配到更合适的位置。iNr品论天涯网

2、重写和优化生产Kernel。iNr品论天涯网

GPT-5.6会深入模型的forwardpass,寻找可以提前计算、省略或并行执行的部分,再通过Codex改写生产环境中的Triton和GluonKernel。iNr品论天涯网

3、优化自己的推测解码系统。iNr品论天涯网

GPT-5.6为自己的draftmodel设计方案,并自动运行数百次实验,测试不同的模型大小、结构和特征。iNr品论天涯网

在训练过程中,它还会持续监控实验,并在发生硬件故障或训练不稳定时主动介入。iNr品论天涯网

4、针对不同任务,自己寻找最优部署参数。iNr品论天涯网

面对短对话、长上下文、代码任务等不同负载,GPT-5.6会自动搜索batching、sharding和KVCache管理的更优组合。iNr品论天涯网

四件事连起来,GPT-5.6参与的已经不再是某个孤立的代码任务,而是一条真实的工程反馈回路:iNr品论天涯网

观察生产系统、寻找瓶颈、提出方案、运行实验、处理故障,再把有效改进部署回承载自己运行的系统。iNr品论天涯网

人类依旧站在圈里iNr品论天涯网

当然,RSI也没那么快,人类依旧站在圈里,也就是humanintheloop。iNr品论天涯网

GPT-5.6虽然开始参与改造自己,但优化目标、工具权限、评测指标,以及代码能否进入生产环境,仍然由人类决定。iNr品论天涯网

而且,模型内部省完了,模型外面还有大量重复开销。iNr品论天涯网

比如,ChatGPTWork和Codex执行复杂任务时,往往要不断经历:iNr品论天涯网

模型思考—调用工具—读取结果—继续思考。iNr品论天涯网

一次用户请求,背后可能循环十几轮甚至几十轮。iNr品论天涯网


iNr品论天涯网

假如一个任务需要调用模型30次,每次只额外浪费1秒,累计起来就是30秒。iNr品论天涯网

上下文、工具说明和历史结果也会在每轮循环中反复传输和计算。iNr品论天涯网

为此,OpenAI搭建了一层由Rust编写的AgentHarness,连接模型、工具和用户环境,专门减少Agent循环里的重复工作。iNr品论天涯网

这里最关键的有两项优化。iNr品论天涯网

1、延迟发现:别一上来就把所有工具塞给模型iNr品论天涯网

今天的Agent可以使用大量工具、Skill、插件和自定义MCP,但单个任务通常只需要其中很少一部分。iNr品论天涯网

OpenAI不再一开始就把所有说明书塞进上下文,而是在真正需要时,才向模型展示对应工具。iNr品论天涯网

工具返回的内容默认也被限制在1万Token以内,需要更多时,再由模型主动申请。iNr品论天涯网

2、只追加、不回写:让Prompt缓存一直有效iNr品论天涯网

Prompt缓存可以复用已经计算过的上下文前缀,但前提是这段前缀必须原样不动。iNr品论天涯网

因此,新的消息和工具结果只会接在上下文末尾,不再插回旧内容;工具保持固定顺序,审批和权限设置则留到执行阶段处理。iNr品论天涯网


iNr品论天涯网

这样一来,GPU可以直接复用此前的计算,只处理本轮新增的内容。iNr品论天涯网

可以说,一次循环可能只省一点,但当成千上万只Agent每天循环几十轮,省下来的就不再是一点。iNr品论天涯网

所以,这轮效率优化其实来自两股力量:一边是GPT-5.6开始帮助优化模型;另一边,是人类继续替模型清理运行环境里的重复劳动。iNr品论天涯网

人类依旧站在圈里,只是圈里的AI已经开始主动拿起扳手了。iNr品论天涯网

AI越好用,用得越多iNr品论天涯网

除了让GPT-5.6参与优化自身,OpenAI还在报告中透露了另一个细节:iNr品论天涯网

在GPT-5.6内部测试期间,每名活跃研究人员的日均输出Token,超过了GPT-5.5时期峰值的两倍。iNr品论天涯网

过去半年,OpenAI用于内部编程推理的研究算力占比增长了100倍,内部AgentToken用量也增长了约22倍iNr品论天涯网

这组数字当然不能直接证明,OpenAI的研究速度也提升了100倍。iNr品论天涯网

但它至少说明了一件事:iNr品论天涯网

AI一旦变得更便宜、更好用,它的用量不仅不会减少,反而会不断增加。iNr品论天涯网

参考链接iNr品论天涯网

[1]https://openai.com/index/gpt-5-6-frontier-intelligence-efficiency/iNr品论天涯网

[2]https://deploymentsafety.openai.com/gpt-5-6/introductioniNr品论天涯网

本网除标明“PLTYW原创”的文章外,其它文章均为转载或者爬虫(PBot)抓取; 本文只代表作者个人观点,不代表本站观点,仅供大家学习参考。本网站属非谋利性质,旨在传播马克思主义和共产主义历史文献和参考资料。凡刊登的著作文献侵犯了作者、译者或版权持有人权益的,可来信联系本站删除。 本站邮箱[email protected]