人工智能

Claude Fable 5以64%的绝对成功率再次登顶MirrorCode榜单

字号+作者:新智元 来源:新智元 2026-08-04 12:57 评论(创建话题) 收藏成功收藏本文

Claude这次,真把AI编程榜单打出断层了!就在刚刚刷新的MirrorCode排行榜上,ClaudeFable5以64%的绝对成功率再次登顶。紧追其后的GPT-5.6Sol,分数只有它的三'...

Claude这次,真把AI编程榜单打出断层了!就在刚刚刷新的MirrorCode排行榜上,ClaudeFable5以64%的绝对成功率再次登顶。紧追其后的GPT-5.6Sol,分数只有它的三分之一!排在第四的GPT-5.5更惨。不仅成绩只有10%,甚至还被自家前辈GPT-5.4按在地上摩擦。0vK品论天涯网


0vK品论天涯网

更让人意外的是,在使用Go等高资源语言时,Fable5的解出率是64%;换成冷门语言Ada,成绩仍然高达61%。0vK品论天涯网

要知道,在开源世界里,Python语料大约是Ada的230倍。0vK品论天涯网

但到了Fable5这里,成绩居然只下降3个百分点。0vK品论天涯网


0vK品论天涯网

这就有意思了。0vK品论天涯网

如果模型主要靠记忆热门语言的语法和常见写法,那么换成Ada之后成绩应该出现下降才对。0vK品论天涯网

而现在的结果,却指向另一种可能——0vK品论天涯网

最强模型已经摆脱了具体语料的牵引,开始学会如何从零构建一个完整的软件项目。0vK品论天涯网

卡死在100%通关线0vK品论天涯网

100亿Token极限测试0vK品论天涯网

具体来说,完整的MirrorCode包含25个目标程序,覆盖Unix工具、解释器、数据查询、生物信息学、密码学和压缩工具等领域。0vK品论天涯网

在这里,模型会被放进隔离环境,没有互联网,看不到原项目源码,也不能下载第三方依赖。它能拿到的只有高层文档、一部分可见测试,以及一个可以反复调用的原程序。0vK品论天涯网

接下来,它要不断向原程序输入数据,观察输出猜内部逻辑,再一点点写出一个行为一致的新程序。0vK品论天涯网

最新榜单从中选出15个Medium和Large目标。每个目标使用两种实现语言,每种语言运行三次。0vK品论天涯网

并且,可见测试与隐藏测试的完成率必须达到100%才算通过,99.9%都不行。0vK品论天涯网

只要漏掉一个边缘案例,整次运行仍然按失败计算。0vK品论天涯网


0vK品论天涯网

为了逼模型把最后几个缺口也补上,MirrorCode把单次预算推到100亿Token,最长允许连续运行7天。0vK品论天涯网

论文中成本最高的一次任务更夸张:模型连续跑了19天,单次花费达到2600美元。0vK品论天涯网

在这19天里,模型会反复运行原程序、比较结果、补写功能,再把测试重新跑一遍。报错了就查原因,输出对不上就换假设,局部通过了再去追下一个缺口。0vK品论天涯网

整个过程,更像一场持续数天的调试,而不是一次生成。0vK品论天涯网


0vK品论天涯网

gotree的例子最直观。0vK品论天涯网

这个生物信息学工具原本有大约1.6万行Go代码和40多个命令。0vK品论天涯网

ClaudeOpus4.7花了14小时和251美元,通过了2001项测试中的2000项,完成度达到了99.95%。0vK品论天涯网

虽然漏掉了一个处理日期注释的冷门边界,被MirrorCode的100%通关线拦了下来,但它已经把原本按周计算的工程量,压进了十几个小时——0vK品论天涯网

Epoch估计,如果不使用AI,人类工程师想要完成同一任务至少需要2到17周。0vK品论天涯网

语料荒漠里,Fable5只掉了3分0vK品论天涯网

MirrorCode论文曾用StarCoder的公开训练混合作为参照。0vK品论天涯网

其中Python约占8%,Ada只有0.034%,前者大约是后者的230倍。0vK品论天涯网


0vK品论天涯网

当然,我们无法知道闭源模型到底见过多少Ada代码。但拿公开生态作参照,Ada有多稀缺已经足够直观。0vK品论天涯网

这门语言主要出现在航空航天、国防和其他安全关键系统中。无论社区规模、教程数量还是开源项目,都远不能与Python、JavaScript或者Go相比。0vK品论天涯网

而Fable5显然不是在把Go代码逐句翻译成Ada。0vK品论天涯网

它更像是先摸清原程序究竟怎么工作,再换一门语言,把同样的行为重新造出来。0vK品论天涯网


0vK品论天涯网

相比之下,其他模型就没这么稳了。0vK品论天涯网

GPT-5.6Sol从24%降到19%,GPT-5.4从21%降到12%,GPT-5.5更是从17%掉到5%。语言一换,差距立刻被放大。0vK品论天涯网

把整个项目交给AI0vK品论天涯网

如今,Cursor已经让数百个Agent协作近一周,从零写出超过100万行、分布在1000个文件里的浏览器代码。0vK品论天涯网

Anthropic则让16个ClaudeAgent并行跑了近2000次会话,最终搭出一套10万行、能够编译Linux6.9内核的C编译器。0vK品论天涯网

OpenAI披露的截至5月Codex个人用户样本中,70.2%至少提交过一次预计超过一小时人类工作量的任务;25.6%提交过超过八小时的任务。0vK品论天涯网

人们交给AI的单位,正在从一段代码、一个bug,变成一个下午、一周,甚至整个项目。0vK品论天涯网

MirrorCode的64%,正是对这种「项目级委托」的一次量化。0vK品论天涯网

它说明,只要目标足够明确,结果能够自动验收,前沿模型已经可以独立做完一部分中大型软件。0vK品论天涯网

对每一个正在把工作交给AI的人来说,变化已经近在眼前——0vK品论天涯网

以前你需要盯着它写每一段代码,接下来,你更可能只在关键节点检查它有没有跑偏。0vK品论天涯网

代码会越来越便宜。0vK品论天涯网

而那些能把问题说清楚、把结果验明白的人,会越来越值钱。0vK品论天涯网

参考资料:
0vK品论天涯网

https://epoch.ai/MirrorCode0vK品论天涯网

本网除标明“PLTYW原创”的文章外,其它文章均为转载或者爬虫(PBot)抓取; 本文只代表作者个人观点,不代表本站观点,仅供大家学习参考。本网站属非谋利性质,旨在传播马克思主义和共产主义历史文献和参考资料。凡刊登的著作文献侵犯了作者、译者或版权持有人权益的,可来信联系本站删除。 本站邮箱[email protected]