人工智能

SpaceXAI最强Grok 4.7发布 价格杀疯,跑分令人失望

字号+作者:机器之心 来源:机器之心 2026-09-22 13:49 评论(创建话题) 收藏成功收藏本文

今天一早,SpaceXAI最强模型Grok4.7来了。发布页开头只有一句极具“攻击性”的定位:面向编程与知识工作的最强模型,速度达到可比模型的两倍,价格只有一半。'...

今天一早,SpaceXAI最强模型Grok4.7来了。发布页开头只有一句极具“攻击性”的定位:面向编程与知识工作的最强模型,速度达到可比模型的两倍,价格只有一半。DMp品论天涯网


DMp品论天涯网

这次升级没有停留在跑分表上。Grok4.7换用了更大的基础模型,强化了长时间任务、自我检查和长上下文管理能力,并把文档、演示文稿、法律、医疗和工程等专业工作纳入重点测试。它瞄准的场景很明确:让模型在持续数小时的任务里少走弯路,交出可以直接使用的结果。DMp品论天涯网


DMp品论天涯网

马斯克发推表示,“Grok4.7在智能水平、运行速度和成本之间取得了很有竞争力的平衡。”DMp品论天涯网


DMp品论天涯网

长任务,成为这一代模型的主战场DMp品论天涯网

Grok4.7采用了比Grok4.6更大的基础模型。训练阶段延长了强化学习周期,任务组合也进一步加难,其中更多样本需要数小时才能完成。SpaceXAI称,新模型在检查自身工作、管理长上下文方面都有提升。DMp品论天涯网

这类改进直接对应当前编程智能体最棘手的问题。短代码生成往往只需要局部判断,真正复杂的软件任务却包含阅读仓库、拆解需求、修改多处文件、运行测试和反复纠错。模型能否在漫长执行链中保持目标、发现错误,通常比一次写出漂亮代码更重要。DMp品论天涯网

CursorBench4.0专门考察长时间编码任务。官方数据中,Grok4.7得分46.3%,Grok4.6为40.4%,提升5.9个百分点。在DeepSWEv1.1上,Grok4.7的高推理强度成绩为71.0%;Terminal-Bench4.0则从上一代的20.3%升至38.0%。DMp品论天涯网

据此将Grok4.7称为CursorBench4.0上价格与性能均处于前沿的模型。DMp品论天涯网


DMp品论天涯网

模型也被训练为原生理解GrokBot的运行框架。按照官方说法,这项调整改善了对话任务和通用知识工作表现。换句话说,Grok4.7的升级重点已经从单轮回答延伸到模型与工具、执行环境之间的持续协作.DMp品论天涯网

从写代码,走向完整的知识工作DMp品论天涯网

编程仍是Grok4.7最醒目的标签,但SpaceXAI给出的评测范围明显更宽。AABriefcase和GDPval关注的是专业人士日常完成的多步骤工作,覆盖律师、护士、金融分析师等岗位常见任务,也包括文档和演示文稿制作。DMp品论天涯网

在AABriefcasev1.1上,Grok4.7获得1657分,高于Grok4.6的1546分;GDPvalElo分数由1605升至1695。官方图表中,它在GDPval上接近Fable5.1的1735分,高于GPT-6Astra的1542分。SpaceXAI的结论是,Grok4.7在两项测试中均超过上一代,整体表现与其他前沿模型相当。DMp品论天涯网


DMp品论天涯网

专业领域的提升也出现在多个方向。EEBench得分由53.0%升至64.0%,HarveyLegalAgentBenchmark由15.8%升至19.6%,HealthBenchProfessional由48.5%升至56.7%。这些结果来自SpaceXAI公布的内部对比表,能够说明新旧两代模型之间的变化;跨模型比较仍会受到推理强度、工具配置和测试环境影响。DMp品论天涯网

这组成绩透露出一个清晰趋势:前沿模型的竞争正在进入“完成整项工作”的阶段。DMp品论天涯网

模型需要理解任务、调用工具、产出文件并自行复核,单一问答能力只是其中一环。Grok4.7延长训练任务时长,并强化自我验证,正是在为这类工作流补课。DMp品论天涯网

安全与价格DMp品论天涯网

能力提升之外,Grok4.7启用了一套全新的安全防护体系。SpaceXAI称,这是其测试过的模型中,在拒答与抵抗越狱方面表现最强的一款。DMp品论天涯网

在生物安全评测方面,Grok4.7以62.4%的成绩登顶LatchBio基准。网络安全测试HackerBenchv0.3主要覆盖高风险和恶意任务。按照官方数据,模型仅放行3.3%的高风险双重用途提示,同时很少误拦正常的安全研究请求。DMp品论天涯网

SpaceXAI还开始向少数网络安全合作伙伴开放邀请制红队能力,用于防御研究。目前,这项红队能力先以受控合作方式提供。DMp品论天涯网

标准版延续原价,快速版速度翻倍DMp品论天涯网

Grok4.7已经上线Cursor和GrokBuild,并通过GrokAPI、第三方编程框架、模型路由服务及云平台提供。标准版起价为每百万输入Token2美元、每百万输出Token6美元,与Grok4.6保持一致。DMp品论天涯网

价格策略让这次升级更具冲击力。开发者无需为换代支付额外的标准版Token成本,却能获得更强的长任务表现、自我检查能力和专业工作成绩。DMp品论天涯网

对编程智能体与知识工作产品而言,模型每次调用的单价固然重要,完成一项任务需要多少轮尝试、多少次返工,最终决定了真实成本。DMp品论天涯网

最后总结一波这次升级:DMp品论天涯网

从训练方式到评测组合,Grok4.7都在强化同一件事:长时间留在任务里,把复杂工作做完。编程只是最先成熟的入口,文档、演示、法律分析、临床推理和工程任务已经被放进同一套能力版图。DMp品论天涯网

但网友似乎并不买账,“这种模型居然也敢发布,简直差到不该发布。”只能挽尊地说,这次Grok4.7的卖点不是全面碾压竞品,它是用远低于部分旗舰模型的API成本,换来了相当接近、并在个别专业任务上领先的性能。DMp品论天涯网


DMp品论天涯网

参考链接:DMp品论天涯网

https://x.ai/news/grok-4-7DMp品论天涯网

https://x.com/ArtificialAnlys/status/2102074904560771365DMp品论天涯网

本网除标明“PLTYW原创”的文章外,其它文章均为转载或者爬虫(PBot)抓取; 本文只代表作者个人观点,不代表本站观点,仅供大家学习参考。本网站属非谋利性质,旨在传播马克思主义和共产主义历史文献和参考资料。凡刊登的著作文献侵犯了作者、译者或版权持有人权益的,可来信联系本站删除。 本站邮箱[email protected]