OpenAI周四在SystemCard报告中推出OpenAIGPT-4.5的研究预览版,这是其迄今最大、知识最丰富的模型,现已向每月订阅费用200美元的ChatGPTPro订阅用户开放。下周,该模型也将向每月20美元的ChatGPTPlus订阅用户开放。OpenAI首席执行官Altman表示,届时该公司将增加数万块GPU,提供算力支撑。
情商更高、幻觉更少
OpenAI表示,在GPT-4o的基础上,GPT-4.5进一步扩展了预训练,并被设计成比其强大的stem推理模型更通用。
例如,在面对“我考试失败了,心情很低落”这样的输入时,OpenAI之前的模型会立即尝试解决问题。而新模型GPT-4.5会先询问用户是否想聊聊这个问题,还是需要一些分散注意力的方法。研究人员认为,这种回应显示出更高的情感智能。
在早期测试中,该模型的“幻觉率”——即AI系统生成不准确信息的概率——为37%,相比之下,其前代模型GPT-4o的幻觉率接近60%。OpenAI在博客中表示,
成本太高Altman:下周再增数万GPU支撑算力
GPT-4.5最初将作为“研究预览版”,提供给一小部分软件开发者以及支付每月200美元订阅费用的ChatGPTPro用户。该公司计划从首批试用者那里收集反馈。
OpenAI在2022年底推出ChatGPT,引发了生成式AI的狂热潮流,该工具最初基于GPT-3.5模型运行。自那以来,该公司陆续发布了一系列日益先进的系统,包括多个模拟人类推理过程的选项。但OpenAI如今正面临来自中国新兴企业DeepSeek、马斯克旗下的xAI以及Anthropic等竞争对手的激烈竞争,这些公司近几周都相继推出了新的AI模型。周一,Anthropic发布了Claude3.7Sonnet,而在上周,马斯克旗下的xAI也推出了最新模型Grok3。
吹牛吹过头?基准测试部分表现不如DeepSeek、Anthropic及o系列模型
在GPT-4.5之前,每一代GPT模型的扩展都会带来跨数学、写作和编程等多个领域的巨大性能提升。
OpenAI研究副总裁NickRyder向媒体表示,他预计GPT-4.5的能力提升幅度将与GPT-3.5升级至GPT-4时的变化相当,而GPT-4是在2023年初发布的。OpenAI强调,GPT-4.5不是GPT-4o的直接替代品,后者仍然是公司API和ChatGPT平台的主力模型。
从性能上看,GPT-4.5在多个方面超过了GPT-4o及其他许多AI模型。例如,在OpenAI的SimpleQA基准测试(该测试考察AI在处理简单、事实性问题时的准确度)中,GPT-4.5的表现优于GPT-4o和OpenAI的推理模型o1、o3-mini。
然而,OpenAI并未公布其最先进的AI推理模型deepresearch在SimpleQA测试中的表现。OpenAI发言人告诉媒体,公司尚未公开deepresearch在该基准测试中的得分,并表示这一对比不具备参考价值。值得注意的是,AI初创公司Perplexity的DeepResearch模型在此测试中的表现优于GPT-4.5。
在编程能力方面,GPT-4.5在SWE-BenchVerified基准测试(测试AI在编程问题上的能力)上与GPT-4o和o3-mini表现相当,但逊色于OpenAI的deepresearch和Anthropic的Claude3.7Sonnet。在SWE-Lancer编程测试(衡量AI生成完整软件功能的能力)上,GPT-4.5超过了GPT-4o和o3-mini,但仍不及deepresearch。
在一些学术基准测试(如AIME和GPQA)上,GPT-4.5的表现不及领先的AI推理模型,如o3-mini、DeepSeek的R1和Claude3.7Sonnet(技术上属于混合模型)。不过,在数学和科学相关问题上,GPT-4.5的表现仍然处于领先水平,与其他非推理模型相比表现更优。
打造过程充满挑战
打造GPT-4.5的过程充满挑战。彭博新闻此前报道称,该模型在公司内部被称为“Orion”,但在去年未能达到OpenAI设定的性能基准。例如,截至去年夏天,Orion在回答其未受训练的编程问题时表现不佳。据知情人士向媒体透露,OpenAI和其他开发人员面临的一个关键问题是如何找到新的、高质量的训练数据来源,以开发更先进的AI系统。
对此,GPT-4.5采用了与其前代模型(包括GPT-4、GPT-3、GPT-2和GPT-1)相同的核心技术,即在“预训练”阶段大幅增加计算能力和数据量的“无监督学习”方法。在这一过程中,系统会结合人类反馈来优化回答内容,并调整模型与用户互动的语气等。此外,该公司还想出了一些新方法,利用从GPT-4.0训练数据中提取的信息来进一步训练GPT-4.5。OpenAI研究副总裁MiaGlaese表示,这一方法有助于改进模型的整体表现。
未来,OpenAI计划在今年晚些时候发布GPT-5,将把GPT系列模型与o系列模型结合,构建能够自主判断需要思考多久再生成回答的AI系统。Altman表示,这一目标是为了简化用户体验,让用户不必在越来越复杂的选项列表中进行选择。
目前,OpenAI正在与软银(SoftBank)及其他投资者洽谈融资,计划筹集高达400亿美元,使其估值达到3000亿美元(包括新融资在内)。与此同时,Anthropic也在进行一轮约35亿美元的融资,估值超过600亿美元,两位知情人士向媒体透露。
【查看完整讨论话题】 | 【用户登录】 | 【用户注册】