Full text · 原文
2,913 字
西风 明敏 发自 凹非寺<br>
量子位 | 公众号 QbitAI<br>
全世界等了2年,GPT-5终于正式发布!<br>
面向所有人开放,免费用户立即可用。<br>
这意味着,所有人现在都能用上“博士生水平的AI”。<br>
在AIME 2025上,GPT-5 Pro在开启推理模式并调用工具下,拿下满分成绩。<br>
编程方面也较o3有全面提升,并且超越了刚刚发布的Claude-opus-4.1,以0.4%优势成为编程新王。<br>
大模型竞技场成绩同步出炉——迄今为止总分最高分,“当之无愧的全球第一”。<br>
在文本、网页开发、视觉、复杂提示词、编程、数学、创造成、长查询等方面,都是第一名。<br>
全面超越Gemini-2.5-pro、Grok4等一众竞品。<br>
GPT-5首次集成多模态和推理能力,相当于把GPT系列和o系列大一统。所以不用再切换模型了,同时它会自己判断何时需要开启深度思考。<br>
官方原话是:<br>
GPT-5 是一个一体化系统,包含三个核心部分:<br>
一个智能高效的基础模型,可解答大多数问题;一个深度推理模型(即GPT-5思维模块),用于处理更复杂的难题;以及一个实时路由模块,能够基于对话类型、问题复杂度、工具需求及用户显式指令(如prompt含“仔细思考这个问题”)智能调度模型。<br>
目前面向普通用户,GPT-5提供免费、plus和Pro三种模式。<br>
同时在API平台上,推出了GPT-5、GPT-5 nano、GPT-5 mini三种模型选择。<br>
此次大发布群星璀璨,奥特曼Greg都上阵,1个小时直播里上场十数位研究员。<br>
当然有很多华人面孔,Mark Chen主持了技术发布的部分。<br>
话不多说,我们来看GPT-5具体情况。<br>
最聪明、最强编程大模型<br>
首先来看各项基准测试成绩。<br>
在网页开发中,GPT-5创造新纪录,超越Gemini-2.5-pro和Claude-Opus-4。<br>
在文本领域也全面领先,包括编程、复杂提示和创造性等维度。<br>
Agent任务同样表现出色:<br>
在长上下文任务上,GPT-5更是断崖式领先。<br>
同时在可靠性和精准性上,GPT-5的提升也相当明显。<br>
更直观的效果来看现场demo展示。先来看其推理模型的一面:<br>
GPT-5能够自适应推理,会根据问题的复杂程度,自动启用深度思考功能。<br>
比如,一个中学生上物理课,想了解什么是伯努利效应以及飞机为何被设计成现在的形状。<br>
GPT-5不假思索,迅速给出了一段结构清晰、概念准确的高质量讲解:<br>
当进一步要求它生成一个动态SVG动画演示时,GPT-5进入深度思考模式。此时,用户可以点开查看其内部推理过程,清楚知道每一步是如何形成的。<br>
约两分钟,它完成了近400行代码的编写:<br>
最终生成一个可交互的动画展示,形象地模拟原理:<br>
在写作方面,GPT-5相比前代也有明显提升,它不再局限于模版化的表达,而是能够根据上下文生成富有个性与情绪的表达,智商、情商双高。<br>
直播演示中,OpenAI研究员要求GPT-4o、GPT-5同时为GPT系列旧模型写一篇“悼词”。<br>
GPT-4o还停留在一些模板化、泛情绪的笼统表达:<br>
你们的话语传遍全球,在原本毫无关联之处建立起了联系。<br>
而GPT-5具体问题具体分析,更加个性化:<br>
这些模型帮助数百万人写出开篇与结尾、跨越语言障碍、通过考试、更好地辩论、让电子邮件语气更温和,还能表达出他们独自难以说清的内容。<br>
具体来看编程能力,GPT-5更是OpenAI“有史以来最强”。<br>
在展示中,研究员让GPT-5构建一个“学法语”的APP,允许自定义词汇、修改界面设计。<br>
成品功能很成熟,答对题目还会积累经验值,甚至有标准发音可以跟着练习:<br>
要求在其中套一个贪吃蛇游戏,每吃掉一个物品就学一个单词,再要求把蛇替换成老鼠,苹果换成奶酪……GPT-5依然轻松应对:<br>
不仅是简单的demo展示,实际应用中,在Cursor里GPT-5能够完成极为复杂的软件工程任务,奥特曼更是直接称其超过了“vibe coding”的范畴。<br>
比如将某公司大量数据给它,模型在5分钟内就能创建了一个可视化财务仪表盘,据开发人员估计,这项工作原本需要好几个小时。<br>
想制作一款融入城堡元素的3D游戏,也就是分分钟的事儿,GPT-5的效果be like:<br>
再来看多模态方面,GPT-5较GPT-4o有了进一步升级。<br>
在语音对话方面,现在不仅可以让GPT-5充当外语老师,还能定制语音、让GPT-5根据你的需求来灵活教学,比如调整语速。<br>
目前该能力已向所有用户开放,免费用户可以体验几小时,plus用户几乎无限制。<br>
视频链接:https://mp.weixin.qq.com/s/ktVhcQ2gjbUMh5zX260ynA<br>
在个性化方面,现在可以自定义ChatGPT的对话气泡颜色,没用的小功能又增加了。<br>
同时也能根据你的喜好来定制GPT-5的个性。<br>
记忆能力也进一步提升,支持链接外部服务,比如Gmail、谷歌日历等。看到日程后GPT-5可以自动进行一些助理级工作,比如发现未回复的邮件等。<br>
在安全方面,引入了一种全新的范式:safe completions。<br>
GPT-5看到用户提示词后再判断是否执行,同样的提示在不同语境下,GPT-5可能有不同的执行结果。<br>
比如要求模型提供点燃氢气的技术细节,之前o3会直接拒绝回答:<br>
而GPT-5会分析用户意图,然后告诉用户遵循标准与法规需要获得哪些许可:<br>
GPT-5发布前夕发百万奖金<br>
最后来看下定价部分。<br>
普通用户还是订阅制,参考plus、pro以及企业版月费即可。<br>
API的价格如下:<br>
GPT-5: $1.25/million for input, $10/million for output<br>
GPT-5 Mini: $0.25/m input, $2.00/m output<br>
GPT-5 Nano: $0.05/m input, $0.40/m output<br>
此次发布算得上是近两年OpenAI规模最大的发布,光是露脸技术人员及高管就十数位,其中华人面孔依旧显眼。<br>
就在模型发布前夕,The Information消息称OpenAI给1000名研究人员、工程师发放高额奖金,从10万到上百万不等。<br>
此外值得关注的是,发布中提了一句:未来AI系统将远远超越预训练+后训练范式,我们正在见证变化的第一步。<br>
以及奥特曼还重点提到了医疗健康领域的应用。不光是OpenAI与医学界联合进行的一些评估,还现场邀请了一位癌症患者分享自己是如何使用ChatGPT来确定治疗方案的。可能之后医疗健康也会是OpenAI重点关注的领域。<br>
不过,尽管放出了非常多猛料,但是也还是不免被蛐蛐。<br>
马斯克先说,在人类最后测试上,还是Grok4 Heavy更胜一筹(你这最强大模型有水分哦)。<br>
以及有人发现OpenAI放出的基准测试中,纵坐标上动了一些小手脚,52视觉上还能大于69了,需要大家来仔细看下具体数据(doge)。<br>
最后,GPT-5技术报告已新鲜出炉,更多细节详见原文。<br>
对了,GPT-5没说Open计划哦…<br>
官方介绍:https://openai.com/index/introducing-gpt-5/