OpenAI发布GPT-4.5:情商升级,幻觉减少,但编程和学术仍有局限
OpenAI于2月28日正式推出了其最新AI语言模型GPT-4.5,作为研究预览版在使用。该模型首先向开发者和ChatGPT Pro订阅用户开放,并计划在未来一周逐步向ChatGPT Plus和其他用户群体推广。
OpenAI称,早期测试表明,与GPT-4.5的互动比之前的模型更加自然。它的知识库更为广泛,并且具备更强的用户需求理解能力。特别是在提高书写、编程和解决实际问题等方面表现优异。此外,该模型的情绪识别和回应更加有同理心,使得与用户的对话显得更温暖而直观。

此次发布的GPT-4.5在计算效率上比GPT-4提升了10倍以上。它在模式识别、建立关联和创意生成方面表现出更强的能力,特别是在减少“幻觉”(生成错误信息)现象方面有显著进步,这使它在处理事实性问题时更加可靠。
尽管如此,OpenAI明确表示,GPT-4.5并不是前沿模型。它并未引入新的前沿功能,在某些准备度能力评估中也不及o1和o3-mini等模型。该模型被定位为OpenAI目前最大、但并非最强的模型,因此在开放API服务时的成本也是一个考虑因素。目前,该模型的API使用非常昂贵,输入和输出的标记费用分别为75美元和150美元每百万单位,是GPT-4o价格的30倍。OpenAI正在评估是否长期支持GPT-4.5的API服务。

在发布会上,OpenAI的首席执行官Sam Altman指出,GPT-4.5是一种非常庞大且计算密集的模型,GPU的短缺也限制了公司的扩展能力。他表示,下一周将增加数万个GPU,以支持更多用户的使用需求,但即便如此这也不尽理想。
尽管成本高昂,GPT-4.5在各大基准测试中表现卓越。在多人对话测试中,GPT-4.5的表现优于OpenAI的所有非推理模型。在淘汰赛基准测试中,GPT-4.5凭借社交推理、策略和欺骗能力的考试,获得了得分排名第一的位置。而在SimpleQA基准测试中,GPT-4.5展示了最低的幻觉率,使得它在事实性问题处理上具备更高的可靠性。

不过,OpenAI也承认,GPT-4.5在某些基准测试中的表现不如DeepSeek和Anthropic的新推理模型。在多个高难度测试中,GPT-4.5的性能不如OpenAI最新的推理模型,如deep research和Anthropic的Claude 3.7 Sonnet。
GPT-4.5除了在情商和内容生成方面表现出色,也是一个强大的协作伙伴。通过无监督学习提升智商,并结合人类反馈的强化学习,让GPT-4.5在多个领域,如写作、编程等上都有显著进步。它不仅能生成更加连贯、符合用户需求的内容,还展现出强大的创意写作能力和高情商回应。
Altman还透露,GPT-4.5将成为OpenAI最后一个不具备思维链推理的非推理模型。未来的模型如GPT-5,将整合更多先进技术,包括深度推理模型,并计划于今年稍晚发布,旨在提高用户体验,使其不再需要在复杂选项中做选择。

GPT-4.5的发布也标志着OpenAI与其他AI开发公司如DeepSeek和Anthropic的竞争进一步加剧。虽然每家公司都在加大投资和研发力度,但CGT-4.5的发布无疑是OpenAI在广泛应用和用户体验上显著推进的一步。
GPT-4.5是OpenAI迄今为止最大的语言模型,其在处理用户交互和内容生成方面的显著提升,尤其是在情绪回应和跨数据中心的训练效率上,均表现出色。然而,高昂的运行成本和GPU资源的紧张使未来的推广和长期服务成为挑战。GPT-4.5的发布不仅是一个技术的进步,更是对AI模型应用广度和深度的一次探索。
