OpenAI o3:迄今为止最强大的推理人工智能模型
OpenAI 的 o3 模型创下了推理基准的新记录,在复杂的数学、编码和科学任务上超越了人类专家,标志着人工智能能力的新时代。
什么是 OpenAI o3?
OpenAI o3 是该公司最先进的人工智能推理模型,于 2025 年初发布。与逐个生成响应的标准大型语言模型不同,o3 采用了一种新颖的“测试时计算”方法——在提供答案之前花费更多的处理时间“思考”问题。这使得该模型能够解决之前困扰人工智能系统的复杂推理挑战。
o3 系列包括两个变体:完整版 o3 模型经过优化,可在困难任务中实现最大准确度,以及 o3-迷你,一个更小、更快、更具成本效益的版本,专为日常编码和推理任务而设计。
基准测试结果
o3 的基准性能给人工智能研究界带来了冲击:
- ARC-AGI(抽象和推理语料库): o3 得分 87.5% 在高计算模式下——相比之下,任何人工智能系统之前的最佳成绩约为 55%,而人类的平均得分为 85%。这被广泛认为是对人工智能通用智能最难的测试。
- AIME 2024(数学奥林匹克): o3 解决了 96.7% 的问题数,相比之前的 GPT-4o 分数提高了 13%。
- SWE-bench(软件工程): o3 已解决 71.7% 真实世界 GitHub 问题的比例 — 高于 o1 的 49%,远远超出早期模型。
- MMLU(常识): o3 在科学、法律、历史和医学领域的准确率超过了 90%。
这些分数不仅代表了人工智能解决问题能力的渐进式进步,而且代表了质的飞跃。
o3 的工作原理
o3 建立在 OpenAI 的“思想链”推理框架之上,该框架在产生最终答案之前,模型会生成内部推理步骤(本质上是大声思考)。关键的创新在于 自适应计算:模型可以根据问题的难度花费或多或少的“思考时间”。
实际上,这意味着 o3 可以:
- 将复杂的数学问题分解为数十个子步骤并验证每个子步骤
- 在选择最佳的之前生成并测试多个代码实现
- 跨学科交叉引用科学概念以形成准确的结论
权衡是速度和成本——与 GPT-4o 等更快的模型相比,高计算 o3 的每次查询时间可能要长得多,成本也更高。 OpenAI 的 o3-mini 变体通过以一小部分计算成本提供大部分推理增益来解决这个问题。
供货情况和定价
OpenAI 已通过其 API 和 ChatGPT Pro 订阅提供 o3 和 o3-mini。关键接入点包括:
- API访问: 开发人员可以通过 OpenAI 平台使用,定价基于输入/输出代币和所选的计算级别。
- ChatGPT 专业版: Pro 订阅者(200 美元/月)可以优先访问 o3 来执行复杂任务。
- o3-迷你: ChatGPT Plus 用户可以通过 API 以显着降低的成本使用,非常适合编码帮助和日常推理。
OpenAI 表示,尽管该公司随着采用率的增长而不断优化成本,但对于密集型任务来说,o3 高计算模式的定价可能很高。
行业影响
o3 的发布引发了人工智能界关于通用人工智能 (AGI) 进展速度的激烈争论。 OpenAI 自己的研究人员指出,o3 在 ARC-AGI(一种专门设计用于抵抗记忆的测试)上的表现表明该模型正在开发真正的推理能力,而不是根据训练数据进行模式匹配。
包括 Google DeepMind、Anthropic 和 Meta 在内的竞争对手预计将在 2025 年推出自己的先进推理模型,加速许多人所说的“人工智能推理军备竞赛”。对于企业和开发人员来说,o3 在自动化科学研究、复杂软件工程、法律分析和财务建模方面开辟了新的可能性,而这些任务以前需要大量的人类专业知识。
