Aiignitions
科技新闻

OpenAI o3:迄今为止最强大的推理人工智能模型

OpenAI 的 o3 模型创下了推理基准的新记录,在复杂的数学、编码和科学任务上超越了人类专家,标志着人工智能能力的新时代。

OpenAI o3:迄今为止最强大的推理人工智能模型

什么是 OpenAI o3?

OpenAI o3 是该公司最先进的人工智能推理模型,于 2025 年初发布。与逐个生成响应的标准大型语言模型不同,o3 采用了一种新颖的“测试时计算”方法——在提供答案之前花费更多的处理时间“思考”问题。这使得该模型能够解决之前困扰人工智能系统的复杂推理挑战。

o3 系列包括两个变体:完整版 o3 模型经过优化,可在困难任务中实现最大准确度,以及 o3-迷你,一个更小、更快、更具成本效益的版本,专为日常编码和推理任务而设计。

基准测试结果

o3 的基准性能给人工智能研究界带来了冲击:

  • ARC-AGI(抽象和推理语料库): o3 得分 87.5% 在高计算模式下——相比之下,任何人工智能系统之前的最佳成绩约为 55%,而人类的平均得分为 85%。这被广泛认为是对人工智能通用智能最难的测试。
  • AIME 2024(数学奥林匹克): o3 解决了 96.7% 的问题数,相比之前的 GPT-4o 分数提高了 13%。
  • SWE-bench(软件工程): o3 已解决 71.7% 真实世界 GitHub 问题的比例 — 高于 o1 的 49%,远远超出早期模型。
  • MMLU(常识): o3 在科学、法律、历史和医学领域的准确率超过了 90%。

这些分数不仅代表了人工智能解决问题能力的渐进式进步,而且代表了质的飞跃。

o3 的工作原理

o3 建立在 OpenAI 的“思想链”推理框架之上,该框架在产生最终答案之前,模型会生成内部推理步骤(本质上是大声思考)。关键的创新在于 自适应计算:模型可以根据问题的难度花费或多或少的“思考时间”。

实际上,这意味着 o3 可以:

  • 将复杂的数学问题分解为数十个子步骤并验证每个子步骤
  • 在选择最佳的之前生成并测试多个代码实现
  • 跨学科交叉引用科学概念以形成准确的结论

权衡是速度和成本——与 GPT-4o 等更快的模型相比,高计算 o3 的每次查询时间可能要长得多,成本也更高。 OpenAI 的 o3-mini 变体通过以一小部分计算成本提供大部分推理增益来解决这个问题。

供货情况和定价

OpenAI 已通过其 API 和 ChatGPT Pro 订阅提供 o3 和 o3-mini。关键接入点包括:

  • API访问: 开发人员可以通过 OpenAI 平台使用,定价基于输入/输出代币和所选的计算级别。
  • ChatGPT 专业版: Pro 订阅者(200 美元/月)可以优先访问 o3 来执行复杂任务。
  • o3-迷你: ChatGPT Plus 用户可以通过 API 以显着降低的成本使用,非常适合编码帮助和日常推理。

OpenAI 表示,尽管该公司随着采用率的增长而不断优化成本,但对于密集型任务来说,o3 高计算模式的定价可能很高。

行业影响

o3 的发布引发了人工智能界关于通用人工智能 (AGI) 进展速度的激烈争论。 OpenAI 自己的研究人员指出,o3 在 ARC-AGI(一种专门设计用于抵抗记忆的测试)上的表现表明该模型正在开发真正的推理能力,而不是根据训练数据进行模式匹配。

包括 Google DeepMind、Anthropic 和 Meta 在内的竞争对手预计将在 2025 年推出自己的先进推理模型,加速许多人所说的“人工智能推理军备竞赛”。对于企业和开发人员来说,o3 在自动化科学研究、复杂软件工程、法律分析和财务建模方面开辟了新的可能性,而这些任务以前需要大量的人类专业知识。

阅读原始来源

前往原始来源查看完整公告和详细信息。

阅读原始来源