OpenAI 的 o3 模型创下了推理基准的新记录,在复杂的数学、编码和科学任务上超越了人类专家,标志着人工智能能力的新时代。
OpenAI o3 是该公司最先进的人工智能推理模型,于 2025 年初发布。与逐个生成响应的标准大型语言模型不同,o3 采用了一种新颖的“测试时计算”方法——在提供答案之前花费更多的处理时间“思考”问题。这使得该模型能够解决之前困扰人工智能系统的复杂推理挑战。
o3 系列包括两个变体:完整版 o3 模型经过优化,可在困难任务中实现最大准确度,以及 o3-迷你,一个更小、更快、更具成本效益的版本,专为日常编码和推理任务而设计。
o3 的基准性能在人工智能研究界引起了震动:
这些分数不仅代表了人工智能解决问题能力的渐进式进步,还代表了质的飞跃。
o3 建立在 OpenAI 的“思想链”推理框架之上,其中模型在产生最终答案之前生成内部推理步骤(本质上是大声思考)。关键的创新在于 自适应计算:模型可以根据问题的难度花费或多或少的“思考时间”。
实际上,这意味着 o3 可以:
权衡是速度和成本——与 GPT-4o 等更快的模型相比,高计算 o3 的每次查询时间可能要长得多,成本也更高。 OpenAI 的 o3-mini 变体通过以一小部分计算成本提供大部分推理增益来解决这个问题。
OpenAI 已通过其 API 和 ChatGPT Pro 订阅提供 o3 和 o3-mini。关键接入点包括:
OpenAI 表示,尽管该公司随着采用率的增长而不断优化成本,但对于密集型任务来说,o3 高计算模式的定价可能很高。
o3 的发布引发了人工智能界关于通用人工智能 (AGI) 进展速度的激烈争论。 OpenAI 自己的研究人员指出,o3 在 ARC-AGI(一种专门设计用于抵抗记忆的测试)上的表现表明该模型正在开发真正的推理能力,而不是根据训练数据进行模式匹配。
包括 Google DeepMind、Anthropic 和 Meta 在内的竞争对手预计将在 2025 年推出自己的先进推理模型,加速许多人所说的“人工智能推理军备竞赛”。对于企业和开发人员来说,o3 为自动化科学研究、复杂软件工程、法律分析和财务建模(以前需要大量人类专业知识的任务)开辟了新的可能性。