Aiignitions
科技新闻

经过美国政府安全审查后,OpenAI 推出 GPT-5.6 Sol、Terra 和 Luna

经过美国政府安全审查后,OpenAI 于 2026 年 7 月 9 日推出了 GPT-5.6 Sol、Terra 和 Luna。以下是等级、基准、定价及其重要性。

经过美国政府安全审查后,OpenAI 推出 GPT-5.6 Sol、Terra 和 Luna

发生了什么

OpenAI 已开始广泛公开推出 GPT-5.6,其最新型号系列,开始 2026 年 7 月 9 日。 GPT-5.6 不是单一模型,而是以不同名称的三层形式提供 - 索尔, 泰拉露娜 — 每个目标都旨在实现智能、速度和成本之间的不同平衡。这些模型现已应用于 ChatGPT、OpenAI API 和公司的编码工具。

OpenAI logo — OpenAI began the broad rollout of its GPT-5.6 Sol, Terra and Luna models on July 9, 2026

这次发射遵循了一条不寻常的道路。 GPT-5.6 首次出现于 2026 年 6 月 26 日 作为有限的预览仅限于大致 20个政府批准的组织,并在之后才向更广泛的公众开放 美国商务部人工智能标准与创新中心 (CAISI) 完成了审查并清除了更广泛的访问权限。 OpenAI 将旗舰产品 Sol 视为迄今为止最强大、最安全的模型,在编码、网络安全和科学推理方面取得了显着的进步。

Sol、Terra 和 Luna:三层

三模型结构是标题设计选择。 OpenAI 没有要求用户猜测哪个单一模型适合他们的任务,而是将 GPT-5.6 分为明确定位的层:

  • 索尔(旗舰): 最强大的层,专为复杂的推理、编码、科学工作、网络安全和长期运行的代理任务而构建。它针对成本是次要问题的高上限、多步骤问题,公开了最高的推理工作量设置,包括“最大”推理模式和“超级”编排模式。
  • 泰拉(平衡): 中端型号的定位与之前的 GPT-5.5 具有竞争力,但成本大约是后者的一半。它旨在成为日常任务的通用主力。
  • Luna(快速且实惠): 该系列中最小、最便宜且延迟最低的成员,针对大容量、成本敏感的工作负载。值得注意的是,在一些编码基准测试中,Luna 实际上超越了价格更高的 Terra,OpenAI 承认这使其成为许多日常工作的经济合理的默认值。
ChatGPT logo — GPT-5.6 Sol, Terra and Luna are rolling out across ChatGPT, the API and OpenAI's coding tools

对于开发人员来说,实际的结果是对性价比权衡进行精细控制:当问题确实需要前沿推理时,可以使用 Sol;当您运行相同的提示数百万次并且延迟和价格比最后几点准确性更重要时,可以使用 Luna。

它的能力如何?

OpenAI 报告的数据集中在代理编码和终端式工作流程上。开 终端工作台 2.1,衡量模型执行实际命令行和编码任务的能力,超级模式下的 GPT-5.6 Sol 领先 91.9%,标准 Sol 为 88.8%——均高于之前的 GPT-5.5 的 88.0%。卢娜发表了令人尊敬的 84.3%,与领先的竞争对手模型相匹配,并且引人注目的是,在这项特定测试中击败了 Terra 的 82.5%。

除了编码之外,OpenAI 还报告了包括生物学和网络安全评估在内的专业领域的收益,Sol 使用比前几代更少的输出令牌来获得答案——当输出令牌是运行模型中最昂贵的部分时,这是一个有意义的效率胜利。在该公司的网络安全漏洞基准测试中,Sol 的得分约为 73.5%OpenAI 将其描述为迄今为止最强大的攻击安全能力,也是该模型在广泛发布之前受到政府审查的部分原因。

OpenAI symbol mark — GPT-5.6 Sol leads OpenAI's reported benchmarks for agentic coding and cybersecurity

与供应商报告的基准一样,警告很重要。独立评估人员指出,Sol 在受控测试中的表现似乎比早期实际部署中的表现要好一些,而 OpenAI 本身也指出,基准测试的领先地位并不会自动转化为每项任务的更好体验。现在真正的考验来了,这些模型已广泛可用,并被推向不可预测的、混乱的生产工作负载。

为什么政府首先审查它

这次发布最有特色的部分不是模型,而是发布过程。 GPT-5.6 最初仅向与美国政府协调的一小部分值得信赖的合作伙伴发货,因为如果该模型被滥用,Sol 更强大的网络安全和科学能力会增加风险。的 人工智能标准与创新中心商务部内部评估前沿人工智能的后继机构 OpenAI 在向公众开放之前进行了审查。

OpenAI 将其与迄今为止最强大的安全堆栈相结合:拒绝禁止的网络和生物援助的模型级训练、评估生成的输出的实时分类器、将恶意行为者与合法安全研究人员区分开的帐户级审查,以及通过监控和执行进行分层访问。该公司表示,它投入了相当于数十万个 GPU 小时的自动红队来应对越狱,并由外部人类专家进行补充。这种模式——在政府监督下进行预览,然后在获得批准后扩大访问范围——是对未来如何发布最有能力的模型的预览。

Cerebras 的前沿速度

除了模型发布之外,OpenAI 还提供 Cerebras 上的 GPT-5.6 Sol 硬件高达 每秒 750 个令牌 对于延迟敏感的客户。这比典型的基于 GPU 的服务要快得多,并且针对的是实时编码助手、交互式代理、实时工具等用例,在这些用例中,等待几秒钟的响应会破坏体验。

Racks of servers in a data center — GPT-5.6 Sol is being offered on Cerebras hardware at up to 750 tokens per second

最初以这样的速度为有限的客户群运行前沿模型,标志着竞争的走向:不仅是更智能的模型,而且模型速度足够快,可以在交互式软件中感受到即时的感觉。速度本身越来越成为一个特征,将顶级模型与专门的推理硬件配对是 OpenAI 试图实现差异化的一种方式。

定价

API 定价分级以匹配三种模型,每百万代币报价:

  • 溶胶: 输入 5.00 美元/输出 30.00 美元
  • 泰拉: 输入 2.50 美元/输出 15.00 美元
  • 露娜: 输入 1.00 美元/输出 6.00 美元

快速缓存继承了早期模型:缓存写入的费用高于标准输入速率,而缓存读取的费用则大幅折扣,这奖励了重用长期稳定上下文的工作负载。 Sol 和 Luna 之间的差异(输入和输出大约是五倍)使得分层变得有意义。对于大容量应用程序,在任务允许的情况下选择 Luna 而不是 Sol 可以大幅削减推理费用,同时保留大部分功能。

可用性和统一应用程序

随着 7 月 9 日的推出,GPT-5.6 正在向 ChatGPT 用户和 API 开发人员开放,更高级别的用户将向付费客户开放,更广泛的公众将分阶段获得访问权限。 OpenAI 还在继续整合其产品,将其独立编码工具折叠成一个统一的 ChatGPT 应用程序,将聊天、编码代理和浏览功能集中在一个地方,而不是跨单独的应用程序。

OpenAI CEO Sam Altman speaking at a conference — OpenAI is consolidating its products around the GPT-5.6 family

对于大多数人来说,这种变化会悄然显现:ChatGPT 中有更好的答案、更快的响应,以及更清晰地映射“这项任务有多难以及我愿意支付多少钱”的模型选择器。开发人员可以做出更重要的决策,在 Sol、Terra 和 Luna 之间选择每次调用,以根据质量调整成本和延迟。

为什么它很重要

GPT-5.6 之所以如此重要,有两个原因,而这两个原因与任何单一基准分数几乎没有关系。首先,三层结构正式体现了整个行业正在发生的转变:从单一模型转向针对不同价格和速度点调整的模型菜单,让具有成本意识的团队大规模部署前沿智能。其次,政府监督的发布过程——向经过审查的小组预览,由联邦标准机构审查,然后广泛提供——是迄今为止最清楚的例子之一,说明如何随着网络和科学能力的增长,对最有能力的人工智能系统进行管理。

Sol 的基准领先地位是否能在现实世界的压力下保持不变,以及 Luna 激进的性价比是否会重塑开发商的建设方式,这些都将在未来几周内显现出来。已经很清楚的是,前沿不再仅由能力来定义,而是由能力、速度、成本以及强大模型的推出过程来定义。 OpenAI 的完整公告发布在其网站上 官方网站

阅读原始来源

前往原始来源查看完整公告和详细信息。

阅读原始来源