OpenAI 发布 GPT

健康方式 87℃

9月23日,OpenAI 推出了 GPT-6 系列的两款新模型——GPT-6 Sol 与 GPT-6 Luna。

文章主题示意图
主题配图,非事件现场。摄影:Pixabay。 /。 Pexels。

据 OpenAI 官方介绍,这两款模型的训练方式与 GPT-6 Astra 相近,把 Astra 在专业工作、事实性、编码、计算机使用以及对齐等维度上的顶尖能力,移植到了速度更快、成本更低的模型当中。

GPT-6 Sol 和 Luna 的 API 定价较 GPT-5.6 促销价下调了 50%。不过 OpenAI 也强调,GPT-6 Astra 仍是其综合实力最强的模型,若追求最佳表现和毫不妥协的体验,官方依然推荐选用 GPT-6 Astra。

性能测试上,在 AutomationBench 的跨应用业务流程评测中,GPT-6 Sol 于 xhigh 强度下的表现超过了 Claude Opus 5,而每任务成本仅为 Opus 5 的 9%。在 high 强度下,GPT-6 Luna 较前代提升了 5.4%,每项任务成本则下降了 58%。

在面向智能体的 Last Exam 测试中,GPT-6 Sol 在 max effort 状态下得分 56.4%,超过了 Claude Opus 5 在该评估中的最高分,同时每任务成本降低了 60%。

事实可靠性方面,GPT-6 Sol 和 Luna 同样有所进步。在 OpenAI 基于去标识化真实世界对话的测试中,GPT-6 Sol 的错误率大约只有前代的一半,可靠性接近 Astra 级别,而成本更低。GPT-6 Luna 的事实可靠性也大幅提升,且成本更低。

编程能力上,GPT-6 Sol 和 Luna 都针对 AI Coding Agent 工作负载做了优化。在 FrontierCode 1.1 Main 测试中,GPT-6 Sol 相比 GPT-5.6 Sol 提升明显,以更低的成本达到了与 Claude Fable 5.1 xhigh 相当的水平。

在 DeepSWE v1.1 软件工程测试中,GPT-6 Sol 于 max effort 下取得 68.8% 的成绩,与 Claude Fable 5 的最高分 69.9% 仅相差 1.1 个百分点,而单任务成本低了约 80%。GPT-6 Luna 在 max effort 下拿到 66.6%,表现接近 Opus 5 和 Fable 5 的 medium effort,单任务成本则分别低了约 93% 和 96%。

计算机操作能力方面,OpenAI 表示 GPT-6 Astra 仍是其在该领域最强的模型,但 Sol 和 Luna 相比上一代模型能以更低的成本完成相关任务。

在 OSWorld 2.0 offline 测试中,GPT-6 Sol 于 xhigh effort 下取得 60.5% 的成绩,与 Claude Opus 5 medium effort 的 60.3% 接近,而单任务成本约低 80%。GPT-6 Luna 在 max effort 下则超过了 GPT-5.6 Sol medium effort,成本约为后者的十分之一。

OpenAI 还把 GPT-6 Astra 改进后的沟通风格带到了 Sol 和 Luna 上。官方认为,新模型在技术和编程对话中表达会更清晰,术语使用更少,措辞更自然,低价值细节更少,整体回答也更简短,同时不会损失实质内容。

除了降价,OpenAI 还帮助基于 GPT-6 的开发者进一步节省应用重复利用上下文部分的费用。官方改进了 GPT-6 的提示缓存,默认提供更高的缓存命中率,帮助智能体重用更多上下文,从而实现更快的响应。

另外,GPT-6 Sol 和 Luna 在价值对齐方面也有所提升。在 OpenAI 官方的对齐评估中,Sol 和 Luna 均较 GPT-5.6 版本有所改善,其中包括关于其编码工作的误导性声明发生率降低。

根据 OpenAI 公告,GPT-6 Sol 和 GPT-6 Luna 自今日起已在 ChatGPT Work 和 Codex 中面向所有 Plus、Pro、Business、Enterprise 和 Edu 用户开放。

免费用户和 Go 用户可以在桌面应用中使用 GPT-6 Luna。这些模型目前尚未在 Chat 中提供。在 OpenAI API 中,它们以 gpt-6-sol 和 gpt-6-luna 的形式提供。