OpenAI 于 2026 年 9 月 22 日发布了两款新模型 GPT-6 Sol 和 GPT-6 Luna,扩展了 GPT-6 系列,与本月早些时候推出的旗舰模型 GPT-6 Astra 并列。该公司将 API 价格较上一代 GPT-5.6 下调了 50%,并将降价归因于缓存和推理基础设施的改进。OpenAI 将 Astra 定位为应对高要求项目的最佳模型,而 Sol 和 Luna 则面向更大规模的日常工作负载,在专业任务、事实准确性、编码和计算机使用方面提供接近 Astra 的性能。
OpenAI 宣布 GPT-6 Sol 和 Luna 的定价结构
按照新定价,GPT-6 Sol 的输入代币价格为每百万个代币 2 美元,输出代币价格为每百万个代币 10 美元,低于 GPT-5.6 的 4 美元和 20 美元。GPT-6 Luna 的输入代币价格为每百万个代币 0.10 美元,输出代币价格为每百万个代币 0.50 美元,低于此前的 0.20 美元和 1.20 美元。该公司表示,成本下降源于缓存和推理基础设施的改进,节省的成本将直接传递给用户。
GPT-6 Sol 和 Luna 的基准测试表现
在 AutomationBench 中,该测试覆盖销售、营销、运营、支持、财务和人力资源领域的 47 种业务工具。GPT-6 Sol 在 xhigh 推理工作量下的得分为 33.2%,每项任务成本为 0.27 美元;其表现超过最高推理工作量下的 Claude Opus 5(26.9%),而每项任务的成本约为后者的九分之一。在 Agents’ Last Exam 中,最高推理工作量下的 Sol 得分达到 56.4%,超过 Claude Opus 5 的最高得分,而成本约低 60%。
在编码方面,GPT-6 Sol 在 DeepSWE v1.1 上的得分为 68.8%,与 Claude Fable 5 的最佳成绩相差 1.1 个百分点,而成本约低 80%。Luna 的得分为 66.6%,与中等推理工作量下的 Opus 5 和 Fable 5 相当,而成本低 93% 至 96%。在 OSWorld 2.0 上,Sol 的表现与 Claude Opus 5 相当(60.5% 对 60.3%),而成本约为后者的五分之一。
OpenAI 报告称,在其针对用户标记为错误的去标识化对话进行的内部评估中,Sol 的事实错误率较其前代模型降低了一半;在更高推理工作量下,Luna 达到了 GPT-5.6 Sol 的可靠性,而成本约为其百分之一。对齐评估显示,两款模型均较其前代模型有所改进,包括在刻意设置挑战的编码场景中表现出更低的欺骗率。
OpenAI 改进提示词缓存和基础设施
除定价外,OpenAI 还改进了提示词缓存,默认提高缓存命中率,并为读取缓存输入代币提供 90% 的折扣。该公司推出了监控仪表板、诊断工具和控制功能,让开发者能够调整推理工作量和工具可用性,同时不会使缓存的上下文失效。GitHub 报告称,这些变化使数十亿次请求中需要重新处理的提示词代币占比降低了 50% 以上。
GPT-6 Sol 和 Luna 在各平台的可用性
GPT-6 Sol 和 Luna 自 2026 年 9 月 22 日起在 ChatGPT Work 和 Codex 中向 Plus、Pro、Business、Enterprise 和 Edu 用户提供。Free 和 Go 用户也可通过桌面应用使用 Luna。两款模型均通过 API 提供,名称为 gpt-6-sol 和 gpt-6-luna,并将在当天分阶段完成发布。
Artificial Analysis 报告成本效率和喜忧参半的表现
Artificial Analysis 的第三方评估证实了 OpenAI 关于效率的主张,同时也呈现出这些模型能力的复杂图景。在 Intelligence Index 测试中,该机构发现,最高推理工作量下的 GPT-6 Sol 每项任务成本约为 1.06 美元,约为其前代模型 1.99 美元的一半;而 Luna 的每项任务成本则从 0.18 美元降至 0.07 美元。两款新模型均位于成本效率帕累托前沿。节省完全源于降价,因为两款模型每项任务生成的输出代币都略多于其前代模型。
性能表现出进步与退步并存的情况。在 Coding Agent Index 中,Sol 提升了 2 分,达到 57 分,在 Terminal-Bench 4.0 和 SWE-Atlas-QnA 上均有所提升;而 Luna 则下降了 2 分,在 SWE-Atlas-QnA 和 DeepSWE v1.1 上落后。AA-Omniscience 基准测试中的幻觉率大幅下降,Sol 从 92% 降至 60%;不过,这部分改善是通过拒绝回答更多问题实现的,也使 Sol 的准确率降低了 5 分。最显著的退步出现在知识工作评估中:Sol 在 GDPval-AA v2.1 中下降了约 100 个 Elo 分,Luna 则下降了约 75 分;人工检查认为,下降原因是交付内容更短、遗漏了评分标准要求的要素,以及呈现质量降低。
常见问题
OpenAI 于 2026 年 9 月 22 日发布了什么?
OpenAI 发布了两款新模型 GPT-6 Sol 和 GPT-6 Luna,扩展了 GPT-6 系列,与本月早些时候推出的旗舰模型 GPT-6 Astra 并列。
GPT-6 Sol 和 Luna 的价格是多少?
GPT-6 Sol 的输入代币价格为每百万个代币 2 美元,输出代币价格为每百万个代币 10 美元。GPT-6 Luna 的输入代币价格为每百万个代币 0.10 美元,输出代币价格为每百万个代币 0.50 美元。两款模型相较 GPT-5.6 的价格均下调了 50%。
独立分析发现了哪些性能改进?
Artificial Analysis 确认了成本效率,其中最高推理工作量下的 GPT-6 Sol 每项任务成本约为 1.06 美元,而其前代模型为 1.99 美元。不过,该机构报告称性能喜忧参半,包括 Sol 在 Coding Agent Index 中提升了 2 分,以及知识工作评估出现退步,其中 Sol 在 GDPval-AA v2.1 中下降了约 100 个 Elo 分。
免责声明:以上内容(如有图片或视频亦包括在内)均为平台用户上传并发布,本平台仅提供信息存储服务,对本页面内容所引致的错误、不确或遗漏,概不负任何法律责任,相关信息仅供参考。
本站尊重他人的知识产权、名誉权等法律法规所规定的合法权益!如网页中刊载的文章或图片涉及侵权,请提供相关的权利证明和身份证明发送邮件到qklwk88@163.com,本站相关工作人员将会进行核查处理回复