GPT-6 Astra 推出至今尚不足一个月,OpenAI 便再度扩展了 GPT-6 系列的产品线。
就在数小时前,OpenAI 正式对外发布了 GPT-6 Sol 和 GPT-6 Luna 两款新型号。此次发布,OpenAI 旨在将 GPT-6 Astra 所具备的能力,以更为低廉的价格推广至更广泛的日常应用场景。
OpenAI 表示,GPT-6 Sol 与 Luna 采用了与 GPT-6 Astra 相似的训练方式,并借助缓存及推理效率的优化来削减运行开销。其 API 价格相较于 GPT-5.6 的促销价直接降低了 50%:GPT-6 Sol 每百万输入 Token 的费用从 4 美元降至 2 美元,输出费用从 20 美元降至 10 美元;而 GPT-6 Luna 则从每百万输入 Token 收费 0.20 美元、输出 Token 每百万收费 1.20 美元,下调至 0.10 美元和 0.50 美元。

这也是此次发布中最值得关注的要点:OpenAI 正将“模型性能有多强”的比拼,进一步转向“完成一项真实任务究竟需要多少成本”。
Sol 和 Luna 究竟升级了哪些方面?
从产品定位来看,Sol 和 Luna 并非开辟了全新的能力方向,而是在现有模型能力的基础上,进一步提升了智能水平。
具体而言,在专业工作场景方面,GPT-6 Sol 能够处理更为复杂的工作任务。与价格相近的竞品模型相比,GPT-6 Sol 能够提供更强的智能水平与更优的结果。
根据官方公布的基准测试,在 AutomationBench 测试(评估 AI Agent 跨不同应用完成业务工作流的能力)中,GPT-6 Sol 在 xhigh 推理级别下的表现超越了最高推理级别的 Claude Opus 5,但其单项任务成本仅为后者的 9%。
在 high 推理级别下,GPT-6 Luna 相较上一代模型性能提升了 5.4%,同时单项任务成本降低了 58%。

GPT-6 Sol 的表现也超越了 Claude Fable 5.1,并且成本明显更低,甚至超过了低推理级别的 GPT-6 Astra。

在 Agents’ Last Exam 测试(评估 AI Agent 完成复杂专业工作流的能力)中,GPT-6 Sol 在最高推理级别下取得了 56.4% 的成绩,相比 Claude Opus 5 在该测试中的最高成绩,其单项任务成本低了 60%。

事实准确性
答案的有用性,在很大程度上取决于其中信息的准确性。OpenAI 表示,公司正持续提升模型的事实可靠性。
在一项内部事实准确性测试中,OpenAI 使用了经过匿名化处理的真实用户对话,这些对话此前曾被用户指出存在模型事实错误。
测试结果显示,GPT-6 Sol 出现错误的次数约为上一代模型的一半,同时以明显更低的成本接近了 GPT-6 Astra 的可靠性水平。
GPT-6 Luna 同样取得了显著提升。在更高推理级别下,其表现可以达到 GPT-5.6 Sol 的水平,但单项任务成本仅约为后者的百分之一。

编程
今年,编程 Agent 开始处理比以往更为复杂、范围更广、持续时间更长的任务。OpenAI 表示,公司内部对编程 Agent 的使用量也在快速增长。
按照 API 价格计算,目前一名普通研究人员每天使用的 Token 对应价值已超过 600 美元,而使用量排名前 10% 的研究人员,每天使用量对应的价值则超过 7000 美元。
随着编程 Agent 承担越来越长、越来越复杂的任务,持续使用的成本也变得更加重要。GPT-6 Sol 和 Luna 希望在保持较强编程能力的同时,通过更低的 API 价格,让开发者拥有更多迭代空间,也让团队更有信心将更复杂的任务交给 Codex。
正因如此,代码能力也是此次更新的重点。
OpenAI 使用 FrontierCode 1.1 Main 测试模型是否能够真正产出可合并进真实代码库的修改,而不仅仅是回答一道编程题。
测试结果显示,GPT-6 Sol 相比 GPT-5.6 Sol 有明显提升,同时以更低的成本达到了与 Claude Fable 5.1 在 xhigh 推理级别下相当的表现。

在 DeepSWE v1.1 测试中,GPT-6 Sol 在最高推理级别下取得了 68.8% 的成绩,与 Claude Fable 5 在该测试中的最高成绩 69.9% 相差 1.1%,但单项任务成本低了约 80%。
GPT-6 Luna 在最高推理级别下取得了 66.6% 的成绩,与 Claude Opus 5 和 Fable 5 在中等推理级别下的表现相当。在这些对比中,Luna 的单项任务成本比 Opus 5 低了 93%,比 Fable 5 低了 96%。

电脑操作
OpenAI 表示,GPT-6 Astra 依然是目前电脑操作能力最强的模型,但 GPT-6 Sol 和 Luna 相比上一代模型,在成本效率方面有明显提升。
在 OSWorld 2.0 离线测试集中,GPT-6 Sol 在 xhigh 推理档位下达到了 60.5%。
这个成绩与 Claude Opus 5 中等推理档位的 60.3% 接近,但 OpenAI 称 Sol 完成单项任务的成本大约低了 80%。
Luna 则更为激进。OpenAI 表示,GPT-6 Luna 在最高推理级别下的表现超过了 GPT-5.6 Sol 的中等推理级别,而成本仅为后者的十分之一。

此次更新中另一个值得关注的变化是输出风格。
OpenAI 表示,Sol 和 Luna 也继承了 GPT-6 Astra 新的沟通方式,包括表达更加清晰、减少术语堆砌、减少奇怪措辞和低价值细节,同时整体回答会略微缩短,但不会刻意牺牲信息量。
对于开发者而言,这个变化可能没有“benchmark 提升”那么容易引起注意,但实际上很重要。因为当模型开始承担代码修改、浏览器操作和长流程 Agent 任务后,一个模型是否容易控制、是否会不断输出无关内容,同样会影响实际任务成本。

成本问题
如果说 Benchmark 解释了 GPT-6 Sol 和 Luna “为什么值得关注”,那么价格才是此次发布真正改变开发者计算方式的因素。
API 文档也显示,GPT-6 Sol 和 Luna 目前支持文本和图片输入,并可通过 Responses API 和 Chat Completions API 使用;标准价格适用于最高 272K 输入 Token 的请求。
对于开发者来说,真正值得关注的不是一次请求便宜了几分钱,而是当一次任务的成本下降到原来的几分之一后,开发者可以更大胆地让 Agent 多尝试、多验证、多迭代。
这也是 OpenAI 所说“让用户大量使用 AI”的真正含义。
Benchmark 正变得越来越难以解释
此次发布还有一个值得注意的背景。
GPT-6 Sol 和 Claude Opus 5.5 几乎在同一天发布,双方都将“能力+成本”作为重点。
Anthropic 公布的数据显示,Opus 5.5 在 Terminal-Bench 4.0、FrontierCode 和 CursorBench 等测试上继续保持强劲表现;Anthropic 同时强调,与上一代相比,Opus 5.5 在典型任务上的运行成本下降了约 40%。
这意味着两家公司实际上正朝着同一个方向前进:模型能力仍在持续提升,但“完成一项真实任务要花多少钱”正变得越来越重要。
这也意味着,传统的“谁的 Benchmark 最高”,可能越来越难以直接对应真实使用体验。一个模型拿到 70 分,但如果完成任务需要消耗 10 倍 Token;另一个模型拿到 68 分,却只需要十分之一的成本,对开发者来说,两者可能已经是完全不同的产品。
从 OpenAI 自己公布的测试结果也能看出,模型能力并非一张简单的成绩单。例如,GPT-6 Sol 和 Luna 在 HealthBench 的部分指标上并未全面超越 GPT-5.6。OpenAI 对此的解释是,新模型的回答明显变短,而部分测试需要覆盖大量细节,因此回答变短反而会影响得分。
在这样的背景下,降本几乎贯穿了 OpenAI 此次发布的全部宣传重点。
对 OpenAI 来说,更低的推理成本意味着同样的基础设施可以支撑更多模型调用。在数据中心硬件和算力需求持续增长的情况下,单位算力能够产生更多实际的推理结果;对开发者来说,则意味着更低的使用门槛,也意味着可以让 Agent 多跑几轮、多做几次验证和迭代。
整体而言,OpenAI 此次强调的不只是“模型变得更强”,还有一个更现实的问题:同样的智能,能否用更低的成本运行起来。
当 AI Agent 从偶尔调用变成持续运行,模型每一次调用的成本都会被放大。这个时候,Benchmark 上多出来的几个百分点固然重要,但模型能以什么成本将任务真正跑完,同样会决定它最终能被多大规模地使用。
参考:
https://www.zdnet.com/innovation/openai-gpt-6-sol-luna-release/
https://openai.com/index/introducing-gpt-6-sol-and-luna/
本文来自微信公众号“CSDN”,36氪经授权发布。
5条评论
围绕每条规则均配有真实比赛示例,便于对照理解,竞彩让球规则持续打磨更优质的服务。发布于2021年7月21日上午10:00
竞彩让球规则深耕按玩法类别分章节编排,避免不同场景的判定混淆领域,用心服务每一位用户。
在提供选项含义与结算边界的详细问答,快速消除疑问方面,竞彩让球规则提供贴心周到的支持。发布于2021年7月21日上午10:00
竞彩让球规则以内容持续根据官方规则更新,确保信息准确可用为核心,带来高效便捷的体验。
在竞彩让球含义方面,竞彩让球规则提供贴心周到的支持。发布于2021年7月21日上午10:00
想了解更多竞彩让球规则相关内容,尽在竞彩让球规则。
陈晓峰 发布于 2026年8月22日 16:10
让球玩法中常见疑问:让球数为整数时,比分恰好等于让球数怎么办?例如主队让一球,实际比分1-0,减球后为0-0,判定为平局,而非主胜。让球数为非整数(如0.5)时,则不存在平局可能,必须分出胜负。
发表评论