GPT-6 Sol斩杀5.6全系!Astra的1/5价格,Luna比梁文谷还便宜,周二Codex重置

HelloKitty 2026-09-23 14:59

扫一扫 在手机阅读、分享本文

545

本文由 量子位 撰写/授权提供,转载请注明原出处。

以下文章来源于:量子位(QbitAI)

作者:梦晨

GPT-6 Sol、Luna 深夜上线,API 价格直接砍半!

图片

Astra 改进的训练方法这两款也都用上了,所以也继承了 Astra 在计算机使用等方面的提升。

那还有啥好说的,等于 5.6 系列直接被斩杀了呗。

图片

现在系列里 Astra 负责当以前的 Sol,Sol 负责当以前的 Terra,Luna 还是以前的 Luna。

Terra 生态位直接被挤没了。

与 5.6 系列相比,6 系列的 API 定价直接砍 50%,其中 Luna 的输出砍得比 50% 还多一点。

而且 Luna 的输入价格比 DeepSeek-V4.1 Flash 的梁文谷价格($0.15)还便宜一点了,就是不知道缓存命中率有没有的比。

图片

为啥升级还便宜了?

OpenAI 称这得益于缓存和推理环节的效率提升,省下来的成本直接让利给用户和开发者。

图片

这不得尊奥特曼一声奥特之王(限时 24 小时)。

图片

用一成价格,盯着 Fable 打

整个发布公告看下来,我先学会一招,用 GPT-6 Sol 最好别开 Max。

效果提升有限,价格提升很大,就不如直接开 Astra 了,还有个别榜单跑分 Max 比 xHigh 掉分。

什么你不知道怎么在 Codex 里开 Max?

在设置里可以选,默认是没打开的,这下知道为什么没打开了。

图片

按照 AutomationBench 这个榜,GPT-6 Sol 的 high 和 xhigh 两个档位已经摸到了 Astra 的 light 和 medium 的水平。

图片

AutomationBench 测的是 AI 在销售、营销、运营、客服、财务和人力资源六大领域 47 个工具上执行端到端业务流程的能力。

作为对比,Claude Opus 5 在 max effort 下得分和 GPT-6 Sol 的 medium 差不多,但单任务成本是 Sol 的 11.1 倍。

Claude Fable 5.1,成本是 Sol 的 8.9 倍以上,而且这还没算上约 40% 任务触发 Opus 5 回退产生的额外开销。

图片

为测试 GPT-6 Sol 的计算机使用能力,我让它在图表中把隔壁新发的 Opus5.5 成绩也画上去。

这下可以直观看出,Opus5.5 的 Max 档达到了 GPT-6 Astra 水平,价格也达到了 Astra 水平。

图片

换 Agents' Last Exam,这次考长周期任务,覆盖55个子行业。

GPT-6 Sol 在 max effort 下得分 56.4%,超过 Claude Opus 5 在该测试中的最高分,成本还低了 60%。

图片

编程是这次重点展示的方向。

OpenAI 透露了一组内部数据:公司内部的 Coding Agent 使用量呈指数级增长,按 API 价格折算,中位数研究员每天的 token 消耗已超过 600 美元,90 分位的研究员超过 7000 美元。

随着编程 agent 承担的任务越来越长、越来越复杂,持续使用的成本变得更加关键,这正是 Sol 和 Luna 要解决的问题。

在 DeepSWE v1.1(测试 AI 在真实代码库中解决复杂软件工程任务)上,GPT-6 Sol 其实并没有比5.6 Sol更好,但确实便宜不少。

GPT-6 Luna 在 max effort 下得分 66.6%,与 Claude Opus 5 和 Fable 5 在 medium effort 下水平相当,成本分别低了 93% 和 96%。

图片

在 Cognition 推出的 FrontierCode(评估 AI 编写的代码是否达到可合并进真实代码库的标准)上,GPT-6 Sol 相比 GPT-5.6 Sol 同样有明显提升,能以更低成本匹配 Claude Fable 5.1 xhigh 的表现。

这个榜隔壁 Claude 的档位又乱了起来。

图片

计算机操作,这块还是 Astra 比较权威。

GPT-6 Sol 也仅仅是比 5.6 Sol 便宜了,high 档位以上水平其实没超过 5.6 多少。

GPT-6 Luna 在 max effort 下超过了 GPT-5.6 Sol 在 medium effort 下的表现,成本仅为后者的十分之一。

图片

事实准确性方面,OpenAI 用一组从真实 ChatGPT 对话中提取的、用户曾标记过事实错误的案例进行了测试。

结果是 GPT-6 Sol 的错误率大约是上一代的一半,接近 Astra 的水平。GPT-6 Luna 在较高 effort 下能匹配 GPT-5.6 Sol 的准确度,而成本只有百分之一。

图片

缓存命中率提升,重置马上来

模型能力之外,OpenAI 对 GPT-6 的基础设施也做了几项改进。

首先是提示词缓存。

改进后的缓存机制默认提供更高的命中率,缓存命中的输入 token 可享受 90% 的价格折扣。

OpenAI 还上线了缓存监控面板和诊断工具,开发者可以查看缓存使用情况、定位未命中的原因并针对性优化。

还有这样一个实用的改动:调整推理 effort 级别或开关工具时,不再会打断之前的缓存上下文。

GitHub 已经在用这套方案。据 OpenAI 披露,过去几个月里这些优化让 GitHub Copilot 需要重新处理的提示 token 比例下降了超过 50%,涉及数十亿次请求。

终于能在任务的不同任务灵活切换配置了。

之前看已经有人做出来,搭配 Jev 可以在任务中途毫秒级切换。

图片

然后是对话风格。

OpenAI 把 Astra 上改进过的沟通方式带到了 Sol 和 Luna 上,在技术和编程对话中感知会尤为明显,表现为更清晰、更少术语、更少无效细节、回复整体更简短但不丢失关键信息。

OpenAI 在博客中展示了同一个网页开发任务下 GPT-5.6 Sol 和 GPT-6 Sol 的对比回复。

5.6 会主动复述用户已知的信息并使用含糊措辞,6 则更直接,会说明自己检查了什么、没检查什么。

图片

对齐方面,Sol和 Luna 在测试中优于 GPT-5.6 同级模型,包括在编程任务中做出误导性声明的比率更低。OpenAI 强调,这些对齐测试专门挑选了容易诱发不诚实行为的场景,正常使用中出现此类问题的概率远低于测试数据。

最后,关于额度重置。

总之是周二,具体时间未定,醒来的朋友们可以开蹬了。

图片

参考链接:

[1]https://openai.com/index/introducing-gpt-6-sol-and-luna/#alignment-reviewer-bypass

[2]https://x.com/miu21590/status/2101857866378362926?s=20

微信图片_20260817175153_7_668.png

扫一扫 在手机阅读、分享本文

扫码关注公众号

获取更多技术资讯

精选活动 更多 >

{{ val.activity_name }}

{{ val.province ? (val.province + ' ' + val.city) : val.location }}
客服微信
享受1V1专属服务
免费领取技术福利
发送名片申请入群
与CTO聊合作
(备注姓名、公司及职位)
热门文章