OpenAI 推出 GPT-6 Sol 和 Luna:API 价格大降 50%,单任务成本最低不到竞品一成

约 882 字 · 预计阅读 3 分钟

内容概览

本文围绕“OpenAI 推出 GPT-6 Sol 和 Luna:API 价格大降 50%,单任务成本最低不到竞品一成”整理核心信息、适用场景与使用条件,便于读者快速了解重点,再决定是否进一步体验或查阅项目资料。

OpenAI 当日发布 GPT-6 系列的最新成员——GPT-6 Sol 和 GPT-6 Luna。两款模型采用与 GPT-6 Astra 类似的训练方法,把 Astra 在专业工作、事实性、编码、计算机使用和对齐等方面的最先进性能,带入更快、更经济的模型。OpenAI 也强调,GPT-6 Astra 仍是其整体最优秀的模型,追求无妥协体验仍应首选它。

image.png

价格砍半,成本最低不到竞品一成

GPT-6 Sol 和 Luna 的 API 价格相比 GPT-5.6 促销价降低 50%。更值得注意的是单任务成本:在 AutomationBench 跨应用业务流程测试中,GPT-6 Sol 在 xhigh 强度下表现优于 Claude Opus 5,成本却仅为 Opus 5 每任务成本的 9%;同一测试 high 强度下,GPT-6 Luna 较前代提升 5.4%,每项任务成本降低 58%。

评估智能体的 Last Exam 测试中,GPT-6 Sol 在 max effort 状态下得分 56.4%,高于 Claude Opus 5 在该评估中的最高分,每任务成本还降低 60%。事实可靠性同样进步:GPT-6 Sol 的错误率约为前代的一半,接近 Astra 级可靠性且成本更低;Luna 的事实可靠性也大幅提升。

image.png

性能逼近旗舰,长任务更省

编程方面,两款模型均针对 AI Coding Agent 工作负载优化。FrontierCode 1.1 Main 测试中,GPT-6 Sol 较 GPT-5.6 Sol 明显提升,并以更低成本达到 Claude Fable 5.1 xhigh 相当水平。DeepSWE v1.1 软件工程测试里,GPT-6 Sol 在 max effort 下取得 68.8%,距 Claude Fable 5 的最高成绩 69.9% 仅差 1.1 个百分点,单任务成本却低约 80%;GPT-6 Luna 在 max effort 下为 66.6%,表现接近 Opus 5 与 Fable 5 的 medium effort,单任务成本分别低约 93% 和 96%。

计算机操作上,Astra 仍是 OpenAI 最强,但 Sol 和 Luna 能以更低成本完成相关任务。OSWorld 2.0 offline 测试中,GPT-6 Sol 在 xhigh effort 下取得 60.5%,与 Claude Opus 5 medium effort 的 60.3% 接近,单任务成本低约 80%;Luna 的 max effort 超过 GPT-5.6 Sol medium effort,成本约为后者十分之一。

OpenAI 还将 Astra 改进后的沟通风格带到 Sol 和 Luna,称新模型在技术与编程对话中更清晰、用更少术语与奇怪措辞、压缩低价值细节且不失实质。同时,官方改进了 GPT-6 提示缓存,默认提供更高缓存命中率,帮助智能体重用更多上下文、加快响应;价值对齐上,两款模型较 GPT-5.6 有所改进,编码工作的误导性声明发生率降低。

自今日起,GPT-6 Sol 和 Luna 已在 ChatGPT Work 与 Codex 中向所有 Plus、Pro、Business、Enterprise 和 Edu 用户开放,免费及 Go 用户可在桌面应用使用 Luna;API 中分别以 gpt-6-sol 与 gpt-6-luna 提供,目前尚未在 Chat 中上线。

编辑整理:阅读要点

  • 功能和价格可能随版本或地区变化,使用前应查看最新说明。
  • 安装软件或启用服务时,优先使用项目官方渠道并检查所需权限。
  • 是否适合长期使用,应结合自身设备、工作流和实际体验判断。

延伸阅读

查看相关项目或原始资料

Avatar photo

By Tony

Share via
Copy link