9月23日消息,OpenAI推出GPT-6系列新模型GPT-6 Sol与GPT-6 Luna。 OpenAI官方称,这两款模型沿用和GPT-6 Astra相近的训练方案,把Astra在专业任务、事实准确性、代码编写、计算机调用以及对齐能力上的顶尖性能,移植到速度更快、成本更低的模型当中。
GPT-6 Sol和Luna的API定价,相比GPT-5.6的促销价格下调了50%。OpenAI官方同时说明,GPT-6 Astra依旧是综合性能最强的模型,如果追求顶尖效果、想要无折损的使用体验,优先选择GPT-6 Astra。
性能测试数据显示,在AutomationBench跨应用业务流程评测里,高强度xhigh档位下GPT-6 Sol的表现超过Claude Opus 5,单任务成本仅为后者的9%。在high强度测试中,GPT-6 Luna相比前代性能提升5.4%,单任务成本下降58%。
智能体评测Last Exam的结果显示,max effort模式下GPT-6 Sol拿到56.4%的分数,成绩超过Claude Opus 5的该项测试最高分,同时单任务成本减少60%。
事实准确性上,GPT-6 Sol 和 Luna 两款模型均有明显进步。在OpenAI使用脱敏真实对话开展的测试中,GPT-6 Sol的出错率大约只有前代模型的一半,可靠性接近Astra,但成本更加低廉。GPT-6 Luna的事实可靠程度同样大幅增强,使用成本也有所下降。
编程能力上,GPT-6 Sol和Luna都针对AI代码智能体任务负载做了优化。在FrontierCode 1.1 Main测试中,GPT-6 Sol对比GPT-5.6 Sol提升显著,能用更低的成本取得和Claude Fable 5.1 xhigh相近的表现。
在DeepSWE v1.1软件工程测试中,max effort模式下GPT-6 Sol得分68.8%,仅比Claude Fable 5的最高分69.9%少1.1个百分点,单任务成本降低约80%。GPT-6 Luna在max effort档位拿到66.6%,性能接近Opus 5与Fable 5在medium effort模式下的水平,单任务成本分别低约93%、96%。
计算机操作能力上,OpenAI称GPT-6 Astra依旧是旗下该能力最强的模型,不过Sol和Luna对比上一代模型,可以用更低开销完成同类任务。
OSWorld 2.0离线测试结果显示,xhigh effort模式下的GPT-6 Sol得分60.5%,和Claude Opus 5在medium effort模式的60.3%基本持平,单任务成本降低约80%。GPT-6 Luna在max effort档位的表现优于GPT-5.6 Sol的medium effort,成本仅为后者的十分之一。
OpenAI把GPT-6 Astra优化后的表达风格下放至Sol和Luna。官方表示,两款新模型在技术、编程对话里表述更加易懂,专业术语、怪异句式以及冗余无效内容有所减少,回复篇幅也更精简,同时保留核心有效信息。
除API降价之外,OpenAI还为基于GPT-6开发的应用降低重复上下文的开销。官方升级了GPT-6提示缓存机制,默认提升缓存命中效率,方便智能体复用上下文信息,实现更快应答。
与此同时,GPT-6 Sol与Luna在价值对齐能力上也获得优化。OpenAI内部对齐测试显示,两款模型对比GPT-5.6版本均有进步,在代码相关内容上产生虚假误导陈述的概率有所下降。
根据OpenAI公告,GPT-6 Sol和GPT-6 Luna即日起于ChatGPT Work以及Codex上线,Plus、Pro、Business、Enterprise和Edu用户均可使用。免费用户与Go用户可在桌面客户端体验GPT-6 Luna,当前Chat板块暂未接入这两款模型。在OpenAI API内,模型标识分别为gpt-6-sol和gpt-6-luna。
