首页 /
资讯中心 /
GPT-5.6全面开放:中档模型意外封神,最贵版本却在测试中翻车
资讯
GPT-5.6全面开放:中档模型意外封神,最贵版本却在测试中翻车
Tidhive 编辑部
2026-07-10 09:57
56 阅读
7月10日,OpenAI正式全面开放GPT-5.6系列,一共三款:Sol、Terra和Luna。同步上线的还有ChatGPT Work,这是OpenAI把Codex的部分能力搬进ChatGPT桌面端的尝试,被外界视为直接对标Claude Cowork的产品。
两周前,GPT-5.6还因为网络安全方面的考虑,只向少数经美国政府批准的机构开放。如今限制解除,社区用一整天的实测给出了三个不太一样的答案:一个意外出圈的"黑马",一个稳但不惊艳的主力款,以及一个花了更多钱却输给上一代的旗舰版本。
OpenAI给这次发布定的关键词是"效率"。但效率这两个字,在不同任务里算出的是完全不同的结果。
被忽视的中间档:Terra
发布后第一波体验中,最出乎意料的不是主打的Sol,而是定价介于Sol和Luna之间、原本没什么存在感的Terra。
有测试者用Terra完整生成了一套瑞士杠杆擒纵机构的三维模型——真实的齿轮比例、可以正常运作的擒纵结构、呼吸式游丝,指针真的能走时。更关键的是,模型自己检查了力学关系和视觉接触点,反复迭代直到整个机芯稳定运行。这位测试者形容,这种表现"已经很接近顶尖模型的水准"。
价格上,Terra的官方定价是输入每百万token 2.5美元,输出15美元。按OpenAI给出的数据,在考察长程专业工作流能力的Agents' Last Exam测试中,Terra和Luna用大约十六分之一的成本,跑出了超过顶级旗舰模型Fable 5的成绩。
Notion联合创始人Simon Last在官方公告中提到,不少原本跑在GPT-5.5上的智能体任务,切换到Terra后表现基本不变,但成本减半,token消耗也降低了。
不过市场对Terra的看法并不统一。也有用户在看过Artificial Analysis的性价比曲线图后表示,从数据上很难看出选择Terra的理由,认为Luna或Sol在整条曲线上都是更划算的选择。
Sol:安全牌,不是革命牌
相比Terra的意外走红,社区对主力款Sol的评价要冷静得多。
一位活跃在海外社交平台上的开源AI开发者总结道,Sol并不是像上一代旗舰Fable那样的全新架构,本质上只是在GPT-5.5基础上的一次扎实升级,谈不上革命性突破。但他也补充说,这仍然是目前订阅计划里能用到的最好的模型。
另一个流传更广的比喻来自内容平台Every的联合创始人兼CEO Dan Shipper,他把GPT-5.6和Fable 5的关系比作保时捷和曲速引擎——日常通勤用保时捷就够了,真要跨星系还得靠曲速引擎。
这个比喻背后有具体数据支撑。在Triple Whale的七项基准测试中,Sol得分4.4,GPT-5.5为4.0,而对标的Claude 4.8是3.5。从电商页面到数据仪表盘,Sol能持续交付完整、响应式的界面,每一项表现都刚好够用。
这恰恰是"日常通勤"型产品需要的东西:不是跑得最快的车,而是最不会让人迟到的车。OpenAI这次似乎没有打算在所有场景里和顶级旗舰硬拼极限能力,而是把重点放在了性能、速度和成本三者的平衡上。
Ultra的翻车现场
如果故事到Sol为止,这次发布会是一次干净利落的胜利。但最贵的Ultra版本,在一组物理模拟测试中出了问题。
某项目团队用四个模型跑了同一组HTML5物理演示测试,任务是生成三个自包含的物理场景:怪物卡车后空翻落在车顶上、特技车飞跃六辆大巴后撞墙、火车脱轨坠桥入水。测试结果显示:
GPT-5.6 Sol Ultra:消耗约3.29万token,成本0.33美元,但物理效果反而比上一代GPT-5.5更差;
GPT-5.5:消耗约1.24万token,成本0.11美元,在卡车翻转和火车脱轨两项测试中表现更好;
Claude Opus 4.8:消耗约9200token,成本0.24美元;
Grok 4.5:消耗约7000token,成本0.08美元,但三项测试里有两项失败。
三倍的价格,换来的却是更差的结果。测试者的结论毫不留情:Ultra画面细节更丰富,但物理表现实际上是退步的,本质上像是花三倍的钱,买了一个物理更弱、画面更好看的GPT-5.5。
OpenAI对Ultra的设计定位是"协调多个智能体并行工作",默认由四个智能体同时处理任务,用更多token换取更强的结果和更快的交付速度。这个逻辑在可拆分的并行任务上听起来合理,但物理测试揭开了一个结构性问题:多智能体协调本身也要消耗token,如果协调没有转化成更好的最终输出,用户实际上是在为更多的"内部讨论"买单,而不是更好的答案。
有分析人士补充解释,物理模拟这类任务恰好暴露了普通编码基准测不出来的弱点——模型可以用更多token去描述更丰富的场景,却依然在真正困难的部分掉链子:力的维持、动量、碰撞时机,以及跨帧的物体行为可信度。
需要说明的是,这组测试选择的物理模拟属于需要全局一致性的任务类型,Ultra的多智能体架构在可拆分的并行任务上可能有不同表现。但这也提醒用户:面对不可拆分的任务,更多智能体协作并不必然带来更好的结果。
模型还没用熟,下一代传闻已经在路上
GPT-5.6发布当天,社交平台上已经开始流传下一代GPT-6可能很快到来的消息。这一传闻尚未获得OpenAI官方确认,发布时间和技术路线目前都没有可靠信息。
但传闻本身击中了开发者的一种真实焦虑:模型迭代速度越来越快,为一个新模型调整好提示词、参数和工作流之后,这套适配到底能用多久?有用户直言,很多人还没来得及真正用上5.6系列,就已经在讨论下一代产品,这多少让整个5.6系列显得有些尴尬。
这种判断或许不完全公平,新模型出现并不意味着旧模型立刻失去价值。但对企业用户来说,模型的效率账不能只算每百万token的价格。切换模型、重新测试能力边界、修改提示词、迁移工作流,同样都是实实在在的成本。模型省下的钱,只有在被稳定使用足够长的时间之后,才真正算数。
效率牌,打给谁看
GPT-5.6的效率叙事,其实有两个不同的观众。
一个是开发者社区,他们在跑分、比价、算性价比,得出的结论是分裂的:Ultra不值,Sol够用,Terra争议最大——有人说它接近顶尖水准,也有人说它在性价比曲线上没有存在的必要。这两种判断能同时成立,是因为大家测的根本不是同一件事。
另一个观众,是资本市场。据媒体报道,OpenAI已经秘密提交IPO招股书,私募市场估值约为8520亿美元,且正在寻求一万亿美元的IPO估值;Anthropic今年5月完成新一轮融资后估值达到9650亿美元,成为全球最有价值的AI公司。两家公司都在争夺同一个上市窗口。
"更好或持平,但更便宜",这句话更像是说给企业CFO听的,而不是说给开发者听的。CFO关心的是单位智能成本,开发者关心的是极端场景下模型到底行不行——这本来就不是同一件事。
而在GPT-5.6发布当天,几个外围动作让"效率"这张牌显得格外拥挤:Anthropic在发布后宣布调整Claude的周度费率,被部分用户解读为对OpenAI新动作的直接回应;Meta同日发布了Muse Spark 1.1;SpaceX方面则在前一天发布了Grok 4.5。同一周内,四家公司都有大动作——效率显然不是OpenAI一家的独家故事,而是整个行业价格战的一部分。
那道线
把24小时的社区评测数据放在一起看,GPT-5.6呈现出的画像,比官方博客描述的要复杂,也更真实。
Terra是最容易被低估的一款,用远低于旗舰的成本跑出了接近顶尖水准的表现,证明效率提升是真实存在的,只是没有出现在最先被关注的那个型号上。Sol是安全的选择而非革命性的选择,"保时捷不是曲速引擎"这个比喻之所以传播得快,正是因为它精准地绕开了官方叙事的夸大成分,给出了一个用户真正用得上的定位。Ultra的物理测试则至少证明了一件事:多智能体并行不会自动带来更好的结果,在需要维持统一规则和跨帧一致性的任务里,协调成本可能会抵消并行带来的收益。
而悬在整个5.6系列头顶的,是GPT-6的传闻——这也是效率叙事里最深的一层矛盾:一边被告知这个模型很省、很值,一边又清楚它可能下个月就被新一代取代。
社区翻完GPT-5.6发布首日的账单,得到的答案不是简单的"好"或"不好",而是同一个"效率",在不同任务里算出了完全不同的结果。OpenAI算的是基准成绩、token消耗和预估成本;开发者算的是具体任务能不能一次做对;而企业最终要算的,是切换模型、重新适配和长期运行之后的总账。
GPT-5.6带来的效率提升是真实的,但它并不统一,也不是换上新模型就会自动兑现。Terra在部分工作流里展现出了很强的性价比,Sol提供了更稳妥的性能与成本平衡,Ultra则需要更挑任务——多花出去的token,必须换来足够好的结果,才能算作真正的效率。
归根结底,模型变得更便宜,不等于任务一定做得更省。真正有意义的效率,永远只有一种:花更少的钱,把事情做完,还不用返工。