匠人学院 JR Academy学AI来匠人
匠人学院 JR Academy学AI来匠人

Follow Us

linkedinfacebooktwitterinstagramweiboyoutubebilibilitiktokxigua

We Accept

/image/layout/pay-paypal.png/image/layout/pay-visa.png/image/layout/pay-master-card.png/image/layout/pay-airwallex.png/image/layout/pay-alipay.png
EN

关于公司

关于我们元宇宙课堂新闻资讯匠人工作成为导师匠人导师联系我们匠人商店J3.Club

匠人资源

工作内推匠人活动1对1私教行业白皮书线上学习平台面试中心分享面试经验Internship会员中心

AI 工具

AI 工具箱考证匠 Cert Master求职匠 Job Hunter牛小匠 UniMate AI

AI 学习方向

全部学习方向AI EngineerContext EngineeringVibe CodingPrompt MasterAI BuilderAI 产品经理Python 入门

AI 应用提效

AI 办公提效AI 数据分析AI 财务AI 内容创作AI 视觉创作前端开发Hermes AgentOpenClaw 本地智能体

大学资源

墨尔本大学昆士兰大学新南威尔士大学悉尼大学莫那什大学阿德莱德大学RMITQUTUTS

少儿 AI 教育

Airbotix 少儿 AI 编程澳洲家长实用资料库NAPLAN 成绩单怎么看My School 学校数据指南悉尼私校学费 2026少儿编程课程与训练营

移民服务

澳洲移民技术移民189/190/491雇主担保482/186/494投资移民188/888英国移民美国移民加拿大移民

企业合作

P3职业孵化器Enterprise (EN)企业培训实习合作招聘合作申请合作

求职代理

岗位代投职位监控LinkedIn代运营LinkedIn人脉代加了解P3项目

匠人支持

FAQsTerms & ConditionsPrivacy PolicyCancellation & Refund PolicySite map

Top Categories

Web全栈班DevOps项目班数据工程全栈班数据分析项目班编程入门班Business Analyst实习算法集训营

求职就业

BA和产品经理实习数据科学实习数据分析实习Marketing实习简历修改面试指导导师指导VIP

地址

Level 10b, 144 Edward Street, Brisbane CBD(Headquarter)
Level 2, 171 La Trobe St, Melbourne VIC 3000
四川省成都市武侯区桂溪街道天府大道中段500号D5东方希望天祥广场B座45A13号
Business Hub, 155 Waymouth St, Adelaide SA 5000

联系方式

hello@jiangren.com.au0421-672-555

Disclaimer

footer-disclaimerfooter-disclaimer

JR Academy acknowledges Traditional Owners of Country throughout Australia and recognises the continuing connection to lands, waters and communities. We pay our respect to Aboriginal and Torres Strait Islander cultures; and to Elders past and present. Aboriginal and Torres Strait Islander peoples should be aware that this website may contain images or names of people who have since passed away.

匠人学院网站上的所有内容,包括课程材料、徽标和匠人学院网站上提供的信息,均受澳大利亚政府知识产权法的保护。严禁未经授权使用、销售、分发、复制或修改。违规行为可能会导致法律诉讼。通过访问我们的网站,您同意尊重我们的知识产权。JR Academy Pty Ltd 保留所有权利,包括专利、商标和版权。任何侵权行为都将受到法律追究。查看用户协议

© 2017-2026 JR Academy Pty Ltd. All rights reserved.

ABN 26621887572

首页/资源中心/文章详情
JR Academy · Blog职业洞察

GPT-5.6 全球放行:Sol / Terra / Luna 三档怎么选

GPT-5.6 于 7 月 9 日结束美政府审查全球开放。本文给出三档定价与场景映射、和 Claude Fable 5 的逐项基准对比(含 SWE-Bench Pro 争议)、Programmatic Tool Calling 与缓存断点的实际省钱算法。

发布日期2026-07-10
阅读时长2 分钟
作者

快速导航

  • 三档模型:名字花哨,分工其实很朴素
  • 基准:赢在 agent,输在 SWE-Bench Pro
  • API 侧的真正新东西:Programmatic Tool Calling
  • 为什么被政府压了两周
  • 上手第一周的几条 best practice
  • 怎么选:一个偷懒但够用的决策表

GPT-5.6 Sol Terra Luna 三档模型发布

2026 年 7 月 9 日上午 10 点(太平洋时间),OpenAI 把 GPT-5.6 系列——旗舰 Sol、均衡 Terra、轻量 Luna——同时推上 ChatGPT、Codex、ChatGPT Work 和 API,全球滚动开放 24 小时内完成。距离 6 月 26 日的"受信任合作伙伴限量预览"过去了整整两周。这两周不是 OpenAI 在憋大招,是美国政府要求先审后放。

我们的 AI 日报从 6 月 26 日预览那天就在追这条线,今天终于可以把完整的图景拼出来:价格、基准、新 API 能力,以及——说实话最有意思的——它输给 Claude 的那几项。

三档模型:名字花哨,分工其实很朴素

太阳、大地、月亮,命名比 GPT-4o / o3 / o4-mini 那套字母数字汤好记多了。分工也直白:

模型 输入 / 输出(每百万 token) 定位
gpt-5.6-sol $5 / $30 最难的问题:复杂编码、安全研究
gpt-5.6-terra $2.50 / $15 大批量业务:客服、内部工具、文档分析
gpt-5.6-luna $1 / $6 高频轻活:摘要、起草、例行自动化

三档都是 100 万 token 上下文、128K 最大输出、知识截止 2026 年 2 月 16 日。API 端不裁挡任何账户,自助开通就能用全部三档;裸模型 ID gpt-5.6 默认路由到 Sol。

ChatGPT 端有分层:免费档只在 Codex / Work 里给 Terra;Plus 给 Sol(中等推理档);Pro 和 Enterprise 才有完整的 Sol Pro 变体和 Ultra 模式。

对着 Sol 的 $5/$30 看一眼隔壁:Claude 家旗舰的定价一直更高,而 Terra 那档 $2.50/$15 明显是冲着"把企业批量任务从竞品那里撬过来"去的——Simon Willison 转述 OpenAI 的说法是 Terra 和 Luna 在部分任务上"以十六分之一的成本跑赢 Fable 5"。厂商自己说的话打个折听,但价格表是实打实的。

基准:赢在 agent,输在 SWE-Bench Pro

OpenAI 这次公布的基准表值得逐项看,因为它没有全赢——这反而让数据更可信。

Sol 领先的:Terminal-Bench 2.1 拿到 88.8%(Ultra 配置 91.9%),比 Claude Fable 5 的 83.4% 高出一截;Agents' Last Exam(55 个领域的长时程专业工作流评测)53.6 分,比 Fable 5 高 13.1 分;OSWorld 62.6%,computer use 类任务基本是 Sol 的主场。

Claude 领先的:SWE-Bench Pro 上 Fable 5 拿 80%,Sol 只有 64.6%,差距不小。GDPval 的 Elo 排名和 Intelligence Index 也还是 Claude 在前。

有意思的是 OpenAI 对 SWE-Bench Pro 的回应:他们发文说估计约 30% 的题目本身是坏的,暗示这个基准不值得较真。我没法独立验证这个说法,但一个厂商在自家发布日专门发文攻击一个自己输掉的基准,这个动作本身就说明分数戳到痛处了。

Simon Willison 上手一天后的评价比较克制:"肯定非常能干(definitely very competent),但复杂编码任务上还没有超过 Fable。"这和基准表的形状是吻合的:agent 编排、终端操作是 GPT-5.6 的强项,深水区代码修复还是 Claude 的地盘。

API 侧的真正新东西:Programmatic Tool Calling

这次发布里对开发者最实质的更新不是分数,是 Responses API 里的 Programmatic Tool Calling:模型不再一次一个地发 tool call JSON,而是直接生成一段 JavaScript,在一个无网络访问的隔离 V8 运行时里编排多个工具调用——循环、条件、并行都写在代码里。

省的是真金白银。MarkTechPost 引用的客户数据是 token 消耗降 38%–63.5%;OpenAI 自己的说法是编码基准上 Sol"用不到一半的输出 token 和不到一半的时间"跑完同样的活。如果你的 agent 每天要跑几千次"查数据 → 过滤 → 再查 → 汇总"这种链路,值得这周就去改造。

缓存也变了,这条容易被忽略但对账单影响很直接:

  • 支持显式 cache breakpoint(此前只有自动检测),缓存至少存活 30 分钟
  • 代价是从 GPT-5.6 起缓存写入要收 1.25 倍未缓存输入价,读取维持 90% 折扣

翻译成人话:以前缓存写入免费、命中打折,现在写入先多付 25%。长 system prompt + 高命中率的场景依然血赚,但"每次请求都换 prompt 前缀"的写法会比以前更亏。上线前拿自己的流量模式算一遍,别直接沿用旧的缓存策略。

另外两个小但实用的:推理档位加了 max(原来到 xhigh 封顶);Ultra 模式默认四个 agent 并行跑分解后的子任务,用 token 换墙钟时间——只开放给 Pro / Enterprise 和 Codex 付费档,本质是个"花钱买快"的开关。

为什么被政府压了两周

6 月 26 日预览时只给了大约 20 家合作伙伴,官方解释是美国政府要求对更广泛发布做审查。VentureBeat 当时的标题直接点了原因:per US Gov。

审什么?公开信息指向网络安全能力:GPT-5.6 在 ExploitBench 上拿到 73.5%,上一代是 47.9%——漏洞利用能力接近翻倍,这种跳变触发分阶段发布协议并不意外。上线后的产品里也留着痕迹:生成过程中会出现几秒的停顿,分类器在中途审查输出。用 API 做流式输出的注意下,这个停顿会影响你的超时和心跳逻辑。

顺带一提,GA 当天没有独立第三方审计报告发布。政府审完了,但审了什么、结论是什么,外界只有"放行"这一个事实。

上手第一周的几条 best practice

这些是从官方文档和这两天各家实测里能确认的做法,按"改动小、见效快"排序:

1. 别把 Sol 当默认。 裸 ID gpt-5.6 会路由到 Sol,很多人图省事直接写这个,等于每个请求都按 $5/$30 计费。正确做法是在自己的代码里做一层路由:分类、抽取、格式转换走 Luna,需要多步推理才升 Terra,只有 agent 编排和真正的难题给 Sol。OpenAI 自己的宣传口径是 Terra 在部分任务上以十六分之一的成本达到旗舰级效果——厂商话术归话术,但"大部分流量根本用不着旗舰"这件事在哪家模型上都成立。

2. 推理档位从低往高试。 这一代的 effort 梯子是 none / low / medium / high / xhigh / max 六档。习惯性拉满 max 的人,账单会先教育你。先用 medium 跑一遍自己的评测集,不达标再逐档往上加——很多任务在 high 和 max 之间根本看不出差别,token 却翻着涨。

3. 缓存策略要重写,不是沿用。 写入收 1.25 倍之后,赚钱公式变成了:命中率越高越赚,前缀越不稳定越亏。把 system prompt、few-shot 例子、工具定义这些不变的部分固定在最前面,打上显式 breakpoint,30 分钟窗口内的请求全部吃 90% 折扣。反过来,如果你的 prompt 前缀每次都在变(比如把时间戳、用户 ID 放开头),先把它们挪到末尾再谈别的。

4. 有多步工具链路的,优先改造成 Programmatic Tool Calling。 判断标准很简单:你的 agent 是不是经常"调工具 A → 拿结果过滤 → 再调工具 B → 汇总"?是的话每一步来回都在烧 token,改成让模型写一段 JS 一次性编排,实测省 38%–63.5%。注意那个 V8 沙箱没有网络访问,工具本身还是你宿主侧执行,别指望在里面 fetch。

5. 流式输出加宽超时。 生成中途会有几秒的安全分类器停顿,老代码里"5 秒没新 token 就断线重试"的心跳逻辑会误杀正常请求。上线前拿长输出任务压一遍。

6. Ultra 别当性能开关用。 它是花钱买墙钟时间:四个 agent 并行,token 消耗成倍涨。只对"可分解、赶时间"的任务值得——比如 code review 一个大 PR。日常任务开 Ultra 属于给 OpenAI 捐款。

怎么选:一个偷懒但够用的决策表

写给正在用 API 干活的人:

  • 在跑 agent / 终端自动化 / computer use → 换 Sol,这是它基准上最能打的领域
  • 大批量分类、客服、文档处理 → Terra,$2.50/$15 的价位配 1M 上下文,这一档目前没有明显更便宜的同级对手
  • 摘要、草稿、轻量自动化 → Luna,$1/$6 和上一代小模型持平
  • 深水区代码修复、大型 codebase 重构 → 先别急着全换,SWE-Bench Pro 的 15 个点差距和 Simon Willison 的上手感受都指向同一个结论:这类活 Claude 还是更稳

我们自己的判断:这次发布最被低估的是 Terra。旗舰对比抢头条,但真正走量的是 $2.50 档——企业批量任务的性价比之战才刚开始,DeepSeek V4 官版下周就来,还带着峰时定价。这一段我们会继续在每日 AI 日报里跟。


Sources:Simon Willison: The new GPT-5.6 family · MarkTechPost: GPT-5.6 Programmatic Tool Calling · DigitalApplied: GPT-5.6 GA · VentureBeat: limited preview per US Gov

作者
一键分享或复制链接
Lightman Wang
Reviewer: Lightman Wang

Founder of JR Academy

查看该作者的更多文章 →
← 上一篇发现一个专门给女生的免费tech计划,全免费下一篇 →Anthropic营收超OpenAI / DeepSeek自研芯片 / OpenAI拟让渡政府5%股权 / Meta Muse Spark 1.1 / 伊州AI安全法

相关文章推荐

OpenAI开发者大会❗人在澳洲也能看

2026-09-08

🇦🇺新发现!悉大9月居然有个🆓文化节

2026-09-07

USYD博物馆活动,5🔪做女神陶偶

2026-09-01

悉尼Town Hall管风琴音乐会🆓

2026-08-27

悉尼Mascot图书馆9月每周二🆓英语课

2026-08-26

澳洲AI Engineer 10层技术栈!你在哪层?

2026-08-25
查看全部文章 →
JR Academy
全球华人学习 AI 第一站
✓15000+ 学员
✓50+ 课程
✓AI 驱动学习平台
训练营免费资源AI学习职业辅导
精选推荐
AI 职业影响地图
测测你的职业风险等级,查看转型路径与学习方向
热门工具
AI & 数据训练营
系统化课程 + 真实项目实战,快速提升竞争力
热门课程
1v1 就业辅导
资深导师一对一指导,简历优化 + 面试准备
就业保障
企业内训定制
AI 技能培训方案,助力团队升级
企业服务
热门标签
Vibe CodingAI 编程CursorClaude求职攻略Prompt前端开发后端开发
订阅更新

获取最新 AI 学习资源、技术教程和求职攻略,直接送达邮箱。

我们尊重您的隐私,不会发送垃圾邮件