三个model、五个等级,新款Codex中的GPT-5.6究竟应该怎么选?

AI 产品与 Agent0 次阅读6 分钟
01-cover-three-models-five-levels.png

这两天 AI 业界的顶流是 OpenAI,它家新款 model GPT-5.6 上线,整个过程都挺魔幻的:

先是 Codex 被产品经理一声不吭地强行塞进 ChatGPT,图标和名字都被抹掉。

然后,死忠粉们在各大社区吵翻了天,吵到第二天,官方又服软,给它在应用里留了一块"牌位",算是保住了点体面。

这场闹剧之外,我们还是来关心一下背负着全村希望的 GPT-5.6 吧。

有了 5.6 加持,Codex 确实变聪明了,写代码、跑工具链都更利落。但代价也摆在那儿,更费 token 了。

GPT-5.6 一口气给出三个 model、五档推理强度,排列组合能凑出 15 种选法。选错了,5小时额度一把告罄(我已经经历过多次……);如果还是使用 API ,那账单保证能让你肉疼一整月。

这篇,我就是想把 15 种组合的选择逻辑、一次性给你捋清楚。

底稿是 OpenAI 官网发布的 GPT-5.6 指南,我把里头真正用得上的部分,整理成了这份中文操作指南。

先说model怎么选

GPT-5.6 一共三档,官方起了三个挺有画面感的名字:Sol、Terra、Luna。

Sol 是顶配,扛最难的活儿。复杂推理、多步骤规划、容错率极低的任务,都该甩给它。

Terra 是日常主力,绝大多数工作场景用它就够了,性价比最高的一档。

Luna 最快也最便宜,专门为高频、大批量的调用准备。你要跑几千次同样结构的请求,Luna 才是正确答案,不是 Sol。

很多人第一反应是"贵的总是好的",一律 Sol 走天下。这是最典型的浪费。Sol 是给"难"用的,不是给"多"用的。量大但简单的活儿丢给 Sol,等于用大炮打蚊子,钱花了,效果没差多少。

02-comparison-sol-terra-luna.png

再说强度怎么定

这一步才是真正烧钱的地方。

官方给出六档:None、Low、Medium、High、xHigh,加上这次新加的 Max。但 None 基本等于关掉推理,能用上的场合不多,真正需要你权衡的,是剩下这五档——标题里"五个等级",说的就是它们。

Low ,留给最基础的任务:简单问答、格式转换,不需要模型"想",直接出答案就行。

Medium 是默认档,官方内部测试的落点也在这里,涉及 MCP 调用、API 调用这类中等复杂度的任务,Medium 是性价比最优解。

High 和 xHigh,留给真正复杂的活儿:多步骤推理、跨文件的代码改动、需要模型自己判断优先级的任务。

Max 是压箱底的选项,官方原话是"最后手段",只有前面几档都跑不明白的极端复杂任务,才轮到它出场。日常任务动不动就上 Max,纯属打水漂。

03-comparison-five-effort-levels.png

模型选难度,强度选复杂度

三个model乘五档强度,正好十五种组合,但不用真的挨个试一遍。记住一条:模型选难度,强度选复杂度,两个维度分开想,就不会乱。

还有个容易搞混的选项,叫 Pro Mode。它不是第四个model,也不是第六档强度,是叠加在你已选的model和强度之上的一层增强,专门留给"哪怕多花点钱,也要把质量榨到极限"的场景。日常任务用不上它,也别把它当万能钥匙。

04-framework-selection-rule.png

别再写复杂提示词

选完model和强度,剩下的变量就是提示词本身了。官方的结论挺反直觉——提示词是越写越短,效果反而越好。内部测试里,把冗长的系统提示词换成精简版,分数涨了大概 15%,token 消耗反倒砍掉六成以上。这话搁过去几代模型身上未必成立,但对 5.6,堆字数就是在跟自己过不去。

具体怎么写,官方给了个“目标 + 模式 + 标准 + 格式”的四件套框架,我整理成中文、你直接照着填就行:

目标:你真正想要的结果,说清楚就行,别绕。
如果是回答、解释、评审或规划类需求:只检查相关材料并汇报结论,除非我明确要求,否则不要动手改东西。
如果是修改或搭建类需求:在授权范围内直接改,并跑完必要的非破坏性验证,不用每一步都等我确认;只有涉及外部写入、破坏性操作,或者范围明显超出预期时,才需要停下来问我。
验收标准:怎么判断这事儿算是做完了。
输出格式:你希望结果长什么样。

05-framework-prompt-four-piece.png

这四行里,"授权边界"那一句最容易被忽略,却是官方反复强调的重点。

GPT-5.6 比以前更主动、更能扛,你不划清"哪些能自己做、哪些必须停下来问",它就真敢自己往前冲。

但也别犯另一个错——把"先问我""别乱改""等我确认"在提示词里翻来覆去说三四遍。官方原话是,重复的授权提醒反而会触发不必要的确认动作,连该放手做的安全操作都被拦下来。划一次边界,说清楚就够了。

注意这几个坑

用起来之后,有几个坑建议提前知道。

缓存写入这次变贵了,按未缓存输入价格的 1.25 倍计费,长对话、频繁改提示词的场景,成本涨得比你想的快。

新加的"程序化工具调用",能省则省,一次调用能搞定的事,别非要写个小程序去跑,那是给真正需要批量处理、过滤中间结果的场景准备的,不是标配。

还有一个时间点需要留意下:GPT-5.4 定在 7 月 23 号退役,GPT-5.5 还留着,但官方建议是,与其等着被强制迁移,不如现在就把老提示词丢给 5.6,让它自己重写。毕竟 5.5 时代攒下的提示词习惯,未必能在 5.6 上原样跑通。尤其是你设置的定时任务,提前变更、免得报错。

Codex 那场闹剧,说到底就是一次没算清账的仓促决定,功能是加了,但没人提前想明白,这么一改,用户的token预算会经受什么样的冲击。

三个model、五档强度、十五种组合,看着复杂,落到实处就一句话:模型按难度选,强度按复杂度调,提示词按四件套写,剩下的交给系统自己判断。这套逻辑理清楚了,你的订阅额度才能撑得更久,你的账单,也才不会在月底给你一个惊喜。