智见AI
GPT-5.6 发布后,Codex 的模型选择一下子变复杂了。
Sol、Terra、Luna 到底怎么选?Low、Medium、High、Extra High、Max、Ultra 六档推理强度又有什么区别?Ultra 既然最强,是不是复杂任务就应该直接拉满?
我最近花了不少时间查榜单、看 X 上的实测,也亲自踩了一个超级贵的坑。最后,我把自己的 Codex 调整成了下面这套配置。
如果你懒得研究,直接抄作业:
轻量任务
Sol Medium
速度优先,适合明确的小任务
日常默认 · 推荐
Sol High
复杂知识工作和编程的常驻档
困难任务
Sol Extra High
关键规划、疑难问题和重大交付
- Max 和 Ultra:直接在设置里关闭
- LazyCodex 负责自动分配子 Agent:检索和执行型工作交给 Luna,关键判断、规划和审查交给 Sol
- Terra:退出我的默认配置,需要时再单独调用
这样配置后来,我平时只需要判断当前任务用 Medium、High 还是 Extra High。子 Agent 应该用什么模型、开多少推理强度,交给 LazyCodex 自动处理。
文章最后,我放了一段可以直接复制给 Codex 的提示词。它会自动安装或更新 LazyCodex,并一次性完成角色配置。
一次 Ultra,把我的 5 小时额度直接烧光
先说我为什么强烈提议大家关闭 Ultra。
前一天,我只是让 Codex 修一个「模型选项无法更改」的配置问题。当时主模型用的是价格低于 Sol 的 Terra Ultra。
结果任务跑了一个多小时,问题还没有完整解决,我的 5 小时用量已经归零。
界面里同时出现了官方警告: Ultra 最多可能使用 1000 个 Agents,并且会快速消耗用量额度。

Terra Ultra 运行后触发官方 1000 Agents 警告,并耗尽 5 小时额度
Ultra 的问题不只在于「多开几个子 Agent」。Codex 的子 Agent 还可以继续向下派遣新的子 Agent,调用数量会递归放大。
更关键的是,目前 Codex 官方这套 Multi-Agent 机制里,子 Agent 默认继承主 Agent 的模型和推理强度。主 Agent 如果是 Sol Ultra,派出去的子 Agent 一般也是 Sol Ultra。你没有一个简单的入口,为每类子任务单独指定更便宜的模型。

子 Agent 继续向下派遣子 Agent 的事故现场
这次任务最后留下了 17 个已经结束的子 Agent。5 小时额度剩余 0%,周额度只剩 40%。

17 个子 Agent 完成后,5 小时额度归零、周额度剩余 40%
这个消耗会直接反映在 Pro 用户每天都能看到的使用额度里。对大多数人来说,Ultra 潜在的能力上限收益,抵不上它造成的额度失控风险。
X 上也已经有人遇到了一样问题。Theo 公开反馈,自己开启 Sol Ultra 后,子 Agent 同样继承了 Sol Ultra,几个 Agent 就能迅速烧掉一周额度。 查看原帖
注意 Ultra 目前更像压力测试入口,不适合作为日常工作模式。
GPT-5.6 的六档推理强度,到底该怎么选?
GPT-5.5 时代,大家熟悉的是 Low、Medium、High、Extra High 四档。GPT-5.6 又增加了 Max 和 Ultra。
你可以把它们简单理解成:
- Low:速度优先,适合明确、机械的小任务
- Medium:日常轻任务,速度和质量比较均衡
- High:大多数复杂知识工作和编程任务的默认档
- Extra High:复杂规划、疑难问题、关键交付前的深度处理
- Max:在 Extra High 之上继续增加推理投入
- Ultra:可以理解为 Max 再叠加 Codex 官方的 Multi-Agent 机制
这里最容易产生的误区,是把推理强度当成游戏画质:既然机器允许,就直接全部拉满。
实际上,推理强度越高,边际收益越小,消耗却会快速增加。从现有榜单看,Sol High 已经达到很强的水平;Extra High 还能带来一段明确提升;到了 Max,提升开始变得昂贵。
Max 并非完全没有价值。超大型项目的前期架构、超级复杂的研究设计、一次错误会造成很大损失的关键决策,可能值得临时开启。大部分 Pro 用户的日常任务,用到这里的机会很少。
我的使用习惯因此超级简单:
Sol High 常驻,简单任务降到 Medium,真正困难的任务升到 Extra High。Max 和 Ultra 默认不显示。

GPT-5.6 六档推理强度的使用边界:High 适合日常,Max 和 Ultra 默认关闭
为什么我的默认配置里没有 Terra?
这里要说清楚:Terra 不是一个不能用的模型。它的问题是,在目前的价格和能力曲线上,常常能被 Sol 或 Luna 替代。
Artificial Analysis 发布的 GPT-5.6 智能水平与任务成本图里,Sol 和 Luna 的各档位都位于 Terra 的更优位置。换句话说,对于同一档 Terra,往往能找到一个 Luna 或 Sol 档位,在不增加成本的情况下更机智,或者用更低成本达到接近的能力。

GPT-5.6 Intelligence 与单任务成本对比,Sol 和 Luna 位于 Terra 的更优前沿
这也是 Artificial Analysis 给出的公开结论:Luna 和 Sol 始终领先于 Terra,Luna 尤其体现出很强的成本效率。 阅读 GPT-5.6 分析 | 查看原始 X 帖子
这里需要区分不同榜单回答的问题。
上面的 Intelligence Index 是多类智能任务的综合指数,适合判断模型的通用能力和单位任务成本。DeepSWE 更聚焦真实软件工程:Agent 需要理解代码库、修改代码并完成验证。它覆盖 113 个任务,比单轮编程问答更接近我们在 Codex 里实际修 Bug、改功能的过程。对于编程场景,我会给 DeepSWE 更高的参考权重。
DeepSWE 的成本曲线里,Sol High 达到 69%,平均每个任务 3.47 美元;Sol Medium 达到 61%,平均成本 1.86 美元。High 已经站在超级强的能力区间,这也是我不提议普通用户默认开启 Max 的直接依据。

DeepSWE 分数与单任务成本曲线,Sol High 达到 69%
展开全部推理档位后,还能看到几组很有代表性的对比:
- Terra Medium:35%,平均成本 0.58 美元
- Luna High:44%,平均成本 0.78 美元
- Terra Extra High:60%,平均成本 2.13 美元
- Sol Medium:61%,平均成本 1.86 美元
- Terra Max:70%,平均成本 4.95 美元
- Sol Extra High:71%,平均成本 4.70 美元
这几组数据不能证明 Terra 在所有任务里都更差,却足以说明:如果我们要设计一套简单、稳定、适合大多数人的默认配置,Sol + Luna 已经覆盖了主要区间,没必要再增加一个需要用户反复权衡的 Terra。

DeepSWE 各模型与推理档位的通过率、成本、输出 Token 和执行步数
查看 Coding Agent Index 完整榜单
榜单负责告知我们模型在标准化任务里的能力和成本;X 上的用户反馈负责暴露真实产品行为;我自己的事故则说明这种行为会怎样影响 Pro 额度。三类证据放在一起,才足以支撑一套日常配置。
模型大小和推理强度,是两个不同的旋钮
Sol、Terra、Luna 的差异,的确 与模型大小有关。
OpenAI 没有公布三个模型具体有多少参数,但官方将它们称为三个不同的模型尺寸,并把 Sol 定位为旗舰、能力最强的型号;Terra 主打能力、速度和成本之间的平衡;Luna 是速度最快、成本最低的型号。 查看 OpenAI 官方说明
官方的 GPT-5.6 System Card 还直接把 Terra 和 Luna 称为更小的模型,并指出更大的模型在复杂任务、避免编辑冲突和实际准确性上一般表现更好。 查看 GPT-5.6 System Card
这可以协助我们理解两个容易混在一起的概念。
能力底座
模型大小
决定基础能力和能力上限
单次预算
推理强度
决定当前任务投入多少计算
更大的模型一般更擅长同时处理多条约束、跨领域信息、长期规划和异常情况,也更适合承担主控、规划、审查和最终决策。Medium、High、Extra High、Max 调整的是模型处理当前任务时的推理投入,并不会把 Luna 临时变成 Sol。现有榜单里 Sol Medium 可以超过 Terra Extra High,正好说明「模型能力」和「推理投入」不能混为一谈。
参数量本身也不能直接换算成智商、知识量或思考深度。模型最终表现还受训练数据、训练方法、模型架构、后训练和推理强度影响。我们可以把型号大小当成能力分层的信号,真正做配置时依旧要看官方定位和任务榜单。
因此,用 Sol 担任主 Agent 的依据很扎实。主 Agent 需要理解全局目标、拆解任务、决定调用谁、处理冲突并汇总结果。Luna 的速度和成本优势,则超级适合大量并行、边界清楚、结果容易验证的子任务。

模型大小决定能力上限,推理强度决定单次任务的推理投入
Sol 负责判断,Luna 负责跑腿
我最后采用的是一套很容易理解的分工。
Sol 放在主 Agent,以及真正需要判断力的岗位:规划、复杂执行、方案审查、代码审查和最终把关。
Luna 放在工作量大、可以并行、结果容易验证的岗位:搜索文件、查资料、跑测试、收集证据和执行明确步骤。
具体配置如下:
| LazyCodex 角色 | 模型与推理强度 | 对应的实际工作 |
|---|---|---|
| Explorer | Luna High | 在本地文件和项目中找线索 |
| Librarian | Luna High | 查资料、读文档、整理外部证据 |
| QA Executor | Luna High | 跑测试、做验证、回报结果 |
| Executor | Sol High | 完成需要综合判断的核心任务 |
| Metis | Sol High | 拆解问题、识别遗漏和风险 |
| Plan | Sol Extra High | 为复杂任务制定执行计划 |
| Momus | Sol Extra High | 挑计划的问题、做高强度审查 |
| Code/Clone/Gate Reviewers | Sol Extra High | 审查代码、交付质量和关键门槛 |

LazyCodex 按角色分配子 Agent:Sol 负责判断,Luna 负责执行
这套分工也符合目前 X 上比较有代表性的实践:让 Sol Extra High 负责规划,让 Luna High 负责执行。 查看 CJ Zafir 的配置
它同时适合两类任务。
做复杂知识工作时,Sol 可以负责研究框架、课程结构、Skill 设计和最终判断;Luna 可以同时搜索资料、阅读文档、核对来源、整理案例。
做编程任务时,Sol 可以负责架构、疑难修改和审查;Luna 可以负责探索代码库、查文档、跑测试和完成边界清晰的子任务。
为什么我依旧推荐 LazyCodex?
我之前推荐 LazyCodex,是由于 Codex 面对复杂任务时明明拥有子 Agent,却常常懒得主动使用。
那篇帖子获得了很高的流量,恰好说明这是许多人的共同痛点。

此前推荐 LazyCodex 的 X 帖子
GPT-5.6 上线后,Codex 官方显然也在解决这个问题。Ultra 给出的答案是:更主动地拆任务,更多地调用子 Agent,甚至允许子 Agent 继续向下派遣。
方向是对的,现阶段的默认资源分配还不够精细。
LazyCodex 的价值就在这里:它允许我们给不同角色指定不同的模型和推理强度。负责思考的角色用 Sol,负责搜索和执行的角色用 Luna。我们得到 Multi-Agent 的并行能力,同时把高价模型留给真正需要判断力的环节。
一条提示词,完成安装和配置
下面这段提示词面向 Codex Pro 用户。直接复制给 Codex 即可。
它不会替你修改全局主模型,也不会替你固定主 Agent 的推理强度。后来你只需要根据任务复杂度,在 Medium、High 和 Extra High 之间手动切换。
STEP 01
备份现有配置
→
STEP 02
安装或更新
→
STEP 03
配置角色路由
→
STEP 04
解析验证
请帮我安装或更新 LazyCodex(OMO),官方仓库: https://github.com/code-yeongyu/oh-my-openagent 目标:在保留我现有 Codex 配置的前提下,完成 LazyCodex 的最新版本安装/更新,并把 Multi-Agent 角色调整为下面这套 GPT-5.6 配置。 一、执行前 1. 先阅读仓库最新的 Codex 安装说明和本机现有配置,不要凭旧经验猜安装路径。 2. 备份 ~/.codex/config.toml 和本次需要修改的 ~/.codex/agents/*.toml 文件。 3. 保留我已有的权限、MCP、插件、Skills、Hooks、凭据和其他无关设置。 二、安装或更新 1. 如果尚未安装 LazyCodex,按官方最新方式安装。 2. 如果已经安装,更新到最新稳定版本,并运行官方提供的初始化/迁移流程。 3. 只修改当前实际生效的 Codex 配置和 Agent 文件,不修改插件缓存中的模板文件。 三、设置可见的推理强度 把 Codex Desktop 中可选择的推理强度限制为: low、medium、high、xhigh 隐藏 max 和 ultra。 不要修改我的全局主模型,也不要修改我的全局默认推理强度。 四、配置 LazyCodex 角色 请根据本机实际存在的 Agent 文件和角色语义完成映射: - Explorer:gpt-5.6-luna,high - Librarian:gpt-5.6-luna,high - QA Executor:gpt-5.6-luna,high - Executor:gpt-5.6-sol,high - Metis:gpt-5.6-sol,high - Plan:gpt-5.6-sol,xhigh - Momus:gpt-5.6-sol,xhigh - Code Reviewer/Clone Reviewer/Gate Reviewer 等代码、复刻和质量门禁审查角色:gpt-5.6-sol,xhigh 如果某个角色在当前版本中已改名,请根据官方说明和角色职责映射到新名称;如果无法确认,先保持原样并在结果中说明,不要自行创造不存在的角色。 五、验证 1. 使用 TOML 解析器检查所有修改后的配置,确保语法有效。 2. 核对 gpt-5.6-sol 和 gpt-5.6-luna 是否存在于本机当前 Codex 模型目录。 3. 确认 LazyCodex 能正常加载,Agent 文件来自当前生效目录。 4. 输出一张“角色/修改前/修改后”的对照表。 5. 明确列出备份文件位置、LazyCodex 版本、验证结果,以及是否需要重启 Codex Desktop。 整个过程直接执行到验证完成。遇到与我现有配置冲突的内容时,优先保留现有配置,并在最终报告中说明冲突和处理方式。
LazyCodex 后续更新有可能重新生成部分角色文件。如果更新后发现模型配置被重置,重新运行这段提示词即可。
最后的提议
GPT-5.6 带来的最大变化,是我们拥有了更高的能力上限,也拥有了更快烧完额度的方法。
对大多数 Codex Pro 用户,我提议从这套习惯开始:
主模型用 Sol,默认 High;简单任务降到 Medium,困难任务升到 Extra High;关闭 Max 和 Ultra;用 LazyCodex 把子 Agent 自动分配给 Sol 和 Luna。
这样,你只需要做一个决定:当前任务究竟有多复杂。
剩下的模型选择和 Agent 分工,让系统自己完成。
#Codex #gpt #skill #subagent #教程





