Codex中GPT 5.6的最佳配置|附一键配置Prompt

内容分享1周前发布
18 1 0

智见AI

GPT-5.6 发布后,Codex 的模型选择一下子变复杂了。

Sol、Terra、Luna 到底怎么选?Low、Medium、High、Extra High、Max、Ultra 六档推理强度又有什么区别?Ultra 既然最强,是不是复杂任务就应该直接拉满?

我最近花了不少时间查榜单、看 X 上的实测,也亲自踩了一个超级贵的坑。最后,我把自己的 Codex 调整成了下面这套配置。

如果你懒得研究,直接抄作业:

轻量任务

Sol Medium

速度优先,适合明确的小任务

日常默认 · 推荐

Sol High

复杂知识工作和编程的常驻档

困难任务

Sol Extra High

关键规划、疑难问题和重大交付

  • Max 和 Ultra:直接在设置里关闭
  • LazyCodex 负责自动分配子 Agent:检索和执行型工作交给 Luna,关键判断、规划和审查交给 Sol
  • Terra:退出我的默认配置,需要时再单独调用

这样配置后来,我平时只需要判断当前任务用 Medium、High 还是 Extra High。子 Agent 应该用什么模型、开多少推理强度,交给 LazyCodex 自动处理。

文章最后,我放了一段可以直接复制给 Codex 的提示词。它会自动安装或更新 LazyCodex,并一次性完成角色配置。

一次 Ultra,把我的 5 小时额度直接烧光

先说我为什么强烈提议大家关闭 Ultra。

前一天,我只是让 Codex 修一个「模型选项无法更改」的配置问题。当时主模型用的是价格低于 Sol 的 Terra Ultra。

结果任务跑了一个多小时,问题还没有完整解决,我的 5 小时用量已经归零。

界面里同时出现了官方警告: Ultra 最多可能使用 1000 个 Agents,并且会快速消耗用量额度。

Codex中GPT 5.6的最佳配置|附一键配置Prompt

Terra Ultra 运行后触发官方 1000 Agents 警告,并耗尽 5 小时额度

Ultra 的问题不只在于「多开几个子 Agent」。Codex 的子 Agent 还可以继续向下派遣新的子 Agent,调用数量会递归放大。

更关键的是,目前 Codex 官方这套 Multi-Agent 机制里,子 Agent 默认继承主 Agent 的模型和推理强度。主 Agent 如果是 Sol Ultra,派出去的子 Agent 一般也是 Sol Ultra。你没有一个简单的入口,为每类子任务单独指定更便宜的模型。

Codex中GPT 5.6的最佳配置|附一键配置Prompt

子 Agent 继续向下派遣子 Agent 的事故现场

这次任务最后留下了 17 个已经结束的子 Agent。5 小时额度剩余 0%,周额度只剩 40%。

Codex中GPT 5.6的最佳配置|附一键配置Prompt

17 个子 Agent 完成后,5 小时额度归零、周额度剩余 40%

这个消耗会直接反映在 Pro 用户每天都能看到的使用额度里。对大多数人来说,Ultra 潜在的能力上限收益,抵不上它造成的额度失控风险。

X 上也已经有人遇到了一样问题。Theo 公开反馈,自己开启 Sol Ultra 后,子 Agent 同样继承了 Sol Ultra,几个 Agent 就能迅速烧掉一周额度。 查看原帖

注意 Ultra 目前更像压力测试入口,不适合作为日常工作模式。

GPT-5.6 的六档推理强度,到底该怎么选?

GPT-5.5 时代,大家熟悉的是 Low、Medium、High、Extra High 四档。GPT-5.6 又增加了 Max 和 Ultra。

你可以把它们简单理解成:

  • Low:速度优先,适合明确、机械的小任务
  • Medium:日常轻任务,速度和质量比较均衡
  • High:大多数复杂知识工作和编程任务的默认档
  • Extra High:复杂规划、疑难问题、关键交付前的深度处理
  • Max:在 Extra High 之上继续增加推理投入
  • Ultra:可以理解为 Max 再叠加 Codex 官方的 Multi-Agent 机制

这里最容易产生的误区,是把推理强度当成游戏画质:既然机器允许,就直接全部拉满。

实际上,推理强度越高,边际收益越小,消耗却会快速增加。从现有榜单看,Sol High 已经达到很强的水平;Extra High 还能带来一段明确提升;到了 Max,提升开始变得昂贵。

Max 并非完全没有价值。超大型项目的前期架构、超级复杂的研究设计、一次错误会造成很大损失的关键决策,可能值得临时开启。大部分 Pro 用户的日常任务,用到这里的机会很少。

我的使用习惯因此超级简单:

Sol High 常驻,简单任务降到 Medium,真正困难的任务升到 Extra High。Max 和 Ultra 默认不显示。

Codex中GPT 5.6的最佳配置|附一键配置Prompt

GPT-5.6 六档推理强度的使用边界:High 适合日常,Max 和 Ultra 默认关闭

为什么我的默认配置里没有 Terra?

这里要说清楚:Terra 不是一个不能用的模型。它的问题是,在目前的价格和能力曲线上,常常能被 Sol 或 Luna 替代。

Artificial Analysis 发布的 GPT-5.6 智能水平与任务成本图里,Sol 和 Luna 的各档位都位于 Terra 的更优位置。换句话说,对于同一档 Terra,往往能找到一个 Luna 或 Sol 档位,在不增加成本的情况下更机智,或者用更低成本达到接近的能力。

Codex中GPT 5.6的最佳配置|附一键配置Prompt

GPT-5.6 Intelligence 与单任务成本对比,Sol 和 Luna 位于 Terra 的更优前沿

这也是 Artificial Analysis 给出的公开结论:Luna 和 Sol 始终领先于 Terra,Luna 尤其体现出很强的成本效率。 阅读 GPT-5.6 分析 | 查看原始 X 帖子

这里需要区分不同榜单回答的问题。

上面的 Intelligence Index 是多类智能任务的综合指数,适合判断模型的通用能力和单位任务成本。DeepSWE 更聚焦真实软件工程:Agent 需要理解代码库、修改代码并完成验证。它覆盖 113 个任务,比单轮编程问答更接近我们在 Codex 里实际修 Bug、改功能的过程。对于编程场景,我会给 DeepSWE 更高的参考权重。

DeepSWE 的成本曲线里,Sol High 达到 69%,平均每个任务 3.47 美元;Sol Medium 达到 61%,平均成本 1.86 美元。High 已经站在超级强的能力区间,这也是我不提议普通用户默认开启 Max 的直接依据。

Codex中GPT 5.6的最佳配置|附一键配置Prompt

DeepSWE 分数与单任务成本曲线,Sol High 达到 69%

展开全部推理档位后,还能看到几组很有代表性的对比:

  • Terra Medium:35%,平均成本 0.58 美元
  • Luna High:44%,平均成本 0.78 美元
  • Terra Extra High:60%,平均成本 2.13 美元
  • Sol Medium:61%,平均成本 1.86 美元
  • Terra Max:70%,平均成本 4.95 美元
  • Sol Extra High:71%,平均成本 4.70 美元

这几组数据不能证明 Terra 在所有任务里都更差,却足以说明:如果我们要设计一套简单、稳定、适合大多数人的默认配置,Sol + Luna 已经覆盖了主要区间,没必要再增加一个需要用户反复权衡的 Terra。

Codex中GPT 5.6的最佳配置|附一键配置Prompt

DeepSWE 各模型与推理档位的通过率、成本、输出 Token 和执行步数

查看 Coding Agent Index 完整榜单

榜单负责告知我们模型在标准化任务里的能力和成本;X 上的用户反馈负责暴露真实产品行为;我自己的事故则说明这种行为会怎样影响 Pro 额度。三类证据放在一起,才足以支撑一套日常配置。

模型大小和推理强度,是两个不同的旋钮

Sol、Terra、Luna 的差异,的确 与模型大小有关。

OpenAI 没有公布三个模型具体有多少参数,但官方将它们称为三个不同的模型尺寸,并把 Sol 定位为旗舰、能力最强的型号;Terra 主打能力、速度和成本之间的平衡;Luna 是速度最快、成本最低的型号。 查看 OpenAI 官方说明

官方的 GPT-5.6 System Card 还直接把 Terra 和 Luna 称为更小的模型,并指出更大的模型在复杂任务、避免编辑冲突和实际准确性上一般表现更好。 查看 GPT-5.6 System Card

这可以协助我们理解两个容易混在一起的概念。

能力底座

模型大小

决定基础能力和能力上限

单次预算

推理强度

决定当前任务投入多少计算

更大的模型一般更擅长同时处理多条约束、跨领域信息、长期规划和异常情况,也更适合承担主控、规划、审查和最终决策。Medium、High、Extra High、Max 调整的是模型处理当前任务时的推理投入,并不会把 Luna 临时变成 Sol。现有榜单里 Sol Medium 可以超过 Terra Extra High,正好说明「模型能力」和「推理投入」不能混为一谈。

参数量本身也不能直接换算成智商、知识量或思考深度。模型最终表现还受训练数据、训练方法、模型架构、后训练和推理强度影响。我们可以把型号大小当成能力分层的信号,真正做配置时依旧要看官方定位和任务榜单。

因此,用 Sol 担任主 Agent 的依据很扎实。主 Agent 需要理解全局目标、拆解任务、决定调用谁、处理冲突并汇总结果。Luna 的速度和成本优势,则超级适合大量并行、边界清楚、结果容易验证的子任务。

Codex中GPT 5.6的最佳配置|附一键配置Prompt

模型大小决定能力上限,推理强度决定单次任务的推理投入

Sol 负责判断,Luna 负责跑腿

我最后采用的是一套很容易理解的分工。

Sol 放在主 Agent,以及真正需要判断力的岗位:规划、复杂执行、方案审查、代码审查和最终把关。

Luna 放在工作量大、可以并行、结果容易验证的岗位:搜索文件、查资料、跑测试、收集证据和执行明确步骤。

具体配置如下:

LazyCodex 角色 模型与推理强度 对应的实际工作
Explorer Luna High 在本地文件和项目中找线索
Librarian Luna High 查资料、读文档、整理外部证据
QA Executor Luna High 跑测试、做验证、回报结果
Executor Sol High 完成需要综合判断的核心任务
Metis Sol High 拆解问题、识别遗漏和风险
Plan Sol Extra High 为复杂任务制定执行计划
Momus Sol Extra High 挑计划的问题、做高强度审查
Code/Clone/Gate Reviewers Sol Extra High 审查代码、交付质量和关键门槛

Codex中GPT 5.6的最佳配置|附一键配置Prompt

LazyCodex 按角色分配子 Agent:Sol 负责判断,Luna 负责执行

这套分工也符合目前 X 上比较有代表性的实践:让 Sol Extra High 负责规划,让 Luna High 负责执行。 查看 CJ Zafir 的配置

它同时适合两类任务。

做复杂知识工作时,Sol 可以负责研究框架、课程结构、Skill 设计和最终判断;Luna 可以同时搜索资料、阅读文档、核对来源、整理案例。

做编程任务时,Sol 可以负责架构、疑难修改和审查;Luna 可以负责探索代码库、查文档、跑测试和完成边界清晰的子任务。

为什么我依旧推荐 LazyCodex?

我之前推荐 LazyCodex,是由于 Codex 面对复杂任务时明明拥有子 Agent,却常常懒得主动使用。

那篇帖子获得了很高的流量,恰好说明这是许多人的共同痛点。

Codex中GPT 5.6的最佳配置|附一键配置Prompt

此前推荐 LazyCodex 的 X 帖子

GPT-5.6 上线后,Codex 官方显然也在解决这个问题。Ultra 给出的答案是:更主动地拆任务,更多地调用子 Agent,甚至允许子 Agent 继续向下派遣。

方向是对的,现阶段的默认资源分配还不够精细。

LazyCodex 的价值就在这里:它允许我们给不同角色指定不同的模型和推理强度。负责思考的角色用 Sol,负责搜索和执行的角色用 Luna。我们得到 Multi-Agent 的并行能力,同时把高价模型留给真正需要判断力的环节。

一条提示词,完成安装和配置

下面这段提示词面向 Codex Pro 用户。直接复制给 Codex 即可。

它不会替你修改全局主模型,也不会替你固定主 Agent 的推理强度。后来你只需要根据任务复杂度,在 Medium、High 和 Extra High 之间手动切换。

STEP 01

备份现有配置

STEP 02

安装或更新

STEP 03

配置角色路由

STEP 04

解析验证

请帮我安装或更新 LazyCodex(OMO),官方仓库: https://github.com/code-yeongyu/oh-my-openagent 目标:在保留我现有 Codex 配置的前提下,完成 LazyCodex 的最新版本安装/更新,并把 Multi-Agent 角色调整为下面这套 GPT-5.6 配置。 一、执行前 1. 先阅读仓库最新的 Codex 安装说明和本机现有配置,不要凭旧经验猜安装路径。 2. 备份 ~/.codex/config.toml 和本次需要修改的 ~/.codex/agents/*.toml 文件。 3. 保留我已有的权限、MCP、插件、Skills、Hooks、凭据和其他无关设置。 二、安装或更新 1. 如果尚未安装 LazyCodex,按官方最新方式安装。 2. 如果已经安装,更新到最新稳定版本,并运行官方提供的初始化/迁移流程。 3. 只修改当前实际生效的 Codex 配置和 Agent 文件,不修改插件缓存中的模板文件。 三、设置可见的推理强度  Codex Desktop 中可选择的推理强度限制为: low、medium、high、xhigh 隐藏 max  ultra。 不要修改我的全局主模型,也不要修改我的全局默认推理强度。 四、配置 LazyCodex 角色 请根据本机实际存在的 Agent 文件和角色语义完成映射: - Explorer:gpt-5.6-luna,high - Librarian:gpt-5.6-luna,high - QA Executor:gpt-5.6-luna,high - Executor:gpt-5.6-sol,high - Metis:gpt-5.6-sol,high - Plan:gpt-5.6-sol,xhigh - Momus:gpt-5.6-sol,xhigh - Code Reviewer/Clone Reviewer/Gate Reviewer 等代码、复刻和质量门禁审查角色:gpt-5.6-sol,xhigh 如果某个角色在当前版本中已改名,请根据官方说明和角色职责映射到新名称;如果无法确认,先保持原样并在结果中说明,不要自行创造不存在的角色。 五、验证 1. 使用 TOML 解析器检查所有修改后的配置,确保语法有效。 2. 核对 gpt-5.6-sol  gpt-5.6-luna 是否存在于本机当前 Codex 模型目录。 3. 确认 LazyCodex 能正常加载,Agent 文件来自当前生效目录。 4. 输出一张“角色/修改前/修改后”的对照表。 5. 明确列出备份文件位置、LazyCodex 版本、验证结果,以及是否需要重启 Codex Desktop。 整个过程直接执行到验证完成。遇到与我现有配置冲突的内容时,优先保留现有配置,并在最终报告中说明冲突和处理方式。

LazyCodex 后续更新有可能重新生成部分角色文件。如果更新后发现模型配置被重置,重新运行这段提示词即可。

最后的提议

GPT-5.6 带来的最大变化,是我们拥有了更高的能力上限,也拥有了更快烧完额度的方法。

对大多数 Codex Pro 用户,我提议从这套习惯开始:

主模型用 Sol,默认 High;简单任务降到 Medium,困难任务升到 Extra High;关闭 Max 和 Ultra;用 LazyCodex 把子 Agent 自动分配给 Sol 和 Luna。

这样,你只需要做一个决定:当前任务究竟有多复杂。

剩下的模型选择和 Agent 分工,让系统自己完成。

#Codex #gpt #skill #subagent #教程

© 版权声明

相关文章

1 条评论

none
暂无评论...