别再什么都问 Codex 了:产品方向交给 ChatGPT,执行才归 Codex
先说破一个误区:产品方向的问题,不该问执行模型
先回忆一下:你上一次纠结「这个功能到底做不做」「这个方向对不对」「竞品是怎么玩的」的时候——你是问谁的?
如果你和大多数人一样,直接丢给了 Codex(或你手头的任何执行 Agent),那你正在用最贵的方式,干它最不顺手的活。这不是模型的错,是工种分错了。两类问题,其实是两个工种:
- 产品方向类:做什么、为什么做、方向对不对、怎么规划、竞品调研、方案裁决——要的是「判断」。这类问题的最优解是 ChatGPT 网页版的最大档:它在规划与权衡上的深度是公认的强项,而且对订阅用户来说,这份额度与你烧钱的执行额度分开计——不用,就是浪费。
- 执行类:写代码、改文件、跑测试、批量处理——要的是「动手」。交给本地执行 Agent(Codex / Claude Code / 任何顺手的工具),能用便宜档就用便宜档。
为什么这个误区代价大?两个原因:① 执行模型在「低头干活」时,看不到你全部的真实背景,做规划只能靠你转述——转述必然丢事实,规划质量靠运气;② 它每想一轮,烧的都是你最贵的执行额度。有人真实账单是「一天一个 200 美元档的号、三个号轮着烧」,大头就烧在这种「想」上。
前阵子很火的《分享一个大幅节省 Codex 额度的邪修方法》(作者卡兹克)其实讲的就是这件事的另一半:把规划的活从执行额度里搬出去,别浪费了你的 ChatGPT 订阅。而本文往下要讲的,是这条分工真正跑通后的完整形态——不只是省钱,还要拿得到事实、留得下文档。
拨正分工后,你会多出三样东西
把「想」搬回 ChatGPT、「做」留给执行 Agent,你立刻多出三样东西:
- 更好的规划——网页版最大档在规划、调研、取舍上的判断力是它的主场;更关键的是,下面的系统会把它和你的真实项目接起来,让它不再靠你转述猜。
- 省下来的额度 / token——最贵的「想」搬去了另一个额度池,执行额度只花在「做」上。参考爆文作者实测:一次规划从执行额度搬到网页版,省下约 10% 的周额度;连续一周,就是「日抛号」和「月付号」的距离。
- 直接到手的文档——它做出来的规划、调研报告、内部设计文档,不是躺在聊天记录里,而是直接写进你的项目目录(下面「通道二」),进版本库、可交接、可追溯。
但要同时拿到这三样,直接开聊还不够,有三堵墙要拆:它默认看不到你的项目(第一堵墙)、聊完的东西会散掉(第二堵墙)、单模型判断没人兜底(第三堵墙)。
我的解法:读、写、援三条通道
我自己重度依赖 AI 推进项目,包括一个对精确性、可追溯性要求极高的长期数据研究项目。我给执行模型写死了一条规则:遇到产品级问题,一律上抛 ChatGPT——把 ChatGPT 拉到最大。为了让它上抛得动,我把三堵墙拆成了三条通道:本机桥接服务 + ChatGPT 官方开发者模式私有插件 + 一套协议纪律。它已经跑过 20 多轮真实重大咨询(编号排到 R23):从架构评审、方案裁决,到项目结案终审;每一轮的发送件、回复件、裁决结果全部落盘归档。
和「只读数据 MCP」的参考做法相比,它多走了三步:
| 能力 | 只读 MCP 参考做法 | 本系统 |
|---|---|---|
| 读真实材料 | 线上数据只读 | 代码 / 测试 / diff / 报告 只读直连 |
| 写回产出 | — | 调研 / 草稿 / 产出直接落盘 |
| 第二模型交叉 | — | Gemini 交叉评议桥 |
| 执行闭环 | 人工转交 | 证据包 + 独立复审 + 采纳门 |
| 全程留痕 | 部分 | 发送 / 回复 / 裁决全量归档 |
下面把三个「场景插件」逐个拆开。它们分别对应三个动作:读、写、援。
通道一 · 读:只读证据通道——让 ChatGPT 直接读你的真实项目
第一堵墙是「看不到」。普通的用法是复制粘贴给它看——但你不可能把整个仓库贴进去,而且贴过去的内容,它也只能「看过就算」,没有出处、无法对账。
我的做法是把项目本身接给它:通过官方 Secure MCP Tunnel 挂了一条只读证据通道。它可以列目录、读文件、搜代码、看 git 状态和 diff、读测试报告——全部是真实、实时的文件,不是截图,不是转述。
- 最小权限:整条通道不可写。它能「看到」一切该看的,但碰不了任何东西;
- 快照绑定:每次读取绑定当时的快照与文件哈希——它读到的是「某一刻的冻结事实」,结论与证据能对得上账;
- 全程审计:每次调用留痕,但文件内容不进审计日志(隐私优先)。
这条通道的价值在实战里被验证过不止一次。最典型的一次:它读完我的真实交付文件后,直接点破「这道验收门被手动预填过参数、已经失效」——那是一次差点发生的「假通过」。转述永远给不出这种结论,只有读原文才行。
从这以后我的观念就变了:对 ChatGPT 最好的尊重,是给它事实,而不是给它总结。
通道二 · 写:公共空间——规划、调研、内部文档直接落盘
第二个痛点:聊完就散。最值钱的结论如果不变成文件、不进版本库,三天后就找不到了——更别说它替你写好的规划文档、调研报告、内部设计文档。
所以第二堵墙我用一个公共空间来拆:我指定一个本地目录,ChatGPT 可以直接在里面工作——创建文件、校验哈希后原子更新、追加内容、复制、移动、重命名、删除(限空目录),甚至能直接用本地 Git 工具提交。它的调研、草稿、产出从此直接落在我的硬盘上,我不用复制粘贴一个字。
我把这个空间按用途分了目录:调研/、草稿/、产出/、项目交接/。一个真实例子:一次内容产品「要不要出海」的重要调研,它交叉验证后写出的 1.3 万字符结论,直接归入产出目录——从决策到归档全自动,没有经过我的剪贴板。
它的边界全部是写死的:
- 只能动这一个目录,别处一概碰不到;
- 单次写入不超过 24KB、单文件不超过 1MB,防「手滑写爆」;
- 每一次写操作全部审计留痕;
- 代码证据通道保持纯只读——「能写文件」与「能看代码」分成两条通道,互不污染。
注意这里的顺序:先读(事实)→ 再判断 → 最后写(产出)。不是让它边写边想,而是想清楚后直接交付成品——规划、调研、内部文档,一次到位。
通道三 · 援:Gemini 交叉评议桥——不做单点判断
第三个痛点:单点判断。重要决策最怕「一个模型说了算」——它语气越自信,你越危险。
所以我接了第三条通道:ChatGPT 在对话中可以直接呼叫第二个模型(Gemini 高档)做交叉评议,还能使用联网搜索工具(返回带来源链接的线索)。重大分歧不再只有一个声音。
实战里它真的会主动用:一次「要不要启用某个功能」的裁决,ChatGPT 自己叫了 Gemini 来交叉,两边不一致的地方被单独标了出来——而不一致本身,就是最有价值的信号。
处置规则同样是写死的:收敛才执行;分歧不自裁。两份意见原文归档,升格为人工裁决项。宁可慢一步,不要错一步。
怎么用它干活:一天的真实流程
系统装好后,日常干活就是这个循环。全程你只有两个动作:提问和验收。
- 遇到产品级问题——先停手。执行 Agent 卡在没把握的方向问题、或你自己拿不准时,不要让它硬写。硬写出来的东西,返工比重问贵得多。
- 打开 ChatGPT 网页版,确认两件事:模型选到最大档;插件挂上你的通道(只读证据 + 公共空间)。
- 按「任务包」提问。背景 1–2 句 + 要决策的 3–5 个问题 + 输出格式要求。不用复制粘贴文件——它自己会去读你项目里的真实代码、测试和文档。
- 等它思考完。几分钟到几十分钟都正常。期间别催、别重发、别打断——被打断的生成会污染会话,还白花钱。
- 拿回结论,顺手把文档留下。裁决和方案在对话里看完;要沉淀的,直接让它在「公共空间」写成文件——规划、调研、内部文档一步到位,不用你复制粘贴一个字。
- 交给执行 Agent 落地,证据回捞复核。执行 Agent 照规划干活、跑真实测试;再把证据包发回来让 ChatGPT 做一轮独立复核——通过才算完事,全程留痕。
整个循环里:它负责想和写,执行 Agent 负责做,你负责问和对。这套节奏里最贵的一步是「跳过提问、直接硬做」——省哪一步,都别省这个顺序。
把「发送键」也交给 Agent:Ego 浏览器自动化
上面这套循环还有个进阶形态:连「提问」这个动作本身,也可以交给 Agent 自动完成。
我的方案是 Ego 浏览器(推荐)——一个为 Agent 设计的浏览器:每个任务开一个独立的「空间」(Space),Agent 在里面自己打开 ChatGPT、挂好插件、把任务包写进输入框、发送、守候回复、再把答复原文提取出来存档。全程可见、可控:你可以随时点「接管」亲手接手,或「终止任务」一键叫停。
配上前面讲的协议纪律(一轮只发一颗子弹、只读等待不打断、回复原文落盘),这套自动化把「记得去问」变成了「结果自己送上门」。它也解释了这套系统真正的杠杆:不只是问答更快,而是整个「咨询—裁决—归档」循环可以无人值守地转起来。
成品先看:这套系统全自动跑出来的东西
说一百遍不如看成品。下面两个入口都是公开可访问的(只读、已脱敏),而且它们本身就是这套系统的产物——从资料整理、蒸馏、结构化卡片,到看板部署,全程由 AI 按上面这套流程自动完成:
| 成品 | 说明 | 入口(公开只读) |
|---|---|---|
| 核心知识库与决策系统 | 数百小时课程资料蒸馏出的结构化知识库:主题决策卡、关键帧定义、Q&A 问答库、推荐书单,附三维决策看板 | 内部系统,不对外 |
| 脱敏运行看板 | 研究管线的只读实时状态:验证进度、实验档案、待决事项——整条管线按本文的协作纪律自动运转 | 内部系统,不对外 |
看这两个入口时,可以带一个问题:如果这一整套产出都能由「AI + 纪律 + 这套协作系统」自动完成,你的项目里有多少活,其实也可以?
想知道它们具体是怎么被一步步造出来的?四套系统的完整生产流程 + 34 件生产工具盘点见《我的 AI 工作流全公开》。
让系统不翻车的六条纪律
三条通道是「器」,下面这些纪律是「法」。说实话,它们比工具值钱——因为每一条都是真实翻车换来的:
- 单次任务包:背景、目标、约束、材料、输出格式一次给全,让它只做判断、不做探索——贵模型的多轮「自己摸索」是最贵的浪费;
- 只读等待,禁止重发:模型思考时重发 = 打断生成 + 污染会话 + 重复劳动。这条是被「服务端错误 + 碎片回复」教做人之后定成的铁律;
- 一题一会话:不同任务用不同会话——串台会带来锚定污染,它会被上一个项目的结论悄悄带偏;
- 采纳门:模型的一切输出先当作「不可信输入」——本地重建可执行方案、独立复核、跑真实测试,全部通过才允许落地。模型不能直接执行任何东西;测试没过,不许「通过」;
- 全量留痕:每一轮的发送件、回复件、裁决结果全部落盘——可回溯、可复查。项目结题时,这批材料的价值不比代码低;
- 结论落地不等追认:方向性问题才停下来请示;已经审过的结论直接执行——你的注意力才是最贵的。
实战:量化项目里的「外脑」怎么干活
抽象说不如看场景。以下都是脱敏后的真实用法:
- 设计评审:一个阶段的设计文档完成后打包上抛(它可以自己翻真实文件对账),从纸面逻辑里挑出实现层矛盾,逐项给出修正要求——我按修正执行,一次过;
- 结案终审:项目阶段收口时,把它拉来做「结案评审」:支持 / 反对 / 附条件,三种结论都可以,但必须给证据链。拿到「支持」或「附条件落地完成」,阶段才允许关闭;
- 分歧仲裁:同一问题同时开两条独立通道(ChatGPT + 另一个顶级模型)。意见收敛就直接执行;分歧不自动裁决——两份裁决原文归档,升级为人工决策项;
- 调研落盘:重要外部调研,让它交叉调研、必要时叫 Gemini,结论直接写进公共空间「产出/」归档。
结果一句话:便宜模型只干执行的活;最聪明的那份智力被拉到最大;每一句结论都能拿证据对账。
一次真实的「外脑立功」:它救了一个已经失效的验收门
说一个我最愿意拿出来讲的案例(R18)。当时一个研究项目准备结案,材料看起来是齐的:指标有、报告有、门禁也"通过"了。我把材料包上抛给外脑做结案评审。
它做了一件我自己没做的事——顺着只读通道翻开了原始代码文件对账。然后它发现了三个纸面上完全看不出来的问题:
- 「验收门」是假的:报告里的关键校验字段是被手动预填的占位值(
SHA=待填类),这意味着自动校验分支从一开始就永远不会真正执行——门看起来在,实际上是装饰; - 身份预检名不副实:文档里宣称的核查范围,比代码实现的实际范围大——声明超出实现;
- 「哈希一致」被当作完整性证明:文件哈希相同 ≠ 内容被完整验收过,这里存在逻辑跳跃。
这三个发现直接把这个阶段从"可以结案"打回"不可结案",并升级为最高优先级修复——全部落地后才重新过审。事后我们的结论:执行者自己检查自己写的门,永远会漏掉"门本身没有真正通电"这种问题;只有把原始证据交给一个"不甘心只看报告"的独立读者,才抓得住。
数字侧写:这套系统跑了多少活
| 维度 | 实测数字 |
|---|---|
| 编号裁决轮次 | 24 轮(R1–R24),全部归档 |
| 裁决回复总量 | 329,183 字节全文保存 |
| 单轮输出体量 | 9.7K–13.1K 字符/轮;最长一轮思考 9 分钟 |
| 回执记录 | 348 份(ACCEPT 76 / REVISE 133 / STOP 5)——近四成意见是"打回重做",这才是它敢当"审稿人"的证明 |
| 一次视觉审查的强度 | 单次自主执行 55 次工具调用、9 种视口、15 张截图 |
| 负面验收战绩 | 测试全绿但界面不可用的合成产品——被判 REVISE + 本地视觉门 FAIL,拒绝签发成功回执 |
成本与安全:省在明处,走官方通道
成本结构非常清晰,而且省在明处:
- 一份订阅(Pro 更佳):网页版高档模型的额度与执行额度分开计——最贵的「想」放这里,不烧执行池。参考爆文作者实测:单次规划省约 10% 周额度;对「一天一个号」的用法,这是从日抛变回月付的距离(额度规则以官方为准);
- 便宜档执行(GLM / 本地模型):「做」的部分放在这里,成本完全可控;
- 本机桥接服务:跑在你自己电脑上,零云成本。
安全与合规,这段必须说重:整套系统全程官方通道——ChatGPT 官方开发者模式私有插件 + OpenAI Secure MCP Tunnel。不反代、不把订阅额度「转出」给第三方工具、不共享账号、不绕过任何限制。
我知道很多人会问:「为什么不直接把网页版额度反代出来给本地用?」因为那条路是拿你的账号去跟平台规则争辩:额度路径不可控、稳定性靠运气、被风控没有申诉路径。本系统是让 ChatGPT 用官方插件能力「主动进来工作」——两条路从根上就不是同一件事。
常见问题
没有 Pro 能用吗?Plus 也能跑通全流程;Pro 的网页档额度更充裕,适合重度使用。
一定要用 Ego 浏览器吗?不是必须。手工在浏览器里提问同样能跑通全套流程(本文前半部分就是);Ego 是把「发送键」也自动化,适合咨询频繁、想彻底解放双手的场景,配置指导包含在交付里。
我只用 Claude Code / Cursor,不用 Codex,行吗?行。执行侧任何本地工具都可以——系统只要求它能读写文件、能跑测试;「产品方向归 ChatGPT、执行归本地工具」的分工不变。
会省多少额度?取决于你把多少「想」的活搬过去。参考实测:单次规划省约 10% 周额度;重度用法(每天烧一个号)体感最明显——省下来的全是原本烧在规划上的执行额度。
会不会被风控?全程官方通道,不做任何反代与绕过;但我不会承诺「零风险」——任何平台的使用政策以官方为准。真正的高风险区是反代类做法,本系统不碰。
我的数据安全吗?默认只读;写入限一个目录 + 限额 + 全审计;不读取密钥类文件;模型没有任何 shell / 浏览器 / 任意命令能力。
支持 Windows 吗?协议跨平台;搭建文档以 macOS 为主,Windows 可以远程协助。
值不值?如果你每月 AI 账单 ≥ 一份订阅,或者经常被 AI「想当然」坑到返工——这套系统就是为你做的。
关于本文与说明
本文思路受公开讨论启发:卡兹克《分享一个大幅节省 Codex 额度的邪修方法》提出的「只读 MCP + 网页版规划」做法;本系统在其思路上做了更进一步的工程化:读写分离、交叉评议、证据闭环。文中提及的额度节省与实战效果为个人实测参考,不构成任何保证;ChatGPT、OpenAI、Gemini、Google 等均为其各自公司的商标,本系统为个人开发的第三方工具套件,与上述公司无隶属关系;所有平台功能与政策以官方为准。
更多教程与工具:主页 aizhuozhi.com;联系邮箱 master@aizhuozhi.cn。