卓智/Skill 产品线/SKILL-03 · 外脑协作系统 ID: SKILL-03-COLLAB实战跑通
AI 协作系统 · 分工纠偏

别再什么都问 Codex 了:产品方向交给 ChatGPT,执行才归 Codex

更新:2026-10 · 阅读约 13 分钟 · 一套跑过 20+ 轮真实裁决的「外脑」协作系统 · 文末含获取方式与说明

如果你把「产品该怎么做、这个方向对不对」也丢给执行模型硬想——这篇就是写给你的。跑通「产品方向 → ChatGPT,执行 → Codex」这条分工,你需要一套系统把 ChatGPT 接到你的真实项目上:读得到事实、写得出文档、叫得动第二意见。全程只走官方通道。
24 轮编号裁决(每轮都是真实项目决策)
32.9 万字节回复全文归档 · 可复查可追溯
348 份回执记录(含 133 次"打回重做")

先说破一个误区:产品方向的问题,不该问执行模型

先回忆一下:你上一次纠结「这个功能到底做不做」「这个方向对不对」「竞品是怎么玩的」的时候——你是问谁的?

如果你和大多数人一样,直接丢给了 Codex(或你手头的任何执行 Agent),那你正在用最贵的方式,干它最不顺手的活。这不是模型的错,是工种分错了。两类问题,其实是两个工种:

  • 产品方向类:做什么、为什么做、方向对不对、怎么规划、竞品调研、方案裁决——要的是「判断」。这类问题的最优解是 ChatGPT 网页版的最大档:它在规划与权衡上的深度是公认的强项,而且对订阅用户来说,这份额度与你烧钱的执行额度分开计——不用,就是浪费。
  • 执行类:写代码、改文件、跑测试、批量处理——要的是「动手」。交给本地执行 Agent(Codex / Claude Code / 任何顺手的工具),能用便宜档就用便宜档。

为什么这个误区代价大?两个原因:① 执行模型在「低头干活」时,看不到你全部的真实背景,做规划只能靠你转述——转述必然丢事实,规划质量靠运气;② 它每想一轮,烧的都是你最贵的执行额度。有人真实账单是「一天一个 200 美元档的号、三个号轮着烧」,大头就烧在这种「想」上。

前阵子很火的《分享一个大幅节省 Codex 额度的邪修方法》(作者卡兹克)其实讲的就是这件事的另一半:把规划的活从执行额度里搬出去,别浪费了你的 ChatGPT 订阅。而本文往下要讲的,是这条分工真正跑通后的完整形态——不只是省钱,还要拿得到事实、留得下文档。

❌ 常见用法:什么都问执行模型 「这个功能做不做?」—— 问它 「方向对不对?」—— 问它 「帮我调研竞品」—— 问它 烧最贵额度 · 规划靠转述 · 文档拿不走 ✅ 正确分工:把工种分开 产品方向 / 规划 / 调研 / 裁决 → 交给 ChatGPT(最大档)· 额度与执行池分开 写码 / 改文件 / 跑测试 / 批处理 → 交给本地执行 Agent · 能用便宜档就用 额度各归各池 · 规划用最强大脑 · 文档直接落盘
同一台电脑、同一件事:工种分错,钱和产出两头亏;工种分开,额度省下来、规划强起来、文档留下来

拨正分工后,你会多出三样东西

把「想」搬回 ChatGPT、「做」留给执行 Agent,你立刻多出三样东西:

  • 更好的规划——网页版最大档在规划、调研、取舍上的判断力是它的主场;更关键的是,下面的系统会把它和你的真实项目接起来,让它不再靠你转述猜。
  • 省下来的额度 / token——最贵的「想」搬去了另一个额度池,执行额度只花在「做」上。参考爆文作者实测:一次规划从执行额度搬到网页版,省下约 10% 的周额度;连续一周,就是「日抛号」和「月付号」的距离。
  • 直接到手的文档——它做出来的规划、调研报告、内部设计文档,不是躺在聊天记录里,而是直接写进你的项目目录(下面「通道二」),进版本库、可交接、可追溯。

但要同时拿到这三样,直接开聊还不够,有三堵墙要拆:它默认看不到你的项目(第一堵墙)、聊完的东西会散掉(第二堵墙)、单模型判断没人兜底(第三堵墙)。

我的解法:读、写、援三条通道

我自己重度依赖 AI 推进项目,包括一个对精确性、可追溯性要求极高的长期数据研究项目。我给执行模型写死了一条规则:遇到产品级问题,一律上抛 ChatGPT——把 ChatGPT 拉到最大。为了让它上抛得动,我把三堵墙拆成了三条通道:本机桥接服务 + ChatGPT 官方开发者模式私有插件 + 一套协议纪律。它已经跑过 20 多轮真实重大咨询(编号排到 R23):从架构评审、方案裁决,到项目结案终审;每一轮的发送件、回复件、裁决结果全部落盘归档。

和「只读数据 MCP」的参考做法相比,它多走了三步:

能力只读 MCP 参考做法本系统
读真实材料线上数据只读代码 / 测试 / diff / 报告 只读直连
写回产出—调研 / 草稿 / 产出直接落盘
第二模型交叉—Gemini 交叉评议桥
执行闭环人工转交证据包 + 独立复审 + 采纳门
全程留痕部分发送 / 回复 / 裁决全量归档
系统全景:把「想」和「做」分开,让「想」读得到事实、写得出产出、叫得动援军 ① 执行层|便宜档模型 · 本地模型 · 你的主控 写代码 · 跑测试 · 做批量 —— 最贵的额度不花在这里 遇到产品级问题 → 强制上抛,不许硬写 ② 咨询协议|任务包单次提交 · 只读等待防打断 · 回复全文落盘 · 一轮只发一颗子弹 材料内嵌 · 结论落地不等追认 · 全过程留痕归档 完整上下文(不是转述) ③ ChatGPT|网页版 · 最大档(额度与执行档分开计) 读 · 只读证据通道 直接读真实代码 / 测试 / diff 最小权限 · 快照绑定 · 审计 每一条结论都能对账 写 · 公共空间 规划 / 调研 / 内部文档落盘 哈希校验 · 限额 · 可回溯 产出直接进版本库 援 · Gemini 交叉评议 第二模型独立意见 联网搜索 · 来源可查 分歧不独裁 裁决 / 方案下行 —— 直接执行,不等追认 ④ 闭环|聊完不算完 本地执行 按裁决落地 证据包 退出码 / 测试数 独立复审 ChatGPT 复核 采纳门 不过不许过 入库上线 全程留痕
执行层负责「做」,ChatGPT 负责「想」;读得到事实、写得出产出、叫得动援军——然后才谈执行

下面把三个「场景插件」逐个拆开。它们分别对应三个动作:读、写、援。

通道一 · 读:只读证据通道——让 ChatGPT 直接读你的真实项目

第一堵墙是「看不到」。普通的用法是复制粘贴给它看——但你不可能把整个仓库贴进去,而且贴过去的内容,它也只能「看过就算」,没有出处、无法对账。

我的做法是把项目本身接给它:通过官方 Secure MCP Tunnel 挂了一条只读证据通道。它可以列目录、读文件、搜代码、看 git 状态和 diff、读测试报告——全部是真实、实时的文件,不是截图,不是转述。

  • 最小权限:整条通道不可写。它能「看到」一切该看的,但碰不了任何东西;
  • 快照绑定:每次读取绑定当时的快照与文件哈希——它读到的是「某一刻的冻结事实」,结论与证据能对得上账;
  • 全程审计:每次调用留痕,但文件内容不进审计日志(隐私优先)。
ChatGPT 设置中的 Codex Read-only Verification 插件详情:权限为允许使用只读工具
实拍:只读插件详情页——权限被锁死在「允许使用只读工具」,以官方开发者模式(dev mode)接入,没有任何写权限

这条通道的价值在实战里被验证过不止一次。最典型的一次:它读完我的真实交付文件后,直接点破「这道验收门被手动预填过参数、已经失效」——那是一次差点发生的「假通过」。转述永远给不出这种结论,只有读原文才行。

从这以后我的观念就变了:对 ChatGPT 最好的尊重,是给它事实,而不是给它总结。

通道二 · 写:公共空间——规划、调研、内部文档直接落盘

第二个痛点:聊完就散。最值钱的结论如果不变成文件、不进版本库,三天后就找不到了——更别说它替你写好的规划文档、调研报告、内部设计文档。

所以第二堵墙我用一个公共空间来拆:我指定一个本地目录,ChatGPT 可以直接在里面工作——创建文件、校验哈希后原子更新、追加内容、复制、移动、重命名、删除(限空目录),甚至能直接用本地 Git 工具提交。它的调研、草稿、产出从此直接落在我的硬盘上,我不用复制粘贴一个字。

我把这个空间按用途分了目录:调研/、草稿/、产出/、项目交接/。一个真实例子:一次内容产品「要不要出海」的重要调研,它交叉验证后写出的 1.3 万字符结论,直接归入产出目录——从决策到归档全自动,没有经过我的剪贴板。

ChatGPT 公共空间目录结构:调研、草稿、产出、项目交接四个分区
实拍:公共空间目录——ChatGPT 写出的调研、规划与内部文档直接落在「产出/」「项目交接/」里,进版本库、可交接、可追溯

它的边界全部是写死的:

  • 只能动这一个目录,别处一概碰不到;
  • 单次写入不超过 24KB、单文件不超过 1MB,防「手滑写爆」;
  • 每一次写操作全部审计留痕;
  • 代码证据通道保持纯只读——「能写文件」与「能看代码」分成两条通道,互不污染。

注意这里的顺序:先读(事实)→ 再判断 → 最后写(产出)。不是让它边写边想,而是想清楚后直接交付成品——规划、调研、内部文档,一次到位。

通道三 · 援:Gemini 交叉评议桥——不做单点判断

第三个痛点:单点判断。重要决策最怕「一个模型说了算」——它语气越自信,你越危险。

所以我接了第三条通道:ChatGPT 在对话中可以直接呼叫第二个模型(Gemini 高档)做交叉评议,还能使用联网搜索工具(返回带来源链接的线索)。重大分歧不再只有一个声音。

实战里它真的会主动用:一次「要不要启用某个功能」的裁决,ChatGPT 自己叫了 Gemini 来交叉,两边不一致的地方被单独标了出来——而不一致本身,就是最有价值的信号。

处置规则同样是写死的:收敛才执行;分歧不自裁。两份意见原文归档,升格为人工裁决项。宁可慢一步,不要错一步。

ChatGPT 插件设置列表:ChatGPT 公共空间、Codex 只读验证、Codex Task Control、Gemini Flash High Bridge
实拍:设置 → 插件——读(Read-only Verification)写(公共空间)援(Gemini Flash High Bridge)三个自研插件与官方插件并列,各自权限单独可控

怎么用它干活:一天的真实流程

系统装好后,日常干活就是这个循环。全程你只有两个动作:提问和验收。

1 发现问题 · 停手 产品级问题不硬写 返工比重问贵得多 2 任务包提问 · 挂插件 材料不用贴 它自己读真实项目 3 等它思考 · 别打断 几分钟到几十分钟正常 催与重发 = 白花钱 4 收回结论 · 留文档 规划 / 调研 / 内部文档 直接写进项目目录 5 执行落地 · 按规划干 执行 Agent 动手 真实测试产出证据包 6 证据复核 · 才收工 ChatGPT 独立复核 通过才算完事,全留痕 提问一次,省掉的是一轮盲试的额度与返工——这个循环越跑越顺
你只做两件事:提问、验收;「想和写」归 ChatGPT,「做」归执行 Agent
  1. 遇到产品级问题——先停手。执行 Agent 卡在没把握的方向问题、或你自己拿不准时,不要让它硬写。硬写出来的东西,返工比重问贵得多。
  2. 打开 ChatGPT 网页版,确认两件事:模型选到最大档;插件挂上你的通道(只读证据 + 公共空间)。
  3. 按「任务包」提问。背景 1–2 句 + 要决策的 3–5 个问题 + 输出格式要求。不用复制粘贴文件——它自己会去读你项目里的真实代码、测试和文档。
  4. 等它思考完。几分钟到几十分钟都正常。期间别催、别重发、别打断——被打断的生成会污染会话,还白花钱。
  5. 拿回结论,顺手把文档留下。裁决和方案在对话里看完;要沉淀的,直接让它在「公共空间」写成文件——规划、调研、内部文档一步到位,不用你复制粘贴一个字。
  6. 交给执行 Agent 落地,证据回捞复核。执行 Agent 照规划干活、跑真实测试;再把证据包发回来让 ChatGPT 做一轮独立复核——通过才算完事,全程留痕。
ChatGPT 对话框 + 菜单中的插件列表
实拍:对话框点「+」就能挂载插件——上面那三个通道插件就在这个列表里,提问前确认要用的已挂上
真实咨询实录:挂着公共空间插件提问,ChatGPT 读取真实文件后作答
真实咨询实录(脱敏):挂上「公共空间」插件提问 → 它自己读取真实文件、思考 56 秒作答——没有复制粘贴,结论直接基于原文。这就是「读得到事实」的样子

整个循环里:它负责想和写,执行 Agent 负责做,你负责问和对。这套节奏里最贵的一步是「跳过提问、直接硬做」——省哪一步,都别省这个顺序。

把「发送键」也交给 Agent:Ego 浏览器自动化

上面这套循环还有个进阶形态:连「提问」这个动作本身,也可以交给 Agent 自动完成。

我的方案是 Ego 浏览器(推荐)——一个为 Agent 设计的浏览器:每个任务开一个独立的「空间」(Space),Agent 在里面自己打开 ChatGPT、挂好插件、把任务包写进输入框、发送、守候回复、再把答复原文提取出来存档。全程可见、可控:你可以随时点「接管」亲手接手,或「终止任务」一键叫停。

Ego 浏览器的空间管理界面:多个任务空间并行运行
实拍:Ego 浏览器的空间列表——多个咨询任务并行跑在各自独立的空间里,互不串台(「一题一会话」纪律的工程化实现)
Agent 正在控制 ChatGPT 会话:一条决策包被自动送达,等待回复
实拍:Agent 正在控制——一条完整的「决策包」被自动送进 ChatGPT 并守候回复;底部可随时「接管」或「终止任务」,人始终保持最终控制权

配上前面讲的协议纪律(一轮只发一颗子弹、只读等待不打断、回复原文落盘),这套自动化把「记得去问」变成了「结果自己送上门」。它也解释了这套系统真正的杠杆:不只是问答更快,而是整个「咨询—裁决—归档」循环可以无人值守地转起来。

成品先看:这套系统全自动跑出来的东西

说一百遍不如看成品。下面两个入口都是公开可访问的(只读、已脱敏),而且它们本身就是这套系统的产物——从资料整理、蒸馏、结构化卡片,到看板部署,全程由 AI 按上面这套流程自动完成:

成品说明入口(公开只读)
核心知识库与决策系统数百小时课程资料蒸馏出的结构化知识库:主题决策卡、关键帧定义、Q&A 问答库、推荐书单,附三维决策看板内部系统,不对外
脱敏运行看板研究管线的只读实时状态:验证进度、实验档案、待决事项——整条管线按本文的协作纪律自动运转内部系统,不对外

看这两个入口时,可以带一个问题:如果这一整套产出都能由「AI + 纪律 + 这套协作系统」自动完成,你的项目里有多少活,其实也可以?

想知道它们具体是怎么被一步步造出来的?四套系统的完整生产流程 + 34 件生产工具盘点见《我的 AI 工作流全公开》。

让系统不翻车的六条纪律

三条通道是「器」,下面这些纪律是「法」。说实话,它们比工具值钱——因为每一条都是真实翻车换来的:

  1. 单次任务包:背景、目标、约束、材料、输出格式一次给全,让它只做判断、不做探索——贵模型的多轮「自己摸索」是最贵的浪费;
  2. 只读等待,禁止重发:模型思考时重发 = 打断生成 + 污染会话 + 重复劳动。这条是被「服务端错误 + 碎片回复」教做人之后定成的铁律;
  3. 一题一会话:不同任务用不同会话——串台会带来锚定污染,它会被上一个项目的结论悄悄带偏;
  4. 采纳门:模型的一切输出先当作「不可信输入」——本地重建可执行方案、独立复核、跑真实测试,全部通过才允许落地。模型不能直接执行任何东西;测试没过,不许「通过」;
  5. 全量留痕:每一轮的发送件、回复件、裁决结果全部落盘——可回溯、可复查。项目结题时,这批材料的价值不比代码低;
  6. 结论落地不等追认:方向性问题才停下来请示;已经审过的结论直接执行——你的注意力才是最贵的。

实战:量化项目里的「外脑」怎么干活

抽象说不如看场景。以下都是脱敏后的真实用法:

  • 设计评审:一个阶段的设计文档完成后打包上抛(它可以自己翻真实文件对账),从纸面逻辑里挑出实现层矛盾,逐项给出修正要求——我按修正执行,一次过;
  • 结案终审:项目阶段收口时,把它拉来做「结案评审」:支持 / 反对 / 附条件,三种结论都可以,但必须给证据链。拿到「支持」或「附条件落地完成」,阶段才允许关闭;
  • 分歧仲裁:同一问题同时开两条独立通道(ChatGPT + 另一个顶级模型)。意见收敛就直接执行;分歧不自动裁决——两份裁决原文归档,升级为人工决策项;
  • 调研落盘:重要外部调研,让它交叉调研、必要时叫 Gemini,结论直接写进公共空间「产出/」归档。

结果一句话:便宜模型只干执行的活;最聪明的那份智力被拉到最大;每一句结论都能拿证据对账。

一次真实的「外脑立功」:它救了一个已经失效的验收门

说一个我最愿意拿出来讲的案例(R18)。当时一个研究项目准备结案,材料看起来是齐的:指标有、报告有、门禁也"通过"了。我把材料包上抛给外脑做结案评审。

它做了一件我自己没做的事——顺着只读通道翻开了原始代码文件对账。然后它发现了三个纸面上完全看不出来的问题:

  • 「验收门」是假的:报告里的关键校验字段是被手动预填的占位值(SHA=待填类),这意味着自动校验分支从一开始就永远不会真正执行——门看起来在,实际上是装饰;
  • 身份预检名不副实:文档里宣称的核查范围,比代码实现的实际范围大——声明超出实现;
  • 「哈希一致」被当作完整性证明:文件哈希相同 ≠ 内容被完整验收过,这里存在逻辑跳跃。

这三个发现直接把这个阶段从"可以结案"打回"不可结案",并升级为最高优先级修复——全部落地后才重新过审。事后我们的结论:执行者自己检查自己写的门,永远会漏掉"门本身没有真正通电"这种问题;只有把原始证据交给一个"不甘心只看报告"的独立读者,才抓得住。

为什么外脑能立功:三个设计缺一不可——①只读通道让它能翻真实文件(而不是只能信你转述);②它没有"想赶紧交差"的动机(执行是别人的活);③它的输出被当"证词"而不是"命令"(人验收后才采纳)。任何一个环节缺失,这个案例都不会发生。

数字侧写:这套系统跑了多少活

维度实测数字
编号裁决轮次24 轮(R1–R24),全部归档
裁决回复总量329,183 字节全文保存
单轮输出体量9.7K–13.1K 字符/轮;最长一轮思考 9 分钟
回执记录348 份(ACCEPT 76 / REVISE 133 / STOP 5)——近四成意见是"打回重做",这才是它敢当"审稿人"的证明
一次视觉审查的强度单次自主执行 55 次工具调用、9 种视口、15 张截图
负面验收战绩测试全绿但界面不可用的合成产品——被判 REVISE + 本地视觉门 FAIL,拒绝签发成功回执
一个反直觉的数字:REVISE 比 ACCEPT 多。如果一套"评审"体系里通过率是 100%,那它不是评审、是橡皮图章。133 次打回,正是这套系统最值钱的部分——它敢说"不行"。

成本与安全:省在明处,走官方通道

成本结构非常清晰,而且省在明处:

  • 一份订阅(Pro 更佳):网页版高档模型的额度与执行额度分开计——最贵的「想」放这里,不烧执行池。参考爆文作者实测:单次规划省约 10% 周额度;对「一天一个号」的用法,这是从日抛变回月付的距离(额度规则以官方为准);
  • 便宜档执行(GLM / 本地模型):「做」的部分放在这里,成本完全可控;
  • 本机桥接服务:跑在你自己电脑上,零云成本。

安全与合规,这段必须说重:整套系统全程官方通道——ChatGPT 官方开发者模式私有插件 + OpenAI Secure MCP Tunnel。不反代、不把订阅额度「转出」给第三方工具、不共享账号、不绕过任何限制。

我知道很多人会问:「为什么不直接把网页版额度反代出来给本地用?」因为那条路是拿你的账号去跟平台规则争辩:额度路径不可控、稳定性靠运气、被风控没有申诉路径。本系统是让 ChatGPT 用官方插件能力「主动进来工作」——两条路从根上就不是同一件事。

❌ 反代 / 桥接路线 把订阅额度「转出来」给别的工具使用 · 与平台使用规则争辩,风险完全自负 · 额度路径不可控,稳定性靠运气 · 网页端行为异常,方法随时可能失效 · 被风控后没有任何申诉路径 省了手续费,赌上了账号 ✅ 官方通道路线(本系统) ChatGPT 用官方插件能力主动进来工作 · 走官方开发者模式 + Secure MCP Tunnel · 网页额度与执行额度分开计,互不相抢 · 不加外挂、不共享账号、不绕过限制 · 数据最小权限:只读默认 · 写入限目录 省的是最贵的额度,不是安全感
同样是把「想」放回 ChatGPT:一条路赌账号,一条路走官方能力——长期跑,必须选后者
⚠️ 边界与免责:本系统为个人开发的第三方工具套件,与 OpenAI / Google 无隶属关系;不承诺「零风险」,任何平台功能与政策以官方为准。整套方案的前提是:只用官方提供的插件与隧道能力,不做反代、不共享账号、不绕过任何限制。

常见问题

没有 Pro 能用吗?Plus 也能跑通全流程;Pro 的网页档额度更充裕,适合重度使用。

一定要用 Ego 浏览器吗?不是必须。手工在浏览器里提问同样能跑通全套流程(本文前半部分就是);Ego 是把「发送键」也自动化,适合咨询频繁、想彻底解放双手的场景,配置指导包含在交付里。

我只用 Claude Code / Cursor,不用 Codex,行吗?行。执行侧任何本地工具都可以——系统只要求它能读写文件、能跑测试;「产品方向归 ChatGPT、执行归本地工具」的分工不变。

会省多少额度?取决于你把多少「想」的活搬过去。参考实测:单次规划省约 10% 周额度;重度用法(每天烧一个号)体感最明显——省下来的全是原本烧在规划上的执行额度。

会不会被风控?全程官方通道,不做任何反代与绕过;但我不会承诺「零风险」——任何平台的使用政策以官方为准。真正的高风险区是反代类做法,本系统不碰。

我的数据安全吗?默认只读;写入限一个目录 + 限额 + 全审计;不读取密钥类文件;模型没有任何 shell / 浏览器 / 任意命令能力。

支持 Windows 吗?协议跨平台;搭建文档以 macOS 为主,Windows 可以远程协助。

值不值?如果你每月 AI 账单 ≥ 一份订阅,或者经常被 AI「想当然」坑到返工——这套系统就是为你做的。

关于本文与说明

本文思路受公开讨论启发:卡兹克《分享一个大幅节省 Codex 额度的邪修方法》提出的「只读 MCP + 网页版规划」做法;本系统在其思路上做了更进一步的工程化:读写分离、交叉评议、证据闭环。文中提及的额度节省与实战效果为个人实测参考,不构成任何保证;ChatGPT、OpenAI、Gemini、Google 等均为其各自公司的商标,本系统为个人开发的第三方工具套件,与上述公司无隶属关系;所有平台功能与政策以官方为准。

更多教程与工具:主页 aizhuozhi.com;联系邮箱 master@aizhuozhi.cn。

蜀ICP备2026060052号-1