卓智/Skill 产品线/SKILL-02 · 审核调度 ID: SKILL-02-DISCIPLINE实测验证
Skill · 成本控制

不订阅也能用顶级 Claude:一套「审核调度」纪律,把 Opus / Fable 变成负担得起的私享审稿人

更新:2026-10 · 阅读约 9 分钟 · 文末含获取方式与推广说明

面向需要「高质量审核」的人:代码终审、方案评审、架构设计、长文档复核。核心问题不是「能不能用上顶级模型」,而是怎么用才不烧钱。这套 Skill 是我自己每天在用的完整调度纪律,含全部实测成本数字。

先说两个真实的坑

直接用 API 调顶级模型,很多人会掉进第二个坑:账单失控。以下是我自己踩过的两类真实浪费(都是实测数字,不是吓唬人):

  • 超时重试烧钱:非流式请求在中继层 2 分钟超时,但上游照常计费。一次 $0.73 的请求因为「看起来卡了」重试 3 次,直接烧掉 $2.19,且全部拿到的是失败响应。
  • 后台代理跑法:让顶级模型当后台执行代理去「自己跑任务」,22 个请求、130 万 token,烧掉约 $3.56,最后的交付物是:零。它全在读文件、规划、然后再也没有然后了。

这两个坑的共同点:钱花在了「过程」上,而不是「结论」上。

❌ 错误用法:为「过程」付费 非流式 + 超时重试 2 分钟中继超时但上游照常计费;重试 3 次 = 双倍、三倍烧钱 烧掉 $2.19,全部失败响应 把贵模型挂成后台执行代理 多轮读文件、规划、再规划……每一轮都是全价计费 22 请求烧掉 $3.56,交付物为零 ✅ Skill 纪律:只为「结论」付费 单次任务包提交 背景+目标+约束+材料+输出格式 ⟶ 一次提交、回收结论 落地动作由主控/廉价模型执行,贵模型只做判断 流式 + 长超时 + 永不重试 stream 保活防假超时;「看起来卡了」就重发 = 双倍烧钱,宁可等 单次完整裁决 ≈ ¥1.3–2.5,可直接执行
左边为过程付费(钱没了、事没办);右边为结论付费(一顿奶茶钱换一份可执行的专家裁决)

正确的姿势:把顶级模型当「审稿人」,不当「实习生」

顶级模型的正确用法是把它们当作只需要结论的专家——你整理好材料、一次性提交、拿回裁决或方案,落地动作由你自己(或廉价模型)执行。围绕这个原则,整套调度纪律可以浓缩成五条:

纪律一:任务包单次提交,禁止后台代理跑法

把背景、目标、约束、现状材料、输出格式整理成一个完整任务包,一次提交、回收结论。绝不把贵模型挂成后台 agent 让它多轮折腾——每一轮都是钱,而多轮探索恰恰是它的弱项(它没有你的项目上下文)。

纪律二:流式输出 + 超时拉满,永远不要重试

所有请求强制 stream: true(边生成边回传,中继连接保活、不会假超时),HTTP 超时设 30 分钟起步。顶级模型思考 1–10 分钟是常态,「看起来卡了」就 kill 重发 = 双倍烧钱。宁可等,不可重试。

纪律三:prompt 只发核心决策点

完整规格、全量代码、历史聊天记录一律不发——只发:问题背景 1–2 句 + 需要决策的 3–5 个核心问题 + 输出格式要求。每个问题精确到「给结论 + 理由」。这一条直接决定单次成本是几毛还是几十块。

纪律四:大材料用「聚焦包」,发出后核回执

大审查只发改动区段 + 未变区段标注「省略」,并且发出后第一步就核对回执里的 prompt_tokens 是否与包体匹配——中继链路存在静默截断(123KB 包体可能只按 11.8K token 计费,被截掉的内容模型根本看不到,且不报错)。偏小 = 该轮裁决作废,换聚焦包重发。

纪律五:同一问题「续接」而非重问

API 无状态。同一问题的连续追问,把「已输出原文 + 从中断处继续」整包带回——既省 token 又避免重复计费。跨模型交叉验证时则反过来:各自干净独立提问,防止锚定污染。

这么用下来,成本是什么水平?

用法单次成本(实测)产出质量
错误用法:非流式 + 重试循环单次 $0.73 起,重试即翻倍失败响应,白烧
错误用法:后台代理跑多轮$3.56 / 22 请求零交付
Skill 纪律:单次任务包提交(Sonnet 档)约 $0.18–0.34 / 次(≈ ¥1.3–2.5)完整裁决/方案,可直接执行
Skill 纪律:单次任务包提交(Opus / Fable 档)按 task 规模数美元内顶级架构决策/终审级结论

也就是说:一次高质量的专业审核,成本可以控制在一杯奶茶以内。我自己的日常实务是——普通难度的规划审核走 Sonnet 档(单次 ¥2 上下),关键决策才升到 Opus / Fable 档,且必须是我主动指定才升级(防止「自动管线偷偷烧钱」)。

单次任务成本对比(实测,对数不重要——看倍数) 非流式 + 重试 $2.19 · 失败响应 后台代理多轮 $3.56 · 零交付 Skill 纪律 · Sonnet 档 $0.18–0.34(≈¥1.3–2.5)· 完整可用裁决 Skill 纪律 · Opus / Fable 档 按 task 规模,数美元内 · 顶级结论 ← 越短越省
错误的用法比正确的贵 10–20 倍,而且拿不到结果——纪律本身就是最大的省钱工具

它审出过什么:三份真实成绩单

纪律不是摆设。这套流程在我自己的项目里抓出过下面这些问题——每一个都是"执行者自己说没问题"、但独立审核推翻它之后才暴露的:

案例审核怎么干结果
① 五轮对抗收口
(一个研究结案包)
第一轮抓出 6 处缺陷 → 第三轮发现"收据可被改写",加上幂等 SHA 绑定 → 第四轮 4 个高危反例写成测试全部修复 → 第五轮换独立通道流式复核终审 APPROVE:逐行零分歧、全覆盖核验通过
② 抓出"伪造缓存"
(一批测试用例)
审核者发现:9 张卡、18 个用例的"历史缓存"是自洽重链编出来的——链路本身自圆其说,但对照真实来源当场露馅放行被拦下;修复后 63 个新伪造变体全部被拒
③ 四轮复审逼出真缺陷
(一段内核代码)
前三轮小修小补后,第四轮用优先级测试逼出一个隐藏 bug:关闭逻辑会无条件清空排队退出请求修复后 237/237 全绿;两条独立复审线同时 ACCEPT

三个案例的共同规律:缺陷都不在"代码能不能跑",而在"结论可不可信"——伪造的证据链、可被改写的收据、被吞掉的边界条件。这些恰恰是执行者自己审自己时永远看不见的东西。

补充一条贵模型的"脾气":顶级模型(尤其 Fable 档)会拒绝"演角色"——如果你在 prompt 里给它安排"你是一位权威专家,请按模板输出"这类框架,它可能直接拒答(这就是一次白烧钱)。正确做法:给材料原文 + 一个直白的问题,让它以工作件的方式裁决,不要给它加戏。

常见问题

没有 Claude 订阅能用吗?能。整套方案就是为「不订阅、按量用 API」设计的——这也正是它存在的原因。

单次审核大概多少钱?普通规划/复审档约 ¥1.3–2.5/次;复杂架构决策按规模数美元内。关键在纪律(单次提交、不多轮),不守纪律什么站都救不了你的账单。

适合完全没有技术背景的人吗?需要基本的命令行操作能力(复制执行 curl / 配置 API key)。

关于本文与说明

本文为个人技术实践记录。

更多教程与工具:主页 aizhuozhi.com。

蜀ICP备2026060052号-1