← 返回作品集行途 · 作品集
行途 / Justin Li · 自媒体 IP 创作工作台
📅 2026-08-28 🤖 deepseek-v4-pro 🏷️ 行途 · 省 token 系列(第 1 篇)
省 token 封面 G3 内容展开版
封面图:900 × 383 px(公众号头条封面 2.35:1) 路径:a0_省token总纲/公众号封面_G3_内容展开_900x383.png

省 token 的第一性原理:把「不用推理的活」,从模型手里拿回来

发布日期:2026-08-28 · 数据来自团队 8 个月账单统计 · 配图自制
📋 使用说明:本文 Markdown 源在 a0_省token总纲/公众号正文.md;正文「复制到公众号」版在 公众号正文_公众号版.html;配图 2 张已 HTML 化重做,上传到公众号素材库后在正文对应位置插入即可。

我是行途,一线技术经理,带团队也写代码。过去 8 个月,公司几十个人天天用 coding agent,烧掉了上百亿 token——用久了,「省 token」就成了肌肉记忆:让 AI「少说点」、关掉思考、换个便宜点的模型。

但上个月,我把这 8 个月的账单导出统计,发现一个反直觉到有点讽刺的事实:

AI 说出来的话(输出),只占 token 总量的 0.4%;而它反复重读的「上下文」(缓存读),占了 97.7%。

(注:0.4% 是数 token 个数。按钱算,输出单价贵 5 倍,会占到约 14.6%。我全文按个数说。)

缓存命中率为什么这么高?这个后面单独拆一篇,今天先记住结论:大头在缓存读。

也就是说——你拼命让 AI 少说话,省的是那个只占 0.4% 的小头;真正的大头,97.7%,你压根没碰。

一句话结论(可引用):省 token 的本质 = 把「不用推理的活」(索引、检索、压缩、搬运、客套)从模型手里拿回来,交给确定性的系统;只把「需要推理的活」(理解、设计、生成、判断)留给模型。模型贵在「想」,不贵在「搬」。

一次对话 token 去向:缓存读 97.7% / 输入 1.9% / 输出 0.4%
(配图① · 自制 · token 数量口径,团队 8 个月账单统计)

一、省 token 先纠正认知:token 到底烧在哪

一个 AI 编程工具,每跑一次,token 的去向只有三个地方:

去向是什么占比(数量口径)
输入你这次新喂进去的内容1.9%
缓存读对话历史、工具结果、系统提示词这些跨轮次被反复重读的内容97.7%
输出AI 生成的话0.4%

你天天琢磨「怎么让 AI 少说两句」「关掉思考省 token」,全是在那 0.4% 里抠。而 97.7% 的缓存读,是 AI 每次对话都要重新读一遍的「固定上下文」——这些才是账单上的大头。

缓存读便宜(按原价 1/10 计价),但它不免费。它吃掉的是另一件更贵的东西——模型的注意力。上下文越杂,模型越容易在噪音里迷路。

二、省 token 的第一性原理:token 只有两种

  1. 需要 AI 推理的:理解需求、设计方案、写代码、判断对错。这类活,只有模型能干。
  2. 不需要 AI 推理的:索引代码、检索文件、压缩命令输出、搬运数据、写客套话。这类活,模型干是浪费。

省 token 的本质,一句话:把「不用推理的活」,从模型手里拿回来,交给确定性的系统(脚本、工具、缓存)。模型贵在「想」,不贵在「搬」。

打个比方:你花高薪请了个架构师,结果天天让他干「把文件从 A 拷到 B」——这不是省钱,这是浪费。

这条思想的关键好处是:它不挑工具。你用 Claude Code、Codex、WorkBuddy、豆包、Cursor,这套「该模型的只模型、该系统的只系统」都成立。同一套 hook,我从 Claude Code 拆下来,装到 Codex 上照用不误。

这不是我拍脑袋:业内也早就这么想

  • Rich Sutton《The Bitter Lesson》(2019):强化学习之父、图灵奖得主的核心论断——能随算力扩展的「通用方法」最终胜过人类硬编码的规则。「规则是愿望,钩子是墙」正是这条规律在 token 成本场景的投影。
  • Anthropic《Effective Context Engineering for AI Agents》(2025):明确把「Just-in-time 上下文」列为 agent 工程核心策略——别预先塞满,按需动态加载。
  • Andrej Karpathy:「Context engineering 是一门为下一步填充恰当时机的恰当信息的艺术与科学。」
省 token 六层金字塔
(配图② · 自制 · 六层金字塔:从地基到尖端,层层剥离)

三、省 token 的六层:把「不用推理的活」一层层剥离

下面每层我都用一个工具举例(来自 Claude Code 的实测),但这六层本身不是某个工具的配置,是「让模型只干推理」这个思想的六种落法。

需求层:先把需求写清楚,别让 AI 猜
让 AI 猜着干是最贵的浪费。解法是 Spec 先文档:动手前把「要做什么」写成结构化文档,作为唯一真相源。
检索层:按需拉取,别一次全塞(省 token 的大头)
把代码库索引成关系图,AI 要什么查什么。实测:从「20 次 grep」降到「3–4 次图查询」,工具调用省了 80%
协议层:命令的输出,别原样喂回去
命令输出先过一层压缩,只保留有意义的部分。实测:命令输出压缩 93.6%,累计省下几千万 token。
输入压缩层:从源头压输入
进模型之前的前置过滤和精简入参。开源项目实测能省 20%–95%(随任务类型波动)。
散文层:别客套(就是「让 AI 少说话」,但只是六分之一)
把输出侧调成「先给结果、跳过铺垫」。它只占六层里的六分之一,你只在它上面下功夫,等于治水只堵了最小的支流。
生成层:让「写代码」本身也讲效率
让模型只生成「做什么」的契约(骨架),让编译器/测试去验证补全细节。生成不是终点,校验才是。

四、省 token 的两条底层律(比工具更底层)

律 1:规则是愿望,钩子是墙。实测规则遵从率只有 70%–90%(随任务和表达方式波动)。靠「自觉」省 token 靠不住,真正稳的是钩子(hooks):把约束变成系统级硬墙。我写过 20 多条「请不要 X」的规矩,实测只执行了七到九成——不如直接上一个 hook,比口头叮嘱管用。

律 2:注意力比 token 更贵。一份 128K 上下文塞 70% 噪音,模型表现往往不如精心管理到 32K 的干净上下文。token 省下来是账面的,模型在噪音里迷路才是真亏。

五、收束:省 token 真正的杠杆是思想,不是配置

你换 Claude、换 Codex、换 WorkBuddy、换豆包,界面在变、价格在变、榜单在变。但「把不用推理的活从模型手里拿回来交给系统」这条,从第一天到今天都成立。

配置三个月就过期,这条思想我今天还能拿去改 Codex、改豆包。省钱的不是哪套配置,是你脑子里那条「模型只干推理」。

这个系列我会一周写 1–2 篇。每篇只拆一层,第一篇讲思想,下一篇拆检索层——那是我账单上省得最狠的一块。

下一篇我会拆具体的一层——检索层,讲讲怎么用图查询把「20 次 grep」打到「3 次查询」,那是省 token 最大的一块肥肉。

六层速查表(建议收藏)

动作效果
① 需求层Spec 先文档省返工
② 检索层图查询省 80%
③ 协议层压缩输出压 93.6%
④ 输入压缩层前置过滤省 20-95%
⑤ 散文层别客套六分之一
⑥ 生成层决策+校验YAGNI

六层落地清单、token 优化踩坑卡、提示词框架模板都整理好了——公众号回复「六层」自取,我把清单发你。

📎 附录 · 六层工具链(GitHub 实时数据,2026-08-28 查证)

检索层 · CodeGraphgithub.com/colbymchenry/codegraph · ⭐68.4k · MIT · npx @colbymchenry/codegraph
检索层 · CBMgithub.com/DeusData/codebase-memory-mcp · ⭐40.9k · MIT
协议层 · RTKgithub.com/rtk-ai/rtk · ⭐77.6k · Apache-2.0 · brew install rtk
输入压缩 · Headroomgithub.com/headroomlabs-ai/headroom · ⭐67.8k · Apache-2.0
散文层 · Cavemangithub.com/JuliusBrussee/caveman · ⭐101.4k · BSL-1.1
生成层 · Ponytailgithub.com/DietrichGebert/ponytail · ⭐113.8k · MIT

参考来源:Rich Sutton《The Bitter Lesson》(2019);Anthropic《Effective Context Engineering for AI Agents》(2025);Andrej Karpathy 公开论述;Claude Code 官方文档;团队 2026 年 1–8 月 token 账单统计。