Claude Code省token的6个技巧,实测能省90%
Anthropic刚发了篇博客,核心就一句话:别再烧冤枉token了。官方列举了6条省钱心法,我逐条实测,发现确实能省——不是省一点,是省掉90%。
为什么你的token越烧越快
用Claude Code干活,每一轮对话都在拖着前面所有轮的全部内容重新发送。会话越长,每一轮就越贵。这种增长是接近平方级别的O(n²)。
官方推算,开发者日均消耗13美元token,月均花在150到250美元之间。同样修一个bug,问法不同,花费能差出好几倍。
6条省钱心法
1. 任务做完就/clear
修完一个bug就清掉当前对话,别让上一个任务读过的文件和命令输出拖进下一个任务里,白白占着上下文。
2. 开局就定好模型和推理强度
中途切换的话,之前积累的提示缓存会全部失效,整段对话历史要按全价重新计算一遍。
3. 用@引用文件,别手打路径
用@直接把文件附到消息里,Claude不用再花一次工具调用去读。手打文件名的话,Claude可能先搜一圈再打开好几个文件试探,这些操作全部会进入对话历史。
4. 给输出多的命令加静默参数
在CLAUDE.md里写一句类似--reporter=dot的配置,让测试输出只打印几行摘要,不是几百行详情。输出越短,占的上下文越少。
5. /compact在休息前做
对话还在缓存里的时候压缩,成本只有正常的十分之一。等缓存过期了再压,就得按全价重新读一遍。
6. 大输出任务扔给子Agent
子Agent在独立上下文窗口里运行,做完只把结论传回来,过程中读的文件和跑的命令输出不会进入你的主对话。
缓存是最大的省钱杠杆
Claude Code的每次请求都从相同的前缀开始。如果这次请求的前缀和上次逐字节一样,服务器就不重新算,直接加载上次的计算结果。
缓存读取只要正常输入价的0.1倍,直接省掉90%。
但缓存必须从请求的第一个字节开始连续匹配,中间任何地方变了,从那里往后全部作废。切模型、切推理强度、开关Fast mode、/compact压缩、时间过期、恢复旧会话——这6种情况都会让缓存失效。
管token,是AI时代的新技能
这些能力一年前并不存在。但它现在决定了你在同一个任务上,是花3美元还是30美元。
Anthropic自己就是最好的例子——他们80%的代码靠AI写,代码合并量一年翻了8倍。如果没人管token,光推理成本就能把预算吃穿。
读懂这篇博客的人,薅到的不只是几美元的token,而是AI时代写代码的人需要长出来的一种新本能。
来源:Anthropic官方博客
发布时间:2026年8月16日
评论区