Vibe session · Learning mode阅读、尝试、提问都留在同一个工作区
Course Map
练习进度 0/55
Learning Guide
Build session

Token 经济学 — 省钱和效率的平衡

intermediate · 10-12 min · 步骤 1/3

上个月我的 Claude API 账单是 $47,其中 $30 是浪费的

说实话,我刚开始用 Claude Code 的时候完全不在意成本。反正 Pro 订阅 $20/月嘛,随便用。然后我发现 Pro 的额度用得比我想象的快太多了——一天写代码四五个小时,到月中就已经触发限速了。

后来我开始用 API,按量付费。第一个月账单出来:$47。

我吓了一跳,然后仔细看了用量明细。发现有一个项目的几次长对话,每次对话都有 150K+ 的 Token 输入——因为我把整个项目的 README、所有的类型定义、几个大文件全塞进上下文里了。每轮对话 AI 都要"重新阅读"这些内容,即使它们跟当前问题根本没关系。

那一刻我意识到:不懂 Token 经济学,就像开车不看油表——你以为在正常行驶,其实油箱快空了。

上下文窗口就像 AI 面前的工作台——写满了旧内容就会被挤出

Token 到底是什么?

Token 是大语言模型处理文本的基本单位。但它不等于"一个字"或"一个词"——这是最常见的误解。

对于英文来说,1 个 Token 大约是 0.75 个单词,或者说 4 个字符。比如 "Hello world" 是 2 个 Token,"ChatGPT is amazing" 是 4 个 Token。

对于中文,1 个汉字大约是 1-2 个 Token。 这比英文"贵"不少。"你好世界" 这四个字可能就要 4-6 个 Token,而英文的 "Hello world" 只要 2 个。

你可能会问:为什么中文更"贵"?因为大部分模型的 Tokenizer 是基于英文训练的,英文的常见词被编码成了高效的 Token,而中文字符的编码效率较低。这是一个技术事实,不是歧视——只是说如果你主要用中文跟 AI 对话,同样的内容你要花更多的 Token。

上下文窗口是什么?为什么它是 AI 的"短期记忆"

上下文窗口(Context Window)就是 AI 一次对话中能"看到"的最大 Token 数量。你可以把它想象成 AI 面前的一张桌子——桌子就这么大,放满了就得把旧的东西拿走才能放新的。

不同模型和套餐支持的上下文长度不同,而且会更新。使用前应在当前工具或官方模型说明中确认,不要把课程里的旧数字当成配额承诺。

即使窗口足够大,也不该把整个仓库一次塞进去。无关文件会占用预算、稀释关键约束,并让结果更难追溯。更可靠的做法是先给目录结构和任务目标,再只引用接口、实现、测试与错误日志等相关材料。

输入 Token vs 输出 Token

这里有一个关键概念很多人搞不清楚:输入 Token 和输出 Token 是分开计费的,而且价格不同。

  • 输入 Token:你发给 AI 的所有内容(你的 Prompt、引用的文件、CLAUDE.md 的内容、之前的对话记录)
  • 输出 Token:AI 生成的回复(代码、解释、建议等)
输入、输出、缓存读取和缓存写入可能采用不同价格,具体规则以当前提供商账单为准。

这意味着什么?让输出只包含任务所需内容,同时减少无关输入,更容易控制成本。

在 CLAUDE.md 里加一条 "回复时直接给代码,不需要解释,除非我问" 能帮你省不少输出 Token。

三层 Context 管理体系——理解 Token 如何在不同层级被消耗

为什么长对话越来越贵

这是一个很多人没意识到的"隐形成本":每一轮对话,AI 都要重新阅读之前所有的对话记录。

假设你和 AI 进行了 10 轮对话,每轮你发 500 Token,AI 回复 1000 Token。到第 10 轮的时候:

第 1 轮输入:500 Token(你的消息)
第 2 轮输入:500 + 1000 + 500 = 2000 Token(前两轮 + 新消息)
第 3 轮输入:2000 + 1000 + 500 = 3500 Token
...
第 10 轮输入:约 13,500 Token

总输入 Token 不只是 10 × 500。 如果每轮都携带完整历史,之前的输入和输出会在后续请求中再次占用上下文;实际计费还要看提供商的缓存和工具实现。

插一句,Claude Code 和 Cursor 在这方面做了一些优化——比如 Prompt Caching(提示缓存),重复的内容不需要每次都重新计算。但即便如此,长对话的成本增长速度仍然是非线性的。

知道何时开始新对话——功能做完就开新对话是省 Token 的关键

实用建议:当一个功能做完了,开一个新对话。 不要在一个对话里做完整个项目——那样到后面几轮,每次对话都在花大量 Token "回忆"前面的内容。

Vibe Workspace
Live build context

你每次跟 AI 聊天都在"烧钱"——但你知道烧了多少吗?

理解 Token 和上下文窗口的工作原理,这是控制成本的第一步

自动保存在此设备
理解 Token 是什么以及它如何影响 AI 编程的成本和效果掌握主流模型的上下文窗口大小和定价差异学会估算日常 AI 编程的 Token 消耗和成本
Home| Vibe Lab
草稿自动保存