账单、卡顿、忘前文,背后是同一个单位。讲清 token 怎么算、输入输出为什么不同价、缓存能省多少,以及按任务选模型的三档判断法
Token 是模型处理文字的基本单位,也是计费单位。按 DeepSeek 官方给的换算口径:1 个中文字约 0.6 个 token,1 个英文字符约 0.3 个 token。你发过去的内容算输入 token,它生成的内容算输出 token,输出通常比输入贵好几倍;每一轮对话都要把历史重新发一遍,所以聊得越久越贵、越慢。选模型不用追最强,按任务分三档:简单重复用便宜快的,日常主力用通用档,需要长链条推理和高准确度时才上旗舰档。
用着用着你会遇到这三件事:
这三件事的度量单位是同一个:token。
把 token 搞懂,你就同时理解了 AI 的计费方式、速度瓶颈和记忆上限,也才知道该怎么选模型、怎么省钱。
这一篇讲两件事:token 是什么、怎么按任务选模型。
DeepSeek 官方文档的定义很干脆:
Token 是模型用来表示自然语言文本的基本单位,也是我们的计费单位。
模型不是按「字」来处理文字的,而是先把文字切成一个个 token 再处理。一个 token 可能是一个字、一个词,也可能是半个单词。

官方给的换算参考(不同模型的切法不同,这只是个估算口径):
| 换算 | |
|---|---|
| 1 个英文字符 | ≈ 0.3 个 token |
| 1 个中文字符 | ≈ 0.6 个 token |
拿这个口径估一下你日常的量级:
| 内容 | 大概多少 token |
|---|---|
| 一条微信长消息(100 字) | 约 60 |
| 一篇公众号文章(3000 字) | 约 1800 |
| 一份 3 万字的产品文档 | 约 1.8 万 |
| 一本 30 万字的书 | 约 18 万 |
所以上一篇说的「100 万 token 上下文」,大约就是 160 万中文字的量。
计费分成两部分:
输出通常比输入贵好几倍。 参考几个公开价格(美元 / 每百万 token,2026 年 8 月的量级,以官网为准):
| 模型 | 输入 | 输出 |
|---|---|---|
| Claude Opus 5 | $5 | $25 |
| Claude Sonnet 5 | $3 | $15 |
| Claude Haiku 4.5 | $1 | $5 |
| DeepSeek V4 Flash | 几分钱级别 | 不到 $1 |
看最后一行:国产模型的价格常常低一到两个数量级,这也是很多人把 agent 工具接到国产模型上的原因(本站有 Codex 接 DeepSeek、DeepSeek Harness 等教程)。
还有一件必须知道的事:模型不记事(1.1 讲过),所以每一轮都要把整个对话历史重新发一遍。第 10 轮对话的输入,包含了前 9 轮的全部内容。
这就是「聊得越久越贵」的真实原因——不是它变贵了,是你每次发过去的东西变多了。

既然每轮都要重发历史,厂商就做了一个优化:缓存(prompt caching / 上下文硬盘缓存)。
原理很简单:如果这次请求的开头部分和上次完全一样,那部分就不用重新计算,按一个便宜得多的价格计费。

差多少?看 DeepSeek 官方价目表,命中缓存的输入价格比未命中低一个数量级以上;Claude 的缓存读取也只需要原价的约十分之一。
对你的实际影响:
好消息是:主流 agent 工具已经替你安排好了这个顺序。你只需要知道别乱动项目的长期约定文件,改一次意味着缓存要重建。
Token 不只影响钱,还影响体验:
① 越长越慢。 输入越长,模型读的东西越多;输出越长,你等的时间越久。一次要它写 5000 字,就是要等它一个 token 一个 token 地蹦出 3000 多个 token。
② 越长越容易抓错重点。 上一篇引过的官方说法:token 数量增长,准确率和召回会下降(context rot)。这不是省钱问题,是质量问题。
③ 思考也算输出。 现在的模型普遍有「思考 / 推理」模式,思考产生的 token 按输出计费。开着深度思考做简单任务,等于花钱买等待。
三个立刻能用的习惯:
一句话:上下文不是越满越好,token 不是花得越多效果越好。

新手最容易犯的错是「一律用最贵最强的」。实际上按任务分档,体验更好也更省。
| 档位 | 特点 | 适合的活 | 2026 年 8 月的代表 |
|---|---|---|---|
| 轻量档 | 便宜、快 | 格式转换、分类打标、简单摘要、批量处理 | Claude Haiku、DeepSeek V4 Flash、各家的 flash / turbo |
| 通用档 | 能力和价格平衡,日常主力 | 写作、改代码、日常 agent 任务 | Claude Sonnet 5、DeepSeek V4 Pro、Kimi K3、Qwen / GLM 的主力型号 |
| 旗舰档 | 最强,也最贵最慢 | 复杂推理、长链条 agent 任务、疑难 bug、重要决策 | Claude Opus 5、各家的 Max / Pro 顶配 |
四条选择原则:
更实用的判断标准不是「哪个模型最强」,而是**「完成这个任务的总成本」**——包括你为返工付出的时间。便宜的模型反复做错,并不省钱。

| 现象 | 原因 | 怎么办 |
|---|---|---|
| 账单涨得快 | 每轮重发历史,输出比输入贵 | 新开会话、只给必要材料、简单任务降档 |
| 越用越慢 | 输入越长读得越久,输出越长等得越久 | 控制上下文,别一次要几千字 |
| 开始忘前文 | 超出上下文窗口,被压缩或截断 | 会话收尾,把结论落到文件里 |
| 简单任务也很贵 | 用了旗舰模型 + 深度思考 | 换轻量档,关掉思考模式 |
| 长文档读不进去 | 模型窗口不够 | 换窗口更大的模型,或者分批喂 |
三条换算记牢:
Token 是 AI 的计量单位,也是你唯一能直接控制的成本变量。 想进一步压成本和提质量,去 4.2 如何管理上下文;想给工具换更便宜的模型,看第 3 段的模型转接(3.3)。
算,只是你不用自己付每一次的钱。订阅制产品(ChatGPT Plus、Claude Pro 这些)内部同样按 token 计量,体现为使用额度和限速——你聊得太长太频繁,会更快撞到上限。走 API 才是按 token 直接付费。
估算用换算口径就够了(中文字数 × 0.6)。要精确的话,各家都提供计数接口或在线工具,agent 工具的界面上通常也会显示本次会话已用多少。
很多场景确实可以,尤其是批量、重复类任务。但不同模型在复杂推理、长链条 agent 任务上的稳定性有差别,值得你拿自己的真实任务各跑一遍再定。本站有把 Codex、Claude Code 接到国产模型的具体教程。
不要。它产生的思考内容按输出计费,还会增加等待时间。规则很简单:需要多步推理、要权衡的复杂任务就开;格式转换、摘要、简单问答这类直给的活就关。