← 返回Token 是什么?
1 / 7
Tutorial·7

Token 是什么?

账单、卡顿、忘前文,背后是同一个单位。讲清 token 怎么算、输入输出为什么不同价、缓存能省多少,以及按任务选模型的三档判断法

TL;DR · 一句话结论

Token 是模型处理文字的基本单位,也是计费单位。按 DeepSeek 官方给的换算口径:1 个中文字约 0.6 个 token,1 个英文字符约 0.3 个 token。你发过去的内容算输入 token,它生成的内容算输出 token,输出通常比输入贵好几倍;每一轮对话都要把历史重新发一遍,所以聊得越久越贵、越慢。选模型不用追最强,按任务分三档:简单重复用便宜快的,日常主力用通用档,需要长链条推理和高准确度时才上旗舰档。

1
Step 1

开篇:账单、卡顿、忘事,是同一个原因

用着用着你会遇到这三件事:

  • API 账单涨得莫名其妙,明明只是聊了几句
  • 同一个工具,越用到后面越慢
  • 聊到很长的时候,它开始忘记前面说过的

这三件事的度量单位是同一个:token

把 token 搞懂,你就同时理解了 AI 的计费方式、速度瓶颈和记忆上限,也才知道该怎么选模型、怎么省钱。

这一篇讲两件事:token 是什么、怎么按任务选模型。

2
Step 2

Token 是什么:模型处理文字的最小单位

DeepSeek 官方文档的定义很干脆:

Token 是模型用来表示自然语言文本的基本单位,也是我们的计费单位。

模型不是按「字」来处理文字的,而是先把文字切成一个个 token 再处理。一个 token 可能是一个字、一个词,也可能是半个单词。

模型先将自然语言切分成 Token 再进行处理
模型先将自然语言切分成 Token 再进行处理

官方给的换算参考(不同模型的切法不同,这只是个估算口径):

换算
1 个英文字符≈ 0.3 个 token
1 个中文字符≈ 0.6 个 token

拿这个口径估一下你日常的量级:

内容大概多少 token
一条微信长消息(100 字)约 60
一篇公众号文章(3000 字)约 1800
一份 3 万字的产品文档约 1.8 万
一本 30 万字的书约 18 万

所以上一篇说的「100 万 token 上下文」,大约就是 160 万中文字的量。

3
Step 3

输入和输出分开算,而且不同价

计费分成两部分:

  • 输入 token:你发过去的一切——系统提示词、历史对话、你贴的资料、工具返回的结果
  • 输出 token:模型生成的内容,包括它的思考过程

输出通常比输入贵好几倍。 参考几个公开价格(美元 / 每百万 token,2026 年 8 月的量级,以官网为准):

模型输入输出
Claude Opus 5$5$25
Claude Sonnet 5$3$15
Claude Haiku 4.5$1$5
DeepSeek V4 Flash几分钱级别不到 $1

看最后一行:国产模型的价格常常低一到两个数量级,这也是很多人把 agent 工具接到国产模型上的原因(本站有 Codex 接 DeepSeek、DeepSeek Harness 等教程)。

还有一件必须知道的事:模型不记事(1.1 讲过),所以每一轮都要把整个对话历史重新发一遍。第 10 轮对话的输入,包含了前 9 轮的全部内容。

这就是「聊得越久越贵」的真实原因——不是它变贵了,是你每次发过去的东西变多了。

输入 Token 与输出 Token 分开计费,历史对话会在下一轮重新发送
输入 Token 与输出 Token 分开计费,历史对话会在下一轮重新发送
4
Step 4

缓存:重复的前缀能便宜一个数量级

既然每轮都要重发历史,厂商就做了一个优化:缓存(prompt caching / 上下文硬盘缓存)。

原理很简单:如果这次请求的开头部分和上次完全一样,那部分就不用重新计算,按一个便宜得多的价格计费。

提示词缓存只会命中完全相同的请求前缀
提示词缓存只会命中完全相同的请求前缀

差多少?看 DeepSeek 官方价目表,命中缓存的输入价格比未命中低一个数量级以上;Claude 的缓存读取也只需要原价的约十分之一。

对你的实际影响:

  • 稳定的内容放前面:系统提示词、项目说明、长文档这些每次都一样的东西,放在最前面最容易命中缓存
  • 变动的内容放后面:你这一轮的具体问题放最后
  • 不要每次改动开头:开头改一个字,后面全部失效(缓存是按前缀匹配的)

好消息是:主流 agent 工具已经替你安排好了这个顺序。你只需要知道别乱动项目的长期约定文件,改一次意味着缓存要重建。

5
Step 5

为什么会变慢、变笨

Token 不只影响钱,还影响体验:

① 越长越慢。 输入越长,模型读的东西越多;输出越长,你等的时间越久。一次要它写 5000 字,就是要等它一个 token 一个 token 地蹦出 3000 多个 token。

② 越长越容易抓错重点。 上一篇引过的官方说法:token 数量增长,准确率和召回会下降(context rot)。这不是省钱问题,是质量问题。

③ 思考也算输出。 现在的模型普遍有「思考 / 推理」模式,思考产生的 token 按输出计费。开着深度思考做简单任务,等于花钱买等待。

三个立刻能用的习惯:

  • 换任务就新开会话,不要在一个长会话里干十件事
  • 只给必要的材料,别「以防万一都贴上」
  • 简单任务别开深度思考,也别用旗舰模型

一句话:上下文不是越满越好,token 不是花得越多效果越好。

Token 过多会同时影响速度、成本和回答质量
Token 过多会同时影响速度、成本和回答质量
6
Step 6

怎么选模型:分三档,不要只追最强

新手最容易犯的错是「一律用最贵最强的」。实际上按任务分档,体验更好也更省。

档位特点适合的活2026 年 8 月的代表
轻量档便宜、快格式转换、分类打标、简单摘要、批量处理Claude Haiku、DeepSeek V4 Flash、各家的 flash / turbo
通用档能力和价格平衡,日常主力写作、改代码、日常 agent 任务Claude Sonnet 5、DeepSeek V4 Pro、Kimi K3、Qwen / GLM 的主力型号
旗舰档最强,也最贵最慢复杂推理、长链条 agent 任务、疑难 bug、重要决策Claude Opus 5、各家的 Max / Pro 顶配

四条选择原则:

  1. 默认用通用档,撞墙了再往上换,简单重复的活往下换
  2. 看上下文窗口:要一次喂进一整份长文档,就得挑窗口大的(多数旗舰已到 100 万 token)
  3. 看能不能接进你的工具:很多 agent 工具支持换模型,接国产模型能大幅降成本
  4. 价格随时在变:2026 年 8 月各家都在调价,下单前看一眼官网

更实用的判断标准不是「哪个模型最强」,而是**「完成这个任务的总成本」**——包括你为返工付出的时间。便宜的模型反复做错,并不省钱。

根据任务复杂度选择轻量档、通用档或旗舰档模型
根据任务复杂度选择轻量档、通用档或旗舰档模型
7
Step 7

总结:一张表收口

现象原因怎么办
账单涨得快每轮重发历史,输出比输入贵新开会话、只给必要材料、简单任务降档
越用越慢输入越长读得越久,输出越长等得越久控制上下文,别一次要几千字
开始忘前文超出上下文窗口,被压缩或截断会话收尾,把结论落到文件里
简单任务也很贵用了旗舰模型 + 深度思考换轻量档,关掉思考模式
长文档读不进去模型窗口不够换窗口更大的模型,或者分批喂

三条换算记牢:

  • 1 个中文字 ≈ 0.6 token
  • 输出价 ≈ 输入价的 3~5 倍
  • 命中缓存的输入 ≈ 原价的 十分之一量级

Token 是 AI 的计量单位,也是你唯一能直接控制的成本变量。 想进一步压成本和提质量,去 4.2 如何管理上下文;想给工具换更便宜的模型,看第 3 段的模型转接(3.3)。

FAQ · 常见问题
包月订阅也算 token 吗?

算,只是你不用自己付每一次的钱。订阅制产品(ChatGPT Plus、Claude Pro 这些)内部同样按 token 计量,体现为使用额度和限速——你聊得太长太频繁,会更快撞到上限。走 API 才是按 token 直接付费。

怎么知道一段文字有多少 token?

估算用换算口径就够了(中文字数 × 0.6)。要精确的话,各家都提供计数接口或在线工具,agent 工具的界面上通常也会显示本次会话已用多少。

国产模型这么便宜,直接全用它不就行了?

很多场景确实可以,尤其是批量、重复类任务。但不同模型在复杂推理、长链条 agent 任务上的稳定性有差别,值得你拿自己的真实任务各跑一遍再定。本站有把 Codex、Claude Code 接到国产模型的具体教程。

思考模式(推理模式)要不要一直开着?

不要。它产生的思考内容按输出计费,还会增加等待时间。规则很简单:需要多步推理、要权衡的复杂任务就开;格式转换、摘要、简单问答这类直给的活就关。

1 / 7