Token 是什么:搞懂大模型的计费和上下文长度
用 AI API 按"Token"计费、模型有"上下文长度"限制——Token 到底是什么?本文用大白话讲清。
用大模型 API 时,你会看到"按 Token 计费""上下文 128K"这些说法。Token 到底是什么?搞懂它,才能算清成本、用好模型。
一、Token 是什么
模型不是按"字"处理文本,而是按 Token(词元)——一种介于"字"和"词"之间的单位。英文里一个 Token 约等于 0.75 个单词;中文里大致1 个汉字约 1-2 个 Token。一段话会先被切成 Token 再喂给模型。
二、为什么按 Token 计费
模型的计算量和文本长度成正比,所以 API 按输入 + 输出的 Token 总数计费。提示词越长、回答越长,花的 Token 越多、钱越多。
三、上下文长度是什么
模型一次能"记住"的 Token 上限,就是上下文窗口(如 128K)。它决定了你能一次喂多长的资料、对话能记多久。超出上限,早的内容就会被"忘掉"。
四、实用建议
- 省钱:精简提示词、只放必要资料、控制输出长度。
- 长文档:太长就分块或用 RAG 检索相关片段,别硬塞。
- 估算成本:大致按"字数 × 单价"心里有个数。
结语
Token 是理解大模型成本和能力的钥匙。知道它怎么算,你就能既省钱又不撑爆上下文,把模型用在刀刃上。