Token Paper
菜单

分词计算

同一段文字,在不同模型里有多长?

选择 GPT、DeepSeek 或 Gemini,查看输入 Token 数、分词器来源和数据处理位置。GPT 与 DeepSeek 在本地计算,Gemini 仅在点击后请求官方接口。

Token 计算工作台

o200k_base上下文 1,050,000浏览器本地

GPT-5.6 (Sol)

使用 tiktoken.js 的 o200k_base;同一编码家族的 GPT 子模型会得到相同的原始文本计数。

40 字符

Token 词组

空格显示为 ·,换行显示为 ↵,无法单独组成 UTF-8 字符的 Token 显示为字节转义。

输入文本后,这里会按模型实际读取顺序显示每个 Token 的词组和 ID。

工作原理

分词器为什么能算出 Token?

先记住一句话:Token 不是字数,而是模型词表中的编号。分词器负责把原始文字变成这串编号。

语言、空格与标点都会影响切分;换了模型词表,结果也可能不同。因此不能用固定的“字数 ÷ 比例”代替真实分词。

01

整理与预切分

分词器先按自己的规则处理 Unicode、空格和标点,把文本划成适合继续匹配的小片段。

02

匹配词表

BPE、Unigram 等算法会把片段继续拆分或合并,并在模型训练时确定的词表中找到对应项。

03

输出 Token ID

每个词表项最终变成一个整数 ID。模型读取的是这串 ID,Token 数就是这串数字的长度。

为什么值得先算?

上下文

避免输入超出模型的上下文窗口。

成本

在调用 API 前估算输入侧用量。

比较

观察同一段文字在不同词表下的差异。

理解边界:本站展示的是原始文本的 Token 数。聊天模板、角色标记、工具定义、图片和平台自动加入的特殊 Token,可能让一次真实 API 请求的输入量更大。

延伸阅读:Hugging Face 分词流水线 · OpenAI tiktoken