整理与预切分
分词器先按自己的规则处理 Unicode、空格和标点,把文本划成适合继续匹配的小片段。
分词计算
选择 GPT、DeepSeek 或 Gemini,查看输入 Token 数、分词器来源和数据处理位置。GPT 与 DeepSeek 在本地计算,Gemini 仅在点击后请求官方接口。
GPT-5.6 (Sol)
使用 tiktoken.js 的 o200k_base;同一编码家族的 GPT 子模型会得到相同的原始文本计数。
40 字符
空格显示为 ·,换行显示为 ↵,无法单独组成 UTF-8 字符的 Token 显示为字节转义。
输入文本后,这里会按模型实际读取顺序显示每个 Token 的词组和 ID。
工作原理
先记住一句话:Token 不是字数,而是模型词表中的编号。分词器负责把原始文字变成这串编号。
语言、空格与标点都会影响切分;换了模型词表,结果也可能不同。因此不能用固定的“字数 ÷ 比例”代替真实分词。
分词器先按自己的规则处理 Unicode、空格和标点,把文本划成适合继续匹配的小片段。
BPE、Unigram 等算法会把片段继续拆分或合并,并在模型训练时确定的词表中找到对应项。
每个词表项最终变成一个整数 ID。模型读取的是这串 ID,Token 数就是这串数字的长度。
上下文
避免输入超出模型的上下文窗口。
成本
在调用 API 前估算输入侧用量。
比较
观察同一段文字在不同词表下的差异。
理解边界:本站展示的是原始文本的 Token 数。聊天模板、角色标记、工具定义、图片和平台自动加入的特殊 Token,可能让一次真实 API 请求的输入量更大。