Token 与下一个 Token 预测
建议用时:25 分钟(含练习)
学习目标
能够解释文本如何被切成 Token,以及模型为何是逐步生成而非查找标准答案。
本节产出
一张从文本到输出的生成流程图
核心知识:模型看到的不是一页纸
Token
你输入“请把这段话写得更清楚”,界面显示的是汉字,模型内部处理的却是一串编码。Tokenizer(分词器)先把文本转换成 Token,再映射为词表中的编号。一个 Token 可能对应一个字、一个词的一部分、标点、空格或其他片段,具体取决于分词器。不要把 Token 直接等同于汉字数,也不要把“英文一个单词大约多少 Token”当成所有语言和模型的固定公式。
这里可以借用积木来理解:同一句话可以由不同大小的积木拼成,不同词表规定了不同的拼法。但模型使用的不只是离散编号,还会将它们转换为向量表示,再经过网络计算。积木比喻只帮助理解切分,不代表模型在搬运现成句子,更不代表它在数据库里查找唯一答案。
对自回归文本生成而言,一个基本过程是:根据目前可见的上下文,计算下一个 Token 的候选分布,按解码策略选择一个,再把它接到已有序列后面,继续计算。这里的“预测”不是预知未来,而是条件概率计算。模型训练后还可能经过指令训练等阶段;完整产品也可以加入工具、搜索和验证,所以“下一个 Token”描述的是生成机制的重要部分,不是整个产品能力的全部说明。
看图时注意反馈箭头:已生成的内容会影响后面的内容。如果早期把任务理解错了,后面可能沿着错误方向写出一篇非常连贯的文章。因此,长输出不能只在最后检查格式;在关键选择点先确认结构、数据和约束,往往比写完再全部推翻更省时间。
一个不需要代码的概率例子
假设某个教学用模型看到“这杯茶太烫了,请先”,给出下列下一片段候选。这里的片段和概率只是示意,不对应任何真实模型的分词或输出。
| 候选片段 | 示例概率 | 接上后可能的发展 |
|---|---|---|
| 放凉 | 0.55 | 放凉后再喝 |
| 等 | 0.25 | 等一会儿 |
| 加 | 0.15 | 加一点冷水 |
| 其他 | 0.05 | 其他续写方向 |
选择最高概率候选是一种策略,按分布抽样是另一种策略。温度等参数可以影响选择的分散程度,但不能给错误事实加上真实性保证。低温度也不等于数据库查询,输出仍可能错误;不同服务对参数的支持范围和含义需要查看各自文档,不能假设所有模型都接受同一组选项。
Token 为什么与预算和长度有关
模型服务通常会对输入和输出设定长度或用量边界。一次请求的输入可能不只有用户最后一句话,还包括历史消息、系统指令、工具定义和检索材料。某些模型还存在额外的推理用量计算规则。最稳妥的做法是查看当前服务的实际用量字段和文档,而不是只数聊天窗口里自己打了几个字。
可以用一个简化教学账本理解:输入材料为 1,200 Token,输出上限为 800 Token,假定此练习中的总预算为 2,000 Token,那么已经没有空间再加入另一份 600 Token 的附件。现实服务未必使用这样的统一预算公式,本例只是说明上下文和输出都会占用资源。实际可用窗口、输出上限和计费方式需要分别确认。
案例:为什么“压缩成一段”不一定省得最多
你有一份活动安排,包含时间、地点、报名条件和三页历史说明。任务只要求生成一条报名提醒。把全部材料压缩成一个没有换行的长段落,字符数几乎没变,关键信息反而更难检查。更好的处理是保留必要字段,去掉无关历史,并明确“缺失字段不要补写”。
如果要验证节省效果,可以使用与目标模型匹配的官方计数工具,比较完整材料和筛选材料的 Token 数。不要把真实密钥或隐私材料粘贴到不可信的在线计数网站。没有合适工具时,先比较材料相关性和实际输出质量,也比凭经验宣称“减少了百分之八十 Token”可靠。
动手练习
- 准备四段无敏感信息的文本:短中文、短英文、一个网址和一小段 JSON。用同一可信分词器观察切分,记录哪些边界出乎你的预期。
- 为“生成报名提醒”制作完整材料和精选材料两版。确保精选版仍保留活动日期、地点、报名方式及限制条件。
- 用同一输出要求比较两版结果,检查有没有遗漏关键字段。没有模型调用条件时,可以手工检查输入是否足以支持目标输出。
参考答案与推演
正确观察不需要得到固定的 Token 数,而是能说明:网址、标点和语言都会影响切分;换一个分词器,计数可能变化。报告必须写清使用的分词器和输入文本,不能把一个工具的结果宣称为所有模型通用。
在材料筛选练习中,如果删除历史背景后仍能准确写出报名提醒,这是有效压缩;如果顺便删掉了报名截止时间,即使 Token 更少也不合格。最后应把长度、成本和质量分开评价:短输入可能降低资源消耗,但前提是任务所需证据没有被删掉。
完成检查
- 能解释 Token 与字符、单词不是固定的一一对应关系。
- 能复述“计算分布—选择—追加—继续”的过程及其局限。
- 不把低温度当作真实性保证,不编造计数或节省比例。
- 精选材料保留了完成任务必需的全部字段。
参考与来源
- Hugging Face:Tokenizer 课程:了解分词器与语言、训练语料之间的关系。
- Hugging Face:Byte-Pair Encoding:进一步学习一种常见的子词切分方法。
- Sennrich 等:Neural Machine Translation of Rare Words with Subword Units:子词单元在神经机器翻译中的原始研究。
Token 与下一个 Token 预测
3 道题 · 及格分 60 分