
一起动脑筋 · 先看一个小故事
女孩把句子切成小纸片,机器人说:模型处理的“小块”叫 token,但不总是一整词。
把过程摊开来看
- 原文一段文字
- 分词器按规则拆分
- token 编号供模型计算
- 生成后再还原为文字
Token 是语言模型处理文本时使用的单位,可能是词、词的一部分、字符或其他片段。
具体切分由分词器决定,不同模型可能不同。中文也不能简单假定一个汉字一定对应一个 token。
把“纸片”当作处理单位的比喻,可以理解为什么字符数与 token 数不总一样。
轮到你来试一试
英文长单词一定只占一个 token 吗?
想好了吗?点开看解释
不一定,它可能被拆成几个片段,需看具体分词规则。
带走一个发现
Token 是语言模型处理文本时使用的单位,可能是词、词的一部分、字符或其他片段。
试着遮住上面的图,把每一步讲给家人听。如果某一步说不清楚,就回到那张卡片再看一遍。