9. 理解 Tokenizer

发布时间:2026/10/6 16:12:56

9. 理解 Tokenizer 什么是 Tokenizer分词器如果只用一句话解释Tokenizer 就是大模型和人类语言之间的翻译器。它负责把文本变成数字Token ID再把数字还原成文本。因为神经网络根本不认识你好 ChatGPT Transformer它只认识[1532, 8756, 42, 998]所以在进入模型之前必须经过 Tokenizer。为什么需要 Tokenizer假设有一句话我喜欢机器学习计算机看到的其实只是UTF-8字节流而 Transformer 的输入要求是Embedding向量中间必须经过文字 ↓ Tokenizer ↓ Token ID ↓ Embedding ↓ Transformer完整流程我喜欢机器学习 │ ▼ Tokenizer │ ▼ [315, 892, 1256, 87] │ ▼ Embedding │ ▼ [[0.1,0.3,...], [0.7,0.2,...], ...]最早的做法按单词切分例如I love machine learning直接按空格切[I,love,machine,learning]然后建立词表I → 1 love → 2 machine → 3 learning → 4变成[1,2,3,4]看起来很简单。但问题巨大。问题1词表会无限大例如dog dogs dogging dogged到底算几个词再比如ChatGPT ChatGPT-4 ChatGPT-5 ChatGPT-Pro新词天天出现。如果全部加入词表词表 无限大模型根本存不下。问题2遇到新词怎么办训练时apple banana orange测试时watermelon词表里没有watermelon就变成UNKUnknown信息直接丢失。所以出现了 Subword子词现代大模型几乎都采用Subword Tokenization核心思想不按单词切而按“常见片段”切。例如unbelievable切成un believe able即使没见过unbelievably也能切un believe ably模型依然能理解。BPEGPT 系列经典方案现代 Tokenizer 的祖师爷之一Byte Pair Encoding (BPE)最早用于压缩算法后来被 NLP 使用。GPT-2、GPT-3 的 tokenizer 基本都属于 BPE 家族。CausalBPE 是怎么训练出来的假设语料low lower lowest初始状态l o w l o w e r l o w e s t统计最常出现的相邻字符l o出现很多次。合并lo得到lo w lo w e r lo w e s t继续统计lo w继续合并low最终low er est成为词表。举个真实例子GPT Tokenizer 可能会把understanding切成under stand ing因为这些片段出现频率很高。而不会切成u n d e r ...这样效率太低。Token 不等于字很多初学者容易误解1 Token 1 个字实际上不是。例如hello可能是[hello]1 Token。中文你好可能[你, 好]2 Token。复杂词internationalization可能[inter, national, ization]3 Token。所以字符数 ≠ Token数Tokenizer 是如何训练的现代 TokenizerBPE、SentencePiece通常经历第一步收集语料例如Wikipedia Common Crawl Books Github几十 TB 数据。第二步统计频率统计机器 学习 深度学习 Transformer出现次数。第三步构建词表保留最常见的50000 100000 128000个 Token。例如 Llama 系列常见规模约为十万级词表。CausalSentencePiece2018 年 Google 提出了著名的SentencePiece论文其特点是不依赖空格传统英文I love AI先按空格切。SentencePieceI▁love▁AI把空格本身也作为符号学习。因此英文 中文 日文 韩文都能统一处理。(Hugging Face)Tokenizer 在训练中的位置完整训练链路可以理解为Tokenizer 编译器前端Transformer 则是CPUCPU 不认识高级语言。Transformer 不认识自然语言。都需要先翻译。一个直观例子输入我爱北京天安门Tokenizer 可能输出[我, 爱, 北京, 天安门]对应 ID[128, 52, 981, 3476]进入 Embedding128 → 向量A 52 → 向量B 981 → 向量C 3476→ 向量D最终形成[B,L,D] [1,4,4096]送入 Transformer。从训练大模型的角度理解你正在学习从零训练大模型可以把 Tokenizer 看成Tokenizer 把文本压缩成模型能处理的离散符号它主要解决三个问题1. 文本如何数字化 2. 未登录词(OOV)如何处理 3. 词表大小如何控制因此整个训练流程实际上是海量文本 │ ▼ Tokenizer训练 │ ▼ 生成词表(vocab) │ ▼ 文本→Token │ ▼ Embedding训练 │ ▼ Transformer训练可以说Tokenizer 是整个大模型训练流水线的第一步。没有 Tokenizer就没有后面的 Embedding、Attention 和 Transformer。
延伸阅读

更多相关文章

2026/10/4 13:28:13

RT-Thread消息队列实战:从轮询到高效线程通信的设计模式

1. 从“轮询”到“消息”:为什么我们需要消息队列 在嵌入式开发,尤其是RT-Thread这类实时操作系统的应用里,线程(或任务)间的通信是一个绕不开的核心话题。很多初学者,包括我自己刚入门时,最容易…

2026/10/6 4:30:49

AURIX™ TC3xx在智能小车开发中的核心优势与实战指南

1. 项目背景与AURIX™在智能小车领域的崛起最近在整理工创赛和各类电子设计竞赛的资料,发现一个非常明显的趋势:越来越多的智能小车项目,无论是物流搬运、循迹避障还是竞速,其主控芯片的选择正在从传统的STM32、51单片机&#xff…

2026/10/6 16:09:25

睿尔曼机械臂二指夹爪集成:从法兰安装到多协议控制实战

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/6 16:09:25

林伽一 · AI科技周报 | 2026年10月第1周

当三家前沿实验室在同一周内先后迭代旗舰模型,技术选型的标尺正在被重新校准。OpenAI 在年度 DevDay 上发布 GPT-6.1 Sol 与常驻智能体 Dots,把编码、计算机操作与专业工作的能力推向接近 Astra 级[① OpenAI Blog];Anthropic 的 Claude Sonn…

2026/10/6 16:09:25

旋转表冠慢拧太迟钝、快拧又跳过头:HarmonyOS 穿戴输入曲线设计

旋转表冠慢拧太迟钝、快拧又跳过头:HarmonyOS 穿戴输入曲线设计 这不是一个 API 的问题 列表只有十项,慢拧表冠时一格要转很久,快拧时又直接跳到末尾。把每个事件固定映射成一个条目,看似稳定,却忽略了旋转速度和连续…

2026/10/6 16:09:25

Windows CMD 的 `cd`(change directory,切换目录)命令

Windows 的 cd 命令跨盘符切换文件夹时,不会自动切换磁盘。当前在 C 盘,cd 只能修改同盘内的目录,想要跳到 E等其他 盘目录,有两种写法:先切盘符,再 cdE: cd E:\aizhigeng-mvp\mlcd 加 /d 参数,…

2026/10/6 16:09:25

天赐范式第185天:让漂变开始定量——扫N看选择主导边界

天赐范式第185天第二篇:让漂变开始定量——扫N看选择主导边界摘要补184-2的N侧。有限种群漂变每代注入σ_g/√N噪声,选择每代推hS。扫N从20到1000(6个格点,50 seeds),Δ*均值≈0.005不随N变——选择响应是确…

2026/10/5 6:32:56

Jev+Agent接管浏览器:browser-use实战与jev-ultrafast性能优化

1. 从“Jev”说起:为什么我要把Agent接进浏览器“Jev”这个词最近在圈子里出现的频率越来越高,很多人第一次听到会以为是某个新模型的名字,其实它更像是一种思路——把Jev模型的能力当作底座,通过Agent的方式去接管浏览器&#xf…

2026/10/6 4:01:51

多智能体集群实战:DeepAgents编排、MCP与A2A协议及Skills体系

1. 从"单兵作战"到"集群协同":多智能体编排到底在解决什么问题如果你最近在折腾 Agent 相关的东西,大概率会有一种感觉:单个 Agent 能做的事情,其实很快就摸到天花板了。你给它一个提示词,挂几个工…

2026/10/5 17:38:27

无源低通滤波器设计实战:从RC到LC,手把手教你避开那些坑

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/6 0:03:23

MR25H40CDF+STM32F031C6工业级高可靠数据存储方案

1. 项目概述:为什么在工业现场非得用 MR25H40CDF 配 STM32F031C6 做数据存储?在工厂产线的 PLC 控制柜里、在风电变流器的散热片背面、在矿井监测终端的金属外壳下,你经常能看到一块指甲盖大小的黑色芯片——它既不是 Flash,也不是…

2026/10/6 0:03:23

MRAM+STM32工业断电数据保全实战指南

1. 项目概述:为什么在工业现场非得用 MR25H40CDF 配 STM32F031C6 做数据存储?在工厂产线的PLC柜里、在野外无人值守的环境监测终端里、在高速运转的包装机控制板上,你经常能看到一块指甲盖大小的黑色芯片,旁边贴着“MR25H40CDF”丝…

还想了解更多?直接咨询顾问

免费诊断 + 免费方案 + 透明报价。

全国咨询热线400-8866-253
免费获取方案
☎咨询二维码 ☎ ↑