发布时间:2026/8/19 21:56:20
9. 理解 Tokenizer 什么是 Tokenizer分词器如果只用一句话解释Tokenizer 就是大模型和人类语言之间的翻译器。它负责把文本变成数字Token ID再把数字还原成文本。因为神经网络根本不认识你好 ChatGPT Transformer它只认识[1532, 8756, 42, 998]所以在进入模型之前必须经过 Tokenizer。为什么需要 Tokenizer假设有一句话我喜欢机器学习计算机看到的其实只是UTF-8字节流而 Transformer 的输入要求是Embedding向量中间必须经过文字 ↓ Tokenizer ↓ Token ID ↓ Embedding ↓ Transformer完整流程我喜欢机器学习 │ ▼ Tokenizer │ ▼ [315, 892, 1256, 87] │ ▼ Embedding │ ▼ [[0.1,0.3,...], [0.7,0.2,...], ...]最早的做法按单词切分例如I love machine learning直接按空格切[I,love,machine,learning]然后建立词表I → 1 love → 2 machine → 3 learning → 4变成[1,2,3,4]看起来很简单。但问题巨大。问题1词表会无限大例如dog dogs dogging dogged到底算几个词再比如ChatGPT ChatGPT-4 ChatGPT-5 ChatGPT-Pro新词天天出现。如果全部加入词表词表 无限大模型根本存不下。问题2遇到新词怎么办训练时apple banana orange测试时watermelon词表里没有watermelon就变成UNKUnknown信息直接丢失。所以出现了 Subword子词现代大模型几乎都采用Subword Tokenization核心思想不按单词切而按“常见片段”切。例如unbelievable切成un believe able即使没见过unbelievably也能切un believe ably模型依然能理解。BPEGPT 系列经典方案现代 Tokenizer 的祖师爷之一Byte Pair Encoding (BPE)最早用于压缩算法后来被 NLP 使用。GPT-2、GPT-3 的 tokenizer 基本都属于 BPE 家族。CausalBPE 是怎么训练出来的假设语料low lower lowest初始状态l o w l o w e r l o w e s t统计最常出现的相邻字符l o出现很多次。合并lo得到lo w lo w e r lo w e s t继续统计lo w继续合并low最终low er est成为词表。举个真实例子GPT Tokenizer 可能会把understanding切成under stand ing因为这些片段出现频率很高。而不会切成u n d e r ...这样效率太低。Token 不等于字很多初学者容易误解1 Token 1 个字实际上不是。例如hello可能是[hello]1 Token。中文你好可能[你, 好]2 Token。复杂词internationalization可能[inter, national, ization]3 Token。所以字符数 ≠ Token数Tokenizer 是如何训练的现代 TokenizerBPE、SentencePiece通常经历第一步收集语料例如Wikipedia Common Crawl Books Github几十 TB 数据。第二步统计频率统计机器 学习 深度学习 Transformer出现次数。第三步构建词表保留最常见的50000 100000 128000个 Token。例如 Llama 系列常见规模约为十万级词表。CausalSentencePiece2018 年 Google 提出了著名的SentencePiece论文其特点是不依赖空格传统英文I love AI先按空格切。SentencePieceI▁love▁AI把空格本身也作为符号学习。因此英文 中文 日文 韩文都能统一处理。(Hugging Face)Tokenizer 在训练中的位置完整训练链路可以理解为Tokenizer 编译器前端Transformer 则是CPUCPU 不认识高级语言。Transformer 不认识自然语言。都需要先翻译。一个直观例子输入我爱北京天安门Tokenizer 可能输出[我, 爱, 北京, 天安门]对应 ID[128, 52, 981, 3476]进入 Embedding128 → 向量A 52 → 向量B 981 → 向量C 3476→ 向量D最终形成[B,L,D] [1,4,4096]送入 Transformer。从训练大模型的角度理解你正在学习从零训练大模型可以把 Tokenizer 看成Tokenizer 把文本压缩成模型能处理的离散符号它主要解决三个问题1. 文本如何数字化 2. 未登录词(OOV)如何处理 3. 词表大小如何控制因此整个训练流程实际上是海量文本 │ ▼ Tokenizer训练 │ ▼ 生成词表(vocab) │ ▼ 文本→Token │ ▼ Embedding训练 │ ▼ Transformer训练可以说Tokenizer 是整个大模型训练流水线的第一步。没有 Tokenizer就没有后面的 Embedding、Attention 和 Transformer。

相关新闻

2026/8/19 21:51:20

RT-Thread消息队列实战:从轮询到高效线程通信的设计模式

1. 从“轮询”到“消息”:为什么我们需要消息队列 在嵌入式开发,尤其是RT-Thread这类实时操作系统的应用里,线程(或任务)间的通信是一个绕不开的核心话题。很多初学者,包括我自己刚入门时,最容易…

2026/8/19 21:51:20

AURIX™ TC3xx在智能小车开发中的核心优势与实战指南

1. 项目背景与AURIX™在智能小车领域的崛起最近在整理工创赛和各类电子设计竞赛的资料,发现一个非常明显的趋势:越来越多的智能小车项目,无论是物流搬运、循迹避障还是竞速,其主控芯片的选择正在从传统的STM32、51单片机&#xff…

2026/8/19 23:06:36

零代码构建AI智能体:从RAG知识库到工作流的Coze实战指南

1. 先搞清楚 Coze 到底能帮你做什么,以及它和直接问大模型有什么区别如果你刚接触 AI 应用开发,看到“AI 智能体”、“RAG 知识库”、“工作流”这些词可能会有点懵。简单来说,Coze 是一个让你不用写复杂代码,就能把大语言模型&am…

2026/8/19 23:06:36

多模态手部感知技术:从传感器融合到自然交互的系统实践

1. 项目概述:从“手”中洞察世界的可能性“The Hands Can Tell A Lot”——双手能诉说很多。这个标题初看像一句富有哲理的格言,但在我们这些常年与数据、算法和传感器打交道的从业者看来,它指向的是一个充满想象力的技术交叉领域&#xff1a…

2026/8/19 23:06:36

深部脑刺激技术原理与认知增强应用前景分析

1. 项目概述:当“脑力增强”遇上硬核神经调控 最近在神经科技和生物黑客圈子里,一个名为“The 420% IQ Booster”的概念引起了不小的讨论。这个听起来极具冲击力的标题,直指一个古老而终极的人类梦想:通过技术手段,安全…

2026/8/19 23:06:36

DNS协议选择:UDP与TCP的智能切换机制及工程实践

“DNS走TCP还是UDP?”——这可能是面试官最爱问的网络基础题之一,也是很多开发者容易答错或答不全的“送分题”。很多人会脱口而出:“DNS用UDP,端口53。” 这个答案只对了一半,甚至可能让你在资深面试官面前失分。为什…

2026/8/19 23:06:36

用数字FAE做智能门锁方案设计:功耗、安全、成本一次跑通

智能门锁的待机电流,是选型时最容易翻车的指标——主控、蓝牙、电源三家各管一段,任何一环没配合好,整机功耗就压不下去。最近做一个门锁方案,需求列了一页纸:蓝牙开锁、指纹识别、电池供电、防拆报警、还要预留联网接…

2026/8/19 23:01:36

基于Arduino与RC522的RFID门禁系统DIY:从原理到智能工具柜实战

1. 项目概述:当RFID遇上DIY,无限创意由此开启 如果你手头有几张闲置的门禁卡、公交卡,或者对超市里“嘀”一下就能结账的标签感到好奇,那么“DIY Idea with RFID”这个主题绝对能为你打开一扇新世界的大门。RFID,也就是…

2026/8/19 4:14:28

工业通信系统底层逻辑:04 反射——高频能量撞墙之后会发生什么?

第四篇:反射——高频能量撞墙之后会发生什么? —— 你以为信号已经过去了,其实它正在回来打你 老Q的现场笔记 第五季,我们正式进入工业神经系统层。这里不再是单个设备的战斗,而是整个工厂“经脉”层面的秩序之战。从这一篇开始,你将第一次看清:看似简单的信号传播,背…

2026/8/19 15:09:57

工业传感器与变送器详解:序章 从物理世界到工业数据

序章 从物理世界到工业数据 ——重新认识工业传感器与变送器 工业自动化系统正变得日益复杂。今天的工业现场早已不是简单的控制回路,而是由多层技术共同构成的立体体系:PLC、DCS、SCADA、MES、工业互联网、边缘计算与人工智能。控制系统可以执行复杂算法,工业网络可以实现…

2026/8/19 0:00:35

【单片机课程设计/毕业设计】基于 STM32 与 WiFi 模块的室内通风智能管控系统设计 基于 STM32 的人体存在感知自适应风扇控制系统设计(018503)

博主介绍:✌️码农一枚 ,专注于大学生项目实战开发、讲解和毕业🚢文撰写修改等。全栈领域优质创作者,博客之星、掘金/华为云/阿里云/InfoQ等平台优质作者、专注于嵌入式单片机,Java、小程序技术领域和毕业项目实战 ✌️…

2026/8/19 0:00:35

AI如何驱动数学猜想生成:从大语言模型到自动化数学发现

1. 项目概述:当AI开始“猜”数学定理 最近在AI研究圈里,一个名为“Moonshine”的项目引起了不小的讨论。这名字本身就挺有意思,直译是“月光”,但在数学史上,它特指一个神秘而美丽的联系——魔群月光猜想,连…

2026/8/19 0:00:36

Agentic Web:构建智能体原生网络的基础设施挑战与四大支柱

1. 从“被动网络”到“能动网络”:一个正在发生的范式转移 如果你最近关注AI和Web技术的前沿动态,可能会频繁听到“Agentic Web”这个词。它不像“Web3”那样带着浓厚的金融色彩,也不像“元宇宙”那样充满科幻感,但它所描绘的未来…

2026/8/18 18:23:10

实测才敢推 AI论文网站 2026最新测评与推荐

2026年真正好用的AI论文网站,核心看生成的论文质量、低AI味、格式正确、学术适配四大指标。综合实测,千笔AI、ThouPen、豆包、DeepSeek、Grammarly 是当前最值得推荐的梯队,覆盖从免费到付费、从中文到英文、从文科到理工的全场景需求。一、综…

2026/8/19 4:14:38

2026必备!AI论文网站测评:最新推荐与深度对比

2026年真正好用的AI论文网站,核心看生成的论文质量、低AI味、格式正确、学术适配四大指标。综合实测,千笔AI、ThouPen、豆包、DeepSeek、Grammarly 是当前最值得推荐的梯队,覆盖从免费到付费、从中文到英文、从文科到理工的全场景需求。 一、…

2026/8/19 16:39:34

摆脱论文困扰!盘点2026年全网爆红的的AI论文写作工具

一天写完毕业论文在2026年已不再是天方夜谭。2026年最炸裂、实测能大幅提速的AI论文写作工具,覆盖选题构思、文献整理、内容生成、格式排版等核心场景,真正帮你高效搞定论文难题。 一、全流程王者:一站式搞定论文全链路(一天定稿首…