首页/新闻资讯/正文详情

Token 到底是什么?

发布时间:2026/9/24 15:19:14 来源:云帆数科 栏目:资讯中心
Token 到底是什么?
Token 到底是什么前言一、大模型的基本工作原理二、Tokenizer 的编码和解码过程1. 编码2. 解码三、Tokenizer的训练过程1. 案例-BPE算法四、Tokenizer 的使用过程1. 编码2. 解码五、Token 与字数的换算关系前言相信大家都听说过Context Window这个概念它代表了模型一次能够处理的最大信息量比如GPT-5.2的Context Window为 40 万这就代表它一次最多能够处理 40 万个Token。注意了这里说的不是 40 万个字也不是 40 万个词而是 40 万个Token。相信Token这个词大家都有听过但究竟什么是TokenToken是怎么生成的它和字或者词到底有什么关系今天我就来彻底为大家讲明白Token这个概念我们首先要从大模型的基本运行原理开始讲起。一、大模型的基本工作原理大模型本质上是一个巨大的数学函数内部全是矩阵运算它输入的是数字输出的也是数字根本就不理解人类的文字所以在人类和大模型之间必须站着一个【翻译官】这个【翻译官】的名字就叫做Tokenizer。Tokenizer一共负责 “编码” 和 “解码” 两个环节其中 “编码” 的意思就是把文字转换为数字而 “解码” 就是反过来把数字转回文字。二、Tokenizer 的编码和解码过程1. 编码编码过程文字 - 数字分两个步骤第一步切分它把用户的问题拿过来将它切成一个个最小的单位这些切出来的碎片就叫做Token。第二步映射因为模型只认数字所以Tokenizer会把每一个Token映射为一个对应的数字这个数字就叫做Token ID。Token ID与Token是一对一的关系Token是文字而Token ID是数字它们就是一个硬币的正反面所表达的内容是一样的只不过表现形式不同而已。经过这两步后我们原本的一句话就变成一串Token ID列表然后Tokenizer就会把这个列表传给模型模型在内部一通运算最后吐出来一个Token ID。这时Tokenizer再次登场它要把这个Token ID翻译回Token这次发挥作用的就是“解码”环节了。2. 解码解码过程数字 - 文字只有一步映射。注意解码环节不需要切分因为模型每次只会给出一个Token。解码阶段完成后我们就拿到了大模型输出的第一个Token。当然如果模型没有说完的话它还可以输出第二个Token、第三个Token等等…“编码”和“解码”涉及到切分和映射这几个环节切分和映射分别是如何实现的呢要搞清楚这一点我们就需要先搞清楚Tokenizer这个东西是怎么被制造出来的。三、Tokenizer的训练过程我们今天以BPE为例给大家演示一下Tokenizer的训练流程它的原理很简单大致说来就是从一堆文章里面找出哪些字经常一起使用然后把这些经常一起使用的字合起来作为一个Token。1. 案例-BPE算法首先我们要准备个文章作为训练材料然后用这个训练材料做出两个产物一个是词表另外一个是合并规则。第一步将训练材料中所有的单字拿过来放到词表里面比如“马”、“克”、“喜”、“欢”…等等它们都是Token第二步为词表里面的每一个字分配一个数字也就是Token ID有些人可能会以为Token ID和Embedding向量类似含义相近的词对应的Token ID应该也相近但其实Token ID只是个编号并没有特殊的语义只要保证Token和Token ID是一对一的关系就行。有了词表之后我们就可以把用户的问题切分为Token了。只用单字的效率太低了我们希望每一个词都是一个Token比如“马克”、“喜欢”、“人工智能” 等等让这些常见的词作为Token才是最佳方案所以呢我们最好能够把这些词也加入到词表里面。第三步让算法扫描整段训练材料统计哪些 “字” 或者是哪些 “词” 喜欢待在一起然后将其进行合并加入到词表中为其分配Token ID并将对应的公式记录在合并规则中。算法扫描后发现“智” 和 “能” 这两个字在这段话里一共出现了五次频率最高。于是算法进行了第一次合并将 “智能” 加入到词表中为其分配一个Token ID并把智 能 —— 智能这个公式记录在合并规则中。从此以后在Tokenizer的眼里“智能” 就是一个整体会处理为一个Token算法继续扫描发现“人”和“工”一共出现了三次当前频率最高。于是使用同样的流程将其合并更新词表并记录下人 工——人工的这个合并规则算法继续扫描发现当前频率最高的是 “人工” 和 “智能” 于是使用同样的流程将进行合并这样Tokenizer就认识“人工智能”这个词了。按照这个规则继续对训练材料进行处理…全部处理完后我们的Tokenizer就训练完毕了它的核心组件就是词表和合并规则。下面我们回到模型的运行流程里看看这个Tokenizer是怎么用的。四、Tokenizer 的使用过程1. 编码切分阶段将用户的问题先分成一个一个的单字再与训练好的合并规则进行比对、合并这样一句完整的用户问题就被切分为了四个Token映射阶段根据词表的映射规则把切分后所得到的Token转换为Token ID2. 解码将模型返回的TokenID与词表进行映射。五、Token 与字数的换算关系40万 Token ≠ 40万字因为Tokenizer不光是一个翻译机它还是一个压缩机。它把经常在一起出现的字合并成了一个 Token例如上面将原本9个字的 “马克喜欢人工智能吗” 合并为四个Token所以Tokenizer可以使模型的输入更少因此模型的训练和推理效率也更高。⚠️量化参考1个Token ≈ 0.75个英文单词1个Token ≈ 1.5-2个汉字40万Token ≈ 60-80万汉字 或 30万英文单词上述博客来自Token 到底是什么—— 揭秘大模型背后的“文字压缩术”

相关推荐

基于结构化森林的快速边缘检测:OpenCV ximgproc 模块 StructuredEdgeDetection 实战与原理解析
基于结构化森林的快速边缘检测:OpenCV ximgproc 模块 StructuredEdgeDetection 实战与原理解析

计算机视觉图像处理深度学习机器学习 【免费下载链接】opencv_contrib Repository for OpenCVs extra modules 项目地址: https://gitcode.com/gh_mirrors/op/opencv_contrib 点击查看 免费下载 导读 边缘检测是计算机视觉的基石任务,但经典方法&#… · 2026/9/24 15:19:01

ESPnet 模型发布指南:TEMPLATE_HF_Readme.md 模板解析与 HuggingFace 模型发布实战
ESPnet 模型发布指南:TEMPLATE_HF_Readme.md 模板解析与 HuggingFace 模型发布实战

人工智能语音音频深度学习NLP 【免费下载链接】espnet End-to-End Speech Processing Toolkit 项目地址: https://gitcode.com/gh_mirrors/es/espnet 点击查看 免费下载 导读 本文以 egs2/TEMPLATE/asr1/scripts/utils/TEMPLATE_HF_Readme.md 为核心,系… · 2026/9/24 15:19:01

2026年大模型时代:企业业务智能化底座横评与选型指南
2026年大模型时代:企业业务智能化底座横评与选型指南

大模型与智能体技术进入规模落地阶段后,企业级AI智能办公、AI办公助手与智能办公平台,正从通用对话走向办公垂直场景的深度融合。对组织而言,真正的价值不在于模型参数高低,而在于AI能否嵌入文档、表格、合同、知识管理等真实办公… · 2026/9/24 15:19:01

Cytoscape.js 视口适配(fit)完全指南:原理、参数与源码级实战
Cytoscape.js 视口适配(fit)完全指南:原理、参数与源码级实战

数据可视化 【免费下载链接】cytoscape.js Graph theory (network) library for visualisation and analysis 项目地址: https://gitcode.com/gh_mirrors/cy/cytoscape.js 点击查看 免费下载 Cytoscape.js 的 cy.fit() 是图可视化中最常用的视口控制 API 之一&… · 2026/9/24 15:48:38

深入解析 npm/arborist 中 peerOptional 冲突为何不应触发 ERESOLVE:以 `peer-optional-eresolve` 测试夹具为线索
深入解析 npm/arborist 中 peerOptional 冲突为何不应触发 ERESOLVE:以 `peer-optional-eresolve` 测试夹具为线索

开发工具包管理器CLI 【免费下载链接】cli the package manager for JavaScript 项目地址: https://gitcode.com/gh_mirrors/cli4/cli 点击查看 免费下载 导读 本文围绕 arborist 测试夹具 peer-optional-eresolve 展开,剖析一组历史上被错误判定为 ER… · 2026/9/24 15:48:38

AI应用开发课程怎么选?对比五家机构后我选了知乎知学堂
AI应用开发课程怎么选?对比五家机构后我选了知乎知学堂

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/24 15:48:32

从人工到AI:短视频配音方式正在发生哪些变化
从人工到AI:短视频配音方式正在发生哪些变化

短视频行业的爆发式增长,让"配音"这个曾经隐藏在幕后的环节,逐渐走到了聚光灯下。好的配音能赋予画面灵魂,差的配音则能让再精美的画面都黯然失色。从最初的真人录制、到后来各种配音工具涌现、再到现在AI大模型直接生成自然语音—… · 2026/9/24 15:48:32

大麦自动抢票工具ticket-purchase:不开刷新狂点,3步跑通一次完整抢票演练
大麦自动抢票工具ticket-purchase:不开刷新狂点,3步跑通一次完整抢票演练

大麦自动抢票工具ticket-purchase:不开刷新狂点,3步跑通一次完整抢票演练 【免费下载链接】ticket-purchase 大麦自动抢票,支持人员、城市、日期场次、价格选择 项目地址: https://gitcode.com/GitHub_Trending/ti/ticket-purchase 开… · 2026/9/24 15:48:32

实验室设备运输哪家专业
实验室设备运输哪家专业

你是不是也经历过这种崩溃时刻?为了压降预算,随口找了家干线车队拉走价值千万的超低温冰箱和质谱仪。结果半路颠簸,防震气囊未充填,回到新址开机直接报错。实验室搬迁从来不是简单的“拆箱再装箱”,它是一项高度系统化… · 2026/9/24 15:48:26

基于YOLOv8的渔船作业监控系统:从环境搭建到边缘部署全流程
基于YOLOv8的渔船作业监控系统:从环境搭建到边缘部署全流程

简介:这是一套面向计算机、人工智能、自动化等专业学生与教师的毕业设计级项目资源,围绕YOLOv8实现渔船作业监控系统,可用于毕设、课程设计、大作业或项目立项演示。压缩包共97个文件,约24.21MB,以70个Python源码文件为… · 2026/9/24 0:00:13

1D-CNN时间序列建模实战:从Conv1d原理到工业落地
1D-CNN时间序列建模实战:从Conv1d原理到工业落地

简介:面向时间序列数据建模的一维卷积神经网络完整实现,适合深度学习入门者及需要快速验证时序模型的研究者,能够从音频、文本、传感器或股价等序列中挖掘局部特征与时间依赖。压缩包体积很小,只有3KB,内含3个Python脚… · 2026/9/24 0:00:26

柔软的L:汉语语流中被忽视的舌肌张力控制
柔软的L:汉语语流中被忽视的舌肌张力控制

1. 这个“L”不是字母表里的L,而是舌尖上的L最近在几个方言群和语音教学社群里,反复看到有人发一句:“也说字母L:柔软的长舌”。初看以为是英语发音课笔记,点开才发现全是方言爱好者、播音系学生、语言康复师甚至戏曲演… · 2026/9/24 0:00:44

了解更多?预约专属演示

我们的顾问将为您一对一讲解产品与方案

企业微信二维码