首页/新闻资讯/正文详情

GPT-4是如何切分文本的?How to Train Your GPT详解BPE分词器的完整原理

发布时间:2026/9/27 0:42:49 来源:云帆数科 栏目:资讯中心
GPT-4是如何切分文本的?How to Train Your GPT详解BPE分词器的完整原理
GPT-4是如何切分文本的How to Train Your GPT详解BPE分词器的完整原理【免费下载链接】how-to-train-your-gptBuild a modern LLM from scratch. Every line commented. Explained like we are five.项目地址: https://gitcode.com/gh_mirrors/ho/how-to-train-your-gptHow to Train Your GPT 是一个从零教你搭建并训练 GPT 大模型的开源教程每一行代码都带注释。这篇文章带你弄懂其中最关键的第一步GPT-4 等现代大模型是如何切分文本的——完整拆解 BPE 分词器Byte Pair Encoding的原理、优势与实操方法。读完你就能看到 unbelievably 如何变成 un believ ably以及为什么大模型从不被新词、emoji 难倒。什么是文本分词大模型读懂文字前的第一步 计算机只认识数字不认识字母。你输入 The cat sat模型看到的其实是[464, 3797, 3332]这样的整数序列。这个文字 → 数字的转换工作就是分词Tokenization。最朴素的想法是给每个单词分配一个编号单词编号cat9246sat6734the279但这条路走不通——英文有上百万个词antidisestablishmentarianism 这种生僻词也要编号吗训练时不存在的新词比如 skibidi怎么办模型直接报错。✅ BPE 分词器给出了答案不按整词切按高频子词切。BPE分词器完整原理GPT-4切分文本的3步走BPE 的核心思想只有一句话从单个字符开始反复把出现频率最高的一对相邻符号合并成新符号。第1步统计相邻字符对的出现次数以low lower lowest为例先把每个字符当作独立 tokenl o w _ l o w e r _ l o w e s t _然后数一数哪些相邻对出现得最多例如lo出现了 4 次是最高频的一对。第2步合并最高频的字符对把l和o合并成新 tokenlo整段文本变成lo w _ lo w e r _ lo w e s t _第3步循环合并直到词表达到目标大小重复统计 → 合并最高频对low→es→est……几轮之后词表长这样{ l, o, w, e, r, s, t, _, lo, low, er, est, ... }神奇的事情发生了没见过的词也能用这些碎片拼出来slower→slower从未训练过照样能表示antidisestablishmentarianism→antidisestablishmentarianism而 GPT 系列的分词器执行了5 万次合并从全部 256 种字节出发最终得到50257 个 token50000 次合并 256 个字节 token 1 个 EOS 特殊 token。完整的逐步推演见 bpe_tokenization.md图文讲解版见 02_tokenization.md。为什么BPE比按词切分强一张表看懂问题场景整词切分BPE子词切分running vs run两个毫无关联的 token共享 runn模型能看出联系新词 rizz未知词 → 直接失败rizz字符级兜底永不出错词表大小50万又慢又臃肿5万快且均衡emoji / 中文 / 代码经常翻车基于字节处理任何文本都能编码 ⚠️ 两个容易忽略的细节空格前缀ĠGPT 分词器把空格粘在下一个词前面 Ġcat和cat是不同的 token。这让空格几乎不占额外 token编码效率更高。EOS 特殊 token【免费下载链接】how-to-train-your-gptBuild a modern LLM from scratch. Every line commented. Explained like we are five.项目地址: https://gitcode.com/gh_mirrors/ho/how-to-train-your-gpt创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

相关推荐

wasm3 可挂起执行与快照(Snapshots)实战指南:`--snapshot` / `--resume` 的中断恢复、Gas 检查点与跨架构续跑
wasm3 可挂起执行与快照(Snapshots)实战指南:`--snapshot` / `--resume` 的中断恢复、Gas 检查点与跨架构续跑

解释器嵌入式语言运行时 【免费下载链接】wasm3 🚀 A fast WebAssembly interpreter and the most universal WASM runtime 项目地址: https://gitcode.com/gh_mirrors/wa/wasm3 点击查看 免费下载 wasm3 的快照机制允许正在运行的 WebAssembly 模块在执… · 2026/9/27 0:42:49

5分钟上手Observal:从本地部署到看到第一条AI会话追踪的完整快速入门教程
5分钟上手Observal:从本地部署到看到第一条AI会话追踪的完整快速入门教程

5分钟上手Observal:从本地部署到看到第一条AI会话追踪的完整快速入门教程 【免费下载链接】Observal Observal is self-hosted registry for your coding agent extensions with a built in insight engine. Setup Observal, define the scope and share your Skill… · 2026/9/27 0:42:29

NgRx Router Store 安装指南:使用 `ng add` 与手动方式快速接入
NgRx Router Store 安装指南:使用 `ng add` 与手动方式快速接入

前端状态管理 【免费下载链接】platform Reactive State for Angular 项目地址: https://gitcode.com/gh_mirrors/pl/platform 点击查看 免费下载 导读 ngrx/router-store 是 NgRx 生态中连接 Angular Router 与 Store 的核心绑定库,它通过监听路由事件… · 2026/9/27 0:42:22

《线性系统理论》核心难点拆解:从状态空间到极点配置
《线性系统理论》核心难点拆解:从状态空间到极点配置

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/27 1:21:36

PaddleNLP Pipelines Answer Extractor 模块全解析:基于 UIE 的无监督问答数据自动构建
PaddleNLP Pipelines Answer Extractor 模块全解析:基于 UIE 的无监督问答数据自动构建

人工智能大模型预训练微调LoRARLHF强化学习分布式训练 【免费下载链接】PaddleNLP Easy-to-use and powerful LLM and SLM library with awesome model zoo. 项目地址: https://gitcode.com/gh_mirrors/pa/PaddleNLP 点击查看 免费下载 本文围绕 PaddleNLP 中 slm/… · 2026/9/27 1:21:36

中兴F50无线调试全攻略:不拆机不刷机,ADB远程连接实战
中兴F50无线调试全攻略:不拆机不刷机,ADB远程连接实战

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/27 1:21:35

ai-marketing-skills 专家团评测:7-10位AI领域专家递归打磨内容直到90+分
ai-marketing-skills 专家团评测:7-10位AI领域专家递归打磨内容直到90+分

ai-marketing-skills 专家团评测:7-10位AI领域专家递归打磨内容直到90分 【免费下载链接】ai-marketing-skills Open-source AI marketing skills — growth experiments, sales pipeline, content ops, outbound, SEO, and finance automation 项目地址: https:/… · 2026/9/27 1:21:35

从零搭建Gazebo+ROS智能小车仿真环境:URDF建模到SLAM导航全流程
从零搭建Gazebo+ROS智能小车仿真环境:URDF建模到SLAM导航全流程

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/27 1:21:35

广州地区艺考美术学习阶段目标与画室适配评估逻辑框架拆解
广州地区艺考美术学习阶段目标与画室适配评估逻辑框架拆解

本文中立拆解广州地区美术艺考全周期学习的阶段目标设计、能力达标评估维度,以及学员与教学体系适配性的判断逻辑,所有阶段划分、验收标准均参考广州本地具备22年办学积淀的正规艺考培训机构(人艺画室)经过18000余名学员实战验证的… · 2026/9/27 1:21:29

MATLAB雷达信号脉冲压缩仿真:LFM线性调频、匹配滤波与距离分辨率实现
MATLAB雷达信号脉冲压缩仿真:LFM线性调频、匹配滤波与距离分辨率实现

简介:这套Matlab仿真工具完整呈现雷达信号脉冲压缩过程,从线性调频(LFM)信号生成、目标回波仿真到匹配滤波压缩处理均有可运行代码支撑,面向电子信息工程、计算机、数学等专业学生,适用于课程设计、期末大作… · 2026/9/27 0:00:01

汕头网站建设制作厂家避坑指南:5大注意事项救急
汕头网站建设制作厂家避坑指南:5大注意事项救急

汕头网站建设制作厂家避坑指南:5大注意事项救急 改个需求建站公司拖一周,这种憋屈事我见得太多了。 很多汕头老板找本地建站团队,签合同前看着方案挺美,一上线就变脸。 今天不聊虚的,直接拆解找 汕头网站建设制作厂家 时的5个核心 注意事项… · 2026/9/27 0:00:01

多模态虚假新闻检测实战:BERT+ResNet双塔与对比学习
多模态虚假新闻检测实战:BERT+ResNet双塔与对比学习

简介:基于PyTorch的多模态虚假新闻检测项目完整代码包,面向自然语言处理与计算机视觉交叉方向的开发者、科研人员及毕业设计选题者,解决社交媒体中文本与图像联合识别虚假新闻的问题。系统以BERT预训练模型提取文本语义特征,以Res… · 2026/9/27 0:00:01

MATLAB雷达信号脉冲压缩仿真:LFM线性调频、匹配滤波与距离分辨率实现
MATLAB雷达信号脉冲压缩仿真:LFM线性调频、匹配滤波与距离分辨率实现

简介:这套Matlab仿真工具完整呈现雷达信号脉冲压缩过程,从线性调频(LFM)信号生成、目标回波仿真到匹配滤波压缩处理均有可运行代码支撑,面向电子信息工程、计算机、数学等专业学生,适用于课程设计、期末大作… · 2026/9/27 0:00:01

汕头网站建设制作厂家避坑指南:5大注意事项救急
汕头网站建设制作厂家避坑指南:5大注意事项救急

汕头网站建设制作厂家避坑指南:5大注意事项救急 改个需求建站公司拖一周,这种憋屈事我见得太多了。 很多汕头老板找本地建站团队,签合同前看着方案挺美,一上线就变脸。 今天不聊虚的,直接拆解找 汕头网站建设制作厂家 时的5个核心 注意事项… · 2026/9/27 0:00:01

多模态虚假新闻检测实战:BERT+ResNet双塔与对比学习
多模态虚假新闻检测实战:BERT+ResNet双塔与对比学习

简介:基于PyTorch的多模态虚假新闻检测项目完整代码包,面向自然语言处理与计算机视觉交叉方向的开发者、科研人员及毕业设计选题者,解决社交媒体中文本与图像联合识别虚假新闻的问题。系统以BERT预训练模型提取文本语义特征,以Res… · 2026/9/27 0:00:01

了解更多?预约专属演示

我们的顾问将为您一对一讲解产品与方案

企业微信二维码