一、TokenToken 是 LLM 处理文本的最小单位。模型不认字、不认词只认 token。你把文本给 LLM它第一步不是读而是切我爱北京→[我,爱,北,京]←4个 tokenChatGPT→[Chat,G,PT]←3个 token 切出来的每一小块就是一个 token。 然后每个 token 换成一个数字ID我→101爱→204北→331京→887模型真正计算的是这些数字不是文字。Token 不是字也不是词Token 是介于字和词之间的子词单元文本按字切按词切按 token 切playingp-l-a-y-i-n-gplayingplay ing苹果苹 果苹果苹果或 苹果我爱北京我爱北京我爱北京我爱北京为什么不用字或词按字切序列太长一个英文词要 7 个 token按词切词表爆炸几十万上百万还处理不了新词按子词切折中方案词表可控又能处理任意文本为什么要分词用有限词表覆盖无限文本。三个现实约束词表不能无限大人类词汇 专有名词 拼写错误 多语言不可能每个词一个 ID要能处理没见过的词新词、错拼、人名靠拆成子词兜底要压缩序列长度太长了模型算不动中英文差异英文有空格边界清楚常见词 ≈ 1 个 token apple → 1 token中文没空格边界模糊词表以英文为主训练中文覆盖不足一个汉字 UTF-8 占 3 字节可能被拆成 2~3 个 token结果中文通常比英文更费 token。特殊 token除了正常文字还有功能型 token模型看到标记才知道该我回答了。|im_start|user 你好|im_end||im_start|assistantToken 为什么重要上下文长度“支持 128K 上下文” 128000 个 token不是 128K 字API 按 token 收费输入 token 输出 token 账单模型理解模型看到的、算的、生成的全是 token。切得不好理解就差。二、EmbeddingEmbedding 是把 token或词、句子变成一串数字向量让语义相近的东西向量也相近。它是模型能理解语义的基础。Token 解决的是怎么切Embedding 解决的是怎么变成数字给模型算。苹果→[0.2, -0.5,0.8,...,0.1]← 一串数字比如4096维香蕉→[0.3, -0.4,0.7,...,0.2]← 和苹果很接近汽车→[-0.8,0.9, -0.3,...,0.6]← 离得很远 核心特性语义相近 → 向量相近。苹果和香蕉都是水果 → 向量接近苹果和汽车不相关 → 向量远Token 是切出来的块Embedding 是块的数字表示。文本我爱苹果│ ① 分词 ▼ Token[我,爱,苹果]← token │ ② 查 Embedding 表 ▼ 向量[[...],[...],[...]]← 每个 token 一个向量 │ ③ 加位置编码 ▼ 送入 Transformer 计算Embedding 来自巨大的查找表Embedding 矩阵维度1 维度2 维度3...我[0.2, -0.5,0.8,...]爱[0.1,0.3, -0.2,...]苹果[-0.4,0.9,0.1,...]...词表 15 万 × 4096 维 6 亿多个参数就在这张表里这张表是训练学出来的不是人定的每个 token 的 ID 直接去表里查对应行Embedding 的层级不止词有 Embedding句子、文档也有类型输入输出用途Token Embedding单个 token向量LLM 输入层句子 Embedding一整句一个向量语义搜索、聚类文档 Embedding一段文档一个向量RAG 检索RAG 里用的是句子/文档 Embedding把文档和问题都变成向量比谁近找最相关的。Embedding 在 RAG 里的作用RAG 的核心流程① 文档切片 → 每片做 Embedding → 存进向量库 ② 用户提问 → 做 Embedding → 得到一个向量 ③ 在向量库里找和问题向量最接近的文档片 ④ 把这些片喂给 LLM让它基于它们回答关键靠 Embedding 的语义距离做检索而不是关键词匹配好处搜怎么减肥能找到如何瘦身关键词不同语义相近传统关键词搜索做不到三、自回归一个一个往外蹦词每蹦一个就把它加到输入里再预测下一个。模型生成一句话不是一次性吐出全部而是循环 每一步的输出变成下一步输入的一部分。这就是自回归 输入今天天气 ↓ 预测 输出真 ↓ 把真拼回去 输入今天天气真 ↓ 预测 输出好 ↓ 拼回去 输入今天天气真好 ↓ 预测 输出eos结束和 KV Cache 的关系自回归每一步都要看前文如果每步都把前文重算一遍会慢死。所以用 KV Cache重点一个词的 K/V只取决于它自己和后面来什么词无关。今天的 K/V → 算一次就定了后面不会变天气的 K/V → 算一次就定了后面不会变 既然不变为什么要重算存起来不就行了 这就是 KV Cache 的核心思想。每一步只算新词前文靠缓存。 这是自回归能实用的关键。 步1算[今天,天气]→ 缓存 K/V Cache{今天: K1,V1;天气: K2,V2}→ 出真步2只算[真]→ 复用缓存 → 出好步3只算[好]→ 复用缓存 → 出eos训练时和推理时的自回归训练时并行不用真自回归答案已知所以一句话里每个位置同时预测推理时串行真自回归答案未知只能一个一个来自回归的优缺点优点质量高每步都能看到完整前文灵活想生成多长都行统一对话、翻译、写作全是预测下一个词缺点慢必须串行不能并行错误累积前面错一个后面可能一路错下去幻觉它是在算下一个词不是查事实三、概率分布与采样LLM 生成文本的最后一步。模型算完一大轮最终要落到到底选哪个词。这一步就是概率分布 采样。概率分布步骤 1模型输出 logits原始打分真→12.5不→10.1很→9.8好→9.2的→7.5汽车→-3.2... 词表15万个就有15万个分数这叫 logits不是概率只是原始分数可正可负。步骤 2Softmax → 概率分布用 Softmax 把 logits 变成总和为 1 的概率真→0.35不→0.18很→0.15好→0.12的→0.06汽车→0.0001... 加起来1.0这一串每个词的概率就是概率分布。它描述模型认为下一个词是各个词的可能性有多大。步骤 3可选温度调整分布用温度 Temperature 调整分布的陡峭程度温度低0.2→ 分布变陡 → 高概率词更突出 温度高1.5→ 分布变平 → 各词概率接近 温度1→ 保持原样 温度不改变词的概率排序只改变分布的尖锐程度。步骤 4进入采样根据采样策略要真正选出一个词。采样策略策略 1贪心Greedy做法永远选概率最高的那个词。优点确定、稳定缺点死板、易重复适用事实问答、代码要确定性策略 2随机采样Random Sampling做法按概率随机抽概率大的更容易被抽中。优点多样、自然缺点可能抽到长尾里的离谱词适用创意写作策略 3温度采样Temperature做法先用温度调整分布再随机采样。温度越低越保守越高越随机。温度分布效果适用0~0.3很陡几乎确定代码、数学、RAG0.7~1.0适中平衡通用对话1.2~2.0很平发散、有创意写诗、头脑风暴策略 4Top-K 采样做法只保留概率最高的 K 个词其余丢弃重新归一化再采样。K3真0.35┐不0.18├─ 保留很0.15┘ ────────────好0.12┐的0.06├─ 丢弃... ┘作用砍掉长尾避免抽到离谱词。缺点K 固定不够灵活有的场景候选该多有的该少策略 5Top-P核采样 Nucleus Sampling做法从高到低累加概率累积到 P如 0.9就停只在这批词里采样。P0.9真0.35→ 累计0.35不0.18→ 累计0.53很0.15→ 累计0.68好0.12→ 累计0.80的0.06→ 累计0.86了0.05→ 累计0.91← 超过0.9停只在前 6 个词里采样。优点候选数量动态比固定 K 更灵活。现在最常用策略 6Beam Search做法保留多条候选路径最后选整体概率最高的那条。Beam3 路径1今天天气 → 真 → 好 路径2今天天气 → 真 → 的 路径3今天天气 → 不 → 错 最后选整体得分最高的优点整体最优缺点慢、输出保守适用机器翻译完整流程输入今天天气 ↓ 模型前向计算 ↓ logits15 万个分数 ↓ Softmax 概率分布15 万个概率和为1 ↓ 温度调整 调整后的分布 ↓ Top-K / Top-P 过滤 候选词集合 ↓ 随机采样 选出1个词真↓ 拼回输入 → 下一轮自回归四、什么是注意力机制五、什么是多头注意力六、什么是位置编码七、什么是 FFN前馈网络八、什么是残差与归一化九、什么是 KV Cache什么是幻觉什么是解码策略什么是量化什么是批处理什么是投机解码什么是提示注入什么是越狱什么是内容过滤什么是可解释性什么是长上下文什么是多模态什么是推理模型第一周基础概念1.1Token →1.2Embedding →1.3自回归 →1.4采样 第二周Prompt 与生成5.1Prompt →5.7CoT →4.1解码策略 第三周RAG5.2RAG →5.3向量数据库 →3.5幻觉 第四周Agent5.4Agent →5.5工具调用 →5.6记忆 第五周工程6.1应用架构 →6.2可观测性 →6.3成本优化 →6.4评估 第六周安全7.1提示注入 →7.2越狱 →7.3内容过滤
企业数字化 ERP 产品动态
相关推荐
硅基流动实测复盘:开源模型MaaS与全模型聚合平台的搭配策略 硅基流动作为国产MaaS第一梯队的代表,综合口碑扎实:150余款模型覆盖语言、图像、视频、语音,注册用户规模庞大,自研推理引擎宣称语言推理提速明显,注册即送体验额度,十分钟就能调通首个API。实测下来,它的开源模型生态与价格确实是强项,但闭源模型缺席也让它的适用边界清晰。本… · 2026/9/26 16:26:41
E2-10G网络测试模块:全速率、超线速与深协议解析技术解析 1. 这块“E2-10G”到底在解决什么真问题?“全速率超线速深协议”——这九个字不是宣传稿里的空洞口号,而是我过去三年在数据中心网络测试现场反复摔打出来的痛点清单。去年底给一家头部云厂商做400G交换机压力验证时,我们卡在了一个极其尴尬的… · 2026/9/26 16:26:35
桂林东明大众4s店地址在哪营业时间收费标准 行业立意:锚定城市出行需求,践行汽车流通服务行业责任
顺应产业发展趋势,扎根桂北汽车服务市场汽车产业是国民经济重要支柱产业,随着居民消费能力提升与出行需求升级,消费者对汽车销售服务、售后维保的专业化、标准化要… · 2026/9/26 18:05:53
Atlas 300V 24G部署YOLO实战:推理卡定位、模型转换与调优全解析 这阵子公司要做一批视频检测服务,人手一张显卡倒是齐了,可成本实在压不住。后来项目组弄来一块 Atlas 300V 24G,大家第一反应都一样:这卡能跑 YOLO 吗?Atlas 不好部署吧?我带着同样的疑问折腾了小两周&… · 2026/9/26 18:05:53
WorkBuddy个人成长计划:模板+智能体+自动化任务三层架构实战 1. 为什么我要自己搭一套 WorkBuddy 个人成长计划先说结论:WorkBuddy 这类工具最大的价值,不是帮你多干几件事,而是把“你今天该干什么、干到什么程度、明天怎么接着干”这条链路固化下来。我前后折腾过七八套任务管理方案,从纯手… · 2026/9/26 18:05:53
佛山知名的防撞吸音软包厂家 推荐一下耐用品牌公司避坑挑选指南 佛山哪里有资质齐全的防撞吸音软包厂家?
佛山挑选防撞吸音软包怎么避坑?
佛山有哪些耐用的防撞吸音软包品牌值得推荐?Q1:佛山哪里有资质齐全的防撞吸音软包厂家?很多做公检法办案区新建改造的总包单位,还有佛山本地的工装分包商,找防撞吸… · 2026/9/26 18:05:47
常州资质齐全的滚针轴承加工厂避坑挑选指南:不踩坑选择参考 先搞懂滚针轴承:新手也能快速建立基础认知
滚针轴承的核心属性是什么?滚针轴承是一类装有圆柱滚针的滚动轴承,相比普通深沟球轴承,它的滚动体直径远小于外径,因此整体结构更紧凑,径向尺寸更小,同时还能拥有… · 2026/9/26 18:05:47
SSM+Flask双框架酒店客房管理系统实战解析 1. 这个项目到底解决什么问题1.1 适合人群与交付物梳理先聊点实际的。手头这个“基于JavaSSMFlask的酒店客房管理系统”,十有八九是计算机专业课程设计或者毕业设计,因为它的交付物太典型了:源码、LW(论文/说明书)、调… · 2026/9/26 18:05:40
数据库课后习题答案别硬背:当测试用例集刷,效率翻倍 简介:万常选版《数据库原理与设计》课后习题答案资源,覆盖第2至6章及第9章,适合正在学习关系模型、数据库建模、关系数据理论与模式求精的本科生、自学者作为复习与自测材料。压缩包共7个文件,含3个doc参考答案、2个sql示例脚本、… · 2026/9/26 0:00:21
OpenClaw 替代品?Hermes Agent 踩坑实录:macOS 飞书接入 TaoToken 配置 /* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/26 0:00:40
向下兼容与向上兼容:接口设计中的兼容性策略与工程实践 一次版本升级事故,是很多团队绕不过去的坎。线上环境里,服务端明明已经上线了新版接口,老的移动端还在照着旧文档传参数。请求一到网关,校验直接拒绝,用户操作失败,客服群炸了锅,开发群里开始互… · 2026/9/26 0:00:46