完整指南How to Train Your GPT 详解 LLM 推理加速与采样参数设置KV Cache、Temperature、Top-k/Top-P 一次讲透【免费下载链接】how-to-train-your-gptBuild a modern LLM from scratch. Every line commented. Explained like we are five.项目地址: https://gitcode.com/gh_mirrors/ho/how-to-train-your-gpt在 How to Train Your GPT 项目中模型训练完成后进入 LLM 推理阶段你会遇到两类核心问题生成为什么慢靠 KV Cache 解决和输出如何可控靠 Temperature、Top-k、Top-P 采样参数解决。本文用大白话讲透 LLM 推理的工作原理并给出采样参数的实战设置建议新手也能直接上手。从训练到推理生成为什么变慢了 训练时模型一次并行处理整个序列预测所有位置的下一个词而推理时只能一个字一个字地蹦——每个新词都要依赖前面已生成的内容必须串行执行。更关键的是如果不做任何优化每生成一个新词都要把整段已有序列重新计算一遍。生成到第 500 个词时前面的 499 个词已经被重复计算了 499 次时间消耗呈平方级增长。项目自带的训练损失曲线loss 稳步下降意味着模型学会了预测下一个词这正是 LLM 推理能够生成的基础KV CacheLLM 推理提速的关键缓存 ⚡核心思想旧词的记忆不用重算在注意力机制中每个词会算出 Key键和 Value值向量。推理时发现前面词的 K/V 不管生成到第几步都不变。所以 KV Cache 的做法是把已算好的 K/V 存起来新词只计算它自己那一份然后追加进缓存。步骤 1处理 The → 缓存 K[The], V[The] 步骤 2处理 cat → 复用缓存只算 cat 的 K/V 步骤 3处理 sat → 复用缓存只算 sat 的 K/V ...就像写长邮件没有缓存时你每打一个新词都要从头重读整封邮件有缓存时你只需记住写过的内容专注当前词即可。提速有多夸张序列长度无 KV Cache 运算量有 KV Cache 运算量加速倍数1005,050 次100 次50×500125,250 次500 次250×4096830 万次4096 次2048×序列越长KV Cache 的作用越明显——它把生成复杂度从平方级降到线性级。代价用显存换速度缓存随序列变长而线性膨胀。以 GPT-2 Small 生成 1000 个词为例KV Cache 约 37 MB轻松无压力但 GPT-3 级别模型跑长上下文时缓存可能吃掉几十 GB 显存。这就是为什么长对话推理对 GPU 显存要求极高也催生了分组查询注意力GQA等省显存技术参见 grouped_query_attention.md。 完整讲解见kv_cache.md、chapters/09_inference.mdTemperature控制 LLM 输出随机性的温度旋钮 ️模型对每个词吐出的是一组原始分数logits。Temperature 就是在这组分数上做的一次除法分数 ÷ 温度。低温度如 0.3分布变尖锐模型自信且保守适合事实问答温度 1.0不改动原始概率标准输出高温如 1.5分布被压平冷门词也有机会适合创意写作同一个提示词不同温度的输出效果T0.2The capital of France is Paris, which is located in the Île-de-France region. T0.8The capital of France is Paris, a city known for its art, cuisine, and... T1.5The capital of France is Paris, where baguettes dream of becoming croissants...Top-k 采样只保留最可能的 k 个候选 ✂️Temperature 再低5 万个词表里每个词仍有微小概率冷门乱码词偶尔会钻出来。Top-k 直接一刀切只保留概率最高的 k 个词其余全部清零。k50通用默认值滤掉明显胡话又保留足够多样性k10激进过滤输出更收敛但偏重复k1退化为贪心解码永远选最可能的词容易陷入重复循环Top-p核采样跟着模型置信度自适应截断 Top-k 的问题是一刀切——模型有时很有把握只需 3 个候选有时很犹豫需要 50 个候选。Top-p 的思路更聪明按概率从高到低累加累加超过 p 就停只保留这批词。举例概率排序为 [0.45, 0.22, 0.13, 0.08, 0.05, ...]Top-p 0.9 → 前 5 个词累加到 0.93保留 5 个Top-p 0.5 → 前 2 个词累加到 0.67只保留 2 个也就是说模型有把握时自动收窄候选没把握时自动放宽——这正是 Top-p 常被推荐的原因。采样参数推荐组合新手直接抄作业 生产环境里三个参数通常叠加使用流程是logits ÷ temperature → top-k 截断 → top-p 截断 → softmax 归一化 → 随机抽一个场景temperaturetop_ktop_p说明事实问答 / 代码0.2~0.3200.9聚焦、可靠通用对话默认0.7~0.8500.9⭐ 推荐起步值创意写作 / 头脑风暴1.2~1.51000.95放飞、多样化项目源码里的默认生成示例就是temperature0.8, top_k50可直接参考 main.py 中的generate方法以及 notebooks/09_inference.ipynb 的交互演示。延伸阅读与源码位置 资源路径推理章节KV Cache 采样策略全表chapters/09_inference.mdKV Cache 深度讲解explanations and examples WIP/kv_cache.mdTemperature/Top-k/Top-p 详解explanations and examples WIP/sampling.md完整实现含训练与生成main.pyBeam Search 对比阅读explanations and examples WIP/beam_search.md一句话总结KV Cache 让 LLM 推理快几个数量级Temperature 管随机性Top-k 管候选数量Top-p 管自适应截断——四件套理解透你就掌握了 LLM 推理调参的全部核心。【免费下载链接】how-to-train-your-gptBuild a modern LLM from scratch. Every line commented. Explained like we are five.项目地址: https://gitcode.com/gh_mirrors/ho/how-to-train-your-gpt创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
企业数字化 ERP 产品动态
相关推荐
R3300L刷Armbian装OMV:百元ARM NAS实战指南 /* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/27 2:49:00
CCB智能体协作图谱实战:如何稳定实现A→B→C复杂多智能体通信 CCB智能体协作图谱实战:如何稳定实现A→B→C复杂多智能体通信 【免费下载链接】claude_codex_bridge Visible multi-agent CLI workspace for mixing Codex, Claude, Gemini, Kimi, Qwen, Cursor, Copilot, Pi, OpenCode, and other AI coding agents 项目地址: h… · 2026/9/27 2:48:54
视频序列目标检测与跟踪算法:融合差分与Mean Shift的工程实践 /* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/27 2:48:54
6T SRAM存储单元深度解析:从电路原理到版图设计实战 /* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/27 3:21:24
我做了一个本地 AI 学习软件,免费开源本地运行 攒了几十个 G 的课件却从没学过之后,我做了一个本地 AI 学习软件
先交代背景:我硬盘里躺着 21 份课件、论文和教材,几个 G 到几十个 G 不等。每次下定决心"这周必须看完",结局都是打开第一份,翻三页… · 2026/9/27 3:21:00
企业AI自动化落地:如何用接口边界与验收方法判断服务方 企业AI自动化落地:如何用接口边界与验收方法判断服务方
企业在评估AI自动化服务方时,最常遇到的问题不是"能不能做",而是"做出来能不能用、出了事谁负责"。本文从技术实践的角度,给出一套可复用的判断维度&am… · 2026/9/27 3:20:54
S905L3S/3SB盒子刷机:BL加载工具与Maskrom救砖全解析 /* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/27 3:20:54
数据治理与决策协同:AI+BI跨部门规模化落地的运营机制 导语
很多企业在AIBI单部门试点阶段取得了不错的局部成果,但当项目从单部门扩展到跨部门规模化落地时,往往会遇到指标口径各部门解释不一致、数据访问权限边界不清、数据治理和业务决策脱节等问题,最终导致AIBI的业务价值无法在全企业层面放大… · 2026/9/27 3:20:54
晶晨S905L3A盒子刷机实战:从固件解包到线刷精简全流程 /* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/27 3:20:54
MATLAB雷达信号脉冲压缩仿真:LFM线性调频、匹配滤波与距离分辨率实现 简介:这套Matlab仿真工具完整呈现雷达信号脉冲压缩过程,从线性调频(LFM)信号生成、目标回波仿真到匹配滤波压缩处理均有可运行代码支撑,面向电子信息工程、计算机、数学等专业学生,适用于课程设计、期末大作… · 2026/9/27 0:00:01
汕头网站建设制作厂家避坑指南:5大注意事项救急 汕头网站建设制作厂家避坑指南:5大注意事项救急 改个需求建站公司拖一周,这种憋屈事我见得太多了。 很多汕头老板找本地建站团队,签合同前看着方案挺美,一上线就变脸。 今天不聊虚的,直接拆解找 汕头网站建设制作厂家 时的5个核心 注意事项… · 2026/9/27 0:00:01
多模态虚假新闻检测实战:BERT+ResNet双塔与对比学习 简介:基于PyTorch的多模态虚假新闻检测项目完整代码包,面向自然语言处理与计算机视觉交叉方向的开发者、科研人员及毕业设计选题者,解决社交媒体中文本与图像联合识别虚假新闻的问题。系统以BERT预训练模型提取文本语义特征,以Res… · 2026/9/27 0:00:01
MATLAB雷达信号脉冲压缩仿真:LFM线性调频、匹配滤波与距离分辨率实现 简介:这套Matlab仿真工具完整呈现雷达信号脉冲压缩过程,从线性调频(LFM)信号生成、目标回波仿真到匹配滤波压缩处理均有可运行代码支撑,面向电子信息工程、计算机、数学等专业学生,适用于课程设计、期末大作… · 2026/9/27 0:00:01
汕头网站建设制作厂家避坑指南:5大注意事项救急 汕头网站建设制作厂家避坑指南:5大注意事项救急 改个需求建站公司拖一周,这种憋屈事我见得太多了。 很多汕头老板找本地建站团队,签合同前看着方案挺美,一上线就变脸。 今天不聊虚的,直接拆解找 汕头网站建设制作厂家 时的5个核心 注意事项… · 2026/9/27 0:00:01
多模态虚假新闻检测实战:BERT+ResNet双塔与对比学习 简介:基于PyTorch的多模态虚假新闻检测项目完整代码包,面向自然语言处理与计算机视觉交叉方向的开发者、科研人员及毕业设计选题者,解决社交媒体中文本与图像联合识别虚假新闻的问题。系统以BERT预训练模型提取文本语义特征,以Res… · 2026/9/27 0:00:01