首页/新闻资讯/正文详情

小米MiMo-V2.6-Flash-RL推测解码原理:DFlash五层MTP草稿模型如何让生成飞起来

发布时间:2026/9/24 16:52:54 来源:云帆数科 栏目:资讯中心
小米MiMo-V2.6-Flash-RL推测解码原理:DFlash五层MTP草稿模型如何让生成飞起来
小米MiMo-V2.6-Flash-RL推测解码原理DFlash五层MTP草稿模型如何让生成飞起来【免费下载链接】MiMo-V2.6-Flash-RL项目地址: https://ai.gitcode.com/XiaomiMiMo/MiMo-V2.6-Flash-RL小米 MiMo-V2.6-Flash-RL 是小米推出的 3090 亿参数稀疏 MoE 多模态大模型支持 100 万 token 上下文。它的一大亮点是内置推测解码Speculative Decoding一个仅 5 层的 DFlash 草稿模型MTP 多词元预测一次性并行猜出后续 7 个 token再由主模型一次前向并行验证让生成速度成倍提升而输出结果与单独跑主模型完全一致。本文带你从零看懂这套 DFlash 推测解码的原理。⚡ 为什么大模型需要推测解码逐字生成的瓶颈自回归大模型是一个字一个字往外蹦的每生成一个新 token都必须等上一步算完。生成越长这种串行等待越浪费——GPU 大部分时间卡在显存读写上而不是在计算。推测解码的核心思路可以概括为三步让一个轻量草稿模型先快速打草稿一口气猜出几个 token让大主模型一次前向并行验证这整段草稿保留猜对的前缀猜错的位置则采纳主模型给出的正确答案继续下一轮打草稿。这样每猜一轮、验一轮就能产出多个 token且数学上生成分布与主模型独立运行完全一致——加速但不改变输出。 认识 DFlash只有 5 层的轻量 MTP 草稿模型在 MiMo-V2.6-Flash-RL 仓库中草稿模型被独立放在 dflash/ 目录关键参数见 dflash/config.json参数取值作用层数5只有 5 个 Transformer 层推理开销极小注意力类型滑动窗口窗口 1024只关注附近上下文省算力隐藏维度4096与主模型同维度便于直接复用特征block_size8每轮并行预测 7 个新 tokenis_causalfalse块内 7 个位置双向互看一次算完mask_token_id151675草稿块中待填位置的遮罩标记模型结构定义在 dflash/dflash.pyDFlashDraftModel类。对比主模型 48 层 256 路由专家的稀疏 MoE 架构见 config.json这个草稿模型轻得多却猜得很准。巧妙之处不重算上下文直接借用主模型的特征传统草稿模型要自己从头处理整个提示词开销不低。DFlash 的做法更聪明从主模型 48 层中均匀抽取 5 层——第 0、11、23、35、47 层——的中间隐藏特征把 5 份特征拼接后经过一个线性层fc投影回 4096 维作为草稿模型的上下文草稿层注意力中的 K/V 向量由主模型上下文特征与自身草稿特征拼接而成见 Qwen3DFlashAttention。相当于草稿模型不需要重新读一遍原文而是直接看主模型的笔记就动笔。特征提取逻辑在 extract_context_feature训练时loss_decay_gamma: 7.0还会让模型优先把块内靠前的 token 猜准进一步提升整块命中率。 完整流程草稿 7 个、验证 8 个还白赚 1 个完整推理循环实现在 spec_generate 方法中每一轮大致三步并行打草稿取 8 个位置的块首位放已确定的 token其余 7 位填 mask 标记5 层草稿模型一次前向就得到 7 个新 token 的概率并行验证把这整个 8 token 块送入主模型一次前向算出每个位置的正确答案统计接受从前到后数连续匹配的长度代码用cumprod连乘实现保留匹配前缀且在第一个不匹配处额外采纳主模型的 token 作为奖励 token。也就是说每轮平均能白赚若干个 token而主模型验证 8 个 token 的成本与生成 1 个 token 几乎相同——这就是生成飞起来的原因。⚙️ 实际启用SGLang 部署时加几行参数即可官方推荐使用 SGLang 部署完整命令见 README.md。关键推测解码参数有--speculative-algorithm EAGLE启用草稿-验证框架--speculative-num-steps 3最多草稿步数--speculative-num-draft-tokens 4每步草稿 token 数--enable-multi-layer-eagle启用主模型多层特征复用即上文 DFlash 的特征借用技巧主模型权重按 64 个 MoE 分片存放于根目录如 model_pp0_ep0_shard0.safetensors草稿模型权重随 dflash/ 目录一起分发推理引擎加载时会自动配对使用。总结MiMo-V2.6-Flash-RL 生成快的秘密是先猜后验的分工协作5 层 SWA 草稿模型DFlash一次前向并行猜出 7 个 token复用主模型 5 层中间特征免掉草稿模型重算上下文的开销主模型整块并行验证一次前向验 8 个 token结果与逐字生成完全一致。这套 MTP 推测解码机制是通用的推理加速方案也正是 MiMo-V2.6-Flash-RL 能支撑 100 万上下文长文与 Agent 多轮任务的关键底座。【免费下载链接】MiMo-V2.6-Flash-RL项目地址: https://ai.gitcode.com/XiaomiMiMo/MiMo-V2.6-Flash-RL创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

相关推荐

8个必知的Tftpd64高级选项:blksize协商、虚拟根目录到MD5校验配置全解
8个必知的Tftpd64高级选项:blksize协商、虚拟根目录到MD5校验配置全解

8个必知的Tftpd64高级选项:blksize协商、虚拟根目录到MD5校验配置全解 【免费下载链接】tftpd64 The working repository of the famous TFTP server. 项目地址: https://gitcode.com/gh_mirrors/tf/tftpd64 Tftpd64 是一款轻量级的多线程 TFTP 服务器&#… · 2026/9/24 16:52:54

ParlAI 研究项目全景:从 BlenderBot 持续学习到对话安全与多模态的完整路线图
ParlAI 研究项目全景:从 BlenderBot 持续学习到对话安全与多模态的完整路线图

NLP人工智能深度学习 【免费下载链接】ParlAI A framework for training and evaluating AI models on a variety of openly available dialogue datasets. 项目地址: https://gitcode.com/gh_mirrors/pa/ParlAI 点击查看 免费下载 ParlAI 的 projects/ 目录是整个… · 2026/9/24 16:52:54

DocAgent实战:一键生成std.core核心标准库完整文档,效果全览
DocAgent实战:一键生成std.core核心标准库完整文档,效果全览

DocAgent实战:一键生成std.core核心标准库完整文档,效果全览 【免费下载链接】DocAgent 项目地址: https://gitcode.com/Cangjie-SIG/DocAgent DocAgent 是一款专为仓颉语言打造的 AI 文档助手,能够根据预设规则集驱动大模型智能体&a… · 2026/9/24 16:52:48

【股票交易】专栏介绍
【股票交易】专栏介绍

为什么同一家公司的经营状况没有明显变化,股价却可能上涨或下跌 30%? 因为股价不仅反映公司当下的经营结果,还包含市场对未来增长、资金成本和风险的判断。同样的利润,在不同的经济环境、行业阶段和市场情绪下,可能对… · 2026/9/24 17:26:48

液冷服务器渗透率2027年破50%?产业链谁在受益
液冷服务器渗透率2027年破50%?产业链谁在受益

中商产业研究院预计中国液冷服务器渗透率2027年有望突破50%,从2021年不足3%到2027年过半,六年翻十几倍。产业链受益顺序是:最先受益的是液冷板/换热器等核心部件,其次是冷却液、管路、CDU等配套,最后是运维和改造服务。… · 2026/9/24 17:26:48

springboot太原青年背包客深度游小程序20606-计算机课程设计、毕业设计
springboot太原青年背包客深度游小程序20606-计算机课程设计、毕业设计

前言 ✨ 博主介绍:一线全栈工程师,毕设实战引路人。技术栈覆盖Java、Python、C#、PHP、Node.js及UniApp跨端开发,擅长多语言项目落地与架构设计。持续分享毕设源码、开题报告、技术选型心得与职场踩坑经验。用工程化思维写代码,帮… · 2026/9/24 17:26:48

springboot生活商城系统21035-计算机课程设计、毕业设计
springboot生活商城系统21035-计算机课程设计、毕业设计

前言 ✨ 博主介绍:一线全栈工程师,毕设实战引路人。技术栈覆盖Java、Python、C#、PHP、Node.js及UniApp跨端开发,擅长多语言项目落地与架构设计。持续分享毕设源码、开题报告、技术选型心得与职场踩坑经验。用工程化思维写代码,帮… · 2026/9/24 17:26:48

【股票交易】第 46 章 技术分析是什么
【股票交易】第 46 章 技术分析是什么

回到目录文章目录46.1 技术分析研究什么第一,价格向什么方向变化?第二,这种变化伴随着多大的交易量?第三,价格变化是在加速,还是在减弱?第四,价格波动有多大?第五&#x… · 2026/9/24 17:26:48

RocketMQ知识点
RocketMQ知识点

^^ 《榴芒客服系统》是我们工作室开发的在线客服系统,欢迎下载试用: 《榴芒客服系统》https://blog.csdn.net/look4liming/article/details/164755808 RocketMQ是队列式的消息中间件。由Producer、Consumer、Broker、NameServer组成。Productor创建消息… · 2026/9/24 17:26:42

基于YOLOv8的渔船作业监控系统:从环境搭建到边缘部署全流程
基于YOLOv8的渔船作业监控系统:从环境搭建到边缘部署全流程

简介:这是一套面向计算机、人工智能、自动化等专业学生与教师的毕业设计级项目资源,围绕YOLOv8实现渔船作业监控系统,可用于毕设、课程设计、大作业或项目立项演示。压缩包共97个文件,约24.21MB,以70个Python源码文件为… · 2026/9/24 0:00:13

1D-CNN时间序列建模实战:从Conv1d原理到工业落地
1D-CNN时间序列建模实战:从Conv1d原理到工业落地

简介:面向时间序列数据建模的一维卷积神经网络完整实现,适合深度学习入门者及需要快速验证时序模型的研究者,能够从音频、文本、传感器或股价等序列中挖掘局部特征与时间依赖。压缩包体积很小,只有3KB,内含3个Python脚… · 2026/9/24 0:00:26

柔软的L:汉语语流中被忽视的舌肌张力控制
柔软的L:汉语语流中被忽视的舌肌张力控制

1. 这个“L”不是字母表里的L,而是舌尖上的L最近在几个方言群和语音教学社群里,反复看到有人发一句:“也说字母L:柔软的长舌”。初看以为是英语发音课笔记,点开才发现全是方言爱好者、播音系学生、语言康复师甚至戏曲演… · 2026/9/24 0:00:44

了解更多?预约专属演示

我们的顾问将为您一对一讲解产品与方案

企业微信二维码