首页/新闻资讯/正文详情

MoE就是复制的mlp;gate 训练就是谁答的好久分给谁奖励

发布时间:2026/9/25 18:54:17 来源:云帆数科 栏目:资讯中心
MoE就是复制的mlp;gate 训练就是谁答的好久分给谁奖励
MoE-MLP 完整流转(输入→门控选专家→专家计算→输出)目录MoE-MLP 完整流转(输入→门控选专家→专家计算→输出)一、先固定:几个专家、选几个(人工超参,不是模型决定)二、内部逐层流转(一个token,从输入到输出)步骤1:Gate门控打分(核心,一个线性层)步骤2:softmax转概率步骤3:选Top-K(这里K=2)步骤4:只把x送进选中的专家(每个专家就是你截图的MLP)步骤5:按Gate概率加权合并 → 最终输出关键:Gate怎么"学会"选哪个专家Gate 为什么能打分?关键:每个专家在Gate里有一列专属权重用最小数字演示(d=2,2个专家)为什么点积能衡量"匹不匹配"这套"模板"哪来的专家分工是怎么来的?分工靠一个"正反馈"循环每层Gate权重都不一样为什么不统一两个辅助机制为什么能分开MoE 放在哪一层?Gate 权重怎么训练?梯度怎么传回来(关键)直觉例子(一个中文token)还有第二股梯度:负载均衡loss更新公式(和普通训练一样)MoE就是把这1套MLP复制成N份(N个专家),再加1个Gate门控。一、先固定:几个专家、选几个(人工超参,不是模型决定)这两个数字训练前写死,模型不会自己变:num_experts:总专家数,比如8个(专家E0~E7,每个都是你截图里那套 w1+gelu+w2 的MLP)top_k:每个token激活几个专家,比如Top2(Switch Transformer是Top1)专家数量 = 代码配置,不是MLP算出来的;门控只负责"从N个里挑哪K个"。二、内部逐层流转(一个token,从输入到输出)设:隐藏维d=4,8个专家,Top2,输入token向量x = [ 0.1 , 0.2 , 0

相关推荐

3DGS高斯泼溅项目环境搭建(传统Windows版)和ooosplat直接安装使用
3DGS高斯泼溅项目环境搭建(传统Windows版)和ooosplat直接安装使用

ooosplat直接安装使用 OOOSplat 是一款将普通环绕拍摄视频或图片序列一键转换为 3D Gaussian Splatting 的本地桌面应用。选择素材、项目目录和质量档位后,应用会自动完成画面准备、相机重建、训练与 PLY 发布,并可直接预览、调整和导出结果 github下载… · 2026/9/25 18:54:17

为什么现在聚焦 kv cache;分清楚:kv权重 和 kv向量
为什么现在聚焦 kv cache;分清楚:kv权重 和 kv向量

权重只存一份,KV 是每个 token 存一份,token 够多 kv 向量越大 目录 权重只存一份,KV 是每个 token 存一份,token 够多 kv 向量越大 一、先看两者怎么随长度变化 二、算出来的结果 三、为什么必然如此(本质) 四、现代大模型呢 一、先看两者怎么随长度变化 模型权重:固定… · 2026/9/25 18:54:11

Univer集成实战:开源Web办公套件的选型与踩坑指南
Univer集成实战:开源Web办公套件的选型与踩坑指南

Univer 最近在 GitHub 和社交平台上的讨论热度一直不低,作为一个前端从业者,我最早是因为要给客户的数据中台做“在线表格填写 自动汇总”这个需求才注意到它的。简单说,Univer 是一套 Web 端的开源办公套件,覆盖电子表格、文档、… · 2026/9/25 18:53:46

EfficientNet(EfficientNet-B0~B7):复合缩放,精度与算力均衡的CNN缩放范式
EfficientNet(EfficientNet-B0~B7):复合缩放,精度与算力均衡的CNN缩放范式

一、时代痛点:传统CNN缩放方式的固有缺陷 在EfficientNet诞生之前,研究者提升模型精度一般采用三种独立策略,各自存在明显瓶颈: 单纯加深网络深度。更深网络可以捕捉更复杂语义,但深度过大容易出现梯度消失&#xff1b… · 2026/9/25 19:18:00

2005-2024年 上市公司业绩说明会文本+情感语调数据 xlsx
2005-2024年 上市公司业绩说明会文本+情感语调数据 xlsx

1、数据介绍 本数据集覆盖2005-2024年全部A股上市公司业绩说明会全量文本与情感语调指标,依托自然语言处理技术完成全样本文本特征提取与量化编码。研究沿用领域通用的“净正面语调”核心指标,计算公式为净正面语调(正面词汇数−负面词汇数&… · 2026/9/25 19:17:54

GEO内容怎么做?企业官网AI检索实操指南
GEO内容怎么做?企业官网AI检索实操指南

GEO内容怎么做?企业官网AI检索实操指南官网被 AI 搜到,不是把关键词重复几遍就可以。AI 搜索要先理解企业是谁、提供什么、服务谁,再判断页面是否有足够的产品事实、案例、时间和联系入口。很多企业官网有首页、有新闻,却没有一页… · 2026/9/25 19:17:54

List(模拟实现)
List(模拟实现)

list模拟实现 一、整体数据结构:带头双向循环链表 _head ──→ [哨兵节点] ←── _head↕[节点1] ←→ [节点2] ←→ ... ←→ [节点n]带头:引入一个不存储有效数据的 _head 哨兵节点,使得空链表时 begin() end() _head,无需… · 2026/9/25 19:17:48

ChatGPT模拟面试和专业AI面试工具有什么区别?2026年6个维度逐一PK:用TaoToken统一Key跑通面试工具配置
ChatGPT模拟面试和专业AI面试工具有什么区别?2026年6个维度逐一PK:用TaoToken统一Key跑通面试工具配置

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/25 19:17:48

企业微信AI SCRM怎么选?微盛·企微管家功能详解及落地实操指南
企业微信AI SCRM怎么选?微盛·企微管家功能详解及落地实操指南

企业在做客户管理和私域运营时,选择适配的企业微信SCRM工具,是降本提效、实现客户资产长效沉淀的核心路径。目前国内企业微信SCRM赛道中,微盛企微管家凭借11年行业积累、全链路功能覆盖、多场景落地经验,成为各类企业的优先选择。… · 2026/9/25 19:17:48

数值优化(Numerical Optimization)学习系列-03-共轭梯度方法(Conjugate Gradient)
数值优化(Numerical Optimization)学习系列-03-共轭梯度方法(Conjugate Gradient)

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/25 1:00:31

创维E900V22D刷机全攻略:S905L3SB芯片兼容性解析与救砖实战
创维E900V22D刷机全攻略:S905L3SB芯片兼容性解析与救砖实战

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/25 1:00:31

MQTT协议原理与Broker服务器搭建实战:从Mosquitto到EMQX
MQTT协议原理与Broker服务器搭建实战:从Mosquitto到EMQX

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/25 1:00:37

了解更多?预约专属演示

我们的顾问将为您一对一讲解产品与方案

企业微信二维码