1. 从热搜词里读懂小米大模型这盘棋1.1 为什么一个团队负责人的档案能冲上热搜说实话我第一次看到小米 MiMo 大模型团队负责人深度档案这个标题挂在热搜上的时候并不意外。过去一年里小米在大模型这条赛道上的动作密度明显加快了从 MiMo 系列模型的迭代节奏到澎湃 OS 里逐步落地的端侧 AI 能力再到围绕 MoE 架构的一系列技术讨论整个社区的关注度是被一点点堆起来的。当一个团队的技术路线开始被普通用户拿来和答题答案内测资格手机端能不能传图片这些具体场景绑在一起讨论时说明它已经越过了纯技术圈层进入了大众视野。罗福莉这个名字之所以被反复提及本质上是因为她代表了一种稀缺的组合既有一线大模型研究的深度积累又能把研究成果落到一个拥有海量终端设备的生态里。这种研究落地的双重身份在当下的大模型竞争格局里非常关键。因为纯做模型的公司很多但能把模型塞进手机、平板、汽车座舱、智能家居这一整套硬件矩阵里并且让用户真正用起来的屈指可数。我写这篇东西的目的很直接不是去复述一份简历而是借这个切入点把小米 MiMo 这条技术线背后的逻辑、MoE 架构到底是怎么回事、端侧大模型为什么难、以及普通开发者和爱好者能从中学到什么一次性讲透。如果你是大模型方向的学生、想入门 AI 应用的开发者或者只是好奇小米的大模型到底强在哪的普通用户这篇都能给你一些实在的东西。1.2 热搜词背后藏着的真实需求把那些热搜词摊开看其实能清晰分出几类人群。第一类是技术好奇型搜MoE 架构MoE 负载均衡代码MoE 架构要全部参数进显存吗的人多半是想搞明白混合专家模型到底怎么工作的甚至想自己动手跑一跑。第二类是产品体验型搜mimo 模型不能传图片mimo coding plancodex 中使用 mimo 模型的人关心的是这个模型能干什么、怎么用、有什么限制。第三类是生态参与型搜小米内测答题答案澎湃 OS4 答题答案beta 版最新消息关注哪个账号的人想挤进内测、第一时间体验新功能。第四类是硬件折腾型搜rx6750gre 训练大模型AI 大模型本地部署配置android app 集成 ai 大模型 gguf的人想在自己的设备上把大模型跑起来。这四类需求其实指向同一个核心问题大模型正在从云端走向端侧从实验室走向普通人的设备。而小米 MiMo 这条线恰好是观察这个趋势的一个绝佳样本。理解了它你就能理解未来两三年 AI 应用落地的主战场在哪里。2. MiMo 与 MoE先把核心概念掰开揉碎2.1 MiMo 到底是什么别被名字绕晕很多人第一次听到 MiMo 会以为是小米版的某个国外模型其实不是。MiMo 是小米自研的大模型系列代号它的定位从一开始就很明确面向端侧和云侧协同的场景强调在有限算力下做出可用的智能。这里的关键词是有限算力。你要知道云端跑一个千亿参数模型背后是成排的加速卡和稳定的供电散热但手机端不行手机要考虑功耗、发热、内存占用还要保证响应速度。这两者的约束条件差了不止一个数量级。所以 MiMo 的技术选型里MoEMixture of Experts混合专家架构几乎是必然选择。为什么因为 MoE 的核心思想是用多少算多少——模型里有很多个专家子网络但每次推理只激活其中一小部分。这就好比一个公司里有几十个专业部门但处理一个具体任务时只需要叫上相关的三五个部门开会而不是全员到场。这样总参数量可以做得很大知识容量大但实际计算量却控制得很小推理快、省电。2.2 MoE 架构的工作原理用大白话讲清楚传统稠密模型Dense Model是这样的你输入一句话模型里所有的参数都参与计算。参数量越大效果通常越好但计算量也线性增长。MoE 则把前馈网络层拆成多个专家再加一个路由器Router/Gating Network。路由器根据输入内容决定把这句话分配给哪几个专家处理。举个具体例子。假设一个 MoE 层有 8 个专家每次激活 2 个。你输入帮我写一段 Python 代码路由器可能判断这属于编程和逻辑推理相关的专家于是激活专家 3 和专家 6。你输入这首诗的意境是什么路由器可能激活文学和语义理解相关的专家 1 和专家 5。整个过程里另外 6 个专家完全不参与计算省下来的算力就是 MoE 的效率来源。这里有个很多人搞混的点热搜里也有人问MoE 架构要全部参数进显存吗答案是训练时通常需要推理时不一定。训练阶段因为要更新所有专家的梯度一般需要把全部参数加载进来但推理阶段如果做了专家分片或者按需加载理论上只需要把当前激活的专家放进显存。不过实际工程中为了减少加载延迟很多部署方案还是会把全部参数常驻显存用显存换速度。这就是一个典型的工程权衡。2.3 负载均衡MoE 最容易翻车的地方MoE 有个经典难题叫专家坍缩Expert Collapse。意思是训练过程中路由器可能越来越偏爱某几个专家导致这几个专家被过度使用其他专家几乎不被激活。结果就是模型参数量看着很大实际有效的就那么几个白白浪费了容量还拖慢了训练。解决办法就是负载均衡。常见做法是在损失函数里加一个辅助损失项auxiliary loss惩罚专家使用的不均衡。具体来说会统计每个专家被选中的频率如果某个专家被选中的概率远高于平均值就给它加惩罚。这样路由器就会被迫雨露均沾让所有专家都能得到训练。热搜里出现的MoE 负载均衡代码大概率是有人想自己实现或者调试这部分。我后面会给一个简化版的思路但先记住核心负载均衡的本质是让路由器的分配尽量均匀同时不破坏模型对输入内容的语义判断能力。这两者是有张力的均衡得太狠路由器就失去了按需分配的意义均衡得太松又会坍缩。调这个平衡点是 MoE 训练里最考验经验的地方之一。3. 端侧大模型为什么难小米要跨过的几道坎3.1 算力、内存、功耗的三重约束把大模型放到手机上第一个撞上的墙就是内存。一个 7B70 亿参数的模型如果用 FP16 精度存储光权重就要占大约 14GB 内存。而目前主流旗舰手机的运行内存也就 12GB 到 16GB还要留给系统和应用。所以端侧部署必须做量化——把 FP16 压到 INT8 甚至 INT4。INT4 量化后7B 模型大约占 3.5GB这才勉强能塞进去。第二个墙是算力。手机 SoC 的 NPU神经网络处理单元虽然专门为 AI 计算设计但和云端加速卡相比吞吐量差着数量级。这就意味着端侧模型不能太大推理必须足够快否则用户等三秒才出结果体验就崩了。第三个墙是功耗和发热。手机没有主动散热风扇持续高负载推理会让机身发烫进而触发降频推理速度进一步下降。所以端侧大模型的设计目标不是最强而是在功耗预算内做到够用。3.2 端云协同不是二选一而是分工小米的解法不是全部塞进手机而是端云协同。简单任务、隐私敏感任务、需要低延迟的任务放在端侧复杂推理、需要大知识库的任务放到云端。比如你让手机把这段话翻译成英文端侧小模型就能搞定不用联网响应快还保护隐私。你让手机帮我分析这份财报的潜在风险这种需要深度推理和大量背景知识的就交给云端大模型。这种分工的关键在于路由决策系统要能判断一个请求该走端还是走云。判断错了要么端侧扛不住卡死要么云端往返延迟高体验差。这个决策逻辑本身也是模型能力的一部分而且要考虑网络状况、电量、当前负载等动态因素。这块的工程复杂度远比单纯训练一个模型要高。3.3 多模态为什么不能传图片会成为热搜热搜里mimo 模型不能传图片这条很值得说。多模态能力尤其是视觉理解是大模型的重要方向但端侧做多模态的难度是成倍增加的。图像编码器本身就要占算力和内存再加上图像 token 数量远多于文本 token推理负担很重。所以早期端侧模型往往先支持纯文本视觉能力逐步放开或者只在特定场景如相册搜索、文档扫描做定制化支持而不是通用的随便传图都能理解。这其实反映了一个普遍规律端侧 AI 的能力是分阶段释放的不是一步到位。用户看到的是不能传图片背后是算力预算、模型大小、功耗控制一系列约束下的阶段性取舍。理解了这一点你就不会对端侧模型的能力边界感到意外了。4. 从 MiMo 看大模型落地开发者能抓住什么4.1 本地部署与量化普通设备也能跑起来热搜里AI 大模型本地部署配置rx6750gre 训练大模型android app 集成 ai 大模型 gguf这几条说明很多人在尝试把模型跑在自己的设备上。这里我给几条实操层面的经验。先说量化格式。GGUF 是目前本地部署最流行的格式之一它把模型权重和推理所需的元数据打包在一起配合 llama.cpp 这类推理引擎可以在 CPU 甚至混合 CPU/GPU 环境下运行。它的优势是兼容性好、对硬件要求相对低。如果你用的是消费级显卡比如热搜里提到的 RX6750GRE12GB 显存跑一个 7B 的 INT4 量化模型是可行的但要注意显存占用不只是权重还有 KV Cache键值缓存上下文越长KV Cache 越大。关于rx6750gre 训练大模型我得泼盆冷水消费级显卡适合推理和轻量微调不适合从零训练大模型。训练 7B 模型即使用 LoRA 这种参数高效微调方法12GB 显存也相当紧张需要精细调 batch size、梯度累积、序列长度。真要训练建议用云端的按需算力或者至少 24GB 显存起步的卡。4.2 微调实战LoRA 是入门首选大模型微调实战这个需求很实在。对于绝大多数开发者LoRALow-Rank Adaptation是性价比最高的微调方案。它的原理是在原模型的权重矩阵旁边挂两个小矩阵训练时只更新这两个小矩阵原模型权重冻结。这样可训练参数量能降到原来的百分之几甚至千分之几显存需求大幅下降。实操上你需要准备三样东西一份高质量的指令数据集格式通常是 instruction-input-output 三元组、一个基础模型、一套微调框架如 LLaMA-Factory、PEFT 等。数据集质量比数量重要得多几百条精心构造的样本往往比几万条噪声数据效果好。我踩过的坑是一开始贪多爬了一堆数据没清洗结果模型学了一堆废话和错误格式反而比微调前更差。后来老老实实手工整理了两百条效果立竿见影。4.3 应用集成从 API 调用到端侧 SDK如果你不想碰模型训练只想做应用那路径就清晰多了。云端方案就是调 API注意控制 token 消耗和做好错误重试。端侧方案则是集成推理 SDK把量化后的模型打包进 App。这里的关键是模型加载策略是启动时加载慢但后续快还是用时加载省内存但首次慢。对于手机 App通常建议按需加载并在加载时给用户明确的进度提示否则用户会以为卡死了。热搜里codex 中使用 mimo 模型mimo coding plan这类反映的是把大模型接入编程辅助工具的需求。这类场景对模型的代码理解和生成能力要求高而且往往需要长上下文要读整个项目文件。端侧模型在这块会比较吃力更适合走云端。5. 常见问题与避坑指南5.1 关于 MoE 的高频疑问问题简明回答补充说明MoE 要全部参数进显存吗推理不一定训练通常要推理可做专家分片但常驻显存换速度更常见MoE 一定比稠密模型好吗不一定同等激活参数量下 MoE 通常更强但训练更难、工程更复杂专家越多越好吗不是专家太多会导致路由困难、负载不均需要匹配数据量和任务多样性负载均衡怎么做辅助损失 路由约束核心是平衡均匀性和语义选择性5.2 端侧部署的坑第一个坑是低估 KV Cache。很多人算显存只算模型权重忘了 KV Cache。上下文长度 2048 时KV Cache 可能占几百 MB 到 1GB 不等长上下文场景下甚至超过权重本身。部署前一定要把这块算进去。第二个坑是忽视量化精度损失。INT4 量化虽然省内存但在某些任务上尤其是需要精确数值计算或细粒度理解的会明显掉点。建议对关键任务保留 INT8 或混合精度。第三个坑是热管理。端侧持续推理会发热降频如果你的应用需要连续处理大量请求必须设计限流和任务队列否则用户体验会断崖式下跌。5.3 内测与生态参与的注意事项热搜里大量答题答案内测资格的需求我理解大家想第一时间体验新功能的心情。但这里要提醒内测版本通常不稳定可能有数据丢失、耗电异常、兼容性问题。如果你只有一台主力机建议谨慎参加或者提前做好数据备份。另外内测资格往往和社区活跃度、设备型号、报名顺序相关与其到处找答案不如老老实实关注官方社区的公告渠道按规则参与。那些所谓的标准答案很多是过时的或者误导的照着填反而可能通不过。6. 我对这条技术线的一些个人判断6.1 端侧大模型的价值不在替代云端很多人讨论端侧大模型时总喜欢问它能不能取代云端。我觉得这个问法本身就偏了。端侧的价值在于它开启了云端做不到的场景离线可用、隐私不出设备、零延迟响应、零边际成本。这些特性组合起来能催生一批全新的应用形态比如完全本地的个人知识助手、不联网的实时翻译、隐私敏感的文档处理。这些不是云端能力的缩水版而是云端根本给不了的东西。小米的优势在于它有海量终端和完整的硬件生态。模型训练出来只是第一步能把它分发到几亿台设备上、让用户在日常场景里真正用起来这才是护城河。从这个角度看MiMo 这条线的战略意义可能比单纯刷榜某个评测要高得多。6.2 对开发者的建议如果你是大模型方向的学习者我的建议是先把一个 7B 模型在本地跑起来再动手微调一次最后做一个端侧或云端的小应用。这三步走完你对大模型的理解会从听说过变成做过。纸上谈兵看一百篇论文不如自己踩一次显存不够的坑来得深刻。如果你是想做 AI 应用的开发者别一上来就想着训练模型。用好现有的开源模型和 API把产品体验打磨好价值可能更大。模型能力是公共基础设施会越来越同质化真正稀缺的是对场景的理解和工程落地的能力。6.3 最后分享一个实操小技巧跑本地模型时如果你发现推理速度忽快忽慢先别急着换硬件检查一下是不是内存带宽成了瓶颈。大模型推理是内存密集型任务很多时候 GPU 算力没用满但显存带宽已经跑满了。这时候降低量化精度比如从 INT8 降到 INT4往往比换更强的 GPU 更有效因为权重变小了带宽压力直接下降。这个点很多人会忽略但实测下来提升非常明显。另外做 MoE 相关实验时建议先用小规模配置比如 4 个专家、激活 2 个把整个训练和推理流程跑通确认负载均衡逻辑没问题再放大规模。我见过太多人一上来就搞 64 专家结果路由坍缩、训练不收敛排查半天发现是辅助损失权重设错了。小步快跑永远比一步到位靠谱。
企业数字化 ERP 产品动态
相关推荐
WorkBuddy本地AI助手实战:Skill配置与自动化工作流搭建指南 最近很多人在聊 WorkBuddy。作为一款能接本地模型的 AI 助手,它把“AI 聊天工具”和“自动化工作台”两件事揉到了一起;再加上可以自己定义 Skill、设定全局规则、保留跨对话记忆,WorkBuddy 已经被很多人拿来当成每天真正干活的入口。这篇文章… · 2026/9/26 13:51:59
ax:面向异构硬件的Kubernetes设备抽象运行时基座 1. “ax”不是缩写,而是一个正在成型的新型基础设施代号最近在几个技术社区和内部分享会上,频繁看到“ax”这个词被单独拎出来讨论——不是作为某个单词的缩写(比如access、axis、acceleration),也不是项目代号里的占位… · 2026/9/26 13:51:53
deepseek 在 cursor 上安装使用教程:TaoToken 统一 Key 配置与验证 /* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/26 13:51:46
Qwerty Learner 配 TaoToken:为键盘工作者设计的单词记忆与英语肌肉记忆锻炼网页 /* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/26 15:00:50
Moltbot(OpenClaw)与扣子商店技能对比:TaoToken 统一 Key 接入配置实战 /* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/26 15:00:50
DB2 V11.1安装实战:从下载到实例创建与Docker部署避坑指南 /* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/26 15:00:37
Atlas 300V 24G推理加速卡上运行YOLO:从概念到部署全解析 最近在好几个技术群里连续看到同一个问题:“Atlas 300V 24G是运算加速卡吗?”“有没有人用Atlas部署过YOLO?”这俩问题其实是同一件事:很多人刚拿到昇腾推理卡,想把手里的目标检测任务跑起来,结果第一步就卡… · 2026/9/26 15:00:31
Python+OpenCV疲劳驾驶检测源码:EAR/MAR算法与工程避坑指南 简介:这是一套面向计算机相关专业学生与项目实战学习者的疲劳驾驶检测完整项目包,基于Python与OpenCV实现,可直接用于毕业设计、课程设计或期末大作业。项目围绕人脸关键点定位与眼部状态分析展开,通过摄像头实时判断驾驶员疲劳程… · 2026/9/26 15:00:31
WinCC V16 ADODB连接SQL Server工业级实践指南 /* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/26 15:00:31
数据库课后习题答案别硬背:当测试用例集刷,效率翻倍 简介:万常选版《数据库原理与设计》课后习题答案资源,覆盖第2至6章及第9章,适合正在学习关系模型、数据库建模、关系数据理论与模式求精的本科生、自学者作为复习与自测材料。压缩包共7个文件,含3个doc参考答案、2个sql示例脚本、… · 2026/9/26 0:00:21
OpenClaw 替代品?Hermes Agent 踩坑实录:macOS 飞书接入 TaoToken 配置 /* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/26 0:00:40
向下兼容与向上兼容:接口设计中的兼容性策略与工程实践 一次版本升级事故,是很多团队绕不过去的坎。线上环境里,服务端明明已经上线了新版接口,老的移动端还在照着旧文档传参数。请求一到网关,校验直接拒绝,用户操作失败,客服群炸了锅,开发群里开始互… · 2026/9/26 0:00:46