摘要本文用一套 9 道可验算的硬题对 DeepSeek V4.1 Flash、Step 5、MiMo V2.6 Pro 和 MiMo V2.6 Flash 四款免费档大模型做了同台裸考实测。结论是答案对错层面四家基本打平所有翻车事故都集中在同一道矛盾检测题上真正的差距在速度和稳定性——MiMo 深度惊人但思考动辄十几分钟DeepSeek 则全程零错误、零崩溃、零等待。作者最终选择无脑 DeepSeek并指出免费档网页端在深度、速度、稳定三者中顶多给你两样。DeepSeek MiMo Step免费档同台实测答案几乎全对翻车全在同一道题到处都在晒 MiMo V2.6 的跑分夸上天的说法满天飞。但跑分表不会告诉你两件事它答一道题要想多久以及它什么时候会当场宕掉。所以我自己出了一套考卷9 道题8 道正题 1 道加考全是能一步步验算的硬题。范围覆盖最坏情况穷举、约束求解、四步溶液混合、矛盾检测、链式计算、Agent 任务规划、时钟陷阱外加一道带 6 条硬约束的编码题。考生四位DeepSeek V4.1 Flash、Step 5、MiMo V2.6 Pro、MiMo V2.6 Flash。全拉到各自官网 chat 里同台不开联网、不调工具、纯裸考多数题目同题重复三遍测稳定性。先说结论省得你往下翻答案对错层面四家基本打平——除了 MiMo Flash 在一道简单题上摔了一跤所有的事故全集中在同一道题上深度、速度、稳定免费档顶多给你两样。我的选择是无脑 DeepSeek。下面按顺序讲。一、考官先翻车我的标准答案先错了这套考卷戏剧性的一幕发生在判卷环节跟考生无关。第 2 题是道约束求解题四块花田规则给了对角守恒左上右下右上左下、相邻差值≤7、总量 100已知红色 28 朵问黄蓝绿各多少。我出题时的设计意图是陷阱题标准答案给了 3 组解考模型会不会漏解。结果 DeepSeek 三跑全答黄蓝22唯一解还主动写了唯一性证明。我按答案键判它错直到我重新读题才发现规则 1 白纸黑字写了右上左下这条规则直接强制黄蓝再由总量锁定 22。唯一解模型是对的我的标准答案是错的。出题的时候我只执行了自己规则的前一半把后一半忘了。处理方式很直接改题面删掉右上左下作为加考题让四家重考。结果四家全给出了完整的 3 组解。这件事真正触动我的一点是旧题面下四家都顶住答案键预期多解的陷阱答了唯一解新题面删掉规则后它们又都正确枚举出 3 组。题面一变答案跟着变。它们是真在读题推理不是在背题库。连考官都会翻车这正是独立实测存在的理由。二、成绩单对错层面四家基本打平9 个计分单元先看总表✅ 表示该题全部跑次正确计分单元DS V4.1 FlashStep 5MiMo ProMiMo FlashQ1 最坏情况穷举✅×3✅×3✅×3⚠️ 2/31 跑错Q2 约束求解原版✅×3✅×3✅×3✅×3Q3 四步溶液混合✅✅✅✅Q4 矛盾检测✅×3⚠️ 1 崩⚠️ 2 崩⚠️ 1 次被放弃Q5 链式计算✅✅✅✅Q6 Agent 规划✅×2✅×2✅×2✅×2Q7 时钟陷阱✅✅✅✅Q8 编码 6 硬约束✅×2✅×2✅×2✅×2加考修正版 Q2✅×3✅×3✅×3✅×3几道题的成色说明一下Q3 溶液混合是全卷计算量的重头戏四步倾倒、每步要算转移的盐量最后 A 瓶 230ml/20.82%、B 瓶 500ml/14.08%、C 瓶 270ml/22.86%Step 和 MiMo 两档还主动做了总盐量 180 克守恒的校验DeepSeek 没做这步直接交了答案。更意外的是四家全都在开头指出了同一处题面瑕疵题目给的是体积、要的是质量百分比缺密度数据严格来说算不出来然后声明按密度 1g/ml 的常规假设解题。免费档模型开始反过来审题面了。Q1 那一跤是全卷仅有的一次真实推理错误MiMo Flash 第三跑答了 28正确 29。事后拆解它的推理框架本身没错但枚举失败集合时把两种情形里跟条件无关的西瓜糖漏算了一遍同一个失误一张卷里犯两次最大失败集合被算成 27答案差 1。同一家族的 Pro 三跑全对Flash 自己前两跑也对。智力够用仔细度断了弦。顺便说个四家里只有 MiMo Flash 抓到的细节Q3 题面说 B 瓶 500ml第一步倒 100ml 进去就变 600ml——如果 500ml 指瓶子容量这瓶水早溢出来了。它指出题面的 ml 只能理解为初始装液量。挑刺能力这块四家谁都不缺。到这里如果你只想知道谁聪明答案已经出来了都够聪明跑分焦虑可以放下了。真正拉开差距的在下面。三、所有的翻车全在同一道题上第 4 题是全卷最狠的一道写个函数找出列表里出现次数为奇数的元素但禁止用任何额外数据结构、时间 O(n)、空间 O(1)然后问这些要求能同时满足吗标准答案不能而且要给出证明。这道题是照着矛盾检测设计的结果它成了照妖镜只是照出来的不是智力第 4 题战况DS V4.1 Flash3 跑全过零事故Step 51 跑思考链崩掉、零输出另 2 跑满分MiMo Pro2 跑思考到最后、正文一个字没出来仅有的成功一跑是全场天花板答卷MiMo Flash1 跑思考半小时没结果被我手动关掉出结果的两次一次思考了1012.7 秒——17 分钟注意一个反直觉的规律越是能想的模型崩得越狠。MiMo 家族在成功状态下交出了比别家深一档的证明Pro 用了通信复杂度的下界论证Flash 用了自动机状态计数都到了教科书水准DS 的证明偏浅给的是反例加直觉论证但它三跑全过、总共没让你等超过一分钟。差距出在输出配额和思考预算上题目一难思考就刹不住跑着跑着把输出额度烧穿了。免费档网页端的真实短板在这儿不在脑子上。四、速度流畅本身就是优势这一节没有跑分只有体感但恰恰是它决定了我的选择。四家答完 9 道题体感差距是这样的DeepSeek 快得多Step 中等MiMo 两档都慢Flash 略好于 Pro但也只是从绝望变成煎熬。夸张的一次等 MiMo屏幕上思考中滚了 17 分钟才吐出答案。我可以负责任地说任何真实使用场景里我早在第 3 分钟就关掉页面了。事实上那次测试里就有一跑是等我失去耐心手动掐掉的。这里必须说句公道话MiMo 的深度是真的。同样的第 4 题DS 给的是能用的证明MiMo 给的是能发表的证明。问题在于我付不起那个时间。五、各家的小怪相错都错得很有性格多跑测试的好处是能抓到跑分表从不展示的一面Step 5有一跑它没解题反过来把我给的材料当成了用户提交的答案开局一句你的推理是正确的我复核一遍审稿人上身。另一跑开局自称作为 StepFun 的模型我无法真正操作您的电脑。诚实但全卷就它一个这么开场。MiMo Pro有一跑把整份答案原样输出了两遍复读机式 glitch。MiMo Flash除了 Q1 那次失误还贡献了一处把细节抠到秒的加分Q7 时钟题算完 7.5° 之后顺手把时针分针真正重合的时刻也算了出来约 3 点 16 分 22 秒。我验了对的。DS没有怪相。它的缺点是证明给得浅、答案写得啰嗦仅此而已。六、我的结论免费档三选二我选快和稳9 道题、四家、七十多轮作答跑下来我的总结是一句话深度、速度、稳定免费档网页端顶多给你两样。MiMo Pro/Flash深度天花板 稳定性中等代价是速度慢到影响可用性。适合不赶时间的研究场景不适合当日常主力。Step 5三项居中证明能力意外地硬但没有一项顶到头。DS V4.1 Flash深度偏浅但速度、稳定、仔细度全占全卷零错误、零崩溃、零等待。所以我的答案很明确在结果没问题的情况下我无脑选 DeepSeek。整个过程太流畅、太舒服这种问完就有人接话的体验用过就回不去。也认真考虑过费用DeepSeek 的 API 价格摆在那儿说实话它并没有贵到让我愿意用 MiMo 那种等待时间去换的程度。为了一段 17 分钟的更优雅证明等 17 分钟这笔账怎么算都不划算。跑分表会告诉你谁的分高只有自己出一套题跑一遍才会告诉你谁用着舒服。整套考卷我发成了公开网页不服的自取测试免费档大模型同台实测 · 自编考卷9 题。毕竟连我的标准答案都翻过车这可能是整场测试里的头号彩蛋。测试口径2026-09-23四家官网 chat 网页端实测非 API关闭联网与工具每题新对话、多数题目同题重复三遍测稳定性MiMo 以公测期 V2.6 Pro 为主力、V2.6 Flash 补测均为公测期免费可用版本。公测期版本随时可能灰度切换结论有时效性。
企业数字化 ERP 产品动态
相关推荐
CatalyzeX:查论文,顺手找代码 温馨提示:若页面不能正常显示数学公式和代码,请阅读原文获得更好的阅读体验。 作者: 艾米丽 (连享会) 邮箱: lianxhcn163.com Title: CatalyzeX:查论文,顺手找代码Keywords: CatalyzeX, 论文代码, 论文复现… · 2026/9/24 7:41:35
RK3128固件改造实战:解包打包与No space left报错解决 /* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/24 7:40:58
昇腾AscendC中TBuf InitBuffer报错507035根因解析 /* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/24 8:27:35
AI嵌入式部署:让传统PLC原生运行轻量级AI模型 /* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/24 8:27:22
EMQX 插件 API 网关修复:HTTP 请求头与查询参数透传机制深度解析 后端物联网消息队列通信 【免费下载链接】emqx The most scalable and reliable MQTT broker for AI, IoT, IIoT and connected vehicles 项目地址: https://gitcode.com/gh_mirrors/em/emqx 点击查看 免费下载 导读
本文围绕 EMQX 开源仓库中的一条缺陷修复记录&… · 2026/9/24 8:26:18
SWIR051AU短波红外相机:从InGaAs原理到工业检测实战 /* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/24 8:25:15
LTspice第三方SPICE模型集成全流程指南 /* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/24 8:25:02
芯片IP选型避坑指南:架构适配、工艺兼容与验证完备性实战 /* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/24 8:24:56
基于YOLOv8的渔船作业监控系统:从环境搭建到边缘部署全流程 简介:这是一套面向计算机、人工智能、自动化等专业学生与教师的毕业设计级项目资源,围绕YOLOv8实现渔船作业监控系统,可用于毕设、课程设计、大作业或项目立项演示。压缩包共97个文件,约24.21MB,以70个Python源码文件为… · 2026/9/24 0:00:13
1D-CNN时间序列建模实战:从Conv1d原理到工业落地 简介:面向时间序列数据建模的一维卷积神经网络完整实现,适合深度学习入门者及需要快速验证时序模型的研究者,能够从音频、文本、传感器或股价等序列中挖掘局部特征与时间依赖。压缩包体积很小,只有3KB,内含3个Python脚… · 2026/9/24 0:00:26
柔软的L:汉语语流中被忽视的舌肌张力控制 1. 这个“L”不是字母表里的L,而是舌尖上的L最近在几个方言群和语音教学社群里,反复看到有人发一句:“也说字母L:柔软的长舌”。初看以为是英语发音课笔记,点开才发现全是方言爱好者、播音系学生、语言康复师甚至戏曲演… · 2026/9/24 0:00:44