首页/新闻资讯/正文详情

DeepSpeed v0.19.7发布:ZeRO、AutoTP、AutoEP、Muon、DeepCompile、MPS 与 CPU Adam 全面升级

发布时间:2026/9/24 17:49:36 来源:云帆数科 栏目:资讯中心
DeepSpeed v0.19.7发布:ZeRO、AutoTP、AutoEP、Muon、DeepCompile、MPS 与 CPU Adam 全面升级
发布时间2026年9月22日版本号v0.19.7DeepSpeed v0.19.7 正式发布。本次更新覆盖训练、推理、分布式通信、自动并行、检查点、性能分析、优化器、CPU 加速、MPS 支持、持续集成与工作流等多个方向。从更新内容来看v0.19.7 的重点不只是新增能力更集中解决了大量真实训练和推理场景中的兼容性、稳定性、内存管理、布局转换、参数分片、断点恢复及设备适配问题。尤其是 ZeRO、AutoTP、AutoEP、Muon、DeepCompile、Ulysses、Universal Checkpoint 等核心模块均有较多修复和增强。一、ZeRO 与检查点能力持续增强在 ZeRO 和检查点导出、恢复、参数分片等方向v0.19.7 增加了多项重要改进。首先ZeRO 检查点导出现在支持配置数据类型。用户可以为导出的 ZeRO checkpoint 指定 dtype从而更灵活地控制检查点的精度和存储形式。在通用检查点方面本次版本完善了分片表达与恢复逻辑。通用检查点分片被描述为仿射映射使分片关系的表达更加明确。同时复制映射中的 affine scale 被正确保留在 replicated map 中而不是错误地附加到 split 上。针对 AutoTP 规模变化后的恢复场景v0.19.7 修复了通用检查点跨 AutoTP size 恢复时的问题。这意味着在不同 AutoTP 配置之间恢复通用检查点时恢复逻辑得到了修正。在 ZeRO 参数布局方面修复了 grouped_mm 的 ZeRO 参数对齐问题避免相关计算中因参数对齐不正确带来的异常。DeepCompile 与 ZeRO-3 的组合也获得多项修复。新版本稳定了 ZeRO-3 参数 guard减少 DeepCompile 场景下参数保护逻辑的不稳定性。同时DeepCompile 的 ZeRO-3 内存调度器被拆分使相关内存调度逻辑更加清晰。对于启用激活检查点时 AutoTP 与 DeepCompile 的组合场景本次修复了 collective 通信可能被静默丢弃的问题。该修复涉及 AutoTP、DeepCompile 与 AC 同时启用时的分布式通信正确性。此外v0.19.7 增加了一个可选的 ZeRO Stage 1 和 Stage 2 梯度范数快速路径为对应场景提供更快的 gradient norm 处理方式。二、AutoTP 能力升级模型级元数据、Qwen3.5 适配与映射输出AutoTP 是本次版本更新较为集中的模块之一。此前AutoTP 的 tp_shard 依赖进程级全局变量。v0.19.7 将这部分逻辑替换为每模型独立的 AutoTPMeta。这样可以避免进程范围全局状态带来的耦合问题使 AutoTP 元数据更贴近具体模型实例。在模型模块加载方面新版本识别了 Qwen3.5 的 RMSNorm 变体使 AutoTP 能够正确处理该模型中的相关归一化模块。Llama 注入策略也得到更新。现在会从 rope_parameters 中读取 rope_theta而不再局限于旧的读取方式。与之对应Inference V2 同样支持从 rope_parameters 读取 rope_theta确保 RoPE 参数读取逻辑在不同推理路径中保持一致。AutoTP 层现在可以输出 affine maps。这与通用检查点中仿射映射的表达方向相呼应为参数映射和分片描述提供支持。此外修复了调试名称映射意外持有模型引用的问题。此前debug name maps 可能会持续引用其快照对应的模型本次更新避免了这种模型被意外固定引用的情况。三、AutoEP 与 DeepEP专家通信、参数分片和恢复流程优化AutoEP 与 DeepEP 是 v0.19.7 的另一大重点。新版本为 AutoEP expert all-to-all 增加了可选的 DeepEP transport。用户可以选择启用 DeepEP 作为专家 all-to-all 的传输路径。在专家恢复方向增加了一个可选的 fused weighted restore用于 AutoEP 的加权恢复流程。针对 DeepEP 通信准备本次优化避免了 AutoEP DeepEP 场景中不必要的 collective token preparation。该调整减少了相关通信前置准备操作。在 ZeRO-3 场景下AutoEP 的 expert 参数现在按层进行分区。该变更涉及 AutoEP expert 参数在 ZeRO-3 下的分片粒度。本次还修复了 AutoEP 中优化器与被替换 MoE 参数不匹配的问题避免优化器参数与替换后的 MoE 参数之间出现不一致。AutoEP 的 score correction bias buffers 现在会被保留防止相关偏置缓冲区在流程中丢失。四、Muon 优化器集中修复ZeRO、动量与参数组问题得到处理Muon 在本次版本中获得了非常密集的修复和行为调整。首先在 ZeRO Stage 0 的默认场景中Muon 不再运行 Newton-Schulz。这一行为调整明确了 ZeRO Stage 0 下 Muon 的执行路径。对于使用 zero.Init 构建模型的 ZeRO-3 场景修复了 Muon 被静默禁用的问题。此前即使用户配置了 Muon在特定模型构建方式下也可能没有实际启用本次版本对此进行了处理。Muon 的 momentum dtype 也得到多处修正。当检查点恢复时Muon 会协调动量的数据类型当动量与梯度进行组合时动量将采用对应梯度的数据类型。在 loss scaler 丢弃某一步更新时Muon 不再推进或保留不应生效的动量变化避免无效 step 对动量状态造成影响。此外修复了 Muon 静默丢弃用户传入 param groups 的问题确保传入的参数组不会被忽略。五、Ulysses、序列并行与分布式通信修复分布式注意力、Ulysses 和序列相关通信路径在 v0.19.7 中也有多项关键修复。针对 seq-first Ulysses all-to-all修复了输出布局问题确保 all-to-all 后的输出 layout 正确。DistributedAttention 现在会携带 KV head count。该调整使每个 DistributedAttention 实例能够保留 KV 头数信息。序列 overlap 的反向传播路径修复了梯度 permutation 问题避免重叠序列处理时反向梯度排列异常。在通信句柄方面AllGatherHandle 和 NoGatherHandle 的 wait 方法现在具备幂等性。也就是说多次调用 wait 不会导致行为异常。barrier 调用中的 device_ids 现在会被正确转发给通信后端改善不同后端和设备场景下的 barrier 行为。另一个重要修复是 _DimZeroAllToAll 在 torch.compile 下可能静默不发送梯度的问题。该问题现已修复保障编译模式下 all-to-all 相关梯度通信的正确性。六、性能分析与 FLOPs 统计更准确v0.19.7 对 FLOPs profiler 进行了多项修复。在聚合 FLOPs profiler 总量时同一个 module object 只会计算一次避免同一模块对象被重复聚合计数。对于转置卷积修复了 FLOPs profiler 的统计问题使 transposed convolutions 的 FLOPs 计算更加正确。元素级计算的 FLOPs 广播规则也进行了修正。现在 elementwise FLOPs 会从尾部维度进行广播处理。Rollout 模块增加了 prefill 和 decode forward 的性能分析能力可以对这两类 forward 阶段进行 profile。此外rollout 还新增了 continuous batching generation prototype并增加了 continuous batching profiling覆盖连续批处理生成及其性能分析路径。七、推理、Hybrid Engine、KV Cache 与 Triton 相关修复在推理能力方面Hybrid Engine 增加了针对不受支持策略的 fallback 机制。当遇到不支持的 Hybrid Engine policy 时可以进入回退处理路径。推理参数校验也更加严格。对于 inference 和 HybridEngine 的 max output tokens现在会校验其必须为正数。静态 KV cache 的预分配逻辑改为使用 config.head_dim确保 KV cache 的初始化尺寸依据正确的 head_dim 配置。TritonSelfAttention 中已经移除了无效的非 Triton attention 路径使该模块不再保留已经失效的实现分支。针对 Triton NFS 检测修复了当 df 命令输出包含较长设备名称时可能发生崩溃的问题。fp_quantizer 不再执行 Triton 兼容性检查移除了这一额外限制。在 tiled 相关实现中tiled MLP 使用 reshape 替代 viewTiledFusedLogitsLoss 同样使用 reshape 替代 view。这些调整涉及张量形状变换的处理方式。八、CPU Adam、ARM 与 MPS 支持进一步完善CPU Adam 在 ARM 平台上新增了更多 SIMD 优化能力。本次更新为 CPU Adam 增加了 ARM SVE update kernel提升 ARM SVE 路径的支持。在 AArch64 平台上CPU Adam 增加了 NEON SIMD 路径属于 CPU Adam 的第二阶段优化内容。针对 CUDA 13 及更高版本op_builder 在 nvcc 编译时使用 C20 标准。MPS 支持也得到增强。新版本增加了 macOS MPS 的持续集成工作流并为 MPS accelerator 增加 torch floor check。对于不支持 fp16 的加速器相关 fp16 配置测试会被跳过避免在不具备 fp16 能力的设备上执行不适用的测试。CPUAdamBuilder 在 MPS 相关调整中更新了 C 标准。九、设备绑定、内存卸载与运行时行为修复本次版本修复了设备绑定策略。device id 只会在确实需要时绑定避免不必要的设备绑定行为。对于 CPU reference modelsDDP 不再固定 device_ids避免 CPU 参考模型被错误地附加 DDP GPU 设备绑定逻辑。测试辅助工具中的设备放置逻辑也得到调整改用 device names而不是 rank ids 来决定设备放置。empty scratch destination 增加了 pin_empty helper用于处理空 scratch 目标的 pin 操作。在内存卸载方面当一个保存的 view 是唯一持有底层 storage 的值时该 view 可以被卸载。offload-state memory deltas 现在仅在 allocator-backed stats 可用时生效避免在不具备对应内存统计基础时进行不合适的增量计算。train_cifar 的 fork_rng device entries 现在会探测 device module修复相关设备条目的处理方式。十、训练调度、配置传递与启动器行为调整WarmupCosineLR 的 ratio flags 现在会正确传递到配置中确保命令行参数能够真正影响调度器配置。lr range test 中的 staircase 参数被改为显式可选项不再默认启用。curriculum schedule 不会再从低于 min_difficulty 的难度开始避免课程调度起点低于最小难度配置。elasticity 的 batch overrides 不再写入调用方原始 config dict避免调用方配置对象被意外修改。partition 方法现在会继续转发 free_data 参数而不是将其固定为 True。SLURM launcher 现在会遵守 include 和 exclude 参数。include 过滤逻辑也得到修复过滤依据改为真实 slots而不是对 include 自身进行过滤。十一、日志、异常处理与信息采集修复comms logger 在未提供 log_name 时可能触发 KeyError本次版本已修复该问题。cuda_graph 的 assertion 被替换为显式 ValueError使错误类型更明确。同时custom_op 的类型注解也得到修复。source-checkout 场景下 torch_info 的 fallback 现在会包含 nccl_version补全相关环境信息。版本文件已在 0.19.6 发布后完成更新并且 release commits 增加了 DCO sign-off。十二、持续集成、工作流与测试规则更新本次版本对 CI 与工作流进行了多项调整。Modal CI 的超时时间被提高以适应较慢的 sandbox provisioning。Modal CI 预算被拆分为 acquisition 和 test 两个阶段分别处理环境获取与测试执行的时间预算。Modal GPU 工作流改为仅从 merge queue 触发。Modal sandbox 的安装链被缓存在镜像层中优化 sandbox 环境准备流程。文档中新增了 agent guidelines 的测试纪律规则。此外DeepSpeed 对部分未使用功能进行了弃用处理同时也弃用了 sparse attention。结语代码地址github.com/deepspeedai/DeepSpeedDeepSpeed v0.19.7 是一次覆盖面很广的版本更新。从 ZeRO checkpoint dtype 配置、通用检查点跨 AutoTP 恢复到 AutoEP 的 DeepEP transport、专家参数按层分区再到 Muon 在 ZeRO、动量 dtype、参数组和 loss scaler 场景下的修复本次版本显著强化了核心训练能力。同时Ulysses 输出布局、序列 overlap 反向梯度、torch.compile 下 all-to-all 梯度发送、FLOPs profiler 统计、Hybrid Engine fallback、KV cache 预分配、CPU Adam 的 ARM SVE 与 NEON 支持、macOS MPS CI、SLURM include 和 exclude 过滤等更新也覆盖了分布式训练和推理中的大量细节问题。对于正在使用 ZeRO、AutoTP、AutoEP、DeepCompile、Muon、Ulysses、Universal Checkpoint、CPU Adam 或 MPS 的用户而言v0.19.7 的修复与能力更新值得重点关注。

相关推荐

线下会议如何对比多人发言?录音工具操作方法
线下会议如何对比多人发言?录音工具操作方法

线下多人研讨、项目会议、访谈座谈场景中,最常见的记录问题是多人交替发言、观点交叉重叠,原始录音和整段转写文本无法快速区分发言主体,导致会后梳理观点、核对讨论内容耗时费力。普通录音仅能留存音频,无法实现发言人拆分与内容… · 2026/9/24 17:49:36

EvalScope+ Langfuse实现RAG三指标分层计算与组合归因操作手册
EvalScope+ Langfuse实现RAG三指标分层计算与组合归因操作手册

EvalScope Langfuse实现RAG三指标分层计算与组合归因操作手册 核心落地逻辑:EvalScope 负责分层执行评测、自动计算指标;Langfuse 负责全链路Trace埋点、结果回写、根因定位与资产沉淀。通过「三层独立评测任务 唯一标识透传 指标双向回写 归因矩阵自… · 2026/9/24 17:49:36

一款失败的游戏,孵出了 277 亿美元的 Slack
一款失败的游戏,孵出了 277 亿美元的 Slack

一款失败的游戏,孵出了 277 亿美元的 Slack反差:主角本来是游戏公司 Stewart Butterfield 的上一家公司做出了 Flickr,后来卖给了雅虎。这一次,他想再做一款成功的产品。 2009 年,他创办 Tiny Speck,目标是… · 2026/9/24 17:49:36

Java+JSP+MySQL学生信息管理系统:课程设计最稳落地方案
Java+JSP+MySQL学生信息管理系统:课程设计最稳落地方案

简介:这份资源是面向高校计算机相关专业学生的Java Web课程设计参考项目,采用JSPServletMySQL技术栈实现学生信息管理系统,适合正在准备期末大作业、课程设计或需要练手Java Web完整开发流程的初学者与中级学习者。压缩包共241个文件&#xf… · 2026/9/24 18:14:57

基于注意力机制的3D点云语义分割源码解析与实战调优
基于注意力机制的3D点云语义分割源码解析与实战调优

简介:本资源面向三维视觉与自动驾驶感知方向的研究者和开发者,聚焦如何借助注意力机制提升3D点云语义分割性能,适合具备一定深度学习基础、希望深入理解点云特征学习并落地实战的中高级学习者。压缩包共195个文件,约1.95MB&#x… · 2026/9/24 18:14:57

C# Socket通讯源码实践:粘包拆包、心跳机制与断线重连全解析
C# Socket通讯源码实践:粘包拆包、心跳机制与断线重连全解析

简介:这是一份基于C#的Socket网络通讯完整源码,面向初步接触网络编程的C#开发者,适合用来快速理解客户端与服务器之间的通信原理。代码采用WinForm界面,分为server和client两个独立项目,结构简洁,支持文本消… · 2026/9/24 18:14:57

航空图像野火探测数据集与YOLOv8实战:从数据选型到边缘部署
航空图像野火探测数据集与YOLOv8实战:从数据选型到边缘部署

简介:这是一份面向野火探测与火灾识别任务的综合性航空图像数据集,适合从事深度学习目标检测的研究者、算法工程师及遥感方向学生使用,可支撑火灾预警、灾情评估等场景下的模型训练与验证。压缩包共收录2000个文件,全部为XML格式的… · 2026/9/24 18:14:57

Java电商后台系统设计:从能跑到敢上线的实战指南
Java电商后台系统设计:从能跑到敢上线的实战指南

简介:这是一套基于Java语言开发的电商后台管理系统模拟源码,面向Java后端初学者与中级开发者,聚焦电商核心业务场景学习与系统架构理解。资源完整呈现了类京东/淘宝后台的关键模块实现,涵盖商品管理、订单处理、用户权限控制、MyB… · 2026/9/24 18:14:50

BP神经网络数据回归预测:Matlab完整实现、参数调优与常见问题排查
BP神经网络数据回归预测:Matlab完整实现、参数调优与常见问题排查

简介:在工业回归预测与学术实验中,常需借助历史数据推断未知结果,BP神经网络作为经典的非线性映射模型,依靠反向传播算法更新权重,非常契合此类问题;基于此的Matlab实现方案面向机器学习初学者和需要落地预… · 2026/9/24 18:14:50

基于YOLOv8的渔船作业监控系统:从环境搭建到边缘部署全流程
基于YOLOv8的渔船作业监控系统:从环境搭建到边缘部署全流程

简介:这是一套面向计算机、人工智能、自动化等专业学生与教师的毕业设计级项目资源,围绕YOLOv8实现渔船作业监控系统,可用于毕设、课程设计、大作业或项目立项演示。压缩包共97个文件,约24.21MB,以70个Python源码文件为… · 2026/9/24 0:00:13

1D-CNN时间序列建模实战:从Conv1d原理到工业落地
1D-CNN时间序列建模实战:从Conv1d原理到工业落地

简介:面向时间序列数据建模的一维卷积神经网络完整实现,适合深度学习入门者及需要快速验证时序模型的研究者,能够从音频、文本、传感器或股价等序列中挖掘局部特征与时间依赖。压缩包体积很小,只有3KB,内含3个Python脚… · 2026/9/24 0:00:26

柔软的L:汉语语流中被忽视的舌肌张力控制
柔软的L:汉语语流中被忽视的舌肌张力控制

1. 这个“L”不是字母表里的L,而是舌尖上的L最近在几个方言群和语音教学社群里,反复看到有人发一句:“也说字母L:柔软的长舌”。初看以为是英语发音课笔记,点开才发现全是方言爱好者、播音系学生、语言康复师甚至戏曲演… · 2026/9/24 0:00:44

了解更多?预约专属演示

我们的顾问将为您一对一讲解产品与方案

企业微信二维码