Xing4.0-29B-A4B国产算力训练全解Ascend NPU与MindSpore深度优化【免费下载链接】Xing4.0-29B-A4BXing4.0-29B-A4B 是中电信人工智能科技有限公司研发的星辰语义大模型系列原 TeleChat新一代模型。模型总参数量 29B激活参数仅 4B原生支持 256K 上下文可扩展至 512K是国内首个基于国产算力与国产框架完成训练、面向复杂工程任务深度优化的百亿参数大模型。项目地址: https://ai.gitcode.com/XingChen-AGI/Xing4.0-29B-A4BXing4.0-29B-A4B 是中电信人工智能科技有限公司研发的星辰语义大模型系列原 TeleChat新一代模型总参数 29B、每 token 仅激活 4B原生支持 256K 上下文可扩展至 512K。它是国内首个基于国产算力与国产框架完成训练的百亿参数大模型——全程运行在 Ascend 910C 集群上使用 MindSpore/MindFormers 框架训练并通过多层面深度优化将训练吞吐提升了约96%。本文带你看懂它的架构由什么组成、国产算力上做了哪些关键优化、性能到底有多强、以及拿到模型后如何快速用起来。规格速览29B总参数为什么只激活4BXing4.0-29B-A4B 采用 MoE混合专家结构每个 token 只激活 64 个路由专家中的 4 个外加 1 个共享专家因此总参数 29B、激活参数 4B——容量大、推理省。配置项数值总参数 / 激活参数29B / 4B层数40前 2 层为 Dense其余为 MoE隐藏维度3584路由专家 / 每 token 激活64 / 4注意力类型MLA多头潜在注意力上下文长度256K可扩展至 512K词表大小131072权重精度bfloat16具体数值可在 config.json 中逐一核对例如n_routed_experts: 64、num_experts_per_tok: 4、max_position_embeddings: 262144。mHC MLA MTP面向 Agent 的架构三件套这个模型为复杂工程任务深度优化核心是三项架构设计实现见 modeling_xing4_0.pymHC超连接残差每层维护 4 条并行信息流hc_mult4用 Sinkhorn 迭代20 次构造双随机组合矩阵让残差连接可学习、可组合长上下文中信息保持更稳定。对应实现 Xing4_0HyperConnection也是国产算力上开发融合算子的重点对象。MLA多头潜在注意力把 KV 压缩到低秩隐空间kv_lora_rank512显著降低长上下文的 KV 缓存显存是 256K 长文可用的关键。见 Xing4_0Attention。MTP多 Token 预测额外 1 个 next-n 预测层训练时多预测下一个 token加速推理并提升训练信号密度configuration_xing4_0.py 中num_nextn_predict_layers1。三者配合支撑多步规划、工具调用与长链条推理——这也是它被定位为Agent-Oriented面向智能体架构的原因。国产算力深度优化96%训练吞吐是怎么来的Xing4.0-29B-A4B 在 Ascend 910C 集群上用 MindSpore/MindFormers 训练并非直接跑通而是做了多级协同优化整体训练吞吐相比开箱即用的表现提升约 96%⚡MoE 细粒度通信优化MoE 训练最大的开销之一是专家间的 All-to-All 通信。模型对专家路由与专家计算做了细粒度切分与通信调度优化配置中ep_size支持专家并行切分让通信与计算充分重叠减少 910C 集群内片间等待。选择性重计算 DVM 自动图算子融合选择性重计算只对重算成本低于存储成本的算子启用激活重计算在显存与算力之间取得最优平衡DVM 自动图算子融合MindSpore 的 DVM 引擎自动把相邻小算子融合为大算子减少片上搬运与启动开销让 Ascend NPU 的执行图更密实。Ascend C 手写 mHC 融合算子框架自带的算子无法覆盖 mHC 这类新结构团队使用Ascend C 编程语言手写实现了 mHC 特征适配与融合算子把多流归一化、Sinkhorn 组合矩阵、加权求和合并为单次片上执行——这是 96% 吞吐提升中贡献最大的一环。基准实测复杂工程任务表现突出基准Xing4.0-29B-A4BGemma4-26B-A4BQwen3.6-35B-A3BSWE-bench Verified75.0053.0076.00Terminal-Bench 2.157.5030.0051.50DeepresearchBII60.8039.3059.70Claw-Eval76.5571.4974.54AIME202690.0088.3092.70SWE-bench Multilingual66.0051.0067.20可以看到它的优势集中在SWE-bench、Terminal-Bench、DeepresearchBII这类真实工程场景修 GitHub Issue、操作终端、深度检索——正是复杂工程任务优化目标的直接体现。快速上手推理部署与领域微调推理部署模型以 Hugging Face Transformers 格式发布41 个权重分片权重索引见 model.safetensors.index.json兼容 vLLM、SGLang、KTransformers 等主流推理框架并提供 OpenAI 兼容 API。推荐采样参数场景temperaturetop_prepetition_penalty复杂推理 / 通用任务1.00.951.05编码 / Agent 任务0.80.951.05领域微调支持 LLaMA-Factory 与 MindFormers 两条路径适合在意图分类、表格理解、合同审核、知识问答等垂直场景做轻量定制同时已针对 OpenCode、Claude Code、OpenClaw、Hermes 等 Agent 框架做了对话格式对齐对话模板见 chat_template.jinja默认参数见 generation_config.json。仓库关键文件指引README.md — 模型亮点、基准与快速上手config.json — 模型结构超参数configuration_xing4_0.py — 配置类定义含张量/流水线/专家并行切分计划modeling_xing4_0.py — 完整模型实现mHC、MLA、MoE 路由tokenization_xing4_0.py tokenizer.model — 分词器131072 词表chat_template.jinja — 支持思考模式与工具调用的对话模板小结Xing4.0-29B-A4B 的意义不只是又一个 MoE 大模型它证明了在 Ascend NPU MindSpore 的纯国产技术栈上完全可以训练出 256K 长上下文、对标国际同级模型的工程级大模型。从 MoE 通信优化、选择性重计算、DVM 图算子融合到 Ascend C 手写融合算子这套框架-算子-架构协同优化经验对国内 AI 基础设施落地具有直接的参考价值。如果你正在评估国产算力上的大模型训练或部署方案值得重点关注。【免费下载链接】Xing4.0-29B-A4BXing4.0-29B-A4B 是中电信人工智能科技有限公司研发的星辰语义大模型系列原 TeleChat新一代模型。模型总参数量 29B激活参数仅 4B原生支持 256K 上下文可扩展至 512K是国内首个基于国产算力与国产框架完成训练、面向复杂工程任务深度优化的百亿参数大模型。项目地址: https://ai.gitcode.com/XingChen-AGI/Xing4.0-29B-A4B创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
企业数字化 ERP 产品动态
相关推荐
Ubuntu 22.04上RM520N-GL 5G模块从接线到自动拨号全指南 /* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/24 14:07:14
Easy-Vibe 附录:Docker 容器化实战指南——从镜像分层原理到多阶段构建部署 Easy-Vibe 附录:Docker 容器化实战指南——从镜像分层原理到多阶段构建部署 【免费下载链接】easy-vibe 从 0 到 1 学会 vibe coding,项目制学习 项目地址: https://gitcode.com/datawhalechina/easy-vibe
容器化是"在我机器上能跑"这一… · 2026/9/24 14:45:36
手把手教你用 tchMaterial-parser 批量下载智慧教育平台电子课本 PDF 手把手教你用 tchMaterial-parser 批量下载智慧教育平台电子课本 PDF 【免费下载链接】tchMaterial-parser 国家中小学智慧教育平台 电子课本下载工具,帮助您从智慧教育平台中获取电子课本的 PDF 文件网址并进行下载,让您更方便地获取课本内容。 项目地… · 2026/9/24 14:45:36
Presto 0.284 版本解析:优化器增强、噪声聚合函数与连接器新特性全览 大数据数据库后端 【免费下载链接】presto The official home of the Presto distributed SQL query engine for big data 项目地址: https://gitcode.com/gh_mirrors/pre/presto 点击查看 免费下载 本篇技术指南以 Presto 官方发行说明 release-0.284.rst 为骨架&… · 2026/9/24 14:45:30
FastAPI 为什么成为默认答案:从生态、性能到开发体验的全面解析 1. 引言
在 Python Web 框架的版图中,Django、Flask、Tornado 等老牌框架各据一方。然而近几年,FastAPI 以惊人的速度崛起,成为众多新项目、教程乃至企业级架构中的"默认答案"。为什么是 FastAPI?它凭什么在众多成熟框架… · 2026/9/24 14:45:30
基于YOLOv8的渔船作业监控系统:从环境搭建到边缘部署全流程 简介:这是一套面向计算机、人工智能、自动化等专业学生与教师的毕业设计级项目资源,围绕YOLOv8实现渔船作业监控系统,可用于毕设、课程设计、大作业或项目立项演示。压缩包共97个文件,约24.21MB,以70个Python源码文件为… · 2026/9/24 0:00:13
1D-CNN时间序列建模实战:从Conv1d原理到工业落地 简介:面向时间序列数据建模的一维卷积神经网络完整实现,适合深度学习入门者及需要快速验证时序模型的研究者,能够从音频、文本、传感器或股价等序列中挖掘局部特征与时间依赖。压缩包体积很小,只有3KB,内含3个Python脚… · 2026/9/24 0:00:26
柔软的L:汉语语流中被忽视的舌肌张力控制 1. 这个“L”不是字母表里的L,而是舌尖上的L最近在几个方言群和语音教学社群里,反复看到有人发一句:“也说字母L:柔软的长舌”。初看以为是英语发音课笔记,点开才发现全是方言爱好者、播音系学生、语言康复师甚至戏曲演… · 2026/9/24 0:00:44