Megatron-Core 训练配方全解析GPT / LLaMA / Mixtral / DeepSeek-V3 超参配置与大规模并行训练实战【免费下载链接】AI-Research-SKILLsComprehensive open-source library of AI research and engineering skills for any AI model. Package the skills and your claude code/codex/gemini agent will be an AI research agent with full horsepower. Maintained by Orchestra Research.项目地址: https://gitcode.com/gh_mirrors/ai/AI-Research-SKILLs本指南以 NVIDIA Megatron-Core 大规模分布式训练框架为背景系统梳理 training-recipes.md 中沉淀的完整训练配方Training Recipes覆盖 GPT-3、LLaMA、Mixtral、DeepSeek-V3 四大系列模型的架构参数、训练超参数与可执行的torchrun启动命令。读完本文你将掌握从 8 GPU 的 LLaMA-3 8B 到 1024 GPU 的 DeepSeek-V3 671B 的完整参数编排方法理解批量爬坡、余弦学习率、GQA/MoE 等关键配置背后的原理并能结合 parallelism-guide.md 与 benchmarks.md 将配方直接套用到自己的集群上。什么是训练配方Training Recipes训练配方是可复现大规模预训练最直接的载体它把模型结构、优化器状态、数据规模与并行策略固化为一组经过生产验证的超参数。与普通的入门示例不同配方必须同时回答四个问题模型长什么样——层数、隐藏维度、注意力头数、FFN 维度、序列长度、位置编码方式用多少数据、多大的批——micro-batch、global-batch、批量爬坡节奏、训练总 token 数优化器与学习率怎么设——Adam 的 β1/β2、权重衰减、梯度裁剪、学习率调度在多少张 GPU 上怎么切分——TP/PP/CP/EP/DP 各自的度数。在 SKILL.md 中Megatron-Core 被定位为面向 2B~462B 参数规模、追求最大化 GPU 利用率文档记录 H100 上最高约 47% MFU的生产级训练框架曾被用于 Nemotron、LLaMA、DeepSeek 等真实模型的训练。因此本文的每个配方都可以视为可直接抄写并缩放的基准配置而非抽象的参数清单。先读懂配方中的通用参数在进入具体模型之前先统一理解所有配方共用的基础参数后面的配置就不再需要重复解释参数含义配方中的典型取值micro-batch-size单卡单次前向/反向的批大小决定显存峰值1~4global-batch-size所有 GPU 上等效的全局批大小 micro-batch × DP × PP 内微批数128~4096lr/min-lr峰值学习率 / 余弦衰减下限8e-5~4.5e-4min-lr 通常为 lr 的 1/10lr-decay-style调度方式配方统一使用cosinecosinelr-warmup-{samples,iters,tokens}预热长度可按样本/迭代/token 三种口径指定2000 iters 或数百万 samplesadam-beta1/adam-beta2Adam 一阶/二阶矩衰减系数0.9 / 0.95weight-decay权重衰减系数0.1clip-grad全局梯度范数裁剪阈值1.0bf16混合精度训练开关BF16truetensor-model-parallel-size张量并行 TP单层权重切分到多卡1~8pipeline-model-parallel-size流水线并行 PP按层切分阶段1~16context-parallel-size上下文并行 CP长序列切分8K 序列启用1~2expert-model-parallel-size专家并行 EPMoE 模型把专家分布到多卡8~64sequence-parallel序列并行配合 TP 进一步削减激活显存trueuse-distributed-optimizer优化器状态分片显著降低每卡显存true其中并行度之间满足恒等式数据并行 DP 总 GPU 数 ÷ (TP × PP × CP × EP)MoE 之外 CP/EP 为 1。这一关系在 parallelism-guide.md 中有完整推导也是理解下文每个配方注释中# Data parallel: ...的关键。GPT-3 系列配方GPT-3 系列配方代表了稠密DenseTransformer 在大规模下的经典形态是理解其余所有配方的基础。GPT-3 15B 配置模型架构num-layers: 32 hidden-size: 6144 num-attention-heads: 48 ffn-hidden-size: 24576 # 4 × hidden-size seq-length: 4096 max-position-embeddings: 4096 position-embedding-type: rope squared-relu: true group-query-attention: true num-query-groups: 8值得注意的架构细节ffn-hidden-size恰好是 hidden 的 4 倍这是 Transformer FFN 的经典扩展比例使用RoPErotary position embedding而非 learned position embeddingsquared-relu: true采用平方 ReLU 激活使用GQAGrouped Query Attention8 个 query group 共享 KV在 48 头注意力下显著压缩 KV cache 与通信量。训练超参数# Batch Configuration micro-batch-size: 4 global-batch-size: 1152 rampup-batch-size: [384, 384, 97656250] # start, increment, total samples # Learning Rate Schedule lr: 4.5e-4 min-lr: 4.5e-5 lr-decay-style: cosine lr-decay-samples: 1949218748 lr-warmup-samples: 3906252 # ~2B tokens with seq_len4096 # Optimizer optimizer: adam adam-beta1: 0.9 adam-beta2: 0.95 weight-decay: 0.1 clip-grad: 1.0 # Precision bf16: true # Parallelism tensor-model-parallel-size: 8 pipeline-model-parallel-size: 1 sequence-parallel: true use-distributed-optimizer: true overlap-grad-reduce: true overlap-param-gather: true这份配置有三个贯穿全篇的关键模式批量爬坡Batch Ramp-Uprampup-batch-size: [384, 384, 97656250]表示从 384 起步、每步增加 384直到累计 97,656,250 个样本后达到目标值。其意义在于训练早期梯度噪声大小批量更稳后期梯度方向趋于稳定再逐步放大批量以提升吞吐以样本数驱动的调度lr-decay-samples与lr-warmup-samples都按样本计数而非 step3906252个样本 × 4096 序列长度 ≈ 160 亿 token即约 2B token 的预热量通信重叠优化overlap-grad-reduce梯度规约与反向传播重叠与overlap-param-gather参数收集与前向重叠配合use-distributed-optimizer把优化器状态分片后的通信开销隐藏在计算里——这是 SKILL.md 中最大化 GPU 利用率的直接手段。启动命令torchrun --nproc_per_node8 --nnodes4 pretrain_gpt.py \ --num-layers 32 \ --hidden-size 6144 \ --num-attention-heads 48 \ --ffn-hidden-size 24576 \ --seq-length 4096 \ --max-position-embeddings 4096 \ --micro-batch-size 4 \ --global-batch-size 1152 \ --lr 4.5e-4 \ --min-lr 4.5e-5 \ --lr-decay-style cosine \ --lr-warmup-samples 3906252 \ --train-samples 1953125000 \ --adam-beta1 0.9 \ --adam-beta2 0.95 \ --weight-decay 0.1 \ --clip-grad 1.0 \ --bf16 \ --tensor-model-parallel-size 8 \ --pipeline-model-parallel-size 1 \ --sequence-parallel \ --use-distributed-optimizer \ --overlap-grad-reduce \ --overlap-param-gather \ --data-path /path/to/data \ --vocab-file /path/to/vocab.json \ --merge-file /path/to/merges.txt \ --save /checkpoints/gpt3-15b \ --load /checkpoints/gpt3-15b \ --save-interval 1000 \ --eval-interval 100注意该命令是4 节点 × 8 卡 32 GPUTP8 恰好用满单节点的 8 张卡NVLink 互联PP1 不做流水线切分剩余维度全部由数据并行覆盖。--save与--load指向同一目录是为了支持断点续训——这在大规模训练中是必须的容错手段详见 production-examples.md 中的 checkpoint 策略。GPT-3 175B 配置模型架构num-layers: 96 hidden-size: 12288 num-attention-heads: 96 ffn-hidden-size: 49152 seq-length: 2048 max-position-embeddings: 2048训练超参数micro-batch-size: 1 global-batch-size: 1536 lr: 6e-5 min-lr: 6e-6 lr-decay-style: cosine lr-warmup-steps: 2000 train-iters: 150000 adam-beta1: 0.9 adam-beta2: 0.95 weight-decay: 0.1 clip-grad: 1.0 bf16: true # Parallelism for 512 GPUs tensor-model-parallel-size: 4 pipeline-model-parallel-size: 8 # Data parallel: 512 / (4 * 8) 16175B 配方展示了跨节点并行的典型形态micro-batch-size: 1——模型巨大单卡只能容纳 1 个样本的前向/反向lr: 6e-5——模型越大峰值学习率越低对比 15B 的 4.5e-4PP8 把 96 层切为 8 个阶段跨节点放置TP4 在节点内切分512 卡下数据并行度 512 ÷ (4 × 8) 16。根据 benchmarks.md 的记录GPT-3 175B 在 TP4、PP8、128~512 张 H100 的配置下可达约 47% MFU、单卡约 390 TFlops 的吞吐。这也解释了为什么 175B 需要TP 小、PP 大超大模型激活显存与跨层通信都成为瓶颈流水线并行比张量并行更容易跨节点扩展。LLaMA 系列配方LLaMA 系列配方引入了现代 LLM 的多个标志性结构RoPE 高频基数rope-theta、RMSNorm 归一化、SwiGLU 激活、GQA、embedding 与输出解耦untie-embeddings-and-output-weights以及针对 8K 以上长序列的上下文并行CP。LLaMA-3 8B模型架构num-layers: 32 hidden-size: 4096 num-attention-heads: 32 num-query-groups: 8 # GQA ffn-hidden-size: 14336 seq-length: 8192 max-position-embeddings: 8192 position-embedding-type: rope rope-theta: 500000 normalization: RMSNorm swiglu: true untie-embeddings-and-output-weights: true训练超参数micro-batch-size: 4 global-batch-size: 128 lr: 3e-4 min-lr: 3e-5 lr-decay-style: cosine lr-warmup-iters: 2000 train-iters: 100000 adam-beta1: 0.9 adam-beta2: 0.95 weight-decay: 0.1 clip-grad: 1.0 bf16: true # Parallelism for 8 GPUs tensor-model-parallel-size: 1 pipeline-model-parallel-size: 1 context-parallel-size: 2 # For 8K sequences8B 是少数单节点即可运行的配方8 张 GPU 全部作为数据并行但context-parallel-size: 2把 8192 长度的序列切成两段做环状注意力Ring Attention。根据 parallelism-guide.md 的决策表序列超过 8K token 时应引入 CP——8B 模型单卡可容纳权重但 8K 序列的激活与 KV cache 才是显存瓶颈CP 直接按 CP 度削减这部分开销。FP8 训练H100./examples/llama/train_llama3_8b_fp8.sh脚本内容如下#!/bin/bash torchrun --nproc_per_node8 pretrain_gpt.py \ --num-layers 32 \ --hidden-size 4096 \ --num-attention-heads 32 \ --num-query-groups 8 \ --ffn-hidden-size 14336 \ --seq-length 8192 \ --max-position-embeddings 8192 \ --micro-batch-size 2 \ --global-batch-size 128 \ --lr 3e-4 \ --train-iters 100000 \ --lr-decay-style cosine \ --lr-warmup-iters 2000 \ --weight-decay 0.1 \ --clip-grad 1.0 \ --fp8-hybrid \ --fp8-amax-history-len 1024 \ --fp8-amax-compute-algo max \ --apply-query-key-layer-scaling \ --attention-softmax-in-fp32 \ --tensor-model-parallel-size 1 \ --pipeline-model-parallel-size 1 \ --context-parallel-size 2 \ --sequence-parallel \ --use-mcore-models \ --transformer-impl transformer_engine \ --data-path /data/llama_train \ --vocab-file /data/tokenizer.model \ --save-interval 1000FP8 配方在 BF16 基础上追加了一组精度控制参数值得逐一说明--fp8-hybridFP8 混合精度训练Transformer Engine 自动选择 FP8 计算路径--fp8-amax-history-len 1024维护 1024 步的激活最大值历史用于缩放因子估计--fp8-amax-compute-algo max取历史最大值而非指数移动平均作为缩放依据更保守、更稳--apply-query-key-layer-scaling对 Q/K 做层缩放缓解 FP8 低精度下注意力分数溢出--attention-softmax-in-fp32softmax 保持在 FP32 计算避免精度损失传导--use-mcore-models与--transformer-impl transformer_engine使用 Megatron-Core 模型实现与 Transformer Engine 后端是 FP8 生效的前提。按照 SKILL.md 与 benchmarks.md 的记载FP8 相比 BF16 在 H100 上可带来约 1.5~2 倍加速同时权重显存减半——但该收益依赖 Hopper/Ada/Blackwell 架构FP8 需要硬件原生支持。LLaMA-3 70B模型架构num-layers: 80 hidden-size: 8192 num-attention-heads: 64 num-query-groups: 8 ffn-hidden-size: 28672 seq-length: 4096 max-position-embeddings: 4096 position-embedding-type: rope rope-theta: 500000 normalization: RMSNorm swiglu: true训练超参数micro-batch-size: 1 global-batch-size: 1024 lr: 1.5e-4 min-lr: 1.5e-5 lr-decay-style: cosine lr-warmup-iters: 2000 adam-beta1: 0.9 adam-beta2: 0.95 weight-decay: 0.1 clip-grad: 1.0 bf16: true # Parallelism for 64 GPUs tensor-model-parallel-size: 4 pipeline-model-parallel-size: 4 context-parallel-size: 2 # Data parallel: 64 / (4 * 4 * 2) 270B 配方是3D 并行的标准模板TP4 在节点内切分权重PP4 跨节点划分层CP2 处理 4K 序列DP2 兜底填充剩余维度。64 卡全部被四维并行覆盖。根据 benchmarks.md 的估算70B 模型参数约 140GBBF16TP4 × PP4 切分后每卡仅约 8.75GB 参数加上梯度与 Adam 优化器状态后约 30GB可轻松放入 80GB 的 H100/A100。LLaMA-3.1 405B模型架构num-layers: 126 hidden-size: 16384 num-attention-heads: 128 num-query-groups: 8 ffn-hidden-size: 53248 seq-length: 4096 max-position-embeddings: 131072 # Supports up to 128K position-embedding-type: rope rope-theta: 500000训练超参数micro-batch-size: 1 global-batch-size: 2048 lr: 8e-5 min-lr: 8e-6 lr-decay-style: cosine lr-warmup-iters: 8000 train-samples: 15000000000000 # 15T tokens adam-beta1: 0.9 adam-beta2: 0.95 weight-decay: 0.1 clip-grad: 1.0 bf16: true # Parallelism for 1024 GPUs tensor-model-parallel-size: 8 pipeline-model-parallel-size: 8 context-parallel-size: 2 # Data parallel: 1024 / (8 * 8 * 2) 8405B 配方是文档中最大的稠密模型配置max-position-embeddings: 131072意味着模型结构上支持最长 128K 上下文但训练时seq-length仍为 4096——长上下文能力通常通过后续的继续训练/微调阶段获得1024 卡下 TP8占满节点 NVLink、PP8跨节点、CP2、DP8是一套标准的 4D 并行组合15T token 的训练量、8000 步的预热体现了超大模型 超大语料 更长预热的规律。生产配置Metatorchrun --nproc_per_node8 --nnodes128 pretrain_gpt.py \ --num-layers 126 \ --hidden-size 16384 \ --num-attention-heads 128 \ --num-query-groups 8 \ --ffn-hidden-size 53248 \ --seq-length 4096 \ --max-position-embeddings 131072 \ --micro-batch-size 1 \ --global-batch-size 2048 \ --lr 8e-5 \ --min-lr 8e-6 \ --lr-decay-style cosine \ --lr-warmup-iters 8000 \ --train-samples 3662109375 \ --adam-beta1 0.9 \ --adam-beta2 0.95 \ --weight-decay 0.1 \ --clip-grad 1.0 \ --bf16 \ --tensor-model-parallel-size 8 \ --pipeline-model-parallel-size 8 \ --context-parallel-size 2 \ --sequence-parallel \ --use-distributed-optimizer \ --overlap-grad-reduce \ --overlap-param-gather \ --use-flash-attn-v2 \ --position-embedding-type rope \ --normalization RMSNorm \ --swiglu \ --untie-embeddings-and-output-weights \ --use-mcore-models \ --transformer-impl transformer_engine \ --data-path /data/llama3_pretraining \ --vocab-file /data/llama3_tokenizer.model \ --save /checkpoints/llama3-405b \ --save-interval 500 \ --eval-interval 100128 节点 × 8 卡 1024 GPU命令把前文所有现代优化手段一次性叠加序列并行、分布式优化器、通信重叠、FlashAttention-v2、RoPE、RMSNorm、SwiGLU、embedding 解耦、mcore 模型与 Transformer Engine。对照 production-examples.md 中的 Meta 生产记录405B 模型在两个 24K H100 集群上训练单卡持续吞吐约 400 TFlops、MFU 约 46%、可用性超过 95%、相比 LLaMA 2 训练效率提升约 3 倍。Mixtral 系列配方Mixtral 配方引入稀疏 MoEMixture of Experts总参数量巨大但每个 token 只激活少数专家配合**专家并行EP**实现容量与算力解耦。Mixtral 8×7B56B 总量13B 激活模型架构num-layers: 32 hidden-size: 4096 num-attention-heads: 32 num-query-groups: 8 ffn-hidden-size: 14336 seq-length: 4096 max-position-embeddings: 32768 # Sliding window position-embedding-type: rope normalization: RMSNorm swiglu: true # MoE Configuration num-experts: 8 moe-router-topk: 2 # Activate 2 experts per token moe-router-load-balancing-type: aux_loss moe-aux-loss-coeff: 0.01MoE 配置三要素num-experts: 88 个专家 FFN总参数量 8 × 7B ≈ 56Bmoe-router-topk: 2每个 token 只激活 2 个专家推理/训练时实际计算量约 13Bmoe-router-load-balancing-type: aux_loss与moe-aux-loss-coeff: 0.01辅损失负载均衡惩罚路由器把 token 过度集中到少数专家系数 0.01 表示该辅助 loss 在总损失中的权重。训练超参数micro-batch-size: 2 global-batch-size: 512 lr: 1e-4 min-lr: 1e-5 lr-decay-style: cosine lr-warmup-iters: 2000 adam-beta1: 0.9 adam-beta2: 0.95 weight-decay: 0.1 clip-grad: 1.0 bf16: true # Parallelism for 64 GPUs tensor-model-parallel-size: 1 pipeline-model-parallel-size: 4 expert-model-parallel-size: 8 context-parallel-size: 1 # Data parallel: 64 / (1 * 4 * 8 * 1) 2MoE 配方的并行策略与稠密模型有本质区别专家并行 EP8 把 8 个专家分布到 8 张 GPU 上每卡只保存 1 个专家。根据 parallelism-guide.md 的估算Without EP: 8 experts × 7B 56GB per GPU With EP4: 2 experts × 7B 14GB per GPU Savings: 75% memory reduction训练命令torchrun --nproc_per_node8 --nnodes8 pretrain_gpt.py \ --num-layers 32 \ --hidden-size 4096 \ --num-attention-heads 32 \ --num-query-groups 8 \ --ffn-hidden-size 14336 \ --seq-length 4096 \ --max-position-embeddings 32768 \ --micro-batch-size 2 \ --global-batch-size 512 \ --lr 1e-4 \ --min-lr 1e-5 \ --lr-decay-style cosine \ --lr-warmup-iters 2000 \ --train-iters 100000 \ --adam-beta1 0.9 \ --adam-beta2 0.95 \ --weight-decay 0.1 \ --clip-grad 1.0 \ --bf16 \ --tensor-model-parallel-size 1 \ --pipeline-model-parallel-size 4 \ --expert-model-parallel-size 8 \ --num-experts 8 \ --moe-router-topk 2 \ --moe-router-load-balancing-type aux_loss \ --moe-aux-loss-coeff 0.01 \ --position-embedding-type rope \ --normalization RMSNorm \ --swiglu \ --use-mcore-models \ --transformer-impl transformer_engine \ --data-path /data/mixtral_train \ --vocab-file /data/mixtral_tokenizer.model \ --save /checkpoints/mixtral-8x7b \ --save-interval 10008 节点 × 8 卡 64 GPUEP8 恰好一一对应 8 个专家。这里 TP1 是有意为之MoE 的专家计算天然稀疏张量并行会破坏专家切分的粒度通信开销反而大于收益。Mixtral 8×22B176B 总量39B 激活模型架构num-layers: 56 hidden-size: 6144 num-attention-heads: 48 num-query-groups: 8 ffn-hidden-size: 16384 seq-length: 4096 max-position-embeddings: 65536 # MoE Configuration num-experts: 8 moe-router-topk: 2训练超参数micro-batch-size: 1 global-batch-size: 1024 lr: 7e-5 min-lr: 7e-6 lr-decay-style: cosine adam-beta1: 0.9 adam-beta2: 0.95 weight-decay: 0.1 clip-grad: 1.0 bf16: true # Parallelism for 256 GPUs tensor-model-parallel-size: 4 pipeline-model-parallel-size: 4 expert-model-parallel-size: 8 # Data parallel: 256 / (4 * 4 * 8) 28×22B 配方展示了MoE 模型的 5D 并行雏形专家变大后单卡放不下TP4 需在节点内对每个专家再做切分同时 PP4 划分层、EP8 分布专家、DP2 兜底256 卡恰好整除。这印证了 parallelism-guide.md 中模型越大、并行维度越多的规律500B 级别需要 4D 甚至 5DTPPPCPDPEP并行。DeepSeek-V3671B 总量37B 激活配方DeepSeek-V3 配方是目前文档中规模最大、并行切分最复杂的 MoE 配置引入了256 个专家的超大规模 MoE 与 MLAMulti-head Latent Attention路由。模型架构num-layers: 61 hidden-size: 7168 num-attention-heads: 128 num-query-groups: 16 ffn-hidden-size: 18432 # MoE Configuration num-experts: 256 moe-router-topk: 8 # Multi-head latent attention shared-expert-intermediate-size: 18432训练超参数micro-batch-size: 1 global-batch-size: 4096 lr: 2.7e-4 min-lr: 2.7e-5 lr-decay-style: cosine lr-warmup-tokens: 5B train-tokens: 14.8T adam-beta1: 0.9 adam-beta2: 0.95 weight-decay: 0.1 clip-grad: 1.0 bf16: true # Parallelism for 1024 GPUs tensor-model-parallel-size: 2 pipeline-model-parallel-size: 16 expert-model-parallel-size: 64 # Data parallel: 1024 / (2 * 16 * 64) 0.5 (overlapping)这份配置的几个极端之处256 个专家、top-k8每个 token 激活 8 个路由专家加上 18432 维的共享专家激活参数量约 37B总参数量 671BEP64256 个专家分布在 64 张 GPU 上每卡约 4 个专家DP 0.5 的重叠并行按公式1024 / (2 × 16 × 64) 0.5无法整除说明实际部署采用了重叠式overlapping专家放置——同一张 GPU 同时承担部分数据并行副本与部分专家切分。这是超大规模 MoE 训练中绕过维度必须整除限制的工程手段以 token 为口径的调度lr-warmup-tokens: 5B、train-tokens: 14.8T与 production-examples.md 记载的 DeepSeek-V3 生产配置1024 H100、14.8T token一致。通用训练模式无论模型规模如何training-recipes.md 后半部分沉淀了一批可复用的通用模式。批量大小爬坡Batch Size Ramp-Uprampup-batch-size: [start_batch, increment, total_samples] # Example: [384, 384, 97656250] # Start with 384, increase by 384 every step until total_samples三元组依次为起始批量、每步增量、累计样本上限。批量爬坡的收益来自两方面早期小批量降低梯度噪声、稳定训练后期大批量提升每样本的计算效率。当累计训练样本数超过total_samples后批量保持为start increment × steps封顶值。学习率调度Learning Rate Schedules余弦衰减最常用lr(step) min_lr 0.5 * (max_lr - min_lr) * (1 cos(π * step / total_steps))线性预热 余弦衰减if step warmup_steps: lr(step) max_lr * step / warmup_steps else: lr(step) cosine_decay(step - warmup_steps)余弦衰减在训练后期以平缓曲线逼近min_lr相比阶跃衰减能更平滑地收敛预热阶段则避免模型参数初始化不稳时过大的学习率导致发散。优化器设置Optimizer Settings标准 Adamoptimizer: adam adam-beta1: 0.9 adam-beta2: 0.95 # Lower than typical 0.999 weight-decay: 0.1 clip-grad: 1.0为什么 beta2 取 0.95 而不是常见的 0.999更低的 β2 使二阶矩估计对近期梯度更敏感更新步伐更快响应损失曲面的变化在大规模预训练中批量巨大、梯度估计本身足够平稳无需 0.999 那样长程的平均该取值已在 GPT-3、LLaMA、Mixtral 的公开配方中反复验证。数据配置Data Configuration词汇表规模GPT-350,257 tokensGPT-2 BPELLaMA-3128,256 tokens为多语言扩展Mixtral32,000 tokens典型数据混合按 token 占比网页60~70%书籍10~15%GitHub 代码5~10%学术论文5~10%其他Wikipedia 等5~10%配方中的词汇表大小与数据混合比例直接决定了vocab-file与数据预处理的配置是配方可复现的另一半——即使并行与优化器参数完全相同数据分布不同也会导致训练曲线与最终质量差异显著。关于数据侧的工程细节可参考仓库中 production-examples.md 记录的数据预处理调用链。如何把配方缩放到你自己的集群配方是参考答案落到实际集群时还需要做三件事确认并行度可整除、选对微批大小、用性能指标验证。第一步核对并行度恒等式总 GPU 数 TP × PP × CP × EP × DP以 SKILL.md 的速查表为起点模型规模GPU 数TPPPDPCP7B8118113B8214170B644441405B1288822并行度选取的规则源自 parallelism-guide.mdTP 优先且不超过 8TP 依赖节点内 NVLink跨节点会因网络延迟显著掉速PP 用于跨节点扩展PP 只传递激活数百 MB 量级对网络带宽要求低CP 用于超长序列序列超过 8K 时启用按 CP 度削减 KV cache 与激活显存DP 填充剩余维度梯度 all-reduce 每步只发生一次扩展性最好。第二步微调 micro-batch-size微批大小直接决定显存峰值与流水线气泡比例。标准做法是从 1 开始逐步增大直到 OOM# Start with 1, increase until OOM for MBS in 1 2 4 8; do echo Testing micro-batch-size$MBS torchrun ... --micro-batch-size $MBS done文档给出的经验值7B 模型 4~870B 模型 1~2405B 模型 1。更大的 global batch 通过增加微批数量也能摊薄流水线气泡SKILL.md 的排障章节对此有说明。第三步监控 MFU 与吞吐训练一旦启动应持续跟踪详见 benchmarks.mdMFUModel FLOP Utilization文档记录 H100 上可达约 47%低于 30% 需要排查单卡吞吐TFlops/GPUThroughput 总 FLOPs / (时间 × GPU 数 × 10^12)显存占用权重之外还需预留梯度与优化器状态约 2 倍权重Loss 曲线应随学习率调度平稳下降。若 MFU 偏低按以下顺序排查增大微批 → 开启 FlashAttention 与序列并行 → 检查 NCCL/InfiniBand 配置 → 确认数据加载没有成为瓶颈若通信占比过高30%则降低 TP、改用 interleaved 流水线调度--num-layers-per-virtual-pipeline-stage 2并开启overlap-grad-reduce/overlap-param-gather。若显存不足可依次尝试梯度检查点--recompute-granularity full --recompute-method block、降低微批、提高并行度或使用--cpu-optimizer把优化器状态卸载到 CPU。生产环境的最后一块拼图配方只覆盖训练本身。对照 production-examples.md生产级落地还需要频繁 checkpoint--save-interval 500~1000--save与--load指向同一目录以支持断点续训持续监控Loss、学习率、梯度范数、吞吐、MFU 以及 GPU 利用率、显存水位故障容忍优先于吞吐大规模训练数月维度的任务中任何一次 GPU 故障都可能造成巨大损失可恢复性是第一优先级。总结training-recipes.md 提供的七份配方覆盖了现代大模型预训练的完整谱系从 GPT-3 15B/175B 的稠密并行模板到 LLaMA-3 8B/70B/405B 的 RoPE GQA CP 长序列组合再到 Mixtral 8×7B/8×22B 与 DeepSeek-V3 的稀疏 MoE EP 五维并行。它们共同揭示了三组可迁移的规律模型越大学习率越小、预热越长、微批越小4.5e-4/2B tokens → 8e-5/8000 iters并行维度随规模单调增长小模型 DP 足够70B 引入 TPPP8K 序列加 CPMoE 再加 EP所有配方共享同一套稳训基座Adamβ10.9, β20.95、weight-decay 0.1、clip-grad 1.0、cosine 衰减、批量爬坡与 BF16/FP8 混合精度。配合仓库中的 parallelism-guide.md并行策略对比与选型、benchmarks.md不同规模下的 MFU/吞吐基准与 production-examples.mdLLaMA 3、Nemotron、DeepSeek-V3 等真实生产案例这些配方足以作为你从单机实验走向千卡集群的完整路线图。【免费下载链接】AI-Research-SKILLsComprehensive open-source library of AI research and engineering skills for any AI model. Package the skills and your claude code/codex/gemini agent will be an AI research agent with full horsepower. Maintained by Orchestra Research.项目地址: https://gitcode.com/gh_mirrors/ai/AI-Research-SKILLs创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
企业数字化 ERP 产品动态
相关推荐
Coding Agent终端输出剪枝:Token消耗降低80%的实战方案 1. 当终端输出变成账单上的数字:一个被忽视的成本黑洞第一次意识到终端输出是个问题时,我正在跑一个自动化重构任务。Agent 需要遍历一个中型项目的所有测试文件,逐个分析依赖关系并生成迁移方案。任务本身不复杂,但跑完之后我看了… · 2026/9/23 13:49:14
PaddleNLP 中 Mixtral 稀疏专家模型的推理实践:从 BF16 到 WINT8 的完整部署指南 人工智能大模型NLP深度学习预训练微调RLHF模型量化 【免费下载链接】PaddleNLP Easy-to-use and powerful LLM and SLM library with awesome model zoo. 项目地址: https://gitcode.com/gh_mirrors/pa/PaddleNLP 点击查看 免费下载 Mixtral 是 Mistral AI 基于 Mo… · 2026/9/23 13:49:14
YOLO安全帽手套检测:三套标签格式与训练数据集全解析 简介:YOLO安全帽手套检测数据集整合了1000张真实场景图片,面向目标检测初学者与安全施工场景应用开发者,可直接用于YOLO系列模型训练与效果验证。包内包含2000个文件,其中1000个xml标注、991个txt标签,配合少量Python划… · 2026/9/23 13:49:14
抽屉滑轨哪个品牌好?2026 横评:承重结构、阻尼集成、静音联动、防锈工艺四条硬线 结论:按品牌实力和硬数据分四个梯队——国产高端技术标杆:炬森(JUSEN)——2025 年推出星耀系列三节连动隐藏轨,补齐高端抽屉滑轨产品矩阵,在轨道顺滑度和缓冲一致性上进一步优化;星耀系列 35kg … · 2026/9/23 15:13:33
schedule 库安装完全指南:Python 版本要求、可选依赖与多平台安装方式 任务调度后端 【免费下载链接】schedule Python job scheduling for humans. 项目地址: https://gitcode.com/gh_mirrors/sc/schedule 点击查看 免费下载 导读
schedule 是一个"面向人类"的轻量级进程内 Python 任务调度库,用于以友好、直观… · 2026/9/23 15:13:33
DGA域名检测:从特征工程到LSTM+Attention实战 简介:本资源是一套面向网络安全研究人员与AI安全工程师的DGA恶意域名检测实战方案,聚焦于利用机器学习与深度学习技术突破传统黑名单防御局限,解决隐蔽性强、动态演化快的DGA域名识别难题。压缩包共5个文件(17.59MB)&a… · 2026/9/23 15:13:25
Yii 2 开发起步指南:开始学习框架之前必须掌握的 PHP、OOP 与 Composer 前置知识 Yii 2 开发起步指南:开始学习框架之前必须掌握的 PHP、OOP 与 Composer 前置知识 【免费下载链接】yii2 Yii 2: The Fast, Secure and Professional PHP Framework 项目地址: https://gitcode.com/gh_mirrors/yi/yii2
本文是 Yii 2 官方指南「入门࿰… · 2026/9/23 15:13:25
Python手写SFM三维重建:从特征匹配到光束法平差完整指南 简介:三维重建是计算机视觉的热点方向,这份项目实践包专门讲解如何用Python实现SFM(运动恢复结构)算法,适合具备一定Python与图像处理基础、希望从零跑通三维重建流程的开发者或研究者。包体非常精简,共3个… · 2026/9/23 15:13:25
DeepSeek大模型赋能BIM图纸审查:从数据预处理到LoRA微调的完整方案 简介:DeepSeek建筑行业BIM智能化方案共272页,围绕大模型技术在工程图纸自动审查中的落地路径,面向BIM工程师、算法开发者和工程数字化实施团队,针对图纸审查效率低、规范依赖人工等痛点给出体系化解决思路。资源为1个PDF文件&… · 2026/9/23 15:13:19
3招搞定手机怎么下载微信面试难题实战项目解析 3招搞定手机怎么下载微信面试难题实战项目解析 面试被问“手机怎么下载微信”背后的原理,90%的人答不上来。别笑,这看似弱智的问题,实则是考察你对移动应用分发机制、安全校验及网络协议理解的试金石。我带过不少校招新人,他们背了八股文,却连一个A… · 2026/9/23 0:00:03
你有新短消息请注意查收:3个新手避坑指南搞定消息系统选型 你有新短消息请注意查收:3个新手避坑指南搞定消息系统选型 面试被问“高并发下如何保证消息不丢失”,你张口就是“用Redis”,结果面试官追问“如果Redis宕机了怎么办”,你瞬间卡壳。这种场景太常见了,很多新手在背八股文时,只记住了技术名词… · 2026/9/23 0:00:29