【免费下载链接】Model-OptimizerA unified library of SOTA model optimization techniques like quantization, distillation, pruning, neural architecture search, speculative decoding, etc. It compresses deep learning models for downstream deployment frameworks like TensorRT-LLM, TensorRT, vLLM, etc. to optimize inference speed.项目地址https://gitcode.com/GitHub_Trending/te/Model-Optimizer点击查看免费下载本篇指南完整讲解 NVIDIA Model Optimizernvidia-modelopt在 Linux 系统上的安装流程覆盖系统要求、Docker 与本地PIP/Conda两种环境搭建路径、可选依赖模块的正确选取以及安装后的核验方法。读者将能根据自身部署目标TensorRT-LLM / ONNX / Hugging Face准确选择安装方式与 optional dependencies并完成首次 CUDA 扩展编译与预编译验证。一、系统要求先确认硬件与软件基线根据官方安装文档最新版nvidia-modelopt在 Linux 上的系统要求如下项目要求操作系统OSLinux架构Architecturex86_64、aarch64 (SBSA)Python 3.10, 3.15CUDA12.x、13.xPyTorch 2.8TensorRT-LLM可选 1.0ONNX Runtime可选1.24TensorRT可选 10.0几点说明Python 版本约束与项目元数据一致pyproject.toml中声明requires-python 3.10,3.15与上表完全对应这意味着 Python 3.103.14 均可用3.15 及以上暂不支持。PyTorch 是硬性依赖核心依赖列表固定了torch2.8安装时会随主包一并解析。可选项以部署目标为导向TensorRT-LLM、ONNX Runtime、TensorRT 均标注为可选说明仅当你要将量化产物导出到对应推理框架时才需要安装这直接影响下文可选依赖的选择策略。二、环境搭建Docker 与本地环境的双路径选择官方文档提供了两条并行的环境搭建路径可根据使用场景二选一。2.1 Docker 镜像推荐含完整部署依赖如果要在完整依赖例如 TensorRT / TensorRT-LLM 部署下使用 Model Optimizer推荐直接使用预装了 Model Optimizer 的 TensorRT-LLM Docker 镜像nvcr.io/nvidia/tensorrt-llm/release:version使用 Docker 路径时的三个要点镜像内已预装 Model Optimizer但建议用 pip 按下一节说明升级到最新版本避免使用镜像内置的旧版本。按需设置 TensorRT 相关环境变量官方给出的示例为export PIP_CONSTRAINT export LD_LIBRARY_PATH${LD_LIBRARY_PATH}:/usr/include:/usr/lib/x86_64-linux-gnu补充示例依赖具体示例如 examples/hf_ptq可能还需要安装各自requirements.txt中的额外依赖。其他可选的 NVIDIA 官方镜像PyTorch 场景使用 NGC PyTorch 容器nvcr.io/nvidia/pytorch:version-py3Model Optimizer 已预装适合以 PyTorch 为主的量化工作流。Megatron-Bridge / Megatron-LM 框架使用 NeMo 容器nvcr.io/nvidia/nemo:versionModel Optimizer 已预装适合剪枝、蒸馏等训练型优化技术。ONNX / TensorRT 场景使用 TensorRT 容器nvcr.io/nvidia/tensorrt:version-py3官方明确说明其性能优于 PyTorch 容器适合 examples/onnx_ptq 这类工作流。注意拉取和使用容器镜像前请先阅读并遵守各镜像自身的许可条款。2.2 本地环境PIP / Conda不使用 Docker 时推荐先在本地建立独立虚拟环境第一步创建并激活 conda 环境conda create -n modelopt python3.12 pip conda activate modelopt官方文档以 Python 3.12 为例它在 3.103.14 的支持范围内且pyproject.toml的文档构建与测试体系也以 Python 3.12 为主线是一个稳妥的选择。第二步可选安装指定版本的 PyTorch默认情况下会安装 pip 上最新的 PyTorch。如需为特定 CUDA 版本安装特定 PyTorch请先按照 PyTorch 官方本地安装指引安装对应版本再继续安装 Model Optimizer。第三步可选安装其他 NVIDIA 依赖库如果想与 TensorRT、TensorRT-LLM、Megatron-Bridge、Megatron-LM、Triton 等其他 NVIDIA 库搭配使用请先确认这些库在本地环境中的安装难度。若遇到依赖冲突问题官方建议改用 Docker 镜像以获得无缝体验。同时也可以采用混合工作流在本地仅用 Model Optimizer 完成 HuggingFace 模型量化再进入 Docker 镜像完成部署环节。三、安装 Model Optimizer主包与可选依赖的精确组合Model Optimizer 在安装过程中会下载并安装额外的第三方开源软件使用前请先审阅这些开源项目的许可条款。3.1 一键全量安装如果使用官方 Docker 镜像已含 ModelOpt 及全部可选依赖可跳过安装步骤若使用其他建议的镜像ModelOpt 可能只预装了部分可选依赖请按需用 pip 升级。常规安装命令为pip install -U nvidia-modelopt[all]其中[all]在 pyproject.toml 中定义为nvidia-modelopt[onnx,hf,puzzletron]即一次安装 ONNX、Hugging Face、Puzzletron 三组可选依赖。3.2 按模块精确选择 partial dependencies如果不加任何可选依赖安装的nvidia-modelopt仅包含modelopt.torch包所需的基础依赖其他模块必须搭配对应的可选依赖或[all]才能正常工作。官方文档给出的模块与可选依赖对应关系如下模块可选依赖modelopt.onnx[onnx]modelopt.torch._deploy[onnx]可见 ONNX 相关能力modelopt/onnx 模块及其 ONNX 导出/量化管线与部署工具链modelopt.torch._deploymodelopt/torch/_deploy都依赖[onnx]组。此外还支持为第三方包安装依赖第三方包可选依赖Hugging Facetransformers、diffusers等[hf][hf]组在pyproject.toml中涵盖了accelerate、datasets、diffusers、transformers、peft、deepspeed等库是运行 examples/hf_ptq、examples/llm_qat 等 Hugging Face 工作流的前提。典型安装组合示例# 仅量化 ONNX 模型 pip install -U nvidia-modelopt[onnx] # 量化 Hugging Face 模型 pip install -U nvidia-modelopt[hf] # 全量安装ONNX HF Puzzletron pip install -U nvidia-modelopt[all]3.3 CUDA 专属依赖cupy 的版本匹配默认情况下[onnx]依赖会安装cupy-cuda12x以支撑 INT4 ONNX 量化。若你的环境是 CUDA 13则需要在安装nvidia-modelopt[onnx]之后执行pip uninstall -y cupy-cuda12x pip install cupy-cuda13x这一点与系统要求表中 CUDA 12.x / 13.x 的支持范围相呼应——cupy 的 CUDA 绑定必须与本地 CUDA 版本一致否则 INT4 ONNX 量化链路可能无法正确加载内核。四、加速量化Triton Kernels 的启用条件ModelOpt 内置了基于 Triton 语言实现的优化量化内核可将量化运算速度相比默认实现提升约 40%对 AWQINT4 权重仅量化 和量化感知训练QAT工作流尤其有价值。从源码看内核的可用性由 modelopt/torch/kernels/quantization/gemm/init.py 统一探测当torch.cuda.is_available()且能成功导入triton时会自动加载 FP4、FP8 等 Triton 内核其中fp4_kernel_hopper额外要求 GPU 计算能力 8.9因为它使用了tl.float8e4nv。官方文档给出的启用条件为CUDA 设备计算能力 8.9例如 RTX 40 系列、RTX 6000、NVIDIA L40 及更新型号安装 Tritonpip install triton。无需额外配置——只要硬件与量化格式满足条件优化内核会被自动选用。当前 Triton 内核支持 NVFP4 量化格式后续版本会扩展更多格式。需要留意的是Triton 内核主要加速量化模拟/前向过程与上文的本地依赖安装是两个独立的维度。五、检查安装预编译 CUDA 扩展首次使用 ModelOpt 的 PyTorch 量化 API 时它会利用本机已安装的 torch 与 CUDA 编译快速量化内核编译可能需要几分钟但后续量化调用会显著加快。编译过程由 modelopt/torch/quantization/extensions.py 驱动其底层load_cpp_extension实现见 modelopt/torch/utils/cpp_extension.py会根据torch.version.cuda与 CUDA 版本约束做匹配检查并依据设备计算能力自动设置TORCH_CUDA_ARCH_LIST再调用torch.utils.cpp_extension.load()完成编译。为了触发编译、验证是否成功或在构建 Docker 镜像时预先完成编译请运行python -c import modelopt.torch.quantization.extensions as ext; ext.precompile()precompile()会依次编译并打印四组扩展modelopt_cuda_exttensor_quant 通用内核、modelopt_cuda_ext_fp8FP8 量化内核、modelopt_cuda_ext_mxMX 格式内核以及modelopt_cuda_ext_ggmlGGML 兼容 IQ 打包内核。所有扩展均采用懒加载缓存首次访问后缓存在函数属性上因此预编译一次后后续量化调用可直接命中已编译产物。六、安装后的下一步安装完成并核验通过后可基于本仓库继续深入量化指南docs/source/guides/1_quantization.rst 与 docs/source/guides/_pytorch_quantization.rst 介绍 PTQ 的具体 API 用法方法选型docs/source/guides/_choosing_quant_methods.rst 提供 FP8、INT8 SmoothQuant、INT4 AWQ 等方法的精度/性能取舍对照可帮助判断哪种量化格式需要 Triton 加速实战示例examples/hf_ptq/README.mdHugging Face PTQ、examples/onnx_ptq/README.mdONNX 量化均附带各自的requirements.txt安装后即可按示例脚本复现完整流程。本文结论在 Linux 上使用 Model Optimizer 的完整路径可概括为——确认系统要求Linux x86_64/aarch64 Python 3.10–3.14 CUDA 12/13→ 选择 Docker 或 Conda 本地环境 → 按目标模块选择[onnx]/[hf]/[all]可选依赖CUDA 13 用户需替换 cupy→ 如需 40% 量化加速则确保计算能力 8.9 并安装 Triton → 最后通过ext.precompile()验证内核编译即可进入量化实战。赞分享【免费下载链接】Model-OptimizerA unified library of SOTA model optimization techniques like quantization, distillation, pruning, neural architecture search, speculative decoding, etc. It compresses deep learning models for downstream deployment frameworks like TensorRT-LLM, TensorRT, vLLM, etc. to optimize inference speed.项目地址https://gitcode.com/GitHub_Trending/te/Model-Optimizer点击查看免费下载相关推荐NVIDIA Model Optimizer 安装指南Linux 与 Windows 全平台环境搭建与验证实战NVIDIA Model Optimizer 安装指南Linux 与 Windows 全平台环境搭建与验证实战 导读 本文是 Model OptimizerAntiSplit-M完整教程5步学会将分拆APK转为标准安装包AntiSplit M完整教程5步学会将分拆APK转为标准安装包 你是否曾经下载了分拆APK文件APKS/XAPK/APKM格式却无法直接安装 今天移动开发开发工具Flask 安装与环境配置指南从 Python 版本要求到依赖体系全解析Flask 安装与环境配置指南从 Python 版本要求到依赖体系全解析 Flask 的安装过程本身很轻量但其背后涉及明确的 Python 版本约束、一组精后端Web框架创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
企业数字化 ERP 产品动态
相关推荐
【领域篇06】效能评估在金融科技与风控领域的应用实践 目录
一、引言
二、效能评估的基本概念与价值
三、金融科技领域的效能评估应用
3.1 系统性能评估
3.2 算法模型效能评估
3.3 业务流程效能评估
四、风控领域的效能评估实践
4.1 风控模型效能评估
4.2 反欺诈效能评估
4.3 贷后管理效能评估
五、效能评估的实施路径
… · 2026/9/25 18:13:09
用OpenCode与Harness重构数据分析工作流:从脚本到智能体实战指南 最近我把一套数据分析项目的工作流整个重构了,核心就换了两个东西:编码智能体 OpenCode,以及智能体运行框架 Harness。这两个词放在一起,不是一个概念,而是两个层面:OpenCode 负责“执行”,也就… · 2026/9/25 18:12:39
OpenMontage:首个本地化AI视频Agent工作流实战指南 1. 这不是“AI剪视频”,而是第一次看到Agent真正接管整条工作流最近在几个技术群和本地AI开发者聚会上,总有人问:“AI Agent真能自己做完一条视频?”语气里带着三分期待、七分怀疑——毕竟过去两年,我们见惯了“AI生成… · 2026/9/25 18:12:39
IronClaw Decision Capture 技能实战:在 Agent 会话中自动检测、持久化与追踪决策 人工智能AI 应用交互助手AI Agent 【免费下载链接】ironclaw IronClaw is an Agent OS focused on privacy, security and extensibility 项目地址: https://gitcode.com/gh_mirrors/iro/ironclaw 点击查看 免费下载 IronClaw 的 decision-capture 技能是一套面向 … · 2026/9/25 18:52:08
内蒙古口碑好的大口径铁箍纸桶联系方式生产厂家避坑挑选指南 内蒙古口碑好的大口径铁箍纸桶生产厂家避坑挑选指南辽阳市万兴包装制品厂是深耕纸包装行业三十年的源头生产厂家,主营高强度环保铁箍纸桶,可提供定制化包装解决方案,兼顾出口级品质与高性价比,适配化工、医药等行业的存储运输及出… · 2026/9/25 18:52:02
Atlas 300V 24G推理加速卡实测:YOLOv8部署全流程与性能调优 Atlas 300V 24G 部署 YOLO 实录:这卡到底是不是运算加速卡,我实测后全说清楚这两年被边缘 AI 和视频分析项目追着跑,手里的 GPU 卡又贵又难买,我开始把目光转向国产推理加速卡。手里正好有一张华为 Atlas 300V 24G,很多… · 2026/9/25 18:52:02
Codex 与 CC Switch 配置保姆教程 资源文件:通过网盘分享的文件:
链接 : https://pan.baidu.com/s/1Mp9nIswOat58X33clpjEkg 提取码: va8u 复制这段内容后打开百度网盘手机App,操作更方便哦一、Codex 安装指南方式一:官方下载(推荐)访问open… · 2026/9/25 18:51:50
OrcaSlicer 切片安装配置手册 目录
耗材预设文件
bambustudio导出命令:
20个切片工具
bambustudio 切片
orca-slicer介绍:
orca-slicer下载:
编译:
linux安装:
缩放:
自动切片:
导出预设包,打印机预设… · 2026/9/25 18:51:44
创维E900V22D刷机全攻略:S905L3SB芯片兼容性解析与救砖实战 /* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/25 1:00:31
MQTT协议原理与Broker服务器搭建实战:从Mosquitto到EMQX /* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/25 1:00:37