首页/新闻资讯/正文详情

docker内TRT-LLM v1.3.0rc27 win11本机部署qwen3.8

发布时间:2026/9/24 17:55:25 来源:云帆数科 栏目:资讯中心
docker内TRT-LLM v1.3.0rc27 win11本机部署qwen3.8
1 下载模型modelscope download --model cyankiwi/Qwen3.8-27B-AWQ-INT4 --local_dir H:\agent\trt-llm\models\qwen3.8-27b-awq为什么这个 AWQ 不是 14GB 而是21GB因为作者对 Qwen3.8 敏感的Gated DeltaNet 状态更新层和因果卷积保留了 BF16 高精度仅对占体积最大的注意力与 FFN 进行了 INT4 压缩即W4A16 混合精度从而确保模型不会失真这 21GB 权重载入显存后占用约21~22 GB正好可以压着极限完全吃满你的单张 RTX 309024GB2 开代理拉dockerdocker pull nvcr.io/nvidia/tensorrt-llm/release:1.3.0rc27.dev2026091700003 建立容器docker run -it --gpus all --ipchost --ulimit memlock-1 --ulimit stack67108864 -p 8000:8000 -v H:/agent/qwen38/models_Qwen3.8-27B-AWQ-INT4/qwen3.8-27b-awq:/model --name trt-qwen38 nvcr.io/nvidia/tensorrt-llm/release:1.3.0rc27.dev202609170000 bash4 模型trtllm-serve /model --backend pytorch --host 0.0.0.0 --port 8000 是什么意思核心结论TRT-LLM 1.3.0 目前尚未支持 INT4 的compressed-tensors。我们来看刚才第 125~135 行的源码# 源码中明确写着 else: raise ValueError( fUnsupported quant_bits: {weights_quant_config[num_bits]}. Supported: 8 (FP8) or 4 (NVFP4). )TRT-LLM 1.3.0 刚刚合入对compressed-tensors的实验性支持目前只支持 8-bit (FP8) 和 4-bit 浮点 (NVFP4 / MXFP4)还没有实现 INT4整数量化。root8486ae1773b2:/app/tensorrt_llm# python3 -c import tensorrt_llm.models as m; print([x for x in dir(m) if Qwen in x]) Skipping import of cpp extensions due to incompatible torch version 2.14.0a04fdf77b940.nv26.08 for torchao version 0.15.0 Please see https://github.com/pytorch/ao/issues/2919 for more info [TensorRT-LLM] TensorRT LLM version: 1.3.0rc27.dev202609170000 []真相大白TRT-LLM 对 Qwen3.8 根本没有“纯 C 引擎”你之所以觉得 TRT-LLM 快是因为你之前跑 Qwen2.5-14B 时用的是trtllm-build编译出来的纯 C.engine。但根据刚刚所有的源码检测TRT-LLM 1.3.0 并没有为 Qwen3.8 编写 C Engine 编译器所以tensorrt_llm.models查出来是空的[]。NVIDIA 对 Qwen3.8 的支持全部扔在了一个叫_torch的Python 后端里。换句话说在 TRT-LLM 里跑 Qwen3.8本质上和 vLLM 一样也是走 Python 调度根本享受不到纯 C 引擎的狂暴速度而且还缺少 INT4 开源解包算子最优解决方案直接用 vLLM 运行该模型无需重新下载任何权重直接用我们刚才下好的H:\agent\qwen38\...目录。第一步退出当前 TRT 容器在当前容器终端执行退出exit第二步在宿主机 Windows PowerShell 一键启动 vLLM如果需要拉取镜像请保持本地代理开启docker run -d --gpus all --ipchost -p 8000:8000 -v H:/agent/qwen38/models_Qwen3.8-27B-AWQ-INT4/qwen3.8-27b-awq:/model --name vllm-qwen38 vllm/vllm-openai:latest --model /model --gpu-memory-utilization 0.90 --max-model-len 4096第三步查看启动与加载日志docker logs -f vllm-qwen38vLLM 会直接识别compressed-tensors并加载 Marlin INT4 内核。看到Application startup complete后即可直接调用

相关推荐

OpenFOAM二次开发教程(03):第一个求解器——从 icoFoam 骨架到能编译的 myFirstFoam
OpenFOAM二次开发教程(03):第一个求解器——从 icoFoam 骨架到能编译的 myFirstFoam

OpenFOAM二次开发教程(03):第一个求解器——从 icoFoam 骨架到能编译的 myFirstFoam版本与事实声明 求解器骨架的 #include 结构(setRootCase.H、createTime.H、createMesh.H、createFields.H、initContinuityErrs.H)来… · 2026/9/24 17:55:19

Spring Boot 统一返回体 + 全局异常处理:让接口不再吐 500 堆栈
Spring Boot 统一返回体 + 全局异常处理:让接口不再吐 500 堆栈

Spring Boot 统一返回体 全局异常处理:让接口不再吐 500 堆栈环境:Spring Boot MyBatis-Plus Lombok JDK 17上一篇把三层架构搭好之后,接口能查数据了,但返回的东西不太像样:直接一个裸数组。而且参数写错的时候&a… · 2026/9/24 17:55:19

opencv概述
opencv概述

了解OpenCV 1、概述2、OpenCV详细介绍 2.1、OpenCV的起源2.2、OpenCV开发语言2.3、OpenCV的应用领域 3、OpenCV模块划分4、OpenCV源码文件结构 4.1、根目录介绍4.2、常用模块介绍4.3、CUDA加速模块 5、OpenCV配置以及Visual Studio使用OpenCV6、关于Lena图片7、OpenCV和OpenGL的… · 2026/9/24 17:55:05

国产AI工业设计软件实测盘点:适配、功能与选型指南
国产AI工业设计软件实测盘点:适配、功能与选型指南

2026年了,做结构设计的同行应该都能感觉到,AI和工业设计软件这对组合,已经从展会PPT里的热词,变成了实实在在装进电脑里的工具。过去一年,我把市面上能跑起来的国产AI工业设计软件都装了一遍,重点就是在国产… · 2026/9/24 18:31:40

VirtualBox虚拟机隐身术:抹除检测痕迹的完整指南
VirtualBox虚拟机隐身术:抹除检测痕迹的完整指南

平时玩虚拟机装系统,大家基本都是图省事,装完 VirtualBox 导入镜像就开始用。但真正玩到深处会发现一个尴尬问题:很多软件一到虚拟机里就“罢工”,有的直接弹窗提示检测到虚拟环境,有的干脆静默退出,还有的… · 2026/9/24 18:31:40

VRRP详解:从原理到eNSP实战,彻底搞懂网关冗余
VRRP详解:从原理到eNSP实战,彻底搞懂网关冗余

做网络这行,最怕后半夜手机响。响起来大概率不是好事——要么出口挂了,要么核心设备重启。但还有一种特别憋屈的情况:公司明明有两台路由器,双链路都接得好好的,可只要主路由器一宕机,全部门瞬间断网。断网… · 2026/9/24 18:31:40

VRRP原理与实战:从网关冗余到华为eNSP配置详解
VRRP原理与实战:从网关冗余到华为eNSP配置详解

每次给刚入行的朋友讲网络高可用,我第一反应通常不是堆叠,不是负载均衡,而是先把 VRRP(虚拟路由冗余协议)拎出来讲透。原因很简单:无论你以后做企业网、数据中心还是运营商接入,网关冗余都是绕不… · 2026/9/24 18:31:40

从ANN预测到LSTM时序预测:网络设计、训练验证与工程落地的完整实践指南
从ANN预测到LSTM时序预测:网络设计、训练验证与工程落地的完整实践指南

简介:压缩包内是一份基于MATLAB的人工神经网络(ANN)预测分析示例代码,适合机器学习初学者及需要快速上手神经网络预测的工程人员。通过单个ANN.m脚本,集中展示了从网络结构定义、数据预处理、训练参数设置到模型训练与… · 2026/9/24 18:31:39

自适应波束形成ADBF实战:从解压到MVDR/LCMV实现
自适应波束形成ADBF实战:从解压到MVDR/LCMV实现

简介:ADBF.zip是面向自适应波束形成(Adaptive Beamforming)学习与仿真验证的MATLAB资源包,适合通信、雷达、声纳等领域需要掌握波束形成算法及滤波器设计的初学者和工程师。压缩包共7个文件,含4个fig示意图和3个m源码脚… · 2026/9/24 18:31:33

基于YOLOv8的渔船作业监控系统:从环境搭建到边缘部署全流程
基于YOLOv8的渔船作业监控系统:从环境搭建到边缘部署全流程

简介:这是一套面向计算机、人工智能、自动化等专业学生与教师的毕业设计级项目资源,围绕YOLOv8实现渔船作业监控系统,可用于毕设、课程设计、大作业或项目立项演示。压缩包共97个文件,约24.21MB,以70个Python源码文件为… · 2026/9/24 0:00:13

1D-CNN时间序列建模实战:从Conv1d原理到工业落地
1D-CNN时间序列建模实战:从Conv1d原理到工业落地

简介:面向时间序列数据建模的一维卷积神经网络完整实现,适合深度学习入门者及需要快速验证时序模型的研究者,能够从音频、文本、传感器或股价等序列中挖掘局部特征与时间依赖。压缩包体积很小,只有3KB,内含3个Python脚… · 2026/9/24 0:00:26

柔软的L:汉语语流中被忽视的舌肌张力控制
柔软的L:汉语语流中被忽视的舌肌张力控制

1. 这个“L”不是字母表里的L,而是舌尖上的L最近在几个方言群和语音教学社群里,反复看到有人发一句:“也说字母L:柔软的长舌”。初看以为是英语发音课笔记,点开才发现全是方言爱好者、播音系学生、语言康复师甚至戏曲演… · 2026/9/24 0:00:44

了解更多?预约专属演示

我们的顾问将为您一对一讲解产品与方案

企业微信二维码