人工智能大模型模型推理服务推理引擎本地部署模型量化【免费下载链接】lmdeployLMDeploy is a toolkit for compressing, deploying, and serving LLMs.项目地址https://gitcode.com/gh_mirrors/lm/lmdeploy点击查看免费下载LMDeploy 是面向大型语言模型LLM与视觉-语言模型VLM的全套轻量化、部署和服务解决方案由 MMDeploy 与 MMRazor 团队联合开发。本文以仓库 README_zh-CN.md 为主线结合源码与官方文档系统讲解其 TurboMind/PyTorch 双引擎架构、AWQ 与 KV Cache 量化、离线推理 pipeline 以及 OpenAI 兼容服务等核心能力帮助你从安装到部署完成一次完整的落地实践。LMDeploy 是什么一个覆盖压缩—部署—服务全链路的工具箱LMDeploy 不是一个单纯的推理加速库而是涵盖了 LLM 任务全流程的解决方案。根据 README_zh-CN.md 的定位它提供四大核心能力高效的推理实现了 Persistent Batch即 Continuous Batch、Blocked K/V Cache、动态拆分与融合、张量并行以及高效计算 kernel 等特性官方文档声称推理性能可达 vLLM 的 1.8 倍该数据为 README 自述可作为项目官方口径参考。可靠的量化支持权重量化和 K/V 量化4bit 模型推理效率是 FP16 下的 2.4 倍量化模型可靠性已通过 OpenCompass 评测验证。便捷的服务通过请求分发服务proxy支持多模型在多机、多卡上统一对外提供推理服务。卓越的兼容性支持 KV Cache 量化、AWQ 权重量化 与 Automatic Prefix Caching 同时使用。从仓库结构看核心实现分布在lmdeploy/包内Python 侧的 pipeline 入口定义在 lmdeploy/api.py引擎配置TurbomindEngineConfig、PytorchEngineConfig与采样配置GenerationConfig定义在 lmdeploy/messages.py高性能 C/CUDA 引擎 TurboMind 位于src/turbomind/包含 comm、core、engine、kernels、models 等模块纯 Python 引擎位于lmdeploy/pytorch/。CLI 工具lmdeploy serve、lmdeploy lite、lmdeploy chat的入口定义在 lmdeploy/cli/。双推理引擎架构TurboMind 与 PyTorch 如何分工README 明确指出 LMDeploy 支持两种推理引擎TurboMind 与 PyTorch两者侧重不同TurboMind基于 NVIDIA FasterTransformer 研发的高性能引擎追求推理性能的极致优化。其核心机制包括Persistent Batch持续批处理将对话式 LLM 的推理建模为一个生命周期跨越整个服务过程的持续运行 batch。系统预先准备 N 个 batch slots请求在有空闲 slot 时加入当请求 token 生成完毕slot 立即释放以接收新请求命中缓存时历史 token 无需每轮解码token 生成即刻开始整个 batch 自动扩缩容避免无效计算。KV 缓存管理器一个带 LRU 实现的内存池可视为KV 缓存的缓存。KV 由管理器按 slot 预分配或按需分配缓存池满时按 LRU 踢除最久未使用的 sequence被踢除的 sequence 会转换为 token IDs 的简洁形式再次出现时由 FMHA context decoder 重新解码回 KV 缓存因此对用户而言系统像是可以访问无限的设备内存。LLaMa 实现改进用基于 cutlass 的 FMHA 替代 context decoder 中的注意力实现以支持 Q/K 长度不匹配在 context/generation FMHA 中加入间接缓冲指针支持不连续 KV 缓存设计新同步机制协调张量并行下的工作线程实现 INT8 KV cache 降低内存开销解决单进程多模型实例 TP 模式下 NCCL 卡死问题。TurboMind 相较 FasterTransformer 也做了减法去掉了前缀提示词、beam search、上下文 embedding、稀疏 GEMM 及 GPT/T5 结构模型支持。PyTorch 引擎纯 Python 开发以较小的性能开销为代价提供更易开发扩展的实现主要用于降低开发门槛、快速实验新特性。其核心组件包括 Scheduler采用类似 vLLM 的 paging 策略按 page block 分配 KV并支持 S-LoRA 多 adapter 动态换入、ModelAgent封装模型加载、TP 管理与 cache 管理、RequestManager请求收发。特性上支持 Continuous Batching、Tensor Parallelism、S-LoRA 与 w8a8 量化。从源码结构看src/turbomind/下大量 C/CUDA 源码312 个 kernel 文件印证了 TurboMind 的深度优化而lmdeploy/pytorch/下 engine、strategies、models 等目录体现了 Python 引擎的模块化设计。两个引擎在支持的模型类别、计算精度方面有差异具体能力矩阵可查阅 supported_models.md。支持的模型矩阵LLM 与 VLM 一览README 中的支持模型表格覆盖了大量主流开源模型具体支持状态以 supported_models.md 为准LLM 类Llama7B–65B、Llama2/3/3.1/3.2、InternLM2/2.5/3、Qwen1.5/2/2.5/3 及 MoE 变体、Qwen3-Next、Code Llama、ChatGLM2、GLM-4/4-0414、CodeGeeX4、YI、Mistral、DeepSeek-MoE/V2/V2.5/V3/V3.2/V4、Mixtral、Gemma、Phi-3/3.5/4-mini、MiniCPM3、SDAR、gpt-oss、GLM-4.7-Flash、GLM-5/5.2 等。VLM 类LLaVA1.5/1.6、Qwen2-VL/2.5-VL/3-VL/3-Omni、Kimi-K2.6、DeepSeek-VL/VL2、InternVL-Chatv1.1–v1.5、InternVL2/2.5(MPO)/3/3.5、Intern-S1 系列、ChemVLM、CogVLM/CogVLM2、MiniCPM 系列、Phi-3-vision、GLM-4V、Molmo、Gemma3、Llama4 等。结合 supported_models.md 的细节两个引擎的能力边界值得注意TurboMind 在 CUDA 平台下支持大多数模型的 FP16/BF16、KV INT8、KV INT4 与 W4A16但存在限制不支持 window attentionMistral、Qwen1.5 需选 PyTorch 引擎当 head_dim 非 128 时如 llama3.2-1B、qwen2-0.5B、internvl2-1B不支持 KV cache 4/8bit 量化暂不支持 Qwen3.5 系列视觉编码器。PyTorch 引擎在 CUDA 下同样支持丰富模型并额外支持 W8A8自 0.6.4 起移除了 llava 原始格式支持建议使用 transformers 格式自 0.11.1 起移除了 mllama 支持。PyTorch 引擎还覆盖了昇腾Atlas 800T A2/A3、Atlas 300I Duo、Maca C500、寒武纪等非 CUDA 平台对应文档见 ascend 快速开始。快速开始安装与首个离线推理安装推荐 conda pipREADME 建议在干净的 conda 环境Python 3.10–3.13中安装conda create -n lmdeploy python3.12 -y conda activate lmdeploy pip install lmdeploy需要说明的版本前提自 v0.13.0 起PyPI 上默认预编译 wheel 基于 CUDA 12.8 构建一般用户含 GeForce RTX 50 系列直接使用上述命令即可。若需从源码安装要求 CUDA Toolkit 12.0、CMake 3.25.2、支持 C20 的编译器或构建 ROCm/昇腾等目标版本请参考 installation.md。离线批处理三行代码跑通 LLM 推理import lmdeploy with lmdeploy.pipeline(internlm/internlm3-8b-instruct) as pipe: response pipe([Hi, pls intro yourself, Shanghai is]) print(response)pipeline 入口定义在 lmdeploy/api.py它会根据模型与两个引擎的能力自动选择后端默认优先 TurboMind。模型默认从 HuggingFace 下载如需改用 ModelScope 或 openMind Hub需先安装对应 SDK 并设置环境变量export LMDEPLOY_USE_MODELSCOPETrue # 使用 ModelScope 下载 export LMDEPLOY_USE_OPENMIND_HUBTrue # 使用 openMind Hub 下载关于 pipeline 的更多推理参数多卡并行、采样、流式输出、logits/hidden_states 获取、ppl 计算、LoRA 等可阅读 LLM 推理 pipeline 文档 与 VLM 推理 pipeline 文档。VLM 场景只需用lmdeploy.vl.load_image加载图片以(prompt, image)元组传入from lmdeploy import pipeline from lmdeploy.vl import load_image pipe pipeline(OpenGVLab/InternVL2-8B) image load_image(https://.../tiger.jpeg) response pipe((describe this image, image)) print(response)引擎参数与采样参数手动指定引擎时可通过backend_config传入引擎配置例如快速开始文档中的典型用法from lmdeploy import pipeline, TurbomindEngineConfig, PytorchEngineConfig # 使用 TurboMind 引擎 pipe pipeline(internlm/internlm2_5-7b-chat, backend_configTurbomindEngineConfig( max_batch_size32, enable_prefix_cachingTrue, cache_max_entry_count0.8, session_len8192, )) # 或使用 PyTorch 引擎参数一致 pipe pipeline(internlm/internlm2_5-7b-chat, backend_configPytorchEngineConfig( max_batch_size32, enable_prefix_cachingTrue, cache_max_entry_count0.8, session_len8192, ))其中cache_max_entry_count显著影响 GPU 内存占用它表示加载模型权重后 K/V 缓存占用的空闲 GPU 内存比例默认 0.8且 K/V 缓存一次性申请、重复使用因此 pipeline 与 api_server 启动后会消耗大量显存遇到 OOM 时应降低该值。采样参数通过GenerationConfig设置top_k1或temperature0.0表示贪心搜索from lmdeploy import GenerationConfig, pipeline response pipe(prompts, gen_configGenerationConfig( max_new_tokens1024, top_p0.8, top_k40, temperature0.6 ))模型服务一键启动 OpenAI 兼容的 api_server启动方式与 README 快速开始对应单条命令即可在本地 23333 端口启动兼容 OpenAI 接口的推理服务lmdeploy serve api_server internlm/internlm2_5-7b-chat常用选项包括--server-port指定端口、--tp设置张量并行、--session-len设置最大上下文长度、--cache-max-entry-count调整 K/V cache 内存占比完整参数可通过lmdeploy serve api_server --help查看。CLI 的实现在 lmdeploy/cli/serve.py。更多部署形态Docker、Kubernetes、多机多卡 proxy 分发见 api_server 文档 与 proxy_server 文档仓库根目录也提供了 Kubernetes 部署所需的 k8s/deployment.yaml 与 k8s/service.yaml。接口使用服务兼容 OpenAI 的/v1/chat/completions、/v1/models、/v1/completions三个接口启动后可在浏览器打开http://0.0.0.0:23333通过 Swagger UI 在线查看与体验。使用官方 openai 包访问from openai import OpenAI client OpenAI( api_keyYOUR_API_KEY, base_urlhttp://0.0.0.0:23333/v1 ) model_name client.models.list().data[0].id response client.chat.completions.create( modelmodel_name, messages[ {role: system, content: You are a helpful assistant.}, {role: user, content: provide three suggestions about time management}, ], temperature0.8, top_p0.8 ) print(response)此外还支持通过lmdeploy.serve.openai.api_client.APIClient直接调用实现位于 lmdeploy/serve/openai/api_client.py、Anthropic 兼容接口api_server_anthropic.md、OpenAI Responses 兼容接口api_server_responses.md、工具调用api_server_tools.md、以及用--backend pytorch --logprobs-mode raw_logprobs启动后通过/generate接口计算输入 token logprob 等高级能力。使用 cURL 也能直接验证服务例如curl http://{server_ip}:{server_port}/v1/chat/completions \ -H Content-Type: application/json \ -d { model: intern-s2-preview, messages: [{role: user, content: Hello! How are you?}] }VLM 服务启动方式相同lmdeploy serve api_server OpenGVLab/InternVL2-8B随后可像访问gpt-4v一样以image_url形式传入图片详见 VLM 推理服务文档。命令行聊天与环境检查LMDeploy 还提供本地对话 CLI用于快速验证模型是否受支持、对话模板是否正确应用以及推理结果是否正确lmdeploy chat internlm/internlm2_5-7b-chat --backend turbomind提交 issue 前可运行lmdeploy check_env收集环境信息便于问题诊断。量化实践AWQ 权重量化与 KV Cache 量化W4A16AWQ 4bit 权重量化TurboMind 引擎支持 AWQ 与 GPTQ 两种方法量化的 4bit 模型推理LMDeploy 量化模块目前支持 AWQ 算法可用显卡覆盖 sm70V100至 sm8940 系列。一条命令完成量化详见 w4a16.mdexport HF_MODELinternlm/internlm2_5-7b-chat export WORK_DIRinternlm/internlm2_5-7b-chat-4bit lmdeploy lite auto_awq \ $HF_MODEL \ --calib-dataset wikitext2 \ --calib-samples 128 \ --calib-seqlen 2048 \ --w-bits 4 \ --w-group-size 128 \ --batch-size 1 \ --work-dir $WORK_DIR大多数参数可省略使用默认值--work-dir建议带上模型名这样推理时无需额外指定对话模板推理接口会按模糊匹配选择近似模板。若量化精度有损可开启--search-scale并调大--batch-size如 8。量化后即可直接推理from lmdeploy import pipeline, TurbomindEngineConfig engine_config TurbomindEngineConfig(model_formatawq) pipe pipeline(./internlm2_5-7b-chat-4bit, backend_configengine_config) response pipe([Hi, pls intro yourself, Shanghai is]) print(response)也可直接推理 HuggingFace Hub 上已 AWQ 量化的 4bit 权重并以--model-format awq启动服务。该能力的最新进展还包括基于 vllm-project/llm-compressor 的 4bit 对称/非对称量化操作指南见 llm_compressor.md。KV Cache 量化quant_policy 一键开启自 v0.4.0 起LMDeploy 支持在线 KV cache int4/int8 量化per-head per-token 非对称量化int4/int8 相比 fp16 可使 KV block 数量分别增至 4 倍与 2 倍从而提升并发与吞吐。其优势包括不需要校准数据集、支持 sm70 及以上全部显卡、int8 精度几乎无损、llama2-7b 上 RPS 较 fp16 提升近 30%int8/40%int4。详见 kv_quant.md。LMDeploy 规定quant_policy4表示 kv int4 量化quant_policy8表示 kv int8 量化quant_policy42表示 TurboQuant 量化。离线推理与服务示例from lmdeploy import pipeline, TurbomindEngineConfig engine_config TurbomindEngineConfig(quant_policy8) pipe pipeline(internlm/internlm2_5-7b-chat, backend_configengine_config) response pipe([Hi, pls intro yourself, Shanghai is]) print(response)lmdeploy serve api_server internlm/internlm2_5-7b-chat --quant-policy 8此外KV 量化还引入了基于 TurboQuant 技术的方案quant_policy42K 路径 QJL4 V 路径 MSE int2平均约 3bit 压缩仅支持 PyTorchEngine、不支持 MLA 结构与推测解码、要求 head_dim 为 2 的幂通过pip install fast_hadamard_transform可获得更好性能。kv_quant.md 中还附带了多模型在 ceval、mmlu、gsm8k 等基准上的精度对比表与 RPS 效率对比表评测脚本可参考 benchmark/profile_throughput.py。性能数据与验证方式README 与文档中的性能口径整理如下均来自官方文档与评测记录部署环境不同结果会有差异引擎吞吐TurboMind 引擎在各种规模模型上每秒处理请求数是 vLLM 的 1.36~1.85 倍README 声称。4bit 推理小 batch 下 4bit 模型推理速度可达 FP16/BF16 的 2.4 倍README 声称RTX 4090 上 batch size1、(1,512) 测试中Llama-2-7B-chat 的 turbomind 4bit 生成速度为 206.4 tokens/s见 w4a16.md。KV 量化效率llama2-chat-7b 在 tp1/ratio 0.8/bs 256 配置下kv fp16/int8/int4 的 RPS 分别为 14.98/19.01/20.81见 kv_quant.md。仓库提供了可复现的压测工具benchmark_throughput.py、benchmark_serving.py、benchmark_decode.py 等以及 profile_throughput.py 等性能剖析脚本自动化回归用例位于 autotest/benchmark/。量化模型的精度验证可参考 evaluate_with_opencompass.md。用户教程地图与进阶指南README 将文档体系划分为用户指南与进阶指南两部分对应仓库 docs/zh_cn/ 下的完整目录用户指南快速上手、LLM 推理 pipeline、VLM 推理 pipeline、LLM 推理服务、VLM 推理服务、模型量化。进阶指南推理引擎 TurboMind、推理引擎 PyTorch、自定义对话模板、支持新模型、gemm tuning、长文本推理、多模型推理服务。仓库还包含丰富的可参考资源配置模板与测试用例位于 autotest/configs/覆盖 Qwen3 系列、InternVL3 系列、DeepSeek 系列等模型的 YAML 配置、tests/test_lmdeploy/ 与 tests/pytorch/ 下的单元测试、以及 benchmark/lmdeploy.yml 压测配置可作为二次开发与验证的起点。社区、贡献与开源协议LMDeploy 社区有基于 Jetson 板卡的部署项目LMDeploy-Jetson与基于 BentoML 的部署示例BentoLMDeploy等周边项目贡献者指引见仓库 .github/CONTRIBUTING.md。项目采用 Apache 2.0 开源许可证并在文档中提供了两篇可引用的 BibTeXLMDeploy 工具包论文与 TurboMind 混合精度推理论文。安装与使用方式遵循本文前述步骤仓库本身为只读源码仅用于查看与本地构建。赞分享人工智能大模型模型推理服务推理引擎本地部署模型量化【免费下载链接】lmdeployLMDeploy is a toolkit for compressing, deploying, and serving LLMs.项目地址https://gitcode.com/gh_mirrors/lm/lmdeploy点击查看免费下载相关推荐ConvertX 文件转换历史怎么导出成 CSV3 步备份到 ExcelConvertX 文件转换历史怎么导出成 CSV3 步备份到 Excel ConvertX 是一款自托管的在线文件转换器支持 1000 多种格式互转。你做的后端前端音视频基于 vLLM 部署 GLM-4.7-Flash离线推理、OpenAI 兼容 API 服务与工具调用实战基于 vLLM 部署 GLM 4.7 Flash离线推理、OpenAI 兼容 API 服务与工具调用实战 本篇指南以 Datawhale《开源大模型食用指南》大模型人工智能教程本地部署微调Soup 推理服务与模型导出完全指南从 LoRA 合并、GGUF 导出到 OpenAI 兼容服务端部署Soup 推理服务与模型导出完全指南从 LoRA 合并、GGUF 导出到 OpenAI 兼容服务端部署 本篇技术指南围绕 Soup 的 serving and人工智能大模型微调LoRACLI上一篇aws-inventory实战指南10分钟上手AWS资源发现与分析下一篇用PiggyMetrics可视化Hystrix熔断器状态机延迟加压实验观察Closed到Open全过程创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
企业数字化 ERP 产品动态
相关推荐
TypeScript与ES6实战笔记:从深拷贝、Map到类型系统与工程化避坑 1. 从“自用”到“贴出来”:这本笔记记录的起点先说个实话:我电脑里躺着十几份命名格式是“XX学习笔记(自用)”的文档,有的写着写着就烂尾了,有的纯粹变成了一个收藏夹搬运工,真正派上用场的少。… · 2026/9/26 7:26:53
SpringBoot+Vue学生干部管理系统毕设完整设计与实现解析 每到毕业季,总有一批人被毕设项目搞得焦头烂额,尤其是 Java Web 方向的学生干部管理系统这类题目,看起来平平无奇,真动手写代码才发现,从需求到数据库、从后端接口到前端页面,每一层都有坑。这套 SpringBoo… · 2026/9/26 7:26:53
STM32F407 启动文件:从上电复位到 main() 平时编写 STM32 程序,通常从 main() 开始。但芯片上电后,需要先设置栈指针、找到程序入口、配置系统时钟,并准备好 C 程序的运行环境,才能执行 main()。本文以 STM32F407、Keil MDK 和标准外设库工程为例,整理启动文件… · 2026/9/26 7:26:53
TensorSharp 支持 Jev 模式了:一次去噪,直接读出决策 目录
先说 Jev 是什么
TensorSharp 里是怎么落地的
怎么调
HTTP
原生 .NET
接口能干什么
为什么快 4–5 倍
哪些事它明确不做
相关链接 2026年9月22日 vLLM 合并了 PR #57250,给 DiffusionGemma 加了一种 Jev 风格的结构化读取模式。我们跟得很快ÿ… · 2026/9/26 7:58:13
2026梦幻防红系统源码解析:抖音圆码跳转拦截与域名轮换实战 简介:这是一套面向社群运营、私域推广及小程序开发者的防红跳转系统源码,针对链接易被平台拦截、域名频繁被封的痛点,提供多域名池智能切换方案,官方宣称防拦截率可达99%以上。资源包共152个文件,约21.72MB,… · 2026/9/26 7:58:13
windows下git使用教程1(安装与使用) git版本:2.53.0.2
1.什么是git
Git 是一款开源的分布式版本控制系统,由 Linus Torvalds 于 2005 年开发,核心作用是追踪文件(尤其是代码)的修改历史、管理多人协作开发流程,确保代码版本可追溯、可回滚&a… · 2026/9/26 7:58:07
金融科技落地实践:支付系统、反欺诈与监管合规架构设计 三年前我第一次进金融项目现场的时候,甲方问我的第一句话是:“你的方案能不能保证每一分钱都对得上?”我当时觉得这是个简单问题,后来才知道,这是金融服务行业所有技术决策的起点。这些年我一直在做金融服务相关系统的… · 2026/9/26 7:58:07
Ince-Gaussian光束生成涡旋阵列:VirtualLab Fusion仿真全解析 之前一直在VirtualLab Fusion里折腾结构光束仿真,总想着用现成的拉盖尔-高斯或厄米-高斯模式拼出涡旋阵列,结果不是对称性不理想,就是阵列排布太“正”,调参调到怀疑人生。后来换到Ince-Gaussian这一类解系,才意识到自… · 2026/9/26 7:58:01
数据库课后习题答案别硬背:当测试用例集刷,效率翻倍 简介:万常选版《数据库原理与设计》课后习题答案资源,覆盖第2至6章及第9章,适合正在学习关系模型、数据库建模、关系数据理论与模式求精的本科生、自学者作为复习与自测材料。压缩包共7个文件,含3个doc参考答案、2个sql示例脚本、… · 2026/9/26 0:00:21
OpenClaw 替代品?Hermes Agent 踩坑实录:macOS 飞书接入 TaoToken 配置 /* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/26 0:00:40
向下兼容与向上兼容:接口设计中的兼容性策略与工程实践 一次版本升级事故,是很多团队绕不过去的坎。线上环境里,服务端明明已经上线了新版接口,老的移动端还在照着旧文档传参数。请求一到网关,校验直接拒绝,用户操作失败,客服群炸了锅,开发群里开始互… · 2026/9/26 0:00:46