首页/新闻资讯/正文详情

Unified Cache Manager(UCM)SGLang集成指南:3步开启跨请求KV Cache持久化共享

发布时间:2026/9/25 4:06:48 来源:云帆数科 栏目:资讯中心
Unified Cache Manager(UCM)SGLang集成指南:3步开启跨请求KV Cache持久化共享
Unified Cache ManagerUCMSGLang集成指南3步开启跨请求KV Cache持久化共享【免费下载链接】unified-cache-managementUnified Cache Manager推理记忆数据管理器是一款以KV Cache为中心的推理加速套件其融合了多类型缓存加速算法工具分级管理并持久化推理过程中产生的KV Cache记忆数据扩大推理上下文窗口以实现高吞吐、低时延的推理体验降低每Token推理成本。项目地址: https://gitcode.com/ModelEngine/unified-cache-managementUnified Cache ManagerUCM推理记忆数据管理器是一款以KV Cache为中心的推理加速套件能够将推理过程中产生的 KV Cache 记忆数据分级持久化存储并通过检索复用替代重复计算。本指南带你3 步完成 UCM 与 SGLang 的集成开启跨请求、跨实例的 KV Cache 持久化共享让多轮对话与长上下文推理显著提速降低每 Token 推理成本。传统部署中每个 SGLang 推理实例各自持有一份独立的 KV Cache图中左侧的 Decentralized KVCache相同前缀的请求到了不同实例就要重新计算而接入 UCM 后KV Cache 被统一写入集中式存储图中右侧的 Centralized KVCache任意实例都能命中历史缓存这正是跨请求 KV Cache 持久化共享的价值所在。一、UCM 是什么为什么适合 SGLangUCM 采用分层架构向上通过 Integration 层以插件形式对接 vLLM、SGLang、MindIE 等推理引擎向下通过 Store 层适配多种存储后端中间提供 Prefill/Decode 加速能力如 Prefix Cache、稀疏注意力等。对 SGLang 而言UCM 的价值可以概括为三点持久化共享KV Cache 落盘到集中存储实例重启、扩容后历史缓存不丢失零拷贝读写基于 HiCache 的batch_get_v1/batch_set_v1零拷贝接口降低存储 I/O 开销免改代码无需修改 SGLang 业务代码通过配置项即可启用。二、集成原理UCM 如何接入 SGLang 的 HiCacheUCM 通过实现 SGLang HiCache 的L3 存储后端接口来接入适配补丁 sglang-adapt.patch 向 SGLang 的StorageBackendFactory注册unifiedcache后端并启用零拷贝的page_get/page_set路径Python 侧由 unifiedcache_store.py 中的UnifiedCacheStore类承载读/写请求ucm_connector.py 中的SglangUcmConnector负责把 SGLang 的 Host KV Pool 映射为 UCM 存储配置自动计算page_size、block_size、device_id等参数最终落到UcmPipelineStore存储管线见上图架构。 前置要求SGLang v0.5.9CUDA 平台。三、3 步开启跨请求 KV Cache 持久化共享Step 1安装 UCM三选一推荐 Docker方式 A官方预构建镜像最快docker pull unifiedcachemanager/ucm-sglang:latest docker run --rm --gpus all --networkhost --ipchost \ -v path_to_your_models:/home/model \ -v path_to_your_storage:/home/storage \ --name name_of_your_container \ -it unifiedcachemanager/ucm-sglang:latest--ipchost用于保证共享内存足够大不可省略。方式 B从源码构建镜像git clone --depth 1 --branch branch_or_tag_name https://gitcode.com/ModelEngine/unified-cache-management cd unified-cache-management docker build -t ucm-sglang:latest -f ./docker/Dockerfile.ucm-sglang-cuda-v0.5.5 ./Dockerfile 会自动调用 build_sglang.sh 编译 wheel、安装依赖并应用 SGLang 集成补丁。方式 Cpip 安装在 SGLang 官方镜像环境内执行export PLATFORMcuda pip install uc-managerStep 2配置 KV Cache 持久化共享核心配置UCM 配置以 JSON 格式通过--hicache-storage-backend-extra-config传入 SGLangHICACHE_CONFIG{ backend_name:unifiedcache, module_path:ucm.integration.sglang.unifiedcache_store, class_name:UnifiedCacheStore, interface_v1:1, kv_connector_extra_config:{ ucm_connector_name:UcmPipelineStore, ucm_connector_config:{ storage_backends:/mnt/test } } }⚠️ 请把/mnt/test替换为你的实际存储目录多个目录可用冒号分隔。也可以将上述kv_connector_extra_config写入 YAML 文件并通过环境变量UNIFIEDCACHE_CONFIG_FILE指定免去每次拼 JSON 的麻烦。Step 3启动推理服务验证缓存命中启动 OpenAI 兼容在线服务python3 -m sglang.launch_server \ --model-path your_model_path \ --tensor-parallel-size 2 \ --page-size 128 \ --port 7800 \ --trust-remote-code \ --enable-hierarchical-cache \ --hicache-mem-layout page_first \ --hicache-write-policy write_through \ --hicache-storage-backend dynamic \ --hicache-storage-prefetch-policy wait_complete \ --hicache-storage-backend-extra-config $HICACHE_CONFIG看到Application startup complete.日志即启动成功随后可直接调用 APIcurl http://localhost:7800/v1/completions \ -H Content-Type: application/json \ -d {model: your_model_path, prompt: Hello!, max_tokens: 64, temperature: 0}离线批量推理同样的分层缓存参数也可直接传给 SGLang 的offline_batch_inference.py示例脚本无需任何 UCM 专属代码改动。四、关键参数速查与常见问题参数作用建议值--enable-hierarchical-cache开启 SGLang 分层缓存HiCache必选--hicache-mem-layoutHost 内存池布局page_firstUCM 强制要求--hicache-write-policy缓存写策略write_through--hicache-storage-backend存储后端类型dynamic动态加载 UCM 插件storage_backendsKV Cache 持久化目录建议指向高速盘或共享存储常见问题报错 requires --hicache-mem-layout page_firstUnifiedCacheStore仅支持 page_first 布局请检查启动参数。缓存不生效确认backend_name为unifiedcache、module_path拼写正确且 SGLang 版本已应用适配补丁。需要更大的 KV Cache 容量可参考项目内 KV Cache 容量计算器评估显存/内存需求。五、总结通过安装 → 配置 → 启动三步你已在 SGLang 上开启了由Unified Cache ManagerUCM驱动的跨请求 KV Cache 持久化共享相同前缀的重复请求将被集中存储命中重复 Prefill 计算被显著减少吞吐与时延表现随之改善。更多细节可查阅官方文档SGLang 快速上手quickstart_sglang.mdSGLang 集成源码ucm/integration/sglang/前缀缓存最佳实践user-guide/prefix-cache/支持矩阵support_matrix.md【免费下载链接】unified-cache-managementUnified Cache Manager推理记忆数据管理器是一款以KV Cache为中心的推理加速套件其融合了多类型缓存加速算法工具分级管理并持久化推理过程中产生的KV Cache记忆数据扩大推理上下文窗口以实现高吞吐、低时延的推理体验降低每Token推理成本。项目地址: https://gitcode.com/ModelEngine/unified-cache-management创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

相关推荐

DeepSeek Harness 小白入门 10:环境变量全解——Key、Base URL、Model 到底该放哪,TaoToken 统一通道怎么配
DeepSeek Harness 小白入门 10:环境变量全解——Key、Base URL、Model 到底该放哪,TaoToken 统一通道怎么配

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/25 4:06:48

荣耀Magic9首发Qwen Intelligence:端侧Agent部署与记忆体系实践
荣耀Magic9首发Qwen Intelligence:端侧Agent部署与记忆体系实践

1. 荣耀 Magic9 系列首发搭载 Qwen Intelligence 背后的技术逻辑9 月 28 日这个时间节点,荣耀 Magic9 系列要首发搭载阿里 Qwen Intelligence,这条消息在圈子里传开之后,我第一反应不是去看硬件参数,而是去琢磨“首发搭载”这四个… · 2026/9/25 4:06:41

WIFI大师小程序独立版源码:下载到能用隔着工程化习惯
WIFI大师小程序独立版源码:下载到能用隔着工程化习惯

简介:这是一款面向本地共享wifi商业场景的微信小程序独立版源码,适合创业者、小程序开发者及平台运营者用作快速搭建或二次开发基础。项目围绕团长管理、拓展员推广、商家入驻和用户扫码联网等核心链路设计,覆盖完整的前后端逻辑和运营后台&a… · 2026/9/25 4:06:41

ESP32-C5深度解析:首款RISC-V双频Wi-Fi 6嵌入式SoC
ESP32-C5深度解析:首款RISC-V双频Wi-Fi 6嵌入式SoC

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/25 4:40:18

拼团交易平台系统第2-15节:根据UI展示封装接口 —— 从 DeepSeek 拼团页面到服务端接口的落地设计
拼团交易平台系统第2-15节:根据UI展示封装接口 —— 从 DeepSeek 拼团页面到服务端接口的落地设计

文档教程后端 【免费下载链接】CodeGuide :books: 本代码库是作者小傅哥多年从事一线互联网 Java 开发的学习历程技术汇总,旨在为大家提供一个清晰详细的学习教程,侧重点更倾向编写Java核心内容。如果本仓库能为您提供帮助,请给予支持(关注、… · 2026/9/25 4:40:18

STM32学习避坑指南:寄存器开发、真实项目与工程能力构建
STM32学习避坑指南:寄存器开发、真实项目与工程能力构建

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/25 4:40:18

ESP32上WASM为何无法直接访问硬件:沙箱隔离与桥接方案
ESP32上WASM为何无法直接访问硬件:沙箱隔离与桥接方案

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/25 4:40:18

魔百盒CM211-1 CH刷Armbian:从吃灰盒子到低功耗Linux服务器
魔百盒CM211-1 CH刷Armbian:从吃灰盒子到低功耗Linux服务器

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/25 4:40:18

企业形象设计服务哪家正规,台州上艺品牌推广实力与用户口碑
企业形象设计服务哪家正规,台州上艺品牌推广实力与用户口碑

台州上艺品牌推广有限公司自2009年成立以来,深耕品牌视觉识别系统服务领域,专注为台州及周边工贸企业、外贸实体企业提供完整的品牌视觉体系搭建方案,业务涵盖品牌标志优化、标准字体规范、标准色彩设定、辅助图形设计、应用导视系统搭建、宣… · 2026/9/25 4:40:12

数值优化(Numerical Optimization)学习系列-03-共轭梯度方法(Conjugate Gradient)
数值优化(Numerical Optimization)学习系列-03-共轭梯度方法(Conjugate Gradient)

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/25 1:00:31

创维E900V22D刷机全攻略:S905L3SB芯片兼容性解析与救砖实战
创维E900V22D刷机全攻略:S905L3SB芯片兼容性解析与救砖实战

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/25 1:00:31

MQTT协议原理与Broker服务器搭建实战:从Mosquitto到EMQX
MQTT协议原理与Broker服务器搭建实战:从Mosquitto到EMQX

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/25 1:00:37

了解更多?预约专属演示

我们的顾问将为您一对一讲解产品与方案

企业微信二维码