首页/新闻资讯/正文详情

9.24【A】

发布时间:2026/9/27 22:32:49 来源:云帆数科 栏目:资讯中心
9.24【A】
磐久UMXUALink下一代AliSCMGPU直连的PCM内存池PCMPCM是Phase-Change Memory相变内存。它用一种特殊材料在两种状态间切换来存数据结晶态和非晶态的电阻不同控制器读取电阻就能判断存的是 0 还是 1。写入时会用电加热改变材料状态断电后状态仍能保持所以它是非易失性内存。(st.com)放回这篇文章的语境里PCM 是AliSCM 背后的存储介质目标是承接 HBM 放不下、但又不适合放到较慢 SSD 上的温 KV Cache。它不是比 HBM 更快而是希望以较大的容量和较低的成本补上 HBM 与 SSD 之间的一层。GPU先抓住一点**GPU 平时并不是每做一步计算都要 CPU 帮忙搬数据。**CPU主要负责调度、启动任务、准备数据真正运行模型计算时GPU主要从自己的 HBM 里读写数据。文章讨论的是HBM 不够放时GPU怎么高效使用外面的内存。HBM是High Bandwidth Memory高带宽内存它描述的是一种强调高带宽的内存类型。HBM芯片架构**很多用于 AI 和 HPC 的独立 GPU 加速卡有自己的 HBM。**这里“自己的”是说 HBM 通常紧挨着 GPU集成在同一个封装里专门给 GPU 高速读写。例如 AMD Instinct MI300X 配有 192GB HBM3。(amd.com)不过不是所有 GPU 都用 HBM一些显卡用 GDDR集成显卡则可能直接使用 CPU 所用的系统内存。普通 CPU 通常使用 DDR 内存比如主板上的 DDR DIMM并不通常配 HBM。但确实有少数例外Intel Xeon CPU Max 系列集成了 HBMAMD MI300A 则把 CPU 和 GPU 芯片放在同一封装里共享 HBM。(intel.com)所以前面文章里说的“GPU 的 HBM”就是 GPU 身边那一层高速但容量有限的内存。文章想讨论的是HBM不够放时能不能让 GPU 通过互联访问外部更大、更便宜的内存。原本流程原本怎么跑以大模型推理为例流程大致是CPU接收请求、准备输入并安排 GPU 执行。模型权重通常提前放进 GPU 的 HBM。GPU处理输入提示词prefill计算各层结果并把后续生成会用到的KV Cache写入 HBM。每生成一个新 tokenGPU都要读取之前的 KV Cache 来计算再把新 token 对应的 KV 追加进去。对话越长、同时处理的请求越多KV Cache 通常就越大。HBM装不下时系统可能减少并发或上下文长度也可能把部分 KV 移到 CPU 内存、远端内存或 SSD之后需要时再取回来。这样的分层缓存和卸载在现有推理软件中已经存在。(developer.nvidia.com)可以把它想成GPU的 HBM 是工作台KV Cache 是不断堆上来的工作材料。工作台满了就得把暂时不用的材料搬到别处但材料搬远了再取回来就要花时间。问题文章认为卡在哪里它盯着的核心问题是HBM 的容量和成本KV Cache 越来越大但不能简单地把所有数据都放进高成本的 HBM。外部存储各有取舍CPU DRAM、远端内存或 SSD 能提供额外容量但数据需要经过相应的链路和设备越慢的层越不适合频繁访问。文章希望找到一层比 HBM 容量大、比 SSD 更适合频繁读写、又能让 GPU较直接访问的内存。要注意文章把 CXL 概括为“CPU的协议、GPU不能原生用”这是为了突出新路线而做的简化。实际系统能否让 GPU访问某类外部内存要看整个平台的硬件和软件支持不能只看协议名称。UALink的特点是提供 GPU/加速器之间的 load/store/atomic 内存访问语义它并不意味着任何 GPU、PCM 设备接上去就能直接工作。(ualinkconsortium.org)文章想法文章想怎么解决它提出把内存按热度分层活跃、马上要算的 KV 留在 GPU HBM。暂时不活跃、之后可能复用的温 KV 放到 AliSCM 的 PCM。更冷的数据再放到 SSD。同时设想让 GPU经由UALink Switch访问外部 PCMGPU → UALink 交换网络 → 内存端点/控制器 → PCM这样做的目标是让外部内存成为 GPU更容易访问的“扩展内存层”减少数据为了访问外部容量而绕行或反复搬运的成本。UALink相关资料描述了这种 load/store/atomic 访问方式也说明跨加速器的数据一致性需要软件协同处理。(ualinkconsortium.org)所以它要解决的不是“GPU算得不够快”而是GPU显存装不下越来越多的 KV Cache用 HBM 承载所有 KV 的成本太高下沉到更慢的内存或存储后访问和搬运可能拖慢推理希望增加可用容量同时尽量保持 GPU访问路径短、成本可控。它不打算用 PCM 替代 HBM而是让 HBM 继续放最热的数据PCM 接住一部分温数据。PCM 仍然比 HBM 慢文章提出的效果也有待具体产品和实测验证特别是 GPU到 PCM 的真实端到端延迟、带宽和软件管理方式不能仅凭架构示意图判断。

相关推荐

同时跑多个 Claude Code / Codex 后,真正的瓶颈不是模型,而是“阻塞”:用 TaoToken 统一 Key 打通 CLI 并发
同时跑多个 Claude Code / Codex 后,真正的瓶颈不是模型,而是“阻塞”:用 TaoToken 统一 Key 打通 CLI 并发

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/27 22:32:43

基于MCP协议的招聘推荐系统架构设计与实践:TaoToken统一Key接入配置与验证
基于MCP协议的招聘推荐系统架构设计与实践:TaoToken统一Key接入配置与验证

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/27 22:32:43

OpenClaw 报错 Local media path is not under an allowed directory:workspace 白名单与 handler.js 读取路径排查
OpenClaw 报错 Local media path is not under an allowed directory:workspace 白名单与 handler.js 读取路径排查

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/27 22:32:43

Linux网站做301重定向从零搭建实战指南
Linux网站做301重定向从零搭建实战指南

Linux网站做301重定向从零搭建实战指南 网站做好了没人访问,是不是让你觉得钱白花、时间白耗?很多老板以为上线就是终点,其实流量入口的规范化才是开始。尤其是从 http 到 https,或者从 www 到非 www… · 2026/9/27 23:02:59

面向 AI 的 FPGA 开发流程:别急着让它写代码,先把方向定好——TaoToken 统一 Key 接入 Cline 的 config.toml 骨架
面向 AI 的 FPGA 开发流程:别急着让它写代码,先把方向定好——TaoToken 统一 Key 接入 Cline 的 config.toml 骨架

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/27 23:02:52

工程造价毕业论文别再“一个AI用到黑”了:从选题到答辩的工具地图 [特殊字符]
工程造价毕业论文别再“一个AI用到黑”了:从选题到答辩的工具地图 [特殊字符]

先抛一个很多工程造价同学都关心的问题:现在流行的AI论文写作软件榜单到底怎么看? 我的建议是:别只看“第几名”。榜单口径差异很大,有的看流量,有的看付费转化,有的只测通用写作。对工程造价专业来说&… · 2026/9/27 23:02:52

从图灵到智能体:人工智能 76 年兴衰史,为什么爆发恰好发生在现在
从图灵到智能体:人工智能 76 年兴衰史,为什么爆发恰好发生在现在

从图灵到智能体:人工智能 76 年兴衰史,为什么爆发恰好发生在现在 2026 年的秋天,AI 新闻以每天三次的频率刷屏:Meta 的智能体应用两周登顶 App Store(见本站《Meta Muse 爆火复盘》)、OpenAI 和 Anthropic … · 2026/9/27 23:02:52

AI 日报 · 2026年9月25日 星期五
AI 日报 · 2026年9月25日 星期五

AI 日报 2026年9月25日 星期五 36 条精选 | 完整日报:https://myagenthub.cn/daily/2026-09-25 今日核心速览 GPT-6 Astra 需求空前,曝 OpenAI 正筹备 ChatGPT Pro Max 订阅层级DeepSeek Harness 官方桌面版预览偷跑AstrBot: AI Agent Assi… · 2026/9/27 23:02:52

Go 文件 IO:os 与 bufio 区别,什么时候该用缓冲读写
Go 文件 IO:os 与 bufio 区别,什么时候该用缓冲读写

前言很多 Go 新手在接触文件读写时,都会遇到一个困惑:os.Open() 可以读取文件,bufio.NewReader() 也可以读取文件,它们到底有什么区别?为什么有的代码直接读文件,有的代码却要包一层 bufio.NewReader&#… · 2026/9/27 23:02:52

MATLAB雷达信号脉冲压缩仿真:LFM线性调频、匹配滤波与距离分辨率实现
MATLAB雷达信号脉冲压缩仿真:LFM线性调频、匹配滤波与距离分辨率实现

简介:这套Matlab仿真工具完整呈现雷达信号脉冲压缩过程,从线性调频(LFM)信号生成、目标回波仿真到匹配滤波压缩处理均有可运行代码支撑,面向电子信息工程、计算机、数学等专业学生,适用于课程设计、期末大作… · 2026/9/27 0:00:01

汕头网站建设制作厂家避坑指南:5大注意事项救急
汕头网站建设制作厂家避坑指南:5大注意事项救急

汕头网站建设制作厂家避坑指南:5大注意事项救急 改个需求建站公司拖一周,这种憋屈事我见得太多了。 很多汕头老板找本地建站团队,签合同前看着方案挺美,一上线就变脸。 今天不聊虚的,直接拆解找 汕头网站建设制作厂家 时的5个核心 注意事项… · 2026/9/27 0:00:01

多模态虚假新闻检测实战:BERT+ResNet双塔与对比学习
多模态虚假新闻检测实战:BERT+ResNet双塔与对比学习

简介:基于PyTorch的多模态虚假新闻检测项目完整代码包,面向自然语言处理与计算机视觉交叉方向的开发者、科研人员及毕业设计选题者,解决社交媒体中文本与图像联合识别虚假新闻的问题。系统以BERT预训练模型提取文本语义特征,以Res… · 2026/9/27 0:00:01

MATLAB雷达信号脉冲压缩仿真:LFM线性调频、匹配滤波与距离分辨率实现
MATLAB雷达信号脉冲压缩仿真:LFM线性调频、匹配滤波与距离分辨率实现

简介:这套Matlab仿真工具完整呈现雷达信号脉冲压缩过程,从线性调频(LFM)信号生成、目标回波仿真到匹配滤波压缩处理均有可运行代码支撑,面向电子信息工程、计算机、数学等专业学生,适用于课程设计、期末大作… · 2026/9/27 0:00:01

汕头网站建设制作厂家避坑指南:5大注意事项救急
汕头网站建设制作厂家避坑指南:5大注意事项救急

汕头网站建设制作厂家避坑指南:5大注意事项救急 改个需求建站公司拖一周,这种憋屈事我见得太多了。 很多汕头老板找本地建站团队,签合同前看着方案挺美,一上线就变脸。 今天不聊虚的,直接拆解找 汕头网站建设制作厂家 时的5个核心 注意事项… · 2026/9/27 0:00:01

多模态虚假新闻检测实战:BERT+ResNet双塔与对比学习
多模态虚假新闻检测实战:BERT+ResNet双塔与对比学习

简介:基于PyTorch的多模态虚假新闻检测项目完整代码包,面向自然语言处理与计算机视觉交叉方向的开发者、科研人员及毕业设计选题者,解决社交媒体中文本与图像联合识别虚假新闻的问题。系统以BERT预训练模型提取文本语义特征,以Res… · 2026/9/27 0:00:01

了解更多?预约专属演示

我们的顾问将为您一对一讲解产品与方案

企业微信二维码