前几天天数智芯在港交所挂牌市值一度冲上400亿港元。这条新闻在GPU圈子里转得飞快原因很简单加上它坊间常说的国产GPU四小龙终于全部进了资本市场。如果你这几年一直在跟智算中心的项目或者采购过国产加速卡应该能感受到这个赛道的热度来得有多猛。大模型训练把英伟达的卡推到了“一卡难求”的地步国产GPU厂商也从“能做出芯片”的阶段被迫加速跑向“能不能稳定供货、能不能把软件栈补全”的深水区。这篇文章不打算复述新闻稿我想从实际从业者的角度把这件上市案背后的行业信号、国产GPU当前的技术短板、真实部署流程里会踩的坑以及开发者应该如何选型这几件事拆开讲清楚。适合谁看呢一是公司里负责算力采购和平台建设的人二是准备在国产GPU上做模型迁移和推理部署的AI工程师三是单纯想搞清楚“四小龙到底行不行”的行业观察者。看完你至少能搞明白两件事这400亿港元到底买了什么预期以及国产GPU离“拿来即用”还有多远。1. 一条上市新闻背后藏着一整条赛道的转折点1.1 “四小龙”集体上岸赛道进入资本验证期先把“四小龙”这个说法对齐一下。市场里被归进这个阵营的通常是天数智芯、摩尔线程、壁仞科技、沐曦这几家通用GPU公司。它们在路线上的共性是都做GPGPU通用并行计算都主攻数据中心 AI 训练和推理并且都把“兼容CUDA生态”写进了产品卖点。天数智芯有自己的天垓系列训练卡和智铠系列推理卡摩尔线程走的是全功能GPU路线桌面、服务器、AI卡一起铺壁仞主打高算力大芯片沐曦则把训练和推理产品线做得比较齐。这张牌桌上还有海光、景嘉微等玩家但四小龙之所以被单拎出来是因为它们的融资节奏、产品迭代速度和上市时点几乎踩在了同一条时间线上。四家厂商选择在同一窗口期冲刺资本市场表面看是巧合实际上是产业周期推着走的。AI芯片研发烧钱极快一颗7nm或5nm大芯片从流片到量产动辄十几亿人民币起跳且要连续投入好几个迭代版本。一级市场融资在2022到2023年之后明显收紧投资人开始看营收和出货光讲技术故事已经不够了。更关键的是下游国产算力需求起来了智算中心招标、运营商集采、互联网大厂兜底采购这些订单都是亿级规模直接让国产GPU厂商有了真实收入也给了二级市场一个估值锚点。登陆港股本质上是给这些高投入、长周期、强政策的公司补上了一根新的资金输血管。1.2 市场凭什么给GPU公司400亿港元的估值先算一笔账。400亿港元放在半导体行业是什么水平横向对比国内其他芯片设计公司这已经属于头部阵列。但GPU公司的估值逻辑不能只用市盈率看因为大部分国产GPU厂商还在亏损真正支撑市值的是三样东西预期的市场份额、智算中心建设带来的订单能见度以及软件生态未来可能形成的收费空间。我见过不少分析师喜欢拿英伟达的市值和利润比例往国产厂商身上套这个做法很容易失真。更务实的评价指标有三个一是出货量也就是真正交付给客户并跑上业务的卡有多少二是复购率客户用完之后愿不愿意接着买下一代三是软件栈的闭环程度也就是厂商能不能帮客户把训练、推理、运维全部接住。这三条里任何一条不达标估值都会出现系统性的回落风险。所以400亿港元并不是“成功上岸”的证明更像是市场给国产GPU发了一张竞争门票能不能回本还要看后面几个季度的财报和客户案例。2. 热闹之外国产GPU要过的几道硬门坎2.1 生态兼容“兼容CUDA”到底是入场券还是坑所有国产GPU厂商都会在产品页上写“支持CUDA生态”这几乎是标配文案。但作为实际跑过迁移的人我要泼盆冷水兼容CUDA和像英伟达一样好用中间隔着很长的距离。CUDA不是一个单一软件而是一整套从驱动、运行时、数学库到编译器的技术栈。所谓的兼容我经历的方案主要有三种第一厂商在驱动层做翻译将CUDA API调用转换成自家指令上层代码改动少但性能损耗明显第二提供自定义的编程模型让源码重新编译比如把CUDA kernel代码转成厂商中间表示工作量大且依赖工具链的完整度第三走开放标准路线用OpenCL、SYCL或Vulkan这类跨平台接口去接近CUDA的体验。天数智芯、摩尔线程这几家的方案各有侧重但到目前为止我还没有见到任何一家能做到主流AI模型代码零修改、零性能损失地直接跑。再说一个更常见的坑很多人以为“能跑通ResNet就算兼容”实际上大模型训练中最容易出问题的是flash attention、混合精度通信、以及各种定制kernel。这些场景必须依赖厂商算子库的持续更新。所以看到“兼容CUDA”这行字的时候你真正该问的是支持的CUDA版本是多少算子库覆盖到什么程度有没有现成的vLLM、DeepSpeed适配回答不了这几个问题纸面上的兼容就是一个营销词。2.2 算子、编译器和性能调优跑得起来不等于跑得快这几年身边聊GPU的人变多了但很多人对GPU怎么干活还是模糊的。你在网上搜“kernel算子”和“cooperative thread array”大概率是想把GPU编程模型搞清楚。我用最简单的方式梳理一下GPU执行计算时CPU负责下发任务GPU内部会把计算切成一个个线程组来并行执行。CUDA里最基本的概念是warp——32个线程组成一个硬件调度单元GPU每次实际执行都以warp为单位而cooperative thread array是程序员视角下的线程块一个CTA里包含多个warp它们共享一块共享内存并且可以协作同步。理解这些概念不是为了考试而是调优时必须知道你的kernel到底占了多少线程、开了多少并行度。国产GPU的调用链和英伟达类似但算子库覆盖度是最大的痛。我的实测经验是跑主流模型结构时矩阵乘、卷积这些基础算子通常没大问题但一旦遇到模型里新出现的特殊算子比如某些MoE架构里的自定义路由逻辑就会频繁碰到“operator not implemented”之类的报错。这时候你有三条路升级算子库、改写模型绕开算子、用厂商提供的底层接口自己实现一个。如果贵司有算法工程师第三条路可控性最高但工作量不小。没有的话抱歉你可能真要花时间等厂商更新。2.3 驱动、虚拟化与调度底层基建的账要算细现在GPU不只是训练在用各种云原生平台也在大规模调度它。热搜词里出现“k8s调用gpu”“hami gpu虚拟化”“gpu配额已不够预冻结”这一类说明大家早就不满足于“把卡插上就能用”而是要把卡切分、池化、按队列分配。这条链路里藏了不少国产GPU的隐形问题。标准驱动如果不是厂商针对特定内核版本编译的装上后很容易出现开机黑屏、驱动加载失败虚拟化方案里GPU切分的效率、显存隔离强度、以及容器重启后设备能否自动回收每一样都影响平台稳定性。我之前在客户现场排过一个问题容器平台显示GPU已分配但实际算力为零查到最后是device plugin和驱动版本不匹配导致的。所以如果你要做GPU资源池化务必先问厂商要一份“容器调度兼容性清单”并且用真实负载压测至少一周再上线。2.4 热搜词背后藏着开发者最真实的痛点我把和这次话题一起刷上热搜的关键词理了一遍基本可以归成四类。第一类是安装部署类pytorch安装教程gpu、麒麟系统v10加海光gpu安装pytorch这说明大家的新手入门依然有门槛第二类是运行时报错类gpu发生崩溃或d3d设备已移除、xid 79: gpu has fallen off the bus这类问题多半指向驱动稳定性、供电或者温度第三类是性能加速类foldseek在gpu上部署、deepmd-kit的gpu和cpu版本速度对比这是科研用户在认真评估GPU的加速收益第四类是调度虚拟化类k8s调用gpu、gpu配额冻结这是平台运维人员的日常。把这些词条合在一起看你会发现一个趋势GPU已经不再只是“搞深度学习”的人关心的东西了做分子动力学的、做电磁仿真的、跑ComfyUI画图的都在同一个生态里找答案。这对国产GPU厂商来说既是机会也是压力——机会在于市场需求足够多元压力在于要接住这些需求光有芯片远远不够配套软件得像英伟达那样覆盖到每个角落。而“覆盖到每个角落”这件事没有三到五年的持续投入是完不成的。3. 从装机到跑通一套能落地的GPU使用流程3.1 环境准备驱动、固件和系统配置检查不管你是买国产卡还是用别的卡第一步永远不是装驱动而是先确认硬件被正确识别。我习惯的操作是先用lspci | grep -i看PCIe设备列表里有没有对应显卡的型号再进BIOS确认显卡槽的PCIe速率和BAR空间设置。这里有个经常被忽略的细节有些主板的Resizable BAR默认是关闭的如果不打开部分国产GPU在跑大显存占用任务时会遇到性能下降甚至分配失败的问题。建议到手后先升级到最新固件再把BIOS里关于PCIe的选项全开一遍。驱动安装不能用英伟达的那套流程直接套。每个国产厂商都提供了自己的驱动包基本是DEB/RPM或者runfile形式安装前一定要看内核版本支持范围。我踩过一个坑厂商文档说支持某个Linux发行版但实际测试发现内核小版本更新后驱动模块编译直接失败。所以给你的系统做内核版本锁定非常必要。装完后用厂商自带的smi工具类似nvidia-smi确认驱动版本、显存容量和GPU利用率并跑一晚上stress压力测试确保没有掉卡现象再进入下一步。如果你用的是双显卡笔记本类似热搜里“intel uhd graphics和nvidia geforce rtx 4060 laptop gpu同时出现”的情况要注意别把集显和独显搞混。这类机器需要在系统层面配置GPU切换策略很多报错其实不是驱动坏了而是任务被跑到了集显上。工业级GPU服务器虽然不带集显但设置NVIDIA_VISIBLE_DEVICES之类的环境变量来指定设备依然是容器场景下的基本功这一点对国产卡同样适用。3.2 框架部署PyTorch、PaddlePaddle适配要点PyTorch是国产GPU适配的第一优先对象这点各家厂商都非常清楚但同为“支持PyTorch”坑也不少。最稳妥的做法是直接使用厂商提供的Docker镜像里面驱动、算子库、框架版本已经调好如果你要在裸机上装需要先确认三个版本是否匹配操作系统、体系架构、PyTorch版本任何一个不匹配都会引发莫名其妙的segmentation fault。成功安装后第一时间不要急着跑模型先做最小验证。下面这段代码是我最常用的检查脚本import torch # 确认框架能识别设备 print(torch.cuda.is_available()) # 确认设备名称和算力 print(torch.cuda.get_device_name(0)) print(torch.cuda.get_device_capability(0)) # 跑一个简单的张量运算 a torch.randn(1024, 1024, devicecuda) b torch.randn(1024, 1024, devicecuda) c torch.matmul(a, b) print(c[0, 0])如果打印结果是False或者报设备不存在先别怀疑代码回头检查环境变量和驱动加载状态。PaddlePaddle的验证更简单框架内置了paddle.utils.run_check()它会把环境、设备、算子状态全部自检一遍。还有一点很多人忽视跑国产GPU时尽量少用pip install从默认源装包有些包会默认拉取带CUDA的依赖把环境搅乱。用厂商源或者镜像里的whl可以少走很多弯路。3.3 分布式训练与GPU池化把卡用得明明白白当你手上的国产卡不止一张就要考虑分布式训练和资源调度。单机多卡场景下PyTorch官方推荐的torchrun基本可用但要注意集合通信库的表现。英伟达生态里NCCL是默认选项国产GPU厂商目前有的走兼容层、有的走自研集合通信库实际效果差别很大。我在测试中遇到过多卡扩展效率只有线性40%的情况排查后发现是通信库没有走RDMA而是退化到了TCP这直接会让大模型训练效率崩盘。如果是更大规模的集群k8s调用GPU的标准姿势是部署device plugin。每个厂商都会提供自己的插件实现但开源社区里也有hami这类通用方案可以尝试。这里要特别提醒“配额”和“预冻结”的概念平台通常会按GPU卡时/核时给用户分配额度任务排队时资源会被预冻结超时就释放。热搜词里那些“配额已不够冻结5分钟折合1.33核时”的提示其实就是平台在提醒你额度不足而不是出了故障。想省额度就得把模型加载、数据预处理这些环节优化好把GPU真正用于计算的占比提上去。3.4 常见报错定位与解决附排查表实操中的报错可以写一本书这里我列一个高频排查表都是我和团队真实碰到过的报错现象常见原因排查顺序解决办法xid 79: GPU has fallen off the bus供电不足、散热异常、驱动不稳定查电源功率和PCIe插槽、看系统日志、摸GPU温度换供电线/换槽位更新驱动或降频D3D device removed / GPU崩溃显存占满、驱动超时重置查显存占用、看事件日志、跑稳定性测试减小batch size、更新驱动、加显存隔离Unsupported GPU / capability mismatchCUDA版本太旧不识别新GPU算力查GPU算力和CUDA版本对应关系升级CUDA工具包或换旧显卡kernel not implemented / operator missing算子库覆盖不全查算子名、查厂商发布日志升级算子库、换等价模型实现CUDA error: out of memory显存不够或分配未释放查进程占用、检查上下文残留清理僵尸进程、加max_split_size或梯度检查点每个问题背后都有对应的排查套路但最核心的一条经验是先确认最小组件是好的。驱动是好的、设备能被系统识别、矩阵乘能跑通再去怀疑上层框架和模型代码。很多人在环境还没就绪时就去跑7B大模型微调最后报错满天飞根本分不清是算子问题还是显存问题。4. 面向场景训练、推理与科学计算的国产算力4.1 大模型微调与推理成本账怎么算国产GPU目前最容易切入的市场其实是中文大模型的微调和推理。原因很好理解训练市场竞争激烈客户预算又对性能极度敏感但微调和推理更看重性价比和供货稳定性。先算微调账。用7B参数模型做LoRA微调BF16精度下权重占约14GB显存里还要塞优化器状态、激活值等一张24GB显存卡勉强能跑但batch size会很保守。如果换成全参微调至少需要4张或更多卡做数据并行。这时你要关注的不是“单卡算力有多少TFLOPs”而是多卡线性加速比——加的卡越多通信开销越大算力利用率可能越低。我们在国产GPU集群上做微调的经验是把模型切分、梯度累积和通信重叠都调好整体吞吐能追到同代N卡的六七成就已经是拿得出手的成绩。推理端的账更简单。在线推理主要看两个指标首token延迟和吞吐量。决定这两个指标的不只是算力还有显存带宽和KV cache的管理能力。国产GPU如果显存带宽够大配合vLLM这类优化推理框架在INT8甚至FP8量化之后单卡跑中等规模模型的性价比优势会很明显。账要这么算不只看硬件采购价还要看单位Token生产成本和可维护性。国产卡的优势是供货充足、议价空间大缺点是软件栈迭代速度还有提升空间需要平台层做更多兜底工作。4.2 科学计算与垂直行业算力加速的实际收益大模型之外我越来越关注科学计算这个方向。热搜词里“foldseek在gpu上部署”和“deepmd-kit的gpu和cpu版本速度对比”就是蛋白质结构比对和分子动力学模拟这类典型的科学计算负载。为什么这些负载天然适合GPU因为它们内部藏着大量可并行的计算分子模拟里每步要同时算成百上千个原子间的相互作用力用CPU只能一个挨一个地算GPU却能按warp批量算。像DeepMD这类软件GPU版本相对CPU单核的加速比可以到几十倍这是算力效率层面的根本差异。科学计算对GPU的要求和大模型很不一样更看重的往往是双精度浮点性能FP64、驱动稳定性、以及和Fortran/C老代码库的兼容性。国产GPU在FP64峰值上的表现目前普遍弱于面向AI的FP16/FP32能力这对科研用户是一个需要重点评估的点。另外一个现实问题是许多专业软件只针对英伟达显卡做过底层优化要在国产卡上跑要么靠厂商做兼容适配要么等软件开发商官方支持国产GPU。我在和科研团队沟通时通常会建议他们拿自己的真实数据先跑一遍基准测试用加速比和完成时间说话不要被纸面算力误导。4.3 超算、云与边缘部署形态的差异化同一个GPU芯片放在超算中心、云平台和边缘盒子里的要求可能是三套完全不一样的东西。超算中心看重的互联能力、并行文件系统和故障恢复云平台看重的是虚拟化效率、多租户隔离和按需扩缩容边缘场景则要求低功耗、小尺寸和恶劣环境下的稳定性。这对厂商的考验是全方位的。很多国产GPU起步时只做了“数据中心PCIe插卡”这一种形态但客户真正需要的是服务器整机方案、一体机、甚至液冷版本。运营商和大型智算中心的招标文件里经常会把“液冷散热支持”“RoCE/IB互联兼容”“整机柜交付”写进硬性条款。如果厂商只能提供裸卡那基本连入围资格都没有。这也是为什么看一家GPU厂商的成熟度不能只看芯片参数还要看它有没有完整的服务器产品矩阵和行业解决方案团队。5. 生态之争开发者吸引力才是长期赛点5.1 编程模型迁移从CUDA到国产平台的可行路径开发者最关心的问题永远是“我的代码怎么跑上去”。迁移路径一般有三条按工作量排序第一条是直接用厂商翻译层跑二进制兼容零改造但性能和覆盖面要看缘分第二条是源码级移植把CUDA的kernel代码改成SYCL或厂商扩展语言工作可控性高很多第三条是用可移植性更好的统一编程框架比如SYCL、OpenCL等从底层设计上避免锁定单一厂商。我个人的判断是长期看第三条最健康但短期迁移成本会略高。看一段简单的向量加法kernel就明白了CUDA版本和SYCL版本的逻辑几乎一样但接口和内存模型略有差别。对团队里只写过CUDA的工程师来说学会SYCL的代价并不大真正的成本在于那些调优过的自定义算子比如手写的FlashAttention这类代码迁移起来才会真正让人头疼。所以如果你是在为一家准备长期经营AI平台的公司做事我的建议是尽量把核心算子层抽象成公共接口不要把所有优化都绑死在单一平台上。5.2 项目生态与开发者扶持谁能留住人这一轮上市潮给国产GPU带来的不只是钱还有一轮开发者关注度。但关注度和忠诚度是两码事。我观察到一个现象网上搜“pytorch安装教程gpu”出来的主流教程还是英伟达为主国产GPU的教程要么埋在厂商官方文档里要么是零散的博客。这就导致很多新用户遇到问题后第一反应是问AI助手或者去论坛发帖而不是看厂商文档。要改变这个局面厂商需要在三件事上持续投入完善的中英文文档库、开箱即用的示例工程、以及高效的社区响应渠道。我在评估一家GPU厂商的成熟度时会重点看他们的GitHub仓库更新频率和issue回复速度这个指标比发布会上的PPT指标可靠得多。另外能不能快速适配vLLM、Ollama、ComfyUI这类热门开源项目也是重要的参考维度。大家在选型时也可以按这个标准来筛看它能不能跑通你最常用的三个开源项目跑不通就说明生态离可用还有距离。5.3 结语之前的几句实在话这轮“国产GPU四小龙齐聚资本市场”的消息好处是让行业第一次有了集中的上市公司群体方便投资者和客户做对比评估坏处是资本关注可能让人产生“国产GPU已经可以全面替代”的错觉。我认为更准确的说法是它们拿到了必要的资金和关注接下来三年才是真正的冲刺期。芯片迭代、量产良率、软件栈闭环、客户服务每一项都在用真金白银和时间赛跑。做为一个实际上手过多种国产卡的人我的建议始终是先用你的真实负载做两周到四周的测试再谈采购。把模型精度、吞吐量、稳定性、售后响应速度这些指标列成表一家一家过。芯片是不是自研、融资看着是否充裕这些信息可以参考但都不能替代你亲手跑出来的那份测试报告。国产GPU的故事现在才讲到从PPT走向量产和落地的章节。后面的内容不会比上市敲钟更轻松但也注定要比敲钟更精彩。
企业数字化 ERP 产品动态
相关推荐
Notepad++便携版:U盘即用的轻量代码编辑器 简介:这是一份开箱即用的绿色版Notepad文本编辑器资源,面向程序员、运维人员及日常办公用户,解决Windows系统下缺乏功能丰富、轻量免装文本工具的问题。压缩包共303个文件,包含92个HTML帮助文档与界面说明页、103个PNG图标资源、2… · 2026/9/26 11:47:54
C语言合并两个无序数组:冒泡排序与双指针归并详解 这道题我第一次见到是在给学生讲GESP备考题的时候,原题描述很简单:两个无序数组,合并成一个升序数组。但是不同人的第一反应很有意思,有些直接“先合并再排序”,有些会想到“先排序再用双指针归并”。这两种方案代码都… · 2026/9/26 11:47:54
JS+CSS3卡通表情动画:轻量级UI情绪反馈方案 简介:这是一份面向前端初学者与网页交互设计爱好者的轻量级动画实践资源,聚焦JS与CSS3协同实现卡通人物情绪表达,解决网页中动态表情反馈、用户交互可视化等常见需求。资源包共5个文件,含HTML页面结构、CSS3动画样式表、JavaScrip… · 2026/9/26 11:47:54
Atlas 300V 24G部署YOLO全流程:从硬件到推理优化 从标题“atlas”出发,这篇文章我想聊聊一个非常具体的东西:在Atlas 300V 24G这张运算加速卡上,把YOLO目标检测模型部署到生产环境的完整过程。热搜里那句“atlas 300v 24g 是运算加速卡吗”,可以很直接地回答——是的,… · 2026/9/26 12:25:00
军工保密资质年度风险自评估报告:法规依据、内容模型与提交校验 定义: 年度风险自评估报告是军工保密资质单位的法定年度义务,依据《武器装备科研生产单位保密资质管理办法》(保发〔2025〕2 号)第 35 条,应当于每年 3 月 31 日前向实施机关报送。一级资质报国家保密行政管理部门&… · 2026/9/26 12:25:00
SAP SM36后台作业实操指南:从创建到排错的完整解析 做SAP运维的,没有谁没被凌晨的电话吵醒过。客户在电话里说“昨天夜里的批作业没跑,今天早上报表数据全不对”,你睡眼惺忪地打开系统一看,SM37里那个作业还挂在Scheduled状态,压根没释放。这种场景我经历过太多次&#… · 2026/9/26 12:24:54
葡萄酒质量分析数据挖掘大作业:Python完整流程与避坑指南 简介:这是一份面向计算机相关专业学生的数据挖掘课程设计资源,以Python实现葡萄酒质量分析为完整案例,适合正在准备期末大作业或希望积累实战经验的学习者。项目围绕酒精含量、酸度、密度等变量与葡萄酒质量评定的关系展开,覆盖数… · 2026/9/26 12:24:54
Atlas 300V 24G部署YOLO全解析:从推理加速卡定位到实操踩坑 Atlas这个词,搞AI的人这两年多少都听过。如果你关注过华为的AI计算产品线,应该知道Atlas是华为的AI计算品牌,旗下有Atlas 300V、Atlas 300I、Atlas 800等多个系列。最近“Atlas 300V 24G是不是运算加速卡”“能不能部署YOLO”这类问题在社区里… · 2026/9/26 12:24:47
算符优先分析法C语言实现:优先关系表构建与移进归约核心算法详解 开头 说到编译原理这门课,算符优先分析算法应该是很多人在语法分析这一章第一次真正动手写代码的地方。当年我也是从“文法、推导、归约到底都是啥”的懵圈状态过来的,到现在还能记得调试优先关系表时的那种抓狂感——明明照着书上的算法写的,… · 2026/9/26 12:24:41
数据库课后习题答案别硬背:当测试用例集刷,效率翻倍 简介:万常选版《数据库原理与设计》课后习题答案资源,覆盖第2至6章及第9章,适合正在学习关系模型、数据库建模、关系数据理论与模式求精的本科生、自学者作为复习与自测材料。压缩包共7个文件,含3个doc参考答案、2个sql示例脚本、… · 2026/9/26 0:00:21
OpenClaw 替代品?Hermes Agent 踩坑实录:macOS 飞书接入 TaoToken 配置 /* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/26 0:00:40
向下兼容与向上兼容:接口设计中的兼容性策略与工程实践 一次版本升级事故,是很多团队绕不过去的坎。线上环境里,服务端明明已经上线了新版接口,老的移动端还在照着旧文档传参数。请求一到网关,校验直接拒绝,用户操作失败,客服群炸了锅,开发群里开始互… · 2026/9/26 0:00:46