前阵子有个朋友找我咨询公司想上一套大模型推理服务预算有限又在国产化名单里你说买哪家的卡合适我问他模型多大规模、并发多少、跑训练还是推理、放在机房还是边缘设备他说不是就买算力芯片吗越强越好呗。这个回答恰恰暴露了很多人对国产AI算力芯片的误解——它不是一件商品而是一堆方案且不同方案的适用场景可能隔了十万八千里。今天这篇就围绕一个核心问题展开国产AI算力芯片到底有哪些品牌为什么几乎所有人的目光都从训练场转向了推理和边端我会把目前市场上能接触到的玩家按阵营拆开结合推理场景的真实技术约束和边端部署的实操经验给你一份可以直接用来做方案选型的参考。适合智算中心的采购、AI应用团队的架构师以及所有打算在边缘设备上落地模型的开发者。1. 先想明白一件事突破口为什么是推理和边端而不是训练1.1 训练芯片和推理芯片本质上不是同一类芯片在展开品牌名单之前有个非常容易被忽略的事实拿训练卡跑推理和拿推理卡做推理不是性能打折这么简单而是两套完全不同的设计哲学。训练阶段的负载特点是batch size大、数据吞吐高、矩阵运算密集、对精度敏感通常要FP16或BF16甚至混合精度下需要FP32累积。训练芯片要在单位时间内塞进更多样本这件事上尽量快所以设计上会堆大量AI Core、堆高带宽显存电源和散热预算可以拉到350W甚至750W。开一次训练任务几千张卡嗡嗡嗡跑几个月大家看的是总算力小时数。但推理完全是另一副面孔。推理是部署阶段面对的是单个用户的一次请求batch size往往很小经常是1到8之间的数字。这时候芯片的实际吞吐上限很少由峰值算力决定而是由电路里每个数据搬运的时间决定也就是业内常说的memory bound。于是你会发现一个反直觉的现象某些标称500 TOPS的推理板卡跑7B模型时可能还没有标称200 TOPS但带宽更高的卡快。边端就更特殊了。边端芯片活在功耗、价格、散热、体积都极其苛刻的约束下很多时候连主动风扇都没有还要保证实时性。一台服务器可以用1000W的电源但一台机器人、一个摄像头或一辆车里的AI盒子可能只有5W到30W的预算。在这种局面下比拼的已经不是算力TOPS这个数字而是单位功耗下的有效算力以及模型量化后精度还在不在。1.2 需求爆发的时间窗口恰好卡在推理侧过去两三年有个明显现象训练大模型的团队可能只有几百上千个但使用大模型的用户已经到亿级。训练一次模型可能用几千张卡跑几个月但这套模型一旦部署每天要为成千上万并发用户做推理。一个成熟的大模型服务长期占用的推理算力往往是训练算力的数倍。这个变化带来的结果就是训练侧的高端芯片窗口期短、入围门槛极高现在再想挤进去做纯训练卡基本是地狱难度。而推理侧的需求是长尾的、分散的、场景化的——公有云要跑7B/14B/72B模型私有化项目要跑1.5B/3B小模型运营商和政企项目又普遍有国产硬件的门槛摄像头、玩具、车载、教育硬件则要的是低功耗方案。没有任何一颗芯片能通吃所有场景这种碎片化格局恰恰是国产AI芯片的机会结构也是推理与边端成为突破口的最底层逻辑。2. 国产AI算力芯片品牌全景盘点谁在训练侧谁在推理侧谁在边端其实国产AI算力芯片不是一个圈子而是三个圈子云端训推、推理卡、边端SoC。三个圈子的竞争格局完全不同混在一起比反而容易得出错误结论。2.1 能在云端训推上正面对位的玩家先说声量最大的一档也是能在云端大算力场跟国际主流产品掰手腕的几家。华为昇腾是现在国产AI算力里最完整的一盘棋。训练有昇腾910B/910C系列推理有Atlas 300I Duo和Atlas 800I A2等产品。昇腾不是简单复制GPU路线用的是达芬奇架构AI Core加Vector Core的异构设计软件栈叫CANN大模型推理引擎MindIE也逐步兼容了主流框架。在大模型训推全流程上昇腾的解决包最完整但它的工具链相对封闭第三方厂商做适配和迭代的难度不小。寒武纪是从边缘推理起家的思元220时代就在做端侧推理后来思元370做成训推一体思元590把训练能力顶上来了。寒武纪的思元370推理卡在互联网大厂内部的实际部署量不小INT8推理的能效比很能打性价比一度很有竞争力。海光走的是通用GPGPU路线深算一号DCU兼容AMD ROCm生态因此很多原本为CUDA写的项目在迁移时能借助兼容层减少部分改动。但兼容只是降低迁移成本不等于不改代码算子库、通信库、框架调度还有一堆细节要调。沐曦的看点集中在训练卡曦云系列对标通用GPU策略上先攻训练后延伸推理底层同样往ROCm方向靠。训练卡能不能在大模型集群里稳定跑起来是它目前最关键的问题。另外还有百度昆仑芯R200/R300在百度内部业务上用量很大但对外销售声量相对低调暂时不展开。2.2 把宝押在推理卡上的务实派第二梯队更贴合推理是突破口这个判断这些厂商的产品定义本身就偏推理场景。燧原科技云燧训练卡之外云燧i10/i20推理卡在运营商、互联网项目里的曝光率很高。燧原的产品策略是专门为推理场景开模不是拿训练卡降频当推理卡卖所以功耗和单卡吞吐上有自己的优势。天数智芯天垓系列主打通用训练智铠系列面向推理。智铠100在一些视频解析和轻量LLM推理项目里有落地。壁仞科技壁砺104、壁砺106走的是大算力路线单卡算力冲得很高。真正限制它的是软件栈BIRENSuite的成熟度和应用案例目前还在追赶阶段。2.3 边端SoC藏量最庞大的战场边端是品牌最多、最依赖场景绑定、最不透明的领域。地平线征程系列覆盖自动驾驶征程3、征程5、征程6系列征程6P峰值算力能到560 TOPS。BPU架构在端侧做Transformer和BEV算法很顺工具链和开发平台也是车端最完整的一档。黑芝麻智能华山系列A1000、A2000还有跨域融合计算方向的武当C1200系列覆盖自动驾驶和舱驾一体跟地平线直接对位。算能从智能安防到智算盒子BM1684X、SG2300X这些TPU在边缘视觉项目里出货量不小配合TPU-MLIR工具链有自己的生态圈子。爱芯元智AX620、AX630、AX650系列主打端侧图像和轻量视觉推理很多智能摄像头背后就是它。瑞芯微、晶晨、全志这些老牌SoC厂商这两年齐齐把NPU规格拉了上来。瑞芯微RK3588上那颗6 TOPS的NPU已经成为边缘小盒子开发者的首选入门方案晶晨A311D广泛出现在交互屏、会议盒子、智能家居里全志T527系列也把NPU加到了中低端硬件上。海思Hi3516CV610这类芯片在安防项目里非常常见配合昇腾体系端侧视觉推理链路的工具链比较成熟网上从源码到板端部署YOLOv8的教程也因此多。边端芯片跟云端芯片最大的不同在于**没人会单独买一颗芯片大家买的是一套能跑起来的解决方案。**摄像头厂商不会先看NPU算力只会问能不能顺利把目标检测模型跑上去夜视效果如何、功耗多少、单颗成本多少、外壳尺寸能不能塞得下——每一项都卡得死死的。2.4 一张表看清主要国产AI芯片玩家厂商代表产品主攻方向需要重点考察的短板华为昇腾910B/C、Atlas 300I Duo训练推理行业一体机工具链偏自有迁入成本高寒武纪思元370、思元590训推一体推理性价比高高端训练集群性能仍需验证海光深算一号DCU通用GPGPU兼容ROCm软件层适配工作量不小沐曦曦云C500训练为主向推理延伸生态起步较晚燧原云燧i10/i20云端推理训练侧声量较弱天数智芯天垓150、智铠100训练与推理分线规模落地案例相对少壁仞壁砺104/106云端大算力软件栈成熟度追赶中地平线征程3/5/6汽车与自动驾驶非车载场景绑定不多黑芝麻华山A1000/A2000汽车与舱驾融合工具链生态仍在成长算能BM1684X、SG2300X边缘视觉、智算盒子工具链偏自研爱芯元智AX630/AX650端侧图像、轻量推理大模型端侧能力一般瑞芯微RK3588/RK3576边缘盒子、工控算力有限适合中小模型这张表没有把每个玩家的所有产品线列全但已经足够说明一件事国产AI算力芯片从来不缺品牌缺的是在正确的场景里选对正确的型号。3. 推理芯片选型逻辑算力榜单会骗人带宽和生态才见真章3.1 峰值算力与有效吞吐两组数字两套故事我见过不止一个项目拿着芯片标称的几百TOPS志得意满结果实测跑一个7B模型并发只有几十路性能完全没跑起来。原因在于大模型推理过程其实可以拆成两段。第一段叫Prefill预填充用户把问题发过来后芯片要并行地把整段prompt算一遍生成第一个token这个阶段算力利用率高。第二段叫Decode解码芯片要一个token一个token地往外吐每一步都依赖前一步串行性质很强这个阶段内存带宽才是天花板。只要Decode速度上不来整体并发和时延就上不来。标称TOPS是在矩阵全速跑起来的前提下测出来的但推理的Decode阶段矩阵算力根本用不满反而在拼命读KV Cache。所以选推理卡我第一个看的是带宽第二是显存容量第三才是TOPS。这个顺序跟越强越好的直觉正好相反。3.2 KV Cache、Continuous Batching与动态Shape大模型推理时每个请求都要为历史token维护一份KV Cache它常驻显存。显存总量除以每个请求平均占用的KV Cache才约等于这块卡能同时服务的请求数。所以显存容量不够算力再高也只能干瞪眼。另一个关键点是动态Shape和连续批处理Continuous Batching。vLLM能显著拉高吞吐核心就是用PagedAttention解决KV Cache碎片化再加上连续批处理让不同请求的动态加入和退出变得高效。如果一颗推理卡的驱动层和推理引擎对动态Shape支持不好每次请求都要重新分配缓冲区那批处理效率会大幅下降。这也是为什么国产卡需要花大量精力做推理引擎适配——很多时候不是芯片不行而是软件层没有把芯片的批处理潜力释放出来。3.3 本地部署和边缘推理容易踩的配置误区热搜里总有人问本地推理需要MacBook Pro吗780M核显推理用什么工具合适这里其实有个常被忽略的答案本地推理从来不是非得靠高算力GPU关键看你跑什么规模的模型、用多大的量化。1.5B到3B的小模型用INT4量化之后参数只有1到2GB一个中高端的核显、甚至一台ARM小板子就能跑只是速度有快慢。这种场景下llama.cpp、Ollama这类专门为低功耗设备优化的推理框架反而比跑CUDA的大框架更合适。核心原则是先把模型压缩到能塞进内存再用工具链把带宽吃到极致最后才考虑堆算力。这套逻辑放到国产边端芯片上同样成立。很多芯片的标称算力只有在特定量化精度INT8甚至INT4和特定模型结构下才能发挥出来。评估一颗边端NPU时一定要看它在目标模型、目标量化下的真实帧率而不是看宣传页上的理论TOPS。4. 边端芯片才是最卷的牌桌从6 TOPS到560 TOPS怎么选4.1 功耗、成本、实时性三个硬约束边端芯片的选型逻辑和云端几乎是两个世界。第一个约束是功耗车内AI盒子、摄像头、门禁、电子猫眼这些场景基本都是被动散热或小风扇功耗预算通常在3W到30W之间。第二个约束是成本一颗芯片的价格可能直接决定整个硬件方案能不能立项所以在边端经常会看到用更低算力但便宜得多的方案的倾向。第三个约束是实时性自动驾驶、工业质检、安防预警对单帧延迟极其敏感不能接受云端那种几百毫秒的往返延迟必须在本地完成推理。所以在边端比谁算力高更合理的维度是有效算力/瓦和有效算力/元。一个场景标称560 TOPS的车规芯片和一颗6 TOPS的通用SoC根本没有可比性因为目标产品完全不同。4.2 从PyTorch模型到板端落地要闯的五个关卡从训练好的模型到它在板卡上跑起来中间至少有五个环节缺一个都跑不通模型导出把PyTorch训练好的模型转成ONNX或直接转成厂商自定义格式。算子兼容性检查板卡NPU支持的算子集合和GPU不完全一致注意力机制、动态形状、某些激活函数经常要替换或融合。量化校准INT8/INT4量化需要准备校准数据集用KL散度或最小化误差的方法确定各层量化参数这一步直接决定精度损失多少。编译与推理框架接入在厂商工具链里做图优化、算子融合、内核生成然后接runtime跑起来。联调与性能优化在真实设备上测帧率、延迟、功耗必要时针对特定层做手工优化。以YOLOv8为例网上大量教程讲的是在Hi3516CV610或RK3588上从源码到板端的完整流程核心套路都是先转ONNX再到厂商转换工具里做量化校准编译成NPU专用二进制格式最后用官方runtime调用。看起来步骤不多坑却非常密集——量化后精度掉点、某个算子不支持导致整图回退到CPU慢速执行、内存布局不对导致性能腰斩这些都是常态。4.3 选边端工具链就是选平台边端领域没有统一的CUDA每家有每家的工具链这也是选型时最需要关注的隐性因素。瑞芯微是RKNN-Toolkit2配RKNN runtime地平线是OpenExplorer工具链算能是BMNNSDK配TPU-MLIR海思则是一套从HiAI到昇腾相关工具链的体系。如果你是算法团队希望尽量少碰芯片细节选择标准就两条一是工具链对PyTorch和ONNX的支持覆盖度二是社区案例数量。案例越多意味着可查的踩坑记录越多出问题时有人可问。目前RK3588在这一块的优势很明显从模型转换到摄像头采集、Qt界面、NPU加速一条龙的教程遍地都是所以很多开发者选它反而是最省力的。5. 工具链与推理引擎适配决定国产芯片能不能用起来5.1 从CUDA生态迁移的真正难点在分层这几年国产芯片厂商都有一个共同口号兼容CUDA生态。但实际迁移过的人都知道CUDA生态是分层的有CUDA C/C这种底层编程接口有cuBLAS/cuDNN算子库有CUDA graph执行调度还有上层框架PyTorch、TensorFlow对算子的默认调度。兼容层一般只能做到语法层面的翻译不等于性能等价。一个模型在A卡上收敛得很好换到国产卡上跑最常遇到的问题某个算子在算子库里缺失或者某个自研算子的精度和官方不一致需要手动重写。推理场景相对训练会好一些因为推理的计算图是固化下来的可以提前做图优化和算子融合。这就是为什么能跑推理的国产卡比能跑训练的国产卡更容易先成熟。5.2 vLLM与SGLang的适配现状现在做大模型推理行内人基本绕不开vLLM和SGLang。vLLM的PagedAttention解决了KV Cache碎片化问题连续批处理大幅提升服务吞吐。SGLang则在调度开销和RadixAttention共享前缀上更激进特别适合多轮对话和长提示词场景。如果还想从原理层面彻底搞懂PagedAttention和Continuous Batching的运行机制从nano-vLLM这类教学级实现开始读是很好的路径源码规模小得多关键逻辑保留得还比较完整。国产芯片要在这两个框架里被真正用起来不能只靠厂商自研引擎还必须做深度适配。目前昇腾、寒武纪都投入了不少工作昇腾有MindIE但也主动接入了vLLM的分支版本燧原、沐曦也在各自推进兼容方案。对用户来说选一颗能跑主流推理引擎的国产卡远比选一颗只能跑厂商demo的卡重要因为你的服务代码、调度逻辑、监控体系都是围绕这些开源框架写的芯片只能跑私有引擎的话整套技术栈就被绑死了。5.3 自研引擎全家桶体验与绑定的取舍除了兼容主流框架国产厂商也在自研工具链上做差异化。最典型的是昇腾的MindIE不止是推理引擎还包括模型转换、量化、性能分析在内的一整套工作流。好处是全家桶体验完整官方说支持什么模型调起来通常比较顺坏处是你需要进入一整个新的知识体系学习成本和排障成本都高。我个人的判断是真正能长期留下来的国产AI芯片公司一定不是TOPS最多的而是让算法工程师迁移成本最低的。工具链文档质量、报错信息的可读性、社区案例的密度这些看不见的工程细节最终决定了生产力和客户黏性。6. 落到具体项目上的选型决策与个人判断6.1 按业务形态推荐的选型框架大型公有云或大规模训练集群优先考虑昇腾、寒武纪这类有完整训练加推理方案的厂商因为此时需要的是集群稳定性和持续迭代能力。企业私有化大模型推理优先看寒武纪、燧原这类推理卡落地案例多的厂商同时确认它对vLLM和SGLang的支持程度显存容量是否跟得上模型规模。边缘视觉和智能硬件根据成本目标来选RK3588是最大公约数车规场景看地平线和黑芝麻安防行业绑定比较深的是算能和爱芯。轻量端侧AI玩具和交互设备则适合晶晨、全志这类低功耗SoC配量化后的小模型主打性价比。6.2 值得持续关注的三个演进方向第一个是PD分离Prefill/Decode分离架构。把Prefill和Decode分别部署到不同类型的硬件上让计算和访存各就各位已经有一些国产芯片厂商在布局这会重新定义推理卡的产品形态。第二个是内存扩展技术让推理卡突破显存物理容量的限制大模型推理的并发瓶颈会因此松动。第三个是端侧大模型的兴起当3B甚至7B模型在端侧跑得足够顺时边端芯片的市场空间会比现在再大一个量级这是国产边端芯片最大的长期红利。6.3 我在国产芯片上踩坑后的三点体会第一凡是宣传页上的性能都要打一个问号最终以自己目标模型实测为准尤其是量化和动态Shape场景。第二选型和采购时一定把工具链工程师的投入算进成本有些芯片看着便宜但团队要花两个月时间去磨算子转换和内存优化总成本反而更高。第三优先选社区案例多的硬件哪怕性能略微逊色一点。因为当你的项目卡在某个算子报错时能搜到一条别人的解决方案比什么都值钱。以后再有人问国产AI算力芯片哪家强我建议先反问一句你的模型是什么、跑在什么场景、能接受多大的迁移成本。把这三个问题回答清楚品牌清单自然会浮出水面。推理和边端之所以是突破口不是因为训练不重要而是因为任何模型的价值最终都要靠部署和推理来实现——而部署这件事拼的就是场景理解、工程适配和长期服务的笨功夫。
企业数字化 ERP 产品动态
相关推荐
Keil MDK5集成AStyle代码格式化与注释自动化配置指南 /* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/25 1:10:52
7-Zip完全使用指南:从下载安装到命令行操作与问题排查 /* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/25 1:10:40
ESP32 如何运行 WebAssembly?WAMR 运行时原理与实践 /* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/25 1:10:40
微信读书电子书导出工具:开源方案实现EPUB/PDF本地化 /* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/25 1:49:19
STM32从选型到实战:时钟树、中断、外设与避坑指南 /* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/25 1:49:07
CST Studio Suite 2026安装教程:环境配置、许可证激活与性能调优 /* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/25 1:49:07
Python+Django视频点播系统源码:毕业设计快速搭建与避坑指南 /* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/25 1:49:07
Spring Boot二手车交易系统毕业设计:从技术选型到答辩避坑指南 /* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/25 1:49:07
Proteus 8.11安装与仿真验证全指南 /* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/25 1:49:07
创维E900V22D刷机全攻略:S905L3SB芯片兼容性解析与救砖实战 /* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/25 1:00:31
MQTT协议原理与Broker服务器搭建实战:从Mosquitto到EMQX /* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/25 1:00:37