AI 花费失控问题可能不在模型价格读麦肯锡《智能的成本》一家企业决定给客服系统接入 AI。试点时每天只有几十个人在用账单看起来微不足道。推广到整个业务后员工开始让智能体检索知识库、调用工具、反复检查答案有些任务一次完成有些任务绕了十几轮。月底采购部门看到了模型账单却很难回答一个更重要的问题这些钱究竟解决了多少客户问题麦肯锡 QuantumBlack 在 2026 年 7 月发表的《The cost of intelligence: How CIOs can manage AI demand at scale》讨论的正是这种困境。文章主张把 AI 消费当作一门持续管理的经济学不仅计算 token也要管理模型选择、智能体循环、工作流设计、基础设施和业务结果。我读完后最大的感受是企业正在经历一次计量单位的转换。过去买软件管理者主要关心采购了多少席位现在部署 AI真正需要追问的是完成一个合格任务需要消耗多少资源又带来多少增量价值一、93% 的企业“超预算”说明了什么报告援引麦肯锡 2026 年 5 月的一项 Enterprise AI FinOps 调查120 家企业参与其中 75 份为符合条件的回答涉及五个主要行业。报告称62% 的受访组织已经进入积极部署阶段93% 的受访者表示 AI 支出超过预算从零散试点走向企业级采用时AI 支出接近增加到四倍。这些数字足以提醒管理者关注支出却不宜直接写成“全球 93% 的企业 AI 投资失败”。样本有限报告没有展示随机抽样或企业间可比性的详细设计“超预算”也只说明实际支出高于事先设定的额度不能单独证明项目没有收益。如果使用量和有效业务量同时迅速增长超预算与高回报完全可能并存。反过来说预算问题也不能因为“AI 创新需要投入”而被轻描淡写。报告指出企业的支出散落在大模型 API、云平台、办公套件中的 AI 功能、各业务部门购买的工具及实验环境中。按照作者的项目经验约 20%—30% 的 AI 支出可能没有被统一纳入可追踪视图。这里说的是可见性不足并非这些钱全是浪费。我认为更准确的诊断是企业放大了 AI 的使用权却还没有建立与之匹配的成本归属、效果衡量和任务边界。财务部门看到发票技术部门看到调用量业务部门看到“好像更快了”三者尚未落在同一张账上。二、为什么 token 单价下降企业账单仍可能上升传统软件的席位数通常比较容易预测。AI 的一次“使用”却可能只是一次问答也可能是一条由检索、规划、工具调用、代码执行和自我检查组成的任务链。每增加一个步骤都可能产生新的模型调用并把之前积累的上下文再次送入模型。报告引用的一项斯坦福数字经济实验室研究为这种波动提供了更具体的证据在其智能体编程任务研究中同一任务不同运行的 token 消耗最高可相差 30 倍而且更多 token 并不必然带来更高的正确率。这个结论来自特定的编程任务和评测设置不能直接外推为所有企业智能体都存在 30 倍波动但它足以说明按照“平均每次对话花多少钱”做预算可能很脆弱。进一步看成本上涨不一定是坏消息。假设某团队通过模型优化把单次调用成本降了一半却把原先只能人工处理的一批任务交给 AI总支出仍可能上升。此时需要问的是新增任务是否值得做而不是仅凭总账单判断优化有没有成功。因此AI 成本管理至少要同时看三个维度单位调用成本、每项任务的调用量、业务需求总量。模型降价只能改变第一个维度智能体设计影响第二个维度推广速度和新增使用场景则改变第三个维度。忽略后两个维度采购到更便宜的 token 也可能换来更高的总账单。三、真正的单位经济学是“每个合格结果的总成本”报告反复强调治理单位应该是完成的业务结果而不是 token。这个观点值得进一步推到工程实践中。可以先用一个简单的概念式来理解每个合格结果的成本 ≈模型与工具调用 基础设施 失败重试 人工复核与返工÷ 合格完成的任务数这不是报告给出的会计公式而是我对“按结果核算”的展开。分母中的“合格”尤其关键。例如客服智能体自动回复了 100 张工单其中只有 60 张符合准确性和合规要求其余需要人工改写。若只算每张工单的推理费就会低估失败与返工若把“自动回复次数”当成产出还会高估价值。成本也不能脱离任务难度和风险解释。同样是一张工单查询物流状态与处理高争议退款对准确性、审核和响应时限的要求不同。把复杂任务和简单任务混在一起比较“平均每单成本”可能鼓励系统只挑容易的任务最终把难题留给人工。在我看来一个可用的 AI 经营指标应至少同时记录任务类型、成功与否、质量要求、人工接管、端到端耗时、模型及工具成本以及相对原工作流的增量效果。对于成本分布波动大的智能体还要看高成本尾部例如第 95 百分位任务成本和异常循环次数而不能只看均值。这也是为什么报告提到的 AI 控制层值得关注。它位于应用、智能体和模型之间记录每次请求属于哪个业务、由谁负责、调用了什么模型、花费多少、是否重试以及最终产生什么结果同时执行预算、权限和升级规则。控制层的意义不在于多装一层管理软件而在于把过去分散的“模型日志”和“业务结果”连起来。四、节省费用的技术手段都有适用边界麦肯锡列举了模型路由、缩短上下文、限制输出、缓存、批处理、控制重试与工具调用以及选择开源权重模型等手段。它们都有价值但不能脱离质量与时效使用。例如报告称提示词缓存可使重复输入 token 的成本最多降低约 90%。这个数字针对可复用的静态上下文尤其适合有稳定前缀的检索增强生成和智能体流程它不是“整个 AI 系统账单减少 90%”。如果每次输入都高度不同或缓存命中率很低实际收益会明显小得多。再如缩短上下文可以省钱但若删掉判断所需的证据后续纠错、重试和人工审核可能花得更多。把所有任务路由到便宜模型也一样只有在事先定义质量门槛并持续测试不同任务的失败率、延迟与风险后“最便宜且够用”才是一条有效规则。本地部署和开源权重模型提供了另一个选择但不能只比较 API 单价与机器电费。自建方案还有硬件折旧、空闲容量、运维、安全、升级和峰值弹性成本云端调用也要考虑数据治理、服务稳定性和供应商依赖。报告提出的“买、建、托管、路由、切换”组合比一次性决定“全上云”或“全本地”更符合企业现实。不同工作负载可能需要不同答案。更深一层看工作流本身往往比模型更值得优化。一个智能体如果因任务定义含糊而反复调用工具即使每次调用都换成便宜模型仍可能是一条昂贵且不可靠的流程。先消除无效步骤再优化剩余步骤的模型与 token用钱买到的才更可能是有效能力。五、对报告数字也应做一次“成本审计”这份报告值得读但其中的节省数字需要细看。正文说约三分之一的受访组织通过主动优化实现了 20%—30% 的节省然而图 3 展示的过去三个月数据中节省21%—30%的受访者占8%节省10%—20%的占25%超过30%的占1%。按图中的区间无法直接推出“约三分之一达到了 20%—30%”。可能存在文字或统计口径问题公开材料没有解释。报告另有“重视 AI 消费的企业可以节省 20%—30%”的说法表述为作者的项目经验。这与调查图表的样本统计不是同一种证据。读者可以把它理解为优化机会的提示却不该直接拿“节省 30%”作为本公司预算承诺。同理报告说预测能力较成熟的企业平均多节省 10% 的 AI 支出属于受访企业之间的关联。它没有证明只要建立预测团队就一定能产生相同幅度的节省。规模、技术基础、业务复杂度和原有浪费程度都可能影响结果。这种审慎并不削弱报告的核心判断反而使判断更有用企业需要自己测量成本曲线与业务结果而不能靠行业平均节省率替代本公司的实验。六、如果由我来落地会先把一条流程算清楚企业很容易听完报告就决定建设覆盖全公司的 AI FinOps 平台。但在平台之前应先挑选一条业务量足够大、结果能够复核的流程例如客服工单、代码审查或合同初审建立一份可信的基线。第一步追踪任务从发起到验收的完整轨迹使用者、业务负责人、模型、输入和输出 token、缓存命中、工具调用、重试、延迟、人工复核时间、最终质量与单位成本。敏感文本可以按权限处理不需要为了计费而无限保存原始内容。第二步对同一类任务小范围比较方案原人工流程、现有 AI 流程、不同模型路由或更精简的工作流。除了平均成本还要比较合格率、人工接管率、耗时和高成本尾部。任何“节省”都应在达到相同质量门槛的条件下计算。第三步再把证明有效的规则做进系统不同任务的模型权限、单任务调用上限、异常循环告警、成本阈值、人工升级路径和持续回归评测。业务部门看到自己的需求带来了多少成本与收益技术团队才知道应该优先改哪条链路。这套顺序背后的管理逻辑很简单先定义什么叫完成再衡量完成的代价最后才谈大规模采购与优化。结语企业购买的不是 token而是可承担成本的能力麦肯锡这篇报告将 CIO 面临的问题说得很清楚AI 普及以后支出不再只由采购合同决定也由每天运行的工作流、模型路由和智能体行为共同决定。成本治理需要进入产品设计和运行架构。但我更想补上一句如果企业把 FinOps 做成一场单纯的“省 token 竞赛”它仍可能算错账。便宜的错误答案会制造返工昂贵但可靠的系统可能替企业避免更大的损失。真正需要优化的是在质量、风险和时效约束下每个合格业务结果的总成本与增量价值。企业 AI 走向成熟的标志或许就是能平静地回答那个在试点阶段常被回避的问题这项能力每月会花多少钱能稳定完成什么任务谁为结果负责以及规模扩大后这笔账是否仍然成立。**资料来源**McKinsey QuantumBlackThe cost of intelligence: How CIOs can manage AI demand at scale2026 年 7 月 20 日尤其参见 PDF 第 2、3、5、7—10 页及图 1—3Longju Bai 等How Do AI Agents Spend Your Money?Stanford Digital Economy Lab2026 年。文中概念式、报告局限和落地建议为笔者分析。
企业数字化 ERP 产品动态
相关推荐
海口柜子先做还是地板先铺,收口 1 指宽怎么处理 先给答案:柜子和地板谁先做,没有通用解。地面铺瓷砖、柜体不做通高落地的,先铺地板后装柜更省事;地面是木地板、柜体要通高落地的,先装柜后铺地板更常见。差别不在对错,在那条收口缝由谁来盖。
不少人问海口… · 2026/9/27 10:06:32
Oracle SQL 优化知识库:构建方案与价值评估 Oracle SQL 优化知识库:构建方案与价值评估文档类型:方案宣讲(讲清楚为什么做、怎么做、优缺点)
适用场景:团队评审、技术分享、方案汇报
配套文档:plans/DESIGN-QDRANT-INTEGRATION.md(技术设计… · 2026/9/27 10:06:26
2026 AI 进化论:从对话框到全能管家,Moltbot、MCP 与 ATA 协议配置实战 /* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/27 21:12:59
咸阳做网站备案卡壳?3步落地最佳实践 咸阳做网站备案卡壳?3步落地最佳实践 备案流程一头雾水,看着工信部ICP备案系统里的条款就发懵,咸阳做网站的老板们是不是都卡在第一步?别急,今天不聊虚的,直接上干货。… · 2026/9/27 21:12:59
告别模板丑站,网站开发过程可分为5步搞定性能优化 告别模板丑站,网站开发过程可分为5步搞定性能优化 别再盯着那些千篇一律的模板网站发呆了,不仅丑得掉渣,加载还慢,客户看一眼就划走,这种“电子垃圾”根本撑不起你的品牌。很多站长以为选个好看的模板就能上线,结果流量进来全流失,核心原因不在内容,… · 2026/9/27 21:12:53
execa 转义与引用机制完全指南:从数组语法、模板字符串到 Shell 安全 开发工具 【免费下载链接】execa Process execution for humans 项目地址: https://gitcode.com/gh_mirrors/ex/execa 点击查看 免费下载 导读
本文深入剖析 execa 的命令参数转义(escaping)与引用(quoting)机制。ex… · 2026/9/27 21:12:34
MATLAB雷达信号脉冲压缩仿真:LFM线性调频、匹配滤波与距离分辨率实现 简介:这套Matlab仿真工具完整呈现雷达信号脉冲压缩过程,从线性调频(LFM)信号生成、目标回波仿真到匹配滤波压缩处理均有可运行代码支撑,面向电子信息工程、计算机、数学等专业学生,适用于课程设计、期末大作… · 2026/9/27 0:00:01
汕头网站建设制作厂家避坑指南:5大注意事项救急 汕头网站建设制作厂家避坑指南:5大注意事项救急 改个需求建站公司拖一周,这种憋屈事我见得太多了。 很多汕头老板找本地建站团队,签合同前看着方案挺美,一上线就变脸。 今天不聊虚的,直接拆解找 汕头网站建设制作厂家 时的5个核心 注意事项… · 2026/9/27 0:00:01
多模态虚假新闻检测实战:BERT+ResNet双塔与对比学习 简介:基于PyTorch的多模态虚假新闻检测项目完整代码包,面向自然语言处理与计算机视觉交叉方向的开发者、科研人员及毕业设计选题者,解决社交媒体中文本与图像联合识别虚假新闻的问题。系统以BERT预训练模型提取文本语义特征,以Res… · 2026/9/27 0:00:01
MATLAB雷达信号脉冲压缩仿真:LFM线性调频、匹配滤波与距离分辨率实现 简介:这套Matlab仿真工具完整呈现雷达信号脉冲压缩过程,从线性调频(LFM)信号生成、目标回波仿真到匹配滤波压缩处理均有可运行代码支撑,面向电子信息工程、计算机、数学等专业学生,适用于课程设计、期末大作… · 2026/9/27 0:00:01
汕头网站建设制作厂家避坑指南:5大注意事项救急 汕头网站建设制作厂家避坑指南:5大注意事项救急 改个需求建站公司拖一周,这种憋屈事我见得太多了。 很多汕头老板找本地建站团队,签合同前看着方案挺美,一上线就变脸。 今天不聊虚的,直接拆解找 汕头网站建设制作厂家 时的5个核心 注意事项… · 2026/9/27 0:00:01
多模态虚假新闻检测实战:BERT+ResNet双塔与对比学习 简介:基于PyTorch的多模态虚假新闻检测项目完整代码包,面向自然语言处理与计算机视觉交叉方向的开发者、科研人员及毕业设计选题者,解决社交媒体中文本与图像联合识别虚假新闻的问题。系统以BERT预训练模型提取文本语义特征,以Res… · 2026/9/27 0:00:01