大模型服务商陆续从订阅制转向按 token 计费后,企业内部的 AI 使用成本开始快速上升。麦肯锡表示,公司目前没有通过硬性限额压缩员工使用,而是先让高频用户清楚看到自己的消耗情况,再配合技术手段提升效率。

10% 用户消耗了 65% 用量

麦肯锡旗下 AI 业务负责人 Patnaik 表示,公司把这类提醒机制比作企业手机流量提示,重点不是阻止员工使用,而是告诉他们怎样以更低成本完成同样的工作。

公司博客数据显示,到 2026 年 5 月,麦肯锡每月处理约 5 万亿 AI token。用量分布并不平均,约 10% 的用户占到总消耗的 65%。其中,顾问和软件工程师是最主要的使用群体。

  • 月处理量约 5 万亿 token
  • 约 10% 用户消耗 65% 总量
  • 高用量人群主要是顾问和工程师

内部网关和熔断机制已上线

Patnaik 说,麦肯锡目前的 AI 支出还没有到失控阶段,因为多数使用场景仍集中在个人效率提升和更快交付客户项目,这类投入的收益暂时仍高于成本。

不过,公司已经增加了多层控制措施。其内部 AI 网关会在请求发送给模型服务商前先做优化;当某些场景出现异常高的 token 消耗时,系统还会临时暂停访问,先判断这类使用是否真正产生价值。

此外,麦肯锡也在使用缓存机制,把重复问题的答案复用,减少重复调用。公司还会把不同业务线的消耗统一管理,而不是把未使用额度锁定在单独许可中。

咨询行业开始集中压缩 token 支出

类似做法也出现在其他咨询公司。安永表示,公司已设立专门团队管理 AI 投入,并在部分专业工具后端部署路由系统,把员工请求分配给更适合任务的模型。安永称,自 4 月以来,这套系统配合治理措施已将 token 消耗压低 60%。

德勤美国一名高级软件工程师则在今年 6 月表示,GitHub 调整计费方式后,开发者很快就会用完新的月度额度,团队对工作节奏的预期也因此受到影响。

Patnaik 还表示,麦肯锡已在今年春季正式设立相关业务,帮助客户以更低成本部署 AI。其建议不是单看每名员工用了多少 token,而是看完成一个结果需要多少成本。如果只追求更少的 token,反而可能压制本来有价值的 AI 使用。