企业 AI 支出持续上升后,自动分配模型的“模型路由器”开始加快进入主流部署。它通过按任务难度切换不同模型,减少高价模型在简单任务上的消耗,帮助企业压缩 Token 成本。

头部公司加快接入

从企业使用场景看,这类系统正在推动调用方式变化。邮件总结、文档摘要、信息检索等任务,通常可由更轻量的模型完成;只有复杂推理或高精度任务,才需要调用能力更强、价格更高的模型。

OpenAI 推出 GPT-5 系列后,自动按任务复杂度切换模型的做法进一步普及。与此同时,第三方路由器也开始扩展到跨供应商调度,企业可在 OpenAI、Google 和 Anthropic 等模型之间动态分配请求。

日本 AI 实验室 Sakana AI 此前展示的多模型协同系统显示,不同模型已开始呈现更明确的任务分工。例如,数学问题更常被分配给 OpenAI 模型,科学问题则更多路由至 Google Gemini。

企业开始量化降本效果

商业化案例也在增加。Palantir Technologies 推出的 Evolve AI routing system 除了选择模型,还会优化提示词,并减少重复调用。公司披露,在部分案例中,把任务从较强模型切换至轻量模型后,推理成本最高下降 97%。

建筑公司 McCarthy Building 表示,其 AI token 使用量同比下降约 60%,主要原因也是模型调度优化。Databricks 推出的 Unity AI Gateway 也已在内部广泛使用。其首席执行官 Ali Ghodsi 表示,企业之所以重视这类工具,是因为 AI 预算消耗速度过快。

  • Palantir 部分案例推理成本降幅达 97%
  • McCarthy Building 的 token 使用量同比降约 60%
  • Cognition 称其路由系统可将成本压低约 35%

融资与产品同步推进

资本也在跟进这一方向。模型路由平台 OpenRouter 于 4 月完成 1.2 亿美元融资,成为这一赛道受关注度较高的创业公司之一。其自动路由产品允许用户设置成本与质量偏好,再由系统动态选择模型。

公开数据显示,OpenRouter 的路由请求中,约三分之一被分配至 Google 的低成本模型,流向 OpenAI 较强模型的比例约为 10%。该平台还整合了 Not Diamond 等路由技术,并支持跨云服务商调用,以同时优化延迟和价格。

AI 编程公司 Cognition 也推出了自有路由系统。按照文中说法,该系统在编程基准测试中的表现接近前沿模型,但成本下降约 35%。这表明,企业 AI 竞争正在从单纯比拼模型能力,转向比拼调度效率与成本控制。