MLog
返回文章列表
Tech#模型路由#AI基础设施#LLM#成本优化

模型路由:当 AI 不再拼「谁最强」,而是拼「谁最省」

发布于: 2026年7月18日阅读时长: 13 min

2026年,企业AI部署的核心命题正在从「哪个模型最聪明」转向「如何让多个模型协同工作且不破产」。模型路由(Model Routing)通过智能分发请求到不同能力和成本的模型,可在保持质量的同时降低60%-80%的推理成本。本文拆解了从静态规则到学习路由器的技术演进、断路器与优雅降级等韧性设计,以及Perplexity混合推理的商业化实践。

一个出人意料的转折正在2026年的AI行业发生:最聪明的模型不再自动等于最好的产品。

过去两年,所有人都在追问「哪个模型基准测试分数最高」。但到了2026年,真正决定产品竞争力的,不再是单一模型的峰值性能,而是如何在质量、成本、延迟和合规之间找到最优解。这个问题的答案,指向了一个正在快速成熟的技术领域——模型路由(Model Routing)。

算一笔账:单一模型的隐性成本

先看一组来自 Zylos Research 的真实数据。

假设一家企业有250名员工,每人每天使用AI进行5次查询。如果所有请求都发给 Claude Opus 4.8($5/$25 每百万输入/输出 token),年度成本约为 24.4万美元。但如果引入智能路由——70% 的简单查询发给 Haiku($1/$5),20% 中等复杂度发给 Sonnet($3/$15),仅10% 真正复杂的任务才调用 Opus——同样的工作负载年成本骤降至 6.2万美元

降幅 75%,且大部分请求的质量感知几乎没有区别。

这不是理论推演。2026年,37% 的企业已在生产环境中运行5个或更多不同的大语言模型。这些企业学到的核心经验是:模型选择不是一次性的技术决策,而是一个持续运行的空中交通管制问题。

路由架构的三层演进

第一层:静态规则路由

最朴素的方案:事先定义一些 if-else 规则,根据任务类型标签、prompt 长度或用户等级将请求导向不同模型。例如:

  • 标记为「文本提取/分类」→ Haiku
  • 少于500 token 且无工具调用 → Sonnet
  • 多步推理或代码生成 → Opus

优点在于零额外延迟、成本完全可预测。缺点是脆弱——一个被错误标记的复杂 prompt 可能被路由到弱模型,产生无法恢复的劣质输出。静态规则需要持续的人工维护,且随着任务分布变化而快速过时。

AWS Bedrock 的 Intelligent Prompt Routing(2025年4月正式上线)是这类方案的商业化代表:在同一模型家族内(如 Claude Haiku / Sonnet / Opus)自动路由,AWS 报告典型企业工作负载可降低 30% 成本而无精度损失。

第二层:学习型路由器

学术界的答案是用机器学习来替代人工规则。

RouteLLM(ICLR 2025)将这个问题的核心提炼为一个二元分类问题:给定一个 prompt,该发往强模型(高质量、高成本)还是弱模型(低质量、低成本)?研究团队基于 Chatbot Arena 的人类偏好数据训练了一个元分类器,最终在 MMLU 和 MT-Bench 上以不到2倍的成本实现了接近强模型的质量。更关键的是,这个路由器具有泛化能力——即使推理时更换底层模型,它依然能做出合理的路由决策。

Not Diamond 走得更远:它训练了一个元模型来预测「哪个具体模型」在给定查询上表现最好,不仅区分强弱,还在异构模型舰队中做精准匹配。它还附带 prompt 改写能力,自动将输入调整到匹配目标模型的训练分布。SAP 已在 Generative AI Hub 中集成了 Not Diamond,IBM Ventures 也对其进行了投资。

MasRouter(ACL 2025)则将路由概念扩展到了多智能体场景:它不仅决定用哪个模型,还动态构建多智能体的协作模式(辩论、流水线、集成),为每个角色分配模型,并通过级联控制器网络统一调度。在 MBPP 基准上,MasRouter 以最高减少 52% token 开销的代价,取得了 1.8%-8.2% 的性能提升。

第三层:置信度级联

级联(Cascading)是一种更精巧的省钱策略:先用廉价模型处理请求,只有当输出置信度低于阈值时才升级到更强模型。

听起来简单,但核心挑战是置信度校准——模型对自己输出质量的自我报告往往不可靠。研究表明,基于隐藏状态的探针方法(trained probes)和基于困惑度的方法,在判断输出正确性上远优于让模型自述「你有多自信」。

2025年提出的「推测级联」进一步优化了这一模式:它结合自回归草稿生成与并行验证来决定是否升级,在摘要、翻译、推理、编程和问答等多个基准上,均在成本-质量帕累托前沿上超越了标准级联和推测解码。

生产环境中的一个典型三级级联可能如下:

  1. 请求先发往 Haiku,提取关键 token 的对数概率
  2. 困惑度低于阈值 T1(高置信度)→ 直接返回
  3. 困惑度在 T1 和 T2 之间 → 升级到 Sonnet
  4. 仍低于 T2 → 最终升级到 Opus

阈值需要基于标注评估集离线校准,且模型版本变更后必须重新校准。

韧性设计:当模型不可用时

路由不仅是为了省钱,也是为了生存。主流 LLM API 的 SLA 在 99%-99.5% 之间,这意味着单一供应商依赖每年会经历数小时的降级。

断路器模式是解决方案的核心。每个模型端点被包裹在一个三态断路器中:

  • 闭合(正常):请求正常通过,失败计数递增
  • 断开:错误率超过滑动窗口阈值,所有请求立即快速失败,不发起网络调用
  • 半开:定时器到期后,允许一条探测请求通过。成功则恢复闭合,失败则回到断开并加倍等待时间

生产环境的保守起点:断开时长从30秒开始,每次连续失败翻倍,上限5分钟。

但断路器还不够。2025年8月曾有一家主流供应商同时出现三个 bug,导致响应质量持续数周下降——但 HTTP 状态码一切正常。依赖状态码的路由系统对此类故障完全盲视。唯一的防御手段是语义质量检查:对响应采样进行 LLM-as-judge 评估,或检测输出长度异常。

优雅降级策略同样关键。当主模型不可用,路由层应有定义好的回退链:

  1. 同级别回退:尝试另一家供应商的同等级模型(如 Opus → GPT-4o)
  2. 降级回退:退到自身体系内的下一级(如 Opus → Sonnet),并通知调用方质量可能下降
  3. 优雅失败:返回结构化错误,由调用应用决定是排队重试还是走其他路径

关键是让降级对应用层可见。静默回退到低等级模型会让所有质量问题看起来像是系统性的,几乎无法定位。

产业实践:Perplexity 的混合推理

理论之外,Perplexity 在2026年的实践提供了一个生动的商业案例。

在 Computex 2026 上,Perplexity 与 Intel 联合发布了混合推理编排器:它能自动在用户本地设备和云端前沿模型之间路由 AI 工作负载,无需用户干预。超过90%的请求走的是 Perplexity 自研的开源模型,仅少量真正复杂的查询才会触达闭源顶级模型。

这套架构的韧性在2026年6月经历了一次戏剧性的压力测试。6月12日,Anthropic 因美国商务部紧急管制指令,其 Claude Fable 5 和 Mythos 5 模型上线仅72小时即被全球关停。重度依赖 Anthropic API 的 AI 搜索竞品在72小时内付费用户流失率超过32%。而 Perplexity 同期的用户流失率不到 2%,周留存率反而环比提升了 17%

原因很简单:它的路由系统里,绝大部分请求根本不依赖 Anthropic。公司甚至在这段时间承接了大量从竞品流失的付费用户。

这是一个有力的证明:多模型路由不仅是成本优化工具,更是业务连续性的战略资产。

展望:路由的未来

如果说2024-2025年 AI 的叙事是「更大的模型、更强的能力」,那么2026年的叙事正在变成「更聪明的调度、更经济的部署」。

几个值得关注的趋势:

端云混合路由正在从概念进入产品。Perplexity 的混合推理预计将30%的查询转移到本地设备,云端算力成本可降低约30%。一旦这条路径跑通,AI 产品的毛利率模型将被彻底改写。

多智能体路由将路由的概念从「选哪个模型」扩展到「构建什么样的协作结构」。MasRouter 的工作已初步证明,动态编排 multi-agent 架构可以获得比固定流程更好的效果。

开源生态正在让路由变得更加自主可控。开源模型的能力快速逼近闭源顶级模型,使得企业可以构建「完全自托管+仅关键任务上云」的路由策略,既享受低成本又规避供应链风险。

一个行业正在成熟的标志,是它开始认真讨论 ROI 而不再只是讨论性能。模型路由的兴起,恰恰说明 AI 产业正在跨过那道从「能不能」到「值不值」的门槛。

而这,可能比任何新的基准测试分数都更重要。