跳转到内容

模型策略与路由

一个智能体系统(agentic system)很少只有一个在所有情境下都最优的模型。适合做分类的模型可能并不擅长长跨度工具使用;能处理最困难情形的模型在常规步骤上可能过慢或过贵。提供商、模型版本、模态、上下文限制、部署位置与安全特性也都会变化。

因此,架构问题并不是“哪个模型最好?”而是:应该由哪些符合条件的配置在何种证据与回退策略下作出哪些由模型介导的决策?

模型路由(model routing)是针对符合条件的模型配置所制订的版本化决策策略。它必须在优化延迟或成本之前,确保任务质量与风险约束得到满足。

一个配置不仅仅是一个模型名。它可能包含提供商与版本、推理或推断设置、工具、响应结构、提示词或适配器版本,以及重试或回退行为。对其中任何一项的更改都可能改变系统行为,并应被视作系统级变更来评估。

从决策类别开始,而非一个覆盖全产品的单一模型

Section titled “从决策类别开始,而非一个覆盖全产品的单一模型”

路由的最小单元应是需求相对稳定的部分。一次运行可能包含多个决策类别:

决策类别 典型需求
意图或文档分类 稳定标签、低延迟、经校准的弃答
证据综合 来源使用、长上下文、引用忠实度
工具选择与参数构造 结构约束遵循、指令遵循、工具使用可靠性
规划 约束处理、分解、基于反馈的修订
高后果推荐 更强证据、保守的不确定性处理、独立校验
面向用户的解释 语言质量、受众适配性、结果的忠实呈现

将一个模型指派给整个“智能体”会掩盖这些差异。这也会让升级变得风险更高:新模型可能提升综合能力,却让工具参数或多语行为倒退。因此,评估应按决策类别与端到端结果报告质量。

在比较质量、成本或速度之前,先剔除无法以负责方式服务该请求的配置。资格条件(eligibility)可能取决于:

  • 所需的模态、上下文容量、结构化输出或工具支持;
  • 数据属地、保留、机密性与租户策略;
  • 在相关评估中证明的语言与领域能力;
  • 最大延迟、可用性与部署约束;
  • 将特定数据或工具暴露给该提供商的权限;以及
  • 要求使用特定命名模型类别、验证器或人工审批的风险规则。

这个顺序很重要。当某个模型无法接收数据、无法表达所需的行动约定,或无法满足强制性质量阈值时,便不是一个有效路由,即便它很便宜。资格判断应能在模型之外被强制执行,并与路由一起记录。

这些选择有关联,但彼此不同:

  • 模型选择:选择系统所支持的基础模型家族与版本。
  • 适配:通过指令、示例、检索、工具、结构化输出、微调或其他提供商支持的控制来改变模型行为。
  • 路由:为某个特定决策在符合条件的配置中进行选择。
  • 升级处理:在结果较弱、检查失败或结果不确定后,消耗额外计算或切换到更强的配置。

不要默认通过微调来修复缺失的上下文、薄弱的工具约定或不正确的控制回路。先定位真实的失败点。只有当受维护的评估数据表明一个可重复的行为差距更适合通过适配来弥补,而不是通过上下文、工具、确定性代码或产品范围来解决时,适配才是合理的。

将每个决策类别映射到一个配置。这通常是最佳起点:易理解、易评估且可预期地运维。它的弱点是每个类别中的请求都会获得相同的能力与成本。

使用可观测属性——模态、语言、文档大小、租户策略、行动风险,或用户选择的模式——来选择路由。当需求能够明确表达时,规则通常很有效。但如果只能根据表面特征推测“难度”,规则就会变得脆弱。

基于学习的生成前路由(pre-generation routing)

Section titled “基于学习的生成前路由(pre-generation routing)”

分类器或学习型路由器(router)在生成之前预测哪个模型能够处理该请求。RouteLLM 展示了基于偏好数据学习到的路由器可以在其评估的基准测试上,在保持所选质量水平的同时降低成本(Ong et al., 2025)。该结果支持“学习路由可行”这一结论,而非普遍节省:性能取决于候选模型、流量分布、标签与阈值。

先运行低成本配置;当其结果未达到置信要求、未通过验证器或质量门槛时,再切换到更强的配置。FrugalGPT 研究了通过组合模型调用来权衡准确度与成本的级联(Chen et al., 2024)。级联可以在简单案例上节省计算,但负责判断是否继续升级的机制会成为关键部件。如果它无法识别那些看似可信的错误,系统就永远不会调用更强的模型。

生成多个候选并进行选择或综合。当多样性有价值且存在可靠评估器时,这会有帮助。候选之间相互关联的错误、额外延迟以及能力不足的选择器,会使该模式不如一次使用强模型。相似模型之间的一致并非独立证据。

这些模式可以组合,但每增加一个分支,行为与评估面就会扩张。

模型自报告的置信度并不是一种与提供商无关的正确性概率。token 概率、文字表达的自信程度、跨样本一致性、路由器分数与验证器分数,衡量的并非同一事物。只有在针对具代表性的结果完成校准后,它们才可能有用。

以可运维的术语定义路由门控:

eligible configurations
task and risk features
selected route and reason code
quality or completion check
escalation condition
fallback behavior when dependencies fail
maximum calls, latency, and cost
evidence retained for evaluation

优先采用与可观测任务条件绑定的门控:输出是否通过结构校验、所需证据是否存在、测试是否通过、策略约束是否满足,或使用错误率已知的评估器。一个看起来很漂亮的答案或很高的自信不应绕过失败的确定性检查。

回退会改变能力,有时还会改变数据处理、工具支持或输出语义。明确每种失败是否允许:

  • 因提供商瞬时错误而在同一配置上重试;
  • 使用同一模型的等效部署;
  • 降级到承诺更窄、能力更弱的模型;
  • 升级到更强的模型;
  • 在应用其资格条件规则后切换提供商;或
  • 返回部分结果、等待、阻塞,或标记失败。

不要在无声无息中将敏感上下文发送给新提供商,也不要让一个未经过评估以提出某项行动的回退模型去执行该行动。优雅的回退可能是“保存本次运行并请用户稍后继续”,而不是“以任意质量给出答案”。

路由应在三个层次进行评估:

  1. 每次决策的质量:每个被路由的调用是否满足其约定?
  2. 端到端结果:系统是否在其控制回路下到达了正确的任务状态?
  3. 策略表现:路由器选择各条路径、执行升级处理、失败或违反延迟与成本限制的频率如何?

按条件分别报告结果,而不仅是给出平均值。路由器可能降低了平均成本,却让错误集中在某种语言、某个租户、少见行动或高风险类别中。将其与简单基线比较:单一强模型、单一便宜模型与一个确定性规则。在测试中纳入提供商故障与模型版本变更。

在提供商支持时固定版本;否则记录实际服务的模型,并在行为变化时重跑发布门控。影子路由(shadow routing)可以比较拟议策略,而不让其影响用户。生产工程(Production Engineering)负责上线、产能与事故处置实践;评估(Evaluation)负责通用的测量方法。本章强调一个架构事实:路由本身是可观测、可版本化的行为。

含糊的难度分数忽视了隐私、工具、模态、风险与任务特定质量。先定义资格条件与决策类别的需求。

没有可靠门控的“最便宜优先”

Section titled “没有可靠门控的“最便宜优先””

系统会接受流利但错误的结果,因为级联没有用于升级处理的独立信号。要测量门控的误接收率,而不仅是升级率。

早期的一次分类就将同一个模型用于规划、行动、验证与解释。在需求不同处按实质性的决策类别进行路由。

提供商失败时静默更换模型或提供商。用户与运维人员无法解释该行为,策略约束也可能被破坏。记录路由,并保持承诺或显式失败。

将公开排名当作本地工作流的证明。基准测试用于告知候选;应用级评估决定资格条件。

分类调用、重复的上下文传输、缓存碎片化与升级处理带来的延迟抹去了预期的节省。测量整条路径。

提示词、工具、输出结构、推理设置与安全设置发生漂移,而仪表板仍把它们归在同一模型标签下。应对完整的行为配置进行版本化。

为每个实质性的决策类别维护一张路由卡(route card):

字段 问题
决策 正在产出的有边界的判断或产物是什么?
资格条件 适用哪些模态、数据、策略、工具与风险约束?
候选 哪些版本化配置通过了相关评估?
策略 静态分配、规则、学习型路由、级联,或并行选择?
门控 依据哪些可测量条件判定通过、升级处理、弃答或失败?
回退 在不改变承诺的前提下,哪些失败允许采用哪些备用路由?
限制 对调用次数、延迟、token 与成本有哪些上限?
记录 保留哪些特征、路由、版本、原因、结果与检查?
复审 哪些分布偏移或模型变更会触发重评?
  • 是否按范围明确的决策类别定义路由,而非模糊的整体智能体“难度”?
  • 数据、模态、工具、策略与风险约束是否在优化之前被强制执行?
  • 每个候选是否是版本化的配置,而不仅仅是一个模型名?
  • 最简单的静态路由是否已作为基线测量?
  • 学习得分与模型自信是否已在具代表性的结果上完成校准?
  • 级联门控能否检测到看似合理但错误的结果?
  • 回退路径是否受相同的资格条件与权限规则约束?
  • 一次运行能否报告所选路由、原因、模型、配置与升级处理历史?
  • 评估是否覆盖按子群体划分的决策质量、端到端结果与策略表现?
  • 模型或提供商变更是否会触发受控的重评与发布?