跳转到内容

多智能体系统

多个智能体(multi-agent)可以探索彼此独立的路径、隔离上下文,并为同一目标引入专用工具或权限。它们也可能重复工作、放大相关错误、覆盖共享状态,并以递归委托隐藏成本。智能体数量不是系统成熟度的度量。

仅在清晰边界——并行性、专精、上下文隔离、权限分离或独立评审——带来的价值大于其引入的协调成本时,才使用多个智能体。

每个智能体仍然是一个受明确边界约束的控制回路。多智能体层还必须提供任务所有权、通信约定、共享状态规则、总量限制、终止条件与失效隔离。仅靠群聊本身并不能提供这些能力。

先问是否真的需要另一个智能体

Section titled “先问是否真的需要另一个智能体”

若干机制常被误认为是多智能体架构:

  • 在确定性工作流中于多步调用同一个模型;
  • 并行检索或批处理作业;
  • 来自同一模型的多次采样;
  • 以两个提示词实现的规划器与验证器;
  • 一个内部包含模型调用的工具;或
  • 在同一对话中设置多个人格。

这些可能有用,但只有当它们需要各自独立的目标、上下文、行动、反馈、状态与停止条件时,创建独立的智能体回路才会增值。

可被证明合理的边界包括:

  1. 并行探索:独立分支可减少总耗时或提升覆盖度。
  2. 专精:领域、语言、工具集或模型配置能明显改善一个范围明确的任务。
  3. 上下文隔离:中间细节会淹没协调者,但可通过约定进行摘要。
  4. 权限分离:不同身份或审批应约束不同的行动。
  5. 独立评审:单独设计并评估的流程可对产物或决策提出质疑和检查。

不要仅因两个智能体有不同角色提示词、却共享相同的模型、证据与失效假设,就声称它们是独立的。

拓扑 适用情形 主要风险
协调者—执行者 单一所有者可分解并整合有边界的子任务 协调者成为瓶颈以及摘要信息丢失
移交链 职责沿不同阶段或专长流转 传话游戏式上下文流失与不清晰的所有权
同侪协作 同侪需协商或结合互补视角 对话膨胀且缺乏最终权威
共享任务板或黑板 工作动态变化,任务可从公共状态中被认领 竞争争用、重复认领与记录陈旧
辩论或评审 候选方案受益于结构化挑战 相关错误与无证据的选择

Anthropic 报告其研究产品采用协调者—执行者设计,使用并行子智能体探索不同方面,由主导智能体综合结果(Anthropic, 2025)。其公开经验包括显著增加的 token 成本,以及协调与评估方面的挑战。这只是对某一类研究工作负载的证据,而非适用于事务型或低延迟系统的默认模板。

AutoGen 展示了一个框架,用于在示例应用中通过模型、人员与工具之间的可配置会话来进行智能体协调(Wu et al., 2023)。该研究展示了会话式协调的灵活性;应用正确性仍取决于明确的约定与基于环境的评估。

一次委托请求应包含:

parent run and task ID
bounded objective and exclusions
required inputs and source versions
expected output schema or artifact
success and failure evidence
allowed tools, authority, data, and destinations
time, token, cost, and recursion limits
deadline, cancellation, and progress reporting
return, escalation, and ownership rules

执行者应返回状态、证据、产物、假设、未解决问题、尝试过的行动,以及已经生效或结果未知的操作。当父级必须决定子任务是否成功时,仅说“这是我找到的内容”并不足够。

除非明确转移并被接受,父级仍对被委托的目标负责。委托不会自动转移请求者的权限;子级能力不应宽于任务所需。

自然语言消息有助于解释,但在并发方面较弱。请维护共享的结构化记录,用于:

  • 任务 ID、所有者、租约、依赖与状态;
  • 输入与产物版本;
  • 断言与证据标识符;
  • 已生效与待生效的操作;
  • 预算与子级计数;
  • 取消与截止时间;以及
  • 合并条件与最终决策所有者。

使用乐观并发、租约、分区所有权或其他合适机制,避免执行者在没有提示的情况下相互覆盖。消息应引用共享记录,而非复制一份日益陈旧的世界状态。

在创建执行者之前,先定义如何划分工作。合理的划分方式可以依据数据源集合、假设、领域、产物或独立测试,而不是使用“换个角度看看”之类含糊的提示词。除非确实需要独立复现,否则应避免让每个执行者都接手完整问题。

在合并处应当:

  1. 按各自约定验证每个结果;
  2. 用证据调和重复或冲突的断言;
  3. 识别缺失的分支与失败的执行者;
  4. 保留不确定性,而不是强行达成共识;
  5. 检查总预算与已经产生的影响;以及
  6. 对父级目标进行独立验证。

共识不代表真实。多个智能体可能复现同一来源错误或模型偏差。应根据证据与方法独立性为断言加权,而非根据票数。

能创建子级的子级会形成任务树或图。需在运行与根级同时施加限制:

  • 最大活跃执行者数量与委托深度;
  • 总体与每子级的 tokens、调用、成本、时间与工具行动;
  • 全局速率与外部影响限制;
  • 最大重试次数与无进展循环;
  • 从父级继承的截止时间;以及
  • 取消的传播。

预算预留可防止每个子级都消耗父级的全部额度。追踪记录应把子级的资源使用和外部影响汇总到根任务,使看似单一的请求体现其真实成本与风险。

某个执行者的格式错误输出、提示注入、技能被攻陷或失控循环,不应污染所有其他执行者。应采取:

  • 具备最小权限的执行者身份与能力;
  • 数据最小化与租户隔离;
  • 边界处的结构化结果校验;
  • 将不受信内容与协调指令分离;
  • 断路器与子级终止;
  • 不可变的证据引用;以及
  • 明确的部分失效策略。

决定父级在缺失分支时能否成功、是否必须重试、是否应缩小其断言,或必须升级处理。将不完整的综合结果作为完全成功上报,会掩盖失效。

将架构与更简单的基线进行对比评估

Section titled “将架构与更简单的基线进行对比评估”

将多智能体设计与在相同总预算下的单智能体,以及(适用时)与确定性并行工作流进行比较。测量:

  • 端到端任务成功率与重复试验的可靠性;
  • 覆盖度与证据质量;
  • 总耗时与总计算量;
  • 重复工作与协调开销;
  • 移交损失与冲突率;
  • 子级失效隔离与取消延迟;以及
  • 在部分失效下的结果质量。

Anthropic 的报告指出,其多智能体研究系统消耗的 tokens 远高于聊天,且优势主要体现在可并行方向的广度优先任务上。将此类厂商测量视为针对特定工作负载的动机,用以开展本地对比。

为每个角色标签都设一个智能体

Section titled “为每个角色标签都设一个智能体”

规划者、研究者、写作者、批评者与管理者被拆成独立回路,却没有可测量的边界。从函数或工作流步骤起步;只有当需要独立自适应时才加入智能体。

每个执行者都能继续创建子任务并获得完整预算。成本与副作用会在不易察觉的情况下增长。应汇总资源,并限制深度与并发。

每个智能体都转述上一份摘要,最终使证据与约束逐渐丢失。应通过结构化的移交字段传递产物与证据引用。

多个执行者在同一段对话中读写,却没有任务所有权或版本控制。应使用结构化任务板与冲突控制。

相似的智能体达成一致,系统便将断言视为已验证。要求提供证据或独立方法,并保留异议。

同侪产出多个方案,却无人对综合结果负责。明确决策与完成的所有者。

协调者在执行者超时后仍写出流畅答案。应显式呈现缺失的分支并收窄结论。

在添加一种执行者类型之前,先填写此记录:

字段 问题
边界 哪种并行性、专精、上下文、权限或评审收益需要一个单独回路?
基线 为什么单智能体或确定性工作流不够?
约定 哪些目标、输入、输出、证据、权限与限制跨越该边界?
状态 在哪里记录任务所有权、版本、产物与外部影响?
协调 如何处理工作认领、冲突、合并与缺失结果?
隔离 如何隔离数据、工具、失效、注入与取消?
预算 哪些根级与子级限制可防止递归膨胀?
评估 哪项实测收益足以证明总成本与复杂性是合理的?
  • 每个智能体边界是否都有比更简单机制更具体的收益?
  • 每个子级是否都有范围明确的目标、结果约定、权限、截止时间与预算?
  • 任务与结果状态是否结构化、具备版本控制,并与对话文本分离?
  • 并行分区是否足够独立,且具备明确的合并与冲突规则?
  • 是否有明确的所有者对父级结果负责?
  • 子级权限是否不宽于或等于被委托的权限?
  • 是否在根级约束了递归、并发、总成本、工具行动与外部影响?
  • 取消与截止时间是否会向子级传播?
  • 最终结果中是否可见部分失效、缺失分支与异议?
  • 评估是否在公平预算下对比了单智能体与确定性基线?