跳转到内容

框架与供应商比较

观察日期:2026-07-23。

适用范围:LangGraph、OpenAI Agents SDK、Microsoft AutoGen、LlamaIndex 和 CrewAI 的当前维护者文档。

维护状态:持续维护的领域笔记。当某个框架改变核心编排模型、持久化保证、人在回路中支持、可观测性模型、部署假设或兼容性说法时,应重新审阅。

智能体框架和供应商运行框架并没有收敛到同一种抽象。它们强调不同的重心。

有些从图或工作流编排出发,把状态、转换、检查点和人工干预作为明确的设计对象。有些从 agent 对象、工具、移交、防护栏、追踪记录和 session 出发。有些从检索和数据应用出发。有些强调 crews、roles、tasks 和 process models。这些差异很重要,因为它们会影响什么容易构建、测试、观测和治理。

功能清单会掩盖真正的决策。“支持工具”并没有说明工具参数如何验证。“有记忆”并没有说明谁拥有权威状态。“支持人在回路中”并没有说明审批是否绑定到具体操作和状态。“有 tracing”并没有说明追踪记录是否连接到已接受结果、事件和发布版本。

围绕工作负载和生产承诺比较框架。

先从你需要支持的工作出发:交互式助手、编码智能体、研究工作流、支持工单、数据分析作业、长时间运行的业务流程,或多智能体委托。然后问:为了让这个工作负载在生产中可信地运行,必须满足哪些条件?

可以使用这些问题:

维度 比较问题
控制回路 谁决定下一步,运行框架在哪里可以拒绝或修正它?
状态 什么状态是权威状态,什么是派生上下文,什么能在重启后保留?
工具与权限 工具如何声明、授权、验证、沙盒化并审计?
人工控制 人能否在合适的时刻审批、编辑、停止、恢复、升级处理或接管?
评估 同一运行框架能否用有版本的提示词、工具、数据和评分器运行代表性任务?
可观测性 追踪记录能否解释模型决策、工具调用、重试、审批和已接受结果?
发布 行为塑造资产能否被版本管理、分阶段暴露、回滚和比较?
可移植性 哪些部分是标准协议,哪些是框架对象,哪些是托管产品行为?
治理 系统能否关联负责人、策略、风险决策和证据记录?

答案也可能是“不使用框架”。对于工具使用有限、合规要求强或状态语义特殊的窄工作流,一个小型确定性运行框架可能更合适。当通用框架确实减少了真实的编排、持久化、评估和可观测性工作时,它也可能是正确选择。当上线速度比可移植性更重要时,托管供应商运行框架也可能合理,只要依赖关系被明确记录。

不要脱离工作负载给框架排名。适合重检索分析的框架,可能不适合长时间运行的审批。图运行时对一个小型起草工具来说可能过重。托管 SDK 可以快速集成,但也可能限制底层控制。

不要把维护者文档视为生产适配性的证明。它说明框架打算暴露什么,却不能证明你的迁移路径、延迟画像、安全控制、事件流程或用户体验。

不要让框架词汇替代 Fieldbook 词汇。如果某个框架有 AgentToolActionFlowTaskMemory 对象,在做设计决策前,要把它映射回模型能力、系统能力、权限、状态、控制回路和已接受结果。

  • 在比较工具之前,定义工作负载、用户群体、后果等级、运行时长、数据敏感性和所需证据。
  • 做一个包含失败路径的小型代表性验证,而不只是快乐路径 demo。
  • 测试重启、取消、重复工具调用、延迟回调、策略拒绝、人工审批和审计重建。
  • 确认状态、记忆、追踪记录、提示词、工具、评估器和发布标签是否可以导出或迁移。
  • 识别哪些行为属于开放协议、框架代码、托管产品功能,以及你自己的运行框架。
  • 审查许可证、部署模型、依赖更新策略、安全模型和支持预期。
  • 只有当某个框架功能移除了真实的本地职责,或让该职责更容易验证时,才采用它。