跳转到内容

生产工程(Production Engineering)

本部分关注让模型行为可能变化的系统在实际运行中变得可衡量、可靠、安全、可治理,并在成本上可持续。它以“架构”部分定义的系统机制为前提,考察这些机制在真实负载、持续变更和故障条件下是否仍然有效。

  • 评估系统与质量门槛 — 将“基础”部分的评估原则落实为版本化资产、持续维护的评估套件、重复试验、不确定性分析、有效性审查和明确的决策门槛。
  • 可观测性与事件响应 — 将任务级证据、相互关联的遥测数据、面向实际结果的异常发现、预先准备的遏制措施和事后改进连接起来。
  • 可靠性、恢复与持久执行 — 讨论故障分类、安全重试、幂等、未知结果、检查点、继续执行、取消、补偿和依赖恢复。
  • 安全、隐私与防护栏 — 讨论完整系统的威胁建模、提示词注入、最小权限、凭据、网络出站控制、沙盒、输出处理、隐私、分层防护栏、供应链风险和对抗性测试。
  • 治理、风险与问责 — 讨论系统清单、风险分类与接受、决策权、政策与义务映射、外部提供方治理、保证活动、受影响方质疑、重新评估和退役。
  • 成本、延迟与容量 — 把单位有效结果成本、端到端与尾部延迟、工作负载预算、排队、容量余量、准入、背压、过载、缓存、异步工作和真实容量测试连接起来。
  • 测试、变更与发布(Testing, Change, and Release) — 讨论确定性测试、集成测试,模型、提示词、工具和技能的版本管理,以及分阶段发布、兼容与回滚;它验证变更是否安全,而不重新定义产品质量评估。