研究与知识工作智能体
研究与知识工作智能体承诺比人手工更快地搜索、阅读、比较、总结和综合信息。它们有用,是因为很多知识工作不是一次检索就能解决的问题。系统可能需要改写查询、打开来源、跟踪引用、比较主张、发现冲突,并产出一份人可以据此行动的备忘录。
同样的灵活性也带来了核心风险。研究智能体可以生成一份流畅的答案,但其中的引用并不支持主张,来源已经过时,不确定性被埋起来,缺失证据也不可见。在研究工作中,流畅往往是交付物里最不重要的部分。
当研究智能体被设计成证据分拣与综合系统时,它才有价值:每一项重要主张都应连接到可检查的来源、日期、范围、不确定性和可被审查者挑战的缺口。
已接受结果不是“一个答案”,而是一份带证据链路的有边界答案。证据链路应足够紧凑,便于阅读;也应足够具体,便于审计。
从研究决策出发
Section titled “从研究决策出发”研究智能体的任务适配取决于这项工作要支持什么决策:
- 为团队规划会议做背景扫描;
- 在专家深入审查前进行文献搜索;
- 带日期来源链接的市场或竞品摘要;
- 政策或标准比较;
- 识别来源和未解决问题的尽调备忘录;
- 跨内部文档的知识综合。
这些任务后果不同。低风险扫描可以接受更大的不确定性和更快周转。法律、医疗、金融、安全或合规问题可以让智能体收集和组织证据,但负责任的结论必须属于有资质的人或流程。
产品承诺应说明工作层级。“查找并总结来源”不同于“建议监管策略”。“准备文献地图”不同于“判断临床相关性”。当下游决策后果严重时,智能体应暴露审查需求,而不是把它们磨平。
来源发现是受控回路
Section titled “来源发现是受控回路”研究智能体通常需要一个观察、决策、行动回路:
- 解释问题并识别易变术语。
- 选择搜索策略和来源类别。
- 打开来源并记录访问日期。
- 提取主张、日期、定义和限制。
- 比较来源之间的一致、冲突和覆盖缺口。
- 当证据薄弱或单侧时修正搜索。
- 产出综合结论,并把引用绑定到具体主张。
OpenAI 的 Deep Research 材料和 BrowseComp 基准说明,困难网页任务需要持续浏览和可验证答案(OpenAI Deep Research System Card;BrowseComp)。GAIA 同样用需要推理和工具使用的多步问题测试助手,而不是只测试单轮回忆(Mialon et al., 2023)。
工程启示不是“浏览型智能体天然可靠”,而是搜索与综合是有状态过程。系统必须记住尝试过什么、找到了什么、拒绝了什么,以及哪些主张仍缺乏支持。
引用是主张,不是装饰
Section titled “引用是主张,不是装饰”引用只有在回答三个问题时才有用:
- 这个来源支持哪一项主张?
- 这个来源的日期、版本和范围是什么?
- 读者应记住什么限制?
研究智能体界面不应把原始引用堆在末尾,让读者倒推论证。来源应出现在主张附近,或进入可追溯的证据表。被引用的来源不能只是包含相似词语;它应支持正在提出的命题。
来源类型很重要。产品文档可以证明该产品声称支持什么。系统卡可以描述提供方的安全框架和已知限制。经同行评审的论文可以在其条件下支持经验或理论主张。法规或标准可以确立适用范围内的义务或定义。博客文章可以保存提供方或实践者经验。这些来源不能互相替代。
把不确定性作为一等结果
Section titled “把不确定性作为一等结果”研究智能体应显式表示这些状态:
- 证据不足;
- 来源互相冲突;
- 来源陈旧或未注明日期;
- 无法访问原始来源;
- 来源集中在单一供应商或地区;
- 术语尚未澄清;
- 需要专家审查。
NIST AI 600-1 强调生成式 AI 系统中的来源与流转记录、数据沿袭、验证和生命周期风险(NIST, 2024)。放到研究产品里,这意味着来源链路、转换说明和不确定性声明。用户不仅要看到智能体得出了什么结论,还要看到它无法确认什么。
不确定性不应变成套话。“我可能会错”几乎没有用。更好的说法是具体的:
- “我只找到了该 API 行为的供应商文档,没有找到独立实现证据。”
- “该标准摘要公开,但规范性全文需要付费。”
- “该来源持续更新,未暴露稳定发布日期。”
- “最强证据来自基准任务,而不是生产部署。”
| 选项 | 最适合 | 主要风险 |
|---|---|---|
| 检索式回答 | 在可信语料上的窄问题 | 漏掉外部变化或冲突来源 |
| 浏览型研究智能体 | 开放网页扫描、当前事实、来源发现 | 引用漂移、来源质量错误、页面过时 |
| 语料综合智能体 | 内部文档、企业知识、政策比较 | 权限泄露和未审查的内部矛盾 |
| 多智能体研究系统 | 搜索空间广、子题可并行 | 协调开销和引用标准不一致 |
| 专家辅助研究流程 | 高风险审查准备 | 人类审查者可能过度信任流畅综合 |
Anthropic 关于多智能体研究系统的工程文章有价值,因为它展示了把广泛研究拆给并行智能体的收益与成本(Anthropic, 2025)。并行可以扩大覆盖面,但也提高了来源规范化、冲突处理和最终综合的要求。
- 引用洗白。 智能体引用了可信来源,但该来源并不支持具体主张。
- 搜索近视。 早期查询词固定了搜索方向,排除了更好的来源类别或反方证据。
- 时间坍缩。 旧来源、未来来源、草案和当前资料混在一起,没有日期。
- 权威混淆。 供应商文档、法律、研究、标准和社区报告被当成同一种证据。
- 综合过度。 智能体把有限证据扩展成宽泛建议。
- 隐藏缺口。 缺失原始来源或无法访问全文的事实从最终答案中消失。
- 不安全个性化。 智能体把收件人无权看到的私有或内部知识用于输出。
本手册的判断
Section titled “本手册的判断”围绕证据义务设计研究智能体。要求重要主张有主张到来源的映射。对易变来源记录访问日期。保留来源类型和限制。当证据不完整时,让智能体能够返回部分结果。
将研究工作与问责判断分开。智能体可以收集、比较和起草。需要专业知识、风险接受或组织权限的决策,仍由负责任的行动者拥有。
让证据链路真正可用。原始浏览追踪对多数读者太吵,而只有引用的答案又太薄。更好的产物通常是一份综合结论,附带紧凑来源说明、带日期的参考资料和明确的未解决问题。
- 产品承诺是否区分证据收集、综合、建议和决策权限?
- 当主张受影响时,是否记录来源类别、日期、司法辖区和版本?
- 每一项重要主张是否能追溯到真正支持它的来源?
- 智能体是否暴露冲突、陈旧、无法访问或单侧的证据?
- 内部文档和私有数据是否限制在收件人授权范围内?
- 高风险领域是否包含专家审查流程?
- 引用是否保留在主张附近或进入可用的证据表?
- 评估是否测试引用支撑关系,而不只是答案是否有帮助?
参考文献及其使用方式
Section titled “参考文献及其使用方式”- OpenAI Deep Research System Card - OpenAI 系统卡,用于当前浏览、来源使用、限制和安全框架。
- OpenAI BrowseComp - 基准报告,用于说明困难网页研究需要持续浏览和可验证答案。
- Mialon et al., “GAIA: a benchmark for General AI Assistants” - 研究基准,用于支持多步、带工具问答的证据。
- Anthropic, “How we built our multi-agent research system” - 工程文章,用于支持并行研究模式及其协调限制。
- Amershi et al., “Guidelines for Human-AI Interaction” - 经同行评审的人机交互论文,用于支持不确定性、纠正和期望设定。
- NIST AI 600-1, “Generative Artificial Intelligence Profile” - 自愿性风险管理资料,用于来源与流转记录、沿袭、验证和生命周期风险框架。