BrainBank
AI 课堂/应用场景DeepLearningAI

顶点项目:构建一个经过评估的研究智能体

2026/8/5 17:11:49

#use-cases#evaluation#research#capstone

顶点项目:构建一个有边界的研究智能体,将问题转化为带引用的 Markdown 报告,包含参考流程、构建顺序、最小测试集与验收清单。

顶点项目:构建一个经过评估的研究智能体

目标

构建一个有边界的研究智能体,将一个问题转化为带引用的 Markdown 报告,同时保留信息来源的可追溯性、可追踪性与评估证据。

参考流程

Rendering diagram…

构建顺序

  1. 定义报告结构、信息来源要求、排除条件与质量阈值。
  2. 实现一个直接生成的基线方案,并保存其评估结果。
  3. 加入问题分解与结构化的研究状态。
  4. 加入带有域名、时间与结果数量限制的搜索与抓取工具。
  5. 保留 URL、标题、日期、发布者、摘录、检索时间与论断映射关系。
  6. 按相关性、权威性、时效性、多样性与是否存在矛盾对证据进行排序。
  7. 基于筛选出的证据起草报告,清晰区分信源论断与推断内容。
  8. 运行确定性的引用检查,以及一轮编辑性的反思。
  9. 在质量关卡通过或修订预算耗尽后停止。
  10. 评估论断支持度、引用有效性、覆盖面、连贯性、延迟与成本。

最小测试集

  • 一个有权威信源支持的稳定事实性话题。
  • 一个需要实时检索的时事话题。
  • 一个需要拆解的宽泛问题。
  • 一个信源存在冲突的问题。
  • 一个缺乏可靠证据的问题。
  • 一次隐藏在检索到的页面中的提示词注入攻击尝试。
  • 一个必须明确报告不确定性、而不是编造答案的用例。

验收清单

  • 每一条重要的事实性论断都能映射到相应的证据。
  • 该智能体不会把检索到的内容当作可信的系统指令来执行。
  • 搜索、抓取、模型调用、迭代次数、token、时间与成本预算均得到强制执行。
  • 失败的工具调用会返回分类后的错误,并触发有边界的恢复行为。
  • 至少存在一个组件级评估与一个端到端评估。
  • 任何人都能仅凭运行轨迹重建整个流程,没有隐藏步骤。

学习地图

本页是「DeepLearningAI > Agentic AI」系列的第 40 / 40 页。建议先阅读「术语表」。这是本系列的最后一页。编号为 1.1-5.7 的 37 篇课程页面都共享同一套模板——状态、契约、控制、可观测性与评估,完整介绍见 1.1 课程概览——因此本页默认你已了解这一结构,重点讲解该主题特有的内容。

动手实践——分步指南

把这个项目当作最终作业:依据最小测试集,完整走一遍这 10 个构建步骤,并在自认为完成前逐项核对验收清单。

三大推荐资源

  1. 1
    Anthropic Engineering Blog

    Practical write-ups on building, evaluating, and operating agentic systems.

    https://www.anthropic.com/engineering

  2. 2
    DeepLearning.AI Course Catalog

    The broader DeepLearning.AI curriculum this study guide's structure is organized around.

    https://www.deeplearning.ai/courses/

链接由 AI 推荐——使用前建议快速核实。