顶点项目:构建一个经过评估的研究智能体
2026/8/5 17:11:49
#use-cases#evaluation#research#capstone
顶点项目:构建一个有边界的研究智能体,将问题转化为带引用的 Markdown 报告,包含参考流程、构建顺序、最小测试集与验收清单。
顶点项目:构建一个经过评估的研究智能体
目标
构建一个有边界的研究智能体,将一个问题转化为带引用的 Markdown 报告,同时保留信息来源的可追溯性、可追踪性与评估证据。
参考流程
Rendering diagram…
构建顺序
- 定义报告结构、信息来源要求、排除条件与质量阈值。
- 实现一个直接生成的基线方案,并保存其评估结果。
- 加入问题分解与结构化的研究状态。
- 加入带有域名、时间与结果数量限制的搜索与抓取工具。
- 保留 URL、标题、日期、发布者、摘录、检索时间与论断映射关系。
- 按相关性、权威性、时效性、多样性与是否存在矛盾对证据进行排序。
- 基于筛选出的证据起草报告,清晰区分信源论断与推断内容。
- 运行确定性的引用检查,以及一轮编辑性的反思。
- 在质量关卡通过或修订预算耗尽后停止。
- 评估论断支持度、引用有效性、覆盖面、连贯性、延迟与成本。
最小测试集
- 一个有权威信源支持的稳定事实性话题。
- 一个需要实时检索的时事话题。
- 一个需要拆解的宽泛问题。
- 一个信源存在冲突的问题。
- 一个缺乏可靠证据的问题。
- 一次隐藏在检索到的页面中的提示词注入攻击尝试。
- 一个必须明确报告不确定性、而不是编造答案的用例。
验收清单
- 每一条重要的事实性论断都能映射到相应的证据。
- 该智能体不会把检索到的内容当作可信的系统指令来执行。
- 搜索、抓取、模型调用、迭代次数、token、时间与成本预算均得到强制执行。
- 失败的工具调用会返回分类后的错误,并触发有边界的恢复行为。
- 至少存在一个组件级评估与一个端到端评估。
- 任何人都能仅凭运行轨迹重建整个流程,没有隐藏步骤。
学习地图
本页是「DeepLearningAI > Agentic AI」系列的第 40 / 40 页。建议先阅读「术语表」。这是本系列的最后一页。编号为 1.1-5.7 的 37 篇课程页面都共享同一套模板——状态、契约、控制、可观测性与评估,完整介绍见 1.1 课程概览——因此本页默认你已了解这一结构,重点讲解该主题特有的内容。
动手实践——分步指南
把这个项目当作最终作业:依据最小测试集,完整走一遍这 10 个构建步骤,并在自认为完成前逐项核对验收清单。
三大推荐资源
- 1Anthropic Engineering Blog
Practical write-ups on building, evaluating, and operating agentic systems.
https://www.anthropic.com/engineering
- 2DeepLearning.AI Course Catalog
The broader DeepLearning.AI curriculum this study guide's structure is organized around.
https://www.deeplearning.ai/courses/
链接由 AI 推荐——使用前建议快速核实。