BrainBank
AI 课堂/应用场景DeepLearningAI

邮件助手工作流

2026/8/5 17:11:48

#tool-use#use-cases#email

邮件助手工作流:何时使用、为何有效、它在智能体系统中的位置,以及如何实现、评估并在生产环境中加固它。

3.5 邮件助手工作流

学习目标

完成本节后,你应当能够:

  • 解释邮件助手工作流对智能体系统的贡献。
  • 判断何时该使用它、何时更简单的设计就已足够。
  • 将该模式实现为可观察、可测试的组件。
  • 识别其主要的成本、安全与可靠性风险。

何时使用

将邮件智能体用于分类、起草、检索,以及需要明确审批才能发送的受控操作。

为何有效

邮件场景同时涉及不可信内容、敏感数据、身份识别,以及具有实际后果的副作用。

它在系统中的位置

Rendering diagram…

箭头表示控制流与数据流的走向,不一定对应不同的模型。图中的方框可以由一个确定性函数、被多次调用的同一个模型,或多个不同模型来实现。在整个流程中应保留追踪标识符(trace identifiers)。

分步实现

  1. 对用户意图进行分类。 在实现之前,先写清楚输入、预期输出、负责人和失败条件。
  2. 解析并核实收件人。 让这一决策在日志或结构化状态中可被观察,以便后续评估。
  3. 只检索所需的上下文。 在此边界处应用最小权限原则,并验证相关假设。
  4. 起草但暂不发送。 记录结果以及足够复现或诊断所需的元数据。
  5. 检查语气、附件与敏感内容。 在继续之前,将结果与明确的验收标准进行比较。
  6. 要求用户确认。 依据既定策略,将失败情形导向重试、回退方案,或人工审核。
  7. 发送并记录结果。 把观察到的行为加入回归测试集与运维记录中。

技术实现要点

  • 状态(State): 在结构化的运行记录中保存消息、工具调用、观察结果、产出物、决策理由、尝试次数、token 用量、延迟以及最终状态。
  • 契约(Contracts): 为每个组件定义带类型的输入、带类型的输出、允许的副作用、超时时间和错误类别。
  • 控制(Controls): 使用最小权限凭证、白名单工具、有界循环、输入校验、输出校验,并为有实际影响的动作设置审批关卡。
  • 可观测性(Observability): 在符合隐私规则的前提下,记录 prompt 或其版本、模型与参数、工具参数、工具结果、异常、时间戳和成本。
  • 评估(Evaluation): 测试具有代表性的案例、边界案例、对抗性案例和失败恢复案例,并与最简单可行的基线进行比较。

实例演示

对于「回复 Alex」这类请求,先确认是哪一位 Alex,起草回复内容,展示收件人,然后等待审批。

输入:用户目标 + 约束条件
状态:{run_id, step, observations, budget, status}
决策:下一个有边界的动作
校验:权限、参数与策略
执行:模型调用、确定性代码或工具
观察:结构化结果或分类后的错误
停止:验收标准通过、预算用尽,或转交人工

失败模式与应对措施

失败模式信号应对措施
目标含糊输出看似流畅却偏离了任务把需求转化为可衡量的验收标准
无界循环反复调用却没有实质性进展设置迭代次数、token、时间与成本上限
中间状态有误后续步骤放大了早期的错误校验每个组件的契约并保留追踪记录
不安全的副作用工具尝试进行未经授权的更改应用授权机制、最小权限、演练模式(dry-run)与审批关卡
评估盲区演示成功但真实案例却失败用贴近生产环境的案例和对抗性案例扩充测试集

验证清单

  • 该使用场景确实证明了此模式优于更简单的一次性调用。
  • 输入、输出与成功标准都已明确。
  • 工具调用及其副作用均已校验并获得相应权限。
  • 循环设有硬性预算上限和有意义的停止条件。
  • 失败情形会触发安全的重试、回退方案,或转交上报。
  • 质量、延迟与成本被一并测量。
  • 回归测试中至少包含一个失败案例。

复习问题

  1. 什么样的可观察失败,会表明这一模式被误用了?
  2. 哪一部分应当是确定性的,而不应交给 LLM 处理?
  3. 每一步所需的最小上下文是什么?
  4. 人工审批或上报关卡应设在哪个位置?
  5. 哪个指标能证明新增的复杂度是值得的?

实践练习

为一个范围狭窄的任务实现一个最小可行版本。保存三条轨迹:一次成功的运行、一次可恢复的失败,以及一个必须停止或上报的案例。为每条轨迹编写一个回归测试,并将结果与直接生成的基线进行比较。

学习地图

本页是「DeepLearningAI > Agentic AI」系列的第 21 / 40 页。建议先阅读「将函数转化为工具」。读完后可继续阅读「代码执行」。编号为 1.1-5.7 的 37 篇课程页面都共享同一套模板——状态、契约、控制、可观测性与评估,完整介绍见 1.1 课程概览——因此本页默认你已了解这一结构,重点讲解该主题特有的内容。

动手实践——分步指南

完成本页末尾的「实践练习」:为「邮件助手工作流」实现一个最小可行版本,保存三条轨迹——一次成功的运行、一次可恢复的失败、以及一个必须停止或上报的案例——为每条轨迹编写一个回归测试,并与直接生成的基线进行比较。

三大推荐资源

  1. 1
    Claude Docs: Prompt Engineering Overview

    Anthropic's official guidance on structuring prompts and multi-step model interactions.

    https://docs.claude.com/en/docs/build-with-claude/prompt-engineering/overview

  2. 2
    DeepLearning.AI Course Catalog

    The broader DeepLearning.AI curriculum this study guide's structure is organized around.

    https://www.deeplearning.ai/courses/

链接由 AI 推荐——使用前建议快速核实。