什么是智能体式人工智能?为何强大?
2026/8/5 17:11:47
什么是智能体式人工智能?为何强大?:何时使用、为何有效、它在智能体系统中的位置,以及如何实现、评估并在生产环境中加固它。
1.2 什么是智能体式人工智能?为何强大?
学习目标
完成本节后,你应当能够:
- 解释**什么是智能体式人工智能?为何强大?**对智能体系统的贡献。
- 判断何时该使用它、何时更简单的设计就已足够。
- 将该模式实现为可观察、可测试的组件。
- 识别其主要的成本、安全与可靠性风险。
何时使用
当质量的提升来自多轮处理而非一次性生成时,使用智能体工作流。
为何有效
把复杂任务拆分成有边界的步骤,能让模型获得新的上下文、明确的目标,以及使用外部证据的机会。
它在系统中的位置
箭头表示控制流与数据流的走向,不一定对应不同的模型。图中的方框可以由一个确定性函数、被多次调用的同一个模型,或多个不同模型来实现。在整个流程中应保留追踪标识符(trace identifiers)。
分步实现
- 写出可衡量的「完成」定义。 在实现之前,先写清楚输入、预期输出、负责人和失败条件。
- 把任务拆解为输入、转换与输出。 让这一决策在日志或结构化状态中可被观察,以便后续评估。
- 为每个步骤分配一个明确的职责。 在此边界处应用最小权限原则,并验证相关假设。
- 定义在各步骤之间传递的状态。 记录结果以及足够复现或诊断所需的元数据。
- 添加停止规则与最终校验。 在继续之前,将结果与明确的验收标准进行比较。
技术实现要点
- 状态(State): 在结构化的运行记录中保存消息、工具调用、观察结果、产出物、决策理由、尝试次数、token 用量、延迟以及最终状态。
- 契约(Contracts): 为每个组件定义带类型的输入、带类型的输出、允许的副作用、超时时间和错误类别。
- 控制(Controls): 使用最小权限凭证、白名单工具、有界循环、输入校验、输出校验,并为有实际影响的动作设置审批关卡。
- 可观测性(Observability): 在符合隐私规则的前提下,记录 prompt 或其版本、模型与参数、工具参数、工具结果、异常、时间戳和成本。
- 评估(Evaluation): 测试具有代表性的案例、边界案例、对抗性案例和失败恢复案例,并与最简单可行的基线进行比较。
实例演示
与其用一条提示直接要一篇文章,不如先生成提纲、逐条核实论点、起草初稿、评审连贯性,再进行修订。
输入:用户目标 + 约束条件
状态:{run_id, step, observations, budget, status}
决策:下一个有边界的动作
校验:权限、参数与策略
执行:模型调用、确定性代码或工具
观察:结构化结果或分类后的错误
停止:验收标准通过、预算用尽,或转交人工
失败模式与应对措施
| 失败模式 | 信号 | 应对措施 |
|---|---|---|
| 目标含糊 | 输出看似流畅却偏离了任务 | 把需求转化为可衡量的验收标准 |
| 无界循环 | 反复调用却没有实质性进展 | 设置迭代次数、token、时间与成本上限 |
| 中间状态有误 | 后续步骤放大了早期的错误 | 校验每个组件的契约并保留追踪记录 |
| 不安全的副作用 | 工具尝试进行未经授权的更改 | 应用授权机制、最小权限、演练模式(dry-run)与审批关卡 |
| 评估盲区 | 演示成功但真实案例却失败 | 用贴近生产环境的案例和对抗性案例扩充测试集 |
验证清单
- 该使用场景确实证明了此模式优于更简单的一次性调用。
- 输入、输出与成功标准都已明确。
- 工具调用及其副作用均已校验并获得相应权限。
- 循环设有硬性预算上限和有意义的停止条件。
- 失败情形会触发安全的重试、回退方案,或转交上报。
- 质量、延迟与成本被一并测量。
- 回归测试中至少包含一个失败案例。
复习问题
- 什么样的可观察失败,会表明这一模式被误用了?
- 哪一部分应当是确定性的,而不应交给 LLM 处理?
- 每一步所需的最小上下文是什么?
- 人工审批或上报关卡应设在哪个位置?
- 哪个指标能证明新增的复杂度是值得的?
实践练习
为一个范围狭窄的任务实现一个最小可行版本。保存三条轨迹:一次成功的运行、一次可恢复的失败,以及一个必须停止或上报的案例。为每条轨迹编写一个回归测试,并将结果与直接生成的基线进行比较。
学习地图
本页是「DeepLearningAI > Agentic AI」系列的第 3 / 40 页。建议先阅读「课程概览」。读完后可继续阅读「自主程度」。编号为 1.1-5.7 的 37 篇课程页面都共享同一套模板——状态、契约、控制、可观测性与评估,完整介绍见 1.1 课程概览——因此本页默认你已了解这一结构,重点讲解该主题特有的内容。
动手实践——分步指南
完成本页末尾的「实践练习」:为「什么是智能体式人工智能?为何强大?」实现一个最小可行版本,保存三条轨迹——一次成功的运行、一次可恢复的失败、以及一个必须停止或上报的案例——为每条轨迹编写一个回归测试,并与直接生成的基线进行比较。
三大推荐资源
- 1Claude Docs: Prompt Engineering Overview
Anthropic's official guidance on structuring prompts and multi-step model interactions.
https://docs.claude.com/en/docs/build-with-claude/prompt-engineering/overview
- 2DeepLearning.AI Course Catalog
The broader DeepLearning.AI curriculum this study guide's structure is organized around.
https://www.deeplearning.ai/courses/
链接由 AI 推荐——使用前建议快速核实。