BrainBank

CS 329Z:构建 AI 智能体

2026/9/7 09:13:56 · 来源

AI 翻译于 2026/9/7 09:33:37 · 使用 Qwen3.6 35B (fast, default) + Qwen3.8 27B Q8 (vision)

#ai-agents#tool-use#step-by-step#rag#evaluation#compound-ai#dspy

这门课程涵盖复合人工智能系统和自主代理的完整工程领域,从从头构建检索增强生成(RAG)和工具使用等基础组件,到评估、优化以及像 DSPy 这样的框架。

欢迎!

从单体大语言模型转向复合人工智能系统—即包含大型语言模型、检索器、工具和优化器等多个交互组件的系统 —代表了人们构建 AI 应用方式的根本性变革。本课程教授学生如何工程化实现智能体系统:涵盖从简单的大语言模型流水线,到复合 AI 系统,再到自主智能体的完整体系。学生将学习如何确定重点攻关的问题类型、分解问题、选择合适的组件、收集与整理数据、构建评估体系,并探讨在实践中构建这些系统时会遇到的设计权衡。 学生将首先从零开始构建核心组件(检索增强生成 RAG、工具调用、智能体循环),随后学习 DSPy 等框架是如何将这些模式抽象出来的。通过两项全流程应用的作业和一个贯穿一个学季的项目,学生将获得构建、优化和评估智能体系统的实践经验。

课程安排

注意:课程表仅供参考,如有变动以实际通知为准。每周一和周三下午 1:30–2:50 在 Packard 101 教室上课。课件资料将陆续在此链接发布。

Week|Date|Lecture|Course Material 1|Wed Sep 23|基础与全景 导论——什么是智能体系统? 从单体模型到复合 AI 系统再到智能体的发展脉络;复合系统适用的场景;三大工程挑战(分解、数据、评估);课程后勤安排。 阅读材料:

工具使用与函数调用REPL、函数调用API、模型上下文协议(MCP)、设计优质工具、代码执行沙箱、错误处理与重试。动手实践:从零构建一个具备工具调用能力的系统。 阅读材料:

6

Mon Oct 26 / 10 月 26 日(周一)

📺 客座讲座(待定)

6

Wed Oct 28 / 10 月 28 日(周三)

面向智能体系统的数据:智能体究竟需要哪些数据?轨迹、示范与反馈;用于优化 vs. 用于评估的数据;数据飞轮;合成数据生成;从人机交互中收集数据。

阅读材料:

补充阅读

7

Mon Nov 2 / 11 月 2 日(周一)

数据选择与质量:寻找信息量最大的数据,过滤与选择策略,小而精准的基准测试,标注实践,质量评估,以及从智能体轨迹构建数据集。

阅读材料:

补充阅读

7

Wed Nov 4 / 11 月 4 日(周三)

面向智能体系统的评估

评估基础与基准设计:为何评估如此困难,四元组框架(请求、环境、停止条件、评分器),各组件的设计,优秀基准应具备的性质,贴近真实场景的脚手架,以及可靠性维度。

阅读材料:

补充阅读

8

Mon Nov 9 / 11 月 9 日(周一)

LLM 作为评判者与评估基础设施:三类评分器,设计评判提示,已知的偏差,成对评估 vs. 单点评估,非确定性指标(pass@k vs. pass^k),测试框架设计,以及 Anthropic 的八步路线图。

阅读材料:

补充阅读

8

Wed Nov 11 / 11 月 11 日(周三)

安全

智能体安全与防护机制:工具访问带来的隐私风险,提示注入(包括间接注入),红队测试,沙箱与权限模型,输出防护,责任归属考量,负责任地部署,以及人在回路(human-in-the-loop)模式。

阅读材料:

扩展阅读

第 9 周

周一 11月16日

📺 客座讲座(待定)

周三 11月18日

编程 Agent 与主动式 Agent
编程与软件工程 Agent
Agent 的全流程工作原理;SWE-agent、Claude Code 和 OpenHands 的架构设计;脚手架作为决策工具;SWE-bench 及四元组框架的实际应用;Agent 时代软件开发的前瞻。

阅读材料:

扩展阅读:

第 10 周

周一 11月23日

无课——感恩节假

周三 11月25日

无课——感恩节假

第 11 周

周一 11月30日

主动式 Agent
从反应式到主动式;通用用户模型(GUM);下一步动作预测;开源主动式个人 Agent;隐私与信任议题;Agent 何时应该发起交互 vs. 被动等待(混合发起模式)。

阅读材料:

扩展阅读:

周三 12月2日

开放问题与最终演示
前沿与开放问题
多模态 Agent、网页交互 Agent 与计算机控制;科学领域的 Agent;长周期系统的 Agent 架构;生产部署与可观测性(追踪、监控、成本管理);可靠性、可扩展性与可解释性中的开放问题。

扩展阅读:

第 12 / 期末考试周(12月7日至11日)

Final Project Demo Day(期末项目演示日)

于期末考试成绩公布期间举行;具体时间地点待定。

截止日期

所有截止日期均以太平洋时间为准。截止日期可能变动,任何调整将在课堂上公布并同步至此页面。

周次截止日期日期

时间表
3
HW1发布
10月5日(星期一)
—
3
项目提案提交截止
10月9日(星期五)
晚上11:59
6
HW2发布
10月26日(星期一)
—
6
HW1提交截止
10月30日(星期五)
晚上11:59
7
中期演示
11月4日(星期三)
课上进行
7
中期报告提交截止
11月6日(星期五)
晚上11:59
8
论文视频提交截止(10分钟)
11月13日(星期五)
晚上11:59
9
HW2提交截止
11月20日(星期五)
晚上11:59
11
同伴互评提交截止(3个视频)
11月30日(星期一)
晚上11:59
期末周
最终提交与最终系统演示
12月7–11日
待定

课程作业

两次完全应用型的作业建立在课堂讲授的组件之上。每次作业后会跟随一次关于HW的10分钟测验,学生需在此解释其设计决策和取舍方案,并展示对知识的理解。

  • HW1:构建一个智能体系统(第3–6周)。给定一组研究论文库,构建一个通过检索相关论文并进行推理来回答科学问题的智能体。A部分从零开始构建该智能体,使用litellm实现(RAG + 工具调用 + 带有如ReAct等推理模式的智能体循环);B部分使用DSPy重建关键组件,并反思该框架抽象了哪些内容。
  • HW2:评估一个智能体(第6–9周)。给定一个预构建的智能体,设计一份全面的评估套件,包含基于代码的评分器、至少一个LLM-as-judge评估、基于4元组框架(请求、环境、停止条件、评分器)构建的基准任务以及错误分析。

论文视频与同伴互评

每位学生录制一段关于其自选近期智能体论文的10分钟视频(截止第8周),然后观看并评审其他同学的三个视频(感恩节之后提交)。

  • 视频(7%)。 2分选取一个有实质内容的新近论文并给出扎实的解释;2分提供你自己的批评或见解——你同意或不同意的地方、局限性,或是它引出的有趣问题;2分附加价值,例如复现一项结果、运行小规模实验、与另一种方法对比、演示实现,或将其与实际智能体关联;1分清晰且引人入胜的呈现。
  • 同伴互评(3%)。 每项1分,针对具体且有深度的反馈,超越“演示很好”这类泛泛之谈——指出一个优点、一个弱点或问题,以及一条具体建议。

评分标准

  • 项目[50%]
    • 提案[5%]
    • 中期报告[5%]
    • 中期演示[7%]
    • 最终提交[15%]
    • 最终系统演示[18%]
  • 作业[20%]
    • HW1:构建一个智能体系统[10%]
    • HW2:评估一个智能体[10%]
  • HW测验[15%]
    • 测验1(HW1之后)[7.5%]
    • 测验2(HW2之后)[7.5%]
  • 论文视频与同伴互评[10%]
    • 论文视频[7%]
    • 同伴互评(3×1%)[3%]
  • 参与度[5%]
    • 课堂讨论、项目团队协作与辅导课

课程项目

学生将以小组为单位完成一个为期一学期(quarter)的项目,主题为**"用智能体改善斯坦福的生活"。**目标是构建一个协助斯坦福生活各方面的智能系统。项目创意示例:

  • 课程大纲阅读器 — 提取截止日期并添加到您的日历
  • 下一季度课程排程优化器
  • 学术论文发现与摘要智能体
  • 校园活动聚合与推荐器

里程碑

  • **第3周:**项目提案(1页)
  • **第6周:**中期报告(1页)+ 中期演示 — 需要提供一个工作原型
  • **第10周:**最终提交(1页)+ 最终系统演示(Demo日)

报告篇幅简短(写作部分1–2页,附录中可包含所需的结构化内容,例如智能体失败模式的示例)。

学习地图

第一阶段:基础与核心组件

  • 复合 AI 的基础:理解从单体语言模型向多组件智能体系统的转变及其工程挑战。
  • LLM API 与上下文工程:掌握结构化输出、解码策略、测试时计算以及高效处理 token 上下文的方法。
  • 检索增强生成(RAG):基于向量存储、分块策略和混合搜索构建具有事实依据的检索机制。

第二阶段:编排与高级设计

  • 工具使用与函数调用:实现函数调用 API、代码执行沙箱以及模型上下文协议(MCP)。
  • 智能体框架:探索如 DSPy、LangGraph 和 LlamaIndex 等用于编译声明式工作流的抽象方法。
  • 记忆与多智能体系统:设计短期和长期记忆架构,以及多智能体协调模式。

第三阶段:优化与评估

  • 提示词与权重优化:扩展测试时计算能力,并应用提示词进化或微调技术。
  • 智能体评估与时作为评判的 LLM:利用四元组框架和自动评分器构建严谨的基准测试环境。
  • 安全性与生产级护栏:缓解提示注入等安全威胁,并实施隐私保护的护栏机制。

动手实践——分步指南

  1. 搭建你的 Python 运行环境,安装 LiteLLM 库以及你所选择的用于模型交互的 API 密钥。
  2. 编写一个脚本,使用结构化的输入输出和受限生成模式来调用大语言模型。
  3. 构建一个简单的 RAG(检索增强生成)管道:将一组文档切分成文本块、生成嵌入向量,然后实现基于向量的相似度检索。
  4. 实现一个自定义的"工具调用循环",让大语言模型可以根据用户的请求来调用本地 REPL 交互终端或计算器函数。
  5. 将这些组件拼装成一个完整的 ReAct(推理+执行)智能体循环:对问题进行推理、检索数据、调用工具处理,并循环往复直到完成任务。

三大推荐资源

  1. 1
    Anthropic: Building Effective Agents

    An engineering guide detailing practical patterns, workflows, and best practices for building robust LLM agents.

    https://www.anthropic.com/engineering/building-effective-agents

  2. 2
    DSPy GitHub Repository

    The official repository for DSPy, a framework for programming—rather than prompting—language models.

    https://github.com/stanfordnlp/dspy

  3. 3
    Model Context Protocol Specification

    The official specification for connecting AI models securely to data sources and development tools.

    https://modelcontextprotocol.io/specification/2025-06-18

链接由 AI 推荐——使用前建议快速核实。