CS 329Z:构建 AI 智能体
2026/9/7 09:13:56 · 来源
AI 翻译于 2026/9/7 09:33:37 · 使用 Qwen3.6 35B (fast, default) + Qwen3.8 27B Q8 (vision)
这门课程涵盖复合人工智能系统和自主代理的完整工程领域,从从头构建检索增强生成(RAG)和工具使用等基础组件,到评估、优化以及像 DSPy 这样的框架。
欢迎!
从单体大语言模型转向复合人工智能系统—即包含大型语言模型、检索器、工具和优化器等多个交互组件的系统 —代表了人们构建 AI 应用方式的根本性变革。本课程教授学生如何工程化实现智能体系统:涵盖从简单的大语言模型流水线,到复合 AI 系统,再到自主智能体的完整体系。学生将学习如何确定重点攻关的问题类型、分解问题、选择合适的组件、收集与整理数据、构建评估体系,并探讨在实践中构建这些系统时会遇到的设计权衡。 学生将首先从零开始构建核心组件(检索增强生成 RAG、工具调用、智能体循环),随后学习 DSPy 等框架是如何将这些模式抽象出来的。通过两项全流程应用的作业和一个贯穿一个学季的项目,学生将获得构建、优化和评估智能体系统的实践经验。
课程安排
注意:课程表仅供参考,如有变动以实际通知为准。每周一和周三下午 1:30–2:50 在 Packard 101 教室上课。课件资料将陆续在此链接发布。
Week|Date|Lecture|Course Material 1|Wed Sep 23|基础与全景 导论——什么是智能体系统? 从单体模型到复合 AI 系统再到智能体的发展脉络;复合系统适用的场景;三大工程挑战(分解、数据、评估);课程后勤安排。 阅读材料:
- Zaharia et al. "The Shift from Models to Compound AI Systems." BAIR Blog (2024). 补充阅读
- Ng. "Agentic Design Patterns Part 1: Four AI Agent Strategies…" The Batch (2024).
- Si et al. "Towards Execution-Grounded Automated AI Research." arXiv (2026). 2|Mon Sep 28|面向开发者的 LLM API 与 SDK(litellm)、结构化输入输出与受限生成、解码策略与测试时计算、上下文工程、模型选型以及成本/延迟权衡。 阅读材料:
- Schluntz & Zhang. "Building Effective Agents." Anthropic (2024). 补充阅读
- Rajasekaran et al. "Effective Context Engineering for AI Agents." Anthropic (2025). 2|Wed Sep 30|核心构建模块 检索增强生成(RAG) 事实 grounding 与幻觉、嵌入(embeddings)与向量存储、分块策略、混合搜索、跨编码器与晚期交互(ColBERT)。动手实验:从零构建 RAG 流水线。 阅读材料:
- Lewis et al. "Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks." NeurIPS (2020). 补充阅读
- Khattab & Zaharia. "ColBERT: Efficient and Effective Passage Search via Late Interaction over BERT." SIGIR (2020). 3|Mon Oct 5
工具使用与函数调用REPL、函数调用API、模型上下文协议(MCP)、设计优质工具、代码执行沙箱、错误处理与重试。动手实践:从零构建一个具备工具调用能力的系统。 阅读材料:
-
模型上下文协议规范。Linux基金会(2025年)。 3 10月7日星期三 框架与智能体设计框架与编排DSPy(签名、模块、优化器)、LangChain/LangGraph、LlamaIndex;各框架抽象了什么 vs. 从零开始构建了什么;选择合适的抽象层级。 阅读材料:
-
Khattab 等。"DSPy: 将声明式语言模型调用编译为自改进管道。" ICLR (2024)。 4 10月12日星期一 智能体设计模式与支架工作流与智能体的分类法、五种可组合的工作流模式、智能体模式(ReAct、规划-执行、反思),以及支架作为设计决策。 阅读材料:
-
Yao 等。"ReAct: 在语言模型中融合推理与行动。" ICLR (2023)。 4 10月14日星期三 记忆与多智能体系统智能体记忆架构短期记忆与长期记忆、基于工具操作的记忆、文件系统作为外部化记忆、结构化记忆范式,以及跨智能体记忆。 阅读材料:
-
Park 等。"生成式智能体:人类行为的交互式模拟。" UIST (2023)。 5 10月19日星期一 多智能体系统单体与多智能体架构、编排模式、交接与状态转移、委托与协作模式,以及协调和错误的传递所面临的挑战。 阅读材料:
-
Liu 等。"LLM赋能的动态智能体网络用于面向任务的智能体协作。" COLM (2024)。 5 10月21日星期三 优化优化从提示到微调的全景;提示优化(GEPA、MIPROv2、OPRO、TextGrad);推理时计算扩展;LoRA/QLoRA;蒸馏;RLHF/DPO的高水平概述;以及在何时优化提示 vs. 权重 vs. 推理计算。 阅读材料:
6
Mon Oct 26 / 10 月 26 日(周一)
📺 客座讲座(待定)
6
Wed Oct 28 / 10 月 28 日(周三)
面向智能体系统的数据:智能体究竟需要哪些数据?轨迹、示范与反馈;用于优化 vs. 用于评估的数据;数据飞轮;合成数据生成;从人机交互中收集数据。
阅读材料:
补充阅读
7
Mon Nov 2 / 11 月 2 日(周一)
数据选择与质量:寻找信息量最大的数据,过滤与选择策略,小而精准的基准测试,标注实践,质量评估,以及从智能体轨迹构建数据集。
阅读材料:
补充阅读
7
Wed Nov 4 / 11 月 4 日(周三)
面向智能体系统的评估
评估基础与基准设计:为何评估如此困难,四元组框架(请求、环境、停止条件、评分器),各组件的设计,优秀基准应具备的性质,贴近真实场景的脚手架,以及可靠性维度。
阅读材料:
补充阅读
8
Mon Nov 9 / 11 月 9 日(周一)
LLM 作为评判者与评估基础设施:三类评分器,设计评判提示,已知的偏差,成对评估 vs. 单点评估,非确定性指标(pass@k vs. pass^k),测试框架设计,以及 Anthropic 的八步路线图。
阅读材料:
补充阅读
8
Wed Nov 11 / 11 月 11 日(周三)
安全
智能体安全与防护机制:工具访问带来的隐私风险,提示注入(包括间接注入),红队测试,沙箱与权限模型,输出防护,责任归属考量,负责任地部署,以及人在回路(human-in-the-loop)模式。
阅读材料:
扩展阅读
第 9 周
周一 11月16日
📺 客座讲座(待定)
周三 11月18日
编程 Agent 与主动式 Agent
编程与软件工程 Agent
Agent 的全流程工作原理;SWE-agent、Claude Code 和 OpenHands 的架构设计;脚手架作为决策工具;SWE-bench 及四元组框架的实际应用;Agent 时代软件开发的前瞻。
阅读材料:
扩展阅读:
第 10 周
周一 11月23日
无课——感恩节假
周三 11月25日
无课——感恩节假
第 11 周
周一 11月30日
主动式 Agent
从反应式到主动式;通用用户模型(GUM);下一步动作预测;开源主动式个人 Agent;隐私与信任议题;Agent 何时应该发起交互 vs. 被动等待(混合发起模式)。
阅读材料:
扩展阅读:
周三 12月2日
开放问题与最终演示
前沿与开放问题
多模态 Agent、网页交互 Agent 与计算机控制;科学领域的 Agent;长周期系统的 Agent 架构;生产部署与可观测性(追踪、监控、成本管理);可靠性、可扩展性与可解释性中的开放问题。
扩展阅读:
第 12 / 期末考试周(12月7日至11日)
Final Project Demo Day(期末项目演示日)
于期末考试成绩公布期间举行;具体时间地点待定。
截止日期
所有截止日期均以太平洋时间为准。截止日期可能变动,任何调整将在课堂上公布并同步至此页面。
| 周次 | 截止日期 | 日期 |
|---|
时间表
3
HW1发布
10月5日(星期一)
—
3
项目提案提交截止
10月9日(星期五)
晚上11:59
6
HW2发布
10月26日(星期一)
—
6
HW1提交截止
10月30日(星期五)
晚上11:59
7
中期演示
11月4日(星期三)
课上进行
7
中期报告提交截止
11月6日(星期五)
晚上11:59
8
论文视频提交截止(10分钟)
11月13日(星期五)
晚上11:59
9
HW2提交截止
11月20日(星期五)
晚上11:59
11
同伴互评提交截止(3个视频)
11月30日(星期一)
晚上11:59
期末周
最终提交与最终系统演示
12月7–11日
待定
课程作业
两次完全应用型的作业建立在课堂讲授的组件之上。每次作业后会跟随一次关于HW的10分钟测验,学生需在此解释其设计决策和取舍方案,并展示对知识的理解。
- HW1:构建一个智能体系统(第3–6周)。给定一组研究论文库,构建一个通过检索相关论文并进行推理来回答科学问题的智能体。A部分从零开始构建该智能体,使用litellm实现(RAG + 工具调用 + 带有如ReAct等推理模式的智能体循环);B部分使用DSPy重建关键组件,并反思该框架抽象了哪些内容。
- HW2:评估一个智能体(第6–9周)。给定一个预构建的智能体,设计一份全面的评估套件,包含基于代码的评分器、至少一个LLM-as-judge评估、基于4元组框架(请求、环境、停止条件、评分器)构建的基准任务以及错误分析。
论文视频与同伴互评
每位学生录制一段关于其自选近期智能体论文的10分钟视频(截止第8周),然后观看并评审其他同学的三个视频(感恩节之后提交)。
- 视频(7%)。 2分选取一个有实质内容的新近论文并给出扎实的解释;2分提供你自己的批评或见解——你同意或不同意的地方、局限性,或是它引出的有趣问题;2分附加价值,例如复现一项结果、运行小规模实验、与另一种方法对比、演示实现,或将其与实际智能体关联;1分清晰且引人入胜的呈现。
- 同伴互评(3%)。 每项1分,针对具体且有深度的反馈,超越“演示很好”这类泛泛之谈——指出一个优点、一个弱点或问题,以及一条具体建议。
评分标准
- 项目[50%]
- 提案[5%]
- 中期报告[5%]
- 中期演示[7%]
- 最终提交[15%]
- 最终系统演示[18%]
- 作业[20%]
- HW1:构建一个智能体系统[10%]
- HW2:评估一个智能体[10%]
- HW测验[15%]
- 测验1(HW1之后)[7.5%]
- 测验2(HW2之后)[7.5%]
- 论文视频与同伴互评[10%]
- 论文视频[7%]
- 同伴互评(3×1%)[3%]
- 参与度[5%]
- 课堂讨论、项目团队协作与辅导课
课程项目
学生将以小组为单位完成一个为期一学期(quarter)的项目,主题为**"用智能体改善斯坦福的生活"。**目标是构建一个协助斯坦福生活各方面的智能系统。项目创意示例:
- 课程大纲阅读器 — 提取截止日期并添加到您的日历
- 下一季度课程排程优化器
- 学术论文发现与摘要智能体
- 校园活动聚合与推荐器
里程碑
- **第3周:**项目提案(1页)
- **第6周:**中期报告(1页)+ 中期演示 — 需要提供一个工作原型
- **第10周:**最终提交(1页)+ 最终系统演示(Demo日)
报告篇幅简短(写作部分1–2页,附录中可包含所需的结构化内容,例如智能体失败模式的示例)。
学习地图
第一阶段:基础与核心组件
- 复合 AI 的基础:理解从单体语言模型向多组件智能体系统的转变及其工程挑战。
- LLM API 与上下文工程:掌握结构化输出、解码策略、测试时计算以及高效处理 token 上下文的方法。
- 检索增强生成(RAG):基于向量存储、分块策略和混合搜索构建具有事实依据的检索机制。
第二阶段:编排与高级设计
- 工具使用与函数调用:实现函数调用 API、代码执行沙箱以及模型上下文协议(MCP)。
- 智能体框架:探索如 DSPy、LangGraph 和 LlamaIndex 等用于编译声明式工作流的抽象方法。
- 记忆与多智能体系统:设计短期和长期记忆架构,以及多智能体协调模式。
第三阶段:优化与评估
- 提示词与权重优化:扩展测试时计算能力,并应用提示词进化或微调技术。
- 智能体评估与时作为评判的 LLM:利用四元组框架和自动评分器构建严谨的基准测试环境。
- 安全性与生产级护栏:缓解提示注入等安全威胁,并实施隐私保护的护栏机制。
动手实践——分步指南
- 搭建你的 Python 运行环境,安装 LiteLLM 库以及你所选择的用于模型交互的 API 密钥。
- 编写一个脚本,使用结构化的输入输出和受限生成模式来调用大语言模型。
- 构建一个简单的 RAG(检索增强生成)管道:将一组文档切分成文本块、生成嵌入向量,然后实现基于向量的相似度检索。
- 实现一个自定义的"工具调用循环",让大语言模型可以根据用户的请求来调用本地 REPL 交互终端或计算器函数。
- 将这些组件拼装成一个完整的 ReAct(推理+执行)智能体循环:对问题进行推理、检索数据、调用工具处理,并循环往复直到完成任务。
三大推荐资源
- 1Anthropic: Building Effective Agents
An engineering guide detailing practical patterns, workflows, and best practices for building robust LLM agents.
https://www.anthropic.com/engineering/building-effective-agents
- 2DSPy GitHub Repository
The official repository for DSPy, a framework for programming—rather than prompting—language models.
https://github.com/stanfordnlp/dspy
- 3Model Context Protocol Specification
The official specification for connecting AI models securely to data sources and development tools.
https://modelcontextprotocol.io/specification/2025-06-18
链接由 AI 推荐——使用前建议快速核实。