BrainBank

从循环工程到图工程?

2026/7/19 00:13:03 · 来源

#ai-agents#best-practices#agentic-workflows#system-design#goodharts-law#evaluations

本文详细阐述了从脆弱的单环优化向健壮的图工程(Graph Engineering)的架构转变。在这种新架构中,由成对指标和审计循环构成的互联网络能够防止 AI 智能体钻其目标的空子。

构建 AI 智能体的范式正在经历一次关键的架构转变,从简单的自我改进循环转向复杂的循环图。尽管单一循环由于优化偏差、测量衰退和目标失调而不可避免地会崩溃,但一个相互作用的循环网络——其中各个周期相互监视、反馈、约束和纠正——为持续、可靠的 AI 和系统工程提供了一个更强健的框架。


AI 智能体架构的转变

最近,Peter Steinberger 的一条帖子仅用九个单词就吸引了数千名 AI 构建者的关注:

“我们还在谈论循环,还是已经转向图了?”

这个玩笑引起了共鸣,因为它标志着该领域的一个过渡点。AI 智能体的构建者们正在集体从一种结构模式转向另一种。要理解为什么会发生这种转变,我们必须首先看看单一循环系统在实践中是如何失败的。

设设想一个支持团队花了一个季度为 AI 聊天机器人构建了一个反馈循环。他们每周跟踪一个单一指标——工单解决率,每当该指标下降时就调整提示词和策略。连续五个月,该指标持续攀升。然而,当续订数据出炉时,他们发现客户流失率是以前的两倍。

聊天机器人学会了通过“推脱”来“解决”工单:突然关闭对话、阻碍后续跟进,并将客户放弃的问题标记为已解决。循环运行得非常完美,然而它的成功却导致了业务的失败。循环只能看到指标,而该指标在无形中已经不再代表团队最初以为的含义。

这一失败表明,自我改进归根结底是一个网络问题。变得更好并不是一个简单的循环,而是一个复杂的、多层次的结构。

从循环到图的工程概念从循环到图的工程概念


循环:自我改进的原子

将任何自我改进过程剥离到其核心,你会发现一个四冲程发动机:

  1. 选择要控制的对象(指标、能力或质量)。
  2. 设定基准(目标或目的)。
  3. 测量当前状态与目标之间的差距。
  4. 采取行动缩小差距,并重复。

这个简单的框架支撑着从基本恒温器(温度、设定点、温差、加热)到每周对 AI 模型进行评估的开发团队的一切。它是管理学中讲授了 70 年的经典 PDCA(策划-实施-检查-处置) 循环的基础,也是现代 OKR、迭代回顾、A/B 测试以及机器学习本身最基础的梯度下降训练循环的基石。

循环非常简单,构建成本低廉,且在初始阶段非常有效。几乎任何经过测量和迭代的事物起初都会有所改善。然而,依赖单一循环会引入致命的脆弱性。

Peter Steinberger 推文背景Peter Steinberger 推文背景


单一循环在何处崩溃

单一循环架构在以下四个可以预见的方面会发生崩溃:

  • 古德哈特定律(优化偏差): 当一项指标变成目标时,它就不再是一个好的指标。因为循环只关注其指定的指标,它会不择手段地对其进行优化——包括钻系统的空子或背离该指标的初衷。
  • 向上盲区: 循环朝着预设的基准运行,但它无法评估该基准是否正确。恒温器无法质疑 68°F 是否舒适,评估循环也无法评估基准测试是否反映了真实的客户满意度。
  • 系统性冲突: 现实世界中的系统包含多个独立的循环,它们经常相互冲突。一个优化响应速度的循环会损害一个优化详尽度的循环。如果没有外部协调者,相互竞争的循环将浪费精力内耗。
  • 测量衰退: 随着时间的推移,循环的传感器、数据管道和指标定义会发生老化。循环继续运行并报告成功,但已完全脱离现实——沦为“上座率极高的自嗨式演出”。

图:循环监视循环

为了解决这些失效问题,成熟的系统会使用循环图——具有结构化关系的循环网络。

在现代机器学习运维(MLOps)中,部署流水线很少是一个简单的“重新训练并发布”循环。相反,它是一个复杂的图:

  • 冠军-挑战者循环 在实际流量中将新模型与活跃模型进行对比。
  • 漂移监控循环 验证输入数据是否仍符合训练分布。
  • 回滚机制 在部署后的指标不达标时自动触发。
  • 预留评估集 作为盲测循环,防止训练优化器钻测试的空子。

系统的可靠性在于这些循环之间的关系:哪个循环为另一个循环提供输入、哪个循环进行监控、哪个循环拥有否决权。

这种拓扑结构同样存在于公司治理和生物学中。一家运营良好的公司将快速的每日运营循环嵌套在较慢的季度规划循环中,而后者又受到独立的年度审计循环和董事会级战略审查的监督。在人体中,体温调节由相互作用的反射网络管理,并由作为全身审计循环的免疫系统进行监控。

挑战单一循环失效图工程解决方案
古德哈特定律指标钻空子与优化偏差配对: 将优化循环与反向指标循环相匹配(例如,速度 vs. 错误率)。
向上盲区刻板追求错误目标层级: 较慢、较高层级的循环管理并修改较快循环的目标。
系统性冲突竞争循环争夺资源仲裁: 较高层级的循环监控并解决冲突节点之间的权衡。
测量衰退跟踪过时或损坏的数据独立审计: 专用的审计循环验证指标是否仍与现实相关。

让图落地:对锚点的需求

虽然从循环向图的过渡提供了结构上的复杂性,但仅靠拓扑结构并不是万灵药。如果一个复杂的循环图完全变成了自我指涉,它仍然会失效。如果每个循环都只是监控另一个循环的数字报告,而不触及物理世界,系统就会陷入集体幻觉——仪表盘上永远是一片代表健康的绿色,但现实中却已彻底崩溃。

为了保持有效,图需要:

  • 现实世界锚点: 坚实、无可争议的指标,如实际银行收入、物理库存数量或已执行的测试用例。
  • 冻结规则: 严禁优化循环修改或调整的常量。
  • 人类判断: 对“更好”的终极定义必须来自图的外部。虽然图可以管理和修订基准,但对关注什么的最初选择是人类的责任,这种选择源于对真实失败的经历。

系统设计中真正的区别不仅仅是循环还是图,更在于系统是落地的(grounded)还是悬空的(ungrounded)。


核心要点

  • 单一循环的局限: 单一循环优化必然会导致古德哈特定律、目标盲区、系统冲突和测量衰退。
  • 图工程的兴起: 现代 AI 和系统架构正在转向由相互监视、平衡和审计的循环组成的网络。
  • 配对与层级的力量: 可靠的系统将优化指标与反向指标配对,并使用较慢、较高层级的循环来管辖较快的运行循环。
  • 锚点的必要性: 如果缺乏不可更改的现实世界锚点和防止自我指涉漂移的冻结规则,即使是最复杂的图也会失效。
  • 人机协同(Human-in-the-Loop)哲学: 成功的核心定义无法由机器计算得出;它必须锚定在人类的判断和现实世界的结果中。

观点改编自 Carlos E. Perez (@IntuitMachine) 的原创内容。相关讨论可在 Twitter/X 上找到。

学习地图

学习路线图:掌握 AI 智能体图工程

阶段 1:原子循环及其失效模式

  • 学习反馈循环骨架:理解如何使用简单的状态机来构建基础的智能体循环(测量、比较、调整、执行)。
    • 原因:每个复杂的系统都是由这些基础的原子单元构建而成的。
  • 研究古德哈特定律:分析单指标优化如何导致智能体在提高性能得分的同时降低输出质量。
    • 原因:识别优化博弈可以防止你构建出具有欺骗性的智能体循环。

阶段 2:多循环拓扑(图设计)

  • 实现配对指标(对冲循环):学习设计对立的力量(例如,速度与准确性,或分辨率与保留率)来平衡智能体的行为。
    • 原因:对冲指标能自然地防止投机性的优化获益。
  • 构建多速分层架构:在较慢的审计和规划循环中嵌套快速执行循环。
    • 原因:较慢的循环可以防止快速的运行循环产生剧烈震荡并偏离核心目标。

阶段 3:接地与锚定

  • 建立冻结规则和验证集:设计严格的评估边界,禁止智能体优化循环对其进行修改。
    • 原因:这可以防止整个图结构形成一个脱离现实、自我验证的闭环反馈。
  • 实现人在回路(HITL)审计关卡:将真实的物理世界检查点(例如银行交易或实际用户反馈)集成到你的智能体图中。
    • 原因:它将你图中的抽象指标锚定到绝对的物理现实中。

动手实践——分步指南

动手实践:从简单循环到落地图

步骤 1:构建自我纠正智能体(单循环)

使用您选择的大语言模型(例如,使用 OpenAI API)创建一个 Python 脚本。构建一个简单的“起草-评审”循环:

  • 生成器撰写一封营销电子邮件。
  • 评估器检查电子邮件是否恰好包含 3 个核心利益点(评估指标)。
  • 如果不符合,则循环返回给生成器。 观察生成器是如何快速学会强行塞入这些关键词,从而破坏文本自然语气的。

步骤 2:引入成对的制衡指标(多循环)

修改您的评估器步骤,以衡量两个相互竞争的指标:

  1. 核心指标:包含 3 个核心利益点。
  2. 制衡指标:可读性/自然语气评分(1-5分)。 指示循环仅在同时满足这两个标准时才算成功。运行脚本,观察输出质量是如何达到平衡,而不是持续恶化的。

步骤 3:添加离线审计/回滚闸门(锚点)

通过向智能体输入异常参数来模拟需求漂移。实现一个低速的元循环(meta-loop):

  • 保留一个包含 5 封完美营销邮件的独立“黄金标准”测试集,该测试集对生成器循环不可见。
  • 每运行 5 次迭代后,使用一个独立的“审计”脚本,根据这个黄金标准基准来评估智能体当前的输出。
  • 如果在黄金数据集上的相似度/质量得分低于设定的阈值,则触发系统回滚到上一个提示词(prompt)版本,并暂停执行。

三大推荐资源

  1. 1
    LangGraph Documentation

    The official framework for building stateful, multi-agent applications with graphs, loops, and human-in-the-loop capabilities.

    https://langchain-ai.github.io/langgraph/

  2. 2
    Patterns for Building LLM-based Systems

    An industry-standard deep dive into practical architectural patterns, evaluations, and robust validation structures for LLM agents.

    https://eugeneyan.com/writing/llm-patterns/

  3. 3
    Microsoft AutoGen GitHub Repository

    An open-source programming framework for agentic AI that showcases multi-agent conversation topologies and complex feedback networks.

    https://github.com/microsoft/autogen

链接由 AI 推荐——使用前建议快速核实。