企业级AI架构:模型之外
2026/7/13 17:52:54
企业级 AI 架构必须将前沿模型与其智能体控制框架、语义数据平面及任务控制系统分离,以确保确定性的计算和可审计的证据,而非仅仅依赖概率模型。
企业级 AI 架构:超越模型
Claude Code、Ask Sage、Palantir AIP、IBM watsonx、Databricks AI 以及自研开发
针对文本密集型、数据密集型、大数据及国防部(DoD)财务审计工作负载的架构对比与实施策略
🟨 部署说明: 必须针对每个环境验证模型的可用性、授权情况、涉密等级、合同条款以及批准的用途。
执行摘要
核心结论非常简单: Claude 是一个模型家族;Claude Code 是一个智能体套件(Agent Harness);Ask Sage、Palantir、IBM 和 Databricks 则是企业级平台。它们的价值不应仅仅通过其是否提供 Claude 模型来衡量。核心问题在于,它们直接采用了哪些 Claude Code 机制,哪些机制仍可通过真正的 Claude Code 客户端或 Claude Agent SDK 获取,以及哪些机制被更强大的企业原生控制措施所替代。
🟦 一目了然的建议
选用 Ask Sage 用于安全的文本与文档辅助,并将其作为连接到 Claude Code 的受控途径。当任务依赖于业务运行本体(Ontology)、受控动作、凭证关联和工作流时,选用 Palantir AIP。当核心侧重点是 Spark、SQL、大规模数据工程、机器学习、血缘分析和评估时,选用 Databricks。在混合基础设施、传统遗留系统现代化、企业级集成和确定性决策服务占主导地位的场景下,选用 IBM。仅针对特定任务层构建自研套件,并保持底层模型的可替换性。
| 选项 | 核心定位 | 最佳适用场景 | 首要注意事项 |
|---|---|---|---|
| Claude Code | 以代码库为中心的智能体套件 | 编码、软件工程、自定义智能体模式 | 并非企业数据目录、财务语义层或审计凭证系统 |
| Ask Sage | 安全的多模型访问与 RAG 快速引入 | 文本密集型分析、草案起草、政策/文档研究、受控的 Claude Code 连接 | 并非权威的交易、对账或血缘分析平台 |
| Palantir AIP | 业务运行语义与受控动作 | 本体(Ontology)、权限管理、个案、工作流、凭证与交易的关联 | 需要严格的本体和数据治理;存在对闭源专有平台的依赖 |
| IBM watsonx / Bob | 混合企业级编排与现代化 | 主机/遗留代码、业务规则、集成、受监管的企业工作流 | 技术栈更庞大复杂;Claude 原生制品并非其核心组织标准 |
| Databricks AI | 大规模数据与 AI 运营 (AIOps) | Spark/SQL、管道、机器学习、语义分析、血缘分析、追踪与评估 | 相比 Palantir,其对以对象为中心的个案/动作工作流的适配较弱 |
| 自研解决方案 | 特定任务控制与可移植性 | 独特的工作流、模型路由、专用工具、评估及用户体验 | 研发、安全、运维及生命周期管理成本最高 |
对于 DoD 审计,最佳方案是分层架构,而非单一产品: 一个可信的财务数据与凭证平面;确定性的对账与控制逻辑;受控的 MCP 或 API 工具;一个受约束、可替换的模型层;人工审核;以及对每次查询、数据源、计算、工具调用、审批和变更的不可篡改记录。
1. 核心对比:模型、智能体套件、平台与任务控制
许多企业级 AI 对比会将四个不同的层级混为一谈。这会导致误导性的结论,例如“平台 X 使用了 Claude,因此它拥有 Claude Code”,或者“平台 Y 没有 CLAUDE.md,因此它缺乏持久的企业级上下文”。这些层级解决的是不同的问题,应当分别进行评估。
图 1. 四层企业级 AI 架构。
| 层级 | 典型示例 | 定位与目的 | 核心启示 |
|---|---|---|---|
| 前沿模型 | Claude 及其他 LLM | 推理、语言表达、编码、分类和工具选择 | 准确性依然是概率性的;模型不应成为权威记录系统 |
| 智能体套件 | Claude Code、Agent SDK、AIP Logic、Orchestrate、Databricks Agent Framework、Deep Agent | 上下文组装、规划循环、工具、状态、权限、重试、预算和评估 | 套件质量决定了高能力模型能否转化为可靠的系统 |
| 数据与语义平面 | Ontology、Unity Catalog、SQL/Spark、watsonx.data、RAG 数据集 | 权威数据、元数据、业务含义、检索、血缘和计算 | 糟糕的数据无法通过更强大的模型来修复 |
| 任务控制与凭证 | IAM、密级标记、动作、工作流、审批、日志、个案/凭证库 | 授权、职责分离、可复现性和问责制 | 对于审计、财务管理和重大决策性动作至关重要 |
🟥 架构原则
切勿将权威的业务逻辑、财务计算、凭证溯源、访问控制或审批权限直接写入系统提示词(System Prompt)中。应当将它们保留在受治理的服务中,智能体可以调用这些服务,但无法对其进行重新定义。
2. 作为参考智能体套件的 Claude Code
Claude Code 是一个智能体化的编码系统,它可以读取代码库、编辑文件、运行命令、连接外部工具并与开发环境集成。它对企业级架构的重要性并不仅限于编码,还为上下文管理、可复用程序、确定性控制、工具连接、专用智能体以及扩展包管理提供了一个清晰的参考设计。[1]
| 基元 | 功能 | 企业级价值 | 局限性 |
|---|---|---|---|
CLAUDE.md 与规则 | 加载到会话上下文中的持久项目、用户或组织说明 | 架构规范、构建/测试命令、安全规则和复核清单 | 仅为上下文,无法保证强制执行;硬性控制需使用钩子或平台策略 |
| 自动记忆 (Auto memory) | 智能体编写的笔记,可在多个会话之间保留有用的发现 | 构建命令、调试洞察和循环出现的偏好设置 | 必须是可审计且受限的;并非权威知识库 |
| 技能 (Skills) | 带有指令、脚本和支持资源的可复用 SKILL.md 包 | 可重复的工作流,如代码复核、对账分析、文档审核或部署 | 强大的模块化能力模式,但程序仍需要测试和治理 |
| MCP | 连接智能体与工具、数据和外部服务的开放协议 | 数据库、API、工单、文档、企业应用和自定义函数 | MCP 规范了连接,但无法保证授权、数据质量或安全的工具设计 |
| 钩子 (Hooks) | 智能体动作执行前或执行后的确定性生命周期控制 | 阻止危险命令、强制执行测试、记录活动或验证变更 | 对于强化不依赖模型判断的规则至关重要 |
| 自定义智能体与智能体团队 | 具有隔离上下文和受控工具的专用工作站 | 并行分析、代码复核、测试、研究和领域专家 | 增加了编排、成本、状态管理和评估的复杂度 |
| 插件 (Plugins) | 用于分发技能、智能体、钩子、MCP、LSP 和设置的发布包 | 可复用的组织级扩展捆绑包 | 一种软件工程扩展模型,而非企业级数据治理模型 |
| 权限与沙箱 | 对工具、文件、命令和执行环境的控制 | 限制智能体的影响范围并需要审批 | 本地编码权限不同于企业数据权限和职责分离要求 |
| LSP 与 IDE 集成 | 语言服务器诊断和编辑器上下文 | 强类型代码智能、错误提示、符号和导航 | 对软件开发极具价值;对财务审计分析的优先级较低 |
| Claude Agent SDK | 对 Claude Code 工具和智能体能力的编程访问 | 具有受控编排和权限的自定义应用与智能体工作流 | 在编码接口之外引入 Claude Code 模式的最佳途径 |
Claude Code 原生并不提供分布式查询引擎、财务语义模型、企业知识图谱、记录级血缘系统、个案管理平台或审计凭证库。这些能力必须由周边的企业级平台或自定义架构来提供。
3. 商业平台如何引入或替代 Claude Code 能力
对 Claude 的引入存在四种实质上不同的形式。准确的对比必须识别出每种平台和用例适用的是哪种形式。
| 引入模式 | 定义 | 架构影响 | 示例 |
|---|---|---|---|
| 1. 模型接入 | 平台将 Claude 作为其可用模型之一开放 | 企业使用 Claude 的推理能力,但保留平台自身的专有套件 | IBM 特定产品集成;Databricks 模型端点;Palantir 模型服务;Ask Sage 路由 |
| 2. Claude Code 客户端兼容 | 真正的 Claude Code CLI 或 IDE 连接到平台端点或 MCP 服务器 | CLAUDE.md、技能、钩子、插件、子智能体和 LSP 仍作为 Claude Code 客户端的能力保留 | Ask Sage 明确支持 Claude Code;Palantir 提供了 Claude Code IDE 使用和 MCP 连接的文档支持 |
| 3. Claude Agent SDK 托管 | 自定义智能体在企业平台内部运行 Anthropic 的可编程套件 | 深度引入 Claude 规划、工具和编排,同时使用企业数据和控制 | Palantir 提供明确的 Claude Agent SDK 模板;其他平台可支持具有不同原生集成水平的自定义 Python 框架 |
| 4. 专有功能替代 | 平台提供其自身的上下文、智能体、策略、数据语义、工作流和评估 | Claude Code 制品不可移植,但对于实际业务操作,企业级控制力可能更强 | Palantir Ontology/AIP、IBM Orchestrate/Bob、Databricks Unity Catalog/MLflow、Ask Sage 数据集/角色/Deep Agent |
🟪 重要区别
当 Claude Code 通过 Ask Sage 连接或连接到 Palantir MCP 时,如果说CLAUDE.md、技能、钩子、插件、子智能体、权限或 LSP 缺失是不准确的。它们在 Claude Code 客户端中依然可用。更好的问题是,企业平台是否能原生理解、治理、分发和审计这些制品。
4. Ask Sage
4.1 Claude 引入程度
在已评估的商业平台中,Ask Sage 与实际 Claude Code 用户体验的直接验证兼容性最高。其兼容 Anthropic 的端点已被证实可与 Claude Code CLI 和 VS Code 插件协同工作。这使得 Claude Code 客户端可以继续提供其自身的项目指令、技能、钩子、插件、子智能体、权限和 IDE 集成,而 Ask Sage 则提供受控的端点、身份验证、模型路由以及面向政府的部署环境。[4]
Ask Sage 还提供了其自身的物理数据集、角色(Personas)、提示词库、插件、网页搜索、Deep Agent 和 MCP 能力。Deep Agent 能够在网页和私有 RAG 数据集上执行迭代研究。这些都是非常有用的平台原生能力,但它们在格式上不一定与 Anthropic 技能、Claude 插件或 CLAUDE.md 兼容。[5]
| 类别 | 评估 |
|---|---|
| 直接引入 | Anthropic 风格的 API 格式;Claude Code 客户端兼容性;MCP;通过经批准的后端访问 Claude 模型 |
| 客户端提供 | 使用实际 Claude Code 客户端时的 CLAUDE.md、自动记忆、技能、钩子、插件、子智能体、权限模式和 LSP |
| 平台原生等效功能 | 数据集与 RAG、角色、提示词库、平台插件、Deep Agent、智能体构建器(Agent Builder)和管理控制 |
| 并非主要优势 | 分布式 SQL/Spark、企业财务语义建模、对象/动作本体(Ontology)、记录级交易血缘分析以及大规模对账 |
4.2 核心优势
-
通过统一界面安全地访问多个商业模型。
-
无需从零构建完整的模型网关和 RAG 应用,即可快速部署文本和文档密集型任务。
-
为将 Ask Sage 作为批准端点的开发团队提供受控的 Claude Code 使用环境。
-
提供面向政府的部署选项,以及针对非开发类分析师的友好配置。
-
快速原型化政策研究、报告分析、草案起草、摘要生成和知识辅助。
4.3 在 DoD 架构中的适用角色
Ask Sage 最适合定位为安全的交互和模型访问层。它可以支持文档研究、NFR(缺陷与建议通知书)和 CAP(纠正行动计划)起草、政策综合、审计人员请求响应、开发者辅助以及快速的任务原型设计。它不应作为余额、交易、对账结果、数据血缘或审计凭证的权威来源。这些必须来自受控制的财务数据与凭证平台。
5. Palantir AIP
5.1 Claude 引入程度
在所评估的商业平台中,Palantir 与 Anthropic 的可编程智能体层展示出了最深度的验证集成。Palantir 将 Claude Code 作为 IDE 集成进行记录,提供了 Palantir MCP 和 Ontology MCP,并为 Claude Agent SDK 提供了显式的智能体模板,其中简化了 Ontology MCP、Palantir MCP 和 Ontology SDK 的配置。[6][7]
这并不意味着 Palantir 是 Claude Code 的重新实现。Palantir 的战略差异化优势在于围绕智能体构建的企业平台:本体(Ontology)、对象与动作安全、用户权限传播、业务应用、工作流、个案、分支、血缘和可观测性。
| 功能/特性 | 作用 | 重要性 |
|---|---|---|
| Palantir MCP | 面向开发的 MCP,用于 Foundry 内部的数据集成、本体配置和应用开发 | 将 Claude Code 和其他 AI IDE/智能体连接到平台构建能力上 |
| Ontology MCP | 将对象类型、动作类型和查询函数作为受控的 MCP 工具开放 | 允许外部智能体在应用限制下读取对象、执行预定义的动作并查询数据 |
| Claude Agent SDK 模板 | 深度集成 Ontology MCP、Palantir MCP 和 OSDK 的原生入门模板 | 允许 Anthropic 套件模式在接近 Palantir 数据和运行控制的环境下运行 |
| AI FDE | Palantir 原生 AI 开发环境,其操作严格遵循用户现有的权限体系 | 提供专有的企业上下文、能力、治理和平台构建工作流 |
| AIP 可观测性与执行历史 | 提供指标、追踪(Traces)、日志和工作流历史记录 | 支持超越本地智能体转录记录的业务运行监控与排查 |
5.2 Palantir 替代而非直接引入的内容
-
在平台层,
CLAUDE.md被受控的应用上下文、本体定义、代码库上下文、系统指令和平台策略所取代。在使用外部客户端时,Claude Code 文件依然存在。 -
Claude 技能通过函数、动作类型、AIP Logic 模块、智能体模板、OSDK 能力和平台应用进行补充或替代。
-
Claude 钩子通过动作验证、应用限制、工作流审批、分支管理和平台自动化来进行补充。
-
Claude 本地权限通过企业身份、密级标记、对象/属性级安全以及用户现有的 Foundry 权限进行补充。
-
Claude 插件通过 Palantir 的软件包、应用、模板、SDK 和 MCP 服务进行补充。
5.3 核心优势
-
业务运行语义建模:表示财务、业务和审计对象及其相互关系。
-
受控的动作:允许智能体仅发起预定义的业务动作和工作流。
-
跨系统数据集成、个案管理、整改跟踪和凭证关系关联。
-
具备权限感知能力的企业级应用和人机协同(Human-in-the-loop)操作。
-
将分析转化为业务运行决策、任务、个案或批准的动作。
5.4 在 DoD 架构中的适用角色
Palantir/Advana 是业务运行审计与凭证层的强有力候选者:它将财务报表行项目连接到账户、交易、前置系统、佐证文档、控制措施、NFR、纠正措施、责任人和审计人员请求。当组织需要梳理复杂关系并执行受控的整改动作,而不仅仅是运行大型 SQL 查询时,它的价值最大。
6. IBM watsonx 和 IBM Bob
6.1 Claude 引入程度
IBM 和 Anthropic 宣布建立战略合作伙伴关系,将 Claude 集成到特定的 IBM 开发工具和企业级产品中,同时保留 IBM 的安全、治理和成本控制。IBM 还向 MCP 社区贡献了企业指南、参考架构和开源资产。[10]
IBM 的架构仍保持 IBM 原生风格。watsonx Orchestrate 充当企业智能体控制平面;watsonx.data 可以通过框架无关的远程 MCP 服务器向外暴露文档库;而 IBM Bob 则提供专有的代码库智能、软件现代化工作流、集成智能体生成和企业级治理。[11][12][13]
| 类别 | 评估 |
|---|---|
| 直接引入 | 在选定产品中集成 Claude;跨 Orchestrate 和 watsonx.data 的 MCP;企业智能体生命周期指南 |
| 未直接引入 | 未确认将 CLAUDE.md、Anthropic 技能、Claude 插件打包、Claude 钩子或 Claude LSP 架构原生作为 IBM 的组织标准 |
| 平台原生替代 | watsonx Orchestrate、智能体开发套件、智能体目录/工具包、watsonx.data、治理体系、IBM Bob 和决策服务 |
| 独特优势 | 混合云/本地部署企业级运行、Red Hat 生态系统、大型机和遗留系统现代化、业务规则以及与长生命周期系统的集成 |
6.2 核心优势
-
具有深厚企业上下文的 Java、COBOL、RPG、IBM i 和大型机现代化。
-
数据和应用无法轻易集中的混合云和本地部署集成。
-
确定性的决策服务和业务规则,适用于不应由 LLM 即兴发挥的流程。
-
在统一控制平面下对多供应商智能体进行企业级编排。
-
与现有中间件、应用和受监管的业务运行环境集成。
6.3 在 DoD 架构中的适用角色
在审计整改或财务转型依赖于理解和改造遗留代码、接口和业务规则的场景下,IBM 最具说服力。Claude 可以帮助分析代码或解释政策,但 IBM 的核心价值在于跨混合和大型机环境维护企业流程的完整性。
7. Databricks AI
7.1 Claude 引入程度
Databricks 支持外部基础模型、自定义 Python 智能体、MCP 工具和外部智能体注册,但其原生架构是模型和框架无关的,而非 Claude Code 原生。Databricks 支持使用任何 Python 开发库编写的智能体,并将其与 MLflow 追踪集成。目前官方尚未将 CLAUDE.md、Anthropic 技能、Claude 钩子、Claude 插件或 LSP 记录为原生平台构建块。[8]
因此,适当的对比不在于 Databricks 是否复制了 Claude Code。Databricks 提供的是智能体在企业规模下可靠工作所需的数据、查询、治理、部署、血缘和评估基础。
| 功能/特性 | 作用 | 重要性 |
|---|---|---|
| Agent Framework | 开发、部署和评估自定义 Python 智能体;将它们连接到结构化数据、非结构化数据、代码和外部 API | 在接近企业数据的位置部署与框架无关的智能体 |
| Unity Catalog | 治理表、文件、函数、模型、服务及其他数据和 AI 资产 | 统一身份、权限、元数据和审计的基础设施 |
| Unity AI Gateway | 治理模型、智能体、MCP 服务器和工具之间的运行时交互;路由流量、应用护栏并监控使用情况 | 针对 AI 服务和工具访问的企业级控制平面 |
| MLflow | 追踪(Tracing)、评估、模型/智能体生命周期管理和监控 | 系统级质量与可观测性,而非对话式的 Demo 展示 |
| Spark 与 SQL | 分布式转换、匹配、聚合和特征工程 | 针对数百万或数十亿条记录的正确计算基础 |
| 血缘分析 (Lineage) | 对支持的查询自动生成血缘,可精细至列级 | 跨数据产品和报告的影响分析与可追溯性 |
| Genie / 语义分析 | 对受控分析数据和业务语义的自然语言访问 | 分析师与基于 SQL 的数据进行交互,而非原始记录提示 |
7.2 核心优势
-
太字节(TB)和拍字节(PB)级的摄取、转换、关联、聚合和机器学习。
-
总体级别的对账、异常检测、欺诈和不当支付分析。
-
湖仓一体治理、数据访问控制、自动血缘分析和可复用的分析数据产品。
-
机器学习和智能体追踪、评估、监控以及成本/性能优化。
-
开源数据和 SQL/Spark 导向,可支持多个下游应用和模型。
7.3 在 DoD 架构中的适用角色
Databricks 是一个强大的计算和分析基础,用于规范 ERP 和前置系统数据、构建交易总体、执行大型关联、核对余额、训练异常模型并生成精选的异常表。随后,Palantir 或其他业务运行平台可以将这些分析结果转化为个案、凭证关系和批准的动作。
8. 详细功能与引入矩阵
Direct = 显式支持的原生或文档化集成。Client = 由实际的 Claude Code 客户端提供。Analog = 提供类似功能的专有平台能力。Not confirmed = 目前尚无官方确凿证据支持。
8.1 Claude 原生基元与直接集成
| 功能/特性 | Claude Code | Ask Sage | Palantir AIP | IBM watsonx / Bob | Databricks AI |
|---|---|---|---|---|---|
| Claude 模型接入 | 原生 | 直接模型路由 | 直接模型服务 | 部分 IBM 产品 | 外部模型端点/模型托管服务 |
| 实际 Claude Code | 原生 | 直接兼容的端点 | 已文档化的 IDE/客户端集成 | 未确认作为端点 | 可进行外部使用;原生托管未确认 |
| Claude Agent SDK | 原生 | API 可能兼容;原生模板未确认 | 显式提供已文档化的模板 | 未确认 | 可使用自定义 Python 框架;一流的原生模板未确认 |
| MCP | 原生 | 直接提供平台 MCP 以及 Claude Code MCP | Palantir MCP 和 Ontology MCP | Orchestrate 和 watsonx.data MCP | 通过 Unity Catalog / AI Gateway 治理的 MCP 服务 |
CLAUDE.md | 原生 | 客户端:是;原生 Ask Sage 格式:否 | 客户端:是;原生 AIP 格式:否 | 无精确格式 | 无精确格式 |
| 自动记忆 | 原生 | 客户端提供;平台会话/数据功能有所不同 | 客户端/SDK 提供;平台历史记录有所不同 | 专有状态/上下文 | 依赖于框架;MLflow 追踪(Traces)并非记忆 |
| 技能 (Skills) | 原生 SKILL.md | 客户端:是;角色/提示词/插件为等效替代 | 客户端/SDK:是;函数/模板/Logic 为等效替代 | 智能体/工具目录和工作流为等效替代 | 智能体代码、指令和工作流为等效替代 |
| 钩子 (Hooks) | 原生 | 客户端:是;原生等效项粒度较粗 | 客户端:是;动作、限制和审批为等效替代 | 策略与编排等效替代 | 服务策略、作业和验证门禁为等效替代 |
| 插件 (Plugins) | 原生扩展包管理 | 客户端:是;Ask Sage 插件有所不同 | 客户端:是;平台包/模板有所不同 | Bob/工具包/目录有所不同 | 无 Claude 插件系统;Marketplace 服务于不同目的 |
8.2 企业数据、控制与运行能力
| 功能/特性 | Claude Code | Ask Sage | Palantir AIP | IBM watsonx / Bob | Databricks AI |
|---|---|---|---|---|---|
| 子智能体 / 团队 | 原生 | 客户端:是;Deep Agent 属于不同的抽象 | Agent SDK 与平台智能体组合 | Orchestrate 多智能体组合 | 依赖于框架的监督者/多智能体模式 |
| LSP / IDE 智能 | 原生 | 客户端:是,通过 Claude Code | 客户端:是;AI FDE/Code Workspaces 为专有 | Bob 提供专有代码智能 | 外部 IDE 和 Notebook 工具;无 Claude LSP 系统 |
| 知识 / RAG | 文件、MCP、记忆、网页 | 数据集、文件、网页、Deep Agent | 本体、数据集、文档、函数 | 知识库和文档库 | 表、卷(Volumes)、向量/知识服务、Unity Catalog |
| 语义查询 | 依赖于工具 | 主要为 RAG 和 API | 本体查询、函数、SQL 和动作 | watsonx.data、集成和决策服务 | Spark、SQL、语义指标和 Genie |
| 执行环境 | 本地/云端编码沙箱 | Claude Code 客户端沙箱以及 Ask Sage 端点控制 | 平台控制的执行和作用域受限工具 | 云端/混合控制的运行时和 IAM | 集群、无服务器计算、Apps 和模型托管 |
| 企业级权限 | Claude Code 权限 | 政府端点/管理员控制;取决于集成的系统 | 强身份、密级标记、对象/属性级安全以及限制条件 | IAM、机密管理、治理和企业级集成 | Unity Catalog 权限、服务策略和连接 |
| 可观测性 / 评估 | 会话、日志和钩子 | 账户指标和平台控制;需要针对特定应用进行评估 | AIP 指标、追踪、日志和执行历史 | 企业级监控/治理;特定于产品的评估 | MLflow 追踪/评估、系统表和网关监控 |
| 业务可操作动作 | Shell/工具;偏向编码 | 插件/MCP/智能体;非财务动作模型 | 预定义的本体动作和工作流 | 编排的企业动作和决策服务 | 自定义工具、函数、作业和工作流 |
| 核心差异化优势 | 开发者套件 | 安全访问与快速文本/RAG 引入 | 业务运行本体与受控工作流 | 混合集成与现代化 | 大数据计算与 AI 运营 (AIOps) |
9. 知识、查询与语义架构
“知识”一词在这些产品中描述的是截然不同的机制。模型上下文文件、向量索引、SQL 语义层以及业务本体之间无法相互替代。
| 知识类型 | 实现机制 | 定位与目的 | 优势平台 | 设计启示 |
|---|---|---|---|---|
| 项目上下文 | CLAUDE.md、规则和记忆 | 持久指令和代码库知识 | Claude Code | 灵活且接近实际工作;但强制约束力和企业级血缘有限 |
| 文档知识 | 针对政策、手册、合同和证明文件的 RAG | 检索源文本段落以获得有依据的回答 | Ask Sage、IBM watsonx.data、Databricks 知识/向量服务、Palantir 文档 | 取决于语料库质量、元数据、检索和引用验证 |
| 分析语义 | SQL 视图、指标定义、维度模型和受控函数 | 在大型结构化数据集上标准化度量和计算 | Databricks、自研湖仓一体、Palantir SQL/函数 | 最适合可复现的余额、趋势、差异和聚合计算 |
| 业务运行语义 | 对象、关系、动作、责任人和工作流状态 | 将数据连接到业务含义和受控动作 | Palantir 本体(Ontology);自研知识图谱/工作流 | 对个案和整改具有高价值;需要持续的领域治理 |
| 确定性决策逻辑 | 规则、验证和决策服务 | 一致地执行政策或计算 | IBM 决策服务、SQL/Python/Spark 规则、平台动作 | 虽不如 LLM 灵活,但对重大的计算和控制至关重要 |
🟩 在财务管理中
规范的财务语义层应当明确定义资金、拨款、预算年度、TAS、USSGL、SFIS 属性、余额、义务、支出、划拨以及财务报表行项目。这些定义应当存在于受控的数据模型和确定性函数中,而不能仅写在提示词或向量文档中。
9.1 为什么对于数据密集型工作而言,查询引擎比更大的模型更重要
LLM 不应该通过在其上下文窗口中读取数千个交易行来计算实质性余额。应该由 SQL 或 Spark 执行聚合;由规则引擎测试合规性;由统计或机器学习模型对异常进行评分;并由 LLM 选择经批准的工具、解释结果、识别缺失的凭证并引导后续跟进。这种分离提高了规模、可复现性,降低了成本,并增强了审计人员的信心。
10. 智能体套件工程与企业级控制
智能体套件工程(Harness Engineering)是一门将大语言模型(LLM)打造成受限、可观测且可测试系统的学科。即使是最强大的模型,如果其套件检索了错误的上下文、选择了不安全的工具、陷入死循环、丢失状态、绕过了权限或生成了无法复现的结论,系统依然会失败。
| 套件组件 | 功能 | 企业级重要性 |
|---|---|---|
| 上下文编译器 | 选择指令、模式、文档、示例、历史记录和工具结果 | 防止不相关或未授权的上下文进入任务 |
| 规划器与完成度控制器 | 分解任务、选择步骤并确定何时停止 | 控制死循环、成本以及过早或错误的完成 |
| 工具注册表与契约 | 强类型描述、输入、输出、权限和失败行为 | 工具质量通常比提示词的巧妙程度更重要 |
| 权限代理 | 传播身份并授权每次读取、查询或动作 | 防止智能体超出用户或任务角色的权限 |
| 执行隔离 | 沙箱化运行代码、命令、包、文件、网络和机密 | 限制由于失误或恶意内容导致的影响范围 |
| 状态与记忆 | 仅持久化保留所需的任务和组织知识 | 支持连续性,同时避免隐蔽、陈旧或未授权的记忆 |
| 预算控制器 | 限制 Token、时间、计算资源、SQL 吞吐量、重试和外部调用 | 保持智能体在经济和运行层面的可控范围 |
| 评估 | 测试检索、计算、工具使用、安全性、政策和最终答案 | 衡量的是整个系统,而非模型本身的流畅度 |
| 遥测与回放 | 捕获提示词、版本、工具、查询、数据快照和输出 | 支持事后排查、质量改进和审计复现 |
| 人工控制 | 审批、异常处理、复核人分配和职责分离 | 在执行重大的财务或运行动作前必不可少 |
11. 基于工作负载的平台策略
| 工作负载 | 典型示例 | 推荐的核心侧重点 | 工程关注重点 |
|---|---|---|---|
| 文本密集型 | 政策、手册、NFR 响应、CAP 描述、审计报告、往来公文、合同 | Ask Sage + 经批准的 Claude/模型;必要时采用自研 RAG | 检索召回率、权威数据源、生效日期、引用支持、提示词注入防御和人工审核 |
| 数据密集型 | 总账/辅助账分析、预算执行、差异、日记账审核、交易匹配 | 结合确定性 SQL/规则的 Databricks 或 Palantir;将 LLM 作为编排器 | 规范语义、可复现查询、数据质量、行/列级安全和凭证关联 |
| 大数据 | 数百万/数十亿条交易、总体画像、欺诈/异常模型 | Databricks 或同等分布式引擎;Palantir 用于业务运行跟进 | 分区、增量管道、血缘分析、特征质量、误报率、成本和延迟 |
| 业务运行工作流 | 个案、凭证包、审批、整改、责任人/动作跟踪 | Palantir AIP/Ontology;IBM Orchestrate 用于企业级集成模式 | 对象/动作设计、权限传播、分支管理、审批流和状态问责制 |
| 遗留/混合系统 | 大型机代码、COBOL/RPG/Java、长生命周期接口和业务规则 | IBM Bob / watsonx / Orchestrate | 依赖关系发现、确定性规则、测试覆盖率、混合连接和受控的现代化 |
| 自定义任务应用 | 独特的跨平台工作流或用户体验 | Claude Agent SDK 或平台无关框架 + MCP + 企业级服务 | 模型抽象、安全工具、评估体系、遥测、运维和生命周期所有权 |
11.1 文本密集型方案设计
-
整理权威集合并保留文档版本、生效日期、所有者、安全标记和废止状态。
-
采用混合检索、元数据过滤和重排,而非仅依赖向量相似度。
-
要求精细至句子或断言级别的引用,并测试引用的段落是否真正支持答案。
-
将检索到的内容与系统指令隔离开,防御文档中嵌入的提示词注入攻击。
-
衡量检索覆盖率、引用支持率、拒答质量和人工纠错率——而不仅仅是回答的流利度。
11.2 数据密集型方案设计
-
为每个重大计算和对账创建受控的 SQL、Spark 或服务函数。
-
开放狭义工具,例如
get_balance、trace_to_transactions、retrieve_support、run_reconciliation和create_case。 -
返回包含行数、过滤器、生效日期、数据版本和查询标识符的结构化输出。
-
默认保持智能体权限为只读;对于个案更新、工作流变更或账务过账,必须要求显式的人工审批。
-
利用 LLM 进行规划、解释和阐述——绝不能用其替代可复现的计算引擎。
11.3 大数据方案设计
对于总体规模的分析,正确的模式是:原始数据 分布式处理 精选分析产品 受控工具 AI 解释。原始交易总体不应直接放入 LLM 上下文中。智能体应当调用预先批准的分布式查询,接收可追溯的汇总结果,并在必要时才钻取到选定的异常数据中。
12. 美国国防部(DoD)财务审计目标架构
美国政府问责署(GAO)在 2026 年 5 月的报告中指出,DoD 调整后的审计方法更加强调技术(包括 AI)的应用,重点关注对账户余额提供支持的重大行项目和凭证,并指示国防部最大限度地利用 AI、自动化、数据分析和 Advana 平台来解决审计问题。GAO 还对可靠的财务信息、内部控制、IT 薄弱环节、透明度、欺诈风险以及可持续性表示了持续关注。[16]
图 2. AI 赋能的 DoD 财务审计目标架构。
| 层级 | 内容 | 审计目的 |
|---|---|---|
| 1. 权威源与凭证平面 | 源 ID、交易 ID、原始值、文档、摄取时间、转换逻辑、所有者、安全标记和完整性元数据 | 保护凭证链,防止 AI 输出替代权威记录系统 |
| 2. 财务语义层 | TAS、资金、拨款、预算年度、USSGL、SFIS、行项目、期初/本期变动/期末余额及重要性水平 | 为计算和凭证提供统一受控的业务含义 |
| 3. 确定性对账与控制引擎 | 前置系统到总账、辅助账到总账、滚存、重复项、未支持的日记账、文档匹配、接口和总体完整性 | 产生可重复的测试和异常数据集 |
| 4. 业务运行凭证与个案层 | 交易、源系统、文档、控制措施、样本、NFR(发现与建议通知书)、责任人、纠正措施和审计请求 | 将分析与问责及整改紧密关联 |
| 5. 受控工具层 | 只读查询、经批准的 SQL 函数、凭证检索、对账执行和报告包生成 | 将智能体约束在经批准、强类型且有日志记录的操作中 |
| 6. 可替换 AI 层 | 研究、检索、工具选择、解释、异常优先级排序和草案起草 | 采用模型优势,同时避免任务架构与单一供应商深度绑定 |
| 7. 人工审核与审批 | 编制人、复核人、审批人、审计协调和异常处置 | 维护问责制和职责分离原则 |
| 8. 不可篡改执行记录 | 身份信息、模型/提示词/技能版本、数据快照、SQL、工具、数据源、输出、审批和变更 | 确保可重放、可检查,并满足审计依赖性要求 |
🟥 不可妥协的审计原则
AI 可以负责检索、分类、解释、建议和编排。但受控制的数据平台必须负责计算、对账、授权、记录和证实。
12.1 优先 AI 使用场景与自动化边界
| 使用场景 | 核心引擎 | 适用的 AI 角色 | 控制边界 |
|---|---|---|---|
| 政策与审计指南研究 | RAG + LLM | 检索、总结、对比并引用权威指南 | 由人工验证理解及适用性 |
| 审计人员文档请求响应 | RAG + 凭证系统 + 工作流 | 寻找候选支撑材料、组装数据包并起草回复 | 由人工确认完整性、关联性和发布授权 |
| 余额到交易的溯源 | SQL/Spark + 语义模型 + 本体(Ontology) | 将行项目溯源到账户、交易、前置系统和支撑材料 | LLM 解释路径;确定性服务生成溯源结果 |
| 总账与辅助账对账 | SQL/Spark/规则 | 匹配数据集、量化差异并对异常类型进行分类 | LLM 不执行实质性总额计算 |
| 日记账凭证分析 | 规则 + 异常模型 + LLM 解释 | 识别异常的编制人、时间、账户、金额、描述和未支持的分录 | 由人工进行调查并决定处置方式 |
| 交易全集完整性 | 数据工程 + 血缘分析 + 控制规则 | 验证预期源、记录数、总额、期间覆盖范围和接口完整性 | AI 对缺口划分优先级;系统证实完整性 |
| NFR 和 CAP 支持 | 凭证图谱 + RAG + LLM | 总结现状、原因、影响、里程碑、责任人和佐证凭证 | 由人工明确根本原因、整改承诺和关闭决策 |
| 遗留系统分析 | 代码智能体 + IBM/Claude 工具 | 解释遗留代码中的接口、规则和数据转换 | 由测试和系统所有者验证其行为 |
| 不当支付 / 欺诈筛查 | 机器学习/统计 + 规则 + 个案管理 | 对总体进行评分、聚类分析并分发个案 | 由专业调查人员确定发现和动作 |
12.2 Advana FM 的数据模型启示
宽表格式的“扩展总账表”(GL Extended table)由于将许多会计属性集成在单个可查询的数据集中,因此是一个非常有价值的分析主干。但就其本身而言,它还不是一个符合审计要求的凭证模型。它可能缺乏完整的辅助账事件链、接口控制凭证、源文档关联、状态历史、红字反冲与更正、用户审批以及解释为什么会发生该会计分录的业务事件上下文。
推荐的设计是保留该宽表以提供高查询速度,同时添加指向源交易、辅助账事件、证明文档、系统/接口元数据、控制结果和审计个案的受控链接。Palantir 本体是表示这些关系的一种方式;以 Databricks 为中心的实现则可以使用精选的关系模型、数据血缘、指标定义和独立的个案/凭证应用。
12.3 模型可用性与采购风险
截至 2026 年 7 月 13 日,DoD 与 Anthropic 之间的采购和诉讼环境仍不明朗。当前报道指出,Anthropic 已被列为五角大楼合同的供应链风险企业,并未包含在 2026 年 5 月与另外七家 AI 供应商达成的协议中。因此,架构设计必须支持模型替换,并针对每个合同、网络、涉密等级和具体用例验证模型的实际可用性。[17][18]
13. 针对 Advana FM 与 DoD 审计的平台策略
| 策略 | 适用场景 | 设计模式 | 权衡与弊端 |
|---|---|---|---|
| Palantir 优先 | Advana/Foundry 是批准的运行平台,且本体是核心 | 构建财务/审计本体、凭证个案、受控动作和智能体工具;使用 Claude 或其他经批准的模型 | 最佳的业务运行集成和工作流;但存在弱本体/数据治理和对供应商依赖的风险 |
| Databricks 优先 | 湖仓一体和 Spark/SQL 是企业数据基础 | 构建规范的审计数据产品、对账函数、血缘分析和机器学习模型;向智能体和个案应用开放受控工具 | 最佳的计算能力和开放性;但需要额外的运行个案/动作设计 |
| Ask Sage 优先 | 当务之急是安全的文本、政策和文档辅助 | 部署精选数据集、引用验证和特定角色助手;为开发者连接 Claude Code;随后集成权威查询工具 | 快速见效且初始工程量低;但对于交易级的审计凭证支持不足 |
| IBM 优先 | 遗留系统和混合系统在转型问题中占主导地位 | 使用 Bob 和 watsonx 进行代码/流程现代化,Orchestrate 用于集成,决策服务用于确定性规则 | 强大的遗留系统集成能力;但当现代数据平台已覆盖核心需求时,可能会增加系统复杂度 |
| 自研优先 | 任务工作流独特,或对可移植性要求极高 | 使用 Agent SDK 或中立框架、MCP、企业级 IAM、数据服务、凭证库、评估体系和模型路由 | 拥有最大控制权;但生命周期、ATO、安全和运维负担最高 |
| 混合策略(推荐用于企业级审计) | 存在多种不同类型的工作负载 | Databricks/经批准的计算资源用于总体分析;Palantir/Advana 用于业务凭证和工作流;Ask Sage 用于安全文本;IBM 用于遗留系统;模型可替换 | 与工作负载实现最佳匹配;但需要清晰的系统边界和治理体系 |
13.1 推荐的角色分配
| 组件 | 推荐扮演的角色 |
|---|---|
| Advana / Palantir | 业务运行审计数据、本体(Ontology)、凭证关系、个案/整改工作流、权限控制和动作执行 |
| Databricks 或经批准的分布式计算 | 海量数据摄取、规范化、大型关联、对账、总体画像、异常模型和可复用的数据产品 |
| Ask Sage | 安全模型网关、文档/政策研究、分析师草案起草、快速原型开发和受控的 Claude Code 访问 |
| IBM | 遗留系统/大型机现代化、混合集成、确定性业务规则,以及必要时的企业级智能体编排 |
| Claude 或其他经批准的模型 | 可替换的推理、语言表达、编码、工具选择和解释组件 |
| 自研任务服务 | 财务语义定义、经验证的工具、评估套件、凭证打包和跨平台编排 |
14. 构建自定义企业级 AI 解决方案
自研解决方案应当借鉴 Claude Code 的工程模式,但不能让特定于 Claude 的制品成为任务系统运行的唯一方式。任务逻辑和凭证应当保持开放,以便其他批准的模型和智能体也能够访问。
| 构建领域 | 推荐模式 | 成效 |
|---|---|---|
| 模型抽象 | 使用路由层和通用的消息/工具接口 | 在不重建工具、凭证、权限或工作流的情况下更换模型 |
| 规范上下文 | 维护版本化的领域规则、数据定义、系统特异性和操作程序 | 在目的上等同于 CLAUDE.md,但受统一治理且跨模型可用 |
| 技能风格模块 | 将对账、凭证审查、抽样、NFR 响应和控制测试分别打包 | 避免编写单一巨型提示词,并实现针对性测试与版本控制 |
| MCP / API 工具 | 开放强类型的、狭义的、经过身份验证的函数 | 减少定制化集成,约束智能体行为 |
| 确定性验证钩子 | 在完成任务或执行动作前运行安全、数据质量、查询、凭证和审批检查 | 将关键规则从“口头建议”转化为“强制执行的控制措施” |
| 智能体专用化 | 仅在隔离确能带来价值的场景下使用独立的检索、数据、凭证、安全和审查智能体 | 防止上下文过载,避免出现权限过大的泛用型智能体 |
| 企业级授权 | 将用户身份和任务角色传播给每个工具 | 防止智能体演变为共享的超级用户 |
| 凭证与回放 | 记录数据源、查询、版本、输出和审批轨迹 | 使每一项实质性成果均可复现 |
| 评估与红队测试 | 测试黄金案例、植入的数据错误、提示词注入、越权访问和不完整凭证 | 在投入实际业务运行前确立系统可靠性 |
| 安全执行 | 沙箱化运行代码、包、网络、机密和临时文件 | 容纳故障并遏制恶意输入 |
14.1 哪些内容不应从零构建
-
当已有经批准的服务时,无需重新构建企业身份与访问管理。
-
当 Databricks、Palantir 或其他批准平台已提供时,无需重建新的分布式查询引擎或数据目录。
-
无需仅仅因为某个 LLM 功能需要检索,就去定制开发一个向量数据库。
-
当 MCP 或 OpenAPI 能够满足需求时,无需构建专有的工具协议。
-
无需构建与特定模型绑定的凭证库,否则模型更换时该库将失效。
-
在只读工作流、凭证控制和人工审批得到证实之前,切勿构建自主执行财务记账过账的智能体。
15. 实施路线图与成功衡量标准
| 阶段 | 核心工作 | 准出条件 |
|---|---|---|
| 阶段 0:任务与治理 | 选择一个实质性的审计用例;确定权威数据源、所有者、安全边界、候选模型和成功标准 | 概念获得批准,完成数据/工具清单、风险登记册和评估计划 |
| 阶段 1:可信数据基础 | 构建规范的交易/余额/凭证数据集,实施源头对账、质量控制和血缘追踪 | 形成已对账的总体,且完整性和质量已记录归档 |
| 阶段 2:确定性工具 | 实现经验证的 SQL/Spark/规则函数,并通过受控的 API 或 MCP 开放 | 实现可重复的计算、对账和凭证检索 |
| 阶段 3:只读副驾驶(Copilot) | 引入智能体以用于研究、查询规划、解释说明和凭证包组装 | 回答基于事实并附带引用,不具备任何实质性的写入权限 |
| 阶段 4:人工审批工作流 | 增加个案创建、任务分发、异常处置和数据包提交功能 | 动作执行受控,且具备职责分离和不可篡改的审批记录 |
| 阶段 5:扩展与优化 | 扩展数据总体、模型和工作流;增加路由、监控、成本控制和备用模型 | 实现可衡量的企业级性能、可靠性和可持续性 |
| 度量领域 | 推荐的度量指标 |
|---|---|
| 数据信任度 | 实质性余额核对比例;交易总体完整性;可溯源至源头和支撑材料的百分比;未解决的数据质量异常数 |
| 文本/RAG 质量 | 检索召回率;引用支持率;废止源文件的误用率;拒答质量;人工纠错率 |
| 分析准确性 | SQL/规则测试通过率;对账精度;异常误报/漏报率;跨数据快照的可复现性 |
| 运行效能 | 回复审计人员请求的时间;凭证包处理周期;减少的分析师工时;个案账龄;整改吞吐量 |
| 智能体控制 | 未授权的工具尝试次数;审批绕过次数;提示词注入成功率;预算超支次数;失败或陷入死循环的任务数 |
| 可审计性 | 具备完整模型、提示词、工具、查询、数据快照、源头和审批记录的实质性输出占比 |
| 成本与规模 | 单个文档、查询、百万交易、凭证包和关闭异常的成本;计算资源与 Token 利用率 |
16. 最终建议
-
切勿仅仅因为某平台宣传其支持 Claude 就选择该平台。应当首先选择权威的数据、语义、工作流和控制层。
-
当面对以代码库为中心的软件工程问题时,使用真正的 Claude Code 客户端。当在自定义应用内部需要其套件模式时,使用 Claude Agent SDK。
-
将 Ask Sage 作为安全的模型和文本辅助层,而非交易或凭证系统。
-
将 Palantir AIP 作为业务运行语义与工作流平台,其核心优势在于本体(Ontology)、权限控制、动作和凭证关系的关联。
-
将 Databricks 作为大型结构化数据、对账、机器学习、血缘分析和评估的分析与计算基础。
-
在遗留系统现代化、混合集成和确定性企业级决策处于核心地位时,将 IBM 作为首选专家。
-
对于 DoD 审计,应从可信数据、实质性行项目语义、对账和凭证溯源入手。在确定性基础构建完毕后再引入 AI。
-
保持模型访问的可替换性,因为技术性能、成本、授权情况和采购条件的变化往往比任务系统的迭代更快。
-
默认采用只读智能体工具。仅通过预定义工作流、显式审批和职责分离来引入写动作。
-
评估的是整个系统——检索、数据、工具、计算、权限、引用和人工工作流——而非仅仅评估模型本身。
🟦 推荐的 Advana FM 模式
受控制的财务与凭证数据 + 分布式对账与分析 + 业务运行本体/个案管理 + 狭义 MCP 工具 + 可替换的已批准模型 + 默认只读智能体 + 人工批准的动作 + 不可篡改的执行记录。
附录 A. 决策清单
| 决策领域 | 核心必答问题 |
|---|---|
| 任务成果 | 哪些具体的决策、审计认定、凭证包或工作流需要改进? |
| 权威数据 | 针对每个余额、交易、文档和状态,哪个系统和数据产品具有权威性? |
| 语义模型 | 会计和业务定义在何处实现并进行版本控制? |
| 确定性逻辑 | 哪些计算、匹配、阈值和控制测试必须是可复现的? |
| 模型角色 | 哪些内容需要推理或语言能力,哪些内容应当保持为 SQL、代码、规则或工作流? |
| 工具设计 | 智能体工具是否为狭义的、强类型的、经过身份验证的、有日志记录的,且默认只读? |
| 权限 | 每项操作是否都在用户或批准的服务身份下执行? |
| 凭证 | 每项实质性主张是否可以追溯到数据源、查询、数据版本和证明文档? |
| 人工控制 | 谁负责编制、复核、批准和解决异常? |
| 评估 | 哪些黄金案例和对抗性测试能证实系统的可靠性与安全性? |
| 运维 | 谁负责监控、事件响应、模型变更、数据漂移、成本控制和重训? |
| 可移植性 | 在不重建数据、工具、凭证和工作流的前提下,模型能否被替换? |
| 授权 | 模型、平台、网络、数据类型和用例是否在适用的 ATO 和合同下获得批准? |
附录 B. 资料来源说明
产品功能和可用性变化迅速。以下官方文档和当前报告支持了本报告中的主要事实陈述。在采购或部署前请重新验证。
-
Anthropic - Claude Code 概述:<u>开源资料</u>
-
Anthropic - Claude 如何记住您的项目:<u>开源资料</u>
-
Anthropic - 创建插件:<u>开源资料</u>
-
Ask Sage - 兼容 Anthropic 的端点与 Claude Code 集成:<u>开源资料</u>
-
Ask Sage - 数据、Deep Agent 和 MCP:<u>开源资料</u>
-
Palantir - 2026 年 7 月公告,包括 Claude Agent SDK 模板:<u>开源资料</u>
-
Palantir - 2026 年 6 月公告,包括 Palantir MCP 和 Ontology MCP 正式商用 (GA):<u>开源资料</u>
-
Palantir - Ontology MCP 概述:<u>开源资料</u>
-
Palantir - AI FDE 概述:<u>开源资料</u>
-
IBM 与 Anthropic 合作伙伴关系:<u>开源资料</u>
-
IBM Cloud - 结合 watsonx Orchestrate 和 MCP 的智能体化 AI 工作流:<u>开源资料</u>
-
IBM watsonx.data 远程 MCP 服务器:<u>开源资料</u>
-
IBM Bob AI 编码智能体:<u>开源资料</u>
-
Databricks - 在 Databricks 上使用智能体:<u>开源资料</u>
-
Databricks - Unity AI Gateway 和 Unity Catalog 血缘:<u>开源资料</u>
15a. Databricks - Unity Catalog 数据血缘:<u>开源资料</u>
-
GAO-26-109115 - 国防部财务管理:与新财务审计方法相关的问题:<u>开源资料</u>
-
路透社 - 五角大楼将 Anthropic 指定为供应链风险,2026 年 3 月 5 日:<u>开源资料</u>
-
路透社 - 五角大楼与七家 AI 供应商达成协议,2026 年 5 月 1 日:<u>开源资料</u>
学习地图
第一阶段:核心架构与智能体基元
- 模型与控制框架:学习大语言模型(LLM)与规划引擎的功能分离,以防止业务逻辑遭受提示词注入。
- 模型上下文协议 (MCP):理解开放协议如何实现推理模型与后端工具及企业数据库的解耦。
- 状态与记忆管理:掌握智能体如何在不膨胀 Token 预算或越过安全边界的情况下,跨会话实现上下文持久化。
第二阶段:企业级语义与数据平面
- 语义层 (SQL/Spark/Ontology):学习构建确定性的语义模式,使 LLM 能够访问经过验证的统计数据,而不是由其自身计算数值。
- 数据血缘与元数据追踪:探索如何将 LLM 生成的决策追溯到最底层的列级数据库修改。
- 权限与 IAM 传播:掌握身份委托技术,防止智能体以权限过高的系统级用户身份执行操作。
第三阶段:运行护栏与评估
- 运行环境隔离与沙箱化:在安全容器内安全地执行智能体命令,以限制编程错误或恶意数据的影响。
- 自动评估 (Evals):利用测试数据集构建系统化的验证套件,对检索覆盖率、准确性和合规性进行评估与评级。
动手实践——分步指南
步骤 1:设置本地沙箱
创建一个安全的 Python 虚拟环境来承载您的智能体本地测试环境:
mkdir mcp-audit-sandbox
cd mcp-audit-sandbox
python3 -m venv venv
source venv/bin/activate
pip install mcp langchain-anthropic
步骤 2:编写只读的 SQL 模拟工具
创建一个 Python 文件 tools.py,实现确定性的数据库查询,而不是让 LLM 直接计算结果:
def get_ledger_balance(fund_id: str) -> dict:
# Mocking database response
mock_db = {"FUND_A": 1500000.00, "FUND_B": 850000.50}
balance = mock_db.get(fund_id, 0.0)
return {"fund_id": fund_id, "balance": balance, "status": "reconciled"}
步骤 3:集成 MCP 服务器模式
设置 fastmcp 服务器模式,安全地注册您的账本查询工具:
from mcp.server.fastmcp import FastMCP
mcp = FastMCP("DoDAuditServer")
@mcp.tool()
def query_balance(fund_id: str) -> str:
"""Retrieves verified reconciled balance for a given fund ID."""
res = get_ledger_balance(fund_id)
return f"Verified balance for {res['fund_id']} is ${res['balance']:,.2f}."
步骤 4:评估和审计运行
对该工具执行测试,验证 LLM 是否被限制为仅调用此特定工具,而不是凭空猜测账本余额,并记录完整的执行轨迹。
三大推荐资源
- 1Anthropic Claude Code Documentation
The official guide to Anthropic's reference agent harness, showing how to structure CLI agents, memory, and permissions.
https://code.claude.com/docs/en/overview
- 2Model Context Protocol (MCP) Official Site
The official open-source protocol documentation explaining how to safely connect LLMs to data sources and tools.
https://modelcontextprotocol.io
- 3Databricks Agent Framework
Official reference guide to deploying, evaluating, and monitoring enterprise-grade Python agents alongside secure database catalogs.
https://docs.databricks.com/en/generative-ai/agent-framework/index.html
链接由 AI 推荐——使用前建议快速核实。