BrainBank

Ask Sage · Palantir AIP · IBM watsonx · Databricks — 整合与修正参考

2026/7/13 18:00:33 · 更新于 2026/7/13 18:04:25

#mcp#claude-code#best-practices#architecture#enterprise-ai#dod

一份对比 Ask Sage、Palantir AIP、IBM watsonx 和 Databricks 的架构指南,探讨如何在安全的 DoD 财务审计环境中集成 Claude Code、MCP 以及模型无关的智能体底座。

合并自两项独立的分析,并已对照原始来源进行事实核查与一致性协调。编写于 2026 年 7 月 13 日。

全文使用的溯源标识: [A] = 沿用自原始附带的分析并验证无误 · [C] = 根据本次审查研究新增或修正 · [A→C] = 存在于原始分析中但在本文中予以修正。完整变更日志参见第 9 节。

1. 执行评估

Claude 模型、Claude Code / Claude Agent SDK 以及企业级 AI 平台运行在三个不同的层级。需要避免的核心错误是将它们视为相互竞争、可替代的产品:

  • Claude 模型(Claude models)提供推理、语言生成、代码编写和工具选择。
  • Claude Code and the Claude Agent SDK(Claude Code 和 Claude Agent SDK)提供智能体框架(agent harness):上下文组装、工具执行、权限控制、智能体循环、记忆、钩子(hooks)、子智能体(subagents)、技能(skills)、插件以及 IDE 交互。
  • Enterprise AI platforms(企业级 AI 平台)提供受治理的数据、身份认证、工作流执行、语义模型、数据血缘、部署、评估、合规性以及与业务系统的集成。[A]

使用 Claude 模型并不等同于使用 Claude Code 的架构。在所审查的平台中:

  • Ask Sage 与实际的 Claude Code 客户端具有最直接的兼容性 —— 已证实:其兼容 Anthropic 的端点可在无需修改的情况下运行真正的 Claude Code CLI、VS Code 扩展和 Claude Cowork,并支持用于陆军生成式 AI(Army GenAI)的国防部(DoD)PKI 证书。[A, verified]
  • Palantir 在结合 Claude Agent SDK、MCP、企业权限、业务数据和操作(actions)方面走得最远 —— 已通过 Foundry 的 Anthropic 兼容代理端点以及 Ontology MCP 对无头(headless)Anthropic SDK 智能体的支持得到证实。[A, verified]
  • Databricks 与 Claude Code 也有着同样直接的关系,而不仅仅是模型托管关系:Agent Bricks 将 Claude Code SDK 列为一级支持的框架,并且 Omnigent(Databricks 的开源“框架之框架”)在统一的受治运行时下组装了 Claude Code、Codex 和自定义智能体。这使 Databricks 的分类从“无文献记录”重新调整为直接支持(Direct)[C — 修正了原始分析]
  • IBM 拥有最强大的专有替代方案,适用于混合企业集成、传统系统现代化、决策服务以及重度依赖大型机的环境,其通过 IBM Bob 和 watsonx Orchestrate 构建了一个多供应商的智能体控制平面。[A]
  • Claude Code 本身在以代码库为中心的编码和可配置的本地智能体行为方面,依然是这些方案中最强大的。[A]

有一个事实特别改变了国防部(DoD)环境的实际权衡,而原始分析对此未作任何探讨 —— 参见第 2 节。

2. 关键的时效性说明:DoD 与 Anthropic 的合同纠纷

本版本新增内容 —— 在原始附带的分析中缺失,对于任何假设 Claude 在 DoD 合同和机密网络中是自由批准模型的建议,该内容都是实质性的。

2026 年 2 月底,在关于军方是否可以将 Claude 用于“所有合法目的”的争议之后,DoD 将 Anthropic 指定为“供应链风险” —— 这一称号通常保留给外国对手。Anthropic 表示,这可能会授权自主武器系统或国内大规模监控。特朗普总统指示联邦机构停止使用 Anthropic 的技术。2026 年 5 月 1 日,DoD 宣布了与八家供应商——SpaceX、OpenAI、Google、NVIDIA、Reflection、Microsoft、AWS 和 Oracle —— 在机密网络(IL6/IL7)上的 AI 合作伙伴关系,刻意排除了 Anthropic。Anthropic 提起诉讼;加利福尼亚州的一项禁令维持了其为民事机构服务的能力,但在诉讼持续期间,五角大楼对 DoD 合同的排除依然有效。此后的报道表明非正式谈判已经重启,但截至本文撰写时,该排除令仍处于生效且处于争议状态。

实际影响: 以下通过“基于经批准的 AIP 模型服务的 Claude”或“基于 Ask Sage 的 Claude”的建议在架构上仍然是正确的 —— 这两个平台确实都如上所述支持 Claude —— 但 Claude 是否是特定 DoD 合同或机密网络的可采购、经授权模型,是一个独立于技术架构的实时政策问题。产生两个后果:

  • 在架构设计任何面向 DoD 的构建时,确保在 MCP/工具抽象层后,模型提供商是可更换的 —— Claude 或其他获得认可的模型应当置于相同的框架之后,而无需重新构建。
  • 对于非机密的 CUI/FOUO 工作(大多数日常 DoD 财务管理(FM)分析),通过 FedRAMP-High 途径使用 Claude 可能会比部署在机密网络上更容易获得 —— 在投入工程时间之前,请向您的 ISSM/AO 确认当前状态,因为此问题正处于积极诉讼和变化之中。

3. Claude Code 实际包含的内容

Claude Code 不仅仅是一个 LLM 的接口:它是一个智能体编码工具,可读取代码库、编辑文件、执行命令并与开发工具进行交互;Claude Agent SDK 为自定义智能体提供了相同的工具、智能体循环和上下文管理机制。[A]

3.1 上下文与知识

Claude Code 从源文件、CLAUDE.md、本地自动记忆(由 MEMORY.md 索引,每次会话加载上限为前 200 行 / 25KB)、活动的 IDE 文件、命令输出、MCP 资源/工具、智能体技能以及子智能体结果中组装上下文。这是灵活的、面向会话的项目知识 —— 与企业知识图谱、受治理的数据目录或语义 SQL 层并不相同。[A, verified]

3.2 技能(Skills)、钩子(Hooks)、插件(Plugins)、子智能体(Subagents)、LSP

  • Skills(技能): 以 SKILL.md 为中心的、可重复使用的、按需加载的指令包 —— 相关的 DoD FM 示例包括审计证据验证、USSGL/SFIS 映射检查、NFR(通知与调查结果)根本原因分析以及对账程序。[A]
  • Hooks(钩子): 生命周期事件中的确定性控制(阻止不安全命令、编辑后运行扫描、完成前要求测试、记录到审计系统)。
  • Plugins(插件): 将技能、钩子、子智能体、MCP 服务器和 LSP 服务器打包成一个可分发的、具有版本控制的单元。
  • Subagents / agent teams(子智能体/智能体团队): 上下文隔离的专业工作者,工具受限,可在前台或后台运行。
  • LSP: 插件可以捆绑语言服务器诊断,以便 Claude 直接看到 IDE 的错误/警告;一个有文档记录的“安全模式(safe mode)”标志可以禁用 CLAUDE.md、插件、技能、钩子和 MCP 服务器以便进行故障排除。[A, 核心声明已验证;安全模式下是否特别包含 LSP/自动记忆未得到确认]

对于大规模金融交易分析而言,这些内容的重要性远不及数据血缘(data lineage)、语义建模、SQL 执行、访问控制和证据溯源(evidence provenance)。[A]

3.3 框架工程体系

AI 框架(harness)是模型周围的系统,决定了它是成为一个有用的企业智能体还是仅仅是一个聊天机器人。一个成熟的框架包含 12 个功能组件:[A]

框架组件用途
上下文编译器 (Context compiler)选择进入提示词的文档、模式(schema)、指令、历史记录和元数据
规划器 (Planner)将目标分解为步骤并选择工具
工具注册表 (Tool registry)定义可用工具、模式、描述和限制
权限代理 (Permission broker)决定智能体可以读取、更改、执行或批准什么
执行环境 (Execution environment)在受控沙箱中运行代码和命令
状态管理器 (State manager)维护会话状态、检查点和可恢复性
记忆系统 (Memory system)在即时上下文窗口之外存储可复用的知识
预算控制器 (Budget controller)限制 Token、时间、工具调用、计算和重试次数
完成控制器 (Completion controller)确定任务何时完成或必须停止
评估器 (Evaluator)测试正确性、接地性(grounding)、安全性和合规性
遥测层 (Telemetry layer)记录提示词、工具、查询、输出、成本、延迟和故障
人工控制层 (Human-control layer)提供审批、异常处理和职责分离

Claude Code 和 Agent SDK 为面向编码的智能体提供了其中的大部分功能。Palantir、IBM 和 Databricks 提供了替代的企业级框架。Ask Sage 既可以提供自己的 Deep Agent/Agent Builder environment 或作为实际 Claude Code 框架背后的安全模型端点。[A]

4. 采用对比矩阵

分类术语:直接(Direct) = 平台明确实现或支持 Claude 机制。客户端提供(Client-provided) = 该机制之所以起作用,是因为在针对平台的端点使用了真正的 Claude Code 客户端。类似(Analogous) = 平台具有专有的等效功能,但格式不兼容。无文献记录(Not documented) = 没有公开文档证实其兼容性。[A]

功能/能力Ask SagePalantir AIPIBM watsonx/BobDatabricks AI
Claude 模型访问直接 —— 通过兼容 Anthropic 的端点进行模型路由直接 —— AIP 模型服务(Azure、AWS Bedrock、Vertex、原生)横跨 IBM 产品组合(Orchestrate、Bob、watsonx.ai)的战略集成直接 —— Mosaic AI Model Serving 原生托管 Claude
实际 Claude Code 兼容性极高 —— 具有文档记录的 Anthropic 兼容端点;真正的 Claude Code CLI/VS Code/Cowork 可无修改运行高 —— Foundry 提供兼容 Anthropic 的代理端点;已证实 Claude Code 可作为外部客户端运行未见有作为 Claude Code 兼容端点的记录;IBM Bob 是一个独立的专有编码智能体自 2026 年 6 月起直接支持 —— Agent Bricks 将 Claude Code SDK 列为一级框架 [A→C: 已修正]
Claude Agent SDK通过端点实现 API 兼容;未记录单独的原生 SDK 集成直接 —— Ontology MCP 明确支持无头“Anthropic SDK”智能体,与 Google ADK, Microsoft Agent Framework, OpenAI SDK 并列未发现显式的原生 Claude Agent SDK 支持直接支持 —— Omnigent 在统一运行时下组装了 Claude Code、Codex 和自定义智能体 [A→C: 已修正]
MCP原生 —— 内置 M365/GitHub 连接器以及自定义 MCP 服务器,处于管理员白名单中极强 —— 两个不同的服务器:Ontology MCP(受治业务数据)和 Palantir MCP(80+ 开发工具,无法写入生产数据)强 —— Orchestrate 和 watsonx.data 开放 MCP 服务器;IBM 共同制定了开源 MCP 标准强 —— MCP 直接添加到 Unity Catalog;托管服务器开放 UC 函数、Genie、向量搜索和 DBSQL
CLAUDE.md在通过端点运行实际 Claude Code 时可用;非 Ask Sage 原生格式可通过外部 Claude Code 使用;非原生 AIP 配置标准未发现完全相同的采用未发现完全相同的采用;Genie Ontology 起到了类似的规范上下文作用
技能 (Skills)可通过 Claude Code 使用;Ask Sage 的角色/模板/插件是类似的,但格式不兼容可通过 Claude Code/Agent SDK 使用;记录了围绕 Ontology MCP 工具构建 Claude 技能的模式IBM Agent Catalog 概念与之类似,而非 Anthropic Agent Skills用于 Genie Code 的“智能体模式技能”名称相同,但规范不同;正在趋同但仍为专有
钩子 (Hooks)在作为端点使用时由 Claude Code 客户端提供由外部 Claude Code 提供;Palantir 拥有自己的操作/审批/工作流机制IBM 编排和策略控制与之类似Databricks 服务策略、作业(jobs)和 MLflow 控制与之类似
插件 (Plugins)Claude Code 插件可在客户端中工作;Ask Sage 也拥有约 27 个专有插件/智能体Claude Code 插件可外部工作;Palantir 提供包、模板、应用和 MCP 作为替代方案IBM Agent Catalog 和 ADK 是专有替代方案框架库、Unity Catalog 服务和 MCP 是替代方案;无插件市场
子智能体 (Subagents)Claude Code 和 Cowork 提供此功能;Deep Agent 与之类似Claude Agent SDK 支持智能体组装;AIP 可以将智能体作为工具开放Orchestrate 支持原生和外部智能体组装支持多智能体监督模式和 Omnigent 组装的框架
LSP / IDE 诊断作为端点使用时具有完整的 Claude Code 能力可通过外部 Claude Code 使用;AI FDE 拥有自己专有的代码/数据感知能力IBM Bob 提供其自有的代码库和 IDE 智能无完全等效功能;笔记本/开发工具为平台原生
知识 / RAG数据集、文件、角色、插件、MCP,具有可解释性检索审计功能属性本体(Ontology)、数据集、文档、函数、应用知识库和 watsonx.data 文档库AI 搜索、向量搜索、Unity Catalog 表和卷、Genie Ontology
语义 / 查询引擎主要由 RAG 和 API 驱动 —— 未发现完整的企业级语义 SQL 层通过 Ontology、查询函数、操作、对象关系提供极强的业务语义层强混合数据 and 决策服务能力通过 SQL、Genie、度量视图(Metric Views)、Spark、Unity Catalog 提供极强的分析语义层
审计 / 治理强大的安全网关和政府部署定位;零信任、基于标签的访问控制强大的身份传播、权限、分支、血缘、执行历史和审批 —— 满足欧盟 AI 法案第 13 条可审计性,且配置少于同行强大的企业级治理、混合部署、决策和生命周期控制;Sovereign Core 在运行时层嵌入策略强大的数据/AI 血缘、访问控制,通过 Unity AI Gateway 进行流量治理,MLflow 追踪和评估

5. 平台深度剖析

5.1 Ask Sage

Claude 采用程度

Ask Sage 兼容 Anthropic 的端点已有完整的文档支持,只需最少的配置(将 ANTHROPIC_BASE_URL 指向 Ask Sage),即可运行真正的 Claude Code CLI 和 VS Code 扩展,包括对 Army GenAI 环境的 DoD PKI 证书支持,且该模式同样适用于 Claude Cowork。因为实际的工作是由真实客户端完成的,所以 Ask Sage 不需要重新实现 CLAUDE.md、技能、钩子、插件、子智能体或 LSP —— 它在未修改的 Anthropic 客户端底层提供模型路由、身份验证、政府网络连接和推理服务。[A, verified]

Ask Sage 自己的原生平台单独包含了数据集、角色/提示词模板、约 27 个插件和智能体、Deep Agent、Agent Builder、工作簿/画布以及 API 访问 —— 但这些不应被视为与 Anthropic Agent Skills、Claude 插件或 CLAUDE.md 格式兼容。[A]

最强能力

  • 在单一受控且经政府认可的接口后面,访问 150 多个商业模型
  • 在受控的 DoD/IL5/IL6 环境中运行 Claude Code 的最快途径,无需构建模型网关
  • 支持 CUI(受控非机密信息)、零信任、基于标签的访问控制;提供边缘/气隙(air-gapped)部署选项
  • 为非开发人员的分析师提供从聊天到基于 API 的应用的最简工程路径

局限性

Ask Sage 不应被视为权威的企业数据或审计系统。在财务对象的企业语义建模、交易级对账、列级血缘(column-level lineage)、分布式 SQL/Spark 计算以及证据链管理方面,它弱于 Palantir 或 Databricks。对于 DoD 审计,应将其定位为安全模型和分析师辅助层 —— 而非全量交易数据库(Universe of Transactions)、对账引擎或证据库。[A]

5.2 Palantir AIP

Claude 采用程度 —— 三个层级

  • 第一层级: Claude 作为 AIP 模型,通过 Azure、AWS Bedrock、Google Vertex 或原生注册提供,取决于区域/环境的可用性。
  • 第二层级: Claude Code 作为外部 Foundry 客户端 —— 已证实。Foundry 提供兼容 LLM 供应商的代理端点(Anthropic、OpenAI 格式),专门用于运行像 Claude Code 这样的工具,同时 Foundry 添加了速率限制、零数据留存和使用情况跟踪。在这种模式下,Claude Code 提供 CLAUDE.md、技能、插件、钩子、子智能体和 IDE 集成;Palantir 提供受治理的数据、Ontology(本体)、模型、API、权限和企业级工具;MCP 则将两者连接起来。
  • 第三层级: 在 Palantir 托管的智能体内部使用 Claude Agent SDK —— 已证实。Ontology MCP 明确记录了与无头智能体框架(包括“Anthropic SDK”)的集成,与 Google ADK、Microsoft Agent Framework 和 OpenAI SDK 并列。

Ontology MCP 与 Palantir MCP —— 一个重要的、有明确文献记录的区别

Ontology MCP (OMCP) 将对象类型、操作类型和查询函数公开为受治理的 MCP 工具,供需要安全读取、写入(仅通过预定义的操作)和查询生产 Ontology 数据的智能体使用;访问范围通过应用限制和标准 Foundry 权限进行约束。Palantir MCP 是一个单独的、面向开发人员的服务器(大约 14 个类别,包含 80 多个工具)用于构建 Foundry 资源 —— 数据集、本体、代码库、OSDK 应用 —— 并且明确规定无法写入生产 Ontology 数据。对于高后果性的财务管理而言,这种分离比起赋予智能体无限制的数据库或 shell 访问权限要合适得多。[A, verified]

Palantir 的专有框架

AI FDE(Palantir 自有的企业框架)在当前用户的身份和权限下运行 —— 如果用户无法创建代码库、编辑对象类型或执行操作,AI FDE 也无法执行。Palantir 用其自有的构建块替代了大部分 Claude Code 的概念:

Claude Code 概念Palantir 对应物
CLAUDE.md应用/代码库/AI FDE 上下文
技能 (Skill)函数、工具、AIP Logic 块
插件 (Plugin)平台包或 MCP 服务器
钩子 (Hook)操作验证或工作流策略
子智能体 (Subagent)智能体即工具或 Agent SDK 子智能体
本地追踪 (Local trace)AIP 执行历史和工作流血缘

[A]

最强能力

  • 业务数据集成和业务对象建模 —— Ontology 可以将财务报表行项目、USSGL 账户、拨备、分录凭证、债务、支出、前置系统、支持性文件、审计样本、控制措施、NFR 和纠正措施表示为一级关联对象
  • 细粒度的授权/标记、人工在环(human-in-the-loop)操作、案例管理、跨系统血缘
  • 在结构上满足欧盟 AI 法案第 13 条样式的可审计性,比竞争平台需要更少的自定义配置

局限性

Ontology 需要精细的设计和持续的治理;糟糕的语义建模会在不可靠的数据之上产生一个看似复杂精美但并不可靠的接口。专有的构建块会导致供应商绑定。大规模原始计算更自然地适合以 Spark 为中心的工作,而 Databricks 在这方面已经是首选的数据平台。[A]

5.3 IBM watsonx 与 IBM Bob

Claude 采用程度

IBM 和 Anthropic 宣布了一项战略合作伙伴关系(2025 年 10 月),将 Claude 注入 IBM 的软件产品组合中,并提供企业级安全、治理和成本控制。IBM 主要是采用 Claude 模型,而不是用 Claude Code 的架构替换其原有架构。其框架仍为 watsonx Orchestrate、IBM Agent Development Kit、IBM Agent Catalog、watsonx.data、watsonx.governance、IBM Bob 以及 IBM 的决策/自动化产品。Orchestrate 现在作为一个智能体控制平面,在统一且一致的策略层下治理来自 IBM 自有 Granite 模型、Anthropic 的 Claude、OpenAI 的 GPT、Mistral 以及自定义构建的智能体 —— IBM 真正的差异化优势在于跨供应商大规模治理非其自身构建的智能体。[A, 扩展内容]

IBM Bob 与 Claude Code

Bob(IBM 的编码智能体,取代了早期的 Watsonx Code Assistant)涵盖了 Java、IBM i 和大型机环境的架构、编码、测试、安全和现代化,根据准确性/性能/成本动态地在 Claude、Mistral 和 Granite 之间路由任务 —— 据报道,约有 80,000 名 IBM 员工在内部使用它,据称生产力提高了 45%。公开文档未证实 Bob 使用了 CLAUDE.md、Anthropic Agent Skills、Claude 插件打包、钩子、LSP 插件或 Claude Code 的精确子智能体配置 —— 它是一个自成体系的框架和开发模型。[A, 扩展内容]

最强能力

  • 混合/本地(on-premises)架构;Java、COBOL、RPG 和大型机现代化
  • 业务规则和决策服务 —— 确定性的权利或策略计算应保留在规则引擎中,由 Claude 解释策略或收集输入,而不是由其临时拼凑出最终数字
  • 110 亿美元收购 Confluent,将 Kafka/Flink 实时流处理引入 watsonx.data;Sovereign Core 在基础设施运行时层嵌入了策略

局限性

当目标是获得完全相同的 Claude Code 开发人员体验、轻量级的绿地(greenfield)智能体开发、Spark 规模的数据工程或 Palantir 风格的业务 Ontology 时,该方案的吸引力较小。其庞杂的产品宽度(Orchestrate、watsonx.data、watsonx.ai、watsonx.governance、Bob)本身就会带来架构上的复杂性。[A]

5.4 Databricks AI

本节修正了原始分析,原始分析基于 2026 年 6 月数据与 AI 峰会(Data + AI Summit)之前的文档,低估了 Databricks 与 Claude Code 的关系。

Claude 采用程度

Databricks 通过提供集中式凭证管理和 AI 网关控制的 Mosaic AI Model Serving 支持 Anthropic,其智能体框架(Agent Framework)支持自定义智能体、RAG、工具调用以及具有 MLflow 追踪/评估功能的多智能体系统。在 2026 年 6 月的数据与 AI 峰会上,Databricks 明确扩展了 Agent Bricks —— 其开发人员智能体平台(已构建超过 10 万个智能体,据报道每年处理超过一千万亿个 Token) —— 将 Claude Code SDK 作为一级框架与 LangGraph、Agno, CrewAI 和 OpenAI Agent SDK 并列支持。Databricks 还发布了 Omnigent,一个开源的“框架之框架”,它明确在单个工作流中组装了 Claude Code、Codex 和自定义智能体,并通过 Unity AI Gateway 在运行时强制执行上下文策略,且每个会话都在 MLflow 中进行追踪。这是对 Claude Agent SDK/Claude Code 框架的**直接(Direct)**采用 —— 而仅仅是托管底层模型。[C]

Databricks 的真实优势

Unity Catalog 是治理的骨干 —— 它强制执行访问控制,将数据/AI 血缘追踪细化至列级,记录审计活动,目前还可以协同治理表、文件、函数、模型、智能体和 MCP 服务器(MCP 已直接添加到 Unity Catalog 中)。Genie Ontology 持续学习业务语义(财政年度定义、组织架构、术语定义),以便智能体在每次调用时无需重新构建上下文,Genie 智能体可将自然语言问题转化为受治理的 SQL。对于财务指标,这通常比仅将业务定义放置在系统提示词中更为可靠。[A, 结合 C 的扩展]

最强能力

  • TB/PB 级规模的处理能力、Spark 和分布式 SQL、数据工程流水线、机器学习特征开发
  • 在所有被审查的平台中,通过 Agent Bricks 和 Omnigent,提供了与实际 Claude Code 框架最直接的互操作性
  • Unity AI Gateway 作为跨模型、智能体、MCP 服务器和技能(Skills)的统一治理/成本/护栏层

局限性

对于面向业务的对象/操作建模、基于案例的纠正工作流以及直接与业务对象绑定的审批流程,它的契合度不够自然 —— 这些虽然可以构建,但通常需要在其上部署额外的应用或工作流系统。GovCloud/FedRAMP High 的覆盖范围正在扩大,但目前仍落后于 Ask Sage 和 Palantir 在机密环境资质认证方面的时间表。[A, 扩展内容]

6. 按工作负载推荐的平台

工作负载最佳首选匹配原因
安全文本辅助和文档分析结合 Claude 或 Claude Code 的 Ask Sage安全模型访问、数据集、多模型支持、快速实现、检索审计追踪
编码和代码库自动化直接使用 Claude Code —— 以 Ask Sage、Palantir 或 Databricks 作为端点最强大的可配置编码框架、技能、钩子、子智能体和 IDE 集成;目前三者均能同样良好地进行托管
业务企业级工作流Palantir AIPOntology、操作、权限、审批、业务应用程序
大规模结构化分析DatabricksSpark、SQL、流水线、语义度量 (Genie Ontology)、MLflow、血缘
大数据异常/欺诈分析Databricks,通过 Palantir 实现业务化落地分布式计算为先;业务案例/操作层为后
传统系统和大型机现代化IBM Bob 和 watsonx专业的 Java、IBM i、COBOL 和大型机能力
复杂的混合企业编排IBM watsonx Orchestrate多供应商智能体目录、决策制定、混合环境治理
最大化自定义和移植性基于 Claude Agent SDK + MCP 的自定义应用对框架、工具、策略和用户体验的直接控制
DoD 财务审计以 Palantir/Advana 或 Databricks 作为证据/数据平面,以 Ask Sage/Claude 作为辅助层审计需要可信数据、血缘、对账和受控工作流 —— 而非仅靠 LLM

6.1 以文本为主的解决方案

示例:政策分析、审计报告审查、公文起草、NFR 总结、控制描述生成。

推荐架构: 安全模型网关(Ask Sage 或企业模型端点) → 文档摄取与元数据提取 → 混合关键词+向量检索 → 结合文档级访问控制的重排(reranking) → Claude Agent SDK 或平台原生智能体 → 引用和证据展示 → 人工审查 → 对照精选的问答集进行评估。

衡量检索正确性、引用准确性、是否排除了已作废的指南,以及在证据不足时系统是否合适地予以拒绝 —— 而不是回答听起来有多流利。在此场景中,Ask Sage 是强大的默认选择;一旦文档必须与业务对象、交易、控制措施、所有者或操作相关联,Palantir 就会变得更有价值。[A]

6.2 以数据为主的解决方案

示例:预算执行、交易对账、总账(GL)分析、异常日记账审查、债务与发票匹配。

推荐架构: 受治理的结构化数据层 → 数据合同和质量规则 → 定义度量和会计概念的语义层 → 确定性的 SQL/代码工具 → 仅公开精选查询和操作的 MCP 接口 → 用于规划、工具选择和解释的 LLM → 可复现的结果存储 → 针对重大后果的操作引入人工审批。

LLM 绝不应该在其自身的上下文窗口中计算来自数千条记录的关键财务总额:应由 SQL 计算余额,由 Spark 执行大型连接(join),由规则引擎测试合规性,由统计模型标记异常 —— 模型的作用是选择经批准的工具并解释结果。当数据必须与业务对象、案例和操作相连接时,选择 Palantir;当重心是 SQL/Spark/ML/规模时,选择 Databricks;当逻辑跨越传统/大型机系统时,选择 IBM;将 Ask Sage 作为顶层面向分析师的语言层。[A]

6.3 大数据解决方案

对于数百万或数数十亿条交易,绝对不要将原始记录发送给 Claude。模式:原始源系统 → 分布式摄取/标准化 → 数据质量与对账流水线 → 精选交易/余额/异常表 → 语义度量和经批准的查询函数 → MCP 工具 → Claude 或其他 LLM → 解释、优先级排序和工作流发起。

关注领域:分区、增量处理、数据倾斜、源到目标对账、模式演进、血缘、确定性业务规则、每百万交易成本以及误报管理。Databricks 通常在此类计算方面具有最佳的原生基础;Palantir 则可以消费这些精选结果,并将其转化为业务案例和经批准的操作。一个常见的错误是使用智能体来替代 Spark/SQL 层 —— 智能体应当编排计算,而不是用自然语言来执行计算。[A]

7. 面向 DoD 审计的推荐架构

美国政府问责局(GAO)2026 年 5 月的证词(GAO-26-109115)证实,DoD 修正后的审计方法已从分散式应对和依赖内部控制,转向集中式协调(新成立的联合审计工作组,Joint Task Force-Audit),重点关注实质性行项目,并“根据需要对大样本进行手动测试并使用人工智能工具” —— 显而易见地增加了对包括 AI 在内的技术的重视,且至少在未来两年内,支持重要账户余额的证据优先于纠正底层控制缺陷。[A→C: 对照原始 GAO 来源进行了验证,并精简了意译表达]

目标不应该是“一个审计聊天机器人”。它应该是一个在 AI 辅助下的审计证据与验证架构,分为七个层级:[A]

层级作用
1. 权威源和证据平面 (Authoritative source and evidence plane)源系统 ID、交易 ID、会计期间、原始凭证、原始值/转换值、摄取时间戳、接口控制、转换版本、数据所有者、分类/CUI 标记、完整性哈希、记录系统参考。此层由 Palantir/Advana、Databricks 或其他受治理的企业平台承载 —— 绝不是 LLM。
2. 财务语义层 (Financial semantic layer)拨款、基金、财政年度、TAS、USSGL、SFIS 属性、财务报表行项目、期初/期末余额、债务、开支、支出、无支持调整、重要性阈值 —— 作为确定性转换、Ontology 对象、SQL 视图或度量定义来实现,而不是提示词文本。
3. 对账与控制引擎 (Reconciliation and control engine)前置系统到总账以及辅助账到总账的对账、试算平衡验证、期初到期末滚动、重复/无支持日记账检测、发票-付款-支出匹配、可用期限和总体完整性测试。AI 可以确定异常的优先级并进行解释;但底层测试必须是可复现的。
4. 受治理的 MCP 工具 (Governed MCP tools)窄口径、专用的、默认只读的工具:get_line_item_balancetrace_balance_to_transactionsretrieve_supporting_documentsrun_feeder_gl_reconciliationlist_unsupported_journalsget_control_ownercreate_audit_evidence_packagesubmit_exception_for_review。写入/工作流操作需要通过预定义操作获得显式批准。
5. 智能体框架 (Agent harness)Palantir AIP Logic 或 Palantir 托管的 Claude Agent SDK 智能体、自定义 Claude Agent SDK 智能体、Databricks 智能体框架、Ask Sage Agent Builder 或 IBM Orchestrate —— 实现工具白名单、迭代/Token/计算预算、提示词注入防御、强制引用、终止条件和人工审批。鉴于第 2 节的内容,请在架构上确保该层底层的模型是可更换的。
6. 不可变执行记录 (Immutable execution record)针对每个重要回答记录:用户身份、时间戳、问题、提示词/策略/技能版本、模型及模型版本、检索到的源信息、SQL/查询文本、数据快照日期、工具调用与输出、中间决策、最终回答、人工审查员、批准/拒绝、以及后续更改。如果没有此记录,AI 生成的审计结论将无法可靠复现。
7. 评估 (Evaluation)包含以下内容的测试套件:已知余额、已知对账中断、已知无支持日记账、嵌入在文档中的对抗性指令、访问控制边界、过期的政策文件、故意不完整的证据以及必须拒绝的场景。评估整个系统,而不仅仅是 LLM。

7.1 各平台在 DoD 审计环境中的推荐角色

平台推荐角色
Ask Sage安全访问 Claude 和其他模型;审计政策/文档研究;起草与总结;为开发人员提供 Claude Code 访问;受控的分析师辅助和快速原型开发。不能作为权威余额、交易、对账或证据系统。
Palantir / Advana审计相关的数据集成、全量交易数据库、财务/业务事件关系、源头到报告的可追溯性、证据案例、NFR 和纠正工作流、受控操作、基于身份的访问。对于 Advana FM(财务管理)环境,通常是业务审计和证据层的首选候选方案。
Databricks海量摄取、大型连接(joins)、交易规范化、机器学习模型、异常检测、总体画像、语义度量、数据质量流水线、分布式对账 —— 根据部门批准的架构,既可作为主数据平台,也可作为向 Advana/Palantir 输送数据的计算层。
IBM适用于对传统财务系统现代化、大型机集成、COBOL/Java 转换、确定性业务规则或混合基础设施有实质性需求的情况。如果 Palantir 或 Databricks 已经执行了核心功能,那么将其作为附加平台的吸引力不大。
自定义 Claude Agent SDK 方案在工作流独特、需要对提示词/工具进行精确控制、注重可移植性且组织拥有充足的工程/网络安全能力时使用。除非有迫切需求,否则不要构建自己的数据目录、分布式查询引擎、身份平台或血缘系统 —— 应当构建专用的框架和审计工具,并依靠成熟的平台来提供通用基础设施支持。

7.2 如果开发自研解决方案应该构建什么

直接采用: 用于智能体循环的 Claude Agent SDK;用于工具/数据接口的 MCP;智能体技能(Agent Skills)或类似的受版本控制的规程格式;类似 CLAUDE.md 的代码库策略文件;用于隔离专业任务的子智能体;用于确定性安全/质量控制的钩子(hooks);沙箱化执行;显式权限和工具审批;完整的追踪和回放;自动评估。[A]

保持供应商中立: 将关键业务逻辑存储在特定于模型的提示词之外 —— 使用 SQL 进行计算,使用 Python/Spark 进行数据转换,使用 MCP/OpenAPI 实现工具,使用受版本控制的模式(schemas),使用 OpenTelemetry 兼容的追踪,使用独立于模型的评估数据集,使用外部身份验证/授权,以及外部证据存储。应当做到无需重建系统即可更换模型 —— 鉴于第 2 节的内容,这现在已是一项功能性要求,而不仅仅是良好的技术习惯。[A→C]

不要在审计应用中对 LSP 进行过度投入 —— 它对软件开发很有价值,但对财务审计用户来说并不是首要任务。对于审计,应转而投资于数据血缘、查询验证、证据溯源、文档到交易的链接、访问控制、语义定义、可复现的计算以及审查/审批工作流。[A]

8. 最终决策

  • 文本密集的安全辅助 → 优先选择 Ask Sage 加上 Claude Code 或 Claude Agent SDK。
  • 数据密集的业务解决方案 → 优先选择 Palantir AIP 和 Ontology(本体)。
  • 大数据分析解决方案 → 如果重视 Claude Code 样式的框架移植性,优先选择具有 Unity Catalog、SQL/Spark、MLflow 和 Agent Bricks/Omnigent 的 Databricks。
  • 传统、混合或重度依赖大型机的环境 → 优先选择 IBM watsonx 和 IBM Bob。
  • DoD 审计 → 采用第 7 节中的分层架构,并根据第 2 节将模型层构建为可更换的。

针对 DoD 审计,具体流程如下:

权威财务/业务数据 → 对账、血缘和语义控制 → Palantir/Advana 证据和业务本体 → 受治理的 MCP 工具 → Claude 或其他获得批准的模型 → 分析师解释、异常优先级排序和受控工作流 → 人工审查和不可变审计记录

总体而言,最强大的 DoD 审计设计并不是单一的商业 AI 产品。它是以下要素受控结合的产物:可信的数据与证据平面、确定性审计逻辑、受治理的工具、受约束的智能体框架、获批的 LLM(鉴于当前 DoD 与 Anthropic 的合同纠纷,模型提供商应被视为可更换的)以及人工问责制。[A→C]

不可妥协的原则: AI 可以推荐、解释、分类、检索和编排。受治理的数据平台必须进行计算、对账、授权、记录和证实。这种职责分离对于审计的成功而言,远比选择哪种模型或供应商重要得多。[A]

9. 修正与溯源日志

对原始附带分析与该组合版本之间发生的变化以及原因保持透明。

条目原始声称验证后的修正 / 状态
Databricks 与 Claude Code SDK / Claude Agent SDK 兼容性“未公开记录为兼容 Claude Code 的端点”;“未发现显式的 Claude Agent SDK 模板”修正为直接支持(Direct)。Agent Bricks(2026 年 6 月数据与 AI 峰会)明确将 Claude Code SDK 列为支持的框架;Omnigent 明确将 Claude Code 作为框架进行组装。该原始声称在 2026 年 6 月之前是准确的,但现在已过时。
DoD 与 Anthropic 的合同状态原始分析中未作任何探讨已添加。DoD 于 2026 年 2 月将 Anthropic 指定为供应链风险,并将其排除在 2026 年 5 月的机密网络 AI 供应商扩张计划之外;诉讼仍在进行。这直接影响到在架构设计合理的情况下,“通过 AIP/Ask Sage 的 Claude”是否可在特定的 DoD 合同中采购。
Ask Sage 与 Claude Code 端点兼容性声称完全兼容,并引用了 Ask Sage 的 Anthropic 兼容性指南验证准确。已通过 Ask Sage 文档确认:兼容 Anthropic 的端点、对 Army GenAI 的 DoD PKI 支持以及对 Claude Cowork 的网关支持。
Palantir —— Ontology MCP 与 Palantir MCP 的区别描述为两个具有不同读写范围的独立服务器对照 Palantir 自身的 Foundry 文档(包括 2026 年 7 月 2 日的平台摘要)验证准确。
Palantir —— Claude Agent SDK / Foundry 模型代理声称 Claude Code 可以在通过兼容 Anthropic 的代理针对 Foundry 提供的模型运行验证准确 —— Foundry 的“兼容 LLM 供应商的 API”文档中明确将 Claude Code 列为支持的使用案例。
GAO-26-109115 引用意译为 DoD 通过文档验证重要余额,并在有用的地方使用 AI对照 GAO 自身的摘要表验证准确;精简了措辞以更贴近 GAO 的原始来源。
Claude Code —— MEMORY.md / 自动记忆被引用为自动记忆索引文件验证准确。
Claude Code ——“安全模式”标志被描述为禁用 CLAUDE.md、技能、插件、钩子、MCP、LSP 和自动记忆核心机制已验证(存在一个真正的标志可禁用 CLAUDE.md/插件/技能/钩子/MCP)。但在该特定禁用列表中是否包含 LSP 和自动记忆无法得到独立确认 —— 视为可能但未经证实。
文档 URL有几处引用使用了 docs.anthropic.com/en/docs/claude-code/... 域名当前规范的 Claude Code 文档域名为 code.claude.com/docs/en/...(API 文档为 docs.claude.com)。旧链接可能仍可解析,但今后应改用当前域名进行引用。

本表中未列出的所有其他内容在本次审查中均对照可用的原始来源进行了核对,发现与原始分析一致。未发现其他实质性的事实错误 —— 总体而言,原始文档的溯源严谨度异常强大。

学习地图

阶段 1:企业级 AI 与 Harness 基础

  • 理解 Claude Code 与 Agent SDK:了解本地智能体循环(local agent loops)、上下文编译器(CLAUDE.md)以及技能(skills)相对于原始 LLM API 是如何运行的。
  • 掌握模型上下文协议 (MCP):学习 MCP 如何解耦客户端智能体与服务端工具及数据模式(data schemas),从而确保安全边界。

阶段 2:企业级平台集成

  • 分析网关配置:理解如何在兼容 Anthropic 的端点(例如 Ask Sage、Databricks AI Gateway 或 Palantir 的代理)上运行 Claude Code。
  • 利用语义与本体层:了解为什么必须由强大的运行语义模型(如 Palantir 的 Ontology 或 Databricks 的 Genie Ontology)来处理计算,而不是依赖模型的推理能力。

阶段 3:高安全合规性设计

  • 实现模型无关的抽象:架构系统的工具和 Harness,以便在供应链/合同纠纷期间可以更换底层的 LLM 提供商。
  • 构建不可变的审计追踪:构建遥测和日志层,以追踪每一个提示词、模式(schema)、工具输出和人工审批,从而实现交易级别的可复现性。

动手实践——分步指南

步骤 1:配置您的安全端点环境

设置您的系统,将 Claude SDK 的流量重定向到您的安全企业代理或网关(例如 Ask Sage 或 Databricks AI Gateway):

export ANTHROPIC_BASE_URL="https://your-secure-gateway-endpoint/v1"
export ANTHROPIC_API_KEY="your-authorized-gateway-token"

步骤 2:通过 CLAUDE.md 确立智能体系统规则

在您的项目根目录下创建一个本地 CLAUDE.md,以对智能体循环施加确定性的处理约束:

# System Instructions
- For calculations, generate and execute SQL queries; do not calculate in-context.
- Always output strict source citations from retrieved databases.

步骤 3:运行并测试模拟 MCP 工具服务器

安装 Model Context Protocol SDK 以注册一个安全的、只读的分析工具:

npm install @modelcontextprotocol/sdk

创建一个入口点配置,将用户请求映射到本地 SQL 查询执行,确保智能体无法直接写入生产表。

步骤 4:实现不可变追溯日志记录

在 Python 或 Node.js 中配置遥测包装器,以记录完整的输入/输出执行记录:

import json
import uuid

def log_audit_trail(session_id, step, prompt, tools, response, approved_by):
    log_entry = {
        "trace_id": str(uuid.uuid4()),
        "session_id": session_id,
        "step": step,
        "prompt": prompt,
        "tools_called": tools,
        "raw_response": response,
        "authorized_by": approved_by
    }
    with open("audit_trail.json", "a") as f:
        f.write(json.dumps(log_entry) + "
")

执行一次简单的运行,以验证所有输入、响应和工具遥测数据都已被安全捕获。

三大推荐资源

  1. 1
    Model Context Protocol (MCP) Official Site

    The open standard specification, quickstarts, and SDK guides for exposing secure data tools to LLM agents.

    https://modelcontextprotocol.io

  2. 2
    Databricks Mosaic AI Agent Framework

    Comprehensive documentation on deploying high-quality enterprise agents, securing routes via the AI Gateway, and evaluating quality with MLflow.

    https://docs.databricks.com/en/generative-ai/agent-framework.html

  3. 3
    Palantir Foundry Documentation

    Primary resource detailing operational Ontology architecture, data-source integration, fine-grained access control, and model-integration security.

    https://www.palantir.com/docs/foundry/

链接由 AI 推荐——使用前建议快速核实。