BrainBank
AI 课堂/AIPalantir

多模态数据平面

2026/7/29 21:33:28 · 来源

AI 翻译于 2026/7/29 21:41:05 · 使用 Qwen3.6 35B (fast, default)

#multimodal#data architecture#open infrastructure#generative ai

多模态数据平面(MMDP)通过 Apache Iceberg 开放标准,整合了碎片化的企业数据源、异构计算运行时以及生成式 AI 模型,在无需重复数据的情况下实现厂商中立的工作流。

多模态数据平面

多模态数据平面(MMDP)是 Palantir 设计的一种开放架构,旨在消除分析系统与运营系统之间的摩擦。通过将碎片化的数据源、异构计算运行时以及广泛的生成式 AI 模型统一为单一网络体系,MMDP 实现了企业自主能力,并在任何规模下提供无缝的终端用户体验。

任意数据:MMDP 的开放数据架构

MMDP 的基石是一套以 Apache Iceberg(作为 Foundry 和 AIP 的主要表格式)为核心的开放数据架构。作为一种在包括 AWS、Google Cloud、Microsoft Azure、Databricks 和 Snowflake 等关键合作伙伴中均被公认的开放标准,Iceberg 允许在 Palantir 内部以原生方式管理 Iceberg 编目(Catalog),亦可将外部提供者的系统注册为虚拟编目与表。这种方法确保了在利用本体(Ontology)支撑运营应用程序和 AI 驱动自动化时,绝不需要对数据进行重复复制。 由于 MMDP 支持 SQL 应用程序和分析笔记本等标准工具,团队可以像在其它任何环境中一样,安全地与 Foundry 和 AIP 中的数据进行交互并对其进行操作。许多组织正在积极构建“数据网格”(或新兴的“AI 网格”),将 Palantir 视为更广泛企业架构中的一员。MMDP 通过充当**“无墙花园”**的角色明确支持这些混合环境,在实现端到端的成果交付的同时,确保每一层架构都能与现有的数据湖、湖仓一体、传统数仓、治理工具和存储库进行深度集成。 Illustration showing many different data sources, compute engines, and models with a title of "Any Data, Any compute, Any model".Illustration showing many different data sources, compute engines, and models with a title of "Any Data, Any compute, Any model".Illustration showing example tabular data sources supported by MMDP with title "Any Data".Illustration showing example tabular data sources supported by MMDP with title "Any Data".

MMDP:超越表格数据的开放性

MMDP 将同样的开放保证扩展到非表格格式,包括媒体、文档、流式数据、地理空间数据以及其他多模态类型。

  • 媒体数据可以在对底层格式做出最少假设的情况下进行同步。通过分析工具,被识别的格式会立即获得交互式解析;而自定义或小众格式的元数据可以从其他来源进行惰性追加。
  • 流式和时空数据通常携带关联元数据(例如传感器标签),这些需要在与主要摄取管道并行的数据管道中进行并行处理。然而,无论数据是作为何种形式进行摄取或转换,底层文件和所有数据点均可通过标准 REST API 以及 Python 和 TypeScript SDK 安全访问。基于来源的变换(Source-based Transforms)范式使得开发人员能够利用完整的 Foundry 工具链,以精细的工作流级别控制来自定义数据输出。

Illustration showing example data sources (tabular, media, streaming, and geospatial) supported by MMDP with title "Any Data".Illustration showing example data sources (tabular, media, streaming, and geospatial) supported by MMDP with title "Any Data".

Any Compute: MMDP's Open Compute Architecture

MMDP 的开放计算架构充分释放了其开放数据基础的完整价值。Foundry 和 AIP 自带一系列开箱即用的运行时环境,均运行在一个被称为 Palantir Rubix <https://www.palantir.com/docs/foundry/architecture-center/rubix/> 的经过加固、自动扩缩容的 Kubernetes 基于的计算网格上。

Rubix 基于零信任原则运作,对每个托管的运行时和服务实施严格的安全姿态。为抵御高级持续性威胁,所有容器均在 72 小时内被销毁并重建,这要求计算基础设施具有高度可用性并能从容应对单节点故障。各个角色的用户——无论是技术数据工程师、分析数据科学家还是运营业务人员——均可通过平台借助 API 和 SDK 利用批处理、流处理和交互式计算引擎。该组合包括用于批处理工作负载的自动扩缩容 Spark、用于流处理的自动扩缩容 Flink,以及 Apache DataFusion、Polars 和 DuckDB 等高性能单节点引擎。

在 "Ontology 下方" 管理的数据转换(将原始数据转换为 Ontology 结构)以及在 "Ontology 上方" 使用的交互式函数(将 Ontology 数据提供给终端用户)均通过这些运行时环境以受控且弹性的方式实现。

Illustration showing example compute engines supported by MMDP with title "Any Compute".Illustration showing example compute engines supported by MMDP with title "Any Compute".

MMDP: Build with Any Compute

Compute Modules 框架支持 "自带计算"(BYO Compute) 模型,允许任何容器化资源被导入并通过批量、流处理或交互式函数安全地暴露。

在运营工作流中,关键的执行文件和模型往往孤立存在于仍不再积极开发的遗留软件包或领域特定工件中。Compute Modules 解放了这些碎片化的资源,使其能够与现代逻辑工件(Python、Java、SQL、Go、Rust)一起安全地托管于 AI 驱动的工作流中。Foundry 和 AIP 还能编排 Palantir 环境之外的计算资源,包括现有的模型推理基础设施、外部 Spark 集群、云托管优化引擎以及本地高性能计算(HPC)。此外,MMDP 支持将计算工作原生下推至 Databricks 或 Snowflake 等云原生运行时环境,使开发人员能够在其现有基础设施旁继续使用 Pipeline Builder 和 Code Workspaces。 展示连接计算资源并带有“通过任意计算构建管道” (Build pipelines with Any Compute) 标题的插图。展示连接计算资源并带有“通过任意计算构建管道” (Build pipelines with Any Compute) 标题的插图。

任意模型:Palantir 对模型访问的承诺

Palantir 对开放性的承诺直接延伸至生成式 AI 领域。MMDP 的**“任意模型”**理念确保通过 AIP 的模型目录可获得最新的企业级生成式模型——包括来自 OpenAI、Anthropic、Google、Meta 和 xAI 的服务——同时为企业平等地注册和部署自有模型提供完全公平的环境。 大语言模型(LLMs)和多模态模型,无论是由 Palantir 提供还是自定义注册,都能在 Foundry 和 AIP 应用中无缝集成,覆盖 Pipeline Builder、Workshop、AIP Logic 以及更广泛的设计工具链。管理员可以精准地治理模型访问权限,针对所有用例和业务线(lines of effort)设置令牌(token)限制。资源管理能力一致地扩展到通过 MMDP 连接的所有数据、计算和 AI 模型,无论其底层模式、运行环境或格式如何。 展示 MMDP 支持的示例模型并带有“任意模型” (Any Model) 标题的插图。展示 MMDP 支持的示例模型并带有“任意模型” (Any Model) 标题的插图。

无所不在:MMDP 对开放性的承诺

MMDP 通过有意避免单体存储和计算架构的局限性,弥合了分析与运营领域之间的鸿沟。它结合了利用 Apache Iceberg 的开放数据架构,以及对媒体、文档、流和多模态类型的同等支持。其计算架构捆绑了标准运行时,同时允许团队导入外部资源,并提供丰富的接口来编排现有的企业基础设施。通过庞大的模型目录和无缝的自定义模型注册,这种开放性得以延伸至生成式 AI 领域。 通过 Palantir Apollo,所有这些灵活性都不依赖于其底层基础设施提供商,并根据在运营一线遇到的实际需求不断演进。MMDP 的核心哲学浓缩为一条指令:“任意数据,任意计算,任意模型,无所不在。” 展示 MMDP 位于本体层以及自动化、代理和应用层之下的插图。展示 MMDP 位于本体层以及自动化、代理和应用层之下的插图。 ---## 核心要点

  • Apache Iceberg 是最基础的表格式,在 Foundry 与 AIP 之间实现目录管理、虚拟表以及零数据冗余工作流,同时支持外部湖仓(lakehouse)与数据仓库环境。
  • 计算灵活性贯穿传统与现代平台:Palantir Rubix 提供经过强化处理、每 72 小时轮换容器的 Kubernetes 网格,而 Compute Modules 支持自带计算资源(BYO compute),可将工作负载原生生地推送到 Databricks、Snowflake 或现有的本地/云基础设施。
  • 治理策略与灵活性已深度内置:通过令牌限制、精确的访问控制以及统一的资源管理,全面适用于所有数据模态、计算运行时环境与 AI 模型(含开源/闭源 LLM 及企业定制模型)。
  • 基础设施中立性:MMDP 凭借其“无围墙花园”理念刻意规避厂商锁定风险,使 Palantir 能够无缝融入任意现有的数据网格、AI 网格或混合部署架构。

学习地图

分阶段路线图

第一阶段:MMDP 基础

  • 理解核心理念:任何数据、任何计算资源、任何模型、任何地方
  • 研究 Apache Iceberg 在零分发工作流中的作用
  • 审阅 MMDP 架构图(“任意数据”部分)

第二阶段:上手架构设计

  • 使用 Iceberg 目录管理服务构建示例表
  • 使用 Rubix/Kubernetes 部署计算资源以支持批处理/流式工作负载
  • 通过 Compute Modules 框架测试 BYO Compute(自带计算)集成

第三阶段:生成式模型集成

  • 在 AIP 的 Model Catalog(模型目录)中注册自定义模型
  • 为 LLMs 实施基于令牌的访问控制
  • 探索使用 MMDP 的统一工具链实现流水线自动化

动手实践——分步指南

  1. 使用 Databricks 或 Spark 配合示例表格数据创建一个简单的 Iceberg 表。
  2. 将来自 AWS S3、Google Cloud Storage 或 Azure Blob Storage 的外部编目注册到 Iceberg 编目中。
  3. 使用 SQL 查询(例如 SELECT * FROM)来验证跨云数据访问。
  4. 通过 Palantir Rubix API 使用 Flink 模板配置用于流式任务的计算模块。
  5. 在 AIP 中注册 OpenAI 的 GPT-4 模型作为测试资源,并验证基于 API 的推理工作流。

三大推荐资源

  1. 1
    Palantir Foundry Architecture Center - MMDP Documentation

    Official documentation covering architecture principles, implementation patterns, and case studies for MMDP deployment.

    https://www.palantir.com/docs/foundry/architecture-center/multimodal-data-plane/

  2. 2
    Apache Iceberg Project Documentation

    Comprehensive resources for Iceberg table formats including schema evolution, storage integration, and query optimization guides.

    https://iceberg.apache.org/docs/

  3. 3
    Databricks Lakehouse Integration Guide

    Practical documentation to build unified data lakes using open standards that align with MMDP's storage architecture.

    https://docs.databricks.com/lakehouse/index.html

链接由 AI 推荐——使用前建议快速核实。