BrainBank

AIP 文档智能概览

2026/7/20 23:10:59 · 来源

#step-by-step#palantir-foundry#document-intelligence#ocr#vlm#llm-evaluation

Palantir Foundry 的 AIP 文档智能通过提供传统 OCR 与生成式 AI 策略、交互式评估以及一键部署到 Python 转换管道,简化了复杂的文档提取工作流。

AIP 文档智能 是 Foundry 用于所有企业文档提取工作流的中心枢纽。它使用户能够轻松打开文档媒体集,快速运行最先进的提取策略,并评估这些策略的质量、速度和代币成本。配置完成后,您可以一键将提取策略部署为 Python 转换,加入批处理管道。

在 AIP 文档智能中预览的媒体集示例 PDF 文档。在 AIP 文档智能中预览的媒体集示例 PDF 文档。


核心功能与特性

AIP 文档智能结合了先进的生成式 AI 与传统 OCR 技术,并配备了直观、即点即用的界面,旨在实现快速测试和部署。

在文档智能中进行文档提取的示例,使用边界框突出显示不同的提取区域。在文档智能中进行文档提取的示例,使用边界框突出显示不同的提取区域。

直观的用户体验

  • 统一界面: 轻松搜索并选择 Foundry 媒体集进行处理。
  • 快速确认循环: 使用交互式映射到原始 PDF 文档上边界框的 Markdown 输出,快速验证提取结果。

高级提取策略

  • 传统提取: 利用布局盲和布局感知方法:
    • 原始文本: 提取底层元数据。仅适用于电子生成的 PDF。
    • OCR: 传统光学字符识别,提取文本但不保留视觉布局信息。
    • 布局感知 OCR: 带有边界框的高级 OCR,保留结构化布局。
  • 生成式 AI(VLM)提取: 使用经过系统提示微调以提取干净 Markdown 的视觉语言模型(VLM)。您可以在配置界面中使用自定义逻辑修改这些默认提示。
  • VLM 预处理: 将布局感知 OCR 预处理与生成式 VLM 结合,以处理高度复杂的文档。详见文档预处理指南。

指标、评估与部署

  • 执行指标: 查看执行时间、输入/输出代币消耗以及整体质量评分。
  • AI 辅助评估: 使用“VLM 作为评审者”对特定结构元素(例如表格、代码块、列表)的提取成功度进行评分。了解更多关于提取评估的信息。
  • 一键部署: 将您最终的策略无缝部署到 Python 转换库。了解更多关于[提取策略部署](https://www.palantir.com/docs/foundry/document-int

学习地图

AIP 文档智能学习地图

第1阶段:文档消化基础

  • 传统 OCR 与布局感知 OCR: 了解基本纯文本读取与可视化、结构化 OCR 之间的区别,以保留表格和文档章节。
  • Foundry 媒体集: 了解如何在 Palantir 生态系统中导入、组织和管理原始非结构化文件(PDF、图像)。

第2阶段:视觉语言模型(VLM)与提示

  • 基于 VLM 的抽取: 掌握多模态模型如何直接解释视觉布局,跳过严格的结构规则。
  • 文档提示工程: 定制抽取提示,以准确捕获特定字段、实体或嵌套表格。
  • 文档预处理: 将布局感知 OCR 与 VLM 提示相结合,解析高度密集、多页或复杂结构元素。

第3阶段:评估与生产流水线

  • LLM 评审式评估: 建立质量评分标准,以编程方式对抽取准确性(表格、代码、列表)进行评分,并与实际文档对比。
  • 文本分块可视化: 调整拆分和分块策略,以优化文档文本用于下游向量检索 / RAG 架构。
  • 自动化 Transform 部署: 将验证后的配置直接部署到 Python Transform 仓库,以自动化完整媒体集的批处理流水线。

动手实践——分步指南

步骤式文档提取指南

  1. 准备您的媒体集
    登录 Palantir Foundry,进入您的项目目录,并将示例多页文档(如财务 PDF 或发票)上传至新的 Media Set

  2. 打开文档智能
    从 Foundry 工作区启动 AIP Document Intelligence 应用,并在交互式着陆页中选择您刚上传的 Media Set。

  3. 设置提取策略
    前往 Configuration 选项卡。选择 Layout-aware OCR 以保持结构化,或选择 VLM 策略来利用生成式视觉能力。

  4. 运行提取预览
    点击配置面板右上角的 Run 按钮,对预览文档页面执行所选策略。

  5. 检查并评估输出
    前往 Extraction result 选项卡查看生成的 Markdown。选择 Evaluate results,让 LLM‑as‑a‑judge 为列表、表格和速度指标的质量打分。

  6. 调优文本分块
    点击提取结果旁的 Chunk 按钮。调整块大小和重叠配置,直观看到文本将在下游 AI 模型中的分割方式。

  7. 部署到批处理管道
    切换到 Deployment 选项卡,选择您优化后的配置,并点击 Create transform repository。为新的 Python transforms 仓库命名,以自动生成可投入生产的批量摄取管道。

三大推荐资源

  1. 1
    Palantir Foundry Documentation - AIP Document Intelligence

    The official product documentation detailing features, core concepts, extraction methods, and deployment strategies.

    https://www.palantir.com/docs/foundry/document-intelligence/overview/

  2. 2
    Palantir Tech YouTube Channel

    Palantir's official channel featuring live demonstrations and feature walkthroughs of the Foundry AIP platform.

    https://www.youtube.com/@palantirtech

  3. 3
    Palantir Foundry Public Docs Repository

    A public repository containing resource code samples and documentation frameworks for Foundry configurations.

    https://github.com/palantir/foundry-public-docs

链接由 AI 推荐——使用前建议快速核实。