Skip to main content
Docling 将 PDF、DOCX、PPTX、HTML 和其他格式解析为丰富的统一表示,包括文档布局、表格等,使其为 RAG 等生成式 AI 工作流做好准备。 此集成通过 DoclingLoader 文档加载器提供 Docling 的功能。

概述

集成详情

加载器特性

提供的 DoclingLoader 组件使您能够:
  • 轻松快速地在 LLM 应用程序中使用各种文档类型,并
  • 利用 Docling 的丰富格式进行高级、文档原生的 grounding。
DoclingLoader 支持两种不同的导出模式:
  • ExportType.DOC_CHUNKS(默认):如果您希望将每个输入文档分块,然后将每个单独的块作为下游的单独 LangChain Document 捕获,或者
  • ExportType.MARKDOWN:如果您希望将每个输入文档作为单独的 LangChain Document 捕获
该示例允许通过参数 EXPORT_TYPE 探索两种模式;根据设置的值,示例管道将相应设置。

设置

为获得最佳转换速度,请在可用时使用 GPU 加速;例如,如果在 Colab 上运行,请使用支持 GPU 的运行时。

初始化

基本初始化如下所示:
对于高级用法,DoclingLoader 具有以下参数:
  • file_path:作为单个字符串(URL 或本地文件)或其可迭代对象的来源
  • converter(可选):要使用的任何特定 Docling 转换器实例
  • convert_kwargs(可选):用于转换执行的任何特定 kwargs
  • export_type(可选):要使用的导出模式:ExportType.DOC_CHUNKS(默认)或 ExportType.MARKDOWN
  • md_export_kwargs(可选):任何特定的 Markdown 导出 kwargs(用于 Markdown 模式)
  • chunker(可选):要使用的任何特定 Docling 分块器实例(用于 doc-chunk 模式)
  • meta_extractor(可选):要使用的任何特定元数据提取器

加载

注意:在这种情况下,可以忽略显示 "Token indices sequence length is longer than the specified maximum sequence length..." 的消息——更多详情请参阅此 docling-core GitHub issue
检查一些示例文档:

延迟加载

文档也可以以延迟方式加载:

端到端示例

  • 以下示例管道使用 HuggingFace 的 Inference API;要增加 LLM 配额,可以通过环境变量 HF_TOKEN 提供令牌。
  • 此管道的依赖项可以如下所示安装(--no-warn-conflicts 适用于 Colab 预填充的 Python 环境;对于更严格的使用,可以随意移除):
定义管道参数:
现在我们可以实例化加载器并加载文档:
确定分割:
检查一些示例分割:

摄入

RAG

请注意,来源包含丰富的 grounding 信息,包括段落标题(即章节)、页面和精确的边界框。

API 参考