Skip to main content
本笔记本提供了快速入门 WebPDFLoader 文档加载器 的概览。有关所有 WebPDFLoader 功能和配置的详细文档,请访问 API 参考

概览

集成详情

加载器功能

您可以在 Web 环境中使用此版本的流行 PDFLoader。 默认情况下,PDF 文件中的每一页将创建一个文档,您可以通过将 splitPages 选项设置为 false 来更改此行为。

设置

要访问 WebPDFLoader 文档加载器,您需要安装 @langchain/community 集成包以及 pdf-parse 包:

凭证

如果您想获得模型调用的自动跟踪,也可以通过取消注释以下内容来设置您的 LangSmith API 密钥:

安装

LangChain WebPDFLoader 集成位于 @langchain/community 包中:

实例化

现在我们可以实例化模型对象并加载文档:

加载

用法,自定义 pdfjs 构建

默认情况下,我们使用 pdf-parse 捆绑的 pdfjs 构建版本,该版本与大多数环境兼容,包括 Node.js 和现代浏览器。如果您想使用更新版本的 pdfjs-dist 或者想使用自定义构建的 pdfjs-dist,可以通过提供一个自定义的 pdfjs 函数来实现,该函数返回一个解析为 PDFJS 对象的 Promise。 在以下示例中,我们使用 pdfjs-dist 的 “legacy”(参见 pdfjs 文档)构建版本,该版本包含默认构建中未包含的多个 polyfill。

消除多余空格

PDF 有多种类型,这使得阅读它们具有挑战性。加载器默认解析单个文本元素并用空格连接它们,但如果您看到过多的空格,这可能不是期望的行为。在这种情况下,您可以使用空字符串覆盖分隔符,如下所示:

API 参考

有关所有 WebPDFLoader 功能和配置的详细文档,请访问 API 参考