Skip to main content
兼容性:仅在 Node.js 上可用。
本笔记本提供了快速入门 PuppeteerWebBaseLoader 文档加载器的概览。有关所有 PuppeteerWebBaseLoader 功能和配置的详细文档,请访问 API 参考 Puppeteer 是一个 Node.js 库,提供了用于控制无头 Chrome 或 Chromium 的高级 API。您可以使用 Puppeteer 来自动化网页交互,包括从需要 JavaScript 渲染的动态网页中提取数据。 如果您需要更轻量级的解决方案,并且您要加载的网页不需要 JavaScript 渲染,您可以改用 CheerioWebBaseLoader

概览

集成详情

加载器特性

设置

要访问 PuppeteerWebBaseLoader 文档加载器,您需要安装 @langchain/community 集成包以及 puppeteer 对等依赖项。

凭证

如果您想获得模型调用的自动跟踪,也可以通过取消注释以下内容来设置您的 LangSmith API 密钥:

安装

LangChain PuppeteerWebBaseLoader 集成位于 @langchain/community 包中:

实例化

现在我们可以实例化模型对象并加载文档:

加载

选项

以下是您可以使用 PuppeteerWebBaseLoaderOptions 接口传递给 PuppeteerWebBaseLoader 构造函数的参数说明:
  1. launchOptions:一个可选对象,用于指定传递给 puppeteer.launch() 方法的附加选项。这可以包括诸如 headless 标志(用于以无头模式启动浏览器)或 slowMo 选项(用于减慢 Puppeteer 的操作速度,使其更易于跟踪)等选项。
  2. gotoOptions:一个可选对象,用于指定传递给 page.goto() 方法的附加选项。这可以包括诸如 timeout 选项(用于指定以毫秒为单位的最大导航时间)或 waitUntil 选项(用于指定何时认为导航成功)等选项。
  3. evaluate:一个可选函数,可用于使用 page.evaluate() 方法在页面上执行 JavaScript 代码。这对于从页面提取数据或与页面元素交互非常有用。该函数应返回一个 Promise,该 Promise 解析为包含评估结果的字符串。
通过将这些选项传递给 PuppeteerWebBaseLoader 构造函数,您可以自定义加载器的行为,并利用 Puppeteer 的强大功能来抓取和与网页交互。

截图

要获取网站的截图,请像上面一样初始化加载器,并调用 .screenshot() 方法。 这将返回一个 Document 实例,其中页面内容是 base64 编码的图像,元数据包含一个带有页面 URL 的 source 字段。

API 参考

有关所有 PuppeteerWebBaseLoader 功能和配置的详细文档,请访问 API 参考