Skip to main content
本文介绍如何使用 WebBaseLoaderHTML 网页中的所有文本加载到文档格式中,以便后续使用。如需更自定义的网页加载逻辑,请参考一些子类示例,例如 IMSDbLoaderAZLyricsLoaderCollegeConfidentialLoader 如果您不想处理网站爬取、绕过 JS 阻塞站点以及数据清洗等问题,可以考虑使用 FireCrawlLoader 或更快的选项 SpiderLoader

概述

集成详情

  • 待办:填写表格功能。
  • 待办:如果 JS 支持链接不相关则移除,否则确保链接正确。
  • 待办:确保 API 参考链接正确。

加载器功能

设置

凭证

WebBaseLoader 不需要任何凭证。

安装

要使用 WebBaseLoader,您首先需要安装 langchain-community Python 包。

初始化

现在我们可以实例化模型对象并加载文档:
要在获取期间绕过 SSL 验证错误,您可以设置 “verify” 选项: loader.requests_kwargs = {'verify':False}

使用多个页面初始化

您也可以传入要加载的页面列表。

加载

并发加载多个 URL

您可以通过并发抓取和解析多个 URL 来加速抓取过程。 并发请求有合理的限制,默认为每秒 2 个。如果您不关心是否做一个好公民,或者您控制着正在抓取的服务器并且不关心负载,您可以更改 requests_per_second 参数以增加最大并发请求量。请注意,虽然这会加快抓取过程,但可能会导致服务器阻止您。请小心!

加载 XML 文件或使用不同的 BeautifulSoup 解析器

您也可以参考 SitemapLoader 了解如何加载站点地图文件的示例,这是使用此功能的一个例子。

延迟加载

您可以使用延迟加载一次只加载一个页面,以最小化内存需求。

异步

使用代理

有时您可能需要使用代理来绕过 IP 封锁。您可以向加载器(以及底层的 requests)传入一个代理字典来使用它们。

API 参考

有关所有 WebBaseLoader 功能和配置的详细文档,请访问 API 参考