Skip to main content
本笔记本提供了快速入门 CheerioWebBaseLoader 文档加载器 的概览。有关所有 CheerioWebBaseLoader 功能和配置的详细文档,请参阅 API 参考

概述

集成详情

本示例介绍如何使用 Cheerio 从网页加载数据。每个网页将创建一个文档。 Cheerio 是一个快速、轻量级的库,允许你使用类似 jQuery 的语法来解析和遍历 HTML 文档。你可以使用 Cheerio 从网页中提取数据,而无需在浏览器中渲染它们。 但是,Cheerio 不模拟网页浏览器,因此无法执行页面上的 JavaScript 代码。这意味着它无法从需要 JavaScript 渲染的动态网页中提取数据。为此,你可以改用 PlaywrightWebBaseLoaderPuppeteerWebBaseLoader

加载器特性

设置

要访问 CheerioWebBaseLoader 文档加载器,你需要安装 @langchain/community 集成包以及 cheerio 对等依赖项。

凭证

如果你想获得模型调用的自动跟踪,也可以取消注释以下内容来设置你的 LangSmith API 密钥:

安装

LangChain CheerioWebBaseLoader 集成位于 @langchain/community 包中:

实例化

现在我们可以实例化模型对象并加载文档:

加载

附加配置

CheerioWebBaseLoader 在实例化加载器时支持附加配置。以下是使用 selector 字段的示例,使其仅从提供的 HTML 类名加载内容:

API 参考

有关所有 CheerioWebBaseLoader 功能和配置的详细文档,请参阅 API 参考