Skip to main content
兼容性:仅在 Node.js 上可用。
本笔记本提供了快速入门 RecursiveUrlLoader 文档加载器 的概览。有关所有 RecursiveUrlLoader 功能和配置的详细文档,请访问 API 参考

概览

集成详情

加载器功能

当从网站加载内容时,我们可能希望处理并加载页面上的所有 URL。 例如,让我们看看 LangChain.js 的介绍文档。 它有许多有趣的子页面,我们可能希望加载、分割,并稍后批量检索。 挑战在于遍历子页面树并组装列表! 我们使用 RecursiveUrlLoader 来完成此操作。 这也为我们提供了灵活性,可以排除某些子页面、自定义提取器等。

设置

要访问 RecursiveUrlLoader 文档加载器,您需要安装 @langchain/community 集成包和 jsdom 包。

凭证

如果您想获得模型调用的自动跟踪,也可以取消注释以下内容来设置您的 LangSmith API 密钥:

安装

LangChain RecursiveUrlLoader 集成位于 @langchain/community 包中:
我们还建议添加像 html-to-text@mozilla/readability 这样的包,用于从页面中提取原始文本。
我们还建议添加像 html-to-text@mozilla/readability 这样的包,用于从页面中提取原始文本。

实例化

现在我们可以实例化模型对象并加载文档:

加载

选项

然而,由于很难执行完美的过滤,您可能仍然会在结果中看到一些不相关的结果。如果需要,您可以自行对返回的文档进行过滤。大多数情况下,返回的结果已经足够好。

API 参考

有关所有 RecursiveUrlLoader 功能和配置的详细文档,请访问 API 参考