Skip to main content
文档加载器提供了一个标准接口,用于从不同来源(如 Slack、Notion 或 Google Drive)读取数据并将其转换为 LangChain 的 Document 格式。 这确保了无论数据来源如何,都能以一致的方式处理数据。 所有文档加载器都实现了 BaseLoader 接口。

接口

每个文档加载器可能定义自己的参数,但它们共享一个通用的 API:
  • load():一次性加载所有文档。
  • loadAndSplit():一次性加载所有文档,并将其分割成更小的文档。

按类别

LangChain.js 以两种不同的方式对文档加载器进行分类:

文件加载器

如果您想贡献一个集成,请参阅贡献集成

PDF 文件

常见文件类型

专用文件加载器

Web 加载器

网页

云提供商

生产力工具

搜索与数据 API

音频与视频

其他

所有文档加载器

Airtable

Apify Dataset

AssemblyAI Audio Transcript

Azure Blob Storage Container

Azure Blob Storage File

Blockchain Data

Browserbase

ChatGPT

Cheerio

College Confidential

Confluence

Couchbase

CSV

DirectoryLoader

DOCX

EPUB

Figma

FireCrawl

GitHub

GitBook

Google Cloud SQL for PostgreSQL

Google Cloud Storage

Hacker News

IMSDB

Jira

JSON

JSONLines

LangSmith

MultiFileLoader

Notion API

Notion Markdown

OpenAI Whisper Audio

OracleDocLoader

PDFLoader

Playwright

PPTX

Puppeteer

RecursiveUrlLoader

S3

SearchAPI

SerpApi

Sitemap

Soniox

Sonix Audio

Spider

Subtitles

Taskade

Text

UnstructuredLoader

WebPDFLoader

YouTube