- 确定性——相同输入始终产生相同输出(无 LLM 幻觉)
- 快速——在 CPU 上每秒处理 100 多页
- 私密——100% 本地运行,零数据传输
- 准确——每个元素都有边界框,正确的多栏阅读顺序
概述
集成详情
加载器功能
OpenDataLoaderPDFLoader 组件使您能够将 PDF 解析为结构化的 Document 对象。
要求
- Python >= 3.10
- 系统
PATH中可用 Java 11 或更新版本
安装
快速开始
参数
使用示例
输出格式
标记 PDF 支持
对于带有结构标签的可访问 PDF(常见于政府/法律文档):密码保护的 PDF
图像处理
文档元数据
每个返回的Document 都包含元数据:
附加资源
- LangChain OpenDataLoader PDF 集成 GitHub
- LangChain OpenDataLoader PDF 集成 PyPI 包
- OpenDataLoader PDF GitHub
- OpenDataLoader PDF 主页
将这些文档 通过 MCP 连接到 Claude、VSCode 等,以获取实时答案。

