Skip to main content
兼容性:仅在 Node.js 上可用。
要在通用 PostgreSQL 数据库中启用向量搜索,LangChain.js 支持使用 pgvector Postgres 扩展。 本指南提供了快速入门 PGVector 向量存储 的概览。有关所有 PGVectorStore 功能和配置的详细文档,请参阅 API 参考

概览

集成详情

设置

要使用 PGVector 向量存储,您需要设置一个启用了 pgvector 扩展的 Postgres 实例。您还需要安装 @langchain/community 集成包,并将 pg 包作为对等依赖项。 本指南还将使用 OpenAI 嵌入,这需要您安装 @langchain/openai 集成包。如果您愿意,也可以使用其他支持的嵌入模型 我们还将使用 uuid 包来生成所需格式的 ID。

设置实例

根据您的实例设置方式,连接到 Postgres 有多种方法。以下是使用 pgvector 团队提供的预构建 Docker 镜像进行本地设置的一个示例。 创建一个名为 docker-compose.yml 的文件,内容如下:
然后在同一目录中,运行 docker compose up 启动容器。 您可以在官方仓库中找到有关如何设置 pgvector 的更多信息。

凭据

要连接到您的 Postgres 实例,您需要相应的凭据。有关支持选项的完整列表,请参阅 node-postgres 文档 如果您在本指南中使用 OpenAI 嵌入,您还需要设置您的 OpenAI 密钥:
如果您想获得模型调用的自动跟踪,也可以通过取消注释以下内容来设置您的 LangSmith API 密钥:

实例化

要实例化向量存储,请调用 .initialize() 静态方法。这将自动检查由传递的 config 中的 tableName 指定的表是否存在。如果不存在,它将使用所需的列创建该表。
安全:用户生成的数据(如用户名)不应用于表名和列名的输入。 这可能导致 SQL 注入!

管理向量存储

向向量存储添加项目

从向量存储中删除项目

查询向量存储

一旦您的向量存储已创建并且相关文档已添加,您很可能希望在链或代理运行期间对其进行查询。

直接查询

执行简单的相似性搜索可以按如下方式进行:
上述过滤器语法支持精确匹配,但也支持以下方式:

使用 in 操作符

使用 notIn 操作符

使用 arrayContains 操作符

如果您想执行相似性搜索并接收相应的分数,可以运行:

通过转换为检索器进行查询

您还可以将向量存储转换为检索器,以便在链中更轻松地使用。

用于检索增强生成

有关如何将此向量存储用于检索增强生成(RAG)的指南,请参阅以下部分:

高级:重用连接

您可以通过创建一个连接池,然后直接通过构造函数创建新的 PGVectorStore 实例来重用连接。 请注意,在使用构造函数之前,您应该至少调用一次 .initialize() 来正确设置数据库和表。

创建 HNSW 索引

默认情况下,该扩展执行顺序扫描搜索,具有 100% 的召回率。您可以考虑创建 HNSW 索引以进行近似最近邻(ANN)搜索,从而加快 similaritySearchVectorWithScore 的执行时间。要在向量列上创建 HNSW 索引,请使用 createHnswIndex() 方法。 该方法参数包括:
  • dimensions:定义向量数据类型中的维度数,最多 2000。例如,对于 OpenAI 的 text-embedding-ada-002 和 Amazon 的 amazon.titan-embed-text-v1 模型,使用 1536。
  • m?:每层的最大连接数(默认为 16)。较小的值可以改善索引构建时间,而较高的值可以加快搜索查询速度。
  • efConstruction?:用于构建图的动态候选列表大小(默认为 64)。较高的值可能会以索引构建时间为代价提高索引质量。
  • distanceFunction?:您要使用的距离函数名称,根据 distanceStrategy 自动选择。
更多信息,请参阅 Pgvector GitHub 仓库Malkov Yu A. 和 Yashunin D. A. 的 HNSW 论文。2020. 使用分层可导航小世界图进行高效且稳健的近似最近邻搜索

关闭连接

完成操作后,请确保关闭连接以避免资源过度消耗:

API 参考

有关所有 PGVectorStore 功能和配置的详细文档,请参阅 API 参考