Skip to main content
Pinecone 是一个功能广泛的向量数据库。
本笔记本将介绍如何使用一个底层基于 Pinecone 和混合搜索的检索器。 此检索器的逻辑来源于此文档 要使用 Pinecone,您必须拥有一个 API 密钥和一个环境。 以下是安装说明
我们希望使用 OpenAIEmbeddings,因此需要获取 OpenAI API 密钥。

设置 Pinecone

您应该只需执行此部分一次。
现在索引已创建,我们可以使用它了。

获取嵌入和稀疏编码器

嵌入用于稠密向量,分词器用于稀疏向量。
要将文本编码为稀疏值,您可以选择 SPLADE 或 BM25。对于领域外任务,我们建议使用 BM25。 有关稀疏编码器的更多信息,您可以查看 pinecone-text 库的文档
上面的代码使用的是默认的 tf-idf 值。强烈建议将 tf-idf 值拟合到您自己的语料库。您可以按如下方式操作:

加载检索器

我们现在可以构建检索器了!

添加文本(如果需要)

我们可以选择性地向检索器添加文本(如果它们尚未存在)。

使用检索器

我们现在可以使用检索器了!