Skip to main content
Oracle AI 数据库支持通过含义(语义)而不仅仅是关键词来查询数据的 AI 工作负载。它将非结构化内容的语义搜索业务数据的关系型过滤结合在一个系统中——因此您可以构建检索工作流(如 RAG),而无需引入单独的向量数据库或将数据分散在多个平台上。 本指南演示如何使用 OracleVS(用于 Oracle AI 向量搜索的 LangChain 向量存储集成)来:
  • 将文档和嵌入向量摄入到 Oracle 中
  • 运行相似性搜索
  • 创建 HNSW 和 IVF 索引
  • 应用元数据过滤器进行高级检索
  • 在 Oracle 数据库 26ai 中启用混合搜索(关键词 + 语义)
  • 使用 Oracle Text 运行全文搜索

先决条件

安装 langchain-oracledbpython-oracledb 驱动程序将作为依赖项自动安装。

连接到 Oracle 数据库

以下示例代码将展示如何连接到 Oracle 数据库。默认情况下,python-oracledb 以“Thin”模式运行,该模式直接连接到 Oracle 数据库。此模式不需要 Oracle 客户端库。但是,当 python-oracledb 使用它们时,可以使用一些额外的功能。当使用 Oracle 客户端库时,python-oracledb 被称为处于“Thick”模式。两种模式都具有全面的功能,支持 Python 数据库 API v2.0 规范。请参阅以下指南,了解每种模式支持的功能。如果您无法使用 thin 模式,可能需要切换到 thick 模式。

导入所需的依赖项

加载文档

使用不同的距离度量创建向量存储

首先,我们将创建三个向量存储,每个使用不同的距离函数。由于我们尚未在其中创建索引,它们现在只会创建表。稍后我们将使用这些向量存储来创建 HNSW 索引。要了解更多关于 Oracle AI 向量搜索支持的不同类型索引的信息,请参阅以下指南 您可以手动连接到 Oracle 数据库,您将看到三个表: Documents_DOTDocuments_COSINEDocuments_EUCLIDEAN 然后我们将创建三个额外的表 Documents_DOT_IVFDocuments_COSINE_IVFDocuments_EUCLIDEAN_IVF,这些表将用于在表上创建 IVF 索引,而不是 HNSW 索引。

文本的添加和删除操作,以及基本的相似性搜索

使用特定参数创建索引

高级搜索

Oracle 数据库 23ai 支持预过滤、过滤中和后过滤,以增强 AI 向量搜索功能。这些过滤机制允许用户在执行向量相似性搜索之前、期间和之后应用约束,从而提高搜索性能和准确性。 关于 Oracle 23ai 中过滤的关键点:
  1. 预过滤 应用传统 SQL 过滤器,在执行向量相似性搜索之前减少数据集。 通过限制 AI 算法处理的数据量来帮助提高效率。
  2. 过滤中 利用 AI 向量搜索直接在向量嵌入上执行相似性搜索,使用优化的索引和算法。 无需完整数据集扫描即可根据向量相似性高效过滤结果。
  3. 后过滤 在向量相似性搜索之后应用额外的 SQL 过滤以细化结果。 允许根据业务逻辑或额外的元数据条件进行进一步细化。
为什么这很重要?
  • 性能优化:预过滤显著减少查询执行时间,使在海量数据集上的搜索更高效。
  • 准确性增强:过滤中确保向量搜索在语义上有意义,提高搜索结果的质量。

过滤器详情

OracleVS 支持一组过滤器,可以使用 filter 参数应用于 metadata 字段。这些过滤器允许您根据各种标准选择和细化数据。 可用的过滤器运算符:
  • 您可以使用逻辑运算符组合这些过滤器:
过滤器示例:
其他使用提示:
  • 当对象中的所有过滤器都必须满足时,您可以省略 $and。以下两种写法是等效的:
  • $not 子句可以否定比较运算符:
  • 使用 field: scalar 等同于 field: { "$eq": scalar }
有关更多过滤器示例,请参阅测试规范

混合搜索

Oracle 数据库 26ai 支持混合搜索,将关键词(全文)和语义(向量)搜索结合到单一的检索功能中。langchain-oracledb 集成公开了:
  • OracleVectorizerPreference:创建一个数据库端的向量化器偏好,供混合索引使用。
  • create_hybrid_index / acreate_hybrid_index:创建一个混合向量索引。
  • OracleHybridSearchRetriever:在 OracleVS 表上执行关键词、语义或混合检索。

先决条件和模型配置

使用混合搜索时,请使用 OracleEmbeddings 配置您的 OracleVS,以便向量化器偏好与嵌入配置完全匹配。您可以通过 OracleVectorizerPreference 提供额外参数来进一步调整混合向量索引。有关详细信息,请参阅文档
替代方案 在不使用显式偏好情况下创建索引:
  • 如果您不想管理命名的偏好,请改为传递 vector_store。该函数将创建一个临时偏好,构建索引,然后自动删除该偏好。
说明和提示:
  • search_mode 决定使用哪些信号:
    • “keyword”:仅关键词
    • “semantic”:仅向量
    • “hybrid”(默认):两者结合
  • 通过检索器的 params 参数传递 DBMS_HYBRID_VECTOR 参数。
  • return_scores=True 将总体分数以及组成部分 text_score 和 vector_score 添加到 Document.metadata。
  • 通过 acreate_hybrid_indexOracleHybridSearchRetriever.ainvoke 支持异步使用。
更多信息:

全文搜索 (Oracle Text)

您可以使用 Oracle Text 直接对 Oracle 数据库运行高质量的关键词搜索。langchain-oracledb 集成公开了:
  • create_text_index / acreate_text_index:在列上创建一个 Oracle Text SEARCH INDEX
  • OracleTextSearchRetriever:运行 CONTAINS 查询并返回 LangChain Document 对象。
索引选项:
  • 如果您有一个 OracleVS 向量存储,您可以索引其内置的 “text” 列。
  • 您也可以通过直接提供 table_name + column_name 来索引任何其他表/列。
运算符模式和高级查询:
  • 默认行为 (operator_search=False):
    • 输入被视为字面文本,在非单词字符上分词,并重写为 ACCUM 表达式。
    • fuzzy=True 时,每个令牌被包装为 FUZZY("token") 以匹配拼写错误。
  • 运算符模式 (operator_search=True):
    • 原样传递 Oracle Text 表达式(NEARABOUTANDORNOTWITHIN 等)。在此模式下,fuzzy 被忽略。
返回的列:
  • 当针对原始表时,通过 returned_columns 在结果中包含额外的列;它们被附加到 Document.metadata
  • 使用 OracleVS 时,returned_columns 默认为 [“metadata”]。
说明和提示:
  • 当使用 operator_search=True 时,fuzzy 被忽略(设计如此)。
  • 通过 acreate_text_indexOracleTextSearchRetriever.ainvoke 支持异步使用。
更多信息:

端到端演示

请参阅我们完整的演示指南 Oracle AI 向量搜索端到端演示指南,以借助 Oracle AI 向量搜索构建端到端的 RAG 管道。