Skip to main content
PythonTypeScript SDK 是在 LangSmith 中运行评估的推荐方式。它们包含可提升性能和可靠性的优化与功能。 如果您无法使用 SDK——例如,您使用的是其他语言或受限环境——您可以直接使用 REST API。本指南演示如何使用 Python 的 requests 库通过 REST API 运行评估,但相同的原则适用于任何语言。 在深入本内容之前,阅读以下内容可能有所帮助:

创建数据集

在此示例中,我们使用 Python SDK 快速创建一个数据集。要通过 API 或 UI 创建数据集,请参阅管理数据集

运行单个实验

要通过 API 运行实验,您需要:
  1. 从数据集中获取示例。
  2. 创建一个实验(在 API 中也称为“会话”)。
  3. 为每个示例创建引用该示例和实验的运行。
  4. 通过设置其 end_time 来关闭实验。
首先,使用 /examples 端点拉取您想在实验中使用的所有示例:
from langsmith import uuid7 接下来,定义一个函数,该函数将在单个示例上运行您的模型并将结果记录到 LangSmith。直接使用 API 时,您需要负责:
  • 通过 POST 到 /runs 创建运行对象,并设置 reference_example_idsession_id
  • 跟踪运行之间的父子关系(例如,包含子“llm”运行的父“链”运行)。
  • 通过 PATCH 到 /runs/{run_id} 使用输出更新运行。
现在创建实验并在所有示例上运行补全。在 API 中,“实验”表示为一个会话(或“跟踪器会话”),通过 reference_dataset_id 引用数据集。与常规跟踪的关键区别在于,实验中的运行必须具有 reference_example_id,将每个运行链接到数据集中的特定示例。

添加评估反馈

运行实验后,您通常希望通过添加反馈分数来评估结果。这允许您跟踪准确性、精确度或任何自定义评估标准等指标。 在此示例中,评估检查每个模型的输出是否与数据集中预期的标签匹配。代码发布一个“正确性”分数(正确为 1.0,错误为 0.0),以跟踪每个模型对有毒与非有毒文本分类的准确性。 以下代码为单个实验示例中的运行添加反馈:
您可以使用不同的键添加多个反馈分数来跟踪各种指标。例如,您可能同时添加“正确性”分数和“检测到的毒性”分数。

运行成对实验

接下来,我们将演示如何运行成对实验。在成对实验中,您将两个示例相互比较。 更多信息,请查看如何运行成对评估