Skip to main content
LangSmith UI 中的代码评估器允许您直接在界面中使用 Python 或 TypeScript 代码编写自定义评估逻辑。与使用模型来评估输出的 LLM 作为评判者 评估器不同,代码评估器使用您定义的确定性逻辑。
要使用 SDK 以编程方式定义代码评估器,请参阅 如何定义代码评估器 (SDK)

步骤 1. 创建评估器

  1. LangSmith UI 中的以下页面之一创建评估器:
    • 在 Playground 中或从数据集中:选择 + Evaluator 按钮。
    • 选择 Add rules,配置您的规则并选择 Apply evaluator
  2. 为您的评估器指定一个清晰的名称,描述其衡量的内容(例如,“精确匹配”)。
  3. 从评估器类型选项中选择 Create code evaluator

步骤 2. 编写评估器代码

自定义代码评估器限制。允许的库:您可以导入所有标准库函数,以及以下公共包:
网络访问:您无法从自定义代码评估器访问互联网。
Add Custom Code Evaluator 页面中,使用 Python 或 TypeScript 定义您的评估逻辑。 您的评估器函数必须命名为 perform_eval,并且应该:
  1. 接受 runexample 参数。
  2. 通过 run['inputs']run['outputs']example['outputs'] 访问数据。
  3. 返回一个字典,其中每个键是一个指标名称,每个值是该指标的分数。每个键代表您想要返回的一条反馈。例如,{"correctness": 1, "silliness": 0} 将为该运行创建两条反馈。

函数签名

示例:精确匹配评估器

示例:基于输入的评估器

步骤 3. 测试并保存

  1. 在示例数据上测试您的评估器,确保其按预期工作
  2. 点击 Save 以使评估器可供使用

使用您的代码评估器

创建后,您可以使用您的代码评估器:

相关内容