Skip to main content
LLM应用程序可能具有挑战性,因为它们通常生成对话式文本,没有单一的正确答案。 本指南向您展示如何使用LangSmith SDK离线评估定义一个LLM作为评判者的评估器
如需快速入门,请使用openevals,它提供了开箱即用的LLM作为评判者的评估器。

创建您自己的LLM作为评判者的评估器

要完全控制评估器逻辑,请创建您自己的LLM作为评判者的评估器,并使用LangSmith SDK(Python / TypeScript)运行它。 需要 langsmith>=0.2.0 一个LLM作为评判者的评估器由三个关键组件组成:
  1. 评估器函数:一个接收示例输入和应用程序输出,然后使用LLM对质量进行评分的函数。该函数应返回一个布尔值、数字、字符串或包含分数信息的字典。
  2. 目标函数:您正在评估的应用程序逻辑(使用 @traceable 进行包装以实现可观测性)。
  3. 数据集和评估:一个包含测试示例的数据集,以及 evaluate() 函数,该函数在每个示例上运行您的目标函数并应用您的评估器。

示例

有关如何编写自定义评估器的更多信息,请参阅如何定义代码评估器(SDK)