Skip to main content
在使用 LangSmith 跟踪时,您可能需要防止敏感信息被记录,以维护隐私并遵守安全要求。LangSmith 提供了多种方法来保护您的数据,防止其被发送到后端:
如果您的合规性或隐私要求规定某些操作根本不应被跟踪(例如,具有零保留策略的客户端),请考虑使用条件跟踪来选择性地禁用特定请求的跟踪,而不是对数据进行掩码处理。

隐藏输入和输出

如果您想完全隐藏跟踪的输入和输出,可以在运行应用程序时设置以下环境变量:
这适用于 LangSmith SDK(Python 和 TypeScript)以及 LangChain。 您还可以为给定的 Client 实例自定义和覆盖此行为。这可以通过在 Client 对象上设置 hide_inputshide_outputs 参数来完成(在 TypeScript 中为 hideInputshideOutputs)。 以下示例为 hide_inputshide_outputs 返回一个空对象,但您可以根据需要进行自定义:

隐藏元数据

hide_metadata 参数允许您在使用 LangSmith Python SDK 进行跟踪时控制运行元数据是否被隐藏或转换。元数据在创建运行时通过 extra 参数传递(例如,extra={"metadata": {...}})。hide_metadata 对于移除敏感信息、遵守隐私要求或减少发送到 LangSmith 的数据量非常有用。您可以通过两种方式配置元数据隐藏:
  • 使用 SDK:
  • 使用环境变量:
hide_metadata 参数接受三种类型的值:
  • True:完全移除所有元数据(发送一个空字典)。
  • FalseNone:按原样保留元数据(默认行为)。
  • Callable:一个转换元数据字典的自定义函数。
设置后,此参数会影响由 Client 创建或更新的所有运行的 extra 参数中的 metadata 字段,包括通过 @traceable 装饰器或 LangChain 集成创建的运行。

隐藏所有元数据

设置 hide_metadata=True 以完全移除发送到 LangSmith 的运行中的所有元数据:

自定义转换

使用可调用函数在元数据发送到 LangSmith 之前选择性地过滤、编辑或修改元数据:

基于规则的输入和输出掩码

此功能在以下 LangSmith SDK 版本中可用:
  • Python:0.1.81 及以上
  • TypeScript:0.1.33 及以上
要掩码输入和输出中的特定数据,您可以使用 create_anonymizer / createAnonymizer 函数,并在实例化 Client 时传递新创建的匿名化器。匿名化器可以由正则表达式模式列表和替换值构建,也可以由一个接受并返回字符串值的函数构建。 如果 LANGSMITH_HIDE_INPUTS = true,匿名化器将跳过输入。对于输出,如果 LANGSMITH_HIDE_OUTPUTS = true,同样适用。 但是,如果输入或输出要发送到 Clientanonymizer 方法将优先于在 hide_inputshide_outputs 中找到的函数。默认情况下,create_anonymizer 最多只会查看 10 层嵌套深度,这可以通过 max_depth 参数进行配置。
请注意,使用匿名化器可能会因复杂的正则表达式或大型负载而产生性能影响,因为匿名化器在处理前会将负载序列化为 JSON。
改进 anonymizer API 的性能已在我们的路线图上!如果您遇到性能问题,请通过 support.langchain.com 联系支持。
隐藏输入输出 旧版本的 LangSmith SDK 可以使用 hide_inputshide_outputs 参数来实现相同的效果。您也可以使用这些参数更高效地处理输入和输出。

为单个函数处理输入和输出

process_outputs 参数在 LangSmith Python SDK 版本 0.1.98 及以上中可用。
除了 Client 级别的输入和输出处理外,LangSmith 还通过 @traceable 装饰器的 process_inputsprocess_outputs 参数提供函数级别的处理。 这些参数接受函数,允许您在特定函数的输入和输出记录到 LangSmith 之前对其进行转换。这对于减小负载大小、移除敏感信息或自定义对象在 LangSmith 中的序列化和表示方式非常有用。 以下是使用 process_inputsprocess_outputs 的示例:
在此示例中,process_inputs 创建一个包含处理后输入数据的新字典,process_outputs 在记录到 LangSmith 之前将输出转换为特定格式。
建议避免在处理器函数中修改源对象。而是创建并返回包含处理数据的新对象。
对于异步函数,用法类似:
当同时定义了函数级别处理器和 Client 级别处理器(hide_inputshide_outputs)时,函数级别处理器优先。

示例

您可以将基于规则的掩码与各种匿名化器结合使用,以从输入和输出中清除敏感信息。以下示例将涵盖使用正则表达式、Microsoft Presidio 和 Amazon Comprehend。

正则表达式

下面的实现并非详尽无遗,可能会遗漏某些格式或边缘情况。在生产环境中使用任何实现之前,请进行彻底测试。
您可以使用正则表达式在输入和输出发送到 LangSmith 之前对其进行掩码。下面的实现掩码了电子邮件地址、电话号码、全名、信用卡号和社会安全号码。
匿名化后的运行在 LangSmith 中将如下所示:匿名化运行 未匿名化的运行在 LangSmith 中将如下所示:未匿名化运行

Microsoft Presidio

下面的实现提供了一个通用示例,说明如何匿名化用户与 LLM 之间交换的消息中的敏感信息。它并非详尽无遗,也未涵盖所有情况。在生产环境中使用任何实现之前,请进行彻底测试。
Microsoft Presidio 是一个数据保护和去标识化 SDK。下面的实现使用 Presidio 在输入和输出发送到 LangSmith 之前对其进行匿名化。有关最新信息,请参阅 Presidio 的官方文档 要使用 Presidio 及其 spaCy 模型,请安装以下内容:
同时,安装 OpenAI:
匿名化后的运行在 LangSmith 中将如下所示:匿名化运行 未匿名化的运行在 LangSmith 中将如下所示:未匿名化运行

Amazon Comprehend

下面的实现提供了一个通用示例,说明如何匿名化用户与 LLM 之间交换的消息中的敏感信息。它并非详尽无遗,也未涵盖所有情况。在生产环境中使用任何实现之前,请进行彻底测试。
Comprehend 是一项自然语言处理服务,可以检测个人身份信息。下面的实现使用 Comprehend 在输入和输出发送到 LangSmith 之前对其进行匿名化。有关最新信息,请参阅 Comprehend 的官方文档 要使用 Comprehend,请安装 boto3
同时,安装 OpenAI:
您需要在 AWS 中设置凭据并使用 AWS CLI 进行身份验证。请按照 AWS Comprehend 设置说明操作。
匿名化后的运行在 LangSmith 中将如下所示:匿名化运行 未匿名化的运行在 LangSmith 中将如下所示:未匿名化运行

用于高吞吐量掩码的批量处理

本页上的先前方法是单独处理每个运行的。如果您的掩码逻辑涉及速率受限的 API 或模型推理(例如 Presidio 或 Amazon Comprehend 示例),逐个处理运行可能会造成瓶颈。process_buffered_run_ops 允许您在原始运行字典序列化并发送到 API 之前拦截一批原始运行字典,因此您可以一次性分摊多个运行的成本。LangSmith 在后台线程中处理这些运行,不会阻塞您的应用程序。 LangSmith 将运行保存在内存缓冲区中,并在以下情况下将它们作为一批刷新:
  • 已累积 run_ops_buffer_size 个运行操作,或
  • 自上次添加运行以来已过 run_ops_buffer_timeout_ms 毫秒(默认:5000 毫秒)。
您的函数接收一批原始运行字典,并且必须返回一个相同长度相同顺序运行 ID 未更改的列表。违反任一约束都会引发 ValueError
run_ops_buffer_size 计算的是单个运行操作,而不是唯一的运行。每个跟踪调用通常产生两个操作:一个创建操作(当运行开始时)和一个更新操作(当它以输出结束时)。相应地设置缓冲区大小。例如,run_ops_buffer_size=1000 将缓冲大约 500 个跟踪调用。因此,同一个运行 ID 可能在一个批次中出现两次:一次带有输入,一次带有输出。
缓冲区仅在达到大小限制或超时时自动刷新。始终在程序退出前调用 client.flush(),以避免丢失缓冲的运行。
批次中的每个运行字典要么是创建操作(带有 inputs,在运行开始时发送),要么是更新操作(带有 outputs,在运行结束时发送)。以下是单个跟踪调用的典型对示例:
以下示例使用 Comprehend 的 batch_detect_pii_entities 端点,该端点每次调用最多接受 25 个文本。使用按运行处理的方法(hide_inputs),您需要为每个运行进行一次 API 调用。在这里,首先收集整个缓冲区中的所有消息文本,然后以 25 个为一批发送到 Comprehend,这在高吞吐量下显著减少了 API 调用次数。
process_buffered_run_opsrun_ops_buffer_size 必须始终一起设置——只提供其中一个而不提供另一个会引发 ValueError