- 完全隐藏输入和输出,使用环境变量或 Client 配置。
- 隐藏元数据,以移除或转换运行元数据。
- 应用基于规则的掩码,使用正则表达式模式或匿名化库来选择性地编辑敏感信息。
- 为单个函数处理输入和输出,进行函数级别的自定义。
- 使用第三方匿名化器,如 Microsoft Presidio 和 Amazon Comprehend,进行高级个人身份信息检测。
- 批量处理运行操作,以一次性对多个运行应用昂贵的掩码逻辑,减少每次运行的开销。LangSmith 在后台线程中处理运行,不会阻塞您的应用程序。
如果您的合规性或隐私要求规定某些操作根本不应被跟踪(例如,具有零保留策略的客户端),请考虑使用条件跟踪来选择性地禁用特定请求的跟踪,而不是对数据进行掩码处理。
隐藏输入和输出
如果您想完全隐藏跟踪的输入和输出,可以在运行应用程序时设置以下环境变量:hide_inputs 和 hide_outputs 参数来完成(在 TypeScript 中为 hideInputs 和 hideOutputs)。
以下示例为 hide_inputs 和 hide_outputs 返回一个空对象,但您可以根据需要进行自定义:
隐藏元数据
hide_metadata 参数允许您在使用 LangSmith Python SDK 进行跟踪时控制运行元数据是否被隐藏或转换。元数据在创建运行时通过 extra 参数传递(例如,extra={"metadata": {...}})。hide_metadata 对于移除敏感信息、遵守隐私要求或减少发送到 LangSmith 的数据量非常有用。您可以通过两种方式配置元数据隐藏:
-
使用 SDK:
-
使用环境变量:
hide_metadata 参数接受三种类型的值:
True:完全移除所有元数据(发送一个空字典)。False或None:按原样保留元数据(默认行为)。Callable:一个转换元数据字典的自定义函数。
extra 参数中的 metadata 字段,包括通过 @traceable 装饰器或 LangChain 集成创建的运行。
隐藏所有元数据
设置hide_metadata=True 以完全移除发送到 LangSmith 的运行中的所有元数据:
自定义转换
使用可调用函数在元数据发送到 LangSmith 之前选择性地过滤、编辑或修改元数据:基于规则的输入和输出掩码
此功能在以下 LangSmith SDK 版本中可用:
- Python:0.1.81 及以上
- TypeScript:0.1.33 及以上
create_anonymizer / createAnonymizer 函数,并在实例化 Client 时传递新创建的匿名化器。匿名化器可以由正则表达式模式列表和替换值构建,也可以由一个接受并返回字符串值的函数构建。
如果 LANGSMITH_HIDE_INPUTS = true,匿名化器将跳过输入。对于输出,如果 LANGSMITH_HIDE_OUTPUTS = true,同样适用。
但是,如果输入或输出要发送到 Client,anonymizer 方法将优先于在 hide_inputs 和 hide_outputs 中找到的函数。默认情况下,create_anonymizer 最多只会查看 10 层嵌套深度,这可以通过 max_depth 参数进行配置。
改进
anonymizer API 的性能已在我们的路线图上!如果您遇到性能问题,请通过 support.langchain.com 联系支持。
hide_inputs 和 hide_outputs 参数来实现相同的效果。您也可以使用这些参数更高效地处理输入和输出。
为单个函数处理输入和输出
process_outputs 参数在 LangSmith Python SDK 版本 0.1.98 及以上中可用。@traceable 装饰器的 process_inputs 和 process_outputs 参数提供函数级别的处理。
这些参数接受函数,允许您在特定函数的输入和输出记录到 LangSmith 之前对其进行转换。这对于减小负载大小、移除敏感信息或自定义对象在 LangSmith 中的序列化和表示方式非常有用。
以下是使用 process_inputs 和 process_outputs 的示例:
process_inputs 创建一个包含处理后输入数据的新字典,process_outputs 在记录到 LangSmith 之前将输出转换为特定格式。
对于异步函数,用法类似:
hide_inputs 和 hide_outputs)时,函数级别处理器优先。
示例
您可以将基于规则的掩码与各种匿名化器结合使用,以从输入和输出中清除敏感信息。以下示例将涵盖使用正则表达式、Microsoft Presidio 和 Amazon Comprehend。正则表达式
下面的实现并非详尽无遗,可能会遗漏某些格式或边缘情况。在生产环境中使用任何实现之前,请进行彻底测试。
未匿名化的运行在 LangSmith 中将如下所示:
Microsoft Presidio
下面的实现提供了一个通用示例,说明如何匿名化用户与 LLM 之间交换的消息中的敏感信息。它并非详尽无遗,也未涵盖所有情况。在生产环境中使用任何实现之前,请进行彻底测试。
未匿名化的运行在 LangSmith 中将如下所示:
Amazon Comprehend
下面的实现提供了一个通用示例,说明如何匿名化用户与 LLM 之间交换的消息中的敏感信息。它并非详尽无遗,也未涵盖所有情况。在生产环境中使用任何实现之前,请进行彻底测试。
未匿名化的运行在 LangSmith 中将如下所示:
用于高吞吐量掩码的批量处理
process_buffered_run_ops 仅在 Python SDK 中可用。process_buffered_run_ops 允许您在原始运行字典序列化并发送到 API 之前拦截一批原始运行字典,因此您可以一次性分摊多个运行的成本。LangSmith 在后台线程中处理这些运行,不会阻塞您的应用程序。
LangSmith 将运行保存在内存缓冲区中,并在以下情况下将它们作为一批刷新:
- 已累积
run_ops_buffer_size个运行操作,或 - 自上次添加运行以来已过
run_ops_buffer_timeout_ms毫秒(默认:5000 毫秒)。
ValueError。
run_ops_buffer_size 计算的是单个运行操作,而不是唯一的运行。每个跟踪调用通常产生两个操作:一个创建操作(当运行开始时)和一个更新操作(当它以输出结束时)。相应地设置缓冲区大小。例如,run_ops_buffer_size=1000 将缓冲大约 500 个跟踪调用。因此,同一个运行 ID 可能在一个批次中出现两次:一次带有输入,一次带有输出。inputs,在运行开始时发送),要么是更新操作(带有 outputs,在运行结束时发送)。以下是单个跟踪调用的典型对示例:
batch_detect_pii_entities 端点,该端点每次调用最多接受 25 个文本。使用按运行处理的方法(hide_inputs),您需要为每个运行进行一次 API 调用。在这里,首先收集整个缓冲区中的所有消息文本,然后以 25 个为一批发送到 Comprehend,这在高吞吐量下显著减少了 API 调用次数。
process_buffered_run_ops 和 run_ops_buffer_size 必须始终一起设置——只提供其中一个而不提供另一个会引发 ValueError。
将这些文档连接到 Claude、VSCode 等,通过 MCP 获取实时答案。

