Skip to main content
开始在 LangChain 中使用 Soniox 音频转录加载器。

设置

安装包:
npm2yarn

凭证

Soniox 控制台 获取您的 Soniox API 密钥,并将其设置为环境变量:

用法

基本转录

示例:如何使用 SonioxAudioTranscriptLoader 转录音频文件并使用 LLM 生成摘要。
您也可以从二进制数据转录音频:

翻译

从任何检测到的语言翻译到目标语言:
您也可以使用 two_way 翻译类型同时转录并在两种语言之间进行翻译。了解更多关于 Soniox 翻译 的信息。

语言提示

Soniox 自动检测并转录 60 多种语言 的语音。当您知道音频中可能出现哪些语言时,提供 language_hints 可以通过将识别偏向这些语言来提高准确性。 语言提示不会限制识别——它们只是将模型偏向指定的语言,同时仍然允许检测其他语言(如果存在)。
更多详情,请参阅 Soniox 语言提示文档

说话人分离

启用说话人识别以区分不同的说话人:

语言识别

启用自动语言检测和识别:

提供上下文以提高准确性

提供特定领域的上下文以提高转录准确性:
更多详情,请参阅 Soniox 上下文文档

API 参考

构造函数参数

SonioxLoaderParams(必需)

SonioxLoaderOptions(可选)

浏览文档以获取支持的完整选项列表。

支持的音频格式

  • aac - 高级音频编码
  • aiff - 音频交换文件格式
  • amr - 自适应多速率
  • asf - 高级系统格式
  • flac - 自由无损音频编解码器
  • mp3 - MPEG 音频层 III
  • ogg - Ogg Vorbis
  • wav - 波形音频文件格式
  • webm - WebM 音频

返回值

load() 方法返回一个包含单个 Document 对象的数组:
元数据包括转录文本、说话人信息(如果启用了分离)、语言信息(如果启用了识别)、翻译数据(如果启用了翻译)和时间信息。
Token 类型:
您可以在 Soniox REST API 参考 中了解更多关于 SonioxTranscriptResponse 类型的信息。

相关资源