Skip to main content
LangChain 与 NVIDIA 已合作,通过四种机制加速智能体:
  1. 组件
  2. LangGraph 加速原语
  3. NeMo Agent Toolkit 优化
  4. 全栈蓝图

组件

langchain-nvidia-ai-endpoints 包为 LangChain 提供了由 NVIDIA AI 驱动的聊天、嵌入、重排序和检索集成——包括 Nemotron(NVIDIA 为智能体 AI 构建的开放模型系列)以及 NVIDIA API 目录 上的数百个社区模型。 模型运行在 NVIDIA NIM 微服务上:这些容器镜像暴露了标准的 OpenAI 兼容 API,并使用 TensorRT-LLM 进行了优化,以在 NVIDIA 硬件上实现峰值吞吐量。它们可以通过托管的 API 目录访问,也可以在本地自托管。

聊天:ChatNVIDIA

ChatNVIDIA 提供基于 NVIDIA 托管模型和本地 NIM 部署的聊天补全。它支持工具调用、结构化输出、图像输入和流式传输。

安装

访问 NVIDIA API 目录

  1. NVIDIA API 目录 上创建一个免费账户并登录。
  2. 点击您的个人资料图标,然后选择 API Keys > Generate API Key
  3. 复制并保存密钥为 NVIDIA_API_KEY

Nemotron:用于智能体 AI 的精选模型

Nemotron 是 NVIDIA 为智能体 AI 设计的开放模型系列。这些模型采用混合 Mamba-Transformer 专家混合架构,以高吞吐量提供领先的基准性能,并支持高达 1M token 的上下文窗口。Nemotron 模型权重、训练数据和实现方案均在 NVIDIA 开放模型许可下公开发布。
有关完整文档,包括工具调用、多模态输入和 Nemotron 特定示例,请参阅 ChatNVIDIA 集成页面

聊天:ChatNVIDIADynamo

ChatNVIDIADynamoChatNVIDIA 的直接替代品,用于与 NVIDIA Dynamo 部署配合使用。它会自动将 KV 缓存路由提示注入每个请求,允许 Dynamo 调度器优化内存分配、负载路由和请求优先级。
有关完整的 ChatNVIDIADynamo 参考,包括每次调用的覆盖和流式传输,请参阅 ChatNVIDIA 集成页面

嵌入:NVIDIAEmbeddings

NVIDIAEmbeddings 生成用于语义搜索和 RAG 管道的稠密向量嵌入。
有关完整文档,请参阅 NVIDIAEmbeddings 集成页面

重排序:NVIDIARerank

NVIDIARerank 使用 NeMo Retriever 重排序 NIM 根据查询相关性对文档列表进行重排序。

检索:NVIDIARAGRetriever

NVIDIARAGRetriever 将 LangChain 连接到正在运行的 NVIDIA RAG 蓝图 服务器,并通过 /v1/search 端点检索相关文档。它支持重排序、查询重写和元数据过滤。
有关完整文档,请参阅 NVIDIARAGRetriever 集成页面

使用 NVIDIA NIM 微服务自托管

当您准备好部署 AI 应用程序时,可以使用 NVIDIA NIM 自托管模型。有关更多信息,请参阅 NVIDIA NIM 微服务

使用 NVIDIA 加速 LangGraph

langchain-nvidia-langgraph 包为 LangGraph 图提供了 NVIDIA 优化的执行策略。它在编译时提供两种互补的优化:
  • 并行执行:自动识别独立节点并并发运行,消除不必要的顺序瓶颈。
  • 推测执行:条件边的两个分支同时运行;一旦路由条件确定,错误的分支将被丢弃。
这两种优化都不需要更改节点逻辑或图边。

安装

并行执行

将 LangGraph 中的 StateGraph 替换为 langchain_nvidia_langgraph.graph 中的 StateGraph。图定义的其余部分保持不变。
或者包装现有的 StateGraph
装饰器可以显式控制哪些节点参与优化:

推测执行

在编译时通过 OptimizationConfig 启用推测。执行器并行运行条件分支,并保留与路由决策匹配的结果。

NeMo Agent Toolkit 与 LangSmith 遥测集成优化

NVIDIA NeMo Agent Toolkit 是一个开源 AI 工具包,用于构建、分析和优化智能体。开发者可以使用 LangChain 与 NeMo Agent Toolkit,只需最少的代码更改即可启用分析、评估、GPU 容量规划和自动化优化。NeMo Agent Toolkit 与 LangSmith 互操作。

全栈蓝图

NVIDIA 和 LangChain 合作开发了全栈示例,展示了如何将所有这些组件结合用于两个企业用例,并重点关注生产就绪性:
  • NVIDIA AI-Q 是一个使用 LangChain Deep Agents 跨企业数据源进行深度研究的蓝图
  • NVIDIA VSS 是一个使用 LangChain 和 LangGraph 进行视频搜索和摘要的蓝图

附加资源