Nemotron部署实战指南:vLLM/SGLang/TensorRT-LLM三大推理引擎Cookbook速查
【免费下载链接】NemotronDeveloper Asset Hub for NVIDIA Nemotron — A one-stop resource for training recipes, usage cookbooks, datasets, and full end-to-end reference examples to build with Nemotron models项目地址: https://gitcode.com/gh_mirrors/ne/Nemotron
想要完成Nemotron 部署却不知从何下手?Nemotron 是 NVIDIA 开源的模型生态仓库,usage-cookbook/ 目录内置了 vLLM、SGLang、TensorRT-LLM 三大推理引擎的官方部署 Cookbook,覆盖从单卡跑 Nano 到多机部署 550B 大模型的完整路径。本文将带你速查这三套推理引擎 Cookbook 的核心流程,从引擎选型、显存规划到工具调用与推理预算控制,一次讲清楚,帮你少走弯路 ⚡
如何为 Nemotron 选推理引擎?
官方文档 docs/nemotron/omni3/inference.md 给出了一张非常实用的选型表,三大引擎各有侧重:
| 引擎 | 核心优势 | 典型场景 |
|---|---|---|
| vLLM | 连续批处理、流式输出、生态最广泛 | 通用推理服务、快速上手 |
| SGLang | 轻量、多智能体与工具调用体验好 | Agent 应用、轻量部署 |
| TensorRT-LLM | 延迟最低、MoE 隐式核优化 | 生产环境、极致性能 |
三者都支持 FP8 / NVFP4 量化与 Ampere 之后的主流 GPU。如果你的模型是 MoE 结构(如 Nemotron-3 全系列),张量并行(TP)和专家并行(EP)是关键部署概念:
上图展示张量并行如何将每层 MLP 的权重切分到多张 GPU 上。对于 MoE 模型,TensorRT-LLM 还会启用专家并行把不同 Expert 放到不同 GPU:
Nemotron-3-Nano:单卡部署的最快路径
入门首选Nemotron-3-Nano(30B-A3B MoE),显存门槛最低:BF16 约需 64 GB,FP8 约需 32 GB,NVFP4 约需 20 GB。
📖 官方 Notebook:usage-cookbook/Nemotron-3-Nano/vllm_cookbook.ipynb
部署流程只有四步:
- 安装依赖:vLLM + 对应量化的 CUDA 环境(NVFP4 需 Blackwell 架构 + CUDA 12.8)
- 验证 GPU:确认 PyTorch 能识别 CUDA 设备
- 进程内加载模型:单条、批量、流式三种生成方式各试一遍
- 启动 OpenAI 兼容服务器:
vllm serve一条命令即可对外提供 API,支持工具调用(--tool-call-parser qwen3_coder)与推理解析(--reasoning-parser nano_v3)
同样的流程也有 sglang_cookbook.ipynb 和 trtllm_cookbook.ipynb 两个引擎版本,结构完全一致,切换引擎几乎零成本。
Nemotron-3-Super:120B MoE 多卡部署速查
Nemotron-3-Super(120B-A12B)是主力模型,显存需求随精度档位变化明显:
| 精度 | 显存需求 | 参考配置 | vLLM 并行参数 |
|---|---|---|---|
| BF16 | ≥ 264 GB | 4× H100 | --tensor-parallel-size 4 |
| FP8 | ≥ 160 GB | 2× H100 | --tensor-parallel-size 2 |
| NVFP4 | ≥ 80 GB | B200(Blackwell) | 单卡即可尝试 |
三个引擎的官方 Cookbook 都在这里:
- vLLM:usage-cookbook/Nemotron-3-Super/vllm_cookbook.ipynb —— 推荐开启
--kv-cache-dtype fp8、--enable-chunked-prefill压低显存 - SGLang:usage-cookbook/Nemotron-3-Super/sglang_cookbook.ipynb ——
--tp 4/--tp 2对应 BF16 / FP8 - TensorRT-LLM:usage-cookbook/Nemotron-3-Super/trtllm_cookbook.ipynb —— Docker 容器化部署,
--tp_size 4 --ep_size 4全专家并行,延迟最低
💡小贴士:FP8 首次启动会比较慢(内核 JIT 编译 + autotune),第二次启动会明显快很多,别急着重启。
Nemotron-3-Ultra:550B 超大模型的多机部署与 AIPerf 压测
Nemotron-3-Ultra(550B-A55B)即使压缩到 NVFP4 也无法单机容纳,官方提供了基于 4× DGX Spark 集群的实战指南:
- 单机集群部署:usage-cookbook/Nemotron-3-Ultra/SparkDeploymentGuide/README.md —— 用
--tensor-parallel-size 4跨四台机器切分模型,节点间走 ConnectX/RoCE 网络 - 双工作站方案:usage-cookbook/Nemotron-3-Ultra/DualStationDeploymentGuide/README.md
- 单工作站方案:usage-cookbook/Nemotron-3-Ultra/StationDeploymentGuide/README.md
部署完成后,官方用NVIDIA AIPerf做了完整压测,首 Token 中位延迟约 2.05 秒,输出吞吐约 20.55 tokens/sec/user:
进阶玩法:工具调用与推理预算控制
三大引擎的 Cookbook 都内置了OpenAI Tools 协议的工具调用演示,部署后即可直接对接现有 Agent 框架:
更酷的是推理预算(Reasoning Budget)控制——通过reasoning_budget参数限制思考 Token 数,在成本与推理深度之间自由权衡。仓库还提供了一个自定义 Logit Processor 工具包 tools/budget/,可在服务端单次调用内完成预算截断,配套的客户端示例见 tools/budget/client.py,启动脚本见 tools/budget/serve_v3.sh。
部署避坑清单
- ⚠️NVFP4 只认 Blackwell 架构(B200 / RTX PRO 6000),Ampere/Hopper 请用 FP8
- ⚠️ 进程内推理后起
vllm serve会 OOM——先重启 kernel 释放 GPU 显存 - ⚠️ 多机部署注意节点序号从 0 开始,node1 对应 rank 0
- ⚠️ 多卡环境确保 notebook 与终端在同一个虚拟环境中
总结
| 你的需求 | 推荐路径 |
|---|---|
| 单卡快速体验 | Nano + vLLM Cookbook |
| 生产级高吞吐 | Super + vLLM(FP8, TP=2) |
| Agent 工具调用 | Super + SGLang |
| 极致低延迟 | Super/Ultra + TensorRT-LLM |
| 消费级硬件跑超大模型 | Ultra + 多机 Spark 集群 |
仓库的 usage-cookbook/README.md 还收录了 NIM 微服务、Hugging Face Transformers、DGX Station 后训练等更多方向的部署与使用指南,结合 docs/nemotron/omni3/inference.md 的引擎对照表,从入门到生产都能找到对应方案。祝部署顺利 🚀
【免费下载链接】NemotronDeveloper Asset Hub for NVIDIA Nemotron — A one-stop resource for training recipes, usage cookbooks, datasets, and full end-to-end reference examples to build with Nemotron models项目地址: https://gitcode.com/gh_mirrors/ne/Nemotron
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考