DeepSpeed Windows 快速安装指南
【免费下载链接】DeepSpeedDeepSpeed is a deep learning optimization library that makes distributed training and inference easy, efficient, and effective.项目地址: https://gitcode.com/GitHub_Trending/de/DeepSpeed
在 Windows 上跑 DeepSpeed 没有想象中麻烦:官方原生支持 Windows 单 GPU 的训练、微调和推理,pip 装的是预编译包,不需要本机 CUDA Toolkit 和 C++ 编译器。这份指南覆盖三个判断——环境能不能装、怎么装最快、装完能干什么。
硬件与软件体检单:校验 CUDA 是否匹配 PyTorch
4GB 显存够单卡微调和推理,但当前 Windows 版只支持单 GPU,多卡训练暂时别指望。
| 组件 | 建议版本 | 关键约束 | 校验命令 |
|---|---|---|---|
| 系统 | Windows 11 23H2+ | 家庭版需开启开发者模式 | winver |
| Python | 3.10 / 3.11 | 需能装支持 CUDA 的 PyTorch | python --version |
| PyTorch | 2.3.0+cu121 | CUDA 版本须与显卡驱动匹配 | python -c "import torch; print(torch.cuda.is_available())" |
| 显卡 | 4GB 显存起步 | 官方测试环境即 4GB,越大越从容 | nvidia-smi |
pip 预编译包不要求你本机装 CUDA Toolkit,算子随包分发。走源码构建则必须有 CUDA 12.x 和 Visual Studio Build Tools。Python 版本不合时,先换 3.10/3.11 重试,别急着升级硬件或折腾 WSL。
安装决策路径:pip 预编译包优先,源码构建兜底
新手直接用 pip 预编译包,装完即可用;源码构建只留给要改算子的人。
路线 A:pip 预编译包(推荐)
- 适用人群:单卡训练、微调、推理的普通用户
- 核心命令:
pip install deepspeed- 验证标准:运行
ds_report,CUDA、ZeRO 等模块显示为 ENABLED,且能看到当前 GPU 型号
路线 B:源码构建(进阶)
- 适用人群:需要跟最新分支或修改自定义算子的开发者
- 核心命令:
git clone https://gitcode.com/GitHub_Trending/de/DeepSpeed cd DeepSpeed .\build_win.bat- 验证标准:
ds_report中目标算子显示 ENABLED - 注意:build_win.bat 默认关闭了 AIO、稀疏注意力等 Linux 专属算子,源码构建前确认 Visual Studio Build Tools 已装好,否则会报
cl.exe not found
最小可行验证:单卡跑通 CIFAR-10 训练
装完先跑一个十分钟内能结束的小任务,确认训练链路通了再谈大模型。
用 DeepSpeed 官方示例库里的 CIFAR-10 脚本,进入 cifar 目录执行:
deepspeed cifar10_deepspeed.py --deepspeed预期输出要点:loss 逐步下降、验证准确率爬升;官方在 RTX A2000(4GB)上实测约 8 分钟跑完 5 个 epoch,准确率达 89.3%。只要看到 loss 曲线正常下降,你的环境就算通了。
进阶场景速览:offload 与 LoRA 的用法
显存不够时,改参数比换硬件划算。三个方向,各记一条关键参数即可。
CPU offload 推理(ZeRO-Inference):解决"4GB 显存装不下 7B 模型"的瓶颈。关键参数--cpu-offload,把模型权重搬到 CPU 内存。官方用 Llama-2-7B 实测:生成 32 个 token 约 47 秒,显存峰值 3.8GB。速度慢,但能跑就是胜利。
LoRA 微调:解决"没有大显存也能继续训练"的问题。关键参数--offload搭配--lora_dim 128 --zero_stage 2,官方在 4GB 显存上微调了 facebook/opt-125m 并全程开启 CPU offload。
多卡扩展:当前 Windows 版限单 GPU。需要多卡时,务实的做法是迁到 WSL2 或 Linux 环境,而不是在原生 Windows 上硬等。
排障速查表
装不上、跑不起来时,先对表再动手。
| 错误特征 | 根因一句话 | 修复动作 |
|---|---|---|
cl.exe not found | 源码构建缺 C++ 编译器 | 装 Visual Studio Build Tools,或改回 pip 预编译包 |
torch.cuda.is_available()返回 False | PyTorch 的 CUDA 版本与驱动不匹配 | 重装与显卡驱动对应的 cu12x 版 torch |
ds_report显示算子 DISABLED | 算子未编译或该算子在 Windows 上被禁用 | 优先换 pip 版;源码版设DS_BUILD_OPS=1重新构建 |
Access denied | 当前终端权限不足 | 以管理员身份重启 PowerShell |
延伸与生态
- blogs/windows/08-2024/chinese/README.md:官方中文版 Windows 支持说明,含全部实测命令与测试环境
- docs/_tutorials/getting-started.md:跨平台入门教程,适合第一次接触 DeepSpeed 的人
- build_win.bat:Windows 源码构建脚本,可查哪些算子被默认关闭
- MANIFEST_win.in:Windows 打包文件清单,排查"装了什么"时看这里
- op_builder/builder.py:算子编译总入口,自定义构建问题时从它读起
【免费下载链接】DeepSpeedDeepSpeed is a deep learning optimization library that makes distributed training and inference easy, efficient, and effective.项目地址: https://gitcode.com/GitHub_Trending/de/DeepSpeed
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考