DeepSpeed Windows 安装一次装通:5 步从体检到跑通推理 DeepSpeed Windows 安装一次装通5 步从体检到跑通推理【免费下载链接】DeepSpeedDeepSpeed is a deep learning optimization library that makes distributed training and inference easy, efficient, and effective.项目地址: https://gitcode.com/GitHub_Trending/de/DeepSpeed过去只能在 Linux 上跑的 DeepSpeed现在 Windows 下一条pip install deepspeed就能装好——官方算子已预编译不用碰 CUDA SDK 和 C 编译器。这篇教程从装前体检、两条安装路线、ds_report 验证讲到排障手册和微调、推理上手目标只有一个让你今天就在自己的 Windows 机器上跑通第一个 DeepSpeed 任务。 第一步 · 装前体检确认你的 Windows 环境能跑 DeepSpeed体检是最划算的一步跳过它后面八成报错都能在这里找到根源。只需核对四项项目最低要求操作系统Windows 11 23H2 及以上22H2 及以下不保证算子兼容Python3.xPyTorch带 CUDA 支持的版本显卡驱动最新版 NVIDIA 驱动确认 PyTorch 状态跑一条命令就能自检python -c import torch; print(torch.__version__, torch.version.cuda, torch.cuda.is_available())输出里第三项是True说明 PyTorch 已经认出了你的 GPU。想核对更细的支持型号和配置可以翻官方 README。总之系统、Python、PyTorch 的 CUDA 版本三样都齐就可以放心进入安装环节了。 第二步 · 选一条路装pip 快车道 or 源码深水区两条路不用都走按你的诉求二选一即可。如果你 3 分钟要装好走 pip 快车道先执行这一条命令pip install deepspeed关键在于它和 Linux 装法的一个本质差别Windows 版的 DeepSpeed 把所有 C/CUDA 算子都预编译进了 wheel 包不需要装 CUDA SDK不需要 C 编译器也不用干等 JIT 编译。下完约 44 MB 的 wheel 文件网络顺畅的话一分钟出头就结束终端最后会打出 Successfully installed deepspeed 字样长这样如果要最新版或要改代码进源码构建深水区只有当你要用尚未发布的最新代码或者需要自己改源码、自己编译算子时才建议走这条路。克隆仓库后直接跑官方构建脚本依赖安装它会自动处理最终产物是dist目录下的 wheel 文件git clone https://gitcode.com/GitHub_Trending/de/DeepSpeed cd DeepSpeed build_win.bat构建过程卡住多半是缺依赖按脚本提示补装即可。构建环境的完整细节在文档docs/_tutorials/advanced-install.md一章可对照 advanced-install 逐项检查。✅ 第三步 · 跑通才算完30 秒验证安装是否成功ds_report是官方自带的体检命令无论走哪条安装路线装完都先跑一遍ds_report看输出有重点先看 C/CUDA extension op report 这一段fused_adam、cpu_adam、fused_lamb等算子应显示 YES再看下方 general environment infotorch 版本、deepspeed 版本、CUDA 版本都要如实打印出来。下面这份就是标准健康输出验证通过后再用最小的训练例子 CIFAR-10 冒烟测试。先克隆官方示例仓库git clone https://gitcode.com/gh_mirrors/de/DeepSpeedExamples进入 CIFAR-10 对应目录后启动训练deepspeed cifar10_deepspeed.py --deepspeed判定成功的标准是终端最后几行先出现Finished Training接着按类别打印识别率plane、bird、car……进程正常退出。准确率爬到 50% 以上说明训练循环真的跑起来了环境干净 第四步 · 排障手册编译错误、CUDA 不匹配、运行报错的三段式解法现象build_win.bat 编译报错原因缺 Visual Studio Build Tools或只装了 VS 本体而没勾选「C 桌面开发」工作负载报错里常出现 compiler、ninja 或 LNK 字样。解法安装 Visual Studio 2019 或更高版本在负载清单里勾上 C 桌面开发再重跑build_win.bat。逐步搭建指南见 advanced-install。现象CUDA 版本不匹配算子加载失败原因PyTorch 携带的 CUDA 版本与 DeepSpeed wheel 编译时用的不一致或驱动版本过老。解法先跑这条命令确认 PyTorch 实际用的 CUDA 版本python -c import torch; print(torch.version.cuda)再安装与该版本匹配的 DeepSpeed wheel驱动过旧就更新 NVIDIA 驱动并重启。现象训练或推理时运行报错原因显存不足又没开 offload或驱动、内存状态异常。解法按顺序做三件事——更新显卡驱动到最新版调小 batch size或给推理命令加--cpu-offload把权重挪到内存仍无解时带着完整ds_report输出对照 getting-started 的排障章节排查还是不行就去 Issue 提单。 第五步 · 进阶路线LoRA 监督微调与 ZeRO-Inference 推理环境通了之后直接试这两个场景。第一个是监督微调用 DeepSpeed-Chat 的 SFT 脚本给 opt-125m 挂上 LoRA叠加 ZeRO-2 和 bf16deepspeed training\step1_supervised_finetuning\main.py --model_name_or_path facebook/opt-125m --gradient_accumulation_steps 8 --lora_dim 128 --only_optimize_lora --print_loss --zero_stage 2 --deepspeed --dtype bf16 --offload --output_dir output这条命令能一次性验证 HuggingFace 集成、LoRA 和 offload 三个能力都可用正常输出长这样第二个是 ZeRO-Inference 推理7B 模型塞不进 4 GB 显存就把权重 offload 到 CPU 内存用 8 个 token 的提示词生成 32 个 tokendeepspeed run_model.py --model meta-llama/Llama-2-7b-hf --batch-size 64 --prompt-len 8 --gen-len 32 --cpu-offload终端打印出连贯的生成段落说明推理链路完全可用至此单 GPU 的训练、微调、推理三大场景全部覆盖。后续路线图上还排着多 GPU 支持、权重量化和性能测试进展会陆续合入。遇到本文没覆盖的报错把完整ds_report输出贴到 Issues 提问或按 CONTRIBUTING 参与社区讨论。【免费下载链接】DeepSpeedDeepSpeed is a deep learning optimization library that makes distributed training and inference easy, efficient, and effective.项目地址: https://gitcode.com/GitHub_Trending/de/DeepSpeed创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考