Open-Sora 完整指南:从零跑通本地 AI 视频生成 Open-Sora 完整指南从零跑通本地 AI 视频生成【免费下载链接】Open-SoraOpen-Sora: Democratizing Efficient Video Production for All项目地址: https://gitcode.com/GitHub_Trending/op/Open-SoraOpen-Sora 是一个完全开源的 AI 视频生成项目一个 11B 规模的模型同时支持文本生成视频T2V和图像生成视频I2V分辨率覆盖 256px 与 768px推理入口统一收敛在 scripts/diffusion/inference.py 一条命令里。只要一台带 NVIDIA 显卡的机器按下面步骤走一遍就能出片。装环境Python 3.10 依赖一次到位系统要求操作系统Linux推荐 Ubuntu 20.04 及以上Python3.10显卡NVIDIA 显卡显存建议 16GB 以上CUDA12.1 及以上克隆仓库并安装用 conda 隔离环境克隆代码后依次安装基础包、xformers 和 flash-attn版本与 CUDA 12.1 匹配conda create -n opensora python3.10 conda activate opensora git clone https://gitcode.com/GitHub_Trending/op/Open-Sora cd Open-Sora pip install -v . # 要求 torch 2.4.0 pip install xformers0.0.27.post2 --index-url https://download.pytorch.org/whl/cu121 pip install flash-attn --no-build-isolation装完后import opensora无报错即可。如果想压榨速度还可以额外编译 Flash Attention 3git clone https://github.com/Dao-AILab/flash-attention # 4f0640d5 cd flash-attention/hopper python setup.py install下载 11B 模型权重推理需要 Open-Sora-v2 权重落盘到./ckpts目录即可。两个来源任选其一国内网络一般选 ModelScope 更快pip install huggingface_hub[cli] huggingface-cli download hpcai-tech/Open-Sora-v2 --local-dir ./ckptspip install modelscope modelscope download hpcai-tech/Open-Sora-v2 --local_dir ./ckpts下载完成后./ckpts下会出现Open_Sora_v2.safetensors等文件这是推理配置里from_pretrained指向的默认路径。文本生成视频第一条最小可用路径单条 prompt 出片下面这条命令走文生图→图生视频的两级流水线先由 flux 文生图模型出首帧再扩散成视频生成一段 256px 视频保存到samples/目录torchrun --nproc_per_node 1 --standalone scripts/diffusion/inference.py configs/diffusion/inference/t2i2v_256px.py --save-dir samples --prompt raining, sea单卡 50 步采样大约一分钟级别出结果如果显存吃紧追加--offload True把权重卸载到 CPU 换空间。用 CSV 批量生成把多个 prompt 写进 CSV仓库自带样例 assets/texts/example.csv第一列为text通过--dataset.data-path传入即可整批跑完torchrun --nproc_per_node 1 --standalone scripts/diffusion/inference.py configs/diffusion/inference/t2i2v_256px.py --save-dir samples --dataset.data-path assets/texts/example.csv图像生成视频给一张图让它动起来I2V 是这套模型的强项。以仓库自带的农场参考图为例命令里--cond_type i2v_head表示图像作为首帧条件--ref指定图片路径torchrun --nproc_per_node 1 --standalone scripts/diffusion/inference.py configs/diffusion/inference/256px.py --cond_type i2v_head --prompt A plump pig wallows in a muddy pond on a rustic farm --ref assets/texts/i2v.png除i2v_head首帧外条件类型还支持i2v_tail、i2v_loop和v2v_head_half等视频续写模式均在同一条命令下切换。批量 I2V 同样支持 CSV把--ref换成--dataset.data-path assets/texts/i2v.csv即可。调分辨率、帧数与多卡加速 关键生成参数--aspect_ratio宽高比可选16:9、9:16、1:1、2.39:1--num_frames帧数取值为4k1且小于 129例如 65torchrun --nproc_per_node 1 --standalone scripts/diffusion/inference.py configs/diffusion/inference/t2i2v_256px.py --save-dir samples --prompt raining, sea --aspect_ratio 16:9 --num_frames 65768px 高清档与多卡768px 分辨率单卡显存压力明显上升官方推荐用 ColossalAI 序列并行把生成任务摊到多卡上8 卡峰值显存约 44GBtorchrun --nproc_per_node 8 --standalone scripts/diffusion/inference.py configs/diffusion/inference/768px.py --prompt raining, sea对应的配置分别位于configs/diffusion/inference/256px.py与configs/diffusion/inference/768px.py采样步数、guidance 等也可直接在命令行覆盖无需改代码。跑通推理之后下一步可以基于 docs/train.md 用自有视频数据集从零训练或微调一个属于你自己的视频生成模型。【免费下载链接】Open-SoraOpen-Sora: Democratizing Efficient Video Production for All项目地址: https://gitcode.com/GitHub_Trending/op/Open-Sora创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考