尧图网络 高端网站定制 · 原创设计
免费咨询热线
400-888-6620
免费获取方案
Open-Sora-Plan:一句话生成视频的免费开源文生视频模型,5 分钟跑通实战教程
Open-Sora-Plan一句话生成视频的免费开源文生视频模型5 分钟跑通实战教程【免费下载链接】Open-Sora-PlanThis project aim to reproduce Sora (Open AI T2V model), we wish the open source community contribute to this project.项目地址: https://gitcode.com/GitHub_Trending/op/Open-Sora-PlanOpen-Sora-Plan 是一个由北大-兔展AIGC联合实验室发起的免费开源文生视频T2V生成模型你只需要输入一句话描述它就能生成几秒到十几秒的短视频还支持图生视频和视频补全。这篇指南带你从零完成安装、跑通第一个视频、调出满意的效果并告诉你到底需要多少硬件。它能干什么Sora 的开源平替 简单说Open-Sora-Plan 就是一个开源版的文生视频引擎你把一只猫在雪地里奔跑这样的句子丢给它它输出对应的 mp4 视频文件。除了文生视频仓库里还包含图生视频给一张首帧图让它动起来、视频补全inpainting填充画面中某块区域和帧插值用 AMT-G 网络把视频插帧变流畅这几个方向的功能核心目录在 opensora/models/ 下。它采用 Apache 2.0 协议模型权重和代码都公开任何人都能下载、训练、二次开发。从版本演进看它走到哪一步了这个项目从 2024 年 3 月启动目前迭代到 v1.5.0几个关键节点可以帮你建立预期v1.2.0首个真 3D 全注意力架构能生成 93 帧 720p约 5 秒视频v1.3.0引入 WFVAE 高压缩 VAE 和稀疏注意力官方明确支持24G 显存内生成 93 帧 480p 视频这是目前对普通用户最友好的一档v1.5.08B 参数规模、用 4000 万条视频训练输出可达 121 帧 576x1024官方称性能接近同为开源的 HunyuanVideo。不过这一版目前只在华为昇腾 NPU 上发布GPU 版本官方表示coming soon。如果你想了解技术细节最值得一读的是 docs/Report-v1.3.0.md它把 WFVAE、提示词精炼器、数据筛选策略都讲清楚了。5 分钟跑通第一个视频 ⚙️三步安装依赖全部锁定仓库没有单独的 requirements 文件所有依赖PyTorch、Transformers、Gradio 等都锁定在 pyproject.toml 里所以安装只需三步git clone https://gitcode.com/GitHub_Trending/op/Open-Sora-Plan cd Open-Sora-Plan pip install -e . # 按 pyproject.toml 安装 opensora 包及全部依赖要求 Python 3.8建议 3.10用网页界面生成第一个视频装完后最省心的入口是内置的 Gradio 网页控制台一条命令启动python opensora/serve/gradio_web_server.py \ --model_path /你的路径/v1_3/model_ema \ # 换成你下载好的 v1.3.0 权重路径README Resource 一节有各版本链接 --version v1_3 \ # 指定模型版本 --save_img_path ./my_videos \ # 生成的视频保存目录 --caption_refiner /你的路径/prompt_refiner \ # 可选自动扩写提示词强烈建议开启 --gradio_port 11900 # 网页端口启动后浏览器打开 11900 即可打开网页后界面就是一个提示词输入框加几个滑块帧数1~93、引导强度guidance scale官方默认 7.5、采样步数10~200、随机种子。填一句话点 Run几分钟后结果视频就出现在右侧自动保存到--save_img_path指定的目录。注意首次启动会自动从 Hugging Face 下载 VAE 和 T5 文本编码器体积不小耐心等第一次下完即可。命令行批量生成如果你要一次生成多条、或做自动化流程直接调采样入口官方脚本 scripts/text_condition/gpu/sample_t2v_v1_3.sh 就是标准参考python -m opensora.sample.sample \ --model_path /你的路径/v1_3/model_ema \ --version v1_3 \ --num_frames 29 \ # 帧数必须是 4n129/45/61/77/93 --height 352 --width 640 \ --text_prompt examples/sora.txt \ # 官方现成提示词文件可换成你自己的 --num_sampling_steps 100examples/sora.txt里就是一批可直接跑的提示词改个文件名、换成自己的句子就能出片。怎么让效果好看三个调优点提示词精炼器一句话自动变长描述直接写猫在雪地模型容易出平庸画面。加--caption_refiner后内置的小型语言模型会先把你的短句子扩写成包含主体、动作、场景、光线氛围的完整描述再生成视频——官方提示词精炼器就是为这个设计的代码在 opensora/sample/caption_refiner.py。对新手来说这是性价比最高的一档开关。帧数、步数、引导强度怎么配帧数按 18fps 换算29 帧约 1.6 秒93 帧约 5 秒想长就调 61/93但显存占用随之上升采样步数官方默认 100网页界面默认 50。步数越高画面越稳但耗时线性增长25 步以上通常可用引导强度默认 7.5 是官方验证过的值调高会让画面更贴合文字但容易过饱和一般不用动。你需要多少硬件 24G 显卡是甜点配置官方给出的明确指标是v1.3.0 可以在 24G 显存内生成 93 帧 480p 视频。也就是说一张 RTX 3090/409024G能舒服地跑满 5 秒时长显存紧张时可以把帧数降到 29 或 45分辨率降到 352x640这是官方样例脚本的默认配置。显存不够时的两个开关网页启动命令支持--enable_tiling和--save_memory两个开关前者用分块卷积把 VAE 的显存占用压到接近恒定这也是 v1.1.0 报告里提到的核心优化后者进一步节省内存。长视频生成时建议都加上。没有 GPU 怎么办要坦白说这个项目的推理代码深度依赖 CUDA官方没有提供 CPU 推理路径普通办公电脑跑不动视频生成。但如果你用的是华为昇腾服务器v1.5.0 已完全基于昇腾训练和推理走 mindspeed_mmdit 分支即可这是目前昇腾平台上性能最强的开源视频模型之一。谁在用它怎么用起来最值内容创作者和教师你的场景是快速产出演示动画、课件素材、短视频草稿。正确用法是先出粗稿再迭代——开启提示词精炼器用 29 帧快速试不同提示词方向挑出满意的方向后再上 93 帧出成片。它不会取代剪辑软件但能把从 0 到第一个能用的画面这一步从几小时压到几分钟。研究人员和二次开发者这是它真正的深度所在完整的训练代码文生视频、图生视频、inpainting 三套脚本在 opensora/train/、数据预处理、评测脚本一应俱全docs/Contribution_Guidelines.md 详细说明了如何贡献模型和数据。很多开源下游工作如 6 秒 720p 的 Allegro都是基于它复现出来的说明这套代码确实撑得住二次训练。适合谁以及它能走到哪如果你有一块 24G 左右的显卡或昇腾资源、想让一句话变视频这件事今天就能发生Open-Sora-Plan 是目前开源界完成度最高的选择之一权重全公开、文档完整、功能从推理到训练都覆盖。它现在还不能生成分钟级长视频但按它半年一个版本、每版都刷新参数和分辨率上限的节奏开源文生视频与闭源的差距正在以肉眼可见的速度缩小——而你今天跑通的第一条视频很可能就是明年行业基线的一部分。【免费下载链接】Open-Sora-PlanThis project aim to reproduce Sora (Open AI T2V model), we wish the open source community contribute to this project.项目地址: https://gitcode.com/GitHub_Trending/op/Open-Sora-Plan创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
RELATED

相关推荐

强化学习中用世界模型预测替代运行的原理与实践

强化学习中用世界模型预测替代运行的原理与实践

1. 这不是“跳过计算”,而是重构决策链路的底层逻辑你有没有遇到过这样的场景:训练一个强化学习智能体去控制机械臂抓取物体,每一步动作都要调用一次高保真物理仿真器——每次仿真耗时200毫秒,一个episode平均要走150步&#xff0…

📅 2026/9/14 9:21:16
螺杆支撑座预压技术:精密传动系统的关键参数优化

螺杆支撑座预压技术:精密传动系统的关键参数优化

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

📅 2026/9/14 9:21:16
海铁联运“一单到底”怎么办理?2026海关多式联运试点企业操作清单

海铁联运“一单到底”怎么办理?2026海关多式联运试点企业操作清单

文/林芳老师 工厂在中西部、货物要到沿海装船,过去每转一段就报一次关。2026年1月27日起,海铁联运、水水中转海关监管新模式试点落地,一张申请单管全程。这篇讲清楚:谁能办、找谁办、每一步传什么数据。 2026年1月20日&#xff0c…

📅 2026/9/14 9:21:16
MORE NEWS

更多资讯

📰

Effect BigDecimal 聚合运算新能力:sumAll 与 multiplyAll 源码解析与实战

Effect BigDecimal 聚合运算新能力:sumAll 与 multiplyAll 源码解析与实战 【免费下载链接】effect Build production-ready applications in TypeScript 项目地址: https://gitcode.com/GitHub_Trending/ef/effect 本文围绕 Effect 中 BigDecimal 模块新增的…

📰

机器人激光雷达选型实战:单线还是多线,固态还是机械?

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

📰

NeMo 流式 / 缓冲 / 分块 ASR 推理实战:AED 与 Transducer 模型的 chunked 与 streaming 解码指南

NeMo 流式 / 缓冲 / 分块 ASR 推理实战:AED 与 Transducer 模型的 chunked 与 streaming 解码指南 【免费下载链接】Speech A scalable generative AI framework built for researchers and developers working on Large Language Models, Multimodal, and Speech A…

📰

MCP生态中的Fetch服务:让大模型轻松读取网页内容

最近在整理手头的 MCP(Model Context Protocol)工具集时,我又把 Fetch MCP 从头到尾过了一遍。这个服务可以说是 MCP 生态里最基础、也最容易被人低估的一个:它干的事很纯粹——帮大模型把指定 URL 的网页内容抓下来,转…

📰

easy-vibe 实战:用 AI IDE 从业务提问到交付多页面产品原型,打造电商素材工作台

easy-vibe 实战:用 AI IDE 从业务提问到交付多页面产品原型,打造电商素材工作台 【免费下载链接】easy-vibe 💻 vibe coding 101|The first course for AI-native product builders. 项目地址: https://gitcode.com/GitHub_Tren…

📰

OpenClaw开源AI Agent框架架构解析与部署实践

1. OpenClaw技术架构深度解析OpenClaw作为当前最热门的开源AI Agent框架,其核心架构设计体现了"本地优先"的理念。整个系统采用微服务架构,主要包含以下核心组件:核心引擎层:基于Node.js构建的任务调度中枢,…

TODAY

今日更新

THIS WEEK

本周精选

THIS MONTH

本月热门

读完文章,想聊聊您的网站?

告诉我们您的行业与需求,资深顾问一对一梳理方案与报价,全程免费。

📞 💬