尧图网络 高端网站定制 · 原创设计
免费咨询热线
400-888-6620
免费获取方案
零基础入门全模态生成:MiniMax-H3-nvfp4-INT4-INT8-Convrot文本到视频实战
零基础入门全模态生成MiniMax-H3-nvfp4-INT4-INT8-Convrot文本到视频实战【免费下载链接】Minimax-H3-nvfp4-INT4-INT8-Convrot项目地址: https://ai.gitcode.com/hf_mirrors/Abiray/Minimax-H3-nvfp4-INT4-INT8-ConvrotMiniMax-H3-nvfp4-INT4-INT8-Convrot是一个社区编译的量化与剪枝权重集合专为本地推理环境如ComfyUI优化让普通用户也能轻松体验强大的全模态文本到视频生成能力。通过统一INT4、INT8、混合精度和NVFP4等多种量化格式该项目使拥有16GB - 24GB VRAM消费级GPU的用户能够便捷地探索MiniMax H3的文本、图像、音频到视频的生成功能。 为什么选择MiniMax-H3量化版本全模态生成能力MiniMax H3是一个通用的全模态生成系统支持对文本、图像、视频和音频组成的多模态上下文进行统一理解并能生成带有原生立体声音频的视频分辨率最高可达2K时长最长15秒。其面向任务泛化的系统设计使其在预训练阶段就具备了广泛的多模态上下文理解和生成能力能够出色地遵循复杂的多模态指令。丰富的输入输出规格类别规格输出时长4–15秒输出宽高比支持多种宽高比包括但不限于21:9、16:9、4:3、1:1、3:4和9:16输出分辨率支持多种分辨率尺寸默认将较短边设置为768像素使用H3-Regenerate-2K可实现2K生成输出帧率24 FPS输出音频32 kHz立体声支持对话语言稳定支持11种语言阿拉伯语、中文、英语、法语、德语、意大利语、日语、韩语、葡萄牙语、俄语和西班牙语 硬件与GPU选择指南下载哪个文件如果你是本地生成新手不确定该下载什么文件可以根据你的显卡使用以下指南。⚠️关于VAEs的注意事项无论你的GPU如何每个人都必须下载/vae文件夹中的两个文件minimax_h3_audio_vae_fp32.safetensors和minimax_h3_video_vae_fp16.safetensors。1. 标准高端GPU16GB VRAM非常适合RTX 4070 Ti Super、RTX 4080等显卡。扩散模型下载INT4MiniMax_H3_[...]_pruned_int4_convrot.safetensors或混合精度_mixed_int4_int8_版本。文本编码器下载qwen3vl_32b_minimax_h3_int4_convrot.safetensors2. 发烧级GPU24GB VRAM非常适合RTX 3090、RTX 4090等显卡。扩散模型下载INT8MiniMax_H3_[...]_pruned_int8_convrot.safetensors以获得最高的剪枝质量。文本编码器下载qwen3vl_32b_minimax_h3_int8_convrot.safetensors3. 仅适用于Nvidia Blackwell GPU专门用于RTX 5090、PRO 6000和其他下一代Blackwell显卡。不要为30/40系列显卡下载这些文件扩散模型下载NVFP4MiniMax_H3_[...]_pruned_nvfp4.safetensors。文本编码器下载qwen3vl_32b_minimax_h3_nvfp4_awq.safetensorsFL2VA与Ref2VA有什么区别FL2VA如果你只想进行标准的文本到视频或简单的图像到视频使用一两个起始/结束图像请下载此版本。Ref2VA如果你想使用高级全参考多个图像、视频剪辑或音频输入请下载此版本。 包含的文件和格式该存储库使用统一的命名约定MiniMax_H3_FL2VA_*和MiniMax_H3_Ref2VA_*以便轻松集成到本地管道中。1. 扩散模型混合INT4/INT8混合精度模型。需要15GB以上显存约15.5 GB。MiniMax_H3_FL2VA_pruned_mixed_int4_int8_convrot.safetensorsMiniMax_H3_Ref2VA_pruned_mixed_int4_int8_convrot.safetensorsINT8最高质量的剪枝模型。需要24GB以上显存约21 GB。MiniMax_H3_FL2VA_pruned_int8_convrot.safetensorsMiniMax_H3_Ref2VA_pruned_int8_convrot.safetensorsINT4适用于标准消费级硬件的高压缩模型约11.3 GB。MiniMax_H3_FL2VA_pruned_int4_convrot.safetensorsMiniMax_H3_Ref2VA_pruned_int4_convrot.safetensorsNVFP4实验性Nvidia 4位浮点模型需要Blackwell架构。MiniMax_H3_Ref2VA_pruned_nvfp4.safetensors12.5 GBMiniMax_H3_Ref2VA_nvfp4_mixed.safetensors24.4 GBMiniMax_H3_FL2VA_pruned_nvfp4.safetensors12.5 GB2. 文本编码器/text_encodersqwen3vl_32b_minimax_h3_int4_convrot.safetensors15.0 GB-推荐用于16GB GPUqwen3vl_32b_minimax_h3_int8_convrot.safetensors27.1 GB-推荐用于24GB GPUqwen3vl_32b_minimax_h3_nvfp4_awq.safetensors15.7 GB-用于Blackwell GPU3. VAEs/vaeminimax_h3_audio_vae_fp32.safetensors605 MB - 音频解码器minimax_h3_video_vae_fp16.safetensors5.21 GB - 视频解码器️ 快速开始步骤1. 克隆仓库首先克隆项目仓库到本地git clone https://gitcode.com/hf_mirrors/Abiray/Minimax-H3-nvfp4-INT4-INT8-Convrot2. 根据GPU选择模型文件根据前面的硬件与GPU选择指南下载适合你显卡的扩散模型、文本编码器以及/vae文件夹中的两个文件。3. 集成到ComfyUI将下载的模型文件放置到ComfyUI的相应目录下即可开始使用MiniMax-H3-nvfp4-INT4-INT8-Convrot进行文本到视频的生成实验。 模型架构简介H3-Context-IRH3-Context-IR是一个托管的预处理和编排系统专为自由形式的多模态输入设计。它解释文本、图像、音频和参考视频之间的关系以及这些材料与预期生成输出的关系。H3-Context-IR将其对上下文的理解序列化为H3-Base接受的结构化表示。H3-BaseH3-Base使用相应的编码器或VAEs对不同的模态进行编码并将编码后的表示组织成统一的打包多模态序列。具体来说文本由H3-Encoder编码视觉输入由H3-Encoder和H3-VisualVAE共同编码音频仅由H3-AudioVAE编码。H3-Omni-Transformer联合预测视频和音频潜变量然后分别解码为视频和立体声音频。H3-EncoderH3-Encoder使用Qwen3-VL-32B的完整预训练权重并将其第50层的隐藏状态提供给H3-Omni-Transformer。H3-VAEH3-VisualVAE是一个时间因果视频自动编码器空间压缩因子为16×时间压缩因子为4×有24个潜通道f16t4d24。H3-AudioVAE对左右音频通道使用相同的编码器和解码器同时独立处理每个通道。它将32 kHz音频压缩成时间速率为40 Hz的潜令牌序列。H3-Omni-TransformerH3-Omni-Transformer是一个33B参数的密集单流Transformer。该模型使用三维多模态旋转位置嵌入MM-RoPE来表示时间和两个空间维度thw上的位置关系。 许可证与法律信息MiniMax H3及其量化衍生物根据MiniMax H3社区许可协议发布。使用官方API时用户提交的文本、图像和视频以及增强提示会受到自动审核。涉嫌违法、色情或侵犯第三方权利的内容可能会被屏蔽。这些防护措施不影响被许可方在MiniMax H3社区许可下的义务特别是与合法使用和使用限制相关的义务。原始创建者/联系方式全球APIplatform.minimax.io联系方式modelminimax.io【免费下载链接】Minimax-H3-nvfp4-INT4-INT8-Convrot项目地址: https://ai.gitcode.com/hf_mirrors/Abiray/Minimax-H3-nvfp4-INT4-INT8-Convrot创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
RELATED

相关推荐

零门槛微调LFM2.5-2.6B:Unsloth与TRL工具链实操教程

零门槛微调LFM2.5-2.6B:Unsloth与TRL工具链实操教程

零门槛微调LFM2.5-2.6B:Unsloth与TRL工具链实操教程 【免费下载链接】LFM2.5-2.6B 项目地址: https://ai.gitcode.com/hf_mirrors/LiquidAI/LFM2.5-2.6B LFM2.5-2.6B是一款高效的AI模型,本教程将带你使用Unsloth与TRL工具链轻松实现零门槛微调&a…

📅 2026/10/3 7:24:40
CLIP-ViT-B-16-laion2B-s34B-b88K vs 原版CLIP:性能对比与模型优化关键差异

CLIP-ViT-B-16-laion2B-s34B-b88K vs 原版CLIP:性能对比与模型优化关键差异

CLIP-ViT-B-16-laion2B-s34B-b88K vs 原版CLIP:性能对比与模型优化关键差异 【免费下载链接】CLIP-ViT-B-16-laion2B-s34B-b88K 项目地址: https://ai.gitcode.com/hf_mirrors/laion/CLIP-ViT-B-16-laion2B-s34B-b88K CLIP-ViT-B-16-laion2B-s34B-b88K是基于…

📅 2026/9/15 8:09:40
WPGraphQL for WooCommerce核心功能解析:产品查询、购物车管理与订单处理全攻略

WPGraphQL for WooCommerce核心功能解析:产品查询、购物车管理与订单处理全攻略

WPGraphQL for WooCommerce核心功能解析:产品查询、购物车管理与订单处理全攻略 【免费下载链接】wp-graphql-woocommerce Add WooCommerce support and functionality to your WPGraphQL server 项目地址: https://gitcode.com/gh_mirrors/wp/wp-graphql-woocomm…

📅 2026/9/15 8:35:16
MORE NEWS

更多资讯

📰

PyCharm控制台pip install后仍报ModuleNotFoundError的完整排查与解决

关于 PyCharm 控制台 pip install 之后仍然报 ModuleNotFoundError: No module named flask 的完整排查记录 先说场景:你在 PyCharm 底部那个 Terminal 面板里敲了 pip install flask ,看着进度条跑完、 Successfully installed flask-3.x.x 也打出来…

📰

匿名模型Space Bunny登顶API调用量榜首:接入与部署实践

Space Bunbun 登顶全球调用量第一的消息,我刷到的时候第一反应是:又一个匿名模型?等我把测试数据拉下来,才发现这事比“匿名”这两个字要复杂得多。它现在在全球公开 API 调用量榜单上压着 Opus5(Anthropic 最新一代旗…

📰

JavaWeb超市管理系统课设:从选型到跑通,附论文框架与源码

简介:这份资源面向计算机专业学生与JavaWeb初学者,提供一套完整的超市管理系统毕业设计或课程设计参考方案,帮助解决从需求分析到代码落地的全流程问题。压缩包共3个文件,包含1个zip源码工程、1个sql数据库脚本和1个doc设计文档&a…

📰

DeepSeek Harness:本地AI工作流引擎深度解析

1. 这不是又一个“AI桌面工具”,而是你本地工作流的真正控制台DeepSeek Harness v0.2 桌面端刚发布那会儿,我第一时间下载试用。不是冲着“国产模型”或者“开源免费”这些标签去的,而是被它文档里一句轻描淡写的描述戳中了:“让插…

📰

企业级轻型AI中台落地实践:从财务自动化到智能对账

财务部的小王每天上午雷打不动要做两件事:把供应商发来的PDF发票手工录入ERP,再把银行流水和业务系统的回款记录一条条拉出来比对。这两件事我观察了很久,它们几乎消耗了财务团队三分之一的工作时间,而且越到月底,对账…

📰

本地AI记忆:重构数字时代的数据主权与离线智能

1. 这不是“搭个AI聊天框”,而是在重建人和信息的关系“本地 AI 记忆”这五个字一出来,我就在笔记本上划了三道横线——它根本不是又一个LLM前端界面项目,而是对“数字记忆权”一次静默但坚定的重定义。过去十年,我们所有笔记、对…

TODAY

今日更新

THIS WEEK

本周精选

THIS MONTH

本月热门

读完文章,想聊聊您的网站?

告诉我们您的行业与需求,资深顾问一对一梳理方案与报价,全程免费。

📞 💬