尧图网络 高端网站定制 · 原创设计
免费咨询热线
400-888-6620
免费获取方案
stable-diffusion.cpp 中的 LLaDA-Image:6B 文生图与指令编辑模型完整部署指南
人工智能大模型本地部署推理引擎媒体生成【免费下载链接】stable-diffusion.cppDiffusion model(SD,Flux,Wan,Qwen Image,Z-Image,...) inference in pure C/C项目地址https://gitcode.com/GitHub_Trending/st/stable-diffusion.cpp点击查看免费下载LLaDA-Image 是 inclusionAI 发布的 6B 级文本生成图像text-to-image与指令引导编辑instruction-guided editing模型。在 stable-diffusion.cpp 中它以纯 C/C 推理方式运行去噪网络采用 Lumina2/Z-Image 风格的 NextDiT由 LLaDA2-MoE diffusion-LLM 文本编码器提供条件并复用 Flux.2 的 VAE同时对外发布了 50 步 base 模型与 4 步蒸馏版 LLaDA-Image-Turbo 两个 checkpoint。阅读本文后你将掌握四件套权重的下载与组织方式、如何把官方 Safetensors 手动转换为 GGUF、如何将 QueryFormer / 文本投影 / SigVQ 合并为单一 connectors 文件、文生图与图像编辑两条 CLI 推理链路以及 steps、CFG、调度器、显存等关键参数的正确选择。LLaDA-Image 模型架构速览从官方发布口径与仓库源码src/model/diffusion/llada_image.hpp可以确认LLaDA-Image 的核心结构如下去噪网络Lumina2/Z-Image 的 NextDiT超参数与 Z-Image 完全一致因此实现中直接复用了 ZImage 的 transformer block。与 Z-Image 的两点区别是所有 norm 均为无参数 normcheckpoint 不携带任何 norm 权重且潜变量从 Flux2 VAE 输出时已经过 patchify因此 patch_size 为 1、通道数为 128。文本编码器LLaDA2-MoE diffusion-LLM负责把 prompt 编码为条件。VAE复用 Flux.2 的 VAE即文档中称的llada_vae.safetensors。连接组件QueryFormer、文本投影text projection、以及编辑任务专用的 SigVQ 图像编码器统一收敛在 connectors 文件中。源码中的LLaDAImageConfigsrc/model/diffusion/llada_image.hpp给出了默认结构参数参数值说明patch_size1潜变量已由 Flux2 VAE patchifyhidden_size3840主干隐藏维度in_channels/out_channels128 / 128Flux2 VAE 通道数num_layers30主干 transformer 层数num_refiner_layers2噪声 / 上下文 / SigVQ refiner 层数head_dim128单头维度num_heads/num_kv_heads30 / 30注意力头与 KV 头multiple_of/ffn_dim_multiplier256 / 8/3MLP 扩展配置norm_eps/qk_norm1e-5 / true归一化配置cap_feat_dim2560文本投影输出维度semantic_feat_dim4096SigVQ 语义特征维度theta/axes_dim256 / {32, 48, 48}RoPE 频率与轴向维度值得说明的是这些参数并非写死LLaDAImageConfig::detect_from_weightssrc/model/diffusion/llada_image.hpp会在加载权重时按张量名自动检测in_channels、hidden_size、cap_feat_dim、semantic_feat_dim、层数、头数等因此两个不同规模的 checkpoint 都能正确适配。下载权重四件套与两个 checkpoint 的兼容性运行 LLaDA-Image 需要四个组件transformer去噪主干GGUF 格式text encoderLLaDA2-MoE 文本编码器GGUF 格式VAEdiffusion_pytorch_model.safetensorsconnectors 文件合并了 QueryFormer、文本投影以及编辑时所需的 SigVQ 图像编码器。两个发布的 checkpoint 不可互换。LLaDA-Image-Turbo 与 LLaDA-Image 携带不同的 transformer、文本编码器、QueryFormer 和文本投影仅 VAE、SigVQ 编码器与 tokenizer 是共享的。混用会产生降质输出而不是干净的报错因此必须把每个 checkpoint 的文件放在一起使用。两者还都需要一个外部 LLaDA2tokenizer.json该文件未内嵌在 sd.cpp 中且对两个 checkpoint 是同一个文件。从任一官方仓库取tokenizer/tokenizer.json通过--tokenizer传入即可。JSON tokenizer 的 CLI 与 C API 用法详见 JSON tokenizers。LLaDA-Image-Turbo4 步蒸馏版已转换的 transformer、文本编码器与预合并 connectors 位于fszontagh/LLaDA-Image-Turbo-GGUFllada-image-turbo-f16.gguftransformerllada-image-turbo-text_encoder-q8_0.gguf文本编码器文生图用llada-image-turbo-connectors.safetensors编辑用llada-image-turbo-connectors-edit.safetensors后者额外携带编辑所需的 SigVQ 编码器同一仓库还提供 transformer 与文本编码器的其他量化版本。VAE 取自原版仓库inclusionAI/LLaDA-Image-Turbo的vae/diffusion_pytorch_model.safetensors下文统一记作llada_vae.safetensors。LLaDA-Image50 步 base 版已转换权重位于fszontagh/LLaDA-Image-GGUFllada-image-f16.gguftransformerllada-image-text_encoder-q8_0.gguf文本编码器文生图用llada-image-connectors.safetensors编辑用llada-image-connectors-edit.safetensorsVAE 取自inclusionAI/LLaDA-Image与 Turbo 版是同一个文件。手动转换权重transformer 走--diffusion-model文本编码器走-m如果不想直接使用社区转换好的 GGUF也可以从官方 Safetensors 自行转换。关键点在于transformer 必须通过--diffusion-model传入使其张量名保留加载器期望的前缀文本编码器则通过-m传入./bin/sd-cli -M convert --diffusion-model transformer/diffusion_pytorch_model.safetensors.index.json \ -o llada-image-f16.gguf --type f16 ./bin/sd-cli -M convert -m text_encoder/model.safetensors.index.json \ -o llada-image-text_encoder-q8_0.gguf --type q8_0第一条命令把去噪主干转为 f16 精度的 GGUF第二条把文本编码器转为 q8_0 量化 GGUF这也是官方转换仓库默认提供的文本编码器量化精度。转换逻辑与sd_version_is_llada_image的分派一致加载时 transformer 前缀为model.diffusion_model文本编码器前缀为text_encoders.llm参见 src/pipeline/model_builders.cpp。构建 connectors 文件QueryFormer 文本投影 SigVQ 的合并脚本--embeddings-connectors只接受一个文件因此 QueryFormer、文本投影以及编辑时的SigVQ 编码器必须合并进单个 Safetensors 文件每个张量名以组件名作为前缀。省略sigvq即可跳过加载约 2.6 GB 的编码器纯文生图场景可以省掉这部分显存与加载时间from safetensors.torch import load_file, save_file merged {} for prefix, path in [ (queryformer, queryformer/diffusion_pytorch_model.safetensors), (text_projection, text_projection/diffusion_pytorch_model.safetensors), (sigvq, sigvq/diffusion_pytorch_model.safetensors), ]: for name, tensor in load_file(path).items(): merged[f{prefix}.{name}] tensor save_file(merged, llada_connectors.safetensors)从源码看这三个组件在 src/model/te/llada_image_te.hpp 中各自对应独立结构QueryFormerQueryFormerConfig256 个可学习查询num_queries256hidden 2048、单层、16 头、intermediate 8192把 LLaDA token embedding 转成 256 个查询后拼接到主干输入不使用 RoPEnorm 无参数。TextProjectionTextProjectionConfighidden 2048、intermediate 8960、6 层、32 头最终投影到projection_dim2560把主干隐藏态映射到去噪网络的 caption 维度。两者 MLP 均使用 tanh GELU 近似源码中ggml_gelu而非ggml_gelu_erf。SigVQSigVQConfig仅编辑用的 40 层 ViThidden 1536、patch 16输出对 16384 条目 codebook 做最近邻量化量化 id 经嵌入与投影后成为去噪网络消费的语义特征其 MLP 使用精确 erf GELUggml_gelu_erf与上述两者不同。文本到图像4 步 Turbo 推理示例文生图只需 transformer 文本编码器 tokenizer VAE 不含 SigVQ 的 connectors./bin/sd-cli \ --diffusion-model /path/to/llada-image-turbo-f16.gguf \ --llm /path/to/llada-image-turbo-text_encoder-q8_0.gguf \ --tokenizer /path/to/tokenizer.json \ --vae /path/to/llada_vae.safetensors \ --embeddings-connectors /path/to/llada-image-turbo-connectors.safetensors \ --prompt a lovely cat holding a sign says llada.cpp \ --width 1024 \ --height 1024 \ --steps 4 \ --cfg-scale 1.0 \ --seed 42 \ --output output.png命令要点--steps 4与--cfg-scale 1.0是 Turbo 版的标配prompt 模板化由系统自动处理直接写普通描述即可无需手工加模板。--llm指定文本编码器对应 CLI 参数--llm即本文档中的-m转换链路--embeddings-connectors指定合并后的连接组件。图像编辑引用图 指令描述编辑模式需要包含 SigVQ 权重的 edit 版 connectors并通过--ref-image传入参考图./bin/sd-cli \ --diffusion-model /path/to/llada-image-turbo-f16.gguf \ --llm /path/to/llada-image-turbo-text_encoder-q8_0.gguf \ --tokenizer /path/to/tokenizer.json \ --vae /path/to/llada_vae.safetensors \ --embeddings-connectors /path/to/llada-image-turbo-connectors-edit.safetensors \ --ref-image /path/to/input.png \ --prompt change the sign text to sd.cpp \ --width 1024 \ --height 1024 \ --steps 4 \ --cfg-scale 1.0 \ --diffusion-fa \ --output output.png编辑链路与共享参考图参数的完整说明见 edit.mdLLaDA-Image 默认使用llada_imagepreset。该 preset 的行为可在 src/pipeline/image.cpp 等处理路径中印证参考图在 VAE 编码前先 resize 到输出宽高SigVQ 采用双线性 resize 到输出分辨率的一半输入归一化到[-1, 1]CFG 时两个分支都保留 source latent但SigVQ 特征只进入 positive 分支negative 分支会把ref_images置空以丢弃 SigVQ 特征编辑必须使用包含 SigVQ 权重的 connectors。从源码层面看编辑实现走的是build_edit_graph/forward_editingsrc/model/diffusion/llada_image.hpp参考图与目标图组成一条联合序列携带两个 timestep——caption 与 source latent 为干净状态t 0第二份 caption 副本与目标 latent 为带噪状态adaLN 是 timestep embedding 的线性映射通过逐 token 喂入 embedding 即可精确选择调制方式无需复制调制投影。最终只去噪目标 latentsource 半边作为上下文输出前还要按参考实现把模型输出取负ggml_ext_scale(out, -1.f)。参数与注意事项steps、CFG、分辨率、显存与调度器步数与 CFGLLaDA-Image-Turbo使用--steps 4 --cfg-scale 1.0。guidance 已在蒸馏中去除更高的 CFG 不仅降质还会让文本编码器成本翻倍。50 步 base 模型使用--steps 50 --cfg-scale 5。分辨率约束宽高会被向上取整到 16 的倍数。编辑链路要求宽高可被32整除参考管线约束。50 步 base 模型建议在 1024x1024 下编辑在 512x512 下它几乎原样返回参考图而不应用指令LLaDA-Image-Turbo 在两个分辨率下都能正确编辑。显存与内存预算编辑时参考图与目标图在一条序列中运行同等分辨率下 token 数约为文生图的两倍。12 GB 显存下1024x1024 编辑必须加--diffusion-faflash attention否则扩散图放不下。权重合计约 16 GB但分段执行segmented execution会流式加载因此更小的内存预算也能跑512x512 下--max-vram 6相比无约束执行几乎零开销--max-vram 3仍可产生逐字节一致的输出耗时约为 2.5 倍。调度器--scheduler默认为llada_image复现参考实现的 Kumaraswamy sigma 网格。对应源码 src/runtime/denoiser.hpp 中的LLaDAImageScheduler参考管线在t linspace(0.001, 1, n 1)[:-1]上构造schedule (1 - (1 - t^1.17)^0.8)^1.1sigma 1 - schedule。通过--extra-sample-args uniform1可切换为普通均匀网格linspace(1, 0, n1)[:-1]预平移网格等价于sigmas[i] 1 - i/n。其他Prompt 模板化自动完成直接传普通描述即可。VQ 条件生成generation_modevq即文本编码器在扩散前解码图像 token未实现当前版本不支持该路径。结语LLaDA-Image 以 NextDiT LLaDA2-MoE 文本编码器 Flux.2 VAE 的组合在 stable-diffusion.cpp 中获得了完整的文生图与指令编辑能力。实操上只需抓住四条主线两个 checkpoint 各成体系、不可混用四件套权重按 transformer / 文本编码器 / VAE / connectors 分别装载编辑必须使用带 SigVQ 的 edit 版 connectors 并注意 32 对齐与--diffusion-faTurbo 版坚持 4 步 CFG 1.050 步版坚持 50 步 CFG 5。按本文命令逐条执行即可在 12 GB 乃至更低显存预算下完成从下载、转换到推理的完整闭环。赞分享人工智能大模型本地部署推理引擎媒体生成【免费下载链接】stable-diffusion.cppDiffusion model(SD,Flux,Wan,Qwen Image,Z-Image,...) inference in pure C/C项目地址https://gitcode.com/GitHub_Trending/st/stable-diffusion.cpp点击查看免费下载相关推荐stable-diffusion.cpp 实战指南Boogu Image 文生图与指令编辑全流程stable diffusion.cpp 实战指南Boogu Image 文生图与指令编辑全流程 Boogu Image 是基于流匹配Flow Matchi人工智能大模型本地部署推理引擎媒体生成Image Editing in stable-diffusion.cpp参考图像驱动的图像编辑完整指南Image Editing in stable diffusion.cpp参考图像驱动的图像编辑完整指南 stable diffusion.cpp 是一款纯人工智能大模型本地部署推理引擎媒体生成Stable Diffusion.cpp 实战指南从文本到图像、图像编辑到视频生成的完整流程Stable Diffusion.cpp 实战指南从文本到图像、图像编辑到视频生成的完整流程 Stable Diffusion.cpp 是一个用纯 C/C人工智能大模型本地部署推理引擎媒体生成上一篇龙芯2K0300 开发环境搭建7 步跑通 LoongArch 交叉编译的完整路线图下一篇如何快速上手 CacheLib从 clone 到跑通的完整指南创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
RELATED

相关推荐

昆明网站设计能实现什么功能?避开这5个注意事项才能留住人

昆明网站设计能实现什么功能?避开这5个注意事项才能留住人

昆明网站设计能实现什么功能?避开这5个注意事项才能留住人 网站做好了没人访问,这是很多昆明老板做官网时的噩梦。钱花了几万,页面看着挺漂亮,结果后台数据惨淡,连个咨询电话都没有。这时候你才意识到, 昆明网站设计能实现什么功能…

📅 2026/9/28 3:45:51
Yao SUI 前端 API 完整指南:组件查询、后端调用、渲染与 CUI 集成实战

Yao SUI 前端 API 完整指南:组件查询、后端调用、渲染与 CUI 集成实战

Agent 框架后端低代码RAG 【免费下载链接】yao ✨ All your agents and workspaces in one place, on every device you own. Track tasks on a board, accessible from desktop, mobile, browser, or API. Self-hosted. 项目地址: https://gitcode.com/gh_mirrors/…

📅 2026/9/28 3:40:50
2026最新:WordPress登录页面打不开?5招救急避坑指南

2026最新:WordPress登录页面打不开?5招救急避坑指南

2026最新:WordPress登录页面打不开?5招救急避坑指南 网站做好了没人访问,这是运营最头疼的事。但更惨的是,连后台都进不去,根本没法改内容。很多站长遇到 wordpress登录页面打不开…

📅 2026/9/28 3:40:50
MORE NEWS

更多资讯

📰

Python上位机开发实战:PyCharm+PyQt5工业级配置与避坑指南

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

📰

技术复盘:多智能体上下文压缩与KV缓存命中取舍,TaoToken统一Key配置实战

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

📰

WordPress MCP 实战:用 TaoToken 统一 Key 打通 AI 代理与向量数据库的 RAG 配置

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

📰

Appian 引入 MCP 协议并与 Snowflake 合作:为智能体提供强管控能力的配置与验证

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

📰

Cursor IDE Rules / Skills / Subagents 前端项目配置全指南:TaoToken 统一 Key 接入 settings.json 骨架

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

📰

OpenClaw 配 TaoToken:settings.json 骨架与报错排查

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

TODAY

今日更新

THIS WEEK

本周精选

THIS MONTH

本月热门

读完文章,想聊聊您的网站?

告诉我们您的行业与需求,资深顾问一对一梳理方案与报价,全程免费。

📞 💬