尧图网络 高端网站定制 · 原创设计
免费咨询热线
400-888-6620
免费获取方案
四十万美元、两亿张图:华为联合六校训出2K模型 Boogu-Image-0.1,比肩闭源
近日华为香港莱布尼茨研究所小艺团队与港大、港科大、港中文等 6 校联合发布了 Boogu-Image-0.1。训练一个顶级文生图模型到底需要多少钱Qwen-Image、HunyuanImage 这些优秀的开源模型预训练动辄用掉数十亿张图像而 GPT-Image-2、Nano-Banana-Pro 等闭源系统虽然效果惊艳其内部实践却始终不对外公开。对于绝大多数研究机构来说这条赛道的入场券太贵了。近日华为香港莱布尼茨研究所小艺团队与港大、港科大、港中文等 6 校联合发布了 Boogu-Image-0.1—— 一个仅用 2.08 亿张独立图像、理论训练成本约 40 万美元就在多个基准上做到开源第一、逼近闭源水平的统一多模态模型家族。模型权重、代码与训练配方已全部以 Apache 2.0 协议开源。Boogu 系列模型是最早支持原生 2K 的开源模型之一并支持华为昇腾 Ascend NPUvLLM-Omni 框架等 ModelScope 和 ComfyUI 均已上线。论文标题Boogu-Image-0.1: Boosting Open Agentic Multimodal Generation via Understanding under a Minimal BudgetarXiv 论文地址https://arxiv.org/abs/2607.13125HuggingFace 论文地址https://huggingface.co/papers/2607.13125代码仓库https://github.com/Boogu-Project/Boogu-Image在线试用https://boogu.org/从「文生图」到「需求生图」Boogu 团队的核心判断是图像生成正在从 Text-to-Image 走向 Requirement-to-Image。用户早已不满足于给一句描述性 prompt—— 他们希望模型能理解复杂意图、隐含约束、多层指令甚至跨模态上下文。而现实需求又极度多样有的只想快速出图有的需要精细排版的海报。单一模型配置很难同时服务好所有场景。因此Boogu 把「理解」提升为与数据质量、训练配方同等重要的一等公民并将其拆解到系统的每一个环节更强的指令编码器。团队把文本编码器类比为文生图模型的「传感器」它决定了整个系统能获得的信息上限。系统性实验证实冻结编码器的规模从 1.7B 扩到 14B生成质量单调提升且未见饱和。最终 Boogu 选用 Qwen3-VL-8B在能力与开源社区可部署性之间取得平衡。Agentic 提示重写做「翻译官」不做「加戏者」。论文提出一个常被忽视的设计原则 —— 重写器应以恒等变换为下界当用户 prompt 已经清晰完整时就原样保留只在意图模糊时才介入。实验显示重写模型越强收益越大0.8B 到 397B 呈近似对数线性提升且在计数、推理、场景文字等维度上能力定向的重写技能带来数倍优势。模型路由让合适的模型干合适的活。Turbo 与 Base 在很多简单请求上输出几乎无差异推理成本却相差 50 倍。Boogu 用 Agent 估计请求难度并动态分发把重型模型留给真正复杂的任务。在 Boogu 自建的 Arena 盲测中与公开 LMArena 排名的 Spearman 相关系数达 1.0, Pearson 相关系数 0.986Boogu-Image-0.1-Turbo-Thinking 以 1048 的 Elo 位列开源第一仅次于 GPT-Image-2 和 Nano-Banana-Pro。在新发布的 Qwen-Image-Bench 上其 Base-Thinking 变体在中英文双语下均取得开源模型最佳总分编辑模型 Boogu-Image-0.1-Edit-Thinking 更是在 ImgEdit-Bench 上拿下全场最高的 4.64 分。敢说真话的技术报告这份 71 页的技术报告有意思的地方不只是结果还有大量业内「靠试错才能学到」却很少被写进论文的细节。公开基准正在失效。团队用 6 个近期模型对比了 LMArena 人类偏好排名与 GenEval、DPG-Bench 分数发现明显的排名倒挂人类偏好最强的 GPT-Image-2 在两个学术基准上只排中游。团队直接宣布不再把这些基准作为主要评估并呼吁社区重新审视其适用性 —— 甚至坦率指出自家模型在 ImgEdit-Bench 上分数虽高但人评中仍不如 Nano-Banana-Pro。「“足够” 的数据」是不够的但结构化的数据可以很省。团队用 1.87 亿开源数据训练的模型明显撞上性能天花板而利用少量按人类先验组织的「Boogu Syllabus」教学大纲式数据仅 2162 万独立样本进行后训练反而能全面提升性能。原则很朴素系统性细粒度拆解、能力全覆盖、每个类别数据量充足 ——「如果模型训练时没见过猫就默认它画不出猫」—— 数据的精细的 “质” 大于朴素地堆砌 “量”。几个可复用的量化结论。一个汉字要被稳定渲染训练中至少需要约 300 次曝光覆盖 3500 个现代常用字即可满足日常中文渲染需求。让模型记住一个从未见过的人物身份需要约 4500 次语言匹配的曝光 —— 团队用一位志愿者也是论文作者之一的 170 张日常照片做了完整消融。不要盲目过滤「坏数据」。水印、过曝、运动模糊的图片不必丢弃 —— 只要在 caption 里明确详细地描述缺陷它们反而能让模型学会理解并可控地规避或复现这些视觉元素。慎用 RL。重度美学 RL 会让输出分布坍缩让模型画「一位六十岁的中国女性」重 RL 模型倾向输出精致妆容的理想化形象。Boogu 选择把人类偏好放进理解系统而非烙进生成器只在肢体结构、文字渲染等不损害多样性的问题上使用 RL。此外作为最早的原生 2K 训练的开源模型之一团队发现标准的动态时间偏移策略在 2K 分辨率会产生「过度挤压」效应导致收敛变慢并给出了简单有效的截断修正方案附录还提出了免训练的推理增强方法 BOGBoosted Orthogonal Guidance把 DiT 预测视为二维矩阵做结构化归一化强化垂直于 flow 流场的信息一定程度提升照片摄影艺术质感。写在最后Boogu-Image-0.1 当然有局限世界知识仍落后于头部闭源系统文字渲染只优化了中英双语复杂多人交互场景仍会出现肢体畸变。但在 40 万美元的预算约束下它给出了一条可复现、可验证的路径 —— 并把过去藏在工业团队内部的工程经验摊开在了论文里。正如团队在结语中所说希望 Boogu-Image-0.1 让图像生成向「真正理解用户想要什么」的系统迈进一步。团队介绍Boogu 团队来自华为香港小艺大模型应用实验室莱布尼茨所联合香港大学、香港科技大学、香港理工大学、香港城市大学、香港中文大学与南京大学共同完成。项目负责人为 Chenyang Lei通讯作者包括 Chenyang Lei、Rui Liu 与 Chao Huang。团队致力于以理解驱动的统一智能体多模态生成研究模型、代码与训练配方均以 Apache 2.0 协议开源。
RELATED

相关推荐

STM32 HAL库I2C通信实战:从协议原理到AT24C02读写避坑指南

STM32 HAL库I2C通信实战:从协议原理到AT24C02读写避坑指南

1. 项目概述:从零到一掌握STM32 HAL库的I2C通信如果你正在用STM32做项目,尤其是需要连接传感器、EEPROM或者OLED屏这类外设,I2C总线几乎是一个绕不开的话题。但很多朋友,包括我刚开始接触时,都会觉得STM32的HAL库I2C用…

📅 2026/9/24 11:43:20
GPT-5.6重磅升级:Sol、Terra、Luna三大模型,解锁AI使用新境界!

GPT-5.6重磅升级:Sol、Terra、Luna三大模型,解锁AI使用新境界!

GPT-5.6带来了三个新的模型名称:Sol、Terra和Luna。 对于很多用户来说,看到这三个名字时,第一反应可能是:它们到底有什么区别?是不是只是换了几个名字? 实际上,这三个模型能力的侧重点各不相同。…

📅 2026/9/24 11:43:26
AI论文工具评测:10大平台提升本科生论文写作效率

AI论文工具评测:10大平台提升本科生论文写作效率

1. 本科生写论文的痛点与AI工具的价值 写毕业论文是每个本科生都要经历的一道坎。记得我大四那年,光是确定选题就折腾了半个月,查文献、找数据、分析结果更是让人头大。现在回想起来,如果当时有这些AI论文工具辅助,至少能省下三分…

📅 2026/8/22 16:57:36
MORE NEWS

更多资讯

📰

离线语音AI芯片如何重塑IoT家居智能体验

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

📰

10kV高压开关柜安装实操指南:5个必须补全的细节与3类环境变量

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

📰

沉浸式互动成主流,VR CS如何重塑线下游乐场馆体验

当下线下实体游乐行业,消费需求正在发生潜移默化的转变。过去依靠传统设备、观光打卡的经营模式,已经很难持续打动新一代消费群体。无论是商业综合体潮玩馆、城市主题乐园,还是文旅配套体验场馆,都在面临同一个经营难题&#xff1…

📰

云原生是什么?从容器到Kubernetes的架构演进与落地实践

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

📰

Android挂后台原理:音频焦点、Surface绑定与前台Service

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

📰

瑞萨RA8开发避坑指南:FSP架构、时钟树与DMA真相

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

TODAY

今日更新

THIS WEEK

本周精选

THIS MONTH

本月热门

读完文章,想聊聊您的网站?

告诉我们您的行业与需求,资深顾问一对一梳理方案与报价,全程免费。

📞 💬