尧图网络 高端网站定制 · 原创设计
免费咨询热线
400-888-6620
免费获取方案
Florence-2 概括版
1. 核心目标与背景核心目标构建一个统一的视觉基础模型Vision Foundation Model通过统一的序列生成方式Sequence-to-Sequence同时解决不同粒度的视觉任务Image-level图像分类、图像描述CaptioningRegion-level目标检测、区域定位GroundingPixel-level像素级分割Segmentation现有模型的两大痛点Motivation训练数据不够全面现有模型如CLIP主要依赖 Image-Text Pair只能提供图像级全局语义缺少目标位置、区域描述和像素级语义如狗在哪Mask 是什么。模型任务不统一很多模型针对单一任务设计检测输出 Box分割输出 Mask描述输出 Text导致不同任务需要不同网络结构难以实现真正的“基础模型”。2. 核心创新一Florence Data Engine 与 FLD-5B 数据集要训练统一模型最大的瓶颈是缺少多粒度数据。论文通过Florence Data Engine自动构建了FLD-5B数据集。2.1 数据生成与迭代流程 (Data Engine)采用“群体智慧”不依赖单一模型而是使用多个现有的视觉专家模型Specialist Models协同生成初始数据再通过迭代优化Train - Predict - Filter - Refine清洗噪声。流程Web Images → 多专家模型协同标注 → Initial Annotations → 过滤与优化 → FLD-5B2.2 FLD-5B 数据规模与组成包含126M图像、5.4B视觉标注远超同类数据集的精细度。单张图片包含多粒度标注Text Annotation (全局)Image → CaptionRegion-Text Pair (区域)Image → Region (Box) → Text如[120,80,300,250]对应dogPhrase-Region Pair (细粒度)Text phrase → Specific RegionPixel-level (像素)Region → Segmentation Mask对比优势结合了 LAION 的“海量规模”与 COCO 的“多粒度精细标注”为模型学习全局到像素级语义提供了数据基础。3. 核心创新二统一序列生成模型架构Florence-2 摒弃了为不同任务设计不同 Head 的传统做法采用Vision Encoder Multimodal Encoder-Decoder架构将所有视觉任务转换为 Token 序列生成。3.1 整体架构Vision Encoder (DaViT)将图像切分为 Patch 并提取视觉特征Visual Tokens。Multimodal Encoder (BART-like)融合视觉特征Visual Tokens与任务指令文本Text Tokens。Decoder (BART-like)统一进行自回归Autoregressive生成输出 Text / Box / Mask Tokens。为什么用 Encoder-Decoder 而不是 Decoder-only LLM视觉任务天然包含“输入Image Instruction→ 输出Structured Prediction”的属性Encoder-Decoder 更适合这种视觉到结构化数据的转换。3.2 任务统一与特殊 Token 设计非文本输出坐标、Mask无法直接用语言表达Florence-2 设计了特殊 Token位置 (Location)将连续坐标离散化。如[100, 200, 300, 400]转换为loc_100 loc_200 loc_300 loc_400。回归问题变成了词汇表上的分类问题。分割 (Segmentation)使用seg mask tokens /seg表示。统一任务范式举例Image Prompt → Token GenerationCaptionimage What is in this image?→A dog running in the parkDetectionimage Detect objects→dog loc_100 loc_200 loc_300 loc_400Segmentationimage Segment dog→dog seg mask tokens /seg4. 训练策略本质是多任务自回归语言模型损失Autoregressive Language Modeling Loss。多任务混合训练同一个 Batch 内混合 Caption、Detection、Grounding、Segmentation 的数据共享一套模型参数计算相同的 Token Prediction Loss。这使得不同任务能互相促进如检测的空间能力辅助分割。两阶段训练预训练 (Pre-training)使用 FLD-5B 学习通用视觉、空间定位、图文对齐能力。微调 (Fine-tuning)在下游特定 Benchmark 数据上进一步优化。模型规模Florence-2-base (232M), Florence-2-large (771M)。证明了通过高质量多粒度数据和统一架构小模型也能具备强大的视觉基础能力对比 Flamingo 80B。5. 总结与多模态模型演进对比核心三大突破数据基础FLD-5B 解决了多粒度Image/Region/Pixel统一标注的缺失。统一架构抛弃独立检测/分割 Head用 Encoder-Decoder 完成统一建模。生成范式创新性地用loc和segTokens 将坐标和掩码转化为序列生成问题。多模态发展路线对比模型核心贡献与特点输出形式CLIP(2021)4亿图文对齐奠定多模态基础相似度/分类BLIP系列(2022-23)统一视觉语言预训练通过 Q-Former 桥接冻结的 LLM 与视觉模型Text (图像描述/问答)LLaVA / Qwen-VL(2023)视觉指令微调侧重多模态对话和复杂问答推理Text (长文本回答)Florence-2(2024)端到端训练统一视觉基础任务重基础视觉能力而非长篇对话Text, Boxloc, Maskseg一句话总结Florence-2 的最大价值不在于提出了新的大语言模型而是通过FLD-5B 多粒度数据集 特殊 Token 编码成功将传统计算机视觉的“分类、检测、分割”三大独立任务完美统一到了自然语言处理的“序列生成”框架下。
RELATED

相关推荐

实时语音驱动NPC+AI剧情分支引擎:Epic官方认证的AI辅助开发框架首次开源解析

实时语音驱动NPC+AI剧情分支引擎:Epic官方认证的AI辅助开发框架首次开源解析

更多请点击: https://kaifayun.com 第一章:实时语音驱动NPCAI剧情分支引擎:Epic官方认证的AI辅助开发框架首次开源解析 Epic Games 于2024年Q2正式开源了其内部孵化的AI辅助游戏开发框架—— NarrativeSynth Engine,该框架获Epic…

📅 2026/9/9 18:38:32
目标模糊、资源泛滥、进度失控,AI学习计划制定失败的3大隐形陷阱及救急方案

目标模糊、资源泛滥、进度失控,AI学习计划制定失败的3大隐形陷阱及救急方案

更多请点击: https://codechina.net 第一章:目标模糊、资源泛滥、进度失控,AI学习计划制定失败的3大隐形陷阱及救急方案 目标模糊:学得越勤,离真实能力越远 当学习目标停留在“学会AI”或“搞懂大模型”这类宽泛表述…

📅 2026/9/18 16:34:37
重庆化龙桥老旧小区改造,怎么搞定夜景照明“不扰居”又能省成本?

重庆化龙桥老旧小区改造,怎么搞定夜景照明“不扰居”又能省成本?

重庆化龙桥靠着嘉陵江,老小区多,最近几年城市更新做的勤,不少住户都反映过小区夜景亮了是好事,可有的灯太晃眼,半夜拉着窗帘都透光,睡不好觉。还有物业算账,这灯开一整晚,公摊电费蹭…

📅 2026/8/2 3:02:24
MORE NEWS

更多资讯

📰

华为手机锁屏密码遗忘不清除数据的官方解决方案

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

📰

nRF54LC10A休眠50nA实测:Cortex-M33与RISC-V混合架构开发指南

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

📰

STM32+A4988驱动42步进电机实战指南

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

📰

Eclipse SVN插件site-1.8.22离线安装与避坑指南

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

📰

区块链应用操作员实操考试全攻略:从节点部署到合约调用

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

📰

LSTM时间序列预测实战:从数据窗口构造到模型调参避坑

简介:这份资源面向高校学生与Python初学者,提供一套可直接运行的LSTM时间序列预测完整项目,适用于期末大作业、课程设计及入门级深度学习实践。项目以空气质量等真实数据为样本,覆盖数据预处理、模型搭建、训练与预测全流程&#…

TODAY

今日更新

THIS WEEK

本周精选

THIS MONTH

本月热门

读完文章,想聊聊您的网站?

告诉我们您的行业与需求,资深顾问一对一梳理方案与报价,全程免费。

📞 💬