
EGM-4B-SFT开发者指南自定义训练与模型微调的最佳实践【免费下载链接】EGM-4B-SFT项目地址: https://ai.gitcode.com/hf_mirrors/nvidia/EGM-4B-SFTEGM-4B-SFT是NVIDIA推出的高效视觉 grounding 语言模型Efficient Visual Grounding Language Models训练 pipeline 第一阶段的监督微调SFT checkpoint基于Qwen3-VL-4B-Thinking构建专为开发者提供自定义训练与模型微调的最佳实践方案。模型核心功能与优势强大的视觉语言能力作为一款多模态模型EGM-4B-SFT具备出色的视觉 grounding 能力能够将文本描述与图像内容精准对应。其采用Qwen3VLForConditionalGeneration架构融合了文本和视觉模态的信息处理为复杂的视觉语言任务提供了强有力的支持。专为进一步训练设计该模型是一个中间 checkpoint主要用于后续的强化学习训练。通过在SFT阶段学习结构化的视觉 grounding 与显式推理为RL阶段GRPO提供了理想的初始化最终可得到性能更优的EGM-4B模型。模型架构详解组件详细信息架构Qwen3VLForConditionalGeneration精度bfloat16文本隐藏层大小2560文本层数36注意力头数328个KV头文本中间层大小9728视觉隐藏层大小1024视觉层数24patch 大小16 x 16最大位置嵌入262,144词汇表大小151,936快速开始模型下载与准备要开始使用EGM-4B-SFT进行自定义训练和微调首先需要下载模型。执行以下命令pip install -U huggingface_hub huggingface-cli download nvidia/EGM-4B-SFT --local-dir ./models/EGM-4B-SFT自定义训练与微调最佳实践SFT阶段训练要点在SFT阶段一个专有VLM为视觉 grounding 训练数据生成详细的思维链推理步骤。然后基于Qwen3-VL-4B-Thinking的基础模型在这些推理增强数据上进行微调以学习具有显式推理的结构化视觉 grounding。RL训练流程下载模型后可按照EGM仓库中的安装和RL训练说明进行操作。SFT checkpoint 作为后续RL阶段GRPO的初始化通过强化学习进一步提升模型性能最终得到EGM-4B模型。相关模型资源模型描述nvidia/EGM-4B最终RL训练模型最佳性能nvidia/EGM-8B-SFT8B变体的SFT checkpointnvidia/EGM-8B最终RL训练的8B模型引用与致谢如果在研究中使用了EGM-4B-SFT请引用以下论文article{zhan2026EGM, author {Zhan, Guanqi and Li, Changye and Liu, Zhijian and Lu, Yao and Wu, Yi and Han, Song and Zhu, Ligeng}, title {EGM: Efficient Visual Grounding Language Models}, booktitle {arXiv}, year {2026} }本仓库得益于Qwen3-VL、InternVL、verl和verl-internvl等项目。【免费下载链接】EGM-4B-SFT项目地址: https://ai.gitcode.com/hf_mirrors/nvidia/EGM-4B-SFT创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考