
一、论文基本信息论文题目Show and Tell: A Neural Image Caption Generator作者Oriol Vinyals、Alexander Toshev、Samy Bengio、Dumitru Erhan发表会议CVPR 2015模型名称NICNeural Image Caption研究方向图像描述生成、视觉—语言学习、条件语言模型核心架构CNN视觉编码器LSTM语言解码器这篇论文将机器翻译中的编码器—解码器思想迁移到图像描述任务CNN负责把图像编码为固定长度的视觉表示LSTM根据这个视觉表示逐词生成自然语言句子。模型不再依赖对象检测、人工模板和语言规则而是直接最大化“给定图像时正确描述出现的概率”。(arXiv)Show and Tell并不是最早使用神经网络生成图像描述的工作但它以非常清晰的CNN—RNN结构建立了后来图像描述模型的经典范式图像编码器负责“看”语言解码器负责“说”。二、图像描述为什么比图像分类更难传统图像分类通常只需要预测图像中最主要的类别例如狗汽车飞机餐桌。图像描述则需要输出一句结构完整、语义合理的自然语言。模型不仅要识别图像中的对象还需要理解对象具有什么属性对象之间有什么关系人物正在执行什么动作哪些内容是图像中的主要信息如何按照正确的语法组织句子。例如一张图片不能只被识别为“dog”和“frisbee”模型还需要生成A dog is catching a frisbee in a field.这里包含了对象、动作、关系、场景和语言表达多个层次。因此图像描述同时涉及计算机视觉和自然语言生成。(arXiv)三、传统图像描述方法有什么问题在神经图像描述模型出现以前许多方法采用分阶段流水线检测图像中的对象识别对象属性推断对象之间的关系将识别结果填入人工模板使用规则生成句子。例如模型可能首先识别出主体person动作riding客体horse然后套用模板A person is riding a horse.这种方法的优点是容易控制但也存在明显局限每一个视觉概念都需要单独设计检测器句子结构依赖人工模板难以生成训练规则之外的新表达检测、关系推断和语言生成相互分离前面环节的错误会不断向后传播很难用统一目标优化整个系统。论文希望构建一个统一概率模型直接学习从图像到句子的映射而不是手工拼接多个子系统。(arXiv)四、论文的核心灵感把图像描述看成机器翻译Show and Tell最重要的思想是把图像描述重新解释为一种“翻译”任务。传统神经机器翻译的输入和输出分别是输入一种语言的句子输出另一种语言的句子。编码器首先将源语言句子压缩为固定长度表示解码器再根据该表示生成目标语言句子。Show and Tell认为图像描述也可以采用相同框架只需将源语言编码器替换成图像编码器机器翻译图像描述源语言句子输入图像RNN编码器CNN编码器固定长度语义向量固定长度视觉向量RNN解码器LSTM解码器目标语言句子图像描述因此一张图像可以被理解为一种特殊的“源语言”模型的任务是把视觉内容翻译成自然语言。论文将这种模型称为NIC即Neural Image Caption。(arXiv)五、一句话理解Show and TellShow and Tell的核心可以概括为使用CNN把图像压缩成视觉向量再将该向量输入LSTM使LSTM像条件语言模型一样逐词生成图像描述。传统分类模型学习图像-------------------------类别Show and Tell学习图像----------------------单词序列输出不再是一个固定类别而是长度可变的自然语言句子。六、模型的整体结构Show and Tell由两个主要模块组成1. CNN视觉编码器CNN接收原始图像提取高层视觉表示。2. LSTM语言解码器LSTM接收图像表示以及此前已经出现的单词预测下一个单词。完整生成过程为输入图像 → CNN视觉特征 → LSTM → 第一个单词 → 第二个单词 → …… → 结束标记例如模型看到一张狗接飞盘的图片后可能依次生成时间步输入信息预测结果图像阶段CNN图像向量初始化视觉上下文第1步开始标记A第2步Adog第3步dogis第4步iscatching第5步catchinga第6步afrisbee第7步frisbee结束标记CNN和LSTM共同构成一个可以使用随机梯度下降训练的神经网络系统。(arXiv)七、模型的训练目标设输入图像为 I对应的描述句子为其中表示句子中的第 t 个单词。模型参数记为。Show and Tell希望找到一组参数使所有训练图像对应正确描述的概率最大这里的表示给定图像 (I) 时生成完整句子 (S) 的概率。由于句子由多个单词组成可以使用概率链式法则将整句概率拆解为多个逐词预测概率也就是说模型每一步都解决一个更简单的问题已知图像和此前所有正确单词下一个单词应该是什么这使可变长度句子的概率建模转化为一系列词分类问题。(arXiv)八、训练损失如何理解最大化正确句子的对数概率等价于最小化负对数似然其中表示第 t 个单词之前的所有真实单词。假设正确描述为A dog is running.当模型预测“dog”时它已经知道输入图像前一个真实单词“A”。如果模型为正确单词“dog”分配较高概率损失较小如果把大部分概率分配给“cat”或“car”损失就会增大。训练完成后模型学习到两类知识图像中通常包含什么视觉内容自然语言中的单词应该按照什么顺序出现。九、CNN编码器负责什么CNN负责将图像转换成固定长度视觉向量这个视觉向量应该概括图像中的高层信息例如有哪些主要对象对象具有什么属性场景属于室内还是室外人物可能在做什么对象之间可能存在什么关系。论文采用预训练图像分类CNN作为视觉部分并使用分类器之前的高层特征连接到语言模型。这样可以利用大规模图像分类数据预先学到的视觉知识再在图像描述数据上进行适配。(arXiv)这里体现了迁移学习思想CNN不必从有限的图像描述数据中重新学习所有视觉概念而是可以先在更大的分类数据集上学习视觉表征。十、为什么不能直接使用CNN的类别预测结果一种较简单的思路是先让CNN输出对象标签再让语言模型根据标签生成句子。例如CNN输出dogfrisbeegrass。语言模型再将其组织成描述。但Show and Tell并没有把离散类别预测作为唯一视觉输入而是使用CNN的连续高层特征。这样做有几个优势连续特征比单一类别标签包含更多信息模型可以保留对象属性、场景和整体结构视觉特征不受固定类别词表严格限制LSTM可以自行学习哪些视觉模式与哪些语言表达相关CNN与语言模型能够通过同一个生成目标进行联合适配。因此图像编码器输出的不是一句话所需的最终符号而是一种可以被语言模型解释的视觉语义表示。十一、为什么使用LSTM而不是普通RNN普通RNN通过隐藏状态保存之前的语言信息其中是当前输入是此前信息的压缩表示是更新后的隐藏状态。但是普通RNN在处理较长序列时容易受到梯度消失或梯度爆炸影响难以长期保存早期信息。Show and Tell因此使用LSTM作为语言解码器。LSTM通过记忆单元和门控机制控制信息的写入、保留与输出。(arXiv)十二、LSTM内部是如何工作的Show and Tell使用的LSTM包含三个主要门输入门遗忘门输出门。1. 输入门输入门决定当前输入中的多少信息应该写入记忆单元2. 遗忘门遗忘门决定此前记忆中的哪些信息应该保留3. 输出门输出门决定当前记忆中哪些信息用于预测单词4. 记忆状态更新新的记忆状态由两部分组成经过遗忘门保留下来的旧信息经过输入门写入的新信息。其中表示逐元素乘法为Sigmoid函数(h) 通常表示双曲正切非线性函数。门控结构让LSTM能够更加稳定地学习较长的语言依赖关系。(arXiv)十三、图像和单词是怎样输入LSTM的在模型展开后图像首先经过CNN得到视觉向量。该向量经过映射后作为序列开始前的特殊输入送入LSTM。随后描述中的单词被映射为词向量并按照顺序逐个输入LSTM。可以将输入过程表示为图像并没有被当作普通单词而是作为生成序列之前的视觉条件。随后LSTM在这个视觉上下文中生成句子。论文中的所有时间步共享同一组LSTM参数。(arXiv)十四、为什么图像只需要输入一次Show and Tell并没有在每个时间步都重新输入整张图像而是先用图像建立初始视觉上下文再逐词生成描述。这一设计可以理解为CNN先告诉LSTM“你看到了什么”LSTM再依靠记忆状态完成后续语言组织。它的优势是结构简单、计算开销较低而且与经典序列到序列机器翻译形式一致。但这也成为模型后来的一个重要局限随着句子变长最初注入的视觉信息可能逐渐减弱语言模型越来越依赖自身的语言统计。这一问题后来直接推动了视觉注意力机制的发展。十五、训练阶段如何逐词学习训练时模型在预测第 (t) 个单词时会接收真实的前一个单词而不是自己刚刚预测的单词。假设参考描述为A man is riding a bicycle.训练过程如下当前条件预测目标图像开始标记A图像语境Aman图像语境A manis图像语境A man isriding图像语境A man is ridinga图像语境A man is riding abicycle完整句子结束标记这种训练方式使每个时间步都能基于正确历史学习下一个词。按照现代术语这通常被称为Teacher Forcing。论文通过随机梯度下降优化整句的对数似然并允许误差从语言部分反向传播到视觉部分从而适配图像描述任务。(arXiv)十六、测试阶段与训练阶段有什么不同测试时没有真实描述可供模型参考因此模型必须使用自己此前生成的单词继续预测。生成过程为CNN提取图像特征将视觉特征输入LSTM输入开始标记预测第一个单词将预测结果作为下一步输入重复生成直到输出结束标记或达到最大长度。这会带来一个问题如果模型早期生成了错误单词后续预测就会建立在错误历史上。因此测试阶段不能简单地在每一步独立选择最高概率单词还需要寻找整体概率较高的句子。十七、贪心搜索、随机采样和束搜索论文讨论了两种主要生成方式随机采样和束搜索。1. 随机采样每个时间步根据模型输出的概率分布随机选择单词。这种方式能够生成多样化句子但可能选择低概率词导致句子质量不稳定。2. 贪心搜索每一步都选择当前概率最高的单词这种方式速度快但局部最优不一定形成全局最优句子。例如某个第一词当前概率最高但选择它之后的所有完整句子概率可能都较低。3. 束搜索束搜索在每个时间步同时保留概率最高的 (K) 条候选序列再分别扩展这些序列。论文主要实验采用beam size为20。相较束宽为1的贪心搜索束搜索平均能够提升约2个BLEU点。(arXiv)十八、如何计算一条候选句子的概率假设候选句子为其条件概率可以写为实际计算通常使用对数概率避免多个小概率连续相乘导致数值下溢束搜索保留累计对数概率较高的候选句子最终选择整体得分最高的完整描述。十九、实验数据集论文在五类图像描述数据上进行实验PASCALFlickr8KFlickr30KSBUMS COCO。Flickr8K、Flickr30K和MS COCO包含人工撰写的图像描述SBU的数据规模较大但文本主要来源于互联网用户标题因此噪声更强。PASCAL没有对应的官方训练集论文主要使用在MS COCO上训练的模型进行迁移测试。(arXiv)这些数据集允许作者研究几个问题数据量增加是否提高生成能力不同数据集之间能否迁移弱标注互联网数据是否有效模型是否能够生成训练集中没有出现过的新描述。二十、图像描述如何评价论文主要使用以下评价方式。1. BLEUBLEU比较生成句子和人工参考句子之间的n-gram重合程度。BLEU-1主要考察单词是否重合BLEU-4进一步检查连续四个词的短语是否一致。一般来说BLEU-1更偏向内容词覆盖BLEU-4对语序和局部句法要求更高。2. METEORMETEOR除了精确匹配还会在一定程度上考虑词形和召回情况。3. CIDErCIDEr根据多个参考描述之间的共识评价生成结果更强调与人类普遍描述内容的一致性。4. 人工评价论文还邀请人工标注者从1到4分评价句子是否准确描述图像是否存在轻微错误是否仅与图像部分相关是否与图像无关。论文发现自动指标虽然有一定参考价值但不能完全反映人与模型生成描述之间的质量差距。(arXiv)二十一、主要实验结果1. MS COCO开发集结果方法BLEU-4METEORCIDEr随机描述4.69.05.1最近邻检索9.915.736.5NIC27.723.785.5人类描述对比21.725.285.4NIC在MS COCO开发集上取得27.7的BLEU-4、23.7的METEOR和85.5的CIDEr在官方测试集上论文报告的BLEU-4为27.2。(arXiv)这里需要谨慎理解“NIC的BLEU-4高于人类”这一结果。这并不代表模型描述质量超过人类。人类分数的计算方式是把一条人工描述当作候选与其余人工描述比较而模型拥有更多参考句子。更重要的是论文的人工评价显示模型生成结果仍明显差于真实人工描述。这恰好说明BLEU不能完整衡量语义正确性、自然程度和描述价值。(arXiv)2. 不同数据集上的BLEU-1方法PASCAL迁移Flickr30KFlickr8KSBU先前代表性结果25565819NIC59666328人类696870—Show and Tell在PASCAL上的BLEU-1达到59而此前结果约为25在Flickr30K上由56提高到66在SBU上由19提高到28。论文同时指出PASCAL和SBU上的较大提升一部分也来自更强的深度CNN视觉特征而不能全部归因于语言生成结构。(arXiv)二十二、数据规模带来了什么影响Flickr30K和Flickr8K的标注风格比较接近而Flickr30K的训练数据大约更多。论文发现在Flickr30K上训练后结果相比Flickr8K大约提高4个BLEU点说明端到端生成模型对数据规模非常敏感。(arXiv)MS COCO数据规模更大但当MS COCO模型直接迁移到Flickr数据时结果没有简单按照规模继续提高。原因在于不同数据集的采集方式、词汇分布和描述风格存在差异。论文由此说明数据数量重要数据分布是否匹配同样重要。例如MS COCO描述往往围绕日常场景中的主要对象和动作而互联网标题可能包含人名、地点、情绪和无法从图像直接判断的信息。二十三、弱标注数据为什么更困难SBU使用网络图片及其用户标题。相比专门为图片撰写的描述这些标题可能包含拍摄时间地点名称人物姓名主观感受与图像内容弱相关的信息拼写或语法错误。因此SBU虽然数据量更大但文本噪声和词表规模也更大。论文发现直接将在MS COCO上训练的模型用于SBU时BLEU-1会从28降到16表明不同描述分布之间存在明显域偏移。(arXiv)这一发现对现代互联网图文预训练仍然很重要更大的弱标注数据不一定直接优于较小但高质量的数据。二十四、模型是在生成句子还是在记忆句子这是论文专门分析的一个问题。当使用束搜索返回最佳结果时大约80%的最高分描述可以在训练集中找到完全相同的句子。说明模型在很大程度上学会了复用训练集中的高频句式。(arXiv)例如训练集中可能大量存在A man is riding a skateboard.A man is riding a horse.A man is riding a bicycle.模型学习到“A man is riding a …”这一高频结构后只需根据图像替换最后的对象。不过当考察束搜索返回的前15条候选句子时大约一半的样本中可以找到训练集未出现过的新描述而且这些新描述仍保持相近的BLEU水平。说明模型不仅能够记忆完整句子也具备一定的短语重组和组合生成能力。(arXiv)二十五、生成多样性是怎样体现的对于同一张飞盘图片模型可能产生A man throwing a frisbee in a park.A man holding a frisbee in his hand.A man standing in the grass with a frisbee.对于一张三明治图片模型可能产生A close up of a sandwich on a plate.A close up of a plate of food with french fries.A white plate topped with a cut in half sandwich.这些候选句子关注的是同一图像的不同方面。论文认为条件语言模型不仅学习一个确定映射而是学习了图像条件下的句子概率分布因此可以生成多个合理候选。(arXiv)但多样性与准确性之间存在权衡保留更多候选可以获得更多表达方式过度采样可能引入与图像不符的内容总选择最高概率句子又容易生成保守、高频和模板化描述。二十六、词嵌入学到了什么LSTM并不直接使用单词的One-Hot向量而是将每个单词映射为低维连续词向量。论文发现联合训练后的词嵌入能够形成一定语义结构。例如horse与pony、donkey接近car与vehicle类词语接近相似动作和对象也会形成邻近关系。这种表示对视觉学习也有帮助如果“horse”“pony”和“donkey”的语言表示接近那么模型会倾向于为这些外观相关对象学习共享视觉特征。(arXiv)这里体现了一种视觉与语言之间的相互作用CNN帮助LSTM识别视觉内容语言空间中的语义关系也反过来影响CNN应该提取什么特征。二十七、图文检索实验说明了什么虽然Show and Tell的主要目标是生成描述但由于模型能够计算一句话在给定图像下的概率它也可以用于给图像排序候选描述给描述排序候选图像。在Flickr8K上NIC的图像到文本Recall1为20文本到图像Recall1为19在Flickr30K上两项Recall1均为17。它并没有专门使用排序损失但仍取得了有竞争力的检索结果。(arXiv)这说明条件生成概率在一定程度上也能衡量图文匹配程度。不过与专门的双向嵌入模型相比生成模型的概率可能受到句子长度、词频和语言流畅度影响因此并不是天然最优的检索评分函数。二十八、论文的核心贡献1. 建立了经典CNN—LSTM编码器—解码器框架Show and Tell把图像描述统一为这一结构简洁、清晰并成为早期图像描述研究中最具代表性的基线框架之一。2. 将图像描述变成端到端条件序列生成问题模型不再分别优化对象识别关系识别句法分析模板选择。而是直接优化$$p(S\mid I)$$这使整个任务能够在统一概率目标下训练。3. 将机器翻译方法成功迁移到视觉语言任务论文并没有为图像描述设计大量特殊规则而是借用了神经机器翻译中的编码器—解码器思想。这说明序列生成框架不仅适用于语言到语言也可以适用于图像到文本视频到文本音频到文本结构化数据到文本。4. 展示了视觉预训练和语言生成的组合价值CNN可以在大规模图像分类数据上预训练语言生成部分则在图像—描述对上训练。不同来源的视觉知识和语言监督可以通过统一模型连接起来。(arXiv)5. 支持开放式句子生成输出不再局限于固定模板或有限类别而是可以根据词表生成长度可变的自然语言。即使生成内容仍受到训练数据限制它已经从“选择已有句子”转向了真正的序列概率建模。二十九、这篇论文最重要的思想是什么Show and Tell最重要的并不是某一个LSTM公式而是任务建模方式的改变。过去的图像描述方法通常认为必须先完全识别图像中的对象、属性和关系再把结果转化成句子。Show and Tell则认为只要有足够的图像—句子对就可以直接学习从视觉表示到语言序列的条件概率。这使多模态学习从人工模块组合逐渐转向数据驱动的端到端表示学习。三十、论文的局限性1. 整张图像被压缩成一个固定向量CNN最终只输出一个全局图像表示。无论图像中包含一个对象还是几十个对象所有视觉信息都被压缩进同一个向量。这容易造成信息瓶颈小对象可能被忽略多对象关系难以保留空间位置信息被弱化局部属性难以精确表达复杂场景被简化为主要内容。2. 没有显式视觉注意力模型生成“dog”“frisbee”“grass”等不同单词时使用的始终是同一个全局视觉上下文。它不能在生成“dog”时关注狗在生成“frisbee”时切换到飞盘区域。因此模型很难解释每个词具体来自图像中的哪个位置。3. 视觉信息只在序列开始时注入随着句子逐渐生成视觉信息必须依靠LSTM记忆状态持续保存。在较长句子后半部分模型可能更多依赖语言规律而不是图像证据。这会增加“看起来语言流畅但内容并不真实”的风险。4. 训练与推理存在输入差异训练时模型接收真实历史单词测试时模型接收自己的预测结果。一旦测试阶段早期出现错误后续错误可能不断累积。这就是后来常说的Exposure Bias问题。5. 最大似然训练倾向于生成安全描述数据集中常见句式会获得较高概率因此模型容易生成A man is standing…A group of people…A dog is sitting…A plate of food…这些描述通常语言正确但可能缺乏图像特有细节。6. 词表是封闭的模型只能生成训练词表中的单词。遇到未见对象名称、人名、地名、品牌或专业术语时模型通常只能使用较粗粒度的已知词代替。7. 自动评价指标不完全可靠论文中NIC的部分自动指标接近或超过人类对照值但人工评价仍明显低于人类描述。这说明n-gram重叠不能充分衡量视觉事实是否正确句子是否真正自然是否遗漏重要内容是否产生幻觉是否具有区分性。(arXiv)三十一、与Deep Visual-Semantic Alignments有什么区别上一篇《Deep Visual-Semantic Alignments for Generating Image Descriptions》和Show and Tell都发表于CVPR 2015但它们的研究重点不同。对比维度Deep Visual-Semantic AlignmentsShow and Tell主要目标区域—短语对齐描述生成整图描述生成视觉输入多个R-CNN区域整张图像的全局CNN特征语言模型BRNN对齐普通RNN生成LSTM生成是否显式定位是否训练过程对齐和生成两个阶段CNN—LSTM统一生成框架核心优势细粒度区域语义结构简单、端到端生成主要局限依赖候选区域和伪标注缺少局部视觉建模Deep Visual-Semantic Alignments更关注句子中的词语对应图像中的什么区域Show and Tell更关注如何用一个统一神经网络直接从整张图像生成完整句子两条路线分别代表了“细粒度对齐”和“端到端生成”后来视觉注意力模型将这两个方向逐渐结合起来。三十二、与DeViSE有什么区别对比维度DeViSEShow and Tell文本形式类别名称完整句子输出形式连续语义向量单词序列主要任务零样本分类图像描述生成语言知识预训练词向量空间条件语言模型图文连接图像—类别相似度图像条件下的句子概率是否生成自然语言否是DeViSE解决的是图像能否被映射到语言类别空间并识别未见类别Show and Tell进一步解决图像能否作为条件生成语法完整的开放式自然语言多模态学习由“视觉—词语嵌入”发展到了“视觉条件序列生成”。三十三、与Show, Attend and Tell有什么区别Show, Attend and Tell在CNN—RNN框架中加入视觉注意力。对比维度Show and TellShow, Attend and Tell图像表示单个全局向量多个空间位置特征视觉输入方式开始时输入一次每个生成步骤动态选择是否有注意力否有单词定位不可见可可视化复杂场景建模较弱更强可解释性较低较高Show and Tell在生成完整句子前就把整张图像压缩成一个向量Show, Attend and Tell则保留空间特征并在生成每个单词时动态计算视觉权重。后者能够在生成不同词语时关注不同区域。(Proceedings of Machine Learning Research)可以将两者的差异概括为Show and Tell先看完整张图再闭着眼睛说完一句话Show, Attend and Tell则一边说一边重新观察相关区域。三十四、与现代多模态大模型的联系现代视觉语言模型通常采用视觉编码器连接模块大语言模型Show and Tell采用CNNLSTM虽然模型规模和训练数据差距巨大但核心思想是一致的使用视觉网络将图像转化为连续表示将视觉表示输入语言模型通过自回归方式逐词生成文本最大化图像条件下目标文本的概率。现代模型主要在以下方面进行了扩展CNN被ViT或其他视觉基础模型替代单个全局图像向量被大量视觉Token替代LSTM被Transformer大语言模型替代简单线性连接被MLP、Q-Former或跨注意力替代图像描述数据扩展为大规模图文和视觉指令数据输出从一句Caption扩展为问答、推理、对话和工具调用。因此Show and Tell可以被视为现代多模态生成模型的一种早期简化形态。三十五、对视觉Token剪枝研究的启发Show and Tell将整张图像压缩成一个向量计算效率很高但会损失细粒度信息。现代多模态模型走向另一个极端高分辨率图像可能被转换成数百甚至数千个视觉Token。这样保留了更多细节却增加了显存和计算开销。二者体现了视觉表示中的核心矛盾视觉信息压缩过强模型会遗漏关键内容视觉Token保留过多又会造成严重冗余。因此现代视觉Token剪枝的目标并不是简单回到单个全局向量而是在两者之间寻找平衡删除背景和重复Token保留小对象和文字信息根据问题动态分配视觉预算在不同语言模型层逐步压缩兼顾准确率、延迟和显存。从这个角度看Show and Tell的固定全局向量就是一种极端视觉压缩方案而现代动态Token选择研究的是更加细粒度、样本自适应的视觉信息压缩。三十六、这篇论文最值得学习的三个思想1. 把视觉理解转化为条件语言生成模型不需要先输出完整结构化场景图再将其转成句子而是可以直接学习这是任务建模方式的重要变化。2. 编码器与解码器可以来自不同模态编码器处理图像解码器生成语言。只要中间表示能够连接两种模态序列到序列思想就不局限于文本翻译。3. 简单统一的模型可以替代复杂人工流水线论文没有专门设计对象、属性和关系规则而是用统一的最大似然目标训练整个系统。这种“用统一目标替代人工模块”的思想后来成为深度多模态学习的主线。三十七、总结《Show and Tell: A Neural Image Caption Generator》提出了经典的NIC框架。模型首先使用CNN把输入图像编码为固定长度视觉表示然后将图像表示输入LSTM。LSTM在视觉条件下根据此前出现的单词逐步预测下一个单词直到生成完整描述。模型通过最大化正确描述的条件概率进行训练整句概率进一步被分解为逐词概率测试阶段模型使用束搜索在多个候选序列中寻找整体概率较高的句子。论文实验表明NIC显著超过当时多种模板式和检索式方法在MS COCO上取得27.7的BLEU-4在PASCAL、Flickr和SBU上获得明显提升模型可以生成部分训练集中未出现的新描述词嵌入能够学习对象之间的语义关系自动指标仍不能完全代表真实人工质量。(arXiv)这篇论文最核心的贡献可以概括为它将图像描述统一为一个由CNN编码图像、LSTM解码语言的端到端条件生成问题确立了“视觉编码器语言解码器”的经典多模态生成框架。后来的视觉注意力、Transformer图像描述、视觉语言预训练和多模态大模型虽然采用了更强的视觉Token、更大的语言模型和更多训练目标但其基本逻辑仍然可以追溯到Show and Tell所建立的编码器—解码器范式。