尧图网络 高端网站定制 · 原创设计
免费咨询热线
400-888-6620
免费获取方案
MLLM轻量化论文阅读2
Efficient Video Sampling, EVS这篇文章发行较早在2025.10动机从图像到视频视频是连续的帧在连续帧之间存在大量的空间冗余想通过在连续帧之间保持不变的空间区域从而减少冗余方法将每一帧划分成大小相同但不重叠的patch对于同一空间位置的patch如果相同则冗余那么直接pruning掉。计算相同位置相邻帧的差值给差值可以理解成变化率进行排序根据预设的剪枝率保留变化率靠前的所以不同帧可能保留的token数是不一样的。1.在计算差值在原始像素空间上首先将每一帧划分为不重叠的patch_size*patch_size的小块然后对于每一帧在对应的块上做一个差分。这样做不需要过encoder但是只是在像素级别做缺乏语义。在视觉特征空间上如果在正常过encoder后得到的Embedding空间考虑了语义文章里面对这两种方法也做了个消融的确过encoder之后的效果更好。2.保留原始位置 ID如上图所示第二种是按顺序编号会丧失原来的空间顺序第三种就是保留原始的position ID但是论文经过对比得到了一个结论直接 plug-in 使用时Sequential 和 Position-preserving 差距不大有时 Sequential 更稳经过 uptraining 后Position-preserving 明显更好因为模型学会了利用稀疏位置 ID这个uptraining可以理解成增量训练目的是让 VLM 适应 EVS 造成的稀疏视觉 token 输入。总结来自G老师EVS 是一个基于相邻帧 patch 变化量的视频视觉 token 剪枝方法它保留第一帧和后续帧中变化明显的 patch删除时间上静态重复的 patch并通过保留原始 position id 与可选 uptraining让 VLM 在更少视觉 token 下保持较好视频理解性能CVPR2026评估token重要性 文本引导下的注意力分数和multi-head的多注意力头的权重不同文章认为在注意力层中多头注意力的不同head之间权重应该是不一样的可能在有些感知任务或者其他特定的任务上面一些head至关重要所以哪些head是重要的这个是需要进行前期评判确定的。如何判断head的重要性呢文章是在常见的几个benchmark上面采用消融实验的方式注意力头都在时的最后效果去掉一个注意力头时的效果这就知道该注意力头本身对于任务的重要性最后进行归一化的得到该注意力头权重。对于文本引导的注意力为了消除位置偏差并确保注意力仅取决于文本与视觉之间的语义对应关系作者省略了RoPE操作计算位置无关的注意力矩阵上图比较清晰明了head_weight是根据前面对每个head的消融提前计算出来的首先这个计算是存疑的不同任务需要关注的地方不同有些任务侧重全局有些任务侧重局部或者是纹理这个head_weight很难说是不是所有任务都能迁移。这个文本引导去掉了ROPE抹除了位置误差ROPE本身是给 q k 矩阵注入了绝对位置信息用文本的q去查询每个vision token的 k那么最后得出的注意力本身其实是不仅是文本对于vision token的注意力还会掺杂着一些位置信息(这个我之前看过有大佬在写数学公式推导但是的确没看太明白)所以把ROPE去掉那么存在的就是文本引导下的注意力分布规避了位置的影响。这个作者也后面做了消融实验的确不加ROPE效果会更好一些。最后计算每个token在每个head注意力权重以及对应文本引导下的注意力得分进行加权得出每个token的得分设定个剪枝率得分排序后进行pruning。以下是实验结果作者比较的是几个典型的方法包括基于注意力基于相似度基于注意力和相似度的相信相信的力量不断积累加油坚持
RELATED

相关推荐

灰度发布的资料

灰度发布的资料

灰度发布(也叫金丝雀发布)是一种能实现版本平滑过渡的软件发布方式,核心是通过逐步扩大新版本的用户覆盖范围,大幅降低全量上线的风险,是当前互联网行业主流的发布保障手段。 一、核心基础定义 灰度发布的核心逻辑是…

📅 2026/9/4 4:48:09
如何优化Llama-3.1-8B_rai_1.7.1_npu_4K在AMD NPU上的推理性能:完整指南 [特殊字符]

如何优化Llama-3.1-8B_rai_1.7.1_npu_4K在AMD NPU上的推理性能:完整指南 [特殊字符]

如何优化Llama-3.1-8B_rai_1.7.1_npu_4K在AMD NPU上的推理性能:完整指南 🚀 【免费下载链接】Llama-3.1-8B_rai_1.7.1_npu_4K 项目地址: https://ai.gitcode.com/hf_mirrors/amd/Llama-3.1-8B_rai_1.7.1_npu_4K 想要在AMD NPU上获得Llama-3.1-8B…

📅 2026/9/7 13:06:52
把胶卷装进暗网:柯达遭顶流黑客“洗劫”,220万张“底片”正被倒数销毁?

把胶卷装进暗网:柯达遭顶流黑客“洗劫”,220万张“底片”正被倒数销毁?

最新内容请微信搜索关注获取如果你对“柯达(Kodak)”的记忆还停留在那些泛黄的胶卷、街角绿底黄字的冲印店,或者“分享瞬间,分享生活”的温情广告语中,那么今天这则来自科技世界的最新爆炸性消息,可能会彻底…

📅 2026/8/10 14:31:45
MORE NEWS

更多资讯

📰

纯前端三件套打造可交付生日祝福页

简介:这是一份面向前端初学者与兴趣开发者的互动式生日祝福网页特效实战资源,聚焦HTML5、JavaScript和CSS3技术融合,帮助用户快速上手制作个性化数字祝福页面。压缩包共39个文件,包含6个HTML页面构建结构与入口,9个JS文…

📰

Easy-Vibe 前端性能优化实战指南:从加载原理到监控体系的全链路提速方案

Easy-Vibe 前端性能优化实战指南:从加载原理到监控体系的全链路提速方案 【免费下载链接】easy-vibe 💻 vibe coding 101|The first course for AI-native product builders. 项目地址: https://gitcode.com/GitHub_Trending/ea/easy-vibe …

📰

闪存多通道并发如何压垮DDR控制器

1. 为什么“闪存多通道并发”会突然把DDR推到压力测试边缘?这个问题我第一次在某款车规级存储控制器的FPGA原型验证阶段撞上——当时团队信心满满地把NAND Flash从单通道升级到4通道并行读取,DMA引擎吞吐翻了3.8倍,结果系统整体延迟不降反升&…

📰

NocoBase 下拉多选(Multiple Select)字段完全指南:配置、特性与源码级原理

NocoBase 下拉多选(Multiple Select)字段完全指南:配置、特性与源码级原理 【免费下载链接】nocobase NocoBase is an open-source AI no-code platform for building business systems fast. Instead of generating everything from scratc…

📰

ADMM算法在多微电网分布式优化与碳排放实时追踪中的应用

1. 项目背景与核心价值多微电网系统作为分布式能源的重要载体,正在重塑现代电力系统的运行模式。传统集中式调度方法在面对多主体、高维度的微网协同问题时,往往面临通信负担重、隐私保护难、扩展性差等痛点。而基于ADMM的分布式优化算法,恰好…

📰

SpringBoot音乐分享平台开发实战与架构解析

1. 项目概述这个基于SpringBoot的音乐分享交流平台是我去年指导的一个本科毕业设计项目,项目编号Project60526。作为一个典型的Java Web应用,它完美展现了SpringBoot在现代Web开发中的高效与便捷。平台核心功能围绕音乐作品的分享、评论和交流展开&#…

TODAY

今日更新

THIS WEEK

本周精选

THIS MONTH

本月热门

读完文章,想聊聊您的网站?

告诉我们您的行业与需求,资深顾问一对一梳理方案与报价,全程免费。

📞 💬