AI大模型前沿:SemVID解决视频高压缩碎片化

type
status
date
slug
summary
tags
category
icon
password
网址
随着人工智能技术的飞速发展,长视频理解正在成为多模态大模型LLM)不可或缺的核心能力。如今的用户已经不再满足于仅仅向模型输入提示词Prompt)来询问“视频里有什么”,而是提出了更高阶的需求:这个特定的事件究竟从什么时候开始?又到什么时候结束?在计算机视觉领域,这类任务被称为视频时序定位(Video Temporal Grounding, 简称VTG)。
然而,视频越长,产生的视觉Token就越多,这直接导致了极其高昂的推理计算成本。为了实现降本增效(这对于AI变现至关重要),一个直观的思路是:对视觉Token进行剪枝(Pruning)。近期,被ECCV 2026会议录用的前沿工作SemVID正是围绕这一痛点展开了深入研究。本文将带您深度解析这项最新AI资讯,看看SemVID是如何通过精妙的Token分配策略,直接解决高压缩下的时序碎片化难题的。

传统剪枝 vs. VTG剪枝:根本目标的差异

AI新闻和学术界中,以往的Token剪枝方法大多是为VideoQA(视频问答)任务量身定制的。VideoQA的终极目标通常是回答诸如“人物在做什么”或“物体是什么颜色”这类静态或局部问题。对于这类任务,模型往往只需要捕捉到少数几个包含关键画面的帧,就足以给出正确答案。
但是,VTG任务的逻辑与此截然不同。VTG不仅要求模型看到与查询(Query)相关的对象,还必须精准捕捉动作发生前后的状态变化。举个例子,如果用户的指令是“一个人从柜子里拿出包”,模型不仅要识别出“人”、“柜子”和“包”,还必须观察到完整的时间动态:手何时伸向柜子,包又是在哪一秒被彻底拿出的。
如果直接套用传统的剪枝方法,只保留最显著的几个画面,模型或许能判断出事件确实发生过,但绝对无法划定准确的时间边界。简而言之,VideoQA剪枝解决的是“哪些画面足以回答问题”,而VTG剪枝真正需要解决的是“哪些证据链条能够支撑精确的时间定位”。

SemVID的核心突破:守护“证据链”

在深入了解SemVID之前,我们需要理解它提出的一个核心动机:VTG需要的绝不仅仅是局部的视觉证据,而是一条能够跨帧连接的“证据链”(Evidence Chain)。
在一个视频事件中,边界附近的Token负责向模型发出信号:“状态变化从这里开始,在这里结束”;而中间的Relay Token(中继节点)则负责将前后的状态连贯起来。如果为了压缩成本而简单粗暴地剪掉这些中间节点,证据链就会彻底断裂。其后果是灾难性的:虽然模型的语义理解能力还在(知道发生了什么),但时间定位能力会大幅衰减(不知道具体什么时候发生的)。
基于此,SemVID为VTG剪枝设定了两个全新的优化目标: 1. 证据保留(Evidence Retention, ER):精准保留与查询语义高度相关的Token,特别是事件边界附近的关键视觉证据。 2. 连接强度(Connectivity Strength, CS):维持跨帧的逻辑连接,让视觉证据能够沿着时间轴顺畅传播,而不是变成一堆孤立无援的碎片。

揭秘免训练的Token分配框架

为了实现上述目标,SemVID设计了一个无需重新训练骨干网络(Training-free)的Token剪枝框架。这意味着它可以在推理阶段直接插拔使用,极大地降低了部署门槛,这对于openaiclaudechatGPT等平台未来处理超长视频提供了极佳的优化思路。
该方法主要分为两个递进的步骤:
第一步:帧级别的预算分配 如果将Token预算平均分配给每一帧,无关的视频片段会造成严重的算力浪费;但如果仅仅依据Query的相关度来分配,预算又会极度集中在少数几个高相关帧上,导致中间帧被“剪空”,时间链路随之断裂。因此,SemVID创新性地同时引入了“Query相关度”和“帧间变化”两个信号。相关帧负责锁定目标事件,而变化帧通常靠近动作转折点,两者结合确保了预算分配能够覆盖完整的时间轴。
第二步:帧内部的三类语义角色分配 这是SemVID最核心的创新。在每一帧内部,SemVID显式地保留了三类承担不同语义角色的Token:
  • Object Token(对象证据):负责回答“发生了什么”。它保留与Query高度相关的对象。为了避免预算被同一物体的相似局部区域耗尽,SemVID引入了MMR算法,确保选出的对象Token既高度相关又具备视觉互补性。
  • Motion Token(动作转折):负责回答“什么时候发生变化”。SemVID通过计算相邻帧之间的局部特征变化来提取Motion Token,并过滤掉无关的背景运动。这些Token充当了连接事件前后状态的关键中继节点。
  • Context Token(场景锚点):负责回答“事件发生在什么环境中”。在极端的剪枝压缩下,如果只剩下局部对象,视频会严重碎片化。保留少量的场景锚点,能够有效维持画面的空间连续性,帮助模型将动作放回正确的语境中进行推理。

实验验证与未来展望

研发团队在Charades-STA和ActivityNet-Grounding等主流数据集上,使用Qwen-VL系列模型进行了严格评测。实验数据清晰地表明,在相同的Token预算限制下,SemVID在mIoU(最终定位精度)、ER(证据保留)和CS(连接强度)三个核心指标上,均全面超越了现有的剪枝方法。
最令人瞩目的是,在12.5%这种极低保留率的极限压缩测试中,其他传统方法出现了断崖式的性能崩塌,而SemVID依然能够稳定保持较高的mIoU。消融实验也证实:去掉Object Token会动摇定位基础,去掉Motion Token会切断时间连接,去掉Context Token则会引发场景碎片化。三者缺一不可。
当然,任何迈向AGI的技术都有其进化空间。目前的SemVID在提取Motion Token时主要依赖帧间特征的绝对变化,如果在镜头剧烈晃动、背景极度复杂或存在严重遮挡的场景下,仍可能受到一定干扰。但这无疑为长视频理解提供了一个极具潜力的发展方向。
获取更多关于大模型前沿论文解析、AI日报以及实用的AI工具教程,欢迎访问专业的AI门户网站 https://aigc.bar,让我们共同见证人工智能的每一次飞跃。
Loading...

没有找到文章