长视频理解的发展方向
4 min
之前一直在看流式视频理解相关的论文,长视频理解 Agent 和 Token Compression 也了解了一些,昨晚在小红书上看到了一篇讨论长视频理解的帖子,poster 给目前的方向分成了 4 类,在这里转载一下,后面系统完善一下:
- token compression,但从我的角度来看这些压缩的方法势必会带来信息的损耗 本质上其实是 benchmark oriented 的做法 压缩了非 benchmark 需求的信息 但已经是最 make sense 的角度之一
- adaptive frame selection,和第一种方法有相似的缺点 同时如果 selection 与 query 相关的话基本无法应用到多轮问答上
- 流式视频领域 streaming 了解的不多但看了几个文章可能都还是在做压缩这个事情 本质上我更愿意把流式视频视作一种特殊的 interleave 来解
- agentic 方法 目前的方式其实都很直觉 做 memory bank 或者什么 zoom in 的方法 实话说可能是目前最容易应用的方法 缺点就是计算复杂度太高
所以从我的角度来看更本质的解法可能在 infra 侧和数据侧 只要 infra 能支持 2048/8192 帧的高分辨率图像输入加上高质量数据 这问题自然就解了
我的看法比较类似,这四种路径本质都是通过牺牲部分信息来换取更长时的视频理解能力,但是说 infra 侧和数据侧进步这问题就能解决有些草率了。
视觉和语言差异实在是太大了。如谢赛宁所说:LLM 实际上是强监督学习,语言中蕴含着人类几千年来默默标注的隐式监督信息,LLM 通过自监督学习就能学习到大量知识。
但到了 CV 上,就完全不是这样,视觉上没有如此强大又密集的隐式监督信息。
最初是图像,我们只能依靠人工标注的类别来进行监督学习,后续 OpenAI 的 CLIP 通过构建巨量的 Image-Text 对,让模型学到了深层的语义信息,同时期的 DINO 则通过自监督,让模型学习到了结构信息。
而到了视频上,情况又不一样了:帧数量暴增,迅速撑满上下文,需要高效压缩;视频增加了时间维度,需要额外建模时间变化。
视频中存在着大量的冗余信息可以被压缩,这是毋庸置疑的,但我们难以找到一个非常好的通用方案:
- 使用 task-sufficient representation:根据 query 来决定哪些 frame/token 是有用的,并剔除冗余数据,但这也意味着我们放弃了多轮对话场景。
- 使用 heuristic sampling:人为根据我们对视频的认知经验来设置压缩算法,通用,但针对某一具体任务效果差。
4.20 Update
又想了一下,感觉 task-sufficient representation 是比较好的方向,我的理由:
- 参考人类本身的视觉处理过程
- 未来是 real-time、streaming 的世界,LLM 的第一个应用场景是 Web 页面聊天,但我们不能局限于这个场景。具身、智能穿戴、自驾、多模态 Agent 这些场景更广阔,并且都偏向于 real-time、streaming、多步骤推理规划(ReAct 范式)