note

  • Video-MME-v1基准内置12种独立任务题型,覆盖基础视觉→时序动态→高阶综合推理全维度:
    • 时序行为、运动模式、多目标跨帧追踪、时序先后推理、事件因果推导、长视频摘要、跨模态信息融合、多语言视频理解、细节定位、空间关系推理、抽象剧情理解、多线索综合问答
  • Video-MME-v2想推动的是一次评测理念上的转变,真正需要比较的是谁能够在连续、动态、多模态的信息中,像人一样,真正理解正在发生的事情

一、Video-MME

1、Video-MME介绍

论文:Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis

  1. 项目主页(榜单、数据集、任务说明):https://video-mme.github.io/home_page.html
  2. GitHub评测代码仓库:https://github.com/BradyFU/Video-MME
    arXiv论文:https://arxiv.org/pdf/2604.05015

二、核心优化点

  1. 研究痛点:过往多模态评测基准仅聚焦静态图像,缺少覆盖长短时序、音视文多模态融合的标准化视频评测集,无法统一衡量时序记忆、跨帧推理、多线索联合理解能力。

在这里插入图片描述

  1. 四大核心设计
    ◦ 场景全覆盖:6大主领域(知识科普、影视、体育、舞台艺术、日常记录、多语言),30个细分子场景;
    ◦ 完整时序跨度:视频时长11秒~1小时,分短/中/长视频,专门测试长上下文记忆;
    ◦ 多模态输入范式:支持纯画面、画面+字幕、画面+音频三种评测模式,量化音/文本对视频理解的增益;
    ◦ 高质量人工标注:900段视频(总254小时)、2700道选择题,全程人工校验,无机器生成脏数据。

  2. 核心创新:构建12类分层视频理解评测任务体系,从底层视觉感知到高层综合推理全覆盖,形成完整能力分层评测标准。

2、Video MME 12类任务体系

基准内置12种独立任务题型,覆盖基础视觉→时序动态→高阶综合推理全维度:

  1. 画面物体识别:识别画面内物体、属性、场景基础视觉感知

  2. 动作识别:区分人物/物体动态行为、运动模式

  3. 多目标跨帧追踪:持续定位多物体在不同时间戳的位置变化

  4. 时序先后推理:判断事件、动作发生的时间先后顺序

  5. 事件因果推导:基于时序上下文分析事件发生的因果逻辑

  6. 长视频摘要:提取数十分钟长视频核心主线、关键情节

  7. 跨模态信息融合:联合画面、字幕、音频信息完成统一推理

  8. 多语言视频理解:适配带多语种字幕/语音的跨语言视频问答

  9. 细节定位:精准定位特定物体、台词、动作出现的时间片段

  10. 空间关系推理:判断物体间远近、方位、遮挡等空间约束

  11. 抽象剧情理解:解读隐喻、人物情绪、剧情伏笔、叙事逻辑

  12. 多线索综合问答:融合时序、空间、音文多条线索做多跳推理

3、Video MME关键实验结果

Video MME关键实验结果(2025年版):
在这里插入图片描述

  1. 闭源模型性能:Gemini 1.5 Pro平均精度75%,高于GPT-4o(71.9%),为初代榜单最优;
  2. 时序衰减规律:所有模型准确率随视频时长拉长持续下降,开源模型长时序短板显著大于闭源;
  3. 模态增益结论:叠加字幕/音频输入后,模型整体准确率提升8%~15%,单帧视觉不足以支撑复杂推理;
  4. 任务分层差距:12类任务性能分化明显,抽象剧情、长视频摘要、多线索综合问答是所有模型普遍弱项。

二、Video-MME-v2

链接:https://arxiv.org/pdf/2604.05015

1、benchmark介绍

考虑三个维度:
1、信息检索和聚合
2、时序理解
3、复杂推理

在这里插入图片描述

评测方法:
1、能力一致性考察:多个角度提问确保模型是真的会
2、推理连贯:非线性评分机制(如零散答对几题不能拿高分、首错阶段机制)
传统单选题目benchmark,高估模型效果

目前效果:gemini 3 pro领先,seed2.0 pro紧随其后,但是和human差别仍然很大
在这里插入图片描述

非常直观的评测结果显示(截止20260704):人类专家的非线性得分为90.7(传统ACC为94.9),而当前最强的商业模型Gemini-3-Pro得分仅为49.4,开源模型Qwen最好的结果为39.1。在更严格的评测框架下,模型与人类之间仍然存在显著差距。

2、数据统计

数据长度分布统计:
在这里插入图片描述

3、thinking的收益

thinking的收益不是无条件成立的,它高度依赖文本线索。

论文实验显示,开启 Thinking 后,模型在"有字幕/音频"的设定下,通常比在"纯视觉"设定下获得更明显的提升。 例如,Qwen3.5-122B-A10B-Think(64 frames) 在无字幕和有字幕设置下,分别带来 +3.8/+5.8 的提升。这说明,显式文本语义仍然是很多模型完成多步推理时非常重要的"锚点"。

但另一方面,Thinking 也可能带来退化。Qwen3-VL-8B 在无字幕设定下出现了 -0.6 的下降,而 KimiVL-16B 在整体上出现了 -3.3/-3. 的性能回落,在更强调复杂推理的 Level 3 上,退化甚至达到 -4.0/-3.9。
在这里插入图片描述

总结:当前很多模型的"推理增强",本质上仍然更擅长利用语言线索,而不是稳定地从纯视觉、纯音频中抽取支撑推理的证据。一旦文本锚点不足,Thinking 不但未必增益,反而可能引入更多噪声。

Reference

[1] Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis
[2] Video-MME-v2: Towards the Next Stage in Benchmarks
for Comprehensive Video Understanding

Logo

火山引擎视频云技术社区,是面向 AI 音视频开发者的技术交流平台。这里汇聚源自抖音、豆包等亿级 DAU 产品的 RTC、直播、点播、AI 媒体处理、音视频互动技术,提供接入指南、最佳实践、性能调优、场景案例、Demo 代码、开源项目、白皮书和 API 文档。社区汇聚官方工程师与一线开发者,为 AI 视频通话、数字人、AI 视频处理等应用的开发与落地提供技术支持。

更多推荐