InternVL视频理解跑分指南:MLVU与Video-MME评测实战教程
InternVL视频理解跑分指南MLVU与Video-MME评测实战教程【免费下载链接】InternVL[CVPR 2024 Oral] InternVL Family: A Pioneering Open-Source Alternative to GPT-4o. 接近GPT-4o表现的开源多模态对话模型项目地址: https://gitcode.com/GitHub_Trending/in/InternVLInternVL是源自 CVPR 2024 Oral 的开源多模态大模型家族其对话模型 InternVL-Chat 在视频理解能力上已接近 GPT-4o是少数能开源免费部署的替代方案。本文带你实战仓库内置的视频基准评测流程完成 MVBench、MLVU 与 Video-MME 三大视频基准的跑分与成绩解读。为什么选 InternVL 做视频理解InternVL 家族在视频理解榜单上屡创开源纪录时间里程碑成绩2024/07/18InternVL2-40B 在Video-MME数据集取得开源 SOTA输入 16 帧得分61.2输入 32 帧得分64.4是最接近 GPT-4o mini 的开源模型2024/07/24MLVU团队评测 InternVL-1.5多项选择任务平均50.4%、生成任务4.02多项选择在所有开源多模态大模型中排名第一这些官方成绩记录在 README.md 的项目动态中你可以在跑完自己的分数后与它们对齐。视频评测基准全景5个数据集一次看懂InternVL 2.5 技术报告使用的视频评测工具链在 internvl_chat/eval/README.md 中完整列出基准名称评测代码库Video-MMEVLMEvalKit开源评测工具MVBench本仓库内置见下文实战MLVUVLMEvalKitMMBench-VideoVLMEvalKitLongVideoBenchVLMEvalKit 三个基准的侧重点不同Video-MME覆盖短/中/长视频的多轮问答MLVU同时考察多项选择与生成式任务MVBench则由 20 个细粒度子任务构成动作计数、空间关系、场景转换等是仓库内唯一提供完整本地评测脚本的视频基准也是新手跑分的最佳起点。评测数据一键准备步骤以 MVBench 为例完整数据准备流程见 internvl_chat/eval/mvbench/README.md拉取仓库只读使用git clone https://gitcode.com/GitHub_Trending/in/InternVL cd InternVL/internvl_chat下载数据集到data/目录并解压视频 zip 包最终形成json/20 个子任务标注video/12 个视频来源的标准目录结构。⚠️ 视频类数据集体积较大README 推荐使用--resume-download断点续传。最快跑分方法MVBench 一键评测命令准备好模型权重checkpoint后只需一行命令即可在 8 卡机器上启动评测GPUS8 sh evaluate.sh ${CHECKPOINT} mvbench该命令实际调用 internvl_chat/eval/mvbench/evaluate_mvbench.py默认抽16 帧--num_segments 16送入模型。常用参数速查表参数默认值说明--checkpoint必填模型权重路径--num_segments16抽帧数直接决定跑分口径--dynamicFalse启用动态高分辨率预处理细节识别更强--max-num1动态高分辨率的最大切片数--load-in-8bitFalse8-bit 量化加载显存紧张时开启--autoFalse超大模型自动切分到 8 卡 小技巧显存不够就加--load-in-8bit或--auto单机放不下 40B 模型也不用慌。MLVU 与 Video-MME 跑分要点MLVU 和 Video-MME 的官方成绩通过 VLMEvalKit 评测工具产出跑分时注意三点抽帧数对齐口径InternVL2-40B 的 Video-MME 成绩有 16 帧61.2与 32 帧64.4两档。帧数越多得分越高但推理耗时近似线性增长横向对比务必注明帧数MLVU 双任务分开看多项选择任务InternVL-1.5 达 50.4%与生成任务4.02分别统计合并比较会失真视频输入原理InternVL 通过decord的VideoReader按帧读取视频每帧走与图片相同的动态高分辨率切块流程完整示例代码在 internvl_chat/README.md 的 Inference with Transformers 章节。常见问题避坑清单分数对不上官方先核对模型版本、抽帧数、是否开启--dynamic、数据集版本四项是否一致单卡显存不足依次尝试--load-in-8bit→--auto多卡切分或换用更小的 1B/2B 版本模型shell/internvl2.5/2nd_finetune/下有各规格脚本可参考多节点分布式internvl_chat/evaluate.sh 已内置torchrun多机参数MASTER_PORT、NODES等设置GPUS环境变量即可想跑更多视频基准MMBench-Video、LongVideoBench 同样走 VLMEvalKit流程与 Video-MME 一致。小结 本文完整覆盖了 InternVL 视频基准评测实战从 internvl_chat/eval/README.md 的基准全景到 MVBench 一键跑分命令、MLVU 与 Video-MME 的抽帧口径再到显存与分数的常见坑位。InternVL 作为接近 GPT-4o 的开源多模态模型其视频理解能力值得你亲自跑一遍分数验证——按本文步骤操作一天内即可完成全部视频基准的完整评测。【免费下载链接】InternVL[CVPR 2024 Oral] InternVL Family: A Pioneering Open-Source Alternative to GPT-4o. 接近GPT-4o表现的开源多模态对话模型项目地址: https://gitcode.com/GitHub_Trending/in/InternVL创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考