手把手教程:如何用VSI-Bench零样本评估你的多模态大模型空间智能
手把手教程如何用VSI-Bench零样本评估你的多模态大模型空间智能【免费下载链接】thinking-in-spaceOfficial repo and evaluation implementation of VSI-Bench项目地址: https://gitcode.com/gh_mirrors/th/thinking-in-space多模态大模型MLLM能看懂视频画面但它真的看懂了空间吗能准确回答客厅里沙发到电视的距离有几米房间里一共有几把椅子这类空间智能问题吗VSI-Bench 正是为此而生的开源基准测试——它用 288 段真实室内第一视角视频和 5000 多个问答对让开发者可以零样本评估多模态大模型的空间智能水平。本文就是一份面向新手的手把手教程从数据集构成到一行命令跑通评估带你快速上手。VSI-Bench 是什么给多模态大模型的空间智能考试VSI-BenchVisual-Spatial Intelligence Benchmark是由 CVPR 2025 Oral 论文《Thinking in Space》提出的权威基准核心思路非常简单给模型看一段在公寓、实验室或工厂里拍摄的第一视角视频然后像闭卷考试一样提问考察它能否在脑海中构建出认知地图并回忆出空间信息。官方评估代码位于仓库的 lmms_eval/tasks/vsibench/ 目录任务配置见 vsibench.yaml。零样本评估的含义所谓零样本zero-shot就是不需要任何微调直接把现成模型放到测试集上推理用统一提示词、贪婪解码保证结果可复现。这意味着你手上任何一个支持视频输入的多模态大模型都能在 VSI-Bench 上快速体检。VSI-Bench 测什么8 大空间智能任务详解VSI-Bench 精心设计了 8 类任务覆盖空间智能的三大维度测量估算Measurement、构型认知Configurational和时空推理Spatiotemporal。任务类别具体任务提问示例测量类物体绝对距离床和沙发的距离是几米测量类物体计数这个房间里有几把椅子测量类物体大小估算冰箱的长度是多少厘米测量类房间大小估算这个房间的面积是多少平方米构型类相对方向书架在门的哪个方向构型类相对距离键盘和电视谁离窗户更近构型类路线规划从马桶走到洗手台怎么走时空类物体出现顺序视频中桌子先出现还是椅子先出现其中选择题MCA任务用**准确率Accuracy衡量数值题NA任务用论文提出的平均相对准确率MRA**衡量具体评分逻辑可以在 utils.py 中查看。数据集规模288 段视频与 5000 问答对VSI-Bench 的视频全部来自 ScanNet、ScanNet 和 ARKitScenes 三个公开室内 3D 重建数据集的验证集覆盖家庭、办公室、工厂等多种真实场景。从统计图可以看出测量类任务占比 40.3%构型类占 47.6%时空类占 12.1%视频时长从几十秒到数分钟不等保证了评测的多样性。仓库还提供了各场景的元信息房间大小、物体坐标、数量等位于 data/meta_info/方便你分析模型在不同场景下的表现差异。准备工作环境安装与仓库克隆评估代码基于 lmms-eval 框架构建安装步骤很简单新手也能轻松完成。先克隆仓库并安装依赖git clone https://gitcode.com/gh_mirrors/th/thinking-in-space cd thinking-in-space git submodule update --init --recursive pip install -e .如果本地有 CUDA 环境建议用 conda 创建独立环境Python 3.10并按需安装 deepspeed 等加速依赖。数据集会自动从 HuggingFace 下载并缓存无需手动处理视频文件。一键运行零样本评估多模态大模型的完整步骤安装完成后评估过程简单得超乎想象——项目提供了开箱即用的一键脚本 evaluate_all_in_one.sh只需一条命令即可开跑bash evaluate_all_in_one.sh --model all --num_processes 8 --benchmark vsibench关键参数说明--model指定要评估的模型all表示评估内置的全部开源模型也可用逗号分隔指定如longva_7b_32f,internvl2_8b_8f--num_processes并行进程数建议根据 GPU 显存调整--benchmark评测基准名固定为vsibench--limit可选参数先用少量样本快速验证流程脚本内置了 8 个主流开源模型的完整配置覆盖 LLaVA-OneVision、LLaVA-NeXT-Video、VILA、LongVA、InternVL2 等模型家族如果你想评估 GPT-4o、Gemini 等闭源模型只需在脚本中补上对应的 API Key 即可。如何解读评估结果评估结束后结果会输出到logs/目录包含每个任务类型的得分与总平均分。论文用同一套流程评测了 15 个视频多模态大模型结果令人深思即使是 GPT-4o、Gemini-1.5 等顶级模型在空间智能上与人类水平仍有明显差距尤其在绝对距离、房间大小等测量类任务上表现较弱。这恰好说明空间智能是当前多模态大模型的重要短板也是值得投入的研究方向。进阶技巧如何让评估更高效先小规模试跑用--limit 50限制样本数确认流程跑通后再全量评估节省调试时间按需并行72B 级别的大模型建议--num_processes 1并开启device_mapauto对比分析结合data/meta_info中的元数据按场景类型如 ARKitScenes分组分析模型短板复现论文结果保持默认提示词和贪婪解码即可与论文表格数据直接对比结语VSI-Bench 为零样本评估多模态大模型的空间智能提供了标准化、可复现的完整方案。无论你是想给自己的模型做体检还是想研究空间智能这一前沿方向只需克隆仓库、安装依赖、运行一条命令就能拿到专业级的评估报告。赶紧动手试试看看你的模型在空间智能上能得多少分吧【免费下载链接】thinking-in-spaceOfficial repo and evaluation implementation of VSI-Bench项目地址: https://gitcode.com/gh_mirrors/th/thinking-in-space创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考