EmbodiedScan全解析CVPR 2024革命性多模态3D感知套件如何重塑具身AI【免费下载链接】EmbodiedScan[CVPR 2024 NeurIPS 2024] EmbodiedScan: A Holistic Multi-Modal 3D Perception Suite Towards Embodied AI项目地址: https://gitcode.com/gh_mirrors/em/EmbodiedScan具身智能Embodied AI是当下人工智能最热门的赛道之一而 EmbodiedScan 正是由上海 AI Lab、香港大学等机构联合推出的多模态3D感知旗舰工作一举入选 CVPR 2024并获 NeurIPS 2024 认可。它不只是一个大模型而是一套数据集 基准 基线框架三位一体的3D感知套件覆盖超过 5000 次室内扫描、100 万张以自我为中心的 RGB-D 视角、100 万条语言指令以及 760 类别的 3D 物体标注。本文将带你从零读懂 EmbodiedScan 的核心创新、模型架构、基准表现与上手方法并解析它如何为具身AI的感知—理解—交互闭环铺平道路。为什么具身AI需要全新的3D感知数据集传统 3D 感知研究大多采用上帝视角给定一个完整重建好的场景点云模型从全局出发做目标检测或语义分割。但在真实世界中机器人或智能体只能通过第一视角的摄像头逐步探索环境再根据人类的自然语言指令完成操作。这个巨大的鸿沟正是 EmbodiedScan 想要填平的。它聚焦于以自我为中心ego-centric的多模态3D感知让模型在边走边看的过程中综合 RGB 图像、深度图、点云和文本指令实现对 3D 场景的整体理解。上图直观展示了 EmbodiedScan 的核心主张从左到右分别是传统方法局限、以自我为中心的探索路径、真实 RGB-D 采集以及最终的多模态 3D 感知结果。一句话总结就是——从看全局到第一人称看世界。EmbodiedScan数据集5k扫描、100万视角、760类别的全景数据库作为3D感知数据集EmbodiedScan 的规模在同类工作中首屈一指5000 次室内扫描覆盖住宅、办公室、商店等多种真实场景️100 万张第一视角 RGB-D 图像还原智能体的真实观察方式100 万条语言提示为视觉定位Visual Grounding任务提供海量监督16 万 个 3D 有向框横跨760 物体类别部分类别与 LVIS 对齐80 个常见类别的稠密语义占用标注Occupancy其中 3D 有向框采用9 自由度9DoF表示比传统的轴对齐框更能刻画物体的真实姿态。数据源自 ScanNet、3RScan、Matterport3D 等公开数据集团队还开发了全新的标注工具与流水线大幅提升了标注效率与质量。从左侧的数据规模列表到右侧的类别实例分布词云这张图很好地说明了 EmbodiedScan 的大而全无论是长尾物体还是高频类别都有足够的标注支撑模型训练。Embodied Perceptron多模态3D感知基线框架光有数据还不够EmbodiedScan 还配套发布了名为Embodied Perceptron的基线框架用于验证基准并展示多模态融合的技术路线。整个框架的思路非常清晰多模态输入任意数量的 RGB-D 视角 点云 自然语言指令双分支编码2D 图像编码器ResNet提取图像特征稀疏 3D 编码器MinkResNet基于体素提取点云特征跨模态融合通过稠密融合与同构稀疏融合两种方式将多视角 2D 特征注入 3D 空间多任务解码统一输出 3D 目标检测框、语义占用地图并支持语言引导的视觉定位这套稀疏 3D 编码 2D 特征反投影融合的设计使得模型能处理任意数量的视角输入且在推理时表现出很强的泛化能力甚至能直接在未标注场景in the wild中工作。四大核心任务与官方基准表现EmbodiedScan 官方在configs/目录下提供了检测、定位、占用三大类任务的完整配置与预训练模型任务配置示例指标表现多视角 3D 目标检测configs/detection/mv-det3d_8xb4_embodiedscan-3d-284class-9dof.pyAP0.25 达 15.22AR0.25 达 52.23连续 3D 目标检测configs/detection/cont-det3d_8xb1_embodiedscan-3d-284class-9dof.pyAP0.25 达 17.83AR0.25 达 47.53多视角 3D 视觉定位configs/grounding/mv-grounding_8xb12_embodiedscan-vg-9dof-full.pyAP0.25 达 36.78加入复杂提示后达 39.26多视角占用预测configs/occupancy/mv-occ_8xb1_embodiedscan-occ-80class.pymIoU 达 21.28连续占用预测configs/occupancy/cont-occ_8xb1_embodiedscan-occ-80class.pymIoU 达 22.92 小知识多视角方案把每个扫描看作一组有序视角适合边看边理解的具身场景连续方案则把整个场景当作连续信号处理更贴近传统离线感知。其中 284 类检测、9DoF 框回归、80 类占用预测等设计都直接对应了 EmbodiedScan 数据集的标注体系新手研究时可以对照配置与源码阅读。项目代码结构从数据集到模型的快速导览EmbodiedScan 基于 OpenMMLab 生态MMEngine MMDetection3D构建代码组织非常规范按以下路径可以快速定位各模块数据集与标注解析embodiedscan/datasets/embodiedscan_dataset.py检测、embodiedscan/datasets/mv_3dvg_dataset.py视觉定位多视角数据流水线embodiedscan/datasets/transforms/multiview.py实现了多视角图像聚合、RGB-D 转点云等关键变换检测模型embodiedscan/models/detectors/sparse_featfusion_single_stage.py稀疏特征融合单阶段检测器视觉定位模型embodiedscan/models/detectors/sparse_featfusion_grounder.py结合文本解码器的定位器占用预测模型embodiedscan/models/detectors/embodied_occ.py与dense_fusion_occ.py训练与评测脚本tools/train.py、tools/test.py、tools/eval_script.py、tools/submit_results.py数据可视化embodiedscan/visualizer/内置EmbodiedScanBaseVisualizer推理时可直接输出 3D 场景可视化此外embodiedscan/explorer.py提供了数据集浏览器配合demo/demo.ipynb和embodiedscan/tutorial.ipynb两个 Notebook新手可以零门槛地体验数据加载、模型推理与结果可视化。快速上手安装、训练与推理全流程第一步克隆仓库并安装环境git clone https://gitcode.com/gh_mirrors/em/EmbodiedScan cd EmbodiedScan推荐环境为 Ubuntu 20.04、CUDA 12.0、Python 3.8、PyTorch 1.11。创建环境并安装 PyTorch 后一行命令即可装齐全部依赖python install.py all # 安装全部依赖如需只装运行或可视化相关依赖可分别使用python install.py run与python install.py visual。安装过程中 Mink Engine 和 PyTorch3D 较重脚本看似卡住属正常现象。第二步训练多视角3D目标检测模型python tools/train.py configs/detection/mv-det3d_8xb4_embodiedscan-3d-284class-9dof.py --work-dirwork_dirs/mv-3ddet多卡训练只需追加--launcherpytorch训练视觉定位模型前建议先下载 3D 检测预训练权重并核对配置中的load_from路径。第三步测试与提交结果python tools/test.py configs/detection/mv-det3d_8xb4_embodiedscan-3d-284class-9dof.py work_dirs/mv-3ddet/epoch_12.pth预测结果会保存为test_results.json再用tools/submit_results.py打包成提交格式即可参与官方榜单如 CVPR 2024 的 Autonomous Grand Challenge 多视角 3D 视觉定位赛道。第四步可视化推理结果在配置中声明visualizer dict(typeEmbodiedScanBaseVisualizer, ...)并在模型的predict方法中调用visualize_scene()即可在推理时直接看到带 3D 框的场景可视化还支持通过 NMS 参数调节框的稀疏程度。从EmbodiedScan到MMScan持续进化的3D感知生态EmbodiedScan 并未止步于 CVPR 2024。其姊妹工作MMScan多模态 3D 场景数据集进一步提供了层次化语言标注并被 NeurIPS 2024 接收。2024 年 9 月官方还发布了 EmbodiedScan v2 beta在 ARKitScenes 新增约 5k 扫描的原始标注。整个开源社区正在以 EmbodiedScan 为核心构建一个覆盖检测—定位—占用—语言交互的完整多模态3D感知生态。总结EmbodiedScan 的价值在于三点数据上它以第一视角多模态数据填补了具身场景 3D 感知的数据空白基准上它定义了检测、定位、占用三大任务的公开评测体系模型上Embodied Perceptron 验证了稀疏 3D 编码 多模态融合路线的有效性。如果你正在研究具身AI、多模态3D感知或视觉语言导航EmbodiedScan 是一个不可错过的起点——开源代码、预训练模型、完整基准一应俱全从跑通 demo 到复现论文、再到提交榜单整条学习路径都已为你铺好。赶快克隆仓库动手试试吧【免费下载链接】EmbodiedScan[CVPR 2024 NeurIPS 2024] EmbodiedScan: A Holistic Multi-Modal 3D Perception Suite Towards Embodied AI项目地址: https://gitcode.com/gh_mirrors/em/EmbodiedScan创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考