从ScanNet到EmbodiedScan:具身AI 3D感知数据集与基准的演进之路

发布时间:2026/10/11 16:43:56

从ScanNet到EmbodiedScan:具身AI 3D感知数据集与基准的演进之路 从ScanNet到EmbodiedScan具身AI 3D感知数据集与基准的演进之路【免费下载链接】EmbodiedScan[CVPR 2024 NeurIPS 2024] EmbodiedScan: A Holistic Multi-Modal 3D Perception Suite Towards Embodied AI项目地址: https://gitcode.com/gh_mirrors/em/EmbodiedScan当机器人在真实房间里自主行走时它需要像人类一样回答我看到了什么桌子在哪把椅子旁边这类问题。这背后离不开高质量的具身AI 3D感知数据集。从2017年的ScanNet到2024年发表于CVPR的EmbodiedScan室内3D数据集完成了一次关键跃迁EmbodiedScan 是一个面向具身AI的多模态3D感知数据集与基准它用第一人称视角的RGB-D数据、百万级语言提示和全景标注重新定义了3D场景理解的训练与评测范式。为什么需要EmbodiedScan这样的具身AI 3D感知数据集传统3D感知研究大多采用场景级设定给定一张完整点云或重建好的网格模型输出物体框或语义分割结果。但真正的具身智能体只有第一人称观察还需要把观察翻译成语言进行交互难度截然不同。EmbodiedScan正是为弥合这道鸿沟而生第一人称视角数据沿智能体的真实探索路径采集而非上帝视角️多模态对齐RGB-D图像、点云、语言提示在同一场景中天然对应全景感知目标检测、视觉定位、占用预测三大任务共享一套数据底座从ScanNet到EmbodiedScan室内3D数据集的三代演进回顾室内3D数据集的脉络能清晰看到EmbodiedScan的继承与突破数据集年份定位局限ScanNet2017大规模RGB-D重建与语义标注类别少、全局视角、无语言标注3RScan / Matterport3D2017-2019可重定位、跨建筑多样性缺少语言交互与第一人称组织ARKitScenes2022手持设备采集的真实数据标注粒度较粗EmbodiedScan2024具身多模态3D感知套件持续扩展中关键进化体现在三处类别从ScanNet的约20类扩展到760类部分与LVIS对齐标注从单视角几何标签升级为沿探索路径的多视角组织数据从纯几何升级为语言-物体-场景的完整关联。这也是EmbodiedScan被称为Holistic全景式的原因。EmbodiedScan数据集规模有多大作为具身AI 3D感知数据集EmbodiedScan的体量相当可观5000 次室内扫描️100万 第一人称RGB-D视图100万 语言提示language prompts16万 3D定向框3D-oriented boxes️760 类别与LVIS部分对齐80个常见类别的密集语义占用标注其中语言提示通过参考SR3D的思路自动生成并辅以人工校准让语言指代3D物体成为可规模化学习的任务。原始数据来自ScanNet、3RScan、Matterport3D与ARKitScenes代码库的data/README.md给出了完整的下载与目录组织指南。EmbodiedScan基准涵盖哪些3D感知任务EmbodiedScan同时提供了一套公开基准官方在configs目录下发布了全部任务的训练配置主要包括五大任务多视角3D目标检测配置见 mv-det3d_8xb4_embodiedscan-3d-284class-9dof.py基线 AP0.25 达到 15.22AR0.25 为 52.23。连续3D检测配置见 cont-det3d_8xb1_embodiedscan-3d-284class-9dof.py融合稠密点云后基线 AP0.25 提升至 17.83。多视角3D视觉定位配置见 mv-grounding_8xb12_embodiedscan-vg-9dof-full.py完整版基线 AP0.25 达 36.78加入复杂提示训练后提升到 39.26。占用预测多视角与连续两套配置见 configs/occupancy基线 mIoU 分别为 21.28 与 22.92。对应的评测逻辑位于 embodiedscan/eval/indoor_eval.py数据集API封装在 embodiedscan/datasets/embodiedscan_dataset.py 与 mv_3dvg_dataset.py 中。Embodied Perceptron基线模型架构解析为了在EmbodiedScan基准上建立可比起点作者提出了**Embodied Perceptron具身感知器**基线框架它能够处理任意数量的多模态输入多模态编码2D图像由ResNet编码3D点云由MinkResNet稀疏编码语言提示由文本编码器处理特征融合采用稠密融合与同构稀疏融合dense isomorphic sparse fusion两套并行通道多任务解码融合后的3D特征分别送入检测头、占用头与视觉定位解码器实现一个模型、多任务输出相关模型实现分布在 embodiedscan/models/detectors 下包括 SparseFeatureFusionSingleStage3DDetector3D检测与 SparseFeatureFusion3DGrounder视觉定位等。快速上手安装与数据准备想亲自跑通这套具身AI 3D感知流水线步骤如下1. 克隆仓库git clone https://gitcode.com/gh_mirrors/em/EmbodiedScan cd EmbodiedScan2. 创建环境并安装依赖conda create -n embodiedscan python3.8 -y conda activate embodiedscan python install.py all3. 准备数据按 data/README.md 下载原始数据集再用 converter 中的脚本抽取图像与占用标注。用EmbodiedScan训练与评测一个3D感知模型环境就绪后训练与推理非常直接。以多视角3D检测为例python tools/train.py configs/detection/mv-det3d_8xb4_embodiedscan-3d-284class-9dof.py --work-dirwork_dirs/mv-3ddet python tools/test.py configs/detection/mv-det3d_8xb4_embodiedscan-3d-284class-9dof.py work_dirs/mv-3ddet/epoch_12.pth训练脚本与测试脚本位于 tools/train.py 与 tools/test.py。此外demo/demo.py 与 demo/demo.ipynb 提供了单场景演示tools/submit_results.py 支持将预测打包提交至CVPR 2024 Autonomous Grand Challenge的视觉定位赛道。从EmbodiedScan到MMScan生态持续扩展EmbodiedScan并非终点。项目团队随后推出了MMScan——一个携带最多层次化语言标注的多模态3D场景数据集并计划在v2版本中为ARKitScenes新增的5000个扫描提供原始标注。论文原文可参考 assets/EmbodiedScan.pdf其中包含更完整的基准细节与消融实验。结语从ScanNet的看见房间到EmbodiedScan的在房间里边走边理解这条演进之路正是具身AI落地的基础工程。无论你是研究3D目标检测、视觉定位、占用预测还是探索多模态大模型与机器人结合EmbodiedScan都提供了一个难得的统一战场——既补足了数据缺口也立好了评测标尺。赶快克隆仓库让你的模型迈出第一人称3D感知的第一步吧【免费下载链接】EmbodiedScan[CVPR 2024 NeurIPS 2024] EmbodiedScan: A Holistic Multi-Modal 3D Perception Suite Towards Embodied AI项目地址: https://gitcode.com/gh_mirrors/em/EmbodiedScan创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
延伸阅读

更多相关文章

2026/10/6 20:36:10

本地AI服务器部署全攻略:从环境搭建到API集成实践

这次我们来看一个名为“神秘服务器宣传”的项目。这个名字听起来有些模糊,但结合当前技术趋势,它很可能指向一个集成了多种AI能力的本地化部署工具或服务。这类项目的核心价值在于,它试图将复杂的AI模型(如图像生成、语音合成、文…

2026/10/6 20:36:15

Python+MySQL抖音数据分析实战:从数据采集到可视化的全流程项目

这次我们来看一个面向数据分析新手的实战项目:基于Python和MySQL的抖音数据分析系统。这个项目最大的价值在于“完整”——它不是一个简单的数据查询脚本,而是一个从数据采集、清洗、存储、分析到可视化的全流程解决方案。对于正在学习Python和MySQL&…

2026/10/6 20:36:19

macdowsOS Tool UI 1.30:Windows系统一键仿macOS美化实战指南

1. 背景与核心概念对于许多长期使用 Windows 的用户而言,macOS 那套优雅、简洁且高度统一的用户界面(UI)设计语言,常常令人心生向往。然而,硬件成本、软件生态或工作流程的依赖,使得完全切换到 macOS 系统并…

2026/10/11 16:43:25

Docker容器化Python应用:从部署翻车到生产环境实践

前几天帮某开发者排查部署问题,他的Flask应用在自己笔记本上跑得好好的,换到服务器上就开始报ModuleNotFoundError,补装依赖之后又遇到版本冲突,最后连Python解释器版本都不一样了。这种场面我见过太多次,绝大多数时候…

2026/10/11 16:43:25

SVG电力图元开发指南:从坐标规范到实时数据接入

简介:面向电力行业绘图与软件开发人员的SVG电力图元定义文档,统一了电力接线图中隔离开关、断路器、变压器等常见设备符号的绘制标准。SVG作为基于XML的矢量格式,可无损缩放,非常适合在不同尺寸屏幕与打印材料上保持图形清晰一致。…

2026/10/11 16:43:25

Java爬虫工程化实战:从HttpClient到反爬与调度系统设计

做数据采集项目时,很多人第一反应是用 Python 写爬虫,但我们在实际落地一个多城市公共交通数据采集系统时,最终选型却定为 Java。Java 爬虫在并发控制、工程化整合和长期稳定性上确实有它不可替代的位置。这篇东西不是教程式的废话堆砌&#…

2026/10/11 16:38:25

Imatest SFRplus教程:从拍摄规范到MTF50指标解读与常见问题排查

简介:这份Imatest教程是一份面向相机评测人员、影像工程师及摄影爱好者的图像质量分析入门文档,重点解决如何看懂Imatest色彩、噪声与解像力测试图表。资源为单个doc文档,压缩包仅128KB,内容紧凑,适合快速查阅。文档依…

2026/10/11 0:02:13

Python调用Gemini Structured Outputs实现工单路由门禁

客服工单最怕的不是模型“答错一句话”,而是它给出一段看起来合理的说明,程序却从中猜错优先级。通俗做法是:要求模型只交 JSON(JavaScript Object Notation,轻量数据格式),再让代码验证它。Gem…

2026/10/11 0:02:13

Spring Boot超市进销存系统毕设实战:从需求拆解到答辩通关

最近带的一个学生项目组里,有A同学跑来问我:选什么毕设题目最稳妥,既能让评审老师觉得工作量够,又不会在答辩时被问到语无伦次。我第一反应就是推荐基于Spring Boot的超市仓库管理系统——也就是超市进销存系统。这个题目乍一看平…

2026/10/11 0:02:13

Flutter StatefulWidget 生命周期核心解析

很多刚开始接触 Flutter 的朋友,在看完一堆“Hello World”和基础组件之后,大概率都会撞上同一堵墙:StatefulWidget 里那堆 initState、build、dispose 方法,到底什么时候被调用?为什么顺序是那样?在里面到…

2026/10/11 0:02:13

Python调用Gemini Structured Outputs实现工单路由门禁

客服工单最怕的不是模型“答错一句话”,而是它给出一段看起来合理的说明,程序却从中猜错优先级。通俗做法是:要求模型只交 JSON(JavaScript Object Notation,轻量数据格式),再让代码验证它。Gem…

2026/10/11 0:02:13

Spring Boot超市进销存系统毕设实战:从需求拆解到答辩通关

最近带的一个学生项目组里,有A同学跑来问我:选什么毕设题目最稳妥,既能让评审老师觉得工作量够,又不会在答辩时被问到语无伦次。我第一反应就是推荐基于Spring Boot的超市仓库管理系统——也就是超市进销存系统。这个题目乍一看平…

2026/10/11 0:02:13

Flutter StatefulWidget 生命周期核心解析

很多刚开始接触 Flutter 的朋友,在看完一堆“Hello World”和基础组件之后,大概率都会撞上同一堵墙:StatefulWidget 里那堆 initState、build、dispose 方法,到底什么时候被调用?为什么顺序是那样?在里面到…

还想了解更多?直接咨询顾问

免费诊断 + 免费方案 + 透明报价。

全国咨询热线400-8866-253
免费获取方案
☎咨询二维码 ☎ ↑