深度学习巨头DeepMind在ImageNet数据集上取得突破性进展，为机器人研究带来新的里程碑

王林

发布时间：2023-10-05 16:21:06

1319人浏览过

来源于机器之心

转载

机器人技术为什么远远落后于自然语言处理（nlp）、视觉和其他人工智能领域？除了其他困难外，数据短缺是主要原因。为了解决这个问题，谷歌 deepmind 联合其他机构推出了开放式 x-embodiment 数据集，并成功训练出了更强大的 rt-x 模型

深度学习巨头DeepMind在ImageNet数据集上取得突破性进展，为机器人研究带来新的里程碑

在大模型不断取得突破的 2023，把大模型当做大脑来辅助运行的具身智能机器人研究也在被迅速推进。

2 个多月前，谷歌 DeepMind 推出了第一个控制机器人的视觉 - 语言 - 动作（VLA）模型 ——RT-2。这个模型让机器人不仅能解读人类的复杂指令，还能看懂眼前的物体（即使这个物体之前从未见过），并按照指令采取动作。比如，你让机器人拿起桌上「已灭绝的动物」。它会抓起眼前的恐龙玩偶。

☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜

深度学习巨头DeepMind在ImageNet数据集上取得突破性进展，为机器人研究带来新的里程碑

当时，一位谷歌高管称，RT-2 是机器人制造和编程方式的重大飞跃。「由于这一变化，我们不得不重新考虑我们的整个研究规划了。」

更令人吃惊的是，时间仅仅过去了两个多月，DeepMind 的这个机器人模型又进步了，而且一下就提高了两倍。

这是怎么实现的呢？

我们知道，机器人通常在做某一件事情上非常专业，但通用能力很差。一般情况下，你必须针对每项任务、每个机器人和环境训练一个模型。改变一个变量往往需要从头开始。但是，如果我们能将各种机器人学的知识结合起来，创造出一种训练通用机器人的方法呢？

这就是 DeepMind 在过去一段时间所做的事情。他们汇集了来自 22 种不同机器人类型的数据，以创建 Open X-Embodiment 数据集，然后在之前的模型（RT-1 和 RT-2）的基础上，训练出了能力更强的 RT-X（分别为 RT-1-X 和 RT-2-X）。

他们在五个不同的研究实验室测试了 RT-1-X 模型，结果显示，与针对每个机器人独立开发的方法相比，新方法在五种不同的常用机器人中平均成功率提高了 50%。他们还表明，在上述数据集上训练的 RT-2-X 在现实世界机器人技能上的表现提高了 2 倍，而且，通过学习新数据，RT-2-X 掌握了很多新技能。这项工作表明，在来自多个机器人类型数据上训练的单个模型比在来自单个机器人类型数据上训练的模型在多个机器人上的性能要好得多。

深度学习巨头DeepMind在ImageNet数据集上取得突破性进展，为机器人研究带来新的里程碑

值得一提的是，这项研究并非由 DeepMind 独立完成，而是他们与 33 家学术实验室通力合作的结果。他们致力于以开放和负责任的方式开发这项技术。

目前，Open X-Embodiment 数据集和 RT-1-X 模型检查点已经对广泛的研究社区开放。

英伟达高级人工智能科学家Jim Fan表示今天可能是机器人的ImageNet时刻。

深度学习巨头DeepMind在ImageNet数据集上取得突破性进展，为机器人研究带来新的里程碑

谷歌研究员Karol Hausman也表达了同样的感叹：机器人的ImageNet时刻终于到来了。

深度学习巨头DeepMind在ImageNet数据集上取得突破性进展，为机器人研究带来新的里程碑

Movie Gen

Movie Gen 是 Meta 公司最新推出的AI视频生成大模型

下载

Open X-Embodiment 数据集，机器人的 ImageNet 时刻

数据集以及基于数据集训练的模型在推进 AI 进步方面发挥了关键作用。正如 ImageNet 推动了计算机视觉的研究，Open X-Embodiment 同样推动了机器人技术的发展。

一直以来，构建多样化数据集是训练通用模型的关键，这些训练好的模型可以控制许多不同类型的机器人，遵循不同的指令，对复杂任务进行基本推理，并有效地进行泛化。然而，对于任何单个实验室来说，收集这样的数据集都过于耗费资源。

为此，DeepMind 与 33 家机构的学术研究实验室展开合作，从而构建了 Open X-Embodiment 数据集。他们从 22 个机器人实例中收集数据，这些数据涵盖超过 100 万个片段，展示了机器人 500 多项技能和在 150000 项任务上的表现。该数据集是同类中最全面的机器人数据集。

^{来自 Open X-Embodiment 数据集的样本，包括 500 多种技能和 150000 个任务。}

^{Open X-Embodiment 基本信息}

RT-1-X：成功率提升 50%

RT-X 基于两个 robotics transformer（RT）模型构建而成。

具体而言，他们使用 RT-1 训练 RT-1-X，其中 RT-1 是建立在 Transformer 架构上的 35M 参数网络，专为机器人控制而设计，如图 3 所示。

此外，他们还在 RT-2 上训练 RT-2-X，其中 RT-2 是一系列大型视觉语言动作模型 (VLA)，在互联网规模的视觉和语言数据以及机器人控制数据上训练而成。

为了评估 RT-1-X，DeepMind 将其与在特定任务上（例如开门）开发的模型进行了比较。结果显示，使用 Open X-Embodiment 数据集训练的 RT-1-X 平均性能优于原始模型 50%。

^{RT-1-X 平均成功率比原始方法提高 50%。}

深度学习巨头DeepMind在ImageNet数据集上取得突破性进展，为机器人研究带来新的里程碑

^{来自不同合作机构的关于 RT-1-X 的效果展示}

RT-2-X：无障碍解锁新技能

为了研究 RT-X 的知识迁移能力，DeepMind 又进行了其他实验。这些实验涉及 RT-2 数据集中不存在的对象和技能，但这些对象和技能存在于另一个机器人的数据集中。结果表明，在掌握新技能方面，RT-2-X 的成功率是其之前的最佳模型 RT-2 的三倍。这也说明了，与其他平台的数据进行联合训练可以为 RT-2-X 赋予原始数据集中不存在的额外技能，使其能够执行新颖的任务。

^{上图展示了 RT-2-X 对物体之间空间关系的理解。}

深度学习巨头DeepMind在ImageNet数据集上取得突破性进展，为机器人研究带来新的里程碑

一系列结果表明，RT-2-X 实现了 RT-2 以前无法实现的技能，包括对空间更好的理解。例如，如果我们要求机器人「将苹果移动到布料附近」、又或者要求机器人「将苹果移动到布料上」，为了实现目标要求，机器人会采取完全不同的轨迹。只需将介词从「near」更改为「on」，就可以调整机器人采取的动作。

RT-2-X 表明，将其他机器人的数据结合到 RT-2-X 训练中可以改善机器人的任务执行范围，但前提是使用足够高容量的架构。

深度学习巨头DeepMind在ImageNet数据集上取得突破性进展，为机器人研究带来新的里程碑

^{RT-2-X (55B): 迄今为止在学术实验室执行未知任务的最大模型之一}

研究启发：机器人需要相互学习，研究人员也一样

机器人研究正处于令人兴奋的早期阶段。DeepMind 的这项新研究表明，通过利用更多样化的数据和更好的模型进行扩展学习，有可能开发出更有用的辅助机器人。与世界各地的实验室合作并共享资源，对于以开放和负责任的方式推进机器人研究至关重要。DeepMind 希望通过开放数据源和提供安全但有限的模型来减少障碍，加快研究。机器人技术的未来有赖于机器人之间的相互学习，最重要的是，让研究人员能够相互学习。

这项工作证明，模型可以在不同环境下通用，无论是在谷歌 DeepMind 的机器人上，还是在世界各地不同大学的机器人上，其性能都得到了显著提高。未来的研究可以探索如何将这些进步与 RoboCat 的自我完善特性相结合，使模型能够根据自身经验不断改进。未来的另一个方向是进一步探索不同数据集的混合会如何影响跨具身智能体泛化，以及这种泛化是如何是实现的。

如果你想了解有关 RT-X 的更多信息，可以参考 DeepMind 发布的这篇论文：

论文链接：https://robotics-transformer-x.github.io/paper.pdf
项目链接：https://robotics-transformer-x.github.io/

^{参考链接：https://www.deepmind.com/blog/scaling-up-learning-across-many-different-robot-types}

贾跃亭：法拉第未来当前股价被严重低估目标价5美元

内存飙升成本暴涨汽车会涨价还是减配？

10家中国车企入围入围财富世界500强比亚迪进前百

关税压力下创纪录！韩国汽车年出口额达720亿美元

韩国2025年电动车销量首破20万辆中国产汽车大卖

相关专题

github中文官网入口 github中文版官网网页进入

github中文官网入口https://docs.github.com/zh/get-started，GitHub 是一种基于云的平台，可在其中存储、共享并与他人一起编写代码。通过将代码存储在GitHub 上的“存储库”中，你可以： “展示或共享”你的工作。持续“跟踪和管理”对代码的更改。

4212

2026.01.21

Python 自然语言处理（NLP）基础与实战

本专题系统讲解 Python 在自然语言处理（NLP）领域的基础方法与实战应用，涵盖文本预处理（分词、去停用词）、词性标注、命名实体识别、关键词提取、情感分析，以及常用 NLP 库（NLTK、spaCy）的核心用法。通过真实文本案例，帮助学习者掌握使用 Python 进行文本分析与语言数据处理的完整流程，适用于内容分析、舆情监测与智能文本应用场景。

418

2026.01.27

http与https有哪些区别

http与https的区别：1、协议安全性；2、连接方式；3、证书管理；4、连接状态；5、端口号；6、资源消耗；7、兼容性。本专题为大家提供相关的文章、下载、课程内容，供大家免费下载体验。

2910

2024.08.16

C# ASP.NET Core微服务架构与API网关实践

本专题围绕 C# 在现代后端架构中的微服务实践展开，系统讲解基于 ASP.NET Core 构建可扩展服务体系的核心方法。内容涵盖服务拆分策略、RESTful API 设计、服务间通信、API 网关统一入口管理以及服务治理机制。通过真实项目案例，帮助开发者掌握构建高可用微服务系统的关键技术，提高系统的可扩展性与维护效率。

2026.03.11

Go高并发任务调度与Goroutine池化实践

本专题围绕 Go 语言在高并发任务处理场景中的实践展开，系统讲解 Goroutine 调度模型、Channel 通信机制以及并发控制策略。内容包括任务队列设计、Goroutine 池化管理、资源限制控制以及并发任务的性能优化方法。通过实际案例演示，帮助开发者构建稳定高效的 Go 并发任务处理系统，提高系统在高负载环境下的处理能力与稳定性。

2026.03.10

Kotlin Android模块化架构与组件化开发实践

本专题围绕 Kotlin 在 Android 应用开发中的架构实践展开，重点讲解模块化设计与组件化开发的实现思路。内容包括项目模块拆分策略、公共组件封装、依赖管理优化、路由通信机制以及大型项目的工程化管理方法。通过真实项目案例分析，帮助开发者构建结构清晰、易扩展且维护成本低的 Android 应用架构体系，提升团队协作效率与项目迭代速度。

2026.03.09

JavaScript浏览器渲染机制与前端性能优化实践

本专题围绕 JavaScript 在浏览器中的执行与渲染机制展开，系统讲解 DOM 构建、CSSOM 解析、重排与重绘原理，以及关键渲染路径优化方法。内容涵盖事件循环机制、异步任务调度、资源加载优化、代码拆分与懒加载等性能优化策略。通过真实前端项目案例，帮助开发者理解浏览器底层工作原理，并掌握提升网页加载速度与交互体验的实用技巧。

2026.03.06

Rust内存安全机制与所有权模型深度实践

本专题围绕 Rust 语言核心特性展开，深入讲解所有权机制、借用规则、生命周期管理以及智能指针等关键概念。通过系统级开发案例，分析内存安全保障原理与零成本抽象优势，并结合并发场景讲解 Send 与 Sync 特性实现机制。帮助开发者真正理解 Rust 的设计哲学，掌握在高性能与安全性并重场景中的工程实践能力。

223

2026.03.05

PHP高性能API设计与Laravel服务架构实践

本专题围绕 PHP 在现代 Web 后端开发中的高性能实践展开，重点讲解基于 Laravel 框架构建可扩展 API 服务的核心方法。内容涵盖路由与中间件机制、服务容器与依赖注入、接口版本管理、缓存策略设计以及队列异步处理方案。同时结合高并发场景，深入分析性能瓶颈定位与优化思路，帮助开发者构建稳定、高效、易维护的 PHP 后端服务体系。

458

2026.03.04

热门下载

网站特效

网站源码

网站素材

前端模板