0

0

导航、采矿、建造,北大这个新智能体把《我的世界》玩透了

DDD

DDD

发布时间:2024-10-30 22:26:00

|

1271人浏览过

|

来源于机器之心

转载

☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜

导航、采矿、建造,北大这个新智能体把《我的世界》玩透了
AIxiv专栏是本站发布学术、技术内容的栏目。过去数年,本站AIxiv专栏接收报道了2000多篇内容,覆盖全球各大高校与企业的顶级实验室,有效促进了学术交流与传播。如果您有优秀的工作想要分享,欢迎投稿或者联系报道。投稿邮箱:liyazhou@jiqizhixin.com;zhaoyunfeng@jiqizhixin.com

该研究成果由来自北京大学的蔡少斐、王子豪、连可为、牟湛存、来自北京通用人工智能研究院的马晓健研究员、来自加州大学洛杉矶分校的刘安吉共同完成。通讯作者为北京大学助理教授梁一韬。所有作者均隶属 CraftJarvis 研究团队。

在游戏和机器人研究领域,让智能体在开放世界环境中实现有效的交互,一直是令人兴奋却困难重重的挑战。想象一下,智能体在《我的世界(Minecraft)》这样的环境中,不仅要识别和理解复杂的视觉信息,还需要利用鼠标和键盘精细地控制游戏画面,快速做出反应,完成像导航、采矿、建造、与生物互动等任务。面对如此庞大且复杂的交互空间,如何能让智能体能理解并执行人类的意图呢?
导航、采矿、建造,北大这个新智能体把《我的世界》玩透了
针对这个问题,CraftJarvis 团队提出利用 VLMs (视觉语言模型)强大的视觉语言推理能力来指导任务的完成,并创新地提出了一种基于视觉 - 时间上下文提示(Visual-Temporal Context Prompting)的任务表示方法。该方法允许人类或 VLMs 在当前和历史游戏画面中将希望进行交互的物体分割出来,来传达具体的交互意图。为了将交互意图映射为具体的鼠标键盘操作,该团队进一步训练了一个以物体分割为条件的底层策略 ROCKET-1。这种融合了视觉 - 时间上下文提示的智能体架构为开放世界的交互奠定了基础,预示了未来游戏 AI 和机器人互动的新可能性。
导航、采矿、建造,北大这个新智能体把《我的世界》玩透了
  • 论文链接: https://arxiv.org/pdf/2410.17856

  • 项目主页: https://craftjarvis.github.io/ROCKET-1

导航、采矿、建造,北大这个新智能体把《我的世界》玩透了导航、采矿、建造,北大这个新智能体把《我的世界》玩透了导航、采矿、建造,北大这个新智能体把《我的世界》玩透了

讯飞智作-虚拟主播
讯飞智作-虚拟主播

讯飞智作是一款集AI配音、虚拟人视频生成、PPT生成视频、虚拟人定制等多功能的AI音视频生产平台。已广泛应用于媒体、教育、短视频等领域。

下载
研究创新点

视觉 - 时间上下文提示方法
导航、采矿、建造,北大这个新智能体把《我的世界》玩透了
                                架构对比图;(e) 为基于视觉 - 时间上下文提示的新型架构

视觉 - 时间上下文提示是一种全新的任务表达方式。通过整合智能体过去和当前的观察信息,该方法利用物体分割信息,为智能体提供空间和交互类型的线索,从而让低级策略能够准确识别和理解环境中的关键对象。这一创新使得智能体能够在执行任务时始终保持对目标对象的关注。

基于物体分割的条件策略 ROCKET-1
导航、采矿、建造,北大这个新智能体把《我的世界》玩透了
                                 基于因果 Transformer 实现的 ROCKET-1 架构

ROCKET-1 是一种基于视觉 - 时间上下文的低级策略,能够在视觉观察和分割掩码的支持下预测行动。通过使用 Transformer 模块,ROCKET-1 可以在部分可观测(Partially Observable)环境中推理过去和当前观测的依赖关系,实现精准的动作预测。与传统方法不同,ROCKET-1 能够处理细微的空间和时序变化,并始终关注要进行交互的物体,显著提升了与环境交互的成功率。

反向轨迹重标注策略
导航、采矿、建造,北大这个新智能体把《我的世界》玩透了
                               反向轨迹重标记流程示意

训练 ROCKET-1 需要收集大量带有物体分割的轨迹数据。传统的数据标注方法成本高、效率低,CraftJarvis 团队提出了一种逆向轨迹重标注方法,利用 SAM-2 的物体分割能力在倒放的视频中连续地对发生交互的物体生成分割注释。这种方法能够根据现有的交互事件重建数据集,使得 ROCKET-1 在离线条件下即可完成高效训练,减少了对人工标注的依赖,并为大规模数据处理提供了切实可行的解决方案。

充分释放预训练基础模型的能力
导航、采矿、建造,北大这个新智能体把《我的世界》玩透了
CraftJarvis 团队将具身决策所依赖的能力分解为视觉语言推理、视觉空间定位、物体追踪和实时动作预测,并巧妙地组合 GPT-4o、Molmo、SAM-2、ROCKET-1 加以解决。

为了应对复杂任务规划的挑战,该团队引入了 GPT-4o,目前最先进的视觉语言模型之一。可以进行强大的视觉语言推理,将复杂的任务分解为一系列具体的物体交互指令。此外,该团队采用了 Molmo 模型来将 GPT-4o 的交互意图翻译为观察图像中的坐标点,用以精确定位交互物体。

为了应对对象跟踪的挑战,该团队引入了 SAM-2,一个先进的视频分割模型。SAM-2 不仅能够通过点提示对物体进行分割,还可以在时间上连续追踪目标,即便物体在视野中消失或重新出现时也能有效保持跟踪。这为 ROCKET-1 提供了稳定的对象信息流,确保了在高频变化的环境中智能体的交互精度。

实验成果

为了验证 ROCKET-1 的交互能力,CraftJarvis 团队在《我的世界》中设计了一系列任务,包括采矿、放置物品、导航和与生物互动等。
导航、采矿、建造,北大这个新智能体把《我的世界》玩透了
                               《我的世界》交互任务评测集
导航、采矿、建造,北大这个新智能体把《我的世界》玩透了
                             ROCKET-1 评测结果

实验结果显示,ROCKET-1 在这些任务上,尤其在一些具有高空间敏感性的任务中,获得的成功率远高于现有方法(在多数任务上实现了高达 90% 的成功率提升),ROCKET-1 表现出了出色的泛化能力。即便在训练集中从未出现的任务(如将木门放到钻石块上),ROCKET-1 依然能够借助 SAM-2 的物体追踪能力完成指定目标,体现了其在未知场景中的适应性。

此外,该团队也设计了一些需要较为复杂的推理能力的长期任务,同样展示了这套方法的杰出性能。
导航、采矿、建造,北大这个新智能体把《我的世界》玩透了
                                  ROCKET-1 在解决任务时的截图
导航、采矿、建造,北大这个新智能体把《我的世界》玩透了
                                   需要依赖规划能力的长期任务性能结果

视觉 - 时间上下文方法的提出和 ROCKET-1 策略的开发不仅为 Minecraft 中的复杂任务带来了全新解决方案,也在通用机器人控制、通用视觉导航等领域展示了广泛的应用前景。

相关专题

更多
人工智能在生活中的应用
人工智能在生活中的应用

人工智能在生活中的应用有语音助手、无人驾驶、金融服务、医疗诊断、智能家居、智能推荐、自然语言处理和游戏设计等。本专题为大家提供人工智能相关的文章、下载、课程内容,供大家免费下载体验。

411

2023.08.17

人工智能的基本概念是什么
人工智能的基本概念是什么

人工智能的英文缩写为AI,是研究、开发用于模拟、延伸和扩展人的智能的理论、方法、技术及应用系统的一门新的技术科学;该领域的研究包括机器人、语言识别、图像识别、自然语言处理和专家系统等。本专题为大家提供相关的文章、下载、课程内容,供大家免费下载体验。

305

2024.01.09

人工智能不能取代人类的原因是什么
人工智能不能取代人类的原因是什么

人工智能不能取代人类的原因包括情感与意识、创造力与想象力、伦理与道德、社会交往与沟通能力、灵活性与适应性、持续学习和自我提升等。本专题为大家提供相关的文章、下载、课程内容,供大家免费下载体验。

628

2024.09.10

Python 人工智能
Python 人工智能

本专题聚焦 Python 在人工智能与机器学习领域的核心应用,系统讲解数据预处理、特征工程、监督与无监督学习、模型训练与评估、超参数调优等关键知识。通过实战案例(如房价预测、图像分类、文本情感分析),帮助学习者全面掌握 Python 机器学习模型的构建与实战能力。

34

2025.10.21

http与https有哪些区别
http与https有哪些区别

http与https的区别:1、协议安全性;2、连接方式;3、证书管理;4、连接状态;5、端口号;6、资源消耗;7、兼容性。本专题为大家提供相关的文章、下载、课程内容,供大家免费下载体验。

1990

2024.08.16

PHP WebSocket 实时通信开发
PHP WebSocket 实时通信开发

本专题系统讲解 PHP 在实时通信与长连接场景中的应用实践,涵盖 WebSocket 协议原理、服务端连接管理、消息推送机制、心跳检测、断线重连以及与前端的实时交互实现。通过聊天系统、实时通知等案例,帮助开发者掌握 使用 PHP 构建实时通信与推送服务的完整开发流程,适用于即时消息与高互动性应用场景。

3

2026.01.19

微信聊天记录删除恢复导出教程汇总
微信聊天记录删除恢复导出教程汇总

本专题整合了微信聊天记录相关教程大全,阅读专题下面的文章了解更多详细内容。

41

2026.01.18

高德地图升级方法汇总
高德地图升级方法汇总

本专题整合了高德地图升级相关教程,阅读专题下面的文章了解更多详细内容。

101

2026.01.16

全民K歌得高分教程大全
全民K歌得高分教程大全

本专题整合了全民K歌得高分技巧汇总,阅读专题下面的文章了解更多详细内容。

148

2026.01.16

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程
最新Python教程 从入门到精通
最新Python教程 从入门到精通

共4课时 | 4.8万人学习

Node.js 教程
Node.js 教程

共57课时 | 8.9万人学习

CSS3 教程
CSS3 教程

共18课时 | 4.7万人学习

关于我们 免责申明 举报中心 意见反馈 讲师合作 广告合作 最新更新
php中文网:公益在线php培训,帮助PHP学习者快速成长!
关注服务号 技术交流群
PHP中文网订阅号
每天精选资源文章推送

Copyright 2014-2026 https://www.php.cn/ All Rights Reserved | php.cn | 湘ICP备2023035733号