让大模型看图比打字管用！NeurIPS 2023新研究提出多模态查询方法，准确率提升7.8%

WBOY

发布时间：2023-10-23 11:45:09

848人浏览过

来源于51CTO.COM

转载

大模型“识图”能力都这么强了，为啥还老找错东西？

例如，把长得不太像的蝙蝠和拍子搞混，又或是认不出一些数据集中的稀有鱼类……

这是因为，我们让大模型“找东西”时，往往输入的是文本。

如果描述有歧义或太偏门，像是“bat”（蝙蝠还是拍子？）或“魔鳉”（Cyprinodon diabolis），AI就会大为困惑。

这就导致用大模型做目标检测、尤其是开放世界（未知场景）目标检测任务时，效果往往没有想象中那么好。

现在，一篇被NeurIPS 2023收录的论文，终于解决了这个问题。

☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜

让大模型看图比打字管用！NeurIPS 2023新研究提出多模态查询方法，准确率提升7.8%

论文提出了一种基于多模态查询的目标检测方法MQ-Det，只需要给输入加上一个图片示例，就能让大模型找东西的准确率大幅提升。

在基准检测数据集LVIS上，无需下游任务模型微调，MQ-Det平均提升主流检测大模型GLIP精度约7.8%，在13个基准小样本下游任务上，平均提高了6.3%精度。

这究竟是怎么做到的？一起来看看。

以下内容转载自论文作者、知乎博主@沁园夏：

MQ-Det：多模态查询的开放世界目标检测大模型

论文名称：Multi-modal Queried Object Detection in the Wild

论文链接：https://www.php.cn/link/9c6947bd95ae487c81d4e19d3ed8cd6f

代码地址：https://www.php.cn/link/2307ac1cfee5db3a5402aac9db25cc5d

让大模型看图比打字管用！NeurIPS 2023新研究提出多模态查询方法，准确率提升7.8%

1.1 从文本查询到多模态查询

一图胜千言：随着图文预训练的兴起，借助文本的开放语义，目标检测逐渐步入了开放世界感知的阶段。为此，许多检测大模型都遵循了文本查询的模式，即利用类别文本描述在目标图像中查询潜在目标。然而，这种方式往往会面临“广而不精”的问题。

例如，（1）图1中的细粒度物体（鱼种）检测，往往很难用有限的文本来描述各种细粒度的鱼种，（2）类别歧义（“bat”既可指蝙蝠又可指拍子）。

然而，以上的问题均可通过图像示例来解决，相比文本，图像能够提供目标物体更丰富的特征线索，但同时文本又具备强大的泛化性。

由此，如何能够有机地结合两种查询方式，成为了一个很自然的想法。

获取多模态查询能力的难点：如何得到这样一个具备多模态查询的模型，存在三个挑战：（1）直接用有限的图像示例进行微调很容易造成灾难性遗忘；（2）从头训练一个检测大模型会具备较好的泛化性但是消耗巨大，例如，单卡训练GLIP 需要利用3000万数据量训练480 天。

多模态查询目标检测：基于以上考虑，作者提出了一种简单有效的模型设计和训练策略——MQ-Det。

MQ-Det在已有冻结的文本查询检测大模型基础上插入少量门控感知模块（GCP）来接收视觉示例的输入，同时设计了视觉条件掩码语言预测训练策略高效地得到高性能多模态查询的检测器。

1.2 MQ-Det即插即用的多模态查询模型架构

△图1 MQ-Det方法架构图

门控感知模块

如图1所示，作者在已有冻结的文本查询检测大模型的文本编码器端逐层插入了门控感知模块（GCP），GCP的工作模式可以用下面公式简洁地表示：

Otter.ai

一个自动的会议记录和笔记工具，会议内容生成和实时转录

下载

让大模型看图比打字管用！NeurIPS 2023新研究提出多模态查询方法，准确率提升7.8%

对于第i个类别，输入视觉示例Vi，其首先和目标图像I进行交叉注意力（X-MHA）得到让大模型看图比打字管用！NeurIPS 2023新研究提出多模态查询方法，准确率提升7.8% 以增广其表示能力，而后每个类别文本ti会和对应类别的视觉示例进行交叉注意力得到，之后通过一个门控模块gate将原始文本ti和视觉增广后文本融合，得到当前层的输出让大模型看图比打字管用！NeurIPS 2023新研究提出多模态查询方法，准确率提升7.8% 。这样的简单设计遵循了三点原则：（1）类别可扩展性；（2）语义补全性；（3）抗遗忘性，具体讨论可见原文。

1.3 MQ-Det高效训练策略

基于冻结语言查询检测器的调制训练

由于目前文本查询的预训练检测大模型本身就具备较好的泛化性，论文作者认为，只需要在原先文本特征基础上用视觉细节进行轻微地调整即可。

在文章中也有具体的实验论证发现，打开原始预训练模型参数后进行微调很容易带来灾难性遗忘的问题，反而失去了开放世界检测的能力。

由此，MQ-Det在冻结文本查询的预训练检测器基础上，仅调制训练插入的GCP模块，就可以高效地将视觉信息插入到现有文本查询的检测器中。

在论文中，作者分别将MQ-Det的结构设计和训练技术应用于目前的SOTA模型GLIP和GroundingDINO ，来验证方法的通用性。

以视觉为条件的掩码语言预测训练策略

作者还提出了一种视觉为条件的掩码语言预测训练策略，来解决冻结预训练模型带来的学习惰性的问题。

所谓学习惰性，即指检测器在训练过程中倾向于保持原始文本查询的特征，从而忽视新加入的视觉查询特征。

为此，MQ-Det在训练时随机地用[MASK] token来替代文本token，迫使模型向视觉查询特征侧学习，即：

让大模型看图比打字管用！NeurIPS 2023新研究提出多模态查询方法，准确率提升7.8%

这个策略虽然简单，但是却十分有效，从实验结果来看这个策略带来了显著的性能提升。

1.4 实验结果：Finetuning-free评估

Finetuning-free：相比传统零样本（zero-shot）评估仅利用类别文本进行测试，MQ-Det提出了一种更贴近实际的评估策略：finetuning-free。其定义为：在不进行任何下游微调的条件下，用户可以利用类别文本、图像示例、或者两者结合来进行目标检测。

在finetuning-free的设定下，MQ-Det对每个类别选用了5个视觉示例，同时结合类别文本进行目标检测，而现有的其他模型不支持视觉查询，只能用纯文本描述进行目标检测。下表展示了在LVIS MiniVal和LVIS v1.0上的检测结果。可以发现，多模态查询的引入大幅度提升了开放世界目标检测能力。

△表1 各个检测模型在LVIS基准数据集下的finetuning-free表现

从表1可以看到，MQ-GLIP-L在GLIP-L基础上提升了超过7%AP，效果十分显著！

1.5 实验结果：Few-shot评估

△表2 各个模型在35个检测任务ODinW-35以及其13个子集ODinW-13中的表现

作者还进一步在下游35个检测任务ODinW-35中进行了全面的实验。由表2可以看到，MQ-Det除了强大的finetuning-free表现，还具备良好的小样本检测能力，进一步印证了多模态查询的潜力。图2也展示了MQ-Det对于GLIP的显著提升。

△图2 数据利用效率对比；横轴：训练样本数量，纵轴：OdinW-13上的平均AP

1.6 多模态查询目标检测的前景

目标检测作为一个以实际应用为基础的研究领域，非常注重算法的落地。

尽管以往的纯文本查询目标检测模型展现出了良好的泛化性，但是在实际的开放世界检测中文本很难涵盖细粒度的信息，而图像中丰富的信息粒度完美地补全了这一环。

至此我们能够发现，文本泛而不精，图像精而不泛，如果能够有效地结合两者，即多模态查询，将会推动开放世界目标检测进一步向前迈进。

MQ-Det在多模态查询上迈出了第一步尝试，其显著的性能提升也昭示着多模态查询目标检测的巨大潜力。

同时，文本描述和视觉示例的引入为用户提供了更多的选择，使得目标检测更加灵活和用户友好。

WorkBuddy技能包运行失败怎么办_WorkBuddy技能执行错误解决办法

Perplexity如何使用Gemini模型_Perplexity多模型协作搜索教程【高级】

OpenClaw隐藏设置_OpenClaw隐藏配置详解【详解】

Perplexity自定义搜索范围_Perplexity Focus模式使用教程【核心】

GitHubCopilot与Codeium哪个好_GitHubCopilot功能差异说明【详解】

相关专题

登录token无效

登录token无效解决方法：1、检查token的有效期限，如果token已经过期，需要重新获取一个新的token；2、检查token的签名，如果签名不正确，需要重新获取一个新的token；3、检查密钥的正确性，如果密钥不正确，需要重新获取一个新的token；4、使用HTTPS协议传输token，建议使用HTTPS协议进行传输；5、使用双因素认证，双因素认证可以提高账户的安全性。

6631

2023.09.14

登录token无效怎么办

登录token无效的解决办法有检查Token是否过期、检查Token是否正确、检查Token是否被篡改、检查Token是否与用户匹配、清除缓存或Cookie、检查网络连接和服务器状态、重新登录或请求新的Token、联系技术支持或开发人员等。本专题为大家提供token相关的文章、下载、课程内容，供大家免费下载体验。

843

2023.09.14

token怎么获取

获取token值的方法：1、小程序调用“wx.login()”获取临时登录凭证code，并回传到开发者服务器；2、开发者服务器以code换取，用户唯一标识openid和会话密钥“session_key”。想了解更详细的内容，可以阅读本专题下面的文章。

1092

2023.12.21

token什么意思

token是一种用于表示用户权限、记录交易信息、支付虚拟货币的数字货币。可以用来在特定的网络上进行交易，用来购买或出售特定的虚拟货币，也可以用来支付特定的服务费用。想了解更多token什么意思的相关内容可以访问本专题下面的文章。

2200

2024.03.01

github中文官网入口 github中文版官网网页进入

github中文官网入口https://docs.github.com/zh/get-started，GitHub 是一种基于云的平台，可在其中存储、共享并与他人一起编写代码。通过将代码存储在GitHub 上的“存储库”中，你可以： “展示或共享”你的工作。持续“跟踪和管理”对代码的更改。

4298

2026.01.21

页面置换算法

页面置换算法是操作系统中用来决定在内存中哪些页面应该被换出以便为新的页面提供空间的算法。本专题为大家提供页面置换算法的相关文章，大家可以免费体验。

500

2023.08.14

http与https有哪些区别

http与https的区别：1、协议安全性；2、连接方式；3、证书管理；4、连接状态；5、端口号；6、资源消耗；7、兼容性。本专题为大家提供相关的文章、下载、课程内容，供大家免费下载体验。

2918

2024.08.16

TypeScript类型系统进阶与大型前端项目实践

本专题围绕 TypeScript 在大型前端项目中的应用展开，深入讲解类型系统设计与工程化开发方法。内容包括泛型与高级类型、类型推断机制、声明文件编写、模块化结构设计以及代码规范管理。通过真实项目案例分析，帮助开发者构建类型安全、结构清晰、易维护的前端工程体系，提高团队协作效率与代码质量。

2026.03.13

Python异步编程与Asyncio高并发应用实践

本专题围绕 Python 异步编程模型展开，深入讲解 Asyncio 框架的核心原理与应用实践。内容包括事件循环机制、协程任务调度、异步 IO 处理以及并发任务管理策略。通过构建高并发网络请求与异步数据处理案例，帮助开发者掌握 Python 在高并发场景中的高效开发方法，并提升系统资源利用率与整体运行性能。

2026.03.12

热门下载

网站特效

网站源码

网站素材

前端模板