NeRF新研究来了：3D场景无痕移除不需要对象，精确到毛发

王林

发布时间：2023-06-05 14:17:47

1448人浏览过

来源于51CTO.COM

转载

神经辐射场（nerf）已经成为一种流行的新视图合成方法。虽然 nerf 正在快速泛化到更广泛的应用以及数据集中，但直接编辑 nerf 的建模场景仍然是一个巨大的挑战。一个重要的任务是从 3d 场景中删除不需要的对象，并与其周围场景保持一致性，这个任务称为 3d 图像修复。在 3d 中，解决方案必须在多个视图中保持一致，并且在几何上具有有效性。

本文来自三星、多伦多大学等机构的研究人员提出了一种新的三维修复方法来解决这些挑战，在单个输入图像中给定一小组姿态图像和稀疏注释，提出的模型框架首先快速获得目标对象的三维分割掩码并使用该掩码，然后引入一种基于感知优化的方法，该方法利用学习到的二维图像再进行修复，将他们的信息提取到三维空间，同时确保视图的一致性。

该研究还通过训练一个很有挑战性的现实场景的数据集，给评估三维场景内修复方法带来了新的基准测试。特别是，该数据集包含了有或没有目标对象的同一场景的视图，从而使三维空间内修复任务能够进行更有原则的基准测试。

☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜

论文地址：https://arxiv.org/pdf/2211.12254.pdf
论文主页：https://spinnerf3d.github.io/

下面为效果展示，在移除一些对象后，还能与其周围场景保持一致性：

NeRF新研究来了：3D场景无痕移除不需要对象，精确到毛发

本文方法和其他方法的比较，其他方法存在明显的伪影，而本文的方法不是很明显：

NeRF新研究来了：3D场景无痕移除不需要对象，精确到毛发

方法介绍

作者通过一种集成的方法来应对三维场景编辑任务中的各种挑战，该方法获取场景的多视图图像，以用户输入提取到的 3D 掩码，并用 NeRF 训练来拟合到掩码图像中，这样目标对象就被合理的三维外观和几何形状取代。现有的交互式二维分割方法没有考虑三维方面的问题，而且目前基于 NeRF 的方法不能使用稀疏注释得到好的结果，也没有达到足够的精度。虽然目前一些基于 NeRF 的算法允许去除物体，但它们并不试图提供新生成的空间部分。据目前的研究进展，这个工作是第一个在单一框架中同时处理交互式多视图分割和完整的三维图像修复的方法。

研究者利用现成的、无 3D 的模型进行分割和图像修复，并以视图一致性的方式将其输出转移到 3D 空间。建立在 2D 交互式分割工作的基础上，作者所提出的模型从一个目标对象上的少量用户用鼠标标定的图像点开始。由此，他们的算法用一个基于视频的模型初始化掩码，并通过拟合一个语义掩码的 NeRF ，将其训练成一个连贯的 3D 分割。然后，再应用预先训练的二维图像修复到多视图图像集上，NeRF 拟合过程用于重建三维图像场景，利用感知损失去约束 2 维画图像的不一致，以及画深度图像规范化掩码的几何区域。总的来说，研究者们提供了一个完整的方法，从对象选择到嵌入的场景的新视图合成，在一个统一的框架中对用户的负担最小，如下图所示。

NeRF新研究来了：3D场景无痕移除不需要对象，精确到毛发

综上所述，这篇工作的贡献如下：

一个完整的 3D 场景操作过程，从用户交互的对象选择开始，到 3D 修复的 NeRF 场景结束；
将二维的分割模型扩展到多视图情况，能够从稀疏注释中恢复出具有三维一致的掩码；
确保视图一致性和感知合理性，一种新的基于优化的三维修复公式，利用二维图像修复；
一个新的用于三维编辑任务评估的数据集，包括相应的操作后的 Groud Truth。

具体到方法上面，该研究首先描述了如何从单视图注释中初始化一个粗略的 3D 掩码。将已标注的源代码视图表示为 I_1。将对象和源视图的稀疏信息给一个交互式分割模型，用来估计初始源对象掩码 NeRF新研究来了：3D场景无痕移除不需要对象，精确到毛发。然后将训练视图作为一个视频序列，与一起给出一个视频实例分割模型 V ，以计算，其中是 I_i 的对象掩码的初始猜测。初始的掩码通常在边界附近是不准确的，因为训练视图实际上并不是相邻的视频帧，而视频分割模型通常是未知 3D 的。

NeRF新研究来了：3D场景无痕移除不需要对象，精确到毛发

多视图分割模块获取输入的 RGB 图像、相应的相机内在和外部参数，以及初始掩码去训练一个语义 NeRF 。上图描述了语义 NeRF 中使用的网络；对于点 x 和视图目录 d，除了密度 σ 和颜色 c 外，它还返回一个 pre-sigmoid 型的对象 logit，s (x)。为了其快速收敛，研究者使用 instant-NGP 作为他们的 NeRF 架构。与光线 r 相关联的期望客观性是通过在等式中呈现 r 上的点的对数而不是它们相对于密度的颜色而得到的：

NeRF新研究来了：3D场景无痕移除不需要对象，精确到毛发

然后使用分类损失进行监督：

NeRF新研究来了：3D场景无痕移除不需要对象，精确到毛发

用于监督基于 NeRF 的多视图分割模型的总体损失为：

NeRF新研究来了：3D场景无痕移除不需要对象，精确到毛发

最后，采用两个阶段进行优化，进一步改进掩码；在获得初始三维掩码后，从训练视图呈现掩码，并用于监督二次多视图分割模型作为初始假设（而不是视频分割输出）。

NeRF新研究来了：3D场景无痕移除不需要对象，精确到毛发

上图显示了视图一致的修复方法概述。由于数据的缺乏妨碍了直接训练三维修改修复模型，该研究利用现有的二维修复模型来获得深度和外观先验，然后监督 NeRF 对完整场景的渲染拟合。这个嵌入的 NeRF 使用以下损失进行训练：

NeRF新研究来了：3D场景无痕移除不需要对象，精确到毛发

该研究提出具有视图一致性的修复方法，输入为 RGB。首先，该研究将图像和掩码对传输给图像修复器以获得 RGB 图像。由于每个视图都是独立修复的，因此直接使用修复完的视图监督 NeRF 的重建。本文中，研究者并没有使用均方误差（MSE）作为 loss 生成掩码，而是建议使用感知损失 LPIPS 来优化图像的掩码部分，同时仍然使用 MSE 来优化未掩码部分。该损失的计算方法如下：

NeRF新研究来了：3D场景无痕移除不需要对象，精确到毛发

即使有感知损失，修复视图之间的差异也会错误地引导模型收敛到低质量几何（例如，摄像机附近可能形成 “模糊” 几何测量，以解释每个视图的不同信息）。因此，研究员使用已生成的深度图作为 NeRF 模型的额外指导，并在计算感知损失时分离权值，使用感知损失只拟合场景的颜色。为此，研究者使用了一个对包含不需要的对象的图像进行了优化的 NeRF，并渲染了与训练视图对应的深度图。其计算方法是用到相机的距离而不是点的颜色代替的方法：

NeRF新研究来了：3D场景无痕移除不需要对象，精确到毛发

然后将渲染的深度输入到修复器模型，以获得修复完的深度图。研究发现，使用 LaMa 进行深度绘制，如 RGB，可以得到足够高质量的结果。这个 NeRF 可以是与用于多视图分割的相同模型，若使用其他来源来获取掩码，如人工注释的掩码，一个新的 NeRF 将被安装到场景中。然后，这些深度图被用来监督已修复的 NeRF 的几何形状，通过其渲染深度然后将渲染的深度输入到修复器模型，以获得修复完的深度图。研究发现，使用 LaMa 进行深度绘制，如 RGB，可以得到足够高质量的结果。这个 NeRF 可以是与用于多视图分割的相同模型，若使用其他来源来获取掩码，如人工注释的掩码，一个新的 NeRF 将被安装到场景中。然后，这些深度图被用来监督已修复的 NeRF 的几何形状，通过其渲染深度到修复的深度的 NeRF新研究来了：3D场景无痕移除不需要对象，精确到毛发到修复的深度的距离：

NeRF新研究来了：3D场景无痕移除不需要对象，精确到毛发

实验结果

多视图分割：首先评估 MVSeg 模型，没有任何编辑修复。在本实验中，假设稀疏图像点已经给出了一个现成的交互式分割模型，并且源掩码是可用的。因此，该任务是将源掩码传输到其他视图中。下表显示，新模型优于 2D（3D 不一致）和 3D 基线。此外研究者提出的两阶段优化有助于进一步改进所得到的掩码。

NeRF新研究来了：3D场景无痕移除不需要对象，精确到毛发

定性分析来说，下图将研究人员的分割模型的结果与 NVOS 和一些视频分割方法的输出进行了比较。与 3D 视频分割模型的粗边相比，他们的模型降低了噪声并提高了视图的一致性。虽然 NVOS 使用涂鸦（scribbles）不是研究者新模型中使用的稀疏点，但新模型的 MVSeg 在视觉上优于 NVOS。由于 NVOS 代码库不可用，研究人员复制了已发布的 NVOS 的定性结果（更多的例子请参见补充文档）。

NeRF新研究来了：3D场景无痕移除不需要对象，精确到毛发

下表显示了 MV 方法与基线的比较，总的来说，新提出的方法明显优于其他二维和三维修复方法。下表进一步显示，去除几何图形结构的引导会降低已修复的场景质量。

NeRF新研究来了：3D场景无痕移除不需要对象，精确到毛发

定性结果如图 6、图 7 所示。图 6 表明，本文方法可以重建具有详细纹理的视图一致场景，包括有光泽和无光泽表面的连贯视图。图 7 表明，本文的感知方法减少了掩码区域的精确重建约束，从而在使用所有图像时防止了模糊的出现，同时也避免了单视图监督造成的伪影。

NeRF新研究来了：3D场景无痕移除不需要对象，精确到毛发

ColorMagic

AI调色板生成工具

下载

aishort平台是什么新手怎么快速上手_aishort基础功能使用入门指南【指南】

如何提高多任务处理的工作效率利用Notion AI构建自动化工作流看板

Cleanvoice AI自动删除口头禅怎么开启_功能使用方法是什么【说明】

WorkBuddy是什么怎么快速上手_WorkBuddy基础功能快速入门说明

Cursor代码重构怎么使用AI辅助_优化方法是什么【技巧】

相关专题

C# ASP.NET Core微服务架构与API网关实践

本专题围绕 C# 在现代后端架构中的微服务实践展开，系统讲解基于 ASP.NET Core 构建可扩展服务体系的核心方法。内容涵盖服务拆分策略、RESTful API 设计、服务间通信、API 网关统一入口管理以及服务治理机制。通过真实项目案例，帮助开发者掌握构建高可用微服务系统的关键技术，提高系统的可扩展性与维护效率。

2026.03.11

Go高并发任务调度与Goroutine池化实践

本专题围绕 Go 语言在高并发任务处理场景中的实践展开，系统讲解 Goroutine 调度模型、Channel 通信机制以及并发控制策略。内容包括任务队列设计、Goroutine 池化管理、资源限制控制以及并发任务的性能优化方法。通过实际案例演示，帮助开发者构建稳定高效的 Go 并发任务处理系统，提高系统在高负载环境下的处理能力与稳定性。

2026.03.10

Kotlin Android模块化架构与组件化开发实践

本专题围绕 Kotlin 在 Android 应用开发中的架构实践展开，重点讲解模块化设计与组件化开发的实现思路。内容包括项目模块拆分策略、公共组件封装、依赖管理优化、路由通信机制以及大型项目的工程化管理方法。通过真实项目案例分析，帮助开发者构建结构清晰、易扩展且维护成本低的 Android 应用架构体系，提升团队协作效率与项目迭代速度。

2026.03.09

JavaScript浏览器渲染机制与前端性能优化实践

本专题围绕 JavaScript 在浏览器中的执行与渲染机制展开，系统讲解 DOM 构建、CSSOM 解析、重排与重绘原理，以及关键渲染路径优化方法。内容涵盖事件循环机制、异步任务调度、资源加载优化、代码拆分与懒加载等性能优化策略。通过真实前端项目案例，帮助开发者理解浏览器底层工作原理，并掌握提升网页加载速度与交互体验的实用技巧。

2026.03.06

Rust内存安全机制与所有权模型深度实践

本专题围绕 Rust 语言核心特性展开，深入讲解所有权机制、借用规则、生命周期管理以及智能指针等关键概念。通过系统级开发案例，分析内存安全保障原理与零成本抽象优势，并结合并发场景讲解 Send 与 Sync 特性实现机制。帮助开发者真正理解 Rust 的设计哲学，掌握在高性能与安全性并重场景中的工程实践能力。

218

2026.03.05

PHP高性能API设计与Laravel服务架构实践

本专题围绕 PHP 在现代 Web 后端开发中的高性能实践展开，重点讲解基于 Laravel 框架构建可扩展 API 服务的核心方法。内容涵盖路由与中间件机制、服务容器与依赖注入、接口版本管理、缓存策略设计以及队列异步处理方案。同时结合高并发场景，深入分析性能瓶颈定位与优化思路，帮助开发者构建稳定、高效、易维护的 PHP 后端服务体系。

420

2026.03.04

AI安装教程大全

2026最全AI工具安装教程专题：包含各版本AI绘图、AI视频、智能办公软件的本地化部署手册。全篇零基础友好，附带最新模型下载地址、一键安装脚本及常见报错修复方案。每日更新，收藏这一篇就够了，让AI安装不再报错！

168

2026.03.04

Swift iOS架构设计与MVVM模式实战

本专题聚焦 Swift 在 iOS 应用架构设计中的实践，系统讲解 MVVM 模式的核心思想、数据绑定机制、模块拆分策略以及组件化开发方法。内容涵盖网络层封装、状态管理、依赖注入与性能优化技巧。通过完整项目案例，帮助开发者构建结构清晰、可维护性强的 iOS 应用架构体系。

222

2026.03.03

C++高性能网络编程与Reactor模型实践

本专题围绕 C++ 在高性能网络服务开发中的应用展开，深入讲解 Socket 编程、多路复用机制、Reactor 模型设计原理以及线程池协作策略。内容涵盖 epoll 实现机制、内存管理优化、连接管理策略与高并发场景下的性能调优方法。通过构建高并发网络服务器实战案例，帮助开发者掌握 C++ 在底层系统与网络通信领域的核心技术。

2026.03.03

热门下载

网站特效

网站源码

网站素材

前端模板