让Sora东京女郎唱歌、高启强变声罗翔，阿里人物口型视频生成绝了

王林

发布时间：2024-03-01 11:34:02

819人浏览过

来源于机器之心

转载

有了阿里的 emo，ai 生成或真实的图像「动起来说话或唱歌」变得更容易了。

最近，以 OpenAI Sora 为代表的文生视频模型又火了起来。

除了文本生成视频，以人为中心的视频合成一直备受关注。比如，专注于“说话人头部”的视频生成，其目标是根据用户提供的音频片段生成面部表情。

在技术层面上，生成表情需要准确捕捉说话者微妙且多样化的面部动作，这对于类似视频合成任务而言是一个巨大的挑战。

传统方法通常会施加一些限制以简化视频生成任务。例如，有些方法利用3D模型来约束面部关键点，另一些方法则从原始视频中提取头部运动序列以引导整体运动。尽管这些限制降低了视频生成的复杂性，但也会限制最终面部表情的丰富度和自然度。

最近在阿里智能计算研究院发表的一篇论文中，研究者着重探讨了音频提示与面部动作之间微妙的关联，以提高说话人头部视频的真实性、自然度和表现力。

研究者发现，传统方法通常无法充分捕捉不同说话人的面部表情和独特风格。因此，他们提出了 EMO（Emote Portrait Alive）框架，该框架通过音频 - 视频合成方法直接呈现面部表情，无需使用中间的3D模型或面部标志。

☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜

让Sora东京女郎唱歌、高启强变声罗翔，阿里人物口型视频生成绝了

论文标题：EMO: Emote Portrait Alive- Generating Expressive Portrait Videos with Audio2Video Diffusion Model under Weak Conditions
论文地址：https://arxiv.org/pdf/2402.17485.pdf
项目主页：https://humanaigc.github.io/emote-portrait-alive/

就效果而言，阿里的方法可以确保整个视频的无缝帧过渡，并保持身份一致，进而产生表现力强和更加逼真的角色化身视频，在表现力和真实感方面显著优于当前 SOTA 方法。

比如 EMO 可以让 Sora 生成的东京女郎角色开口唱歌，歌曲为英国 / 阿尔巴尼亚双国籍女歌手 Dua Lipa 演唱的《Don't Start Now》。EMO 支持包括英文、中文在内等不同语言的歌曲，可以直观地识别音频的音调变化，生成动态、表情丰富的 AI 角色化身。比如让 AI 绘画模型 ChilloutMix 生成的小姐姐唱陶喆的《Melody》。

EMO 还能让角色化身跟上快节奏的 Rap 歌曲，比如让小李子来一段美国说唱歌手 Eminem 的《哥斯拉》（Godzilla）。当然，EMO 不仅仅能让角色开口唱歌，还支持各种语言的口语音频，将不同风格的肖像画、绘画以及 3D 模型和 AI 生成的内容制作成栩栩如生的动画视频。比如奥黛丽赫本的谈话。

最后，EMO 还能实现不同角色之间的联动，比如《狂飙》高启强联动罗翔老师。

方法概览

给定人物肖像的单张参考图像，本文方法可以生成与输入语音音频片段同步的视频，还能保留人物非常自然的头部运动和生动的表情，并且与所提供的声音音频的音调变化相协调。通过创建一系列无缝的级联视频，该模型有助于生成具有一致身份和连贯运动的长时间说话肖像视频，这对于现实应用至关重要。

网络 Pipeline

方法概览如下图所示。主干网络接收多帧噪声潜在输入，并尝试在每个时间步骤中将它们去噪为连续的视频帧，主干网络具有与原始 SD 1.5 版本相似的 UNet 结构配置，具体而言

与之前的工作相似，为了确保生成帧之间的连续性，主干网络嵌入了时间模块。
为了保持生成帧中人像的 ID 一致性，研究者部署了一个与主干网络并行的 UNet 结构，称为 ReferenceNet，它输入参考图像以获取参考特征。
为了驱动角色说话时的动作，研究者使用了音频层来编码声音特征。

闪念贝壳
闪念贝壳是一款AI 驱动的智能语音笔记，随时随地用语音记录你的每一个想法。

下载
为了使说话角色的动作可控且稳定，研究者使用脸部定位器和速度层提供弱条件。

让Sora东京女郎唱歌、高启强变声罗翔，阿里人物口型视频生成绝了

对于主干网络，研究者没有使用提示嵌入，因此，他们将 SD 1.5 UNet 结构中的交叉注意力层调整为参考注意力层。这些修改后的层将从 ReferenceNet 获取的参考特征作为输入，而非文本嵌入。

训练策略

训练过程分为三个阶段：

第一阶段是图像预训练，其中主干网络、ReferenceNet 和面部定位器被纳入训练过程中，在这个阶段，主干网络以单一帧作为输入，而 ReferenceNet 处理来自同一视频剪辑的不同的、随机选择的帧。主干网络和 ReferenceNet 都从原始 SD 初始化权重。

在第二阶段，研究者引入了视频训练，并且加入了时间模块和音频层，从视频剪辑中采样 n+f 个连续帧，其中起始的 n 帧为运动帧。时间模块从 AnimateDiff 初始化权重。

最后一个阶段集成了速度层，研究者只在这个阶段训练时间模块和速度层。这种做法是为了故意忽略训练过程中的音频层。因为说话人的表情、嘴部运动和头部运动的频率主要受音频的影响。因此，这些元素之间似乎存在相关性，模型可能会根据速度信号而不是音频来驱动角色的运动。实验结果表明，同时训练速度层和音频层削弱了音频对角色运动的驱动能力。

实验结果

实验过程中参与比较的方法包括 Wav2Lip、SadTalker、DreamTalk。

图 3 展示了本文方法与先前方法的比较结果。可以观察到，当提供单个参考图像作为输入时，Wav2Lip 通常会合成模糊的嘴部区域并生成以静态头部姿态和最小眼部运动为特征的视频。就 DreamTalk 而言，其结果可能会扭曲原始面孔，也会限制面部表情和头部运动的范围。与 SadTalker 和 DreamTalk 相比，该研究提出的方法能够生成更大范围的头部运动和更生动的面部表情。

让Sora东京女郎唱歌、高启强变声罗翔，阿里人物口型视频生成绝了

该研究进一步探索了各种肖像风格的头像视频生成，如现实、动漫和 3D。这些角色使用相同的声音音频输入进行动画处理，结果显示，生成的视频在不同风格之间产生大致一致的唇形同步。

让Sora东京女郎唱歌、高启强变声罗翔，阿里人物口型视频生成绝了

图 5 表明本文方法在处理具有明显音调特征的音频时能够生成更丰富的面部表情和动作。例如下图第三行，高音调会引发角色更强烈、更生动的表情。此外，借助运动帧还可以扩展生成的视频，即根据输入音频的长度生成持续时间较长的视频。如图 5 和图 6 所示，本文方法即使在大幅运动中也能在扩展序列中保留角色的身份。

让Sora东京女郎唱歌、高启强变声罗翔，阿里人物口型视频生成绝了

表 1 结果表明本文方法在视频质量评估方面具有显著优势：

让Sora东京女郎唱歌、高启强变声罗翔，阿里人物口型视频生成绝了

AI生成活动现场的即时新闻稿

贾跃亭：法拉第未来当前股价被严重低估目标价5美元

内存飙升成本暴涨汽车会涨价还是减配？

10家中国车企入围入围财富世界500强比亚迪进前百

关税压力下创纪录！韩国汽车年出口额达720亿美元

相关专题

github中文官网入口 github中文版官网网页进入

github中文官网入口https://docs.github.com/zh/get-started，GitHub 是一种基于云的平台，可在其中存储、共享并与他人一起编写代码。通过将代码存储在GitHub 上的“存储库”中，你可以： “展示或共享”你的工作。持续“跟踪和管理”对代码的更改。

4331

2026.01.21

http与https有哪些区别

http与https的区别：1、协议安全性；2、连接方式；3、证书管理；4、连接状态；5、端口号；6、资源消耗；7、兼容性。本专题为大家提供相关的文章、下载、课程内容，供大家免费下载体验。

2922

2024.08.16

TypeScript类型系统进阶与大型前端项目实践

本专题围绕 TypeScript 在大型前端项目中的应用展开，深入讲解类型系统设计与工程化开发方法。内容包括泛型与高级类型、类型推断机制、声明文件编写、模块化结构设计以及代码规范管理。通过真实项目案例分析，帮助开发者构建类型安全、结构清晰、易维护的前端工程体系，提高团队协作效率与代码质量。

2026.03.13

Python异步编程与Asyncio高并发应用实践

本专题围绕 Python 异步编程模型展开，深入讲解 Asyncio 框架的核心原理与应用实践。内容包括事件循环机制、协程任务调度、异步 IO 处理以及并发任务管理策略。通过构建高并发网络请求与异步数据处理案例，帮助开发者掌握 Python 在高并发场景中的高效开发方法，并提升系统资源利用率与整体运行性能。

2026.03.12

C# ASP.NET Core微服务架构与API网关实践

本专题围绕 C# 在现代后端架构中的微服务实践展开，系统讲解基于 ASP.NET Core 构建可扩展服务体系的核心方法。内容涵盖服务拆分策略、RESTful API 设计、服务间通信、API 网关统一入口管理以及服务治理机制。通过真实项目案例，帮助开发者掌握构建高可用微服务系统的关键技术，提高系统的可扩展性与维护效率。

177

2026.03.11

Go高并发任务调度与Goroutine池化实践

本专题围绕 Go 语言在高并发任务处理场景中的实践展开，系统讲解 Goroutine 调度模型、Channel 通信机制以及并发控制策略。内容包括任务队列设计、Goroutine 池化管理、资源限制控制以及并发任务的性能优化方法。通过实际案例演示，帮助开发者构建稳定高效的 Go 并发任务处理系统，提高系统在高负载环境下的处理能力与稳定性。

2026.03.10

Kotlin Android模块化架构与组件化开发实践

本专题围绕 Kotlin 在 Android 应用开发中的架构实践展开，重点讲解模块化设计与组件化开发的实现思路。内容包括项目模块拆分策略、公共组件封装、依赖管理优化、路由通信机制以及大型项目的工程化管理方法。通过真实项目案例分析，帮助开发者构建结构清晰、易扩展且维护成本低的 Android 应用架构体系，提升团队协作效率与项目迭代速度。

2026.03.09

JavaScript浏览器渲染机制与前端性能优化实践

本专题围绕 JavaScript 在浏览器中的执行与渲染机制展开，系统讲解 DOM 构建、CSSOM 解析、重排与重绘原理，以及关键渲染路径优化方法。内容涵盖事件循环机制、异步任务调度、资源加载优化、代码拆分与懒加载等性能优化策略。通过真实前端项目案例，帮助开发者理解浏览器底层工作原理，并掌握提升网页加载速度与交互体验的实用技巧。

102

2026.03.06

Rust内存安全机制与所有权模型深度实践

本专题围绕 Rust 语言核心特性展开，深入讲解所有权机制、借用规则、生命周期管理以及智能指针等关键概念。通过系统级开发案例，分析内存安全保障原理与零成本抽象优势，并结合并发场景讲解 Send 与 Sync 特性实现机制。帮助开发者真正理解 Rust 的设计哲学，掌握在高性能与安全性并重场景中的工程实践能力。

227

2026.03.05

热门下载

网站特效

网站源码

网站素材

前端模板