Up主已经开始鬼畜，腾讯开源「AniPortrait」让照片唱歌说话-人工智能-PHP中文网

首页

科技周边

人工智能

Up主已经开始鬼畜，腾讯开源「AniPortrait」让照片唱歌说话

王林

Apr 07, 2024 am 09:01 AM

腾讯产业

AniPortrait 模型是开源的，可以自由畅玩。

「小破站鬼畜区的新质生产力工具。」

近日，腾讯开源发布的一个新项目在推上获得了如此评价。这个项目是 AniPortrait，其可基于音频和一张参考图像生成高质量动画人像。

话不说多，我们先看看可能会被律师函警告的 demo：

动漫图像也能轻松开口说话：

该项目刚上线几天，就已经收获了广泛好评：GitHub Star 数已经突破 2800。

Up主已经开始鬼畜，腾讯开源「AniPortrait」让照片唱歌说话

下面我们来看看 AniPortrait 的创新之处。

Up主已经开始鬼畜，腾讯开源「AniPortrait」让照片唱歌说话

论文标题：AniPortrait: Audio-Driven Synthesis of Photorealistic Portrait Animation
论文地址：https://arxiv.org/pdf/2403.17694.pdf
代码地址：https://github.com/Zejun-Yang/AniPortrait

AniPortrait

腾讯新提出的 AniPortrait 框架包含两个模块：Audio2Lmk 和 Lmk2Video。

Audio2Lmk 的作用是提取 Landmark 序列，其能从音频输入捕获复杂的面部表情和嘴唇动作。Lmk2Video 是利用这种 Landmark 序列来生成时间上稳定一致的高质量人像视频。

图 1 给出了 AniPortrait 框架的概况。

Up主已经开始鬼畜，腾讯开源「AniPortrait」让照片唱歌说话

Audio2Lmk

对于一段语音片段序列，这里的目标是预测对应的 3D 人脸网格序列和姿势序列。

该团队采用了预训练的 wav2vec 来提取音频特征。该模型具有很好的泛化性能，并且可以准确识别音频中的发音和语调 —— 这对生成具有真实感的人脸动画来说至关重要。通过利用所获得的鲁棒的语音特征，使用一种包含两个 fc 层的简单架构就可以有效地将它们转换成 3D 人脸网格。该团队观察到，这种简单直接的设计不仅能确保准确度，而且还能提升推理过程的效率。

在将音频转换成姿势的任务中，该团队使用的骨干网络依然是同样的 wav2vec。但是，这一个网络的权重不同于音频到网格模块的网络。这是因为：姿势与音频中的节奏和音调的关联更加紧密，而音频到网格任务关注的重点（发音和语调）却不一样。为了将之前状态的影响纳入考量，该团队采用了一个 transformer 解码器来解码姿势序列。在这个过程中，该模块使用交叉注意力机制将音频特征整合进解码器。对于上述两个模块，训练使用的损失函数都是简单的 L1 损失。

在获得了网格和姿势序列之后，再使用透视投影将它们转换为 2D 的人脸 Landmark 序列。这些 Landmark 是下一阶段的输入信号。

Lmk2Video

给定一张参考人像和一个人脸 Landmark 序列，该团队提出的 Lmk2Video 可以创建具有时间一致性的人像动画。这个动画过程是将动作与 Landmark 序列对齐，同时维持与参考图像一致的外观。该团队采取的思路是将人像动画表示成一个人像帧构成的序列。

Lmk2Video 的这种网络结构设计的灵感来自 AnimateAnyone。其中的骨干网络是 SD1.5，其整合了一个时间运动模块，能有效地将多帧噪声输入转换成一个视频帧序列。

另外，他们还使用了一个 ReferenceNet，其同样采用了 SD1.5 的结构，作用是提取参考图像的外观信息并将其整合进骨干网络中。这一策略设计可确保人脸 ID 在整个输出视频中保持一致。

不同于 AnimateAnyone，这里提升了 PoseGuider 的设计的复杂性。原来的版本只是集成了几个卷积层，之后 Landmark 特征与骨干网络的输入层的隐含特征融合。而腾讯的这个团队发现，这种初级设计无法捕获嘴唇的复杂运动。因此，他们采用了 ControlNet 的多尺度策略：将相应尺度的 Landmark 特征整合进骨干网络的不同模块。尽管有这些改进，但最终模型的参数数量依然相当低。

该团队还引入了另一项改进：将参考图像的 Landmark 用作一个额外的输入。PoseGuider 的交叉注意力模块能促进参考 Landmark 和每一帧的目标 Landmark 之间的互动。这一过程能为网络提供额外的线索，使其能够理解人脸 Landmark 和外观之间的关联，由此可帮助人像动画生成更精准的动作。

实验

实现细节

Audio2Lmk 阶段使用的骨干网络是 wav2vec2.0。用于提取 3D 网格和 6D 姿势的工具是 MediaPipe。Audio2Mesh 的训练数据来自腾讯的内部数据集，其中包含接近一个小时的来自单个说话人的高质量语音数据。

为了确保 MediaPipe 提取出的 3D 网格的稳定性，在记录期间，表演者头部位置稳定并且面向相机。训练 Audio2Pose 使用的是 HDTF。所有的训练操作都在单台 A100 上执行，使用了 Adam 优化器，学习率设置为 1e-5.

Lmk2Video 过程则采用了一种两步式训练方法。

起始步骤阶段关注的重点是训练骨干网络 ReferenceNet 以及 PoseGuider 的 2D 组件，而不管运动模块。在后续步骤，则会冻结其它所有组件，专注于训练运动模块。为了训练模型，这里使用了两个大规模高质量人脸视频数据集：VFHQ 和 CelebV-HQ。所有数据都经由 MediaPipe 来提取 2D 人脸 Landmark。为了提升网络对嘴唇运动的敏感性，该团队的做法是在根据 2D Landmark 渲染姿势图像时，给上下唇标注不同的颜色。

所有图像的分辨率都重新调整成了 512x512。该模型的训练使用了 4 台 A100 GPU，每一步都耗时 2 天。优化器是 AdamW，学习率固定为 1e-5。

实验结果

如图 2 所示，新方法得到的动画在质量和真实度上都非常出色。

Up主已经开始鬼畜，腾讯开源「AniPortrait」让照片唱歌说话

此外，用户还可以编辑其中间的 3D 表征，从而对最终输出进行修改。举个例子，用户可从某个源提取 Landmark 并修改其 ID 信息，从而实现面部重现效果，如下视频所示：

更多细节请参考原论文。

以上是Up主已经开始鬼畜，腾讯开源「AniPortrait」让照片唱歌说话的详细内容。更多信息请关注PHP中文网其他相关文章！

本站声明

本文内容由网友自发贡献，版权归原作者所有，本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容，请联系admin@php.cn

热AI工具

Undresser.AI Undress

人工智能驱动的应用程序，用于创建逼真的裸体照片

AI Clothes Remover

用于从照片中去除衣服的在线人工智能工具。

Undress AI Tool

免费脱衣服图片

Clothoff.io

AI脱衣机

AI Hentai Generator

免费生成ai无尽的。

显示更多

热工具

记事本++7.3.1

好用且免费的代码编辑器

SublimeText3汉化版

中文版，非常好用

禅工作室 13.0.1

功能强大的PHP集成开发环境

Dreamweaver CS6

视觉化网页开发工具

SublimeText3 Mac版

神级代码编辑软件(SublimeText3)

显示更多

热门话题

gmail邮箱登陆入口在哪里

7444

CakePHP 教程

1371

steam的账户名称是什么格式

win11激活密钥永久

NYT连接提示和答案

显示更多

Related knowledge

DeepMind机器人打乒乓球，正手、反手溜到飞起，全胜人类初学者 Aug 09, 2024 pm 04:01 PM

但可能打不过公园里的老大爷？巴黎奥运会正在如火如荼地进行中，乒乓球项目备受关注。与此同时，机器人打乒乓球也取得了新突破。刚刚，DeepMind提出了第一个在竞技乒乓球比赛中达到人类业余选手水平的学习型机器人智能体。论文地址：https://arxiv.org/pdf/2408.03906DeepMind这个机器人打乒乓球什么水平呢？大概和人类业余选手不相上下：正手反手都会：对手采用多种打法，该机器人也能招架得住：接不同旋转的发球：不过，比赛激烈程度似乎不如公园老大爷对战。对机器人来说，乒乓球运动

首配机械爪！元萝卜亮相2024世界机器人大会，发布首个走进家庭的国际象棋机器人 Aug 21, 2024 pm 07:33 PM

8月21日，2024世界机器人大会在北京隆重召开。商汤科技旗下家用机器人品牌“元萝卜SenseRobot”家族全系产品集体亮相，并最新发布元萝卜AI下棋机器人——国际象棋专业版（以下简称“元萝卜国象机器人”），成为全球首个走进家庭的国际象棋机器人。作为元萝卜的第三款下棋机器人产品，全新的国象机器人在AI和工程机械方面进行了大量专项技术升级和创新，首次在家用机器人上实现了通过机械爪拾取立体棋子，并进行人机对弈、人人对弈、记谱复盘等功能，

Claude也变懒了！网友：学会给自己放假了 Sep 02, 2024 pm 01:56 PM

开学将至，该收心的不止有即将开启新学期的同学，可能还有AI大模型。前段时间，Reddit上挤满了吐槽Claude越来越懒的网友。「它的水平下降了很多，经常停顿，甚至输出也变得很短。在发布的第一周，它可以一次性翻译整整4页文稿，现在连半页都输出不了了！」https://www.reddit.com/r/ClaudeAI/comments/1by8rw8/something_just_feels_wrong_with_claude_in_the/在一个名为「对Claude彻底失望了的帖子里」，满满地

世界机器人大会上，这家承载「未来养老希望」的国产机器人被包围了 Aug 22, 2024 pm 10:35 PM

正在北京举行的世界机器人大会上，人形机器人的展示成为了现场绝对的焦点，在星尘智能的展台上，由于AI机器人助理S1在一个展区上演扬琴、武术、书法三台大戏，能文能武，吸引了大量专业观众和媒体的驻足。在带弹性的琴弦上的优雅演奏，让S1展现出速度、力度、精度兼具的精细操作和绝对掌控。央视新闻对「书法」背后的模仿学习和智能控制进行了专题报道，公司创始人来杰解释到，丝滑动作的背后，是硬件侧追求最好力控和最仿人身体指标（速度、负载等），而是在AI侧则采集人的真实动作数据，让机器人遇强则强，快速学习进化。而敏捷

李飞飞团队提出ReKep，让机器人具备空间智能，还能整合GPT-4o Sep 03, 2024 pm 05:18 PM

视觉与机器人学习的深度融合。当两只机器手丝滑地互相合作叠衣服、倒茶、将鞋子打包时，加上最近老上头条的1X人形机器人NEO，你可能会产生一种感觉：我们似乎开始进入机器人时代了。事实上，这些丝滑动作正是先进机器人技术+精妙框架设计+多模态大模型的产物。我们知道，有用的机器人往往需要与环境进行复杂精妙的交互，而环境则可被表示成空间域和时间域上的约束。举个例子，如果要让机器人倒茶，那么机器人首先需要抓住茶壶手柄并使之保持直立，不泼洒出茶水，然后平稳移动，一直到让壶口与杯口对齐，之后以一定角度倾斜茶壶。这

ACL 2024奖项公布：华科大破译甲骨文最佳论文之一、GloVe时间检验奖 Aug 15, 2024 pm 04:37 PM

本届ACL大会，投稿者「收获满满」。为期六天的ACL2024正在泰国曼谷举办。ACL是计算语言学和自然语言处理领域的顶级国际会议，由国际计算语言学协会组织，每年举办一次。一直以来，ACL在NLP领域的学术影响力都位列第一，它也是CCF-A类推荐会议。今年的ACL大会已是第62届，接收了400余篇NLP领域的前沿工作。昨天下午，大会公布了最佳论文等奖项。此次，最佳论文奖7篇（两篇未公开）、最佳主题论文奖1篇、杰出论文奖35篇。大会还评出了资源论文奖（ResourceAward）3篇、社会影响力奖（

鸿蒙智行享界S9及全场景新品发布会，多款重磅新品齐发 Aug 08, 2024 am 07:02 AM

今天下午，鸿蒙智行正式迎来了新品牌与新车。 8月6日，华为举行鸿蒙智行享界S9及华为全场景新品发布会，带来了全景智慧旗舰轿车享界S9、问界新M7Pro和华为novaFlip、MatePadPro12.2英寸、全新MatePadAir、华为毕升激光打印机X1系列、FreeBuds6i、WATCHFIT3和智慧屏S5Pro等多款全场景智慧新品，从智慧出行、智慧办公到智能穿戴，华为全场景智慧生态持续构建，为消费者带来万物互联的智慧体验。鸿蒙智行：深度赋能，推动智能汽车产业升级华为联合中国汽车产业伙伴，为

AI在用 | 微软总裁疯狂安利的AI小游戏，虐我千千万万遍 Aug 14, 2024 am 12:00 AM

机器之能报道编辑：杨文以大模型、AIGC为代表的人工智能浪潮已经在悄然改变着我们生活及工作方式，但绝大部分人依然不知道该如何使用。因此，我们推出了「AI在用」专栏，通过直观、有趣且简洁的人工智能使用案例，来具体介绍AI使用方法，并激发大家思考。我们也欢迎读者投稿亲自实践的创新型用例。天啊噜，AI真的成精了。最近，AI生图真假难辨这事儿，闹得那叫一个沸沸扬扬。（查看详情，请移步：AI在用|三步速成AI美女，又被AI一秒打回原形）除了火爆全网的AI谷歌小姐姐，社交平台上又冒出了形形色色的FLUX生成

See all articles

Up主已经开始鬼畜，腾讯开源「AniPortrait」让照片唱歌说话

热AI工具

Undresser.AI Undress

AI Clothes Remover

Undress AI Tool

Clothoff.io

AI Hentai Generator

热门文章

热工具

记事本++7.3.1

SublimeText3汉化版

禅工作室 13.0.1

Dreamweaver CS6

SublimeText3 Mac版

热门话题