太全了！苹果上新视觉模型4M-21，搞定21种模态-人工智能-PHP中文网

首页

科技周边

人工智能

太全了！苹果上新视觉模型4M-21，搞定21种模态

WBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWB

Jun 25, 2024 pm 05:17 PM

工程苹果公司 4M-21 洛桑联邦理工学院

当前的多模态和多任务基础模型，如 **4M** 或 **UnifiedIO**，显示出有希望的结果。然而，它们接受不同输入和执行不同任务的开箱即用能力，受到它们接受训练的模态和任务的数量（通常很少）的限制。

,基于此，来自洛桑联邦理工学院（EPFL）和苹果的研究者联合开发了一个**先进的**任意到任意模态单一模型，该模型在数十种**广泛**多样化的模态上进行训练，并对大规模多模态数据集和文本语料库进行协同训练。

训练过程中一个关键步骤是对各种模态执行离散 **tokenization**，无论它们是类似图像的神经网络 **feature map**、向量、实例分割或人体姿态等结构化数据，还是可以表征为文本的数据。

太全了！苹果上新视觉模型4M-21，搞定21种模态

论文地址：https://arxiv.org/pdf/2406.09406
论文主页 https://4m.epfl.ch/
论文标题：4M-21: An Any-to-Any Vision Model for Tens of Tasks and Modalities

该研究展示了训练单一模型，也能完成现有模型至少**三倍**多的任务 / **模态**，并且不会损失性能。此外，该研究还实现了更细粒度和更可控的多**模态**生成能力。

该研究建立在多模态掩码预训练方案的基础上，并通过在数十种高度多样化的模态上进行训练来提升**模型**能力。通过使用特定于模态的离散分词器对其进行编码，该研究实现了在不同模态上训练单个统一**模型**。

简单来说，该研究在几个关键维度上扩展了现有模型的功能：

模态：从现有最佳任意到任意模型的 7 种模态增加到 21 种不同模态，从而实现跨模态检索、可控生成和强大的开箱即用性能。这是第一次单个视觉模型可以以任意到任意的方式解决数十个不同的任务，而不会损害性能，并且没有任何传统的多任务学习。
多样性：添加对更多结构化数据的支持，例如人体姿态、SAM 实例、元数据等等。
tokenization：使用特定于模态的方法研究不同模态的离散 tokenization，例如全局图像嵌入、人体姿态和语义实例。
扩展：将模型大小扩展至 3B 参数，将数据集扩展至 0.5B 样本。
协同训练：同时在视觉和语言上协同训练。

方法介绍

该研究采用 4M 预训练方案（该研究同样来自 EPFL 和苹果，在去年发布），其被证明是一种通用方法，可以有效扩展到多模态。

具体而言，本文保持架构和多模态掩码训练目标不变，通过扩大模型和数据集的规模、增加训练模型所涉及的模态类型和数量，并且在多个数据集上进行联合训练，可以提升模型的性能和适应性。

模态分为以下几大类别：RGB、几何、语义、边缘、特征图、元数据和文本，如下图所示。

太全了！苹果上新视觉模型4M-21，搞定21种模态

Tokenization

Tokenization 主要包括将不同模态和任务转换为序列或离散 token，从而统一它们的表示空间。研究者使用不同的 tokenization 方法来离散具有不同特征的模态，如图 3 所示。总而言之，本文采用了三种 tokenizer，包括 ViT tokenizer、MLP tokenizer 以及文本 tokenizer。

太全了！苹果上新视觉模型4M-21，搞定21种模态

在架构选择上，本文采用基于 Transformer 的 4M 编码器 - 解码器架构，并添加额外的模态嵌入以适应新模态。

实验结果

接下来，论文展示了 4M-21 多模态能力。

多模态生成

基于迭代解码 token ，4M-21 可以用来预测任意训练模态。如图 2 所示，本文可以从给定的输入模态以一致的方式生成所有模态。太全了！苹果上新视觉模型4M-21，搞定21种模态

此外，由于该研究可以有条件和无条件地从其他模态的任何子集生成任何训练模态，因此它支持几种方法来执行细粒度和多模态生成，如图 4 所示，例如执行多模态编辑。此外，4M-21 表现出改进的文本理解能力，无论是在 T5-XXL 嵌入上还是在常规字幕上，都可以实现几何和语义上合理的生成（图 4，右上）。

太全了！苹果上新视觉模型4M-21，搞定21种模态

多模态检索

如图 5 所示，4M-21 解锁了原始 DINOv2 和 ImageBind 模型无法实现的检索功能，例如通过使用其他模态作为查询来检索 RGB 图像或其他模态。此外，4M-21 还可以组合多种模态来预测全局嵌入，从而更好地控制检索，如右图所示。

太全了！苹果上新视觉模型4M-21，搞定21种模态

开箱即用

4M-21 能够开箱即用地执行一系列常见的视觉任务，如图 6 所示。

太全了！苹果上新视觉模型4M-21，搞定21种模态

表 1 评估了 DIODE 表面法线和深度估计、COCO 语义和实例分割、3DPW 3D 人体姿态估计等。

太全了！苹果上新视觉模型4M-21，搞定21种模态

迁移实验

此外，本文还训练了三种不同尺寸的模型：B、L 和 XL。然后，将其编码器迁移到下游任务，并在单模态 (RGB) 和多模态 (RGB + 深度) 设置上进行评估。所有迁移实验均丢弃解码器，而是训练特定任务的头部。结果如表 2 所示：

太全了！苹果上新视觉模型4M-21，搞定21种模态

最后，本文在 NYUv2、Hypersim 语义分割和 ARKitScenes 上的 3D 对象检测上执行多模态传输。如表 3 所示，4M-21 充分利用了可选的深度输入，并显著改进了基线。

太全了！苹果上新视觉模型4M-21，搞定21种模态

以上是太全了！苹果上新视觉模型4M-21，搞定21种模态的详细内容。更多信息请关注PHP中文网其他相关文章！

本站声明

本文内容由网友自发贡献，版权归原作者所有，本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容，请联系admin@php.cn

热AI工具

热工具

热门话题

Java教程

1662

CakePHP 教程

1418

Laravel 教程

1311

PHP教程

1261

C# 教程

1234

显示更多

Related knowledge

ControlNet作者又出爆款！一张图生成绘画全过程，两天狂揽1.4k Star Jul 17, 2024 am 01:56 AM

同样是图生视频，PaintsUndo走出了不一样的路线。ControlNet作者LvminZhang又开始整活了！这次瞄准绘画领域。新项目PaintsUndo刚上线不久，就收获1.4kstar（还在疯狂涨）。项目地址：https://github.com/lllyasviel/Paints-UNDO通过该项目，用户输入一张静态图像，PaintsUndo就能自动帮你生成整个绘画的全过程视频，从线稿到成品都有迹可循。绘制过程，线条变化多端甚是神奇，最终视频结果和原图像非常相似：我们再来看一个完整的绘

登顶开源AI软件工程师榜首，UIUC无Agent方案轻松解决SWE-bench真实编程问题 Jul 17, 2024 pm 10:02 PM

AIxiv专栏是本站发布学术、技术内容的栏目。过去数年，本站AIxiv专栏接收报道了2000多篇内容，覆盖全球各大高校与企业的顶级实验室，有效促进了学术交流与传播。如果您有优秀的工作想要分享，欢迎投稿或者联系报道。投稿邮箱：liyazhou@jiqizhixin.com；zhaoyunfeng@jiqizhixin.com这篇论文的作者均来自伊利诺伊大学香槟分校（UIUC）张令明老师团队，包括：StevenXia，四年级博士生，研究方向是基于AI大模型的自动代码修复；邓茵琳，四年级博士生，研究方

从RLHF到DPO再到TDPO，大模型对齐算法已经是「token-level」 Jun 24, 2024 pm 03:04 PM

AIxiv专栏是本站发布学术、技术内容的栏目。过去数年，本站AIxiv专栏接收报道了2000多篇内容，覆盖全球各大高校与企业的顶级实验室，有效促进了学术交流与传播。如果您有优秀的工作想要分享，欢迎投稿或者联系报道。投稿邮箱：liyazhou@jiqizhixin.com；zhaoyunfeng@jiqizhixin.com在人工智能领域的发展过程中，对大语言模型（LLM）的控制与指导始终是核心挑战之一，旨在确保这些模型既强大又安全地服务于人类社会。早期的努力集中于通过人类反馈的强化学习方法（RL

OpenAI超级对齐团队遗作：两个大模型博弈一番，输出更好懂了 Jul 19, 2024 am 01:29 AM

如果AI模型给的答案一点也看不懂，你敢用吗？随着机器学习系统在更重要的领域得到应用，证明为什么我们可以信任它们的输出，并明确何时不应信任它们，变得越来越重要。获得对复杂系统输出结果信任的一个可行方法是，要求系统对其输出产生一种解释，这种解释对人类或另一个受信任的系统来说是可读的，即可以完全理解以至于任何可能的错误都可以被发现。例如，为了建立对司法系统的信任，我们要求法院提供清晰易读的书面意见，解释并支持其决策。对于大型语言模型来说，我们也可以采用类似的方法。不过，在采用这种方法时，确保语言模型生

arXiv论文可以发「弹幕」了，斯坦福alphaXiv讨论平台上线，LeCun点赞 Aug 01, 2024 pm 05:18 PM

干杯！当论文讨论细致到词句，是什么体验？最近，斯坦福大学的学生针对arXiv论文创建了一个开放讨论论坛——alphaXiv，可以直接在任何arXiv论文之上发布问题和评论。网站链接：https://alphaxiv.org/其实不需要专门访问这个网站，只需将任何URL中的arXiv更改为alphaXiv就可以直接在alphaXiv论坛上打开相应论文：可以精准定位到论文中的段落、句子：右侧讨论区，用户可以发表问题询问作者论文思路、细节，例如：也可以针对论文内容发表评论，例如：「给出至

黎曼猜想显着突破！陶哲轩强推MIT、牛津新论文，37岁菲尔兹奖得主参与 Aug 05, 2024 pm 03:32 PM

最近，被称为千禧年七大难题之一的黎曼猜想迎来了新突破。黎曼猜想是数学中一个非常重要的未解决问题，与素数分布的精确性质有关（素数是那些只能被1和自身整除的数字，它们在数论中扮演着基础性的角色）。在当今的数学文献中，已有超过一千条数学命题以黎曼猜想（或其推广形式）的成立为前提。也就是说，黎曼猜想及其推广形式一旦被证明，这一千多个命题将被确立为定理，对数学领域产生深远的影响；而如果黎曼猜想被证明是错误的，那么这些命题中的一部分也将随之失去其有效性。新的突破来自MIT数学教授LarryGuth和牛津大学

首个基于Mamba的MLLM来了！模型权重、训练代码等已全部开源 Jul 17, 2024 am 02:46 AM

AIxiv专栏是本站发布学术、技术内容的栏目。过去数年，本站AIxiv专栏接收报道了2000多篇内容，覆盖全球各大高校与企业的顶级实验室，有效促进了学术交流与传播。如果您有优秀的工作想要分享，欢迎投稿或者联系报道。投稿邮箱：liyazhou@jiqizhixin.com；zhaoyunfeng@jiqizhixin.com。引言近年来，多模态大型语言模型（MLLM）在各个领域的应用取得了显着的成功。然而，作为许多下游任务的基础模型，当前的MLLM由众所周知的Transformer网络构成，这种网

公理训练让LLM学会因果推理：6700万参数模型比肩万亿参数级GPT-4 Jul 17, 2024 am 10:14 AM

把因果链展示给LLM，它就能学会公理。AI已经在帮助数学家和科学家做研究了，比如著名数学家陶哲轩就曾多次分享自己借助GPT等AI工具研究探索的经历。AI要在这些领域大战拳脚，强大可靠的因果推理能力是必不可少的。本文要介绍的这项研究发现：在小图谱的因果传递性公理演示上训练的Transformer模型可以泛化用于大图谱的传递性公理。也就是说，如果让Transformer学会执行简单的因果推理，就可能将其用于更为复杂的因果推理。该团队提出的公理训练框架是一种基于被动数据来学习因果推理的新范式，只有演示

See all articles

太全了！苹果上新视觉模型4M-21，搞定21种模态

热AI工具

Undresser.AI Undress

AI Clothes Remover

Undress AI Tool

Clothoff.io

Video Face Swap

热门文章

热工具

记事本++7.3.1

SublimeText3汉化版

禅工作室 13.0.1

Dreamweaver CS6

SublimeText3 Mac版

热门话题