GPT-4使用混合大模型？研究证明MoE+指令调优确实让大模型性能超群-人工智能-PHP中文网

方法概述

实验与分析

首页

科技周边

人工智能

GPT-4使用混合大模型？研究证明MoE+指令调优确实让大模型性能超群

王林

Jul 17, 2023 pm 04:57 PM

模型调优

自 GPT-4 问世以来，人们一直惊艳于它强大的涌现能力，包括出色的语言理解能力、生成能力、逻辑推理能力等等。这些能力让 GPT-4 成为机器学习领域最前沿的模型之一。然而，OpenAI 至今未公开 GPT-4 的任何技术细节。

上个月，乔治・霍兹（George Hotz）在接受一家名为 Latent Space 的 AI 技术播客的采访时提到了 GPT-4，并称 GPT-4 其实是一个混合模型。具体来说，乔治・霍兹称 GPT-4 采用由 8 个专家模型组成的集成系统，每个专家模型都有 2200 亿个参数（比 GPT-3 的 1750 亿参数量略多一些），并且这些模型经过了针对不同数据和任务分布的训练。

GPT-4使用混合大模型？研究证明MoE+指令调优确实让大模型性能超群

Latent Space 的采访内容。

这或许只是乔治・霍兹的一种推测，但这种模式确实有一定的合理性。最近，由来自谷歌、UC 伯克利、MIT 等机构的研究者联合发表的一篇论文证实：混合专家模型（MoE）与指令调优的结合能够让大型语言模型（LLM）的性能大幅提升。

GPT-4使用混合大模型？研究证明MoE+指令调优确实让大模型性能超群图片

论文地址：https://arxiv.org/pdf/2305.14705.pdf

稀疏混合专家模型是一种特殊的神经网络架构，可以在不增加推理成本的情况下，为大型语言模型（LLM）增加可学习的参数。指令调优（instruction tuning）是一种训练 LLM 遵循指令的技术。该研究发现 MoE 模型比密集模型更能从指令调优中获益，因此提出将 MoE 和指令调优结合起来。

该研究在三种实验设置下进行了实证研究，包括

在没有指令调优的情况下在单个下游任务进行直接微调；
指令调优后对下游任务进行 in-context 少样本或零样本泛化；
指令调优后对单个下游任务进行进一步微调。

在第一种情况下，MoE 模型总体上不如具有相同计算能力的密集模型。然而，随着指令调优的引入（第二和第三种情况），FLAN-MoE_32B（Fine-tuned LAnguage Net，简写为 Flan，是一种经过指令调优的模型，Flan-MoE 即为指令调优 MoE）在四个基准任务上性能超过了 FLAN-PALM_62B，却只用了三分之一的 FLOPs。

如下图所示，在使用指令调优前，MoE→FT 不如 T5→FT。指令调优后，Flan-MoE→FT 优于 Flan-T5→FT。MoE 从指令调优中获得的收益 (+15.6) 大于密集模型 (+10.2)：

GPT-4使用混合大模型？研究证明MoE+指令调优确实让大模型性能超群图片

看来 GPT-4 采用混合模型还是有点根据的，MoE 确实能够从指令调优中获得更大的收益：

GPT-4使用混合大模型？研究证明MoE+指令调优确实让大模型性能超群图片

方法概述

研究者在 FLAN-MOE （是一组经过指令微调的稀疏混合专家模型）模型中使用了稀疏激活 MoE（Mixture-of-Experts）。此外，他们还用 MoE 层替换了其他 Transformer 层的前馈组件。

每个 MoE 层可理解为一个「专家」，然后，使用 softmax 激活函数对这些专家进行建模，得到一个概率分布。

尽管每个 MoE 层有很多参数，但专家是稀疏激活的。这意味着对于给定的输入 token，只使用有限的专家子集就能完成任务，从而为模型提供了更大的容量。

对于具有 E 个专家的 MoE 层，这实际上提供了 O (E^2) 种不同的前馈网络组合，从而实现了更大的计算灵活性。

由于 FLAN-MoE 是经过指令调优的模型，因而指令调优非常重要，该研究在 FLAN 集合数据集的基础上对 FLAN-MOE 进行微调。此外，该研究将每个 FLAN-MOE 的输入序列长度调整为 2048，输出长度调整为 512。

实验与分析

平均而言，在不增加任何额外计算的情况下，Flan-MoE 在所有模型尺度上都优于密集的同类产品 (Flan-T5)。

GPT-4使用混合大模型？研究证明MoE+指令调优确实让大模型性能超群图片

专家数量。图 4 显示，随着专家数量的增加，初始时，模型受益于更丰富的专门子网络，每个子网络能够处理问题空间中的不同任务或方面。这种方式使得 MoE 在处理复杂任务时具有很强的适应性和效率，从而整体上改善性能。然而，随着专家数量的不断增加，模型性能增益开始减少，最终达到饱和点。

GPT-4使用混合大模型？研究证明MoE+指令调优确实让大模型性能超群图片

图 3 和表 1 详细研究了不同的路由决策如何影响指令调优性能：通过 FLAN-Switch 和 FLAN-GS 策略之间的比较可以得出，激活更多的专家会在四个基准测试中提高性能。在这些基准测试中，MMLU-Direct 模型显示出最显著的改进，对于 BASE/LARGE 尺寸的模型，从 38.0% 增加到 39.9%。

值得注意的是，与等效容量的密集模型相比，指令调优显著放大了 MoE 模型在保留 MMLU、BBH 和内部 QA 和推理基准测试方面的性能。对于较大的 MoE 模型，这些优势进一步放大。例如，指令调优使 ST_32B 的性能提升了 45.2%，而对于 FLAN-PALM_62B，这种改进相对较小，约为 6.6%。

GPT-4使用混合大模型？研究证明MoE+指令调优确实让大模型性能超群

当进行模型扩展时，Flan-MoE (Flan-ST-32B) 优于 Flan-PaLM-62B 。

GPT-4使用混合大模型？研究证明MoE+指令调优确实让大模型性能超群图片

此外，该研究通过 freeze 给定模型的门控函数（gating function）、专家模块和 MoE 参数进行了一些分析实验。如下表 2 所示，实验结果表明，freeze 专家模块或 MoE 组件对模型性能有负面影响。

GPT-4使用混合大模型？研究证明MoE+指令调优确实让大模型性能超群

相反，freeze 门控函数会使模型性能略有改善，尽管并不明显。研究者推测这一观察结果与 FLAN-MOE 的欠拟合有关。该研究还进行了消融实验来探究下图 5 描述了微调数据效率消融研究。

GPT-4使用混合大模型？研究证明MoE+指令调优确实让大模型性能超群

最后，为了比较直接对 MoE 进行微调和 FLAN-MOE 之间的差距，该研究对单任务微调的 MoE、单任务微调的 FLAN-MoE 和密集模型进行了实验，结果如下图 6 所示：

GPT-4使用混合大模型？研究证明MoE+指令调优确实让大模型性能超群

感兴趣的读者可以阅读论文原文，了解更多研究内容。

以上是GPT-4使用混合大模型？研究证明MoE+指令调优确实让大模型性能超群的详细内容。更多信息请关注PHP中文网其他相关文章！

本站声明

本文内容由网友自发贡献，版权归原作者所有，本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容，请联系admin@php.cn

热AI工具

热工具

热门话题

gmail邮箱登陆入口在哪里

7461

CakePHP 教程

1376

steam的账户名称是什么格式

win11激活密钥永久

NYT连接提示和答案

显示更多

Related knowledge

全球最强开源 MoE 模型来了，中文能力比肩 GPT-4，价格仅为 GPT-4-Turbo 的近百分之一 May 07, 2024 pm 04:13 PM

想象一下，一个人工智能模型，不仅拥有超越传统计算的能力，还能以更低的成本实现更高效的性能。这不是科幻，DeepSeek-V2[1]，全球最强开源MoE模型来了。DeepSeek-V2是一个强大的专家混合（MoE）语言模型，具有训练经济、推理高效的特点。它由236B个参数组成，其中21B个参数用于激活每个标记。与DeepSeek67B相比，DeepSeek-V2性能更强，同时节省了42.5%的训练成本，减少了93.3%的KV缓存，最大生成吞吐量提高到5.76倍。DeepSeek是一家探索通用人工智

你好，电动Atlas！波士顿动力机器人复活，180度诡异动作吓坏马斯克 Apr 18, 2024 pm 07:58 PM

波士顿动力Atlas，正式进入电动机器人时代！昨天，液压Atlas刚刚「含泪」退出历史舞台，今天波士顿动力就宣布：电动Atlas上岗。看来，在商用人形机器人领域，波士顿动力是下定决心要和特斯拉硬刚一把了。新视频放出后，短短十几小时内，就已经有一百多万观看。旧人离去，新角色登场，这是历史的必然。毫无疑问，今年是人形机器人的爆发年。网友锐评：机器人的进步，让今年看起来像人类的开幕式动作、自由度远超人类，但这真不是恐怖片？视频一开始，Atlas平静地躺在地上，看起来应该是仰面朝天。接下来，让人惊掉下巴

AI颠覆数学研究！菲尔兹奖得主、华裔数学家领衔11篇顶刊论文｜陶哲轩转赞 Apr 09, 2024 am 11:52 AM

AI，的确正在改变数学。最近，一直十分关注这个议题的陶哲轩，转发了最近一期的《美国数学学会通报》（BulletinoftheAmericanMathematicalSociety）。围绕「机器会改变数学吗？」这个话题，众多数学家发表了自己的观点，全程火花四射，内容硬核，精彩纷呈。作者阵容强大，包括菲尔兹奖得主AkshayVenkatesh、华裔数学家郑乐隽、纽大计算机科学家ErnestDavis等多位业界知名学者。AI的世界已经发生了天翻地覆的变化，要知道，其中很多文章是在一年前提交的，而在这一

替代MLP的KAN，被开源项目扩展到卷积了 Jun 01, 2024 pm 10:03 PM

本月初，来自MIT等机构的研究者提出了一种非常有潜力的MLP替代方法——KAN。KAN在准确性和可解释性方面表现优于MLP。而且它能以非常少的参数量胜过以更大参数量运行的MLP。比如，作者表示，他们用KAN以更小的网络和更高的自动化程度重现了DeepMind的结果。具体来说，DeepMind的MLP有大约300,000个参数，而KAN只有约200个参数。KAN与MLP一样具有强大的数学基础，MLP基于通用逼近定理，而KAN基于Kolmogorov-Arnold表示定理。如下图所示，KAN在边上具

谷歌狂喜：JAX性能超越Pytorch、TensorFlow！或成GPU推理训练最快选择 Apr 01, 2024 pm 07:46 PM

谷歌力推的JAX在最近的基准测试中性能已经超过Pytorch和TensorFlow，7项指标排名第一。而且测试并不是在JAX性能表现最好的TPU上完成的。虽然现在在开发者中，Pytorch依然比Tensorflow更受欢迎。但未来，也许有更多的大模型会基于JAX平台进行训练和运行。模型最近，Keras团队为三个后端（TensorFlow、JAX、PyTorch）与原生PyTorch实现以及搭配TensorFlow的Keras2进行了基准测试。首先，他们为生成式和非生成式人工智能任务选择了一组主流

特斯拉机器人进厂打工，马斯克：手的自由度今年将达到22个！ May 06, 2024 pm 04:13 PM

特斯拉机器人Optimus最新视频出炉，已经可以在厂子里打工了。正常速度下，它分拣电池（特斯拉的4680电池）是这样的：官方还放出了20倍速下的样子——在小小的“工位”上，拣啊拣啊拣：这次放出的视频亮点之一在于Optimus在厂子里完成这项工作，是完全自主的，全程没有人为的干预。并且在Optimus的视角之下，它还可以把放歪了的电池重新捡起来放置，主打一个自动纠错：对于Optimus的手，英伟达科学家JimFan给出了高度的评价：Optimus的手是全球五指机器人里最灵巧的之一。它的手不仅有触觉

DualBEV：大幅超越BEVFormer、BEVDet4D，开卷！ Mar 21, 2024 pm 05:21 PM

这篇论文探讨了在自动驾驶中，从不同视角（如透视图和鸟瞰图）准确检测物体的问题，特别是如何有效地从透视图（PV）到鸟瞰图（BEV）空间转换特征，这一转换是通过视觉转换（VT）模块实施的。现有的方法大致分为两种策略：2D到3D和3D到2D转换。2D到3D的方法通过预测深度概率来提升密集的2D特征，但深度预测的固有不确定性，尤其是在远处区域，可能会引入不准确性。而3D到2D的方法通常使用3D查询来采样2D特征，并通过Transformer学习3D和2D特征之间对应关系的注意力权重，这增加了计算和部署的

FisheyeDetNet：首个基于鱼眼相机的目标检测算法 Apr 26, 2024 am 11:37 AM

目标检测在自动驾驶系统当中是一个比较成熟的问题，其中行人检测是最早得以部署算法之一。在多数论文当中已经进行了非常全面的研究。然而，利用鱼眼相机进行环视的距离感知相对来说研究较少。由于径向畸变大，标准的边界框表示在鱼眼相机当中很难实施。为了缓解上述描述，我们探索了扩展边界框、椭圆、通用多边形设计为极坐标/角度表示，并定义一个实例分割mIOU度量来分析这些表示。所提出的具有多边形形状的模型fisheyeDetNet优于其他模型，并同时在用于自动驾驶的Valeo鱼眼相机数据集上实现了49.5%的mAP

See all articles

GPT-4使用混合大模型？研究证明MoE+指令调优确实让大模型性能超群

方法概述

实验与分析

热AI工具

Undresser.AI Undress

AI Clothes Remover

Undress AI Tool

Clothoff.io

AI Hentai Generator

热门文章

热工具

记事本++7.3.1

SublimeText3汉化版

禅工作室 13.0.1

Dreamweaver CS6

SublimeText3 Mac版

热门话题