国内推出全新语音对话大模型：李开复领衔，零一万物参与，支持中英双语和多模态，开源并可商用-人工智能-PHP中文网

支持文本语音输入，手机也可玩

做了个什么新模型？

作者介绍

首页

科技周边

人工智能

国内推出全新语音对话大模型：李开复领衔，零一万物参与，支持中英双语和多模态，开源并可商用

王林

Sep 22, 2023 pm 04:53 PM

适配器模型国产语音

首个中英双语的语音对话开源大模型来了！

这几天，一篇关于语音-文本多模态大模型的论文出现在arXiv上，署名公司中出现了李开复旗下大模型公司01.ai——零一万物的名字。

国内推出全新语音对话大模型：李开复领衔，零一万物参与，支持中英双语和多模态，开源并可商用图片

这篇论文介绍了一个名为LLaSM的中英双语可商用对话模型。该模型不仅支持录音和文本输入，而且能够实现“混合双打”的功能

国内推出全新语音对话大模型：李开复领衔，零一万物参与，支持中英双语和多模态，开源并可商用图片

研究指出，“语音聊天”是AI与人之间更方便自然的交互方式，不仅仅是通过文本输入

用上大模型，有网友已经在想象“躺着说话就能写代码”的场景了。

国内推出全新语音对话大模型：李开复领衔，零一万物参与，支持中英双语和多模态，开源并可商用图片

这项研究是由LinkSoul.AI、北京大学和零一万物共同完成的，目前已经开源，并且可以直接在抱抱脸中进行试玩

国内推出全新语音对话大模型：李开复领衔，零一万物参与，支持中英双语和多模态，开源并可商用图片

让我们一起来看看它的效果如何吧

支持文本语音输入，手机也可玩

据研究人员表示，LLaSM是第一个支持中英文双语语音-文本多模态对话的开源可商用对话模型。

那么，就来看看它的语音文本输入和中英双语能力如何。

首先，让我们进行一次中英文化碰撞，用英文来评价李白：

国内推出全新语音对话大模型：李开复领衔，零一万物参与，支持中英双语和多模态，开源并可商用图片

还可以，正确地说出了李白的朝代。如果看不懂英文，让它直接翻译成中文也没问题：

国内推出全新语音对话大模型：李开复领衔，零一万物参与，支持中英双语和多模态，开源并可商用图片

在接下来的练习中，让我们尝试一下中英混合提问，将一个“炸食物”一词加入到中文句子中。模型的输出效果也相当不错：

国内推出全新语音对话大模型：李开复领衔，零一万物参与，支持中英双语和多模态，开源并可商用图片

让我们再试探一下模型，让它进行一些评价，看看李白和杜甫哪个更厉害

可以观察到，在经过一段时间的思考后，这个模型给出了非常客观中立的评价，同时也具备了大型模型所必备的基本知识和常识（手动狗头）

国内推出全新语音对话大模型：李开复领衔，零一万物参与，支持中英双语和多模态，开源并可商用图片

当然，不止是电脑，手机也能玩。

我们试着用语音输入“给我推荐一个菜谱吧”：

可以看到模型准确地输出了一个“茄子芝士”的菜谱，就是不知道好不好吃。

不过，我们在尝试的时候也发现，这个模型有时候会出bug。

例如有时候它并不能很好地“听懂人话”。

要求输出中英混合的内容，它会假装看不懂并输出英文：

国内推出全新语音对话大模型：李开复领衔，零一万物参与，支持中英双语和多模态，开源并可商用图片

当中英混合询问想听“Taylor Swift的Red”时，模型出现了严重的错误，不断重复输出同一句话，甚至无法停止……

国内推出全新语音对话大模型：李开复领衔，零一万物参与，支持中英双语和多模态，开源并可商用图片

总体来看，当遇到中英混合的提问或要求时，模型输出能力还是不太行。

不过分开的话，它的中英文表述能力还是不错的。

那么，这样的模型究竟是怎么实现的呢？

做了个什么新模型？

从试玩来看，LLaSM主要有两个特点：一个是支持中英输入，另一个是语音文本双输入。

要做到这两点，分别需要在架构和训练数据上做一些调整。

架构上，LLaSM将当前的语音识别模型和大语言模型做了个整合。

LLaSM由三个部分构成，分别包括自动语音识别模型Whisper、模态适配器和大模型LLaMA。

在这个过程中，Whisper负责接收原始语音输入并输出语音特征的向量表示。模态适配器的作用是对齐语音和文本嵌入。而LLaMA则负责理解语音和文本输入的指令，并生成回复

国内推出全新语音对话大模型：李开复领衔，零一万物参与，支持中英双语和多模态，开源并可商用图片

模型的训练分为两个阶段。第一阶段是训练模态适配器，此时编码器和大模型被冻结，让模型学习语音和文本的对齐。第二阶段是冻结编码器，训练模态适配器和大模型，以提升模型的多模态对话能力

训练数据上，研究人员整理出了一个包含19.9万个对话和50.8万个语音-文本样本的数据集LLaSM-Audio-Instructions。

在50.8万个语音-文本样本中，有8万个是中文语音样本，而42.8万个是英文语音样本

研究人员主要基于WizardLM、ShareGPT和GPT-4-LLM等数据集，通过文本转语音技术，给这些数据集生成语音包，同时过滤掉无效对话。

国内推出全新语音对话大模型：李开复领衔，零一万物参与，支持中英双语和多模态，开源并可商用图片

这也是目前最大的中英文语音文本指令遵循数据集，不过目前还在整理中，据研究人员表示，整理完后会进行开源。

然而，目前还没有对比该论文与其他语音模型或文本模型的输出效果

作者介绍

这篇论文的作者来自LinkSoul.AI、北京大学和零一万物

共同一作Yu Shu和Siwei Dong均来自LinkSoul.AI，此前曾经在北京智源人工智能研究院工作。

LinkSoul.AI是一家AI初创公司，之前推出过首个开源Llama 2的中文语言大模型。

国内推出全新语音对话大模型：李开复领衔，零一万物参与，支持中英双语和多模态，开源并可商用图片

作为李开复旗下的大模型公司，零一万物也在这次研究中有所贡献。作者Wenhao Huang的Hugging Face主页显示，他毕业于复旦大学。

国内推出全新语音对话大模型：李开复领衔，零一万物参与，支持中英双语和多模态，开源并可商用图片

论文地址：
https://www.php.cn/link/47c917b09f2bc64b2916c0824c715923

Demo地址：
https://www.php.cn/link/bcd0049c35799cdf57d06eaf2eb3cff6

以上是国内推出全新语音对话大模型：李开复领衔，零一万物参与，支持中英双语和多模态，开源并可商用的详细内容。更多信息请关注PHP中文网其他相关文章！

本站声明

本文内容由网友自发贡献，版权归原作者所有，本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容，请联系admin@php.cn

热AI工具

热工具

热门话题

gmail邮箱登陆入口在哪里

7554

CakePHP 教程

1382

steam的账户名称是什么格式

win11激活密钥永久

NYT连接提示和答案

显示更多

Related knowledge

全球最强开源 MoE 模型来了，中文能力比肩 GPT-4，价格仅为 GPT-4-Turbo 的近百分之一 May 07, 2024 pm 04:13 PM

想象一下，一个人工智能模型，不仅拥有超越传统计算的能力，还能以更低的成本实现更高效的性能。这不是科幻，DeepSeek-V2[1]，全球最强开源MoE模型来了。DeepSeek-V2是一个强大的专家混合（MoE）语言模型，具有训练经济、推理高效的特点。它由236B个参数组成，其中21B个参数用于激活每个标记。与DeepSeek67B相比，DeepSeek-V2性能更强，同时节省了42.5%的训练成本，减少了93.3%的KV缓存，最大生成吞吐量提高到5.76倍。DeepSeek是一家探索通用人工智

AI颠覆数学研究！菲尔兹奖得主、华裔数学家领衔11篇顶刊论文｜陶哲轩转赞 Apr 09, 2024 am 11:52 AM

AI，的确正在改变数学。最近，一直十分关注这个议题的陶哲轩，转发了最近一期的《美国数学学会通报》（BulletinoftheAmericanMathematicalSociety）。围绕「机器会改变数学吗？」这个话题，众多数学家发表了自己的观点，全程火花四射，内容硬核，精彩纷呈。作者阵容强大，包括菲尔兹奖得主AkshayVenkatesh、华裔数学家郑乐隽、纽大计算机科学家ErnestDavis等多位业界知名学者。AI的世界已经发生了天翻地覆的变化，要知道，其中很多文章是在一年前提交的，而在这一

谷歌狂喜：JAX性能超越Pytorch、TensorFlow！或成GPU推理训练最快选择 Apr 01, 2024 pm 07:46 PM

谷歌力推的JAX在最近的基准测试中性能已经超过Pytorch和TensorFlow，7项指标排名第一。而且测试并不是在JAX性能表现最好的TPU上完成的。虽然现在在开发者中，Pytorch依然比Tensorflow更受欢迎。但未来，也许有更多的大模型会基于JAX平台进行训练和运行。模型最近，Keras团队为三个后端（TensorFlow、JAX、PyTorch）与原生PyTorch实现以及搭配TensorFlow的Keras2进行了基准测试。首先，他们为生成式和非生成式人工智能任务选择了一组主流

你好，电动Atlas！波士顿动力机器人复活，180度诡异动作吓坏马斯克 Apr 18, 2024 pm 07:58 PM

波士顿动力Atlas，正式进入电动机器人时代！昨天，液压Atlas刚刚「含泪」退出历史舞台，今天波士顿动力就宣布：电动Atlas上岗。看来，在商用人形机器人领域，波士顿动力是下定决心要和特斯拉硬刚一把了。新视频放出后，短短十几小时内，就已经有一百多万观看。旧人离去，新角色登场，这是历史的必然。毫无疑问，今年是人形机器人的爆发年。网友锐评：机器人的进步，让今年看起来像人类的开幕式动作、自由度远超人类，但这真不是恐怖片？视频一开始，Atlas平静地躺在地上，看起来应该是仰面朝天。接下来，让人惊掉下巴

替代MLP的KAN，被开源项目扩展到卷积了 Jun 01, 2024 pm 10:03 PM

本月初，来自MIT等机构的研究者提出了一种非常有潜力的MLP替代方法——KAN。KAN在准确性和可解释性方面表现优于MLP。而且它能以非常少的参数量胜过以更大参数量运行的MLP。比如，作者表示，他们用KAN以更小的网络和更高的自动化程度重现了DeepMind的结果。具体来说，DeepMind的MLP有大约300,000个参数，而KAN只有约200个参数。KAN与MLP一样具有强大的数学基础，MLP基于通用逼近定理，而KAN基于Kolmogorov-Arnold表示定理。如下图所示，KAN在边上具

时间序列预测+NLP大模型新作：为时序预测自动生成隐式Prompt Mar 18, 2024 am 09:20 AM

今天我想分享一个最新的研究工作，这项研究来自康涅狄格大学，提出了一种将时间序列数据与自然语言处理（NLP）大模型在隐空间上对齐的方法，以提高时间序列预测的效果。这一方法的关键在于利用隐空间提示（prompt）来增强时间序列预测的准确性。论文标题：S2IP-LLM:SemanticSpaceInformedPromptLearningwithLLMforTimeSeriesForecasting下载地址：https://arxiv.org/pdf/2403.05798v1.pdf1、问题背景大模型

特斯拉机器人进厂打工，马斯克：手的自由度今年将达到22个！ May 06, 2024 pm 04:13 PM

特斯拉机器人Optimus最新视频出炉，已经可以在厂子里打工了。正常速度下，它分拣电池（特斯拉的4680电池）是这样的：官方还放出了20倍速下的样子——在小小的“工位”上，拣啊拣啊拣：这次放出的视频亮点之一在于Optimus在厂子里完成这项工作，是完全自主的，全程没有人为的干预。并且在Optimus的视角之下，它还可以把放歪了的电池重新捡起来放置，主打一个自动纠错：对于Optimus的手，英伟达科学家JimFan给出了高度的评价：Optimus的手是全球五指机器人里最灵巧的之一。它的手不仅有触觉

FisheyeDetNet：首个基于鱼眼相机的目标检测算法 Apr 26, 2024 am 11:37 AM

目标检测在自动驾驶系统当中是一个比较成熟的问题，其中行人检测是最早得以部署算法之一。在多数论文当中已经进行了非常全面的研究。然而，利用鱼眼相机进行环视的距离感知相对来说研究较少。由于径向畸变大，标准的边界框表示在鱼眼相机当中很难实施。为了缓解上述描述，我们探索了扩展边界框、椭圆、通用多边形设计为极坐标/角度表示，并定义一个实例分割mIOU度量来分析这些表示。所提出的具有多边形形状的模型fisheyeDetNet优于其他模型，并同时在用于自动驾驶的Valeo鱼眼相机数据集上实现了49.5%的mAP

See all articles

国内推出全新语音对话大模型：李开复领衔，零一万物参与，支持中英双语和多模态，开源并可商用

支持文本语音输入，手机也可玩

做了个什么新模型？

作者介绍

热AI工具

Undresser.AI Undress

AI Clothes Remover

Undress AI Tool

Clothoff.io

AI Hentai Generator

热门文章

热工具

记事本++7.3.1

SublimeText3汉化版

禅工作室 13.0.1

Dreamweaver CS6

SublimeText3 Mac版

热门话题