目录
可扩展到200亿参数:更逼真,更“聪明”
所有组件都是Transformer
谷歌“自己卷自己”
One More Thing
首页 科技周边 人工智能 谷歌新AI火了!世界最长单词都能画

谷歌新AI火了!世界最长单词都能画

Apr 09, 2023 pm 09:51 PM
谷歌 ai parti

朋友,你知道这个英文单词是什么吗?

Pneumonoultramicroscopicsilicovolcanoconiosis.

这个世界公认最长——由45个字母组成的单词,意思是“因肺部沉积火山矽质微粒所引起的疾病”(俗称火山矽肺病)。

但如果说,现在不是让你拼读这个单词,而是……把它给画出来呢?

(读都读不出来,还画画???)

谷歌最新提出来的一个AI——Parti,它就能轻松hold住这事。

在把这个单词“投喂”给Parti后,它就能有模有样地生成多张合情合理的肺部疾病谷歌新AI火了!世界最长单词都能画:

谷歌新AI火了!世界最长单词都能画

但这只是Parti小试牛刀的能力,据谷歌介绍,它是目前最先进的“文本转图像”AI。

例如,跟它说句:“把悉尼歌剧院和巴黎铁塔做个结合”,输出结果是这样的:

谷歌新AI火了!世界最长单词都能画

(不知道的还真以为是画报呢)

而且在算法路数上,还不同于谷歌自家的Imagen,Parti可以说是把“AI作画”卷出了新高度。

谷歌新AI火了!世界最长单词都能画

就连谷歌AI负责人Jeff Dean也连发数条推文,玩得不亦乐乎:

谷歌新AI火了!世界最长单词都能画

可扩展到200亿参数:更逼真,更“聪明”

事实上,Parti的能力还不止于此。

得益于模型可扩展到200亿参数,一方面,它生成的图像更加细节逼真。

不管是短短几个字,还是五十多个个单词的小段落,都能清晰展现出来。

比如,The back of a violin,小提琴的背面。

谷歌新AI火了!世界最长单词都能画

亦或是照着梵高《星空》来描述的夜晚画面。ps,这段有67个单词。

谷歌新AI火了!世界最长单词都能画

结果Parti也不在话下,一揽子把各种风格的图全给你画出来了~

谷歌新AI火了!世界最长单词都能画

这也正是Parti的第二大能力,不光细节到位,风格也能做到多变。

还有像“浣熊穿正装,头戴礼帽,拄着拐杖,拿着个垃圾袋”这种奇特的描述,它也能在整出花活的同时还不落细节。

风格上,则有梵高风、埃及法老风、像素风、中国传统绘画风、抽象主义风……

谷歌新AI火了!世界最长单词都能画

甚至有时候它还会讲双关笑话。

谷歌新AI火了!世界最长单词都能画

(Toad’ay,癞蛤蟆)

具体在测试结果上,MS-COCO、Localized Narrative(LN,4倍长的描述)上FID分数,Parti都取得了最先进的结果。

谷歌新AI火了!世界最长单词都能画

尤其在MS-COCO零样本的FID得分仅为7.23,微调FID得分为3.22,超过了此前的Imagen和DALL-E 2。

所有组件都是Transformer

时隔一个月,谷歌再把AI作画卷出新高度,结果作者却说:秘诀很简单。

谷歌新AI火了!世界最长单词都能画

Parti主要是将文本生成图像视作序列到序列之间建模。这有点类似于机器翻译,将文本标记作为编码器的输入,目标输出从文本变成了图像。

从结构上看,它的所有组件只有三部分:编码器、解码器以及图像标记器,且都是基于标准Transformer。

谷歌新AI火了!世界最长单词都能画

首先,使用基于Transformer的图像标记器ViT-VQGAN,将图像编码为离散的标记序列。

然后再通过Transformer的编码-解码结构,将参数扩展到200亿。

以往关于文本生成图像的研究,除了最早出现的GAN,大体可以分成两种思路。

一种是基于自回归模型,首先文本特征映射到图像特征,再使用类似于Transformer的序列架构,来学习语言输入和图像输出之间的关系。

这种方法的一个关键组成部分就是图像标记器,将每个图像转换为一个离散单元的序列。比如DALL-E和CogView,就采用了这一思路。

另一种则是这段时间以来进展频频的路线——基于扩散的文本到图像模型,比如DALL-E 2和Imagen。

他们摒弃了图像标记器,而是采用扩散模型来直接生成图像。可以看到的是,这些模型产生的图像质量更高,在MS-COCO零样本FID得分更好。

谷歌新AI火了!世界最长单词都能画

而Parti模型的成功,则证明了自回归模型可以用来改善文本生成图像的效果。

与此同时,Parti还引入并发布了新的基准测试——PartiPrompts,用于衡量模型在12个类别和11个挑战方面的能力。

谷歌新AI火了!世界最长单词都能画

但Parti还是有一定的局限性,研究人员也展示了一些bug:

比如,对否定的描述就没招了~

一个没有香蕉的盘子,旁边一个没有橙汁儿的玻璃杯。

谷歌新AI火了!世界最长单词都能画

还会犯一些常识性错误,例如不合理地缩放。比如这张图,机器人竟然比赛车高出好几倍。

谷歌新AI火了!世界最长单词都能画

一个穿着赛车服和黑色遮阳板的闪亮机器人自豪地站在一辆F1赛车前。太阳落在城市景观上。漫画书插图。

谷歌“自己卷自己”

在这项研究来自Google Research,团队中的华人居多。

谷歌新AI火了!世界最长单词都能画

研究核心工作人员包括Yuanzhong Xu、Thang Luong等,目前均就职于谷歌从事AI相关研究工作。

(Thang Luong在谷歌学术上的引用量高达20000 )

谷歌新AI火了!世界最长单词都能画

△左:Yuanzhong Xu;右:Thang Luong

不过有意思的是,同为“说句话让AI作画”,同为出自谷歌之手的Imagen,它跟Parti还真有点千丝万缕的关系。

在Parti的GitHub的项目文档中就有提到:

感谢Imagen团队,他们在发布Imagen之前与我们分享了其最近完整的结果。

他们在CF-guidance方面的重要发现,对最终的Parti模型特别有帮助。

谷歌新AI火了!世界最长单词都能画

而且Imagen的作者之一Burcu Karagol Ayan,也参与到了Parti的项目中。

(有种谷歌“自己卷自己”那味了)

不仅如此,就连“隔壁”DALL-E 2的作者Aditya Ramesh,也给Parti在MS-COCO评价方面做了讨论工作。

以及DALL-Eval的作者们,也在Parti数据方面的工作提供了帮助。

One More Thing

有一说一,就“文本生成图像”这事,可不只是研究人员们的宠儿。

网友们在“玩”它这条路上,也是乐此不疲(脑洞不要太大好吧)。

前一阵子让Imagen画一幅宋朝“虎戴VR”,直接演变成AI作画大战。

谷歌新AI火了!世界最长单词都能画

△图:Imagen作画

DALL·E、MidJourney等“闻讯赶来”参与其中。

谷歌新AI火了!世界最长单词都能画

△ DALL·E作画

甚至还有把Wordle和 DALL-E 2搞到一起的:

谷歌新AI火了!世界最长单词都能画

……

不过回归到这次的Parti,好玩归好玩,但还是有网友提出了“直击灵魂”的问题:

谷歌新AI火了!世界最长单词都能画

啥时候商业化?要是自己“关门玩”就没意思了。

Parti论文地址:

https://parti.research.google/

GitHub项目地址:

https://github.com/google-research/parti

参考链接:

[1]https://twitter.com/lmthang/status/1539664610596225024[2]https://gizmodo.com/new-browser-game-combines-dall-e-mini-and-wordle-1849105289[3]https://imagen.research.google/​

以上是谷歌新AI火了!世界最长单词都能画的详细内容。更多信息请关注PHP中文网其他相关文章!

本站声明
本文内容由网友自发贡献,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系admin@php.cn

热AI工具

Undresser.AI Undress

Undresser.AI Undress

人工智能驱动的应用程序,用于创建逼真的裸体照片

AI Clothes Remover

AI Clothes Remover

用于从照片中去除衣服的在线人工智能工具。

Undress AI Tool

Undress AI Tool

免费脱衣服图片

Clothoff.io

Clothoff.io

AI脱衣机

AI Hentai Generator

AI Hentai Generator

免费生成ai无尽的。

热门文章

R.E.P.O.能量晶体解释及其做什么(黄色晶体)
4 周前 By 尊渡假赌尊渡假赌尊渡假赌
R.E.P.O.最佳图形设置
4 周前 By 尊渡假赌尊渡假赌尊渡假赌
R.E.P.O.如果您听不到任何人,如何修复音频
4 周前 By 尊渡假赌尊渡假赌尊渡假赌
WWE 2K25:如何解锁Myrise中的所有内容
1 个月前 By 尊渡假赌尊渡假赌尊渡假赌

热工具

记事本++7.3.1

记事本++7.3.1

好用且免费的代码编辑器

SublimeText3汉化版

SublimeText3汉化版

中文版,非常好用

禅工作室 13.0.1

禅工作室 13.0.1

功能强大的PHP集成开发环境

Dreamweaver CS6

Dreamweaver CS6

视觉化网页开发工具

SublimeText3 Mac版

SublimeText3 Mac版

神级代码编辑软件(SublimeText3)

如何配置Debian Apache日志格式 如何配置Debian Apache日志格式 Apr 12, 2025 pm 11:30 PM

本文介绍如何在Debian系统上自定义Apache的日志格式。以下步骤将指导您完成配置过程:第一步:访问Apache配置文件Debian系统的Apache主配置文件通常位于/etc/apache2/apache2.conf或/etc/apache2/httpd.conf。使用以下命令以root权限打开配置文件:sudonano/etc/apache2/apache2.conf或sudonano/etc/apache2/httpd.conf第二步:定义自定义日志格式找到或

debian readdir如何实现文件排序 debian readdir如何实现文件排序 Apr 13, 2025 am 09:06 AM

在Debian系统中,readdir函数用于读取目录内容,但其返回的顺序并非预先定义的。要对目录中的文件进行排序,需要先读取所有文件,再利用qsort函数进行排序。以下代码演示了如何在Debian系统中使用readdir和qsort对目录文件进行排序:#include#include#include#include//自定义比较函数,用于qsortintcompare(constvoid*a,constvoid*b){returnstrcmp(*(

Tomcat日志如何帮助排查内存泄漏 Tomcat日志如何帮助排查内存泄漏 Apr 12, 2025 pm 11:42 PM

Tomcat日志是诊断内存泄漏问题的关键。通过分析Tomcat日志,您可以深入了解内存使用情况和垃圾回收(GC)行为,从而有效定位和解决内存泄漏。以下是如何利用Tomcat日志排查内存泄漏:1.GC日志分析首先,启用详细的GC日志记录。在Tomcat启动参数中添加以下JVM选项:-XX: PrintGCDetails-XX: PrintGCDateStamps-Xloggc:gc.log这些参数会生成详细的GC日志(gc.log),包含GC类型、回收对象大小和时间等信息。分析gc.log

如何优化debian readdir的性能 如何优化debian readdir的性能 Apr 13, 2025 am 08:48 AM

在Debian系统中,readdir系统调用用于读取目录内容。如果其性能表现不佳,可尝试以下优化策略:精简目录文件数量:尽可能将大型目录拆分成多个小型目录,降低每次readdir调用处理的项目数量。启用目录内容缓存:构建缓存机制,定期或在目录内容变更时更新缓存,减少对readdir的频繁调用。内存缓存(如Memcached或Redis)或本地缓存(如文件或数据库)均可考虑。采用高效数据结构:如果自行实现目录遍历,选择更高效的数据结构(例如哈希表而非线性搜索)存储和访问目录信

debian readdir如何与其他工具集成 debian readdir如何与其他工具集成 Apr 13, 2025 am 09:42 AM

Debian系统中的readdir函数是用于读取目录内容的系统调用,常用于C语言编程。本文将介绍如何将readdir与其他工具集成,以增强其功能。方法一:C语言程序与管道结合首先,编写一个C程序调用readdir函数并输出结果:#include#include#includeintmain(intargc,char*argv[]){DIR*dir;structdirent*entry;if(argc!=2){

Debian syslog如何配置防火墙规则 Debian syslog如何配置防火墙规则 Apr 13, 2025 am 06:51 AM

本文介绍如何在Debian系统中使用iptables或ufw配置防火墙规则,并利用Syslog记录防火墙活动。方法一:使用iptablesiptables是Debian系统中功能强大的命令行防火墙工具。查看现有规则:使用以下命令查看当前的iptables规则:sudoiptables-L-n-v允许特定IP访问:例如,允许IP地址192.168.1.100访问80端口:sudoiptables-AINPUT-ptcp--dport80-s192.16

Debian邮件服务器防火墙配置技巧 Debian邮件服务器防火墙配置技巧 Apr 13, 2025 am 11:42 AM

配置Debian邮件服务器的防火墙是确保服务器安全性的重要步骤。以下是几种常用的防火墙配置方法,包括iptables和firewalld的使用。使用iptables配置防火墙安装iptables(如果尚未安装):sudoapt-getupdatesudoapt-getinstalliptables查看当前iptables规则:sudoiptables-L配置

Debian syslog如何学习 Debian syslog如何学习 Apr 13, 2025 am 11:51 AM

本指南将指导您学习如何在Debian系统中使用Syslog。Syslog是Linux系统中用于记录系统和应用程序日志消息的关键服务,它帮助管理员监控和分析系统活动,从而快速识别并解决问题。一、Syslog基础知识Syslog的核心功能包括:集中收集和管理日志消息;支持多种日志输出格式和目标位置(例如文件或网络);提供实时日志查看和过滤功能。二、安装和配置Syslog(使用Rsyslog)Debian系统默认使用Rsyslog。您可以通过以下命令安装:sudoaptupdatesud

See all articles