Stable Diffusion-XL开启公测，让你摆脱繁琐的长prompt！-人工智能-PHP中文网

SD-XL：开源版Midjourney

清晰可读的文字" >清晰可读的文字

更好的人体结构" >更好的人体结构

更有美感（more aesthetic）" >更有美感（more aesthetic）

更贴合prompt的图像" >更贴合prompt的图像

艺术风格" >艺术风格

风格转变问题" >风格转变问题

首页

科技周边

人工智能

Stable Diffusion-XL开启公测，让你摆脱繁琐的长prompt！

WBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWB

Apr 23, 2023 am 10:16 AM

开源

自从Midjourney发布v5之后，在生成图像的人物真实程度、手指细节等方面都有了显着改善，并且在prompt理解的准确性、审美多样性和语言理解方面也都取得了进步。

相比之下，Stable Diffusion虽然免费、开源，但每次都要写一大长串的prompt，想生成高质量的图像全靠多次抽卡。

Midjourney危！Stable Diffusion-XL开启公测：会画手、能写字，再也不用写长prompt了

最近Stability AI的官宣，正在研发的Stable Diffusion XL开始面向公众测试，目前可以在Clipdrop平台免费试用。

Midjourney危！Stable Diffusion-XL开启公测：会画手、能写字，再也不用写长prompt了

试用链接：https://clipdrop.co/stable-diffusion

Stability AI的创始人兼首席执行官Emad Mostaque表示，目前该模型仍然处于训练阶段，等参数稳定后将会开源；SD-XL在「握手」等图像细节方面会表现更好，几乎完全可控。

Midjourney危！Stable Diffusion-XL开启公测：会画手、能写字，再也不用写长prompt了

Stable Diffusion XL也并不是最终发布版的名字，并且也并非是v3，因为SD-XL的架构和SD-v2系列的模型架构非常相似。

Midjourney危！Stable Diffusion-XL开启公测：会画手、能写字，再也不用写长prompt了

Minimalistic home gym with rubber flooring, wall-mounted TV, weight bench, medicine ball, dumbbells, yoga mats, high-tech equipment, high detail, organized and efficient.

简约的家庭健身房，橡胶地板，壁挂式电视，举重凳，药球，哑铃，瑜伽垫，高科技设备，高细节，组织和效率

下面几张SD-XL官方发布的例图，可以看出图像的质量已经非常能打了。

Midjourney危！Stable Diffusion-XL开启公测：会画手、能写字，再也不用写长prompt了

不过有时候less并不代表more，有网友认为SD-XL为了摆脱「糟糕的品味」，设定了太多的规则，定制化空间越来越小，不符合大多数人的喜好。目前v1.5的Stable Diffusion仍然是社区内最流行的基座模型。

Midjourney危！Stable Diffusion-XL开启公测：会画手、能写字，再也不用写长prompt了

网友表示希望新版SD能够和SD 2.1版本的嵌入、hypernetworkds和Lora模型保持兼容，再从零开始重训的话就太难受了。

Midjourney危！Stable Diffusion-XL开启公测：会画手、能写字，再也不用写长prompt了

也有网友认为，SD-XL的表现和civit网站上网友分享的模型差不多，新模型的效果也并不是特别惊艳，也就是平均水平。

Midjourney危！Stable Diffusion-XL开启公测：会画手、能写字，再也不用写长prompt了

SD-XL：开源版Midjourney

关于Stable Diffusion XL模型的具体信息，官方并没有透露太多，目前只知道是一个与v2模型架构相似、但规模和参数量更大的模型。

SD-v2.1包括9亿参数，SD-XL大约有23亿参数，Emad表示正式版可能会额外发布一个更小的蒸馏版本。

SD-XL相比之前版本的改进如下：

使用较短的描述性prompt即可生成高质量图像
可以生成更贴合prompt的图像
图像中的人体结构更合理
与 v2.1和 v1.5版本(程度较轻)相比，SD-XL生成的图片更符合大众审美
负面提示词（negative prompt）是可选项
生成的肖像图更逼真
图像中的文本更清晰

需要注意的是，SD-XL可能与之前版本的插件不兼容。

清晰可读的文字

在v1系列和v2.1版本的Stable Diffusion模型中，并不具备在图片中生成可读文本的能力。

虽然SD-XL生成的文本信息并不总是准确，但确实得到了巨大的提升。

Midjourney危！Stable Diffusion-XL开启公测：会画手、能写字，再也不用写长prompt了

Photo of a woman sitting in a restaurant holding a menu that says “Menu”

一个女人坐在餐馆里拿着写着「Menu」的菜单

Midjourney危！Stable Diffusion-XL开启公测：会画手、能写字，再也不用写长prompt了

Photo of a man holding a sign that says “Stable Diffusion”

一个男人举着写着「Stable Diffusion」的牌子

a young female holding a sign that says “Stable Diffusion”, highlights in hair, sitting outside restaurant, brown eyes, wearing a dress, side light

一个年轻的女性举着一个牌子，上面写着「Stable Diffusion」，头发高亮，坐在餐厅外面，棕色的眼睛，穿着裙子，侧灯

更好的人体结构

Stable Diffusion在生成人体解剖结构方面一直存在诸多问题，多几条腿、少个胳膊实在是太常见不过的问题，通常需要使用inpaint功能进一步对图像细节进行修正；或者是使用ControlNet的Open Pose功能从参考图像中复制人体的姿态。

比如说SD-v1.5生成瑜伽的图像，经常会出现扭曲的人体。

Midjourney危！Stable Diffusion-XL开启公测：会画手、能写字，再也不用写长prompt了

Photo of a woman in yoga outfit, triangle pose, beach in evening, rim lighting

一个女人的照片在瑜伽服装，三角形的姿势，海滩在晚上，边缘照明

SD-XL虽然生成的图像并不完美，不过在人体姿态方面已经有了显着的进步。

Midjourney危！Stable Diffusion-XL开启公测：会画手、能写字，再也不用写长prompt了

更有美感（more aesthetic）

比如同样以屋子为主题，SD-XL可以生成更对称、视觉效果更好的照片。

Midjourney危！Stable Diffusion-XL开启公测：会画手、能写字，再也不用写长prompt了

SD-XL在肖像照片上也有显着改进。

Midjourney危！Stable Diffusion-XL开启公测：会画手、能写字，再也不用写长prompt了

photo shot of a woman

一个女人的照片

更贴合prompt的图像

SD-XL可以更好地理解输入的prompt，并生成更精确的图像。

比如以duotone（双色）为例，SD-v1.5只会生成黑白图像，而SD-XL则可以生成具有多种颜色的双色调图像。

与 v1模型相比，理解提示符的能力有所提高。

Midjourney危！Stable Diffusion-XL开启公测：会画手、能写字，再也不用写长prompt了

duotone portrait of a woman

一个女人的双色调肖像

因为SD-XL同属v2系列模型，所以文本模型尺寸更大，可以比v1模型更好地理解提示词。

Midjourney危！Stable Diffusion-XL开启公测：会画手、能写字，再也不用写长prompt了

比如下面的例子中，v1.5模型始终无法理解图像中的两个主题（机器人和人类），但SD-XL模型可以生成正常的图像（虽然机器人还是不够big）。

Midjourney危！Stable Diffusion-XL开启公测：会画手、能写字，再也不用写长prompt了

big robot friend sitting next to a human, ghost in the shell style, anime wallpaper

大机器人朋友坐在人类旁边攻壳机动队风格的动漫壁纸

Midjourney危！Stable Diffusion-XL开启公测：会画手、能写字，再也不用写长prompt了

a young man, highlights in hair, brown eyes, in white shirt and blue jean on a beach with a volcano in background

一个年轻人，头发染得很亮，棕色眼睛，穿着白衬衫和蓝色牛仔裤，站在海滩上，背景是一座火山

艺术风格

在艺术风格上，SD-XL并没有显着改进，和之前的版本各有千秋。

比如两个模型以不同的角度生成了Edward Hopper风格的图像。

Midjourney危！Stable Diffusion-XL开启公测：会画手、能写字，再也不用写长prompt了

New York city by Edward Hopper

Edward Hopper绘制的纽约

Leonid Afmov 的风格中，SD-v1.5更准确，SD-XL缺少了不同颜色的笔刷（unmistakable colorful board brushstrokes）。

Midjourney危！Stable Diffusion-XL开启公测：会画手、能写字，再也不用写长prompt了

New York city by Leonid Afremov

Leonid Afemov绘制的纽约

William-Adolphe Bouguereau风格中，V1.5和SDXL都可以生成一些类似的内容，其中SD-XL更接近Bouguereau创作的经典学院派绘画，并且面部细节更多。

Midjourney危！Stable Diffusion-XL开启公测：会画手、能写字，再也不用写长prompt了

Portrait of beautiful woman by William-Adolphe Bouguereau

William-Adolphe Bouguereau绘制的美女肖像

风格转变问题

在添加一些无关紧要的关键字后，模型的风格可能会突然转变。

比如先生成一张照片风格的图像。

Midjourney危！Stable Diffusion-XL开启公测：会画手、能写字，再也不用写长prompt了

a young man, highlights in hair, brown eyes, in white shirt and blue jean on a beach with a volcano in background

一个年轻人，头发染得很亮，棕色眼睛，穿着白衬衫和蓝色牛仔裤，站在海滩上，背景是一座火山

再添加一条黄色的围巾后，图像风格就变成了卡通风格。

Midjourney危！Stable Diffusion-XL开启公测：会画手、能写字，再也不用写长prompt了

a young man, highlights in hair, brown eyes, wearing a yellow scarf, in white shirt and blue jean on a beach with a volcano in background

一个年轻人，头发染得很亮，棕色的眼睛，围着黄色的围巾，穿着白衬衫和蓝色牛仔裤，站在一个火山为背景的海滩上

问题的故障可能源于预览问题，在正式发布后该问题不知能否得到解决。

以上是Stable Diffusion-XL开启公测，让你摆脱繁琐的长prompt！的详细内容。更多信息请关注PHP中文网其他相关文章！

本站声明

本文内容由网友自发贡献，版权归原作者所有，本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容，请联系admin@php.cn

热AI工具

热工具

热门话题

gmail邮箱登陆入口在哪里

7697

Java教程

1640

CakePHP 教程

1393

Laravel 教程

1287

PHP教程

1229

显示更多

Related knowledge

十个推荐开源免费文本标注工具 Mar 26, 2024 pm 08:20 PM

文本标注工作是将标签或标记与文本中特定内容相对应的工作。其主要目的是为文本提供额外的信息，以便进行更深入的分析和处理，尤其是在人工智能领域。文本标注对于人工智能应用中的监督机器学习任务至关重要。用于训练AI模型，有助更准确地理解自然语言文本信息，提高文本分类、情感分析和语言翻译等任务的性能。通过文本标注，我们可以教AI模型识别文本中的实体、理解上下文，并在出现新的类似数据时做出准确的预测。本文主要推荐一些较好的开源文本标注工具。1.LabelStudiohttps://github.com/Hu

15个值得推荐的开源免费图像标注工具 Mar 28, 2024 pm 01:21 PM

图像标注是将标签或描述性信息与图像相关联的过程，以赋予图像内容更深层次的含义和解释。这一过程对于机器学习至关重要，它有助于训练视觉模型以更准确地识别图像中的各个元素。通过为图像添加标注，使得计算机能够理解图像背后的语义和上下文，从而提高对图像内容的理解和分析能力。图像标注的应用范围广泛，涵盖了许多领域，如计算机视觉、自然语言处理和图视觉模型具有广泛的应用领域，例如，辅助车辆识别道路上的障碍物，帮助疾病的检测和诊断通过医学图像识别。本文主要推荐一些较好的开源免费的图像标注工具。1.Makesens

推荐：优秀JS开源人脸检测识别项目 Apr 03, 2024 am 11:55 AM

人脸检测识别技术已经是一个比较成熟且应用广泛的技术。而目前最为广泛的互联网应用语言非JS莫属，在Web前端实现人脸检测识别相比后端的人脸识别有优势也有弱势。优势包括减少网络交互、实时识别，大大缩短了用户等待时间，提高了用户体验；弱势是：受到模型大小限制，其中准确率也有限。如何在web端使用js实现人脸检测呢？为了实现Web端人脸识别，需要熟悉相关的编程语言和技术，如JavaScript、HTML、CSS、WebRTC等。同时还需要掌握相关的计算机视觉和人工智能技术。值得注意的是，由于Web端的计

25个AI智能体源码现已公开，灵感来自斯坦福的「虚拟小镇」和《西部世界》 Aug 11, 2023 pm 06:49 PM

熟悉《西部世界》的观众都了解，这部剧设定在未来世界的一个巨大高科技成人主题乐园中，机器人们具备与人类相似的行为能力，能够记忆所见所闻，重复核心故事情节。每天，这些机器人都会被重置，回到初始状态在斯坦福论文《GenerativeAgents:InteractiveSimulacraofHumanBehavior》发布后，这种情景不再仅限于影视剧中，AI已经成功复现了这一场景Smallville的「虚拟小镇」概览图论文地址：https://arxiv.org/pdf/2304.03442v1.pdf

阿里7B多模态文档理解大模型拿下新SOTA Apr 02, 2024 am 11:31 AM

多模态文档理解能力新SOTA！阿里mPLUG团队发布最新开源工作mPLUG-DocOwl1.5，针对高分辨率图片文字识别、通用文档结构理解、指令遵循、外部知识引入四大挑战，提出了一系列解决方案。话不多说，先来看效果。复杂结构的图表一键识别转换为Markdown格式：不同样式的图表都可以：更细节的文字识别和定位也能轻松搞定：还能对文档理解给出详细解释：要知道，“文档理解”目前是大语言模型实现落地的一个重要场景，市面上有很多辅助文档阅读的产品，有的主要通过OCR系统进行文字识别，配合LLM进行文字理

单卡跑Llama 70B快过双卡，微软硬生生把FP6搞到了A100里 | 开源 Apr 29, 2024 pm 04:55 PM

FP8和更低的浮点数量化精度，不再是H100的“专利”了！老黄想让大家用INT8/INT4，微软DeepSpeed团队在没有英伟达官方支持的条件下，硬生生在A100上跑起FP6。测试结果表明，新方法TC-FPx在A100上的FP6量化，速度接近甚至偶尔超过INT4，而且拥有比后者更高的精度。在此基础之上，还有端到端的大模型支持，目前已经开源并集成到了DeepSpeed等深度学习推理框架中。这一成果对大模型的加速效果也是立竿见影——在这种框架下用单卡跑Llama，吞吐量比双卡还要高2.65倍。一名

1.3ms耗时！清华最新开源移动端神经网络架构 RepViT Mar 11, 2024 pm 12:07 PM

论文地址：https://arxiv.org/abs/2307.09283代码地址：https://github.com/THU-MIG/RepViTRepViT在移动端ViT架构中表现出色，展现出显着的优势。接下来，我们将探讨本研究的贡献所在。文中提到，轻量级ViTs通常比轻量级CNNs在视觉任务上表现得更好，这主要归功于它们的多头自注意力模块(MSHA)可以让模型学习全局表示。然而，轻量级ViTs和轻量级CNNs之间的架构差异尚未得到充分研究。在这项研究中，作者们通过整合轻量级ViTs的有效

刚刚发布！一键生成动漫风格图片的开源模型 Apr 08, 2024 pm 06:01 PM

向大家介绍一个最新的AIGC开源项目——AnimagineXL3.1。这个项目是动漫主题文本到图像模型的最新迭代，旨在为用户提供更加优化和强大的动漫图像生成体验。在AnimagineXL3.1中，开发团队着重优化了几个关键方面，以确保模型在性能和功能上达到新的高度。首先，他们扩展了训练数据，不仅包括了之前版本中的游戏角色数据，还加入许多其他知名动漫系列的数据纳入训练集中。这一举措丰富了模型的知识库，使其能够更全面地理解各种动漫风格和角色。AnimagineXL3.1引入了一组新的特殊标签和美学标

See all articles

Stable Diffusion-XL开启公测，让你摆脱繁琐的长prompt！

SD-XL：开源版Midjourney

清晰可读的文字

更好的人体结构

更有美感（more aesthetic）

更贴合prompt的图像

艺术风格

风格转变问题

热AI工具

Undresser.AI Undress

AI Clothes Remover

Undress AI Tool

Clothoff.io

Video Face Swap

热门文章

热工具

记事本++7.3.1

SublimeText3汉化版

禅工作室 13.0.1

Dreamweaver CS6

SublimeText3 Mac版

热门话题