蘋果文生圖大模型亮相：俄羅斯娃娃式擴散，支援1024x1024分辨率-人工智慧-PHP中文網

首頁

科技週邊

人工智慧

蘋果文生圖大模型亮相：俄羅斯娃娃式擴散，支援1024x1024分辨率

WBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWB

Oct 30, 2023 pm 07:29 PM

產業 matryoshka diffusion models mdm

習慣了 Stable Diffusion，如今終於又迎來一個俄羅斯娃娃式（Matryoshka）Diffusion 模型，還是蘋果做的。

在生成式 AI 時代，擴散模型已成為圖像、視訊、3D、音訊和文字生成等生成式 AI 應用的流行工具。然而將擴散模型拓展到高解析度領域仍然面臨巨大挑戰，這是因為模型必須在每個步驟重新編碼所有的高解析度輸入。解決這些挑戰需要使用具有註意力塊的深層架構，這使得優化更困難，消耗的算力和記憶體也更多。

怎麼辦呢？最近的一些工作專注於研究用於高解析度影像的高效網路架構。但現有方法都沒有顯示出超過 512×512 解析度的效果，並且產生品質落後於主流的級聯或 latent 方法。

我們以OpenAI DALL-E 2、GoogleIMAGEN 和英偉達eDiffI 為例，它們透過學習一個低解析度模型和多個超解析度擴散模型來節省算力，其中每個組件都單獨訓練。另一方面，latent 擴散模型（LDM）僅學習低解析度擴散模型，並依賴單獨訓練的高解析度自編碼器。對於這兩種方案，多階段式 pipeline 使訓練與推理複雜化，從而往往需要精心調整或進行超參。

本文中，研究者提出了俄羅斯娃娃式擴散模型（Matryoshka Diffusion Models，MDM）它是用於端到端高解析度影像生成的全新擴散模型。代碼很快將釋出。

蘋果文生圖大模型亮相：俄羅斯娃娃式擴散，支援1024x1024分辨率

論文網址：https://arxiv.org/pdf/2310.15111.pdf

該研究提出的主要觀點是將低解析度擴散過程作為高解析度產生的一部分，透過使用嵌套UNet 架構在多個解析度上執行聯合擴散過程。

研究發現：MDM 與嵌套UNet 架構一起實現了1）多重解析度損失：大幅提高了高解析度輸入去噪的收斂速度；2）高效的漸進式訓練計劃，從訓練低解析度擴散模型開始，按照計劃逐步添加高解析度輸入和輸出。實驗結果表明，多解析度損失與漸進式訓練相結合可以讓訓練成本和模型品質獲得更好的平衡。

該研究在類別條件影像生成以及文字條件影像和視訊生成方面評估了 MDM。 MDM 讓訓練高解析度模型無需使用級聯或潛在擴散（latent diffusion）。消融研究表明，多分辨率損失和漸進訓練都極大地提高了訓練效率和品質。

我們來欣賞以下 MDM 產生的圖片和影片。

蘋果文生圖大模型亮相：俄羅斯娃娃式擴散，支援1024x1024分辨率

方法概覽

研究者介紹稱，MDM 擴散模型在高解析度中進行端到端訓練，同時利用層級結構的資料形成。 MDM 首先在擴散空間中泛化了標準擴散模型，然後提出了專用的嵌套架構和訓練流程。

首先來看如何在擴展空間中對標準擴散模型進行泛化。

與級聯或latent 方法的不同之處在於，MDM 透過在一個擴展空間中引入多解析度擴散過程，學習了具有層級結構的單一擴散過程。具體如下圖 2 所示。

蘋果文生圖大模型亮相：俄羅斯娃娃式擴散，支援1024x1024分辨率

具體來講，給定一個資料點x ∈ R^N，研究者定義了與時間相關的隱變數z_t = z_t^1 , . . . , z_t^R ∈ R^N_1 ...NR。

蘋果文生圖大模型亮相：俄羅斯娃娃式擴散，支援1024x1024分辨率

研究者表示，在擴展空間中進行擴散建模有以下兩點優點。其一，我們在推理期間通常關心全分辨率輸出 z_t^R，那麼所有其他中等分辨率被看作是額外的隱變量 z_t^r，增加了建模分佈的複雜度。其二，多分辨率依賴性為跨 z_t^r 共享權重和計算提供了機會，從而以更高效的方式重新分配計算，並實現高效訓練和推理。

接下來看嵌套架構（NestedUNet）如何運作。

與典型的擴散模型類似，研究者使用 UNet 網路結構來實現 MDM，其中並行使用殘差連接和計算區塊以保留細粒度的輸入資訊。這裡的計算區塊包含多層卷積和自註意力層。 NestedUNet 與標準 UNet 的代碼分別如下。

蘋果文生圖大模型亮相：俄羅斯娃娃式擴散，支援1024x1024分辨率

除了相較於其他層級方法的簡單性，NestedUNet 允許以最高效的方式對計算進行分配。如下圖 3 所示，研究者早期探索發現，當以最低解析度分配大部分參數和計算時，MDM 實現了明顯更好的擴展性。

蘋果文生圖大模型亮相：俄羅斯娃娃式擴散，支援1024x1024分辨率

最後是學習。

研究者使用常規去噪目標在多個解析度下訓練 MDM，如下公式 (3) 所示。

蘋果文生圖大模型亮相：俄羅斯娃娃式擴散，支援1024x1024分辨率

這裡用到了漸進式訓練。研究者按照上述公式 (3) 直接對 MDM 進行端到端訓練，並展示了比原始基線方法更好的收斂性。他們發現，使用類似於 GAN 論文中提出的簡單漸進式訓練方法，大大加速了高解析度模型的訓練。

此訓練方法從一開始就避免了高成本的高解析度訓練，加速了整體收斂。不僅如此，他們還合併了混合解析度訓練，該訓練方法在單一 batch 中同時訓練具有不同最終解析度的樣本。

實驗及結果

#MDM 是通用技術，適用於可以逐步壓縮輸入維度的任何問題。 MDM 與基準方法的比較如下圖 4 所示。

蘋果文生圖大模型亮相：俄羅斯娃娃式擴散，支援1024x1024分辨率

表 1 給出了在 ImageNet（FID-50K）和 COCO（FID-30K）上的比較結果。

蘋果文生圖大模型亮相：俄羅斯娃娃式擴散，支援1024x1024分辨率

下圖5、6、7 展示了MDM 在圖像生成（圖5）、文字到圖像（圖6）和文字到影片（圖7）方面的結果。儘管是在相對較小的資料集上進行訓練的，但 MDM 仍顯示出生成高解析度影像和影片的強大零樣本（zero-shot）能力。

蘋果文生圖大模型亮相：俄羅斯娃娃式擴散，支援1024x1024分辨率

#有興趣的讀者可以閱讀論文原文，了解更多研究內容。

以上是蘋果文生圖大模型亮相：俄羅斯娃娃式擴散，支援1024x1024分辨率的詳細內容。更多資訊請關注PHP中文網其他相關文章！

本網站聲明

本文內容由網友自願投稿，版權歸原作者所有。本站不承擔相應的法律責任。如發現涉嫌抄襲或侵權的內容，請聯絡admin@php.cn

熱AI工具

熱工具

熱門話題

Java教學

1664

CakePHP 教程

1423

Laravel 教程

1321

PHP教程

1269

C# 教程

1249

Related knowledge

DeepMind機器人打乒乓球，正手、反手溜到飛起，全勝人類初學者 Aug 09, 2024 pm 04:01 PM

但可能打不過公園裡的老大爺？巴黎奧運正在如火如荼地進行中，乒乓球項目備受關注。同時，機器人打乒乓球也取得了新突破。剛剛，DeepMind提出了第一個在競技乒乓球比賽中達到人類業餘選手等級的學習型機器人智能體。論文地址：https://arxiv.org/pdf/2408.03906DeepMind這個機器人打乒乓球什麼程度呢？大概和人類業餘選手不相上下：正手反手都會：對手採用多種打法，機器人也能招架得住：接不同旋轉的發球：不過，比賽激烈程度似乎不如公園老大爺對戰。對機器人來說，乒乓球運動

首配機械爪！元蘿蔔亮相2024世界機器人大會，發布首個走進家庭的西洋棋機器人 Aug 21, 2024 pm 07:33 PM

8月21日，2024世界機器人大會在北京隆重召開。商湯科技旗下家用機器人品牌「元蘿蔔SenseRobot」家族全系產品集體亮相，並最新發布元蘿蔔AI下棋機器人－國際象棋專業版（以下簡稱「元蘿蔔國象機器人」），成為全球首個走進家庭的西洋棋機器人。作為元蘿蔔的第三款下棋機器人產品，全新的國象機器人在AI和工程機械方面進行了大量專項技術升級和創新，首次在家用機器人上實現了透過機械爪拾取立體棋子，並進行人機對弈、人人對弈、記譜複盤等功能，

Claude也變懶了！網友：學會給自己放假了 Sep 02, 2024 pm 01:56 PM

開學將至，該收心的不只即將開啟新學期的同學，可能還有AI大模型。前段時間，Reddit擠滿了吐槽Claude越來越懶的網友。「它的水平下降了很多，經常停頓，甚至輸出也變得很短。在發布的第一周，它可以一次性翻譯整整4頁文稿，現在連半頁都輸出不了！」https:// www.reddit.com/r/ClaudeAI/comments/1by8rw8/something_just_feels_wrong_with_claude_in_the/在一個名為“對Claude徹底失望了的帖子裡”，滿滿地

世界機器人大會上，這家承載「未來養老希望」的國產機器人被包圍了 Aug 22, 2024 pm 10:35 PM

在北京舉行的世界機器人大會上，人形機器人的展示成為了現場絕對的焦點，在星塵智能的展台上，由於AI機器人助理S1在一個展區上演揚琴、武術、書法三台大戲，能文能武，吸引了大量專業觀眾和媒體的駐足。在有彈性的琴弦上優雅的演奏，讓S1展現出速度、力度、精準度兼具的精細操作與絕對掌控。央視新聞對「書法」背後的模仿學習和智慧控制進行了專題報道，公司創始人來傑解釋到，絲滑動作的背後，是硬體側追求最好力控和最仿人身體指標（速度、負載等），而是在AI側則採集人的真實動作數據，讓機器人遇強則強，快速學習進化。而敏捷

ACL 2024獎項發表：華科大破解甲骨文最佳論文之一、GloVe時間檢驗獎 Aug 15, 2024 pm 04:37 PM

本屆ACL大會，投稿者「收穫滿滿」。為期六天的ACL2024正在泰國曼谷舉辦。 ACL是計算語言學和自然語言處理領域的頂級國際會議，由國際計算語言學協會組織，每年舉辦一次。一直以來，ACL在NLP領域的學術影響力都名列第一，它也是CCF-A類推薦會議。今年的ACL大會已是第62屆，接收了400餘篇NLP領域的前沿工作。昨天下午，大會公佈了最佳論文等獎項。此次，最佳論文獎7篇（兩篇未公開）、最佳主題論文獎1篇、傑出論文獎35篇。大會也評出了資源論文獎（ResourceAward）3篇、社會影響力獎（

李飛飛團隊提出ReKep，讓機器人具備空間智能，還能整合GPT-4o Sep 03, 2024 pm 05:18 PM

視覺與機器人學習的深度融合。當兩隻機器手絲滑地互相合作疊衣服、倒茶、將鞋子打包時，加上最近老上頭條的1X人形機器人NEO，你可能會產生一種感覺：我們似乎開始進入機器人時代了。事實上，這些絲滑動作正是先進機器人技術+精妙框架設計+多模態大模型的產物。我們知道，有用的機器人往往需要與環境進行複雜精妙的交互，而環境則可被表示成空間域和時間域上的限制。舉個例子，如果要讓機器人倒茶，那麼機器人首先需要抓住茶壺手柄並使之保持直立，不潑灑出茶水，然後平穩移動，一直到讓壺口與杯口對齊，之後以一定角度傾斜茶壺。這

分散式人工智慧盛會DAI 2024徵稿：Agent Day，強化學習之父Richard Sutton將出席！顏水成、Sergey Levine以及DeepMind科學家將做主旨報告 Aug 22, 2024 pm 08:02 PM

會議簡介隨著科技的快速發展，人工智慧成為了推動社會進步的重要力量。在這個時代，我們有幸見證並參與分散式人工智慧（DistributedArtificialIntelligence，DAI）的創新與應用。分散式人工智慧是人工智慧領域的重要分支，這幾年引起了越來越多的關注。基於大型語言模型（LLM）的智能體（Agent）異軍突起，透過結合大模型的強大語言理解和生成能力，展現了在自然語言互動、知識推理、任務規劃等方面的巨大潛力。 AIAgent正在接棒大語言模型，成為目前AI圈的熱門話題。 Au

鴻蒙智行享界S9全場景新品發表會，多款重磅新品齊發 Aug 08, 2024 am 07:02 AM

今天下午，鸿蒙智行正式迎来了新品牌与新车。8月6日，华为举行鸿蒙智行享界S9及华为全场景新品发布会，带来了全景智慧旗舰轿车享界S9、问界新M7Pro和华为novaFlip、MatePadPro12.2英寸、全新MatePadAir、华为毕昇激光打印机X1系列、FreeBuds6i、WATCHFIT3和智慧屏S5Pro等多款全场景智慧新品，从智慧出行、智慧办公到智能穿戴，华为全场景智慧生态持续构建，为消费者带来万物互联的智慧体验。鸿蒙智行：深度赋能，推动智能汽车产业升级华为联合中国汽车产业伙伴，为

See all articles

蘋果文生圖大模型亮相：俄羅斯娃娃式擴散，支援1024x1024分辨率

熱AI工具

Undresser.AI Undress

AI Clothes Remover

Undress AI Tool

Clothoff.io

Video Face Swap

熱門文章

熱工具

記事本++7.3.1

SublimeText3漢化版

禪工作室 13.0.1

Dreamweaver CS6

SublimeText3 Mac版

熱門話題