Penyesuai I2V daripada komuniti SD: tiada konfigurasi diperlukan, pasang dan main, serasi sempurna dengan pemalam video Tusheng-AI-php.cn

Jadual Kandungan

Ringkasan

Rumah

Penyesuai I2V daripada komuniti SD: tiada konfigurasi diperlukan, pasang dan main, serasi sempurna dengan pemalam video Tusheng

王林

Jan 15, 2024 pm 07:48 PM

video Penyelidikan

Tugas penjanaan imej-ke-video (I2V) adalah cabaran dalam bidang penglihatan komputer yang bertujuan untuk menukar imej statik kepada video dinamik. Kesukaran tugas ini adalah untuk mengekstrak dan menjana maklumat dinamik dalam dimensi temporal daripada imej tunggal sambil mengekalkan keaslian dan keselarasan visual kandungan imej. Kaedah I2V sedia ada selalunya memerlukan seni bina model yang kompleks dan sejumlah besar data latihan untuk mencapai matlamat ini.

Baru-baru ini, hasil penyelidikan baharu "I2V-Adapter: A General Image-to-Video Adapter for Video Diffusion Models" yang diketuai oleh Kuaishou telah dikeluarkan. Penyelidikan ini memperkenalkan kaedah penukaran imej-ke-video yang inovatif dan mencadangkan modul penyesuai ringan, Penyesuai I2V. Modul penyesuai ini mampu menukar imej statik kepada video dinamik tanpa mengubah struktur asal dan parameter pra-latihan bagi model penjanaan teks-ke-video (T2V) sedia ada. Kaedah ini mempunyai prospek aplikasi yang luas dalam bidang penukaran imej kepada video, dan boleh membawa lebih banyak kemungkinan kepada penciptaan video, komunikasi media dan bidang lain. Pengeluaran hasil penyelidikan adalah sangat penting untuk mempromosikan pembangunan teknologi imej dan video, dan menyediakan alat dan kaedah yang berkesan untuk penyelidik dalam bidang berkaitan. . .html

Penyesuai I2V daripada komuniti SD: tiada konfigurasi diperlukan, pasang dan main, serasi sempurna dengan pemalam video Tusheng

Alamat kod: https://github.com/I2V-Adapter/I2V-Adapter-repo

Berbanding dengan kaedah sedia ada, I2V-Adapter mempunyai lebih banyak peningkatan parameter yang boleh dilatih. dibuat, dan bilangan parameter boleh mencecah serendah 22M, iaitu hanya 1% daripada penyelesaian arus perdana Stable Video Diffusion. Pada masa yang sama, penyesuai juga serasi dengan model T2I tersuai (seperti DreamBooth, Lora) dan alat kawalan (seperti ControlNet) yang dibangunkan oleh komuniti Stable Diffusion. Melalui eksperimen, para penyelidik membuktikan keberkesanan I2V-Adapter dalam menjana kandungan video berkualiti tinggi, membuka kemungkinan baharu untuk aplikasi kreatif dalam bidang I2V.
Pemodelan temporal dengan Stable Diffusion

Pengenalan imej,dibandingkan dengan penjanaan imej,dibandingkan dengan video bingkai video seks. Kebanyakan kaedah semasa adalah berdasarkan model T2I yang telah dilatih, seperti Stable Diffusion dan SDXL, dengan memperkenalkan modul pemasaan untuk memodelkan maklumat pemasaan dalam video. Diinspirasikan oleh AnimateDiff, model yang pada asalnya direka untuk tugas T2V tersuai, ia memodelkan maklumat pemasaan dengan memperkenalkan modul pemasaan yang dipisahkan daripada model T2I, dan mengekalkan keupayaan model T2I asal untuk menjana video yang lancar . Oleh itu, penyelidik percaya bahawa modul temporal pra-latihan boleh dianggap sebagai perwakilan temporal universal dan boleh digunakan pada senario penjanaan video lain, seperti penjanaan I2V, tanpa sebarang penalaan halus. Oleh itu, para penyelidik secara langsung menggunakan modul pemasaan AnimateDiff yang telah terlatih dan memastikan parameternya tetap.

Penyesuai I2V daripada komuniti SD: tiada konfigurasi diperlukan, pasang dan main, serasi sempurna dengan pemalam video Tusheng Penyesuai untuk lapisan perhatian

Satu lagi cabaran dalam tugas I2V ialah untuk mengekalkan maklumat ID imej input. Terdapat dua penyelesaian semasa utama: satu ialah menggunakan pengekod imej yang telah terlatih untuk mengekod imej input, dan menyuntik ciri yang dikodkan ke dalam model melalui mekanisme perhatian silang untuk membimbing proses denoising; digabungkan dengan input bising dalam dimensi saluran dan kemudian disuap bersama ke rangkaian seterusnya. Walau bagaimanapun, kaedah terdahulu mungkin menyebabkan ID video yang dijana berubah kerana sukar bagi pengekod imej untuk menangkap maklumat asas manakala kaedah yang terakhir sering memerlukan perubahan struktur dan parameter model T2I, mengakibatkan kos latihan yang tinggi dan lemah keserasian.

Untuk menyelesaikan masalah di atas, penyelidik mencadangkan I2V-Adapter. Khususnya, penyelidik memasukkan imej input dan input hingar ke rangkaian secara selari Dalam blok ruang model, semua bingkai juga akan menanyakan maklumat bingkai pertama, iaitu ciri kunci dan nilai datang dari bingkai pertama tanpa bunyi. , dan output Hasilnya ditambah kepada perhatian diri model asal. Matriks pemetaan output dalam modul ini dimulakan dengan sifar dan hanya matriks pemetaan output dan matriks pemetaan pertanyaan dilatih. Untuk meningkatkan lagi pemahaman model tentang maklumat semantik imej input, penyelidik memperkenalkan penyesuai kandungan yang telah terlatih (artikel ini menggunakan Penyesuai IP [8]) untuk menyuntik ciri semantik imej.

Penyesuai I2V daripada komuniti SD: tiada konfigurasi diperlukan, pasang dan main, serasi sempurna dengan pemalam video Tusheng

Frame Similarity Prior

Untuk meningkatkan lagi kestabilan hasil yang dijana, para penyelidik mencadangkan persamaan antara bingkai sebelum mencapai keseimbangan antara kestabilan dan keamatan gerakan video yang dihasilkan. Andaian utama ialah pada tahap hingar Gaussian yang agak rendah, bingkai pertama yang bising dan bingkai seterusnya yang bising adalah cukup hampir, seperti yang ditunjukkan dalam rajah di bawah:

Penyesuai I2V daripada komuniti SD: tiada konfigurasi diperlukan, pasang dan main, serasi sempurna dengan pemalam video Tusheng

Jadi, penyelidik mengandaikan bahawa semua struktur bingkai Serupa , dan menjadi sukar untuk dibezakan selepas menambah sejumlah hingar Gaussian, jadi imej input hingar boleh digunakan sebagai input priori untuk bingkai berikutnya. Untuk menghapuskan maklumat frekuensi tinggi yang mengelirukan, para penyelidik juga menggunakan pengendali kabur Gaussian dan pencampuran topeng rawak. Khususnya, operasi diberikan oleh formula berikut:

Penyesuai I2V daripada komuniti SD: tiada konfigurasi diperlukan, pasang dan main, serasi sempurna dengan pemalam video Tusheng

Keputusan eksperimen

Hasil kuantitatif

Artikel Q.V yang dikira secara kuantitatif ini st Bingkai ketekalan), FlowScore (amplitud gerakan) dan WarppingError (ralat gerakan) digunakan untuk menilai kualiti video yang dihasilkan. Jadual 1 menunjukkan bahawa I2V-Adapter menerima skor estetik tertinggi dan juga melebihi semua skema perbandingan dari segi ketekalan bingkai pertama. Di samping itu, video yang dihasilkan oleh I2V-Adapter mempunyai amplitud gerakan terbesar dan ralat gerakan yang agak rendah, menunjukkan bahawa model ini mampu menjana lebih banyak video dinamik sambil mengekalkan ketepatan gerakan temporal.

Penyesuai I2V daripada komuniti SD: tiada konfigurasi diperlukan, pasang dan main, serasi sempurna dengan pemalam video Tusheng

Hasil kualitatif

Animasi Imej (kiri ialah input, kanan ialah output):

Penyesuai I2V daripada komuniti SD: tiada konfigurasi diperlukan, pasang dan main, serasi sempurna dengan pemalam video Tusheng

Penyesuai I2V daripada komuniti SD: tiada konfigurasi diperlukan, pasang dan main, serasi sempurna dengan pemalam video Tusheng w/ T2I Diperibadikan (di Input kiri, kanan ialah output):

Penyesuai I2V daripada komuniti SD: tiada konfigurasi diperlukan, pasang dan main, serasi sempurna dengan pemalam video Tusheng

Penyesuai I2V daripada komuniti SD: tiada konfigurasi diperlukan, pasang dan main, serasi sempurna dengan pemalam video Tusheng w/ ControlNet (kiri ialah input, kanan ialah output):

Penyesuai I2V daripada komuniti SD: tiada konfigurasi diperlukan, pasang dan main, serasi sempurna dengan pemalam video Tusheng

🎜🎜 🎜 🎜🎜

Ringkasan

Kertas kerja ini mencadangkan I2V-Adapter, modul ringan pasang dan main untuk tugas penjanaan imej-ke-video. Kaedah ini memastikan struktur blok ruang dan blok gerakan serta parameter model T2V asal tetap, memasukkan bingkai pertama tanpa hingar dan bingkai berikutnya dengan hingar selari, dan membenarkan semua bingkai berinteraksi dengan bingkai pertama tanpa hingar melalui mekanisme perhatian , dengan itu Menghasilkan video yang koheren secara sementara dan konsisten dengan bingkai pertama. Penyelidik telah menunjukkan keberkesanan kaedah ini pada tugasan I2V melalui eksperimen kuantitatif dan kualitatif. Selain itu, reka bentuk decouplednya membolehkan penyelesaian digabungkan secara langsung dengan modul seperti DreamBooth, Lora dan ControlNet, membuktikan keserasian penyelesaian dan mempromosikan penyelidikan mengenai penjanaan imej-ke-video yang disesuaikan dan dikawal.

Atas ialah kandungan terperinci Penyesuai I2V daripada komuniti SD: tiada konfigurasi diperlukan, pasang dan main, serasi sempurna dengan pemalam video Tusheng. Untuk maklumat lanjut, sila ikut artikel berkaitan lain di laman web China PHP!

Kenyataan Laman Web ini

Kandungan artikel ini disumbangkan secara sukarela oleh netizen, dan hak cipta adalah milik pengarang asal. Laman web ini tidak memikul tanggungjawab undang-undang yang sepadan. Jika anda menemui sebarang kandungan yang disyaki plagiarisme atau pelanggaran, sila hubungi admin@php.cn

Alat AI Hot

Undresser.AI Undress

Apl berkuasa AI untuk mencipta foto bogel yang realistik

AI Clothes Remover

Alat AI dalam talian untuk mengeluarkan pakaian daripada foto.

Undress AI Tool

Gambar buka pakaian secara percuma

Clothoff.io

Penyingkiran pakaian AI

AI Hentai Generator

Menjana ai hentai secara percuma.

Tunjukkan Lagi

Artikel Panas

R.E.P.O. Kristal tenaga dijelaskan dan apa yang mereka lakukan (kristal kuning)

3 minggu yang lalu By 尊渡假赌尊渡假赌尊渡假赌

R.E.P.O. Tetapan grafik terbaik

3 minggu yang lalu By 尊渡假赌尊渡假赌尊渡假赌

Assassin's Creed Shadows: Penyelesaian Riddle Seashell

1 minggu yang lalu By DDD

R.E.P.O. Cara Memperbaiki Audio Jika anda tidak dapat mendengar sesiapa

3 minggu yang lalu By 尊渡假赌尊渡假赌尊渡假赌

Di mana untuk mencari kad kunci kawalan kren di atomfall

1 minggu yang lalu By DDD

Tunjukkan Lagi

Alat panas

Notepad++7.3.1

Editor kod yang mudah digunakan dan percuma

SublimeText3 versi Cina

Versi Cina, sangat mudah digunakan

Hantar Studio 13.0.1

Persekitaran pembangunan bersepadu PHP yang berkuasa

Dreamweaver CS6

Alat pembangunan web visual

SublimeText3 versi Mac

Perisian penyuntingan kod peringkat Tuhan (SublimeText3)

Tunjukkan Lagi

Topik panas

Di manakah pintu masuk log masuk untuk e-mel gmail?

7416

Tutorial CakePHP

1359

Apakah format nama akaun stim

kunci pengaktifan win11 kekal

Tunjukkan Lagi

Related knowledge

Di manakah fail video disimpan dalam cache penyemak imbas? Feb 19, 2024 pm 05:09 PM

Dalam folder manakah penyemak imbas menyimpan video tersebut Apabila kita menggunakan pelayar Internet setiap hari, kita sering menonton pelbagai video dalam talian, seperti menonton video muzik di YouTube atau menonton filem di Netflix. Video ini akan dicache oleh penyemak imbas semasa proses pemuatan supaya ia boleh dimuatkan dengan cepat apabila dimainkan semula pada masa hadapan. Jadi persoalannya, dalam folder manakah video yang dicache ini sebenarnya disimpan? Pelayar yang berbeza menyimpan folder video cache di lokasi yang berbeza. Di bawah ini kami akan memperkenalkan beberapa pelayar biasa dan mereka

Adakah ia melanggar untuk menyiarkan video orang lain di Douyin? Bagaimanakah ia mengedit video tanpa pelanggaran? Mar 21, 2024 pm 05:57 PM

Dengan peningkatan platform video pendek, Douyin telah menjadi bahagian yang sangat diperlukan dalam kehidupan seharian setiap orang. Di TikTok, kita boleh melihat video menarik dari seluruh dunia. Sesetengah orang suka menyiarkan video orang lain, yang menimbulkan persoalan: Adakah Douyin melanggar apabila menyiarkan video orang lain? Artikel ini akan membincangkan isu ini dan memberitahu anda cara mengedit video tanpa pelanggaran dan cara mengelakkan isu pelanggaran. 1. Adakah ia melanggar penyiaran video orang lain oleh Douyin? Menurut peruntukan Undang-undang Hak Cipta negara saya, penggunaan tanpa kebenaran karya pemilik hak cipta tanpa kebenaran pemilik hak cipta adalah satu pelanggaran. Oleh itu, menyiarkan video orang lain di Douyin tanpa kebenaran pengarang asal atau pemilik hak cipta adalah satu pelanggaran. 2. Bagaimana untuk mengedit video tanpa pelanggaran? 1. Penggunaan domain awam atau kandungan berlesen: Awam

Bagaimana untuk membuang tera air video dalam Wink Feb 23, 2024 pm 07:22 PM

Bagaimana untuk membuang tera air daripada video dalam Wink? Terdapat alat untuk membuang tera air daripada video dalam winkAPP, tetapi kebanyakan rakan tidak tahu bagaimana untuk membuang tera air daripada video dalam Wink dibawa oleh editor Teks tutorial, pengguna yang berminat datang dan lihat! Cara membuang tera air video dalam Wink 1. Buka APP wink dahulu dan pilih fungsi [Remove Watermark] di kawasan halaman utama 2. Kemudian pilih video yang ingin anda keluarkan watermark dalam album 3. Kemudian pilih video dan klik sudut kanan atas selepas mengedit video [√];4 Akhir sekali, klik [Pencetakan satu klik] seperti yang ditunjukkan dalam rajah di bawah dan kemudian klik [Proses].

Bagaimana untuk membuat wang daripada menyiarkan video di Douyin? Bagaimanakah seorang pemula boleh membuat wang di Douyin? Mar 21, 2024 pm 08:17 PM

Douyin, platform video pendek kebangsaan, bukan sahaja membolehkan kami menikmati pelbagai video pendek yang menarik dan novel pada masa lapang kami, tetapi juga memberi kami pentas untuk menunjukkan diri kami dan merealisasikan nilai kami. Jadi, bagaimana untuk membuat wang dengan menyiarkan video di Douyin? Artikel ini akan menjawab soalan ini secara terperinci dan membantu anda menjana lebih banyak wang di TikTok. 1. Bagaimana untuk membuat wang daripada menyiarkan video di Douyin? Selepas menyiarkan video dan mendapat jumlah tontonan tertentu pada Douyin, anda akan berpeluang untuk mengambil bahagian dalam pelan perkongsian pengiklanan. Kaedah pendapatan ini adalah salah satu yang paling biasa kepada pengguna Douyin dan juga merupakan sumber pendapatan utama bagi banyak pencipta. Douyin memutuskan sama ada untuk menyediakan peluang perkongsian pengiklanan berdasarkan pelbagai faktor seperti berat akaun, kandungan video dan maklum balas khalayak. Platform TikTok membolehkan penonton menyokong pencipta kegemaran mereka dengan menghantar hadiah,

Cara menyiarkan video di Weibo tanpa memampatkan kualiti imej_Cara menyiarkan video di Weibo tanpa memampatkan kualiti imej Mar 30, 2024 pm 12:26 PM

1. Mula-mula buka Weibo pada telefon mudah alih anda dan klik [Saya] di sudut kanan bawah (seperti yang ditunjukkan dalam gambar). 2. Kemudian klik [Gear] di penjuru kanan sebelah atas untuk membuka tetapan (seperti yang ditunjukkan dalam gambar). 3. Kemudian cari dan buka [Tetapan Umum] (seperti yang ditunjukkan dalam gambar). 4. Kemudian masukkan pilihan [Video Follow] (seperti yang ditunjukkan dalam gambar). 5. Kemudian buka tetapan [Video Upload Resolution] (seperti yang ditunjukkan dalam gambar). 6. Akhir sekali, pilih [Kualiti Imej Asal] untuk mengelakkan pemampatan (seperti yang ditunjukkan dalam gambar).

2 Cara untuk Alih Keluar Slow Motion daripada Video pada iPhone Mar 04, 2024 am 10:46 AM

Pada peranti iOS, apl Kamera membolehkan anda merakam video gerak perlahan, atau 240 bingkai sesaat jika anda mempunyai iPhone terkini. Keupayaan ini membolehkan anda menangkap aksi berkelajuan tinggi dengan terperinci yang kaya. Tetapi kadangkala, anda mungkin mahu memainkan video gerak perlahan pada kelajuan biasa supaya anda boleh menghargai butiran dan tindakan dalam video dengan lebih baik. Dalam artikel ini, kami akan menerangkan semua kaedah untuk mengalih keluar gerakan perlahan daripada video sedia ada pada iPhone. Cara Mengalih Keluar Gerak Perlahan daripada Video pada iPhone [2 Kaedah] Anda boleh menggunakan Apl Foto atau Apl iMovie untuk mengalih keluar gerakan perlahan daripada video pada peranti anda. Kaedah 1: Buka pada iPhone menggunakan aplikasi Photos

Bagaimana untuk menerbitkan karya video Xiaohongshu? Apakah yang perlu saya perhatikan semasa menyiarkan video? Mar 23, 2024 pm 08:50 PM

Dengan kemunculan platform video pendek, Xiaohongshu telah menjadi platform untuk ramai orang berkongsi kehidupan mereka, meluahkan perasaan mereka dan mendapatkan trafik. Pada platform ini, menerbitkan karya video ialah cara interaksi yang sangat popular. Jadi, bagaimana untuk menerbitkan karya video Xiaohongshu? 1. Bagaimana untuk menerbitkan karya video Xiaohongshu? Mula-mula, pastikan anda mempunyai kandungan video yang sedia untuk dikongsi. Anda boleh menggunakan telefon bimbit anda atau peralatan kamera lain untuk merakam, tetapi anda perlu memberi perhatian kepada kualiti imej dan kejelasan bunyi. 2. Edit video: Untuk menjadikan kerja lebih menarik, anda boleh mengedit video. Anda boleh menggunakan perisian penyuntingan video profesional, seperti Douyin, Kuaishou, dsb., untuk menambah penapis, muzik, sari kata dan elemen lain. 3. Pilih kulit muka: Kulit adalah kunci untuk menarik pengguna untuk mengklik.

Bagaimana untuk menukar video yang dimuat turun oleh pelayar uc kepada video tempatan Feb 29, 2024 pm 10:19 PM

Bagaimana untuk menukar video yang dimuat turun oleh pelayar UC menjadi video tempatan? Ramai pengguna telefon mudah alih suka menggunakan Pelayar UC Mereka bukan sahaja boleh melayari web, tetapi juga menonton pelbagai video dan program TV dalam talian, dan memuat turun video kegemaran mereka ke telefon bimbit mereka. Sebenarnya, kami boleh menukar video yang dimuat turun kepada video tempatan, tetapi ramai orang tidak tahu bagaimana untuk melakukannya. Oleh itu, editor secara khas membawakan anda kaedah untuk menukar video yang dicache oleh pelayar UC kepada video tempatan saya harap ia dapat membantu anda. Kaedah untuk menukar video cache pelayar uc kepada video tempatan 1. Buka pelayar uc dan klik pilihan "Menu". 2. Klik "Muat Turun/Video". 3. Klik "Video Cache". 4. Tekan lama mana-mana video, apabila pilihan muncul, klik "Buka Direktori". 5. Semak yang anda ingin muat turun

See all articles