智谱版Sora开源爆火:狂揽4K Star,4090单卡运行,A6000可微调

PHPz
发布: 2024-08-07 18:05:32
原创
331 人浏览过

智谱AI把自研打造的大模型给开源了。


国内视频生成领域越来越卷了。刚刚,智谱 AI 宣布将与「清影」同源的视频生成模型 ——CogVideoX 开源。短短几个小时狂揽 4k 星标。

智谱版Sora开源爆火:狂揽4K Star,4090单卡运行,A6000可微调

  • 代码仓库:https://github.com/THUDM/CogVideo
  • 模型下载:https://huggingface.co/THUDM/CogVideoX-2b
  • 技术报告:https://github.com/THUDM/CogVideo/blob/main/resources/CogVideoX.pdf

7 月 26 日,智谱 AI 正式发布视频生成产品「清影」,得到大家广泛好评。只要你有好的创意(几个字到几百个字),再加上一点点耐心(30 秒),「清影」就能生成 1440x960 清晰度的高精度视频。

官宣即日起,清影上线清言 App,所有用户都可以全方位体验。想要尝试的小伙伴可以去「智谱清言」上体验「清影」生视频的能力。

「清影」的出现被誉为是国内首个人人可用的 Sora。发布 6 天,「清影」生成视频数就突破百万量级。

  • PC 端访问链接:https://chatglm.cn/
  • 移动端访问链接:https://chatglm.cn/download?fr=web_home

为何智谱 AI 开源模型如此爆火?要知道虽然现在视频生成技术正逐步走向成熟,然而,仍未有一个开源的视频生成模型,能够满足商业级应用的要求。大家熟悉的 Sora、Gen-3 等都是闭源的。CogVideoX 的开源就好比 OpenAI 将 Sora 背后的模型开源,对广大研究者而言,意义重大。
 
CogVideoX 开源模型包含多个不同尺寸大小的模型,目前智谱 AI 开源 CogVideoX-2B,它在 FP-16 精度下的推理仅需 18GB 显存,微调则只需要 40GB 显存,这意味着单张 4090 显卡即可进行推理,而单张 A6000 显卡即可完成微调。
 
CogVideoX-2B 的提示词上限为 226 个 token,视频长度为 6 秒,帧率为 8 帧 / 秒,视频分辨率为 720*480。智谱 AI 为视频质量的提升预留了广阔的空间,期待开发者们在提示词优化、视频长度、帧率、分辨率、场景微调以及围绕视频的各类功能开发上贡献开源力量。
 
性能更强参数量更大的模型正在路上,敬请关注与期待。

模型

智谱版Sora开源爆火:狂揽4K Star,4090单卡运行,A6000可微调

VAE

视频数据因包含空间和时间信息,其数据量和计算负担远超图像数据。为应对此挑战,智谱提出了基于 3D 变分自编码器(3D VAE)的视频压缩方法。3D VAE 通过三维卷积同时压缩视频的空间和时间维度,实现了更高的压缩率和更好的重建质量。

智谱版Sora开源爆火:狂揽4K Star,4090单卡运行,A6000可微调

模型结构包括编码器、解码器和潜在空间正则化器,通过四个阶段的下采样和上采样实现压缩。时间因果卷积确保了信息的因果性,减少了通信开销。智谱采用上下文并行技术以适应大规模视频处理。

实验中,智谱 AI 发现大分辨率编码易于泛化,而增加帧数则挑战较大。因此,智谱分两阶段训练模型:首先在较低帧率和小批量上训练,然后通过上下文并行在更高帧率上进行微调。训练损失函数结合了 L2 损失、LPIPS 感知损失和 3D 判别器的 GAN 损失。
 
专家 Transformer

智谱 AI 使用 VAE 的编码器将视频压缩至潜在空间,然后将潜在空间分割成块并展开成长的序列嵌入 z_vision。同时,智谱 AI 使用 T5,将文本输入编码为文本嵌入 z_text,然后将 z_text 和 z_vision 沿序列维度拼接。拼接后的嵌入被送入专家 Transformer 块堆栈中处理。最后,反向拼接嵌入来恢复原始潜在空间形状,并使用 VAE 进行解码以重建视频。

智谱版Sora开源爆火:狂揽4K Star,4090单卡运行,A6000可微调

Data

视频生成模型训练需筛选高质量视频数据,以学习真实世界动态。视频可能因人工编辑或拍摄问题而不准确。智谱 AI 开发了负面标签来识别和排除低质量视频,如过度编辑、运动不连贯、质量低下、讲座式、文本主导和屏幕噪音视频。通过 video-llama 训练的过滤器,智谱 AI 标注并筛选了 20,000 个视频数据点。同时,计算光流和美学分数,动态调整阈值,确保生成视频的质量。
 
视频数据通常没有文本描述,需要转换为文本描述以供文本到视频模型训练。现有的视频字幕数据集字幕较短,无法全面描述视频内容。智谱 AI 提出了一种从图像字幕生成视频字幕的管道,并微调端到端的视频字幕模型以获得更密集的字幕。这种方法通过 Panda70M 模型生成简短字幕,使用 CogView3 模型生成密集图像字幕,然后使用 GPT-4 模型总结生成最终的短视频。智谱 AI 还微调了一个基于 CogVLM2-Video 和 Llama 3 的 CogVLM2-Caption 模型,使用密集字幕数据进行训练,以加速视频字幕生成过程。

智谱版Sora开源爆火:狂揽4K Star,4090单卡运行,A6000可微调

Prestasi

Untuk menilai kualiti penjanaan teks-ke-video, Zhipu AI menggunakan berbilang penunjuk dalam VBench, seperti tindakan manusia, adegan, dinamik, dsb. Zhipu AI juga menggunakan dua alat penilaian video tambahan: Kualiti Dinamik dalam Devil dan Skor GPT4o-MT dalam Chrono-Magic, yang memfokuskan pada ciri dinamik video. Seperti yang ditunjukkan dalam jadual di bawah.
智谱版Sora开源爆火:狂揽4K Star,4090单卡运行,A6000可微调
Zhipu AI telah mengesahkan keberkesanan undang-undang penskalaan dalam penjanaan video Pada masa hadapan, ia akan terus meningkatkan skala data dan skala model sambil meneroka seni bina model baharu dengan lebih banyak inovasi terobosan dan maklumat Video yang lebih cekap , gabungan kandungan teks dan video yang lebih lengkap.

Akhir sekali, mari kita lihat kesan "Clear Shadow".

Petua: "Sebuah bot mainan kayu yang halus dengan tiang dan layar yang diukir indah meluncur dengan lancar merentasi permaidani biru mewah yang meniru ombak laut. Badan kapal dicat coklat yang kaya dan mempunyai tingkap kecil. Permaidani lembut dan bertekstur, menyediakan latar belakang yang sempurna untuk menyerupai lautan yang luas Terdapat juga pelbagai mainan dan barangan kanak-kanak yang mengelilingi bot, menunjukkan persekitaran yang menyeronokkan dan imaginasi zaman kanak-kanak dengan bot mainannya persekitaran. "智谱版Sora开源爆火:狂揽4K Star,4090单卡运行,A6000可微调Petua: "Kamera mengikuti SUV lama berwarna putih dengan rak bumbung hitam ketika ia mendaki bukit yang curam dan di sepanjang jalan tanah yang dikelilingi oleh pokok pain , tayar mengeluarkan debu dan matahari bersinar SUV itu meluncur laju di sepanjang jalan tanah, memancarkan cahaya hangat di tempat kejadian jalan tanah perlahan-lahan melengkung ke kejauhan, dan tidak ada kereta atau kenderaan lain yang kelihatan di kedua-dua belah jalan itu dipenuhi dengan kayu merah adalah tompok-tompok kehijauan jika dilihat dari belakang, kereta itu mengikuti selekoh dengan mudah, memberikan gambaran bahawa ia memandu di atas rupa bumi yang berceranggah, dikelilingi oleh bukit dan gunung yang curam, dengan langit biru cerah di atasnya : "Lanskap hutan bersalji dengan jalan tanah yang melintasinya. Jalan itu dipenuhi dengan pokok-pokok yang dilitupi salji dan tanah juga dilitupi salji. Matahari bersinar terang, mewujudkan suasana yang cerah dan damai. Jalan itu kosong dan tiada orang atau haiwan kelihatan dalam video Gaya video adalah gambar landskap semula jadi, memfokuskan kepada keindahan hutan bersalji dan ketenangan jalan raya - atas gril pada gril dengan lecuran ringan dan asap ringan."智谱版Sora开源爆火:狂揽4K Star,4090单卡运行,A6000可微调

以上是智谱版Sora开源爆火:狂揽4K Star,4090单卡运行,A6000可微调的详细内容。更多信息请关注PHP中文网其他相关文章!

相关标签:
来源:jiqizhixin.com
本站声明
本文内容由网友自发贡献,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系admin@php.cn
最新问题
热门教程
更多>
最新下载
更多>
网站特效
网站源码
网站素材
前端模板
关于我们 免责声明 Sitemap
PHP中文网:公益在线PHP培训,帮助PHP学习者快速成长!