当前位置：首页 >人工智能 >Sora没体验资格?开源项目:Open-Sora!复现类Sora视频生成方案

Sora没体验资格?开源项目:Open-Sora!复现类Sora视频生成方案

发布时间：2024-03-28 13:28:00 浏览量：187次

项目简介

Open-Sora项目是一项高效制作高质量视频的工作，明确所有权使用其模型、工具和内容的计划。通过采用开源原则，Open-Sora 不仅实现了先进的视频生成技术的普及，还提供了一个专业且用户界面的方案，简化了视频制作的复杂性。

通过 Open-Sora，我们希望更多的开发者一起探索内容创作领域的创新、创造和遏制。

项目展示

项目地址

https://github.com/hpcaitech/Open-Sora

新功能

Open-Sora-v1 已发布。这里提供了模型权重。只需400K视频片段和在单卡H800上训200天（类比稳定视频扩散的152M样本），我们就可以生成2秒的512×512视频。
✅ 从图像扩散模型到视频扩散模型的三阶段训练。我们提供每个阶段的权重。
✅ 支持训练加速，包括 Transformer 加速、更快的 T5 和 VAE 以及序列任务。在对 64x512x512 视频进行训练时，Open-Sora 可将训练速度提高55%。详细信息请参见训练加速。
✅ 我们提供用于数据修复的视频剪辑和字幕工具。有关说明请点击此处，我们的数据收集计划请点击数据集。
✅ 我们发现来自VideoGPT的 VQ-VAE 质量较低，因此采用了来自Stability-AI的高质量 VAE。我们还发现使用添加时间维度的采样会导致质量降低。更多讨论，请参阅我们的报告。
✅ 我们研究了不同的架构，包括 DiT、Latte 和我们提出的STDiT。我们的 STDiT 在质量和速度之间实现了更好的权衡。更多讨论，请参阅我们的报告。
✅ 支持剪辑和 T5 文本调节。
✅ 通过将图像视为单帧视频，我们的项目支持在图像和视频（如 ImageNet 和 UCF101）上训练 DiT。更多说明请参见指令解析。
✅利用DiT、Latte和PixArt的官方权重支持推理。

下一步计划【按优先级排序】

完成数据处理流程（包括密集光流、美学评分、文本图像相似性、重复数据删除等）。更多信息请参见数据集。[项目进行中]
训练视频-VAE。[项目进行中]

支持图像和视频调节。
评估流程。
加入更好的调度程序，如SD3中的整流流程程序。
支持可变长宽比、分辨率和持续时间。
发布后支持SD3。

安装

# create a virtual env
conda create -n opensora python=3.10

# install torch
# the command below is for CUDA 12.1, choose install commands from 
# https://pytorch.org/get-started/locally/ based on your own CUDA version
pip3 install torch torchvision

# install flash attention (optional)
pip install packaging ninja
pip install flash-attn --no-build-isolation

# install apex (optional)
pip install -v --disable-pip-version-check --no-cache-dir --no-build-isolation --config-settings "--build-option=--cpp_ext" --config-settings "--build-option=--cuda_ext" git+https://github.com/NVIDIA/apex.git

# install xformers
pip3 install -U xformers --index-url https://download.pytorch.org/whl/cu121

# install this project
git clone https://github.com/hpcaitech/Open-Sora
cd Open-Sora
pip install -v .

安装完成后，建议阅读结构，了解项目结构以及如何使用配置文件。

模型权重

分辨率	数据	迭代次数	批量大小	GPU 天数 (H800)	网址
16×256×256	366K	80k	8×64	117
16×256×256	20K 总部	24k	8×64	45
16×512×512	20K 总部	20k	2×64	35

我们模型的权重部分由PixArt-α初始化。参数数量为724M。有关训练的更多信息，请参阅我们的报告。有关数据集的更多信息，请参阅数据。HQ 表示水平。 :warning:轰炸性：我们的模型是在有限的预算内训练出来的。质量和文本扫描度相对较差。特别是在生成人类时，模型表现很差，无法遵循详细的指令。我们正在努力改进质量和文本扫描。

推理

要使用我们提供的权重进行推理，首先将T5权重下载到
pretrained_models/t5_ckpts/t5-v1_1-xxl中。然后下载模型权重。运行以下命令配置生成样本。请参见此处自定义模型。

# Sample 16x256x256 (5s/sample)
torchrun --standalone --nproc_per_node 1 scripts/inference.py configs/opensora/inference/16x256x256.py --ckpt-path ./path/to/your/ckpt.pth

# Sample 16x512x512 (20s/sample, 100 time steps)
torchrun --standalone --nproc_per_node 1 scripts/inference.py configs/opensora/inference/16x512x512.py --ckpt-path ./path/to/your/ckpt.pth

# Sample 64x512x512 (40s/sample, 100 time steps)
torchrun --standalone --nproc_per_node 1 scripts/inference.py configs/opensora/inference/64x512x512.py --ckpt-path ./path/to/your/ckpt.pth

# Sample 64x512x512 with sequence parallelism (30s/sample, 100 time steps)
# sequence parallelism is enabled automatically when nproc_per_node is larger than 1
torchrun --standalone --nproc_per_node 2 scripts/inference.py configs/opensora/inference/64x512x512.py --ckpt-path ./path/to/your/ckpt.pth

我们在H800 GPU上进行了速度测试。如需使用其他模型进行推理，请参见此处获取更多说明。

数据处理

高质量数据是高质量模型的关键。这里有我们使用过的数据集和数据收集计划。我们提供处理视频数据的工具。目前，我们数据的处理流程包括以下步骤：

下载数据集。[文件]
将视频分割成片段。 [文件]
生成视频字幕。 [文件]

训练

要启动训练，首先T5权重下载到
pretrained_models/t5_ckpts/t5-v1_1-xxl中。然后运行以下命令在单个节点上启动训练。

# 1 GPU, 16x256x256
torchrun --nnodes=1 --nproc_per_node=1 scripts/train.py configs/opensora/train/16x256x512.py --data-path YOUR_CSV_PATH
# 8 GPUs, 64x512x512
torchrun --nnodes=1 --nproc_per_node=8 scripts/train.py configs/opensora/train/64x512x512.py --data-path YOUR_CSV_PATH --ckpt-path YOUR_PRETRAINED_CKPT

要在多个节点上启动训练，请根据ColossalAI准备一个主机文件，并运行以下命令。

colossalai run --nproc_per_node 8 --hostfile hostfile scripts/train.py configs/opensora/train/64x512x512.py --data-path YOUR_CSV_PATH --ckpt-path YOUR_PRETRAINED_CKPT

有关其他模型的训练和高级使用方法，请参阅此处获取更多说明。

贡献

如果您希望为该项目做出贡献，可以参考贡献指南。

声明

DiT：带有 Transformer 的可扩展扩散模型。
OpenDiT：DiT 训练的加速。我们采用了有价值的 OpenDiT 训练进度加速策略。
PixArt：一种基于 DiT 的开源文本到图像模型。
Latte：尝试有效地训练视频 DiT。
StabilityAI VAE：强大的图像 VAE 模型。
CLIP：强大的文本图像嵌入模型。
T5：强大的文本编码器。
LLaVA：基于Yi-34B 的强大图像字幕模型。

资讯

[2024.03.18] 我们发布了Open-Sora 1.0，这是一个完全开源的视频生成项目。

Open-Sora 1.0 支持视频数据构建、加速训练、推理等流程。

我们提供的模型权只需3天的训练就可以生成2秒的512x512视频。

[2024.03.04] Open-Sora：开源Sora复现方案，成本降低46%，序列扩充至近百万

上一篇北师大未来设计学院在第六届中国教博会发布五项PBL大挑战项目

下一篇揭秘最强视频生成模型Sora，OpenAI是怎么实现1分钟一镜到底的?

热门课程推荐

热门资讯

1. 华为手机神奇“AI修图”功能，一键消除衣服！原图变身大V领深V！

最近华为手机Pura70推出的“AI修图”功能引发热议，通过简单操作可以让照片中的人物换装。想了解更多这款神奇功能的使用方法吗？点击查看！
2. 四款值得推荐的AI以图生图软件，有需要的赶紧来试试!

近年来,人工智能逐渐走入公众视野,其中的AI图像生成技术尤为引人注目。只需在特定软件中输入关键词描述语以及上传参考图就能智能高效生成符合要求的...
3. 照片变漫画效果，这4个方法操作简单有效，快来试试吧！

想将照片变成漫画效果？这篇文章分享了4个方法，包括Photoshop、聪明灵犀、VanceAI Toongineer、醒图，简单操作就能实现，快来尝试一下吧！
4. 一款免费无限制的AI视频生成工具火了!国内无障碍访问!附教程

人人都可以动手制作AI视频! 打开网址https://pixverse.ai/,用邮箱注册后,点击右上角Create,就可以开始创作了。 PixVerse目前有文案生成视频,和图片生...
5. 赶紧收藏好!这4个完全免费的AI视频制作网站和工具

以下是一些免费的AI视频制作网站或工具,帮助您制作各种类型的视频。 1. Lumen5:Lumen5是一个基于AI的视频制作工具,可将文本转换为视频。用户可以使...
6. 零基础10分钟生成漫画，教大家如何用AI生成自己的漫画

接下来,我将亲自引导你,使用AI工具,创作一本既有趣又能带来盈利的漫画。我们将一起探索如何利用这个工具,发挥你的创意,制作出令人惊叹的漫画作品。让...
7. 四款软件让你一键生成AI美女!

就能快速生成一幅极具艺术效果的作品,让现实中不懂绘画的人也能参与其中创作!真的超赞哒~趣趣分享几款超厉害的AI绘画软件,提供详细操作!有需要的快来...
8. AI视频制作神器Viggle：让静态人物动起来，创意无限！

Viggle AI是一款免费制作视频的AI工具，能让静态人物图片动起来，快来了解Viggle AI的功能和优势吧！
9. 10个建筑AI工具，从设计到施工全覆盖!肯定有你从来没听过的

讲述了建筑业比较著名的AI公司小库科技做出的探索,在这儿就不多说了。今天,我们试着在规划设计、建筑方案设计、住宅设计、管道设计、出渲染图、3D扫...
10. Logo Diffusion——基于sd绘画模型的AI LOGO 生成器

这下LOGO设计彻底不用求人了。接下来详细演示一遍操作流程首先进入Logo D... 想学习更多AI技能,比如说关于怎么样利用AI来提高生产效率、还能做什么AI...