5 分钟跑通 CogVideoX:一张显卡,用一句提示词生成 10 秒视频
【免费下载链接】CogVideotext and image to video generation: CogVideoX (2024) and CogVideo (ICLR 2023)项目地址: https://gitcode.com/GitHub_Trending/co/CogVideo
给一句话,拿到一段 10 秒的视频,而且是在你自己的显卡上跑——这就是 CogVideoX 视频生成想解决的事。它是智谱开源的视频生成模型系列,覆盖文本到视频、图像到视频、视频续写和风格转换四种玩法;最新的 1.5 版本一次能出 10 秒、16fps、1360×768 的画面,5B 模型用 diffusers 推理只需约 10GB 显存,连老款 1080Ti 都能跑 2B 版本。读完这篇文章,你会有一条从克隆仓库到出片的最短路径,外加几个让画面稳定的调参技巧。
3 分钟跑通
- 克隆仓库:
git clone https://gitcode.com/GitHub_Trending/co/CogVideo - 装依赖(要求 Python 3.10~3.12):
pip install -r requirements.txt - 跑官方推理脚本 cli_demo.py:
python inference/cli_demo.py \ --prompt "A girl riding a bike." \ --model_path THUDM/CogVideoX1.5-5b \ --generate_type "t2v"- 几分钟后
./output.mp4里就是你的第一条 CogVideoX 生成视频。嫌命令行麻烦的话,gradio_composite_demo 可以起一个带网页界面的版本,还能顺带超分和插帧。
核心能力拆给你看
一句话生成 10 秒视频
t2v 模式只需要一个--prompt。以前做个 5 秒动画要找素材、剪辑、合成,现在提示词写详细点,模型直接给你一镜到底。提示词质量直接决定出片质量:模型是在长文本上训练的,所以"主体 + 动作 + 环境 + 光线"写全比写一句短句效果好得多。嫌自己写不过瘾,仓库里 convert_demo.py 可以直接把短句交给 GLM-4 这类大模型扩写成"训练同款"的长描述。
把静态照片变成会动的镜头
图生视频(image-to-video,用一张图当首帧生成视频)只需把--generate_type换成"i2v"、加一个--image_or_video_path指到图片上。1.5-5B-I2V 版本还支持任意分辨率输入。以前想给海报或产品图配"动态感",要么找动画师要么用转场硬凑;现在一张照片进去,画面里的云、水面、人群自己就动起来了。比如这张海滩照片,丢进 I2V 模式就能让海浪和晚霞活过来:
给已有视频续命换装
v2v 模式接受一段视频加一个提示词,把画面转到潜空间再整体重画:给老录像换个画风、给实拍片补个特效,都不用重新拍。另外仓库里 caption 工具 集成 CogVLM2-Caption(视频转文字描述模型),能把视频批量变成文字标签——做数据集的朋友会知道这一步有多省事。
进阶玩法 & 避坑
进阶玩法
- DDIM 逆转换重绘:DDIM Inversion(把视频反向"解码"回潜空间的技巧)可以把一段已有视频转成潜变量,改一下提示词再重新采样,画面框架还在、内容重画。仓库里的 ddim_inversion.py 直接可用,5B 和 1.5-5B 都支持。
- LoRA 微调专属模型:想让模型学会你的角色、品牌或固定画风,不用全量训练——LoRA(只训练少量参数的省显存微调方式)用几分钟视频加描述就能调出来,单张 4090 就够,方案见 finetune/README.md。
常见坑与解法
- 显存爆了:原因通常是整模型常驻显存。开启
enable_sequential_cpu_offload()(把模型层轮流挪进显存),或者直接跑量化推理脚本 cli_demo_quantization.py,INT8 下 5B 模型约 4.4GB 显存。 - 出片太慢:A100 上 5B 一条片要 3 分钟起步。先把
num_frames从 81 降到 49、步数从 50 降到 30,速度立竿见影。 - 中文提示词效果拉胯:模型只吃英文输入。先用大模型把中文翻成详细英文再喂进去,这是官方明确建议的姿势。
一句话收尾 + 资源指引
一张显卡,跑通文生视频到图生视频的全流程。
- README 中文版:模型规格表
- finetune/README.md:LoRA 微调指南
- inference/:全部推理脚本
- caption 工具:视频转文字
【免费下载链接】CogVideotext and image to video generation: CogVideoX (2024) and CogVideo (ICLR 2023)项目地址: https://gitcode.com/GitHub_Trending/co/CogVideo
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考