摘要:SCAIL-2是由智普AI与清华大学联合开发的可扩展角色动画模型,支持动作迁移和人物替换功能,无需骨骼图等预处理。文章详细介绍了该模型的特点、官方基础工作流逻辑,以及基于WanAnimatePlus插件的优化版工作流搭建方法。内容包括模型选择、遮罩处理、参数设置、多图参考模式等,并提供了低显存配置的调试建议和常见问题解决方案。相关模型和工作流文件可通过文末网盘链接获取。该模型适用于视频生成、角色动画等场景,通过ComfyUI可实现高效操作。
一 模型介绍
SCAIL-2 模型的英文全称是Scalable Character Animation with In-context Learning 2,意思是基于上下文学习的可扩展角色动画V2版本,它是由智普AI与清华大学联合开发的模型。SCAIL-2虽然也是基于wan视频模型底座改造,但与wan animate及之前的Scail版本也有本质区别,该模型不再需要骨骼、掩码或深度图等中间姿态预处理,只需输入参考图及动作视频,模型可以读取完整视觉上下文并自主分析学习角色和动作的映射关系,实现动作迁移、人物替换、多角色互动功能。
1.1 官方说明
智普官方发布地址:https://huggingface.co/zai-org/SCAIL-2
官方强调了scail2是一种端到端驱动动作迁移模型,支持角色替换和多角色场景,无需骨骼图或修复蒙版等中间姿态。官方推荐的视频尺寸是512P和704P,且宽度和高度都必须被32整除。
1.2 模型版本分类
comfy官方发布的适配comfyui的scail2模型版本:
官方共提供了fp16、fp8、nvfp4等几种不同规格的大模型,大家可根据自己本地配置情况进行选择。另外,官方还同步提供了一个DPO lora(wan2.1_SCAIL_2_DPO_lora_bf16.safetensors)和一个重打光lora(wan2.1_scail_2_relight_lora_bf16.safetensors).其中DPO lora的主要作用包括人体矫正,减少畸形、穿模,权重越高则修整畸形能力越强,不过对于人物一致性会有一定影响。重打光lora则主要调整觉得和环境的光影融合效果,尤其没有重打光lora时,人物替换后角色与背景的独立感十分明显。
如果你的显卡显存一般,huggingface上相关作者也发布了多种规格的GGUF版本模型,可根据你的配置情况进行自行选择,注意GGUF模型需放置到models/unet文件夹。
https://huggingface.co/realrebelai/SCAIL-2_GGUF
相关的模我已放到网盘中,小伙伴们可以在文末网盘地址进保存下载。
二、 官方基础工作流
对模型有一定了解以后,打开comfyui,到模版界面中搜索scail2就可以找到官方工作流。
这图蓝色框线区域是上传参考图和源视频:
由于官方基础工作流默认每段处理81帧后进行拼接,所以需要根据视频总帧数估算需要处理的段数,下图区域作用是计算处理的段数。
官方工作流把核心节点做成了两个子图区域,主要也是为了演示长视频上下文的拼接方法,不过社区有更方便的集成插件,这里我们只需要了解子图内部节点逻辑即可。
把子图区全部解开,得到每个处理段完整的工作流节点和连线。
2.1 模型详细介绍及安装位置
模型区:模型加载的整体结构需求与wan模型基本一致,这里我们简单介绍一下模型的种类及其作用。
主模型scail2前文已介绍,模型区根据本地配置选择合适版本即可;
SCAIL-2 模型继承的是 Wan2.1 LoRA 生态,全部 Wan2.1 I2V/V2V LoRA 都可以直接加载。官方工作流里除了使用官方适配的DPO lora外,同时加载了降低采样步数、提升生成速度的加速lora
(Wan21_I2V_14B_lightx2v_cfg_step_distill_lora_rank64.safetensors)。
clip文本编码器使用Wan体系专属的UMT5-XXL模型,标配的是fp8轻量化版本(umt5_xxl_fp8_e4m3fn_scaled.safetensors),低显存方案可以选择city96开源的GGUF量化版本(umt5-xxl-encoder-Q4_K_M.gguf);
clip视觉编码器用于提取参考图人物特征,实现跨视频角色一致性,使用的是clip_vision_h模型(clip_vision_h.safetensors);
VAE解码器唯一适配Wan2.1专属VAE;
另外,scail2模型需搭配Sam3.1分割功能以实现自动抠取参考人物、分离前景角色与背景,所以在下方的创建遮罩区,还需要加载sam3.1模型(sam3.1_multiplex_fp16.safetensors)。
上述所有模型均已打包至网盘中(链接见文末),标准的模型文件放置位置如屏幕显示,下载后放置在对应文件夹即可。
ComfyUI/models/
├─ diffusion_models/
│ └─ wan2.1_14B_SCAIL_2_fp8_scaled.safetensors
├─ unet/
│ └─ SCAIL-2-Q4_K_M.gguf
├─ text_encoders/
│ └─ umt5_xxl_fp8_e4m3fn_scaled.safetensors
├─ clip_vision/
│ └─ clip_vision_h.safetensors
├─ vae/
│ └─ Wan2_1_VAE_bf16.safetensors
├─ loras/
│ └─ Wan21_I2V_14B_lightx2v_cfg_step_distill_lora_rank64.safetensors
│ └─ wan2.1_SCAIL_2_DPO_lora_bf16.safetensors
└─ checkpoints/
│ └─ sam3.1_multiplex_fp16.safetensors
2.2 官流分区介绍
模型加载区下方区域对应的是“段索引”,指第几段处理区域。
模型加载区下方是尺寸设置,用于统一设置输出视频的宽高。数学表达式指向下取整获得32的整数倍,这个公式在我们后面搭建工作流时也会用到,可以在不约束输入数值的情况下确保宽高保持是32的倍数,避免scail2模型运算报错。
最下方是创建遮罩区,这个区域同时对参考图像和源视频图像进行处理并获取遮罩,所以分了两路支线。因为sam3.1模型的精度很高,官流没有通过打点的方式创建遮罩,而是直接通过文字描述的形式对图像进行分割。最后通过Create SCAIL-2 Colored Mask这个节点生成参考图像和动作视频的遮罩数据传递给后续的核心处理节点WanSCAILToVideo。
可以看到WanSCAILToVideo节点接收并处理前面各步骤预处理得到的图像和视频处理数据,并生成正反向条件及潜空间latent传递给后方的采样器,最终生成视频。
此处需要注意的是,下方布尔值节点对应的replacement_mode指是否开启替换模式,false模式下指“动作迁移”模式,true则代表使用的是角色替换功能。
后方的切换设置区域主要用于调整是否启用加速lora所需的不同cfg值和steps步数值切换。最终通过自定义采样器节点处理及VAE编码生成结果视频。
2.3 官流整体结构总结
整个工作流的逻辑并不复杂,基本流线逻辑是:模型加载+图像和视频输入→尺寸预处理→通过sam获取图像和视频的遮罩信息→输入scail2核心节点wanscail2tovideo进行处理→采样器处理获取分段视频,最后再将多段视频进行拼接。
三、优化版工作流讲解
了解了官方基础工作流的逻辑,我们再来看看社区优化版本的工作流搭建及注意事项。
3.1 插件介绍与安装
首先做一下准备工作,优化版工作流需要使用社区大佬wuwukak基于KJ版插件wanvideowrapper优化后独立运行的wananimate plus插件。
插件地如下:https://github.com/wuwukaka/ComfyUI-WanAnimatePlus/tree/main
该插件在wanvideo工作流上新增了四大功能,分别是:多图参考、无缝视频衔接、支持 Bernini 模型以及适配Scail2模型。
针对scail2模型的核心节点是 WanAnimatePlus SCAIL_2 Embeds,说明中强调,该节点会自动把尺寸对齐到 32 像素倍数,同时支持动作迁移和角色替换两种模式,且要使用该节点,需把工作流全链路替换为 WanAnimatePlus 版本节点,不要和原版 WanVideoWrapper 节点混用,否则可能出现报错。
安装完该插件后,我们先来看一下动作迁移工作流的搭建逻辑,然后再在动作迁移的基础上调整为角色替换以及多图参考。
3.2 优化版动作迁移工作流介绍
3.2.1整体布局
整体布局:为了方便初学者使用,我习惯把主要输入项及参数项设置成一个单独的输入区,完整的工作流则在后台区进行运行。
3.2.2 输入区介绍
输入区包括视频加载、图像加载、遮罩内容填写、正向提示词、帧率设置、视频宽高设置及角色数量设置等常用内容。
视频加载Load Video (Upload) 节点,主要关注frame_load_cap、skip_first_frames两个参数,frame_load_cap指读取的总帧数,默认是0指不限制总帧数,将上传的视频全部输入,在我们快速测试效果时,就可以将此值调低到20帧左右,这样就无需等到整段视频全部运行完才能看到效果。skip_first_frames指视频前段跳过的帧数,结合总帧数就可以自由设置输入长视频的任意分段内容。force_rate指强制帧率,该参数已接入独立的“帧率设置”节点进行统一设置,此处无需调整。
遮罩内容输入,分别对应图片遮罩内容和视频遮罩内容,注意此对话框必须输入英文。常规情况下,如果图片和视频中均为人类,则两个输入框均填入person即可。如果图片或视频的主体比较复杂,可以通过更为详细的描述来指定主体,比如多人图片中指定其中带帽子的男孩,就可以输入“the boy with a hat”来限定具体分割对象。
在scail2工作流中,正向提示词是能发挥起具体作用的,常规正常的视频仅需直接描述目标视频内容即可,注意不要描述成视频编辑指令。对于一些特殊角色和场景的视频,提示词的偏差可能会明显影响视频内容,此时就需要通过多轮优化测试来获得最佳效果。
帧率是指每秒播放的图片数量,帧率越高则视频越丝滑,相应地对显存内存的需求及工作流处理时间都会变大。一般建议最低帧率应不小于16,常用帧率值24或30基本上就能达到不错的效果。
视频宽高设置需要时32的整数倍,推荐直接使用官方建议的512P和704P尺寸。如输入的尺寸不是32的整数倍,WanAnimatePlus插件也会自动对齐到32的倍数。因为工作流中需要对参考图像及动作视频进行裁剪预处理,所以在宽高设置处,也设置了自动公式进行计算,拖动节点即可看到隐藏在背后的数学计算式。
角色数量的设置对应的是sam3.1分割模块中的“sam3视频跟踪”的“max_objects”,该数值并非指可识别角色的数量,而是指可以识别角色的数量上限。正常情况下,该数值只需大于等于图片和视频中的角色数量即可。比如参考图中有两人,该数值设置为1,则只可分割出1个对象;该数值设置为3,则可正常分割出2个对象。
sam3.1视频跟踪节点会对分割出的角色对象进行标记和跟踪,即使角色出现左右位置互换等动作,模型依然可以精准识别。模型最大支持的角色跟踪数量为6,预览图中会以不同颜色进行区分,我们输入一张7人图像,就可以看到第7名角色的遮罩颜色与第1个角色重复,也就是说在多角色图像的动作迁移中最多可以标记跟踪6个对象,超出该数值就有可能出现跟踪不准确等问题。
3.2.3 核心工作区介绍
到后台区可以看到完整的工作流搭建逻辑。
首先是模型加载区,模型均使用wananimate plus插件的模型加载节点,模型的选择前文已经进行说明,根据你的电脑配置选择对应版本模型即可,此处不再赘述。
这里仅有几个需要关注的点特别提醒下,模型加载器的attention_mode注意力机制默认的sageattn需安装加速库,如你本地部署未安装加速库导致报错,可以将注意力机制调整为sdpa模式。
BlockSwap是“显存分块交换”节点,主要根据显存和内存大小调整blocks_to_swap交换块数。交换块数一般在0-40之间调整,该数值越大,则显存占用越低,生成速度越慢,对应的内存需求越高。该数值越低,则显存占用越高,生成速度越快,内存需求降低。另外,use_non_blocking非阻塞数据传输开关默认开启,如果你的电脑配置较低也要记得关闭,牺牲运行速度避免报错。
lora模型加载区主要使用了官方推荐的加速lora、DPO lora、relighting重打光lora等几个基础lora,也可以参考wan22 animate动作迁移的工作流lora进行加载。
clip视觉、文本模型及VAE模型选择正确模型版本即可。
视频预处理区和图片预处理区主要是对图像和视频的尺寸进行统一处理,避免参考图与动作视频尺寸不一致导致的异常。注意检查预处理图的预览图,确保参考图及视频经尺寸处理后均可以保留主要元素,避免出现重要元素(如人物头部)因图像裁切导致丢失问题。
遮罩生成区与官方基础工作流保持一致,额外增加了遮罩的预览区,可以看到图片遮罩与视频遮罩的背景颜色不同,参考图遮罩预览中白色背景代表保留背景信息,视频遮罩预览的黑色背景代表不保留背景信息,因为此时“替换模式”设置为false,即动作迁移模式,不需要源视频的背景信息。
如果开启“替换模式”,则遮罩图的背景颜色会出现对换,参考图遮罩预览为黑色背景代表不需要背景信息,参考视频遮罩预览为白色背景,代表保留原视频背景信息。
采样区的逻辑与官方工作流基本一致,主要使用wananimate plus插件节点替代了原工作流的WanSCAILToVideo节点及自定义采样器。需要注意的是SCAIL_2 Embeds节点中的模式要设置正确,动作迁移工作流中,替换模式replacement_mode开关需设置为false,保留主参考图背景preserve_main_ref_background开关设置为true。人物替换工作流中,上述两个参数则对应分别设置为true及false.
最后,VAE解码器采用wananimate plus插件的分块解码器,如果在VAE解码步骤报错的,可以打开分块解码,将enable_vae_tiling开关设置为true。
到此步骤,使用wananimate plus插件完整的优化版SCAIL2工作流就搭建完成了,我们再回顾一下,整体搭建逻辑基本遵循官方基础工作流,总共分为预处理区、获取遮罩区、模型加载区及采样区四个主要区域。
3.3 优化版任务替换工作流搭建
动作迁移工作流搭建完毕后,仅需调整一下模式就可以转换成人物替换工作流,分别将sam遮罩区的Create SCAIL-2 Colored Mask节点和采样区的SCAIL_2 Embeds节点中的replacement_mode开关设置为true,开启替换模式。另外,注意将SCAIL_2 Embeds节点中的保留主参考图背景preserve_main_ref_background开关设置为false。
因为scail2模型是端到端视觉引导,即使开启了替换模式,原参考图的背景仍会对视频背景产生一定干扰。所以,在人物替换工作流中,我们对参考图的尺寸预处理后,增加去除背景的步骤,这样就可以避免出现参考图背景对视频背景的影响。
3.4 多图参考工作流搭建
动作迁移和人物替换的工作流搭建完成后,多图参考模式也并不复杂,因为SCAIL_2 Embeds节点预留了多参考图及多参考图遮罩的接口,只需将处理的多图信息输入即可。
先看多图参考的输入及多图遮罩的获取:
多图的加载图像的节点依然放到输入区,方便平时使用操作,然后通过set节点发送到后台区。
后台区多图参考板块,对应的是4个参考图的处理流程,与主参考图类似,也是由图像裁剪预处理得到预处理图,然后由sam3.1相关节点处理获取图像遮罩图。
得到的预处理图分别接入Image Batch Multi(图像批次处理)节点,即可输出 prefix_frames(多参考图注入)信息,并传输到SCAIL_2 Embeds节点。
得到的遮罩图分别接入Image Batch Multi(图像批次处理)节点,即可输出prefix_mask(多参考图遮罩)信息,并传输到SCAIL_2 Embeds节点。
多参考图注入最多支持5张额外图像输入,作者wuwukaka推荐额外输入3张图像。不过我自己测试下来,多图参考在人物替换中的效果并不好,具体效果和差距大家可以自行测试区别。
完成上面的步骤,我们就实现了scail2模型的多图参考工作。
四、总结与说明
4.1 低显存调试要点
低显存显卡运行报错的调试方法:
首先还是调整尺寸、视频长度和帧率等,尽量调低以减小资源需求;
调整模型规格,scail2模型选择GGUF版本,加速lora模型由distill_rank128降低到distill_rank64或distill_rank32版本;
WanAnimatePlus BlockSwap显存分块交换节点,将blocks_to_swap分块节点调整为40,use_non_blocking使用非阻塞模式开关设置为false;
4.2 测试经验分享
使用过程中遇到的一些问题和经验:
原视频中只有1个人,参考图中有两个人,可以通过sam模型指定其中1人进行动作迁移。
人物替换时,需要先将参考图像和视频中的角色尽可能对齐,否则可能出现人物空间位置不合理等问题。尤其在角色为非人类时,出现问题的概率十分高。
3、 正向提示词对最终生成视频效果有直接作用,尤其在参考图像与视频角色未做对齐的情况下,不同提示词生成的结果差别明显。
4、 动作迁移和角色替换前,先通过去除字幕工作流去除图像和视频中的字幕,否则生成的视频会出现乱码的字幕。
5、 scail2模型可以实现不错的自动切镜效果,含有切镜的长视频可以尝试不用切割成分段视频直接生成。
6、 生成视频最开始的两三帧可能出现偏色的问题,导致画面开始出现闪烁,可以通过Get Image or Mask Range From Batch节点跳过最开始的两三帧画面来解决。
五、模型及工作流地址
本节内容模型及工作流链接地址:https://pan.quark.cn/s/0bffa7c3bd26
欢迎正在学习comfyui等ai技术的伙伴VX加 huaqs123 进入学习小组。在这里大家共同学习comfyui的基础知识、最新模型与工作流、行业前沿信息等,也可以讨论comfyui商业落地的思路与方向。 欢迎感兴趣的小伙伴,群共享资料会分享博主自用的comfyui整合包(已安装超全节点与必备模型)、基础学习资料、工作流等资源……
致敬每一位在路上的学习者,你我共勉!Ai技术发展迅速,学习comfyUI是紧跟时代的第一步,促进商业落地并创造价值是我们学习的最终目标。
——画青山Ai学习专栏———————————————————————————————
零基础学Webui:
https://blog.csdn.net/vip_zgx888/category_13020854.html
Comfyui基础学习与实操:
https://blog.csdn.net/vip_zgx888/category_13006170.html
comfyui功能精进与探索:
https://blog.csdn.net/vip_zgx888/category_13005478.html
系列专栏持续更新中,欢迎订阅关注,共同学习,共同进步!