Scail2 动作迁移教程:一段跳舞视频,让 AI 角色原样复刻
Scail2 动作迁移是什么?能做什么
动作迁移 = 把一段视频里的动作,原样搬到另一个人/角色身上。这一篇的 Scail2 动作迁移工作流:加载一段动作视频(比如跳舞、走路、打太极),再上传一张目标人物图(真人/古风人物/卡通角色都行),它就能生成"目标人物做着视频里的动作"的新视频——换人不换动作。
它能做什么?
- 真人动作搬给 AI 角色:自己录一段舞蹈,让 AI 人物(古风角色、卡通角色)跳一模一样的舞
- 角色动作复刻:让某个角色做指定动作(打招呼、挥手、行走),不用逐帧摆姿势
- 实拍动作再利用:一段实拍动作视频,批量套到多个角色身上
和 H3 图生视频的区别:H3 是"参考图 + 提示词"生成(动作靠提示词描述);Scail2 是骨架驱动——先从动作视频里提取人体关键点序列(骨架),再让模型严格按骨架生成,动作精度高得多。
第 1 步:打开 Scail2 动作迁移工作流
启动 ComfyUI,打开 AI星尘-Minimax H3 文件夹里的 AI星尘--Scail2动作迁移V1.json。

模型已全部内置(SCAIL 专用模型 + SDPose 关键点模型 + 人体检测模型 + Wan 文本/图像编码器),开箱即用。
第 2 步:认识工作流(三大块)
这个工作流比前面几篇复杂,但理解成三块就清晰了:
- 动作提取区:VHS_LoadVideo 加载动作视频 → 人体检测(RTDETR)→ 关键点提取(SDPoseKeypointExtractor)→ 绘制骨架关键点图——把"动作"从视频里抽出来变成骨架数据
- 形象输入区:LoadImage 加载目标人物图 → CLIP Vision 编码——告诉模型"用谁的脸和身体"
- SCAIL 生成区:WanSCAILToVideo(SCAIL 专用模型)吃"骨架 + 形象 + 提示词" → 生成目标人物做该动作的视频 → VHS_VideoCombine 输出

一句话:左半抽动作,中间定形象,右半合成新视频。
第 3 步:加载动作视频(跳什么)
点 VHS_LoadVideo 节点,选择动作视频——视频里要有清晰完整的人体动作(人物全身出镜、动作幅度明显、光线正常)。

建议:3~10 秒、单人出镜、动作连贯的视频效果最好(工作流默认挂了一段跳舞视频示例)。
第 4 步:加载目标人物图(谁来跳)
点 LoadImage 节点,上传目标人物图——你想要谁来做这个动作(真人照片、古风人物、卡通角色都行)。

建议:人物正脸 + 全身(或大半身)清晰图,服装/形象越明确,生成越像。
第 5 步:填提示词
找到「正面提示词」输入框(工作流自带示例:卡通小狗在跳舞。),填上目标人物 + 动作的描述:
- 示例:
古风少女在跳舞,长袖飘逸。 - 要点:写清人物形象(配合 LoadImage 的图)和动作类型(和动作视频一致)

负面提示词已预置(色调艳丽、过曝、静止、模糊等),不用管。
第 6 步:点运行,等动作上身
点「运行」——流程自动走:检测视频里的人 → 提取骨架 → 结合人物图生成新视频。生成完成后 VHS_VideoCombine 输出成片(SCL_xxx.mp4,25 帧/秒)。

实测案例:上传一段 5 秒跳舞视频 + 一张古风人物图,跑完后古风人物完整复刻了跳舞动作——服装、面部是古风人物,动作节奏和视频一致。

参数速览(保持默认即可)
- WanSCAILToVideo:分辨率 512x896(竖版)、帧数自动按视频时长换算(内部循环分段处理,不用管)
- 模型:wan2.1_14B_SCAIL_2(fp8)+ I2V LoRA(加速)+ Wan VAE + umt5 文本编码器——工作流已配好
- 采样器:4 步 euler_ancestral + simple(加速配置)
- 人体检测:RTDETR(person 类别)+ sdpose_wholebody 关键点模型——自动,不用动
技巧
- 动作视频质量优先:骨架提取直接决定生成质量——人物全身清晰、动作幅度大、背景简单的视频效果最好
- 人物图正脸全身:目标人物图越完整(正脸+全身+服装清晰),生成越像;半身照也凑合但全身更稳
- 多角色批量:同一个动作视频,换不同的 LoadImage 人物图重跑——一个动作批量套到 N 个角色
- 配合 SAM3 使用:先用 SAM3 把动作视频里的人抠干净(或把人物图抠成透明底),动作迁移效果更干净
常见问题
- 生成的人物不像?人物图换正脸全身清晰版;提示词里的人物描述和图保持一致
- 动作不完整/变形?动作视频里人物太小或被遮挡——换个全身清晰、动作连贯的视频
- 跑得慢?SCAIL 是 14B 模型 + 循环分段处理,慢是正常的;视频短一点、分辨率保持默认会快些
- 视频里有多个人的?RTDETR 检测 person 会框多人——动作视频尽量单人出镜
小结
Scail2 动作迁移 = 抽动作 + 定形象 + 生成三段式:动作视频提取骨架关键点,人物图确定形象,SCAIL 模型按骨架生成新视频。换人不换动作——录一段舞,AI 角色帮你跳;一套动作,批量套角色。