本文档由 AI 生成。如果您发现任何错误或有改进建议,欢迎贡献! 在 GitHub 上编辑WanInfiniteTalkToVideo 节点可从音频输入生成视频序列。它使用视频扩散模型,以从一个或两个说话者提取的音频特征为条件,生成说话人视频的潜在表示。该节点可以生成新序列,或使用先前帧作为运动上下文来扩展现有序列。
输入参数
参数约束:
- 当
mode设置为"two_speakers"时,参数audio_encoder_output_2、mask_1和mask_2变为必填项。 - 如果提供了
audio_encoder_output_2,则必须同时提供mask_1和mask_2。 - 如果提供了
mask_1和mask_2,则必须同时提供audio_encoder_output_2。 - 如果提供了
previous_frames,则其包含的帧数必须至少等于motion_frame_count指定的数量。