Qwen3-TTS 声音克隆教程:10秒录音克隆你的声音,本地免费无限量配音
Qwen3-TTS 声音克隆是什么?能做什么
Qwen3-TTS 是阿里开源的全能语音模型(1.7B 参数),最大特点就是本地免费无限量使用——不花一分钱、不限次数,声音数据不出你的电脑。
这一篇教的是它的声音克隆能力:给它一段 3~10 秒的人声参考音频,再加上这段音频的逐字转写文本,它就能学会这个人的音色、语速、语调、停顿习惯,然后用这个声音朗读你指定的任何内容——你说什么它说什么,但声音是"那个人"的。
它能做什么?
- 给自己配一个"AI 分身":录 10 秒自己的声音,以后想让它读什么就读什么,发视频解说、读书稿都不用自己重录
- 给视频/有声内容配音:用你的声音风格朗读文案,本地生成、可无限重试
- 一句话出正式内容:录一段随口的日常语音,克隆后让它用你的声音朗读正式文稿(比如给领导的工作汇报)
和在线配音工具的区别:那些工具要么只能选固定音色、要么按字数收费、要么上传素材有审核;Qwen3-TTS 声音克隆是本地跑、不花钱、不限量,克隆的是你提供的参考音色,不是别人家的预设。
第 1 步:打开声音克隆工作流
启动 ComfyUI(双击 ComfyUI启动器.exe),浏览器打开界面后:
- 左侧「工作流」列表打开 AI星尘-开箱即用 文件夹
- 进入 音频 子文件夹
- 选择 Qwen3-TTS-声音克隆.json

模型已经内置在整合包里(models\qwen-tts\ 目录),开箱即用,不需要额外下载任何东西。
第 2 步:认识工作流(一共 3 个节点)
这篇工作流非常简洁,整条链路就三步:
- LoadAudio(加载音频):上传你的参考音频,起点
- FB_Qwen3TTSVoiceClone(Voice Clone / 声音克隆):核心节点,吃进参考音频 + 参考文本 + 目标文本,输出克隆语音
- SaveAudioMP3(保存音频):把结果存成 MP3 文件

中间还有两张提示卡片,是作者留下的使用说明,翻译过来就是:
- 「这里的文本内容需要与输入音频的内容完全一致」——指的是下面要填的「参考文本」
- 「这里的文本内容填写输出音频的内容」——指的是要生成的目标文本
这两个卡片就是整篇工作流的灵魂,照着做就能成。卡片下面这个节点上,ref_text(参考文本)和 target_text(目标文本)这两个输入框就是本篇的核心操作位。
第 3 步:准备并上传参考音频
参考音频的质量直接决定克隆效果,三条要求:
- 清晰:没有背景音乐、没有噪音、没有杂音
- 单人声:只录一个人的声音,别放第二个人或电视声
- 3~10 秒:太短学不全音色,太长没必要
手机录音完全没问题——找安静的地方,对着手机读一句话就行。比如录一句:"领导目前工作已经完成了第一部分,第二部分预计本周五可以完成项目。"(工作汇报场景)。
然后点 LoadAudio 节点上的上传按钮(choose file to upload),选择你的音频文件。工作流默认挂了一个示例音频「声音克隆示例.wav」(内容是一句"翻译翻译,什么叫惊喜?"),你可以先用它跑通全流程,再换自己的。

第 4 步:填写参考文本(最关键的一步)
在 FB_Qwen3TTSVoiceClone 节点上找到 ref_text(参考文本) 输入框——填的是参考音频里说的话,逐字转写。
⚠️ 铁律:参考文本必须和加载的音频内容完全一致。模型需要知道"音频里的每个字"长什么样:哪个字是轻声、哪个词拖了尾音、哪里停顿了。文本和音频对不上,克隆出来就像"口型对不上"一样别扭,这也是工作流里紫色卡片反复提醒的原因。
如果音频是你自己录的,先做语音转文字:把录音拖进剪映点「识别字幕」,或使用通义听悟/Whisper 等工具,把转写结果复制出来——转写工具会自动带上标点,你基本不用管标点怎么填。比如你录的这段话:
领导目前工作已经完成了第一部分,第二部分预计本周五可以完成项目,最终结果预计在下周一中午12点前向您汇报,您看可以吗?
那 ref_text 就原样填这一句(录音里说了什么,这里就填什么,一个标点一个字都不能自作主张改)。
如果用的是包里示例音频,ref_text 就填它的内容:
翻译翻译,什么叫惊喜?

第 5 步:填写要生成的内容
再找到 target_text(目标文本) 输入框——这里填的是你希望克隆声音朗读的内容,想读什么填什么,不用和参考文本有任何关系。
比如让"你的声音"读一首古诗词:
帘外雨潺潺,春意阑珊。罗衾不耐五更寒。梦里不知身是客,一晌贪欢。独自莫凭栏,无限江山。别时容易见时难。流水落花春去也,天上人间。
想读多长?max_new_tokens 默认 2048,够读好几百字的长文案,不用分段。

第 6 步:点运行,等待出片
点界面右侧的「运行」按钮,第一次跑会加载模型(约 3.6GB,需要等一会儿),之后每次就快了。生成完成后 SaveAudioMP3 节点会显示结果,文件保存在:
ComfyUI\output\audio\Qwen3-TTS\

在保存节点上可以直接试听;文件夹里就是 MP3 文件,可以随便拷贝使用。
参数速览(保持默认即可)
克隆节点上参数不少,但除了参考文本和目标文本,其他默认值都是调好的,知道它们是干嘛的就行:
- model_choice(模型):1.7B——Qwen3-TTS 最强模型,包内已内置
- device / precision:auto / bf16——自动选设备,半精度省显存
- language(语言):Chinese——和参考音频/目标文本匹配(换 English 就能克隆英语声音)
- seed(种子):randomize——每次随机,同一句话多抽几次挑效果最好的
- max_new_tokens:2048——生成上限,默认够用
- top_p 0.85 / top_k 30 / temperature 1.1:采样参数,调大更"放飞"、调小更"规整",一般不用动
- repetition_penalty:1.05——防止复读机
- x_vector_only(只提取音色向量):默认 false,完整克隆(音色+语速+语调+说话习惯全学);改成 true 时只提取音色向量、不需要填参考文本(手上音频转写不出文本时用这个救急,但像度会打折)
- attention:sage_attn——省显存的注意力加速实现,别动
- unload_model_after_generate:false——生成完不卸载模型,连跑多条更快
进阶玩法
- 多抽几次选最佳:seed 是 randomize,同一句文案多跑几次,挑发音最自然的那一版
- 克隆英语/日语声音:把 language 改成 English 等对应语言,参考音频用相应语言的录音即可
- 免文本快速克隆:手上只有一段音频、转写不出文本时,把 x_vector_only 打开(true),直接跑也能出,只是克隆精度略降
- 参考文本自动化:自录音频先用剪映「识别字幕」/Whisper 等语音转文字工具出稿,直接复制进 ref_text,标点自动带好,省去手打
- 长文分句优化:文本里用标点把句子断清楚,模型停顿会更自然
常见问题
- 克隆的声音不像?排查三处:参考音频是否清晰无背景音乐、参考文本是否与音频逐字一致、音频是否只有一个人说话——九成问题出在参考文本对不上音频
- 参考文本怎么填?先做语音转文字(剪映识别字幕等),把转写结果复制进 ref_text,录音里说了什么就填什么
- 读出来的语气怪?大概率是参考文本少了语气词或标点,补全重跑
- 第一次运行很慢?正常,模型首次加载 3.6GB 权重,耐心等;之后每次生成就快了
- 显存/内存不足?关掉浏览器其他标签页再跑;TTS 模型本身很轻,16G 显存完全无压力
- 输出文件在哪?
ComfyUI\output\audio\Qwen3-TTS\
小结
Qwen3-TTS 声音克隆的用法就一句话:10 秒参考音频 + 逐字参考文本 + 目标文本,本地免费无限量克隆配音。记住最关键的一点——参考文本必须与音频逐字一致(自录音频先用语音转文字出稿),这是像不像的分水岭。