Qwen3-TTS 声音克隆教程:10秒录音克隆你的声音,本地免费无限量配音

2026-08-22 14:05 · 95 阅读
整合包工作流实战 · 第 17 篇 / 共 19 篇 查看系列 →
Qwen3-TTS 声音克隆教程:10秒录音克隆你的声音,本地免费无限量配音

Qwen3-TTS 声音克隆是什么?能做什么

Qwen3-TTS 是阿里开源的全能语音模型(1.7B 参数),最大特点就是本地免费无限量使用——不花一分钱、不限次数,声音数据不出你的电脑。

这一篇教的是它的声音克隆能力:给它一段 3~10 秒的人声参考音频,再加上这段音频的逐字转写文本,它就能学会这个人的音色、语速、语调、停顿习惯,然后用这个声音朗读你指定的任何内容——你说什么它说什么,但声音是"那个人"的。

它能做什么?

  • 给自己配一个"AI 分身":录 10 秒自己的声音,以后想让它读什么就读什么,发视频解说、读书稿都不用自己重录
  • 给视频/有声内容配音:用你的声音风格朗读文案,本地生成、可无限重试
  • 一句话出正式内容:录一段随口的日常语音,克隆后让它用你的声音朗读正式文稿(比如给领导的工作汇报)

和在线配音工具的区别:那些工具要么只能选固定音色、要么按字数收费、要么上传素材有审核;Qwen3-TTS 声音克隆是本地跑、不花钱、不限量,克隆的是你提供的参考音色,不是别人家的预设。

第 1 步:打开声音克隆工作流

启动 ComfyUI(双击 ComfyUI启动器.exe),浏览器打开界面后:

  1. 左侧「工作流」列表打开 AI星尘-开箱即用 文件夹
  2. 进入 音频 子文件夹
  3. 选择 Qwen3-TTS-声音克隆.json

2cd0edd7-18b4-4acb-9b5e-dec50ec03539.png

模型已经内置在整合包里(models\qwen-tts\ 目录),开箱即用,不需要额外下载任何东西。

第 2 步:认识工作流(一共 3 个节点)

这篇工作流非常简洁,整条链路就三步:

  • LoadAudio(加载音频):上传你的参考音频,起点
  • FB_Qwen3TTSVoiceClone(Voice Clone / 声音克隆):核心节点,吃进参考音频 + 参考文本 + 目标文本,输出克隆语音
  • SaveAudioMP3(保存音频):把结果存成 MP3 文件

d5177067-03ef-44da-87b4-fca01ec6a31e.png

中间还有两张提示卡片,是作者留下的使用说明,翻译过来就是:

  • 「这里的文本内容需要与输入音频的内容完全一致」——指的是下面要填的「参考文本」
  • 「这里的文本内容填写输出音频的内容」——指的是要生成的目标文本

这两个卡片就是整篇工作流的灵魂,照着做就能成。卡片下面这个节点上,ref_text(参考文本)和 target_text(目标文本)这两个输入框就是本篇的核心操作位。

第 3 步:准备并上传参考音频

参考音频的质量直接决定克隆效果,三条要求:

  • 清晰:没有背景音乐、没有噪音、没有杂音
  • 单人声:只录一个人的声音,别放第二个人或电视声
  • 3~10 秒:太短学不全音色,太长没必要

手机录音完全没问题——找安静的地方,对着手机读一句话就行。比如录一句:"领导目前工作已经完成了第一部分,第二部分预计本周五可以完成项目。"(工作汇报场景)。

然后点 LoadAudio 节点上的上传按钮(choose file to upload),选择你的音频文件。工作流默认挂了一个示例音频「声音克隆示例.wav」(内容是一句"翻译翻译,什么叫惊喜?"),你可以先用它跑通全流程,再换自己的。

2a9c2b9f-5706-429e-b1b9-50a21e6c8c05.png

第 4 步:填写参考文本(最关键的一步)

在 FB_Qwen3TTSVoiceClone 节点上找到 ref_text(参考文本) 输入框——填的是参考音频里说的话,逐字转写。

⚠️ 铁律:参考文本必须和加载的音频内容完全一致。模型需要知道"音频里的每个字"长什么样:哪个字是轻声、哪个词拖了尾音、哪里停顿了。文本和音频对不上,克隆出来就像"口型对不上"一样别扭,这也是工作流里紫色卡片反复提醒的原因。

如果音频是你自己录的,先做语音转文字:把录音拖进剪映点「识别字幕」,或使用通义听悟/Whisper 等工具,把转写结果复制出来——转写工具会自动带上标点,你基本不用管标点怎么填。比如你录的这段话:

领导目前工作已经完成了第一部分,第二部分预计本周五可以完成项目,最终结果预计在下周一中午12点前向您汇报,您看可以吗?

那 ref_text 就原样填这一句(录音里说了什么,这里就填什么,一个标点一个字都不能自作主张改)。

如果用的是包里示例音频,ref_text 就填它的内容:

翻译翻译,什么叫惊喜?

552fc221-e04e-4b04-a767-4cf3af5d0d69.png

第 5 步:填写要生成的内容

再找到 target_text(目标文本) 输入框——这里填的是你希望克隆声音朗读的内容,想读什么填什么,不用和参考文本有任何关系。

比如让"你的声音"读一首古诗词:

帘外雨潺潺,春意阑珊。罗衾不耐五更寒。梦里不知身是客,一晌贪欢。独自莫凭栏,无限江山。别时容易见时难。流水落花春去也,天上人间。

想读多长?max_new_tokens 默认 2048,够读好几百字的长文案,不用分段。

image.png

第 6 步:点运行,等待出片

点界面右侧的「运行」按钮,第一次跑会加载模型(约 3.6GB,需要等一会儿),之后每次就快了。生成完成后 SaveAudioMP3 节点会显示结果,文件保存在:

ComfyUI\output\audio\Qwen3-TTS\

02414af9-6fe8-42d0-92be-eee1aeabcd78.png

🔊 播放音频:Qwen3-TTS_00002_

在保存节点上可以直接试听;文件夹里就是 MP3 文件,可以随便拷贝使用。

参数速览(保持默认即可)

克隆节点上参数不少,但除了参考文本和目标文本,其他默认值都是调好的,知道它们是干嘛的就行:

  • model_choice(模型):1.7B——Qwen3-TTS 最强模型,包内已内置
  • device / precision:auto / bf16——自动选设备,半精度省显存
  • language(语言):Chinese——和参考音频/目标文本匹配(换 English 就能克隆英语声音)
  • seed(种子):randomize——每次随机,同一句话多抽几次挑效果最好的
  • max_new_tokens:2048——生成上限,默认够用
  • top_p 0.85 / top_k 30 / temperature 1.1:采样参数,调大更"放飞"、调小更"规整",一般不用动
  • repetition_penalty:1.05——防止复读机
  • x_vector_only(只提取音色向量):默认 false,完整克隆(音色+语速+语调+说话习惯全学);改成 true 时只提取音色向量、不需要填参考文本(手上音频转写不出文本时用这个救急,但像度会打折)
  • attention:sage_attn——省显存的注意力加速实现,别动
  • unload_model_after_generate:false——生成完不卸载模型,连跑多条更快

进阶玩法

  • 多抽几次选最佳:seed 是 randomize,同一句文案多跑几次,挑发音最自然的那一版
  • 克隆英语/日语声音:把 language 改成 English 等对应语言,参考音频用相应语言的录音即可
  • 免文本快速克隆:手上只有一段音频、转写不出文本时,把 x_vector_only 打开(true),直接跑也能出,只是克隆精度略降
  • 参考文本自动化:自录音频先用剪映「识别字幕」/Whisper 等语音转文字工具出稿,直接复制进 ref_text,标点自动带好,省去手打
  • 长文分句优化:文本里用标点把句子断清楚,模型停顿会更自然

常见问题

  • 克隆的声音不像?排查三处:参考音频是否清晰无背景音乐、参考文本是否与音频逐字一致、音频是否只有一个人说话——九成问题出在参考文本对不上音频
  • 参考文本怎么填?先做语音转文字(剪映识别字幕等),把转写结果复制进 ref_text,录音里说了什么就填什么
  • 读出来的语气怪?大概率是参考文本少了语气词或标点,补全重跑
  • 第一次运行很慢?正常,模型首次加载 3.6GB 权重,耐心等;之后每次生成就快了
  • 显存/内存不足?关掉浏览器其他标签页再跑;TTS 模型本身很轻,16G 显存完全无压力
  • 输出文件在哪?ComfyUI\output\audio\Qwen3-TTS\

小结

Qwen3-TTS 声音克隆的用法就一句话:10 秒参考音频 + 逐字参考文本 + 目标文本,本地免费无限量克隆配音。记住最关键的一点——参考文本必须与音频逐字一致(自录音频先用语音转文字出稿),这是像不像的分水岭。

登录后分享可赚邀请积分
评论 (0)

登录后才能发表评论

去登录