Qwen3-TTS 自定义声音教程:9种预置音色直接选,中英日韩方言都能说

2026-08-22 14:25 · 137 阅读
整合包工作流实战 · 第 18 篇 / 共 19 篇 查看系列 →
Qwen3-TTS 自定义声音教程:9种预置音色直接选,中英日韩方言都能说

Qwen3-TTS 自定义声音是什么?能做什么

Qwen3-TTS 的第三种玩法:自定义声音——模型内置了 9 种预置音色库,在节点上下拉框直接选一个,填上文本就能说话。不用参考音频,也不用写声音描述,是最快出稿的一种玩法。

它能做什么?

  • 快速试音:想知道"这个文案用哪个声音读好听"?把 9 个音色各跑一遍,10 分钟内挑出最佳
  • 多角色对话:两个角色各用一个音色,分别生成再拼接,就是一段"双人对话"
  • 日常配音出稿:选中一个顺耳的音色,填文案就出成品,零门槛

Qwen3-TTS 三种玩法的分工:声音克隆=复制一个已有的声音(需要参考音频);声音设计=凭空描述一个想要的声音(需要写描述);自定义声音=直接从内置音色库挑一个现成的(什么都不要,选完就说)。

第 1 步:打开自定义声音工作流

启动 ComfyUI(双击 ComfyUI启动器.exe),浏览器打开界面后:

  1. 左侧「工作流」列表打开 AI星尘-开箱即用 文件夹
  2. 进入 音频 子文件夹
  3. 选择 Qwen3-TTS-自定义声音.json

80da8c90-94cd-40a8-bff5-c491779ee65b.png

模型 Qwen3-TTS-12Hz-1.7B-CustomVoice 已内置在包里(models\qwen-tts\),开箱即用。

第 2 步:认识工作流(2 个节点)

  • FB_Qwen3TTSCustomVoice(Custom_Voice / 自定义语音):核心节点——speaker(选音色)+ text(要读的内容)+ 可选 instruct(微调语气)
  • SaveAudioMP3(保存音频):结果存成 MP3

de76efb4-7824-43f9-a45d-0ed8f2f028c1.png

第 3 步:选择预置音色(speaker)

点 speaker 下拉框,9 种预置音色:

  • Eric:成熟男声(工作流默认选的这个)
  • Aiden / Dylan / Ryan:其他男声音色,Ryan 是下拉默认值
  • Serena / Vivian:女声音色
  • Ono_anna:日系女声
  • Sohee:韩系女声
  • Uncle_fu:大叔音

e21c7c4b-b0c9-401a-a2b7-b8917d128625.png

先随便选一个跑一遍试听,不满意就换——这是预置音色库最大的优势:换音色只是改一个下拉框的事。

第 4 步:填写文本(text)

在 text 输入框填上要让音色朗读的内容,比如用一首古诗词试试效果:

帘外雨潺潺,春意阑珊。罗衾不耐五更寒。梦里不知身是客,一晌贪欢。独自莫凭栏,无限江山。别时容易见时难。流水落花春去也,天上人间。

想读普通话、英语、日语、韩语都可以,把 language 参数改成对应语言即可。Qwen3-TTS 还支持方言,比如工作流默认挂的示例是一段四川话:

你龟儿太过分了,把我的东西都搞坏了,还晓不晓得认错,硬是要把我整冒火你才安逸嗦,莫再烦老子爬球开。

9033180c-0d4f-4614-b3b0-848886a91d30.png

第 5 步:(可选)instruct 微调语气

节点上还有一个可选的 instruct 输入框(默认留空):

  • 留空:直接按音色库默认风格朗读
  • 填内容:在预置音色基础上叠加语气,比如 语气凶狠一点,语速加快 或 温柔缓慢,带着笑意

instruct 的写法和「声音设计」里描述声音的方式一样(音色+语速+语调+说话习惯),但这里它是叠加修饰,不填也能正常用。

image.png

第 6 步:点运行,等待出片

点右侧「运行」按钮,第一次会加载模型(约 3.6GB),之后每次就快了。生成完成后 SaveAudioMP3 节点显示结果,文件在:

ComfyUI\output\audio\Qwen3-TTS\

e8d4b9fa-528f-4b3a-9e62-1ecdd203d290.png

提示:这个是自带默认的ono_anna音色

🔊 播放音频:Qwen3-TTS_00003_

参数速览(保持默认即可)

  • model_choice:1.7B——内置,开箱即用
  • speaker:音色选择,默认 Ryan
  • language:Chinese——换语言就切换朗读语种
  • seed:randomize——同一配置多抽几次,发音略有差异
  • top_p 0.8 / top_k 20 / temperature 1.0 / repetition_penalty 1.05:采样参数,默认即可
  • custom_model_path / custom_speaker_name:高级选项——加载自己微调的声音模型时用(custom_speaker_name 填微调音色名,custom_model_path 填模型路径;填了 custom_speaker_name 后它会覆盖 speaker 下拉选择)

进阶玩法

  • 多角色对话:复制一份工作流(或复制节点),两个 CustomVoice 节点各选不同 speaker(比如 Eric 和 Serena),分别生成两段,拼在一起就是"男女对话"
  • 试音大法:同一段文案,把 9 个音色各跑一遍,全部试听完再决定用哪个——预置音色的好处就是随便折腾
  • 方言/外语内容:四川话、英语、日语、韩语等,把 language 和文本配对即可
  • 加载自训音色:如果你用插件训练过自己的音色模型,填 custom_speaker_name + custom_model_path 就能用(需要自备训练好的模型文件)

常见问题

  • 想换音色?改 speaker 下拉框就行,不用动其他任何参数
  • 预置音色不够用?想要"独一无二"的声音,可以用文字描述造音色(声音设计工作流),或参考音频复制音色(声音克隆工作流)
  • 第一次跑很慢?模型首次加载 3.6GB 权重,正常现象
  • 输出文件在哪?ComfyUI\output\audio\Qwen3-TTS\

小结

自定义声音是 Qwen3-TTS 三种玩法里最快上手的:speaker 下拉选音色 + 填文本 + 点运行,9 种预置音色(中英日韩男声女声大叔音)随便挑,还能用 instruct 叠加语气,方言外语都能读。快速出稿、多角色对话,选它就对了。

登录后分享可赚邀请积分
评论 (0)

登录后才能发表评论

去登录