Qwen3-TTS 声音设计教程:文字描述凭空造出想要的声音

2026-08-22 13:34 · 109 阅读
整合包工作流实战 · 第 16 篇 / 共 19 篇 查看系列 →
Qwen3-TTS 声音设计教程:文字描述凭空造出想要的声音

Qwen3-TTS 声音设计是什么?能做什么

上一类玩法(声音克隆)是"复制一个已有的声音";这一篇的声音设计更神奇——不用任何参考音频,你只需要用一段文字描述(音色、声线、语速、语调、说话习惯),Qwen3-TTS 就能凭空造出一个符合描述的声音,再用这个声音朗读你的文案。

它能做什么?

  • 游戏/动画角色配音:想要一个"呆萌迷糊的少女音"?描述出来,它就是
  • 短视频口播定制音色:不用找配音员,描述一个"知性温柔的女声"直接出稿
  • 创意音色试验:低沉磁性大叔、清冷御姐、活泼少年……先听效果再决定用哪个

和声音克隆的区别一句话:克隆 = 复制一个已有的声音;设计 = 描述一个不存在的声音。克隆需要参考音频,声音设计只需要想象力——它是 Qwen3-TTS 三兄弟里最"凭空造物"的一个。

第 1 步:打开声音设计工作流

启动 ComfyUI(双击 ComfyUI启动器.exe),浏览器打开界面后:

  1. 左侧「工作流」列表打开 AI星尘-开箱即用 文件夹
  2. 进入 音频 子文件夹
  3. 选择 Qwen3-TTS-声音设计.json

f7600cba-a08a-4ee1-9bc4-0b200064b174.png

和声音克隆工作流不同,这里没有 LoadAudio 节点——因为根本不需要音频,一切全靠文字。模型 Qwen3-TTS-12Hz-1.7B-VoiceDesign 已内置在包里,开箱即用。

第 2 步:认识工作流(2 个节点)

  • FB_Qwen3TTSVoiceDesign(Design Voice / 声音设计):核心节点,两个必填输入——text(要朗读的内容)+ instruct(声音长什么样的文字描述)
  • SaveAudioMP3(保存音频):把结果存成 MP3

6496889e-efb2-4588-ad86-c10f07066557.png

第 3 步:填写要朗读的内容(text)

在 text 输入框填上想让声音读出来的文案,工作流默认示例:

帘外雨潺潺,春意阑珊。罗衾不耐五更寒。梦里不知身是客,一晌贪欢。独自莫凭栏,无限江山。别时容易见时难。流水落花春去也,天上人间。

换成你自己的任何文案都可以,支持长文本(max_new_tokens 默认 2048)。

974f1ba0-ece1-491b-82ba-c91f64b43c27.png

第 4 步:用文字描述你想要的声音(instruct)——本工作流的灵魂

在 instruct 输入框里,用自然语言描述"这个声音应该是什么样"。工作流默认带了一个官方示例,拆开看就明白怎么写:

模拟呆萌天然的少女音色,声线中高偏软,语速适中略慢,语调圆润、带一点空灵感。说话时偶尔莫名其妙地停顿,像在放空或走神,尾音常常轻柔拉长,显得有点迷糊。有些词会读得略微笨拙却不至于太错,整体感觉单纯、慢半拍、反应迟钝但非常治愈。

这段描述其实包含了四个层次,写作公式:

  1. 音色基调:呆萌天然的少女音色、声线中高偏软——先定"这是什么嗓子"
  2. 语速节奏:语速适中略慢——再定"说话快慢"
  3. 语调韵味:语调圆润、带一点空灵感——接着定"腔调感觉"
  4. 说话习惯(灵魂细节):偶尔停顿走神、尾音拉长、读词略微笨拙、整体慢半拍——最后加"小毛病",这是让声音"活"起来的关键,也是和别人的描述拉开差距的地方

e32530ca-d74e-421c-8ae6-d9d0b715e2cd.png

换一个例子,想要"磁性大叔音":

模拟低沉磁性的成熟男声,声线偏低带轻微沙哑,语速较慢,语调沉稳厚重,尾音微微压低。说话时像在慢慢思考,偶尔轻轻叹气,带一点疲惫感,整体感觉可靠、温和、有故事。

记住:描述得越具体,出来的声音越接近你想要的效果。只有"温柔一点"这种模糊描述,出来的声音也会模糊。

第 5 步:点运行,等待出片

点右侧「运行」按钮,第一次会加载模型(约 3.6GB),之后每次就快了。生成完成后 SaveAudioMP3 节点显示结果,文件在:

ComfyUI\output\audio\Qwen3-TTS\

3949e888-7230-49c5-8e02-7d1e5d0f1c14.png

🔊 播放音频:Qwen3-TTS_00001_

不满意?改 instruct 描述重新跑——这是声音设计工作流最爽的地方:改文字就能改声音,零成本无限迭代。

参数速览(保持默认即可)

  • model_choice:1.7B——包内已内置,开箱即用
  • language:Chinese——描述和文本用什么语言就选什么
  • seed:randomize——同一描述多抽几次,效果有差异
  • top_p 0.8 / top_k 20 / temperature 1.0:采样参数,比克隆版略保守,默认不用动
  • attention:sdpa——省显存的注意力实现,别动

进阶玩法

  • 加"情绪状态":instruct 里加"语气带着笑意""像在低声自语",角色感立刻不同
  • 多语种设计:language 换 English 等,用英文描述音色,出英语声音
  • 描述迭代法:先粗描述出一版,听缺点,把"缺点"写进新描述(比如"鼻音再重一点""语速再慢一档")
  • 给视频/动画角色批量配音:同一个 instruct 固定一个角色音色,多段 text 就是同一个角色的多句台词

常见问题

  • 声音和想象的不一样?描述不够具体。把语速、声线高低、停顿习惯都写进去,尤其"说话习惯"那一层是点睛之笔
  • 提示 text 和 instruct 都要填?对,两个都必填——没有文本不知道读什么,没有描述不知道用什么嗓子
  • 第一次跑很慢?模型首次加载 3.6GB 权重,正常现象
  • 输出文件在哪?ComfyUI\output\audio\Qwen3-TTS\

小结

Qwen3-TTS 声音设计的核心是 instruct 描述公式:音色基调 + 语速节奏 + 语调韵味 + 说话习惯。不用录音、不用参考音频,一段文字凭空造出一个声音,改文字就能改声音——这是角色配音和创意音色最顺手的玩法。

登录后分享可赚邀请积分
评论 (0)

登录后才能发表评论

去登录