Qwen3-TTS 声音设计教程:文字描述凭空造出想要的声音
Qwen3-TTS 声音设计是什么?能做什么
上一类玩法(声音克隆)是"复制一个已有的声音";这一篇的声音设计更神奇——不用任何参考音频,你只需要用一段文字描述(音色、声线、语速、语调、说话习惯),Qwen3-TTS 就能凭空造出一个符合描述的声音,再用这个声音朗读你的文案。
它能做什么?
- 游戏/动画角色配音:想要一个"呆萌迷糊的少女音"?描述出来,它就是
- 短视频口播定制音色:不用找配音员,描述一个"知性温柔的女声"直接出稿
- 创意音色试验:低沉磁性大叔、清冷御姐、活泼少年……先听效果再决定用哪个
和声音克隆的区别一句话:克隆 = 复制一个已有的声音;设计 = 描述一个不存在的声音。克隆需要参考音频,声音设计只需要想象力——它是 Qwen3-TTS 三兄弟里最"凭空造物"的一个。
第 1 步:打开声音设计工作流
启动 ComfyUI(双击 ComfyUI启动器.exe),浏览器打开界面后:
- 左侧「工作流」列表打开 AI星尘-开箱即用 文件夹
- 进入 音频 子文件夹
- 选择 Qwen3-TTS-声音设计.json

和声音克隆工作流不同,这里没有 LoadAudio 节点——因为根本不需要音频,一切全靠文字。模型 Qwen3-TTS-12Hz-1.7B-VoiceDesign 已内置在包里,开箱即用。
第 2 步:认识工作流(2 个节点)
- FB_Qwen3TTSVoiceDesign(Design Voice / 声音设计):核心节点,两个必填输入——text(要朗读的内容)+ instruct(声音长什么样的文字描述)
- SaveAudioMP3(保存音频):把结果存成 MP3

第 3 步:填写要朗读的内容(text)
在 text 输入框填上想让声音读出来的文案,工作流默认示例:
帘外雨潺潺,春意阑珊。罗衾不耐五更寒。梦里不知身是客,一晌贪欢。独自莫凭栏,无限江山。别时容易见时难。流水落花春去也,天上人间。
换成你自己的任何文案都可以,支持长文本(max_new_tokens 默认 2048)。

第 4 步:用文字描述你想要的声音(instruct)——本工作流的灵魂
在 instruct 输入框里,用自然语言描述"这个声音应该是什么样"。工作流默认带了一个官方示例,拆开看就明白怎么写:
模拟呆萌天然的少女音色,声线中高偏软,语速适中略慢,语调圆润、带一点空灵感。说话时偶尔莫名其妙地停顿,像在放空或走神,尾音常常轻柔拉长,显得有点迷糊。有些词会读得略微笨拙却不至于太错,整体感觉单纯、慢半拍、反应迟钝但非常治愈。
这段描述其实包含了四个层次,写作公式:
- 音色基调:呆萌天然的少女音色、声线中高偏软——先定"这是什么嗓子"
- 语速节奏:语速适中略慢——再定"说话快慢"
- 语调韵味:语调圆润、带一点空灵感——接着定"腔调感觉"
- 说话习惯(灵魂细节):偶尔停顿走神、尾音拉长、读词略微笨拙、整体慢半拍——最后加"小毛病",这是让声音"活"起来的关键,也是和别人的描述拉开差距的地方

换一个例子,想要"磁性大叔音":
模拟低沉磁性的成熟男声,声线偏低带轻微沙哑,语速较慢,语调沉稳厚重,尾音微微压低。说话时像在慢慢思考,偶尔轻轻叹气,带一点疲惫感,整体感觉可靠、温和、有故事。
记住:描述得越具体,出来的声音越接近你想要的效果。只有"温柔一点"这种模糊描述,出来的声音也会模糊。
第 5 步:点运行,等待出片
点右侧「运行」按钮,第一次会加载模型(约 3.6GB),之后每次就快了。生成完成后 SaveAudioMP3 节点显示结果,文件在:
ComfyUI\output\audio\Qwen3-TTS\

不满意?改 instruct 描述重新跑——这是声音设计工作流最爽的地方:改文字就能改声音,零成本无限迭代。
参数速览(保持默认即可)
- model_choice:1.7B——包内已内置,开箱即用
- language:Chinese——描述和文本用什么语言就选什么
- seed:randomize——同一描述多抽几次,效果有差异
- top_p 0.8 / top_k 20 / temperature 1.0:采样参数,比克隆版略保守,默认不用动
- attention:sdpa——省显存的注意力实现,别动
进阶玩法
- 加"情绪状态":instruct 里加"语气带着笑意""像在低声自语",角色感立刻不同
- 多语种设计:language 换 English 等,用英文描述音色,出英语声音
- 描述迭代法:先粗描述出一版,听缺点,把"缺点"写进新描述(比如"鼻音再重一点""语速再慢一档")
- 给视频/动画角色批量配音:同一个 instruct 固定一个角色音色,多段 text 就是同一个角色的多句台词
常见问题
- 声音和想象的不一样?描述不够具体。把语速、声线高低、停顿习惯都写进去,尤其"说话习惯"那一层是点睛之笔
- 提示 text 和 instruct 都要填?对,两个都必填——没有文本不知道读什么,没有描述不知道用什么嗓子
- 第一次跑很慢?模型首次加载 3.6GB 权重,正常现象
- 输出文件在哪?
ComfyUI\output\audio\Qwen3-TTS\
小结
Qwen3-TTS 声音设计的核心是 instruct 描述公式:音色基调 + 语速节奏 + 语调韵味 + 说话习惯。不用录音、不用参考音频,一段文字凭空造出一个声音,改文字就能改声音——这是角色配音和创意音色最顺手的玩法。