Ace-Step 音乐创作教程:中文风格描述+中文歌词,AI 生成完整歌曲
Ace-Step 音乐创作是什么?能做什么
Ace-Step 是当前最强的 AI 音乐生成模型之一,1.5 turbo 版已经内置在整合包里(9.3GB),本地免费无限量生成完整歌曲——你给它一段风格描述(中文就行)加一份歌词(中文就行),它就能生成一首带人声演唱的完整歌曲,包括伴奏、和声、配器,直接存成 MP3。
它能做什么?
- 原创歌曲:写好歌词,选个风格(流行/古风/摇滚/史诗管弦乐……),AI 唱给你听
- 视频 BGM 定制:不要歌词也行,只填风格描述,生成纯音乐当背景乐
- 游戏/动画主题曲:描述想要的感觉(宏大、悲壮、治愈),配合歌词直接出成品
和前面的 TTS 配音不同:TTS 是"照着文字读出来",Ace-Step 是真正的音乐创作——它会自己作曲、编曲、演唱,生成的是完整的一首歌。
第 1 步:打开音乐创作工作流
启动 ComfyUI(双击 ComfyUI启动器.exe),浏览器打开界面后:
- 左侧「工作流」列表打开 AI星尘-开箱即用 文件夹
- 进入 音频 子文件夹
- 选择 Ace-Step-1.5-音乐创作.json

模型已内置(models\checkpoints\Ace_Step_1.5\ace_step_1.5_turbo_aio.safetensors),开箱即用。工作流自带一首英文史诗管弦乐示例,这一篇我们把它改成全中文版本跑一遍——正好教你怎么填。
第 2 步:认识工作流(核心是中间的提示词节点)
从左到右五个区域:
- 模型加载区:Ace-Step 1.5 turbo 整合模型(9.3GB,已选好不用动)
- 时长区:Song Duration 节点,默认 120 秒(歌曲总时长,最长可拉到 2000 秒)
- 提示词区:TextEncodeAceStepAudio1.5——本工作流的心脏,风格描述(tags)+ 歌词(lyrics)+ 音乐参数都在这
- 采样区:8 步 euler 采样(turbo 模型很快),默认不用动
- 保存区:解码 + 存成 MP3(128k 音质)

这一篇你只需要动提示词区一个节点里的三个输入框:tags(风格)、lyrics(歌词)、language(语言),外加可选的 bpm/调式/时长。
第 3 步:填中文风格描述(tags)
工作流默认的 tags 是一大段英文(史诗管弦乐描述)。换成中文完全没问题,直接把框里英文删掉,填你想要的中文描述——风格、乐器、情绪、用途都可以写:
电影级史诗管弦乐,宏大叙事,气势磅礴。开篇是深沉雷鸣般的打击乐与太鼓,弦乐断奏层层叠加,强有力的铜管传递英雄使命,合唱声浪与如歌的小提琴营造牺牲与荣光,动态范围宽广,进行曲般的前进感,适合史诗战斗或电影预告片高潮,庄严肃穆又充满胜利的坚韧。

风格描述写得越具体,出来的歌越接近你的想象。换风格就换这段描述:想听古风就写"古筝琵琶、笛箫悠扬、国风意境",想听摇滚就写"失真吉他、强力鼓点、热血摇滚"。
第 4 步:填中文歌词(lyrics)
在 lyrics 输入框填歌词。格式有讲究:用 [Intro]、[Verse 1]、[Chorus]、[Verse 2]、[Outro] 这样的段落标记,AI 才能正确分主歌/副歌唱出结构。
工作流默认是英文歌词,我们换成中文原创歌词(史诗风格和上一段的 tags 配套):
[Intro]
(低沉的弦乐铺垫,远处鼓声渐起)
[Verse 1]
夜色漫过古老的城墙
烽火在远方微微发烫
我们踏过灰烬的荒原
把最后的星火点亮
[Chorus]
穿过风雨与烈火的洗礼
每一寸山河刻着姓名
让世界记住这呐喊声
我们的名字燃烧在天际
[Verse 2]
剑已出鞘就不再回头
背负着岁月无声的守候
推开命运紧锁的重门
向那黎明大步走
[Chorus]
穿过风雨与烈火的洗礼
每一寸山河刻着姓名
让世界记住这呐喊声
我们的名字燃烧在天际
[Outro]
(恢弘的和声渐弱)
胜利……在寂静中
荣光……永不消散
(最后一声鼓响)

歌词结构要点:主歌(Verse)讲故事,副歌(Chorus)喊情绪,副歌通常重复两遍;想纯音乐不要人声,把歌词框清空只留风格描述即可。
第 5 步:把语言改成中文(zh)——关键一步!
在同一个节点上找到 language(语言)下拉框——默认是 en(英文),必须改成 zh(中文),否则中文歌词会被按英语发音唱出来。


语言列表很全:中英日韩法德西俄都有(zh=中文、ja=日语、ko=韩语、yue=粤语……),唱什么语言就选什么。
第 6 步:(可选)调整音乐参数
再往下是几个音乐参数,默认值已经不错,想个性化再动:
- bpm:105——歌曲速度。抒情歌 70~90,流行歌 100~120,燃向可以拉到 130+
- timesignature(拍号):2——下拉有 2/3/4/6,流行歌一般用 4,进行曲用 2,圆舞曲用 3
- keyscale(调式):D minor——决定歌曲的"调",列表里 34 个大调/小调随便选(小调偏忧伤深沉,大调偏明亮阳光)
- 时长:Song Duration 节点默认 120 秒(2 分钟),想更长把数字改大

第 7 步:点运行,等一首歌诞生
点右侧「运行」按钮。生成分两个阶段:先由内置 LLM 生成"音频码"(这一步较慢,是歌曲质量的关键,不要动),再 8 步采样出音频。
一首 2 分钟的歌大约需要 5~15 分钟(看显卡),生成完成后 SaveAudioMP3 节点显示结果,文件在:
ComfyUI\output\audio\ace-step-1.5\

不满意就换种子重跑(seed 节点默认 fixed 31,点 dice 随机化),或改歌词/风格描述——改文字就能改歌,随便折腾。
参数速览(保持默认即可)
- seed:31(fixed)——同一套配置换个种子就是新的一首歌,多抽几次挑满意的
- generate_audio_codes:true——LLM 生成音频码,质量高但慢;保持开启
- 采样器:8 步 / euler / simple / cfg 1——turbo 模型的标准快配置,不用动
- cfg_scale 2 / temperature 0.85 / top_p 0.9:内部参数,默认即可
- ModelSamplingAuraFlow(shift 3):模型采样修正节点,保持默认
进阶玩法
- 纯音乐 BGM:lyrics 清空,只留 tags 风格描述,出来的就是纯伴奏
- 换风格换情绪:改 tags 就换整首歌的氛围——同一份歌词可以生成摇滚版、古风版、抒情版
- 自定义时长:Song Duration 改到 30 秒就是一段短 BGM,改到 180 秒就是完整长歌(歌词不够长会拖长间奏)
- 多语言歌曲:language 改成 ja/ko/yue 等,配上对应语言的歌词即可
- 批量抽卡:把 seed 改成 randomize,连跑几次从结果里挑最好的
常见问题
- 唱出来是英语发音?language 忘了改 zh——这是最常踩的坑,歌词是中文就必须把语言切成中文
- 生成很慢?正常,LLM 生成音频码阶段占了大头,2 分钟的歌等 5~15 分钟是常态;缩短时长可以加快
- 歌词不按结构唱?检查 [Intro]/[Verse 1]/[Chorus] 段落标记是否写对、有没有漏掉
- 显存不足?关掉浏览器其他标签再跑;这首歌模型约 9.3GB,16G 显存可以跑
- 输出文件在哪?
ComfyUI\output\audio\ace-step-1.5\
小结
Ace-Step 音乐创作就三步:填中文风格描述(tags)→ 填中文歌词(lyrics)→ 语言切中文(zh)→ 点运行。2 分钟完整歌曲、带人声带伴奏,本地免费无限量。歌词结构、bpm、调式都是锦上添花,改文字就能改歌。