音乐生成工具用了一年多,从最早拿Suno瞎试,到后来帮朋友做短视频配乐、给播客做片头,踩过的坑基本能写一本小册子。最深的感受是:AI音乐生成的门槛不在工具,在提示词。同一段旋律动机,提示词写"轻快的钢琴曲"和写"upbeat solo piano, 120 BPM, C major, intimate close-mic recording, subtle room reverb",出来的东西完全是两个物种。前者像手机铃声,后者能直接进剪辑时间线。
这篇东西是我自己整理的一套提示词模板库,覆盖12种主流音乐风格,每种风格都拆到"结构+配器+情绪+制作质感"四个维度,直接复制粘贴就能用。不管你是做短视频配乐、播客片头、游戏BGM,还是单纯想玩AI音乐,这套模板都能帮你把出片率从"抽卡"拉到"稳定产出"。下面我会先讲清楚提示词到底该怎么写、为什么这么写,再逐个风格给模板,最后说几个我踩过的坑。
1. 为什么大多数人写AI音乐提示词都在做无用功
1.1 提示词不是"点歌",是"编曲指令"
很多人写提示词的方式是"我想要一首悲伤的歌",这等于跟一个编曲师说"给我搞点伤感的"。对方能给你一百个版本,但没一个是你脑子里那个。AI音乐模型本质是一个条件生成系统,它需要的是可量化的约束条件,而不是情绪形容词。
我做过一个对比测试,同一个旋律种子,两组提示词:
- A组:
sad piano music - B组:
melancholic solo piano, 70 BPM, A minor, sparse left-hand arpeggios, sustain pedal heavy, close-mic recording with slight tape hiss, cinematic and introspective
A组出来的是通用钢琴loop,B组出来的是能直接放在纪录片结尾的东西。差别在哪?B组给了调性、速度、织体、演奏技法、录音质感、情绪定位六个维度的约束。AI模型在这些约束下,搜索空间被大幅压缩,出来的结果自然更接近预期。
所以第一条经验:提示词的信息密度决定出片质量。你给的约束越多、越具体,AI越不容易跑偏。
1.2 四个必须写进提示词的维度
我总结了一个"四维提示词框架",每次写提示词都按这个结构过一遍:
| 维度 | 作用 | 示例关键词 |
|---|---|---|
| 结构 | 定义曲式、速度、调性 | 120 BPM, verse-chorus, A minor, 4/4 time |
| 配器 | 定义乐器组合与织体 | solo piano, string quartet, analog synth pad |
| 情绪 | 定义情感走向与能量曲线 | melancholic, uplifting, tension-building |
| 制作 | 定义录音与混音质感 | lo-fi, close-mic, tape saturation, wide stereo |
这四个维度缺一个,出来的东西就会"差口气"。缺结构,曲子可能没有明确的段落感;缺配器,AI可能给你塞一堆不想要的乐器;缺情绪,旋律走向会飘;缺制作,声音会显得"干"和"塑料"。
1.3 风格标签的颗粒度要匹配模型能力
不同AI音乐模型对风格标签的理解能力不一样。有些模型对"genre"级别的标签(如jazz、rock)响应很好,但对"sub-genre"(如bossa nova、shoegaze)就模糊。我的做法是:主风格用genre级标签,细节用描述性短语补。
比如做bossa nova,不要只写bossa nova,要写bossa nova, nylon-string guitar, soft brushed drums, 90 BPM, warm and intimate。这样即使模型不认识bossa nova这个标签,也能通过配器和速度描述逼近那个味道。
2. 12种主流风格提示词模板逐条拆解
下面每个模板我都按"四维框架"写好了,直接复制就能用。每个模板后面我会说清楚为什么这么写,以及微调方向。
2.1 电影配乐(Cinematic)
Cinematic orchestral score, 80 BPM, D minor, slow building strings with French horn melody, timpani rolls at climax, epic and emotional, wide stereo image, concert hall reverb, dynamic range from pianissimo to fortissimo这个模板的核心是动态范围。电影配乐最忌讳"从头响到尾",所以我在提示词里明确写了pianissimo to fortissimo,逼模型做出强弱对比。French horn melody是给一个明确的旋律载体,不然弦乐容易糊成一片。timpani rolls at climax是给一个高潮点的信号。
微调方向:想要更黑暗就换C minor加low brass;想要更温暖就换F major加piano arpeggios。
2.2 lo-fi 嘻哈(Lo-fi Hip Hop)
Lo-fi hip hop, 85 BPM, F minor, dusty Rhodes piano chords, boom-bap drums with swing, vinyl crackle and tape hiss, mellow and nostalgic, sidechain compression on bass, warm analog saturationlo-fi的灵魂在**"脏"**。vinyl crackle和tape hiss是必须的,没有这两个标签,出来的东西太干净,就不是lo-fi了。boom-bap drums with swing是定义鼓组风格,swing这个参数很关键,没有它鼓会太"直"。sidechain compression是制作层面的细节,能让bass和kick不打架。
微调方向:想要更"学习向"就加instrumental, no vocals;想要更"夜感"就换D minor加rain sounds。
2.3 合成器浪潮(Synthwave)
Synthwave, 110 BPM, E minor, analog synth arpeggios, gated reverb drums, detuned lead synth, neon and retro-futuristic, wide chorus on pads, sidechain pumping, 80s production aestheticsynthwave的关键词是gated reverb和detuned lead。前者是80年代鼓声的标志,后者是那种"宽而飘"的lead音色。sidechain pumping是让pad跟着kick"呼吸",这是synthwave的节奏感来源。neon and retro-futuristic是情绪锚点,帮模型锁定年代感。
微调方向:想要更"黑暗合成器"就换D minor加darksynth, industrial edge;想要更"梦幻"就加dreamwave, lush pads。
2.4 爵士三重奏(Jazz Trio)
Jazz trio, 120 BPM, Bb major, swing feel, upright bass walking lines, brushed drums, piano comping with rootless voicings, intimate club atmosphere, close-mic recording, slight room ambience爵士的坑在于swing feel。不写这个,AI会给你"直"的节奏,一听就不爵士。walking lines是定义bass的演奏方式,rootless voicings是钢琴的和声风格,这两个都是爵士的"行话",模型认识。intimate club atmosphere是给一个空间感,不然声音会太"录音棚"。
微调方向:想要bossa nova就换bossa nova, nylon-string guitar, 90 BPM;想要更"冷"就换cool jazz, Miles Davis style。
2.5 管弦乐史诗(Epic Orchestral)
Epic orchestral, 90 BPM, C minor, full string section with ostinato pattern, choir pads, taiko drums, brass stabs, heroic and triumphant, huge dynamic range, cinematic reverb, layered build-up史诗管弦乐的核心是**"层层叠加"**。ostinato pattern是弦乐的重复动机,choir pads是人声铺底,taiko drums是打击乐,brass stabs是铜管的强调。这四个元素叠起来就是"史诗感"。layered build-up是告诉模型要有渐进结构。
微调方向:想要更"悲壮"就换A minor加solemn, funeral march;想要更"战斗"就加battle drums, aggressive brass。
2.6 环境音乐(Ambient)
Ambient, 60 BPM, no clear key, evolving synth pads, field recordings of rain, slow attack and long release, meditative and spacious, no percussion, wide reverb tails, drone-based环境音乐最反直觉的一点是**"不要节奏"**。所以我在提示词里明确写了no percussion和no clear key。slow attack and long release是定义包络,这是ambient的"呼吸感"来源。field recordings of rain是给一个具体的声音素材,不然容易太空。
微调方向:想要更"黑暗环境"就加dark ambient, subterranean;想要更"太空"就加space ambient, cosmic。
2.7 民谣(Folk)
Folk, 95 BPM, G major, fingerpicked acoustic guitar, upright bass, light shaker, intimate and storytelling, close-mic vocals if any, natural room sound, no reverb民谣的关键是**"自然"**。no reverb是故意的,民谣要的是"就在你面前唱"的感觉。fingerpicked是定义吉他技法,storytelling是情绪定位。light shaker是给一个轻微的节奏支撑,不抢戏。
微调方向:想要更"美式"就加Americana, pedal steel;想要更"英式"就加British folk, fingerstyle。
2.8 电子舞曲(EDM)
EDM, 128 BPM, F minor, four-on-the-floor kick, sidechained supersaw lead, build-up with white noise riser, drop with heavy bass, energetic and euphoric, wide stereo, club-ready mixEDM的模板必须包含**"build-up"和"drop"**这两个结构标签。white noise riser是build-up的标志音效,heavy bass是drop的核心。supersaw lead是那种"宽而亮"的lead音色。club-ready mix是给一个混音目标。
微调方向:想要更"未来"就加future house, pitched vocal chops;想要更"硬"就加hardstyle, distorted kick。
2.9 中国风(Chinese Traditional)
Chinese traditional, 75 BPM, D pentatonic, guzheng melody, dizi flute counter-melody, pipa arpeggios, erhu for emotional passages, silk and bamboo ensemble feel, ancient and poetic, natural room reverb中国风的坑在于**"五声音阶"**。不写pentatonic,AI容易给你加偏音,一听就不"中国"。guzheng、dizi、pipa、erhu是四个核心乐器,各司其职。silk and bamboo ensemble是给一个合奏的质感参考。
微调方向:想要更"武侠"就加wuxia, martial arts, heroic;想要更"江南"就加Jiangnan, water town, gentle。
2.10 摇滚(Rock)
Rock, 140 BPM, E minor, distorted electric guitar riffs, driving bass, live drums with room sound, aggressive and raw, analog tape saturation, no click track feel摇滚的关键是**"live"感**。live drums with room sound和no click track feel是让鼓听起来像真人在打,而不是机器。analog tape saturation是给一个"暖"的失真质感。raw是情绪定位,不要过度制作。
微调方向:想要更"朋克"就加punk, fast, snotty;想要更"金属"就加metal, drop tuning, double kick。
2.11 氛围电子(Chill Electronic)
Chill electronic, 100 BPM, A minor, soft synth pads, plucked synth melody, gentle four-on-the-floor, warm sub bass, relaxing and dreamy, wide reverb, no harsh frequencies这个风格介于ambient和EDM之间,核心是**"柔和的节奏"**。gentle four-on-the-floor是给一个不抢戏的节奏,warm sub bass是低频支撑,no harsh frequencies是混音要求,避免刺耳。
微调方向:想要更"tropical"就加tropical house, marimba;想要更"夜"就加night drive, neon。
2.12 古典钢琴(Classical Piano)
Classical piano, 70 BPM, C major, solo piano, expressive rubato, sustain pedal heavy, romantic era style, close-mic recording, natural piano resonance, no reverb added古典钢琴的核心是**"rubato"**。不写这个,AI会给你"死"的节奏。romantic era style是给一个风格锚点,no reverb added是让钢琴保持"干"的质感,靠琴本身的共鸣。
微调方向:想要更"巴洛克"就加Baroque, harpsichord, ornamented;想要更"印象派"就加Impressionist, Debussy, whole-tone。
3. 提示词微调的三个实战技巧
3.1 用"排除法"修正跑偏
AI音乐模型有时候会"自作主张"加东西。比如你做lo-fi,它给你加了人声;你做ambient,它给你加了鼓。这时候不要重写提示词,用负向提示(如果模型支持)或者强调词来修正。
我的做法是在提示词末尾加no vocals, no drums, instrumental only这样的排除项。有些模型不支持负向提示,那就把正向描述写得更具体,比如instrumental lo-fi hip hop, purely instrumental, no vocal samples。
3.2 用"参考系"锁定年代和质感
如果你想要一个特定的年代感,用**"参考系"**比用形容词更有效。比如:
- 想要80年代:
80s production, gated reverb, analog synth - 想要90年代:
90s boom-bap, SP-1200 drum machine, vinyl sample - 想要2000年代:
2000s pop punk, distorted guitars, tight drums
这些"参考系"标签能帮模型快速锁定制作风格,比写retro、old school这种模糊词有效得多。
3.3 用"结构标签"控制曲式
AI音乐模型默认生成的曲式往往是"loop式"的,没有明显的段落变化。如果你想要一个完整的"主歌-副歌-桥段"结构,需要在提示词里明确写出来:
verse-chorus-bridge structure, intro with solo piano, chorus with full band, bridge with stripped-back arrangement, outro with fade-out这样模型会按照你给的结构来组织音乐,而不是从头到尾一个loop。
4. 我踩过的五个坑
4.1 提示词太长反而效果差
一开始我以为提示词写得越长越好,把能想到的标签全塞进去。结果发现模型会"顾此失彼",有些标签被忽略了。后来我控制在30-50个词,只保留最关键的约束,效果反而更稳定。
4.2 风格标签混用会"打架"
有一次我写jazz hip hop with orchestral strings,想做一个"爵士嘻哈+弦乐"的东西。结果出来的东西既不爵士也不嘻哈,弦乐也很突兀。后来我明白了:风格标签之间要有主次。正确写法是jazz hip hop as main genre, subtle orchestral strings as accent,明确谁是主、谁是辅。
4.3 BPM写太具体反而限制发挥
我试过写123 BPM,结果模型出来的东西节奏很"死"。后来我改成120 BPM range或者mid-tempo,模型有更多发挥空间,出来的东西反而更自然。BPM给一个范围,不要给一个点。
4.4 忽略"制作质感"导致声音"塑料"
早期我写提示词只关注"什么乐器、什么情绪",忽略了"怎么录、怎么混"。结果出来的东西总是"干"和"塑料"。后来我加了tape saturation、room reverb、close-mic这些制作标签,声音立刻"活"了。制作质感是提示词的"最后一公里"。
4.5 不写"排除项"导致意外元素
有一次我做纯器乐,忘了写no vocals,结果模型给我加了一段人声采样。后来我养成了习惯:每次写提示词都加排除项,把不想要的东西明确排除掉。
5. 不同场景下的模板组合思路
5.1 短视频配乐:短、抓耳、有记忆点
短视频配乐的核心是前3秒抓耳。我的做法是用EDM或Synthwave模板,把BPM提到120-130,加catchy hook, memorable melody。长度控制在15-30秒,结构用intro-drop-outro。
5.2 播客片头:有辨识度、不抢话
播客片头需要**"有存在感但不抢戏"**。我用Chill Electronic或Lo-fi Hip Hop模板,把BPM降到90-100,加instrumental, no vocals, background music。长度10-15秒,结构用intro with hook, fade-out。
5.3 游戏BGM:可循环、有层次
游戏BGM需要**"可循环"**。我在提示词里加seamless loop, no clear ending,结构用loop-based, subtle variations。风格根据游戏类型选,RPG用Epic Orchestral,休闲游戏用Chill Electronic。
5.4 冥想/助眠:无节奏、无旋律记忆点
冥想音乐需要**"不抓注意力"**。我用Ambient模板,加no percussion, no melody, drone-based,BPM写no tempo或free time。长度可以到10分钟以上,结构用evolving, no clear sections。
6. 关于提示词模板库的后续扩展
这套模板库我还在持续更新。最近在试的是**"情绪曲线"的写法,比如tension-building from 0:00 to 1:30, release at 1:30, resolution at 2:00,用时间轴来控制情绪走向。另外也在试"乐器分层"**的写法,比如layer 1: pad, layer 2: arpeggio, layer 3: melody,让模型按层来构建。
如果你也在玩AI音乐,建议从Lo-fi Hip Hop和Cinematic这两个模板开始练手,这两个风格的容错率最高,容易出效果。等熟悉了四维框架,再往Jazz和Chinese Traditional这种对细节要求高的风格走。
最后说一个我自己的习惯:每次生成后都把提示词和结果存下来,建一个自己的"提示词-结果"对照库。时间长了你会发现,哪些标签组合有效、哪些无效,一目了然。这个库比任何模板都值钱,因为它是你自己的。