返回博客

AI 音频提示词怎么写:导演级指南,每个技巧都能试听

六个音频场景提示词技巧:情绪指令、音效时点、角色选角、副语言、配乐调度,每个技巧都配一条真实生成的音频,写法和效果对照着听。

2026年7月23日SeedAudioSeedAudio
AI 音频提示词怎么写:导演级指南,每个技巧都能试听

两条提示词可以描述同一个场景,出来的音频却天差地别。"一个男人说欢迎"得到的是一句平铺直叙的朗读;"温暖的男声,低沉从容,说:'欢迎回来',轻柔钢琴铺底,身后一扇门轻轻合上"得到的是一场戏。

差别不在模型,在提示词。这篇指南把音频提示词的写法拆成六个技巧,像导演递剧本一样交代场景,而且和网上所有同类文章不同,每个技巧你都能直接听到实际效果:下面每条示例音频,都是用所示提示词真实生成的成片。

麦克风旁摊开的批注剧本,声音从纸页升起

音频提示词和文本提示词有什么不同?

音频提示词是舞台指令,不是提问。文本提示词让模型思考;音频提示词告诉模型这场戏听起来是什么样,谁在说话、什么声线什么情绪、底下垫什么音乐、哪个声音落在哪。Seed-Audio 1.0 这类模型把这一切在一次生成里同时完成,所以你没写明的部分全靠模型即兴。音频提示词的功夫,就在于决定哪些东西不能交给运气:声线选角、情绪演绎、音效时点、配乐的角色。这四样写对了,一句话描述就能换回一段混好的完整成片。

公式

几乎所有好的音频提示词都能归结为一个模式:

[配乐 / 氛围] + [角色(声线、情绪)]说:"台词" + [音效,写在它发生的位置]

例:紧张的低音弦乐。男子(低沉,沙哑,平静)说:"你一个人来的?"他身后一扇门吱呀打开。

引号里的会被念出来,引号外的一切都是导演指令,模型把它读成对配乐、声线、音效和节奏的调度。下面六个技巧,就是把公式的每一段用到极致的方法。

三层悬浮的声音图层,人声、配乐、音效,汇成一条波形

一、指挥情绪,别只写台词

同一句话有一打念法。把情绪指令写进角色括号,模型就会"演"而不是"念"。

所用提示词(英文示例):A woman (adult, clear voice) says calmly: "The results are in." Then the same woman, now furious, shouts: "The results are IN!"

同一个声线、同一句台词,两种完全不同的戏。平静、暴怒、迟疑、戏谑、疲惫,这些词写起来零成本,效果天翻地覆。

二、音效写在发生的位置,不要堆清单

时间点跟随文字顺序:写在台词前的音效先响,写在后面的后响。别把音效攒到提示词结尾像购物清单,把它们织进情节里。

所用提示词(英文示例):A wooden door creaks open slowly. A man (middle-aged, wary) whispers: "Who's there?" Then two heavy footsteps approach on a wooden floor.

先吱呀,再低语,后脚步,严格按书写顺序响起。"音效都对但位置全错"的提示词,九成靠这一条修好。想做音效主导的场景,参见AI 音效生成器

三、像导演选角一样定义角色

给每个说话人一条选角单,年龄、质感、能量,他们就能在整段里保持独立且稳定。含糊的"一个男人""一个女人"只会得到千人一声。

所用提示词(英文示例):A boy (young, bright) asks excitedly: "Did you see that?!" An old man (deep, slow, amused) replies: "I did. And I still don't believe it."

两个声线,一次生成,不用拼接。这正是AI 对白生成器双人对话生成器的核心用法,把角色写清楚,模型自会把他们分开。

两条声波在麦克风两侧对话

四、要副语言,词与词之间的声音

笑声、叹息、停顿、气口。这些是"录出来的"和"合成出来的"之间的分界线,而且可以直接写进文字里索要。

所用提示词(英文示例):A young woman starts to speak, laughs mid-sentence, then continues: "Okay, okay — I'll tell you the story." She sighs softly at the end.

把这些人味儿写进场景,她顿了顿、他呼出一口气、两人都笑了,朗读感立刻消失。播客式对谈最吃这一条,AI 播客生成器靠的就是它。

五、把配乐当角色调度,别当背景铺着

音乐可以进场、压到人声底下、再涨回来,前提是你写了。把配乐当成一个有出场和退场的角色。

所用提示词(英文示例):Upbeat jazz piano starts alone for two seconds, then ducks under a male narrator (warm, smooth) who says: "Some mornings just sound better." The jazz swells back up to finish.

动词就是你的混音台:先起、压底、涨起、收在某处淡出。广告口播和旁白的"成片感"就是这么来的,不用进剪辑软件。

六、用距离和空间

声音存在于房间里。贴着麦克风的耳语、走廊尽头的呼喊、电话里的失真,空间指令也是提示词词汇的一部分。

所用提示词(英文示例):A man whispers very close to the microphone: "Can you hear me?" Then the same man calls out from far away, with room echo: "How about now?"

贴近麦克风、在隔壁房间、透过电话、在大厅里回响,这些短语不需要任何后期,就能改变听感空间。

三个会把戏写塌的错误

**一口气要太多。**一条提示词里塞四个角色、三种音效、两次配乐变化,出来多半是一锅粥。一场戏一个焦点,长内容分段生成。

只贴标签,不搭台。"一个悲伤的场景"远弱于"她说得很慢,声音哽了一下,一个钢琴长音悬在底下"。把悲伤演出来,别只报幕。

**配乐无人调度。**提到了音乐却不写它干什么,它就会以同一个音量从头铺到尾。给它进场和退场(见技巧五)。

一个完整的实战示例

把这套公式放到量产规模,就是我们悬疑刑侦模板背后的提示词:手机震动、鸟鸣环境音、马林巴主奏的悬疑配乐、两个选角完毕的声线(其中一个带电话失真处理)、收尾的汽车与脚步拟音,全部按书写顺序落位。看完整提示词并试听成片,或从十二个模板里任挑一个,换成你自己的戏。

常见问题

AI 配乐的提示词怎么写? 写配器、情绪和走向,别只写曲风:"马林巴主奏,合成器铺底,弦乐渐强,紧张"胜过"悬疑音乐"。如果配乐伴随人声,写清它们如何互动,压底、垫后、在台词间隙涨起。

音频提示词该写多长? 戏需要多长就写多长,不多写。单句旁白一句话就够;带音效的双人对话通常 60~120 字。超过约 600 字往往说明你在写两场戏,拆开。

这些技巧在中文里管用吗? 管用。公式与语言无关,指令和台词用你想要的语言写即可。中文场景,包括台湾腔、东北话这类方言,恰恰是 Seed-Audio 1.0 的强项;本文示例音频为英文生成,站内十二个模板里有大量中文成片可对照。

在哪能试这些提示词?工作台,首次生成免注册。本文所有示例音频都是在那里用所示提示词生成的。

写一场戏,听一遍

学音频提示词最快的路径:生成一场戏,然后听。打开工作台,粘贴本文任意一条提示词,改动一处,情绪、某个音效的位置、配乐的进场方式。那一耳朵的差别,比任何文章都教得快。