视频 · 实测

用 AI 给无声视频加背景音乐,发布之前先检查

一长条象牙色纸在石墨色板上折成柔和的波浪,下面是几根细细的炭黑色杆子,最高的波峰上放着一枚琥珀色圆片
原创抽象编辑插画,在 Ciyo 中用 GPT Image 2.5 Sunburst 生成。

大多数产品短片一开始都是无声的:用手机拍的店铺视频,或者关掉了声音的 AI 视频模型片段。音乐能让它显得完整。麻烦在于,音乐没法看截图来判断,一条音轨在笔记本电脑的扬声器上听着没问题,却可能有些毛病要到第十遍播放才会被注意到。

2026年9月29日,我们请 Ciyo Agent(Ciyo 智能体)给虚构花店 Bramble & Bloom 的一条 10 秒无声 Reels 配上音乐,然后用视频剪辑师常用的工具测量了结果。第一条音轨有一个毛病,只凭耳朵听一遍我们是发现不了的。

从一条无声片段开始

如果你已经有片段,把它上传到画板就行。我们的片段是在 Ciyo 里做的:用 GPT Image 2.5 Flare 生成一张花束照片(2 个额度),再用它生成一条 10 秒的 Seedance 2.5 视频(394 个额度),特意做成无声。智能体检查了文件,确认它是 720 × 1280、10 秒长、没有音轨。

这里无声很重要。视频模型自己加上的声音(沙沙声、室内环境音)之后会和音乐打架。

Ciyo 画布上是一张用牛皮纸包着蜜桃色玫瑰和白色花毛茛的花束照片,旁边是一条 10 秒的无声视频
画板上的花束照片和 10 秒无声片段。2026年9月29日。
我们怎么做出这条无声片段
我经营一家小花店 Bramble & Bloom。为这个周末的 Instagram Reels,请先做一张 9:16 的周末花束照片(蜜桃色庭院玫瑰、白色花毛茛和尤加利叶,用棕色牛皮纸包着,放在锌质台面上,柔和的日光,不要文字),然后用 Seedance 2.5 把它变成一条 10 秒的竖版视频:镜头绕着花束缓慢环绕,花瓣轻轻摆动。视频要无声,不要生成音频。音乐我之后再加。

像写需求一样描述音乐,而不是只说氛围

写明乐器、速度、“不要人声”、准确的时长,以及怎么开始、怎么结束。Ciyo Agent 用 MiniMax Music 3 作曲,并在它的工作区里把音乐混进视频。它报告音轨花了 3 个额度,混音不收费:音轨完整覆盖 10.04 秒,用 1.2 秒淡入、1.6 秒淡出,平均响度约为 −15 LUFS。

LUFS 是剪辑师衡量感知响度的单位。网络视频常见的数值在 −14 到 −16 之间;再小声很多,你的 Reels 在信息流里和别人的一比就会显得没力气。

Ciyo 智能体面板报告音乐的时长、淡入淡出、响度和费用,旁边是画板上的无声视频和成片
智能体对第一条音轨的报告。
配乐请求
片子很好看。现在请给这条 Reels 加背景音乐:温暖轻快的原声吉他配柔和的钢琴,放松的周末早晨氛围,大约 90 BPM,不要人声。时长必须和片段完全一样(10 s),开头轻柔,结尾随视频干净地收住,而不是在一个音符中间被切断。响度要适合 Instagram。把加好音乐的成片保存在无声视频旁边,并告诉我用了多少额度。

测量一下:中间那一秒安静了

我们下载了做好的 Reels,用 ffmpeg 检查。画面没有被动过:全部 241 帧都和无声片段一致。响度为 −15.2 LUFS,峰值 −1.4 dB,和智能体说的一样,结尾在最后一帧淡到几乎无声。

但电平曲线上有个坑。从约 5.1 秒到 5.95 秒,音乐降到了 −32 dB 左右,比音轨其余部分低了约 15 dB。在一条 10 秒的 Reels 里,这意味着正中间整整一秒几乎无声,而这恰恰是观众决定要不要继续看的时刻。

两个版本在十秒内的音频电平折线图:版本 1 在 5.1 秒到 5.95 秒之间跌到约 −32 dB,版本 2 保持在 −10 到 −23 dB 之间
两条成片 Reels 每 0.1 s 的音频电平,由我们用 ffmpeg 测量。

要求一条平稳的音轨,再检查一次

我们把测量结果发回去,要求一条风格相同、没有停顿的新音轨。智能体确认了这个低谷(还在 2.5 秒附近发现了一个更短的),又花 3 个额度做了第二条音轨,视频沿用原来那条。

第二个版本没有断档。两次淡变之间最安静的时刻约为 −23 dB,是吉他音符之间的一个短暂间隙。它的响度为 −14.0 LUFS,峰值 −1.3 dB,画面同样和无声片段逐帧一致。

两个音乐版本的测量结果
检查项版本 1版本 2
时长10.04 s10.04 s
响度(整体)−15.2 LUFS−14.0 LUFS
峰值−1.4 dB−1.3 dB
两次淡变之间最安静的时刻5.9 s 处 −32.9 dB1.5 s 处 −23.2 dB
画面有无改变无无
额度33
Ciyo 智能体面板确认安静的那段已经消失,并报告第二条音轨的电平,画板上有三条视频
画板上的第二个版本,旁边是第一个版本和无声片段。
我们的后续消息
我测了这条音轨:从 5.1 s 到 5.95 s,它下降了约 15 dB,降到 -32 dB 左右,所以 Reels 在中间有一秒几乎没声音。请做一条新音轨,风格不变,但从头到尾节奏平稳连续,没有停顿或断档,保留轻柔的开头和结尾的淡出,另存为第二个版本。告诉我安静的那段是否已经消失。

当 AI 音乐让人失望时

不是每次测试都顺利。含糊的请求只会换来一条平庸的音轨,听一遍也不等于检查过。把乐器和速度说具体,测量电平曲线,或者至少戴耳机听两遍,然后重新生成:这里一条新音轨只要 3 个额度。

发布之前的检查清单

检查音轨是否和视频一样长,是否轻柔地开始并在最后一帧结束,中间有没有空档,响度是否在 −14 到 −16 LUFS 附近且峰值不超过 −1 dB,以及画面有没有被改动。然后在手机上开着声音听一遍。

用 AI 给视频加音乐

AI 能给我现有的视频加音乐吗?

能。在 Ciyo 里,把片段放到画板上,请 Ciyo Agent 配乐。它会按片段的时长生成一条纯音乐音轨,并把它混成一条新视频放到画板上。

Reels 的音乐应该多响?

整体响度约 −14 到 −16 LUFS、峰值低于 −1 dB,是网络视频的常见目标。我们的两个版本分别测得 −15.2 和 −14.0 LUFS。

为什么我的 AI 音乐中间有一段很安静?

音乐模型可能会在短音轨里安排一个停顿。我们那条降到约 −32 dB,持续了将近一秒。要求节奏平稳、没有停顿,然后再测量或再听一遍。

花了多少钱?

每条音乐音轨 3 个额度。制作我们的无声测试片段花了 396 个额度(照片 2 个,Seedance 视频 394 个)。

在 Ciyo 里完成你的 Reels

把片段放到画板上,描述你要的音乐,让 Ciyo Agent 混出一个你可以测量、可以发布的版本。