视频声音 · 实测

用 AI 给视频加音效,精确到每一帧

一长条象牙色纸横跨一块拉丝石墨色板,纸上立着三根高低不同的炭黑色圆柱,末端是一只琥珀色玻璃铃
原创抽象编辑插画,在 Ciyo 中用 GPT Image 2.5 Sunburst 生成。

一条无声的产品短片总显得没做完,光加音乐也补不上。让美食和产品视频看着过瘾的,是那些细小的声音:面包皮裂开,杯子碰到桌面。这些声音只有正好落在动作上才有效果。爆裂声早了半秒,听起来就是假的。

2026年9月30日,我们在 Ciyo 里为虚构面包店 Crumb & Kettle 做了一条 8 秒的 Reels,并请 Ciyo Agent(Ciyo 智能体)加上四个音效和一层安静的环境音。它自己在视频里找到了这些时刻,并为每个音效报告了时间点。我们测量了成片的音频:杯子声正好落在那一帧上,爆裂声最响的部分也落在面包裂开的过程之内。

从一条无声片段开始

如果你已经有片段,上传就行。我们的片段是在 Ciyo 里做的:一条 8 秒的竖版特写,一双手在盘子上方撕开一个可颂,碎屑落下,然后一杯咖啡被放在旁边。用最便宜的视频设置花了 9 个额度,我们要求不带音频。

无声很重要。视频模型自己加上的声音会和你之后放的音效打架,而且没法干净地去掉。

Ciyo 画布上有一个 8 秒的竖版视频卡片,智能体面板说明这条无声片段花了 9 个额度
画板上的无声片段(视频卡片在播放前显示为黑色)。2026年9月30日。
我们怎么做出这条无声片段
我经营一家小面包店 Crumb & Kettle。为一条 Instagram Reels,请给我做一条无声的 8 秒竖版片段(最便宜的视频设置,不要音频):特写一双手在白色盘子上方把一个新鲜可颂撕开,碎屑落下,然后一杯咖啡被放在旁边。镜头保持不动。先不要加任何声音;下一步我想加音效。

说出时刻,而不只是声音

只列一串声音是不够的。要说明每个声音属于什么动作,这样智能体才能在画面里找到它:面包皮裂开,两半被拉开,碎屑落下,杯子碰到桌面。再加一层环境音让画面有空气感,并说明它该有多安静。要求它给出时间点,这样你就能检查。

音效请求
片段不错。现在加上音效,让它们落在动作上:面包皮裂开时清脆的爆裂声,两半被拉开时轻柔的拉扯声,碎屑落到盘子上的声音,杯子碰到桌面的声音,底下再垫一层安静的咖啡馆环境音。请你自己在视频里找出确切的时刻,告诉我每个音效的时间点,并把环境音压低,让动作的声音突出。不要音乐,不要人声。

智能体怎么找到这些时刻

智能体逐帧浏览视频,在画板上放了一张时间对照表:32 帧,每 0.25 秒一帧,每帧都标着时间。它是一份可以删掉的工作参考,也是你检查结果最快的方式。

然后它生成了五个声音,混进片段的一个副本里,原片保留不动。五个声音花了 7 个额度;混音不花钱。

Ciyo 画板上是一张由 32 个视频帧组成的时间对照表,时间标记从 0.00 到 7.75 秒,画面是可颂被撕开和咖啡杯被放下,智能体正在生成五个音效
智能体的时间对照表,每 0.25 s 一帧,此时它正在生成五个声音。

它选择的时间点

智能体报告了每个音效以及选这个时间的理由,比如杯子在 6.80 秒落下,“when the cup's downward movement stops”(也就是杯子向下的动作停止的时候)。环境音贯穿整条片段,比音效低约 20 dB。

下面这几帧取自成片中的这四个时间点。

Ciyo Agent 于 2026年9月30日报告的音效和时间点
音效开始时间对应画面里的什么
面包皮爆裂声1.95 s面包皮第一次裂开;随着裂口变大持续约 1.3 s
轻柔拉扯声3.20 s两半被拉开,一直到约 5.0 s
碎屑落盘声3.75 s第一片碎屑落下
杯子放到桌上6.80 s杯子停止向下移动
咖啡馆环境音0 到 8 s淡入淡出,比音效低约 20 dB
面包店片段的四帧:双手开始掰开可颂,两半被拉开、中间拉出面丝,碎屑落在盘子上,一杯咖啡被放下
1.95、3.20、3.75 和 6.80 秒处的画面,也就是四个音效的时间点。

我们测量了音频

我们下载了成片 MP4,每 50 毫秒测一次响度。环境音大约在 −46 到 −48 dB。杯子声是最响的时刻,−18 dB,正好从 6.80 秒开始。碎屑声在 3.70 秒升起。爆裂声放在 1.95 秒,但它最响的部分出现在 2.5 到 3.0 秒、裂口最大的时候,这仍然在智能体选定的时间段之内。

所以环境音比最响的音效低约 28 dB,比智能体说的“about 20 dB”(约 20 dB)还要安静一些,整条 Reels 的响度测得为 −19.7 LUFS。如果它和你的其他 Reels 放在一起显得偏小声,就要求混得响一点;智能体主动提出可以不生成新声音、免费重新混音。

Ciyo 智能体面板列出各音效的时间点,并说明这些声音花了 7 个额度,旁边画板上是时间对照表、原片和新视频
智能体的时间点报告,画板上是原片和加了声音的版本。

用耳朵检查,再做调整

AI 智能体能测量波形,但没法告诉你爆裂声听起来像不像可颂。戴上耳机听一遍,再用手机扬声器听一遍。对每个音效问两个问题:它是不是从动作开始的那一帧开始?它听起来像不像那个东西?如果某个声音早了或晚了,就把时间对照表上的帧时间和调整方向告诉智能体,比如“把爆裂声往后移 0.3 s”。

音效检查项,以及我们的结果
检查项我们的 Reels
每个音效都从对应动作开始杯子声准确落在 6.80 s;爆裂声峰值在裂开过程之内
环境音低于音效比最响的声音低约 28 dB
没要求就不加音乐或人声没有
整体响度−19.7 LUFS;需要的话可以要求调响
保留原片是,无声片段留在画板上

这条 Reels 的下一步

音效、音乐和人声各有各的空间时,才能配合得好。在音效下面垫一层音乐,或者在音效之后加一段简短的旁白,并保留无声原片,留给下一次剪辑。

用 AI 添加音效

AI 能让音效卡准我的视频吗?

能,只要它看得到画面。在我们的测试中,Ciyo Agent 为片段做了一张时间对照表,并按动作放置每个音效;按我们的测量,杯子声正好从 6.80 秒开始。

应该让视频模型来生成声音吗?

如果你想要掌控,就不要。先生成无声片段,再加上可以逐个移动和调整的音效。

环境音应该多响?

低到能让动作的声音突出就行。我们的环境音比最响的音效低约 28 dB。如果片段在声音之间显得空,就把它调高一点。

花了多少钱?

2026年9月30日共花 16 个额度:无声片段 9 个,五个音效 7 个。混音以及任何不生成新声音的重新混音都是免费的。

在 Ciyo 里给你的片段加声音

上传一条无声片段,说出哪些时刻需要声音,并请 Ciyo Agent 给出时间点,方便你检查。