影片音效 · 實測

用 AI 為影片加上音效,精準對到每一格畫面

一條長長的象牙白紙帶橫過拉絲石墨色盤面,上面沿線立著三根高度不同的炭黑色圓柱,末端是一個琥珀色玻璃鈴
原創抽象編輯插畫,於 Ciyo 中以 GPT Image 2.5 Sunburst 生成。

無聲的商品短片感覺像沒做完,而光加音樂也解決不了。讓美食和商品影片看起來過癮的,是那些細小的聲音:酥皮裂開、杯子碰到桌面。這些聲音只有精準落在動作上才有效。碎裂聲早了半秒,聽起來就很假。

2026 年 9 月 30 日,我們在 Ciyo 中為虛構烘焙坊 Crumb & Kettle 做了一支 8 秒的 Reel,並請 Ciyo Agent 加上四個音效和一層安靜的環境音。它自己在影片中找出這些時刻,並回報每一個的時間點。我們量測了完成的音訊:杯子的聲音落在完全正確的那一格,碎裂聲最響的部分也落在裂開的過程之中。

從一支無聲短片開始

如果你已經有短片,就把它上傳。我們的短片是在 Ciyo 裡做的:一支 8 秒的直式特寫,雙手在盤子上方撕開可頌,酥皮碎屑掉落,接著一杯咖啡被放在旁邊。它用最便宜的影片設定花了 9 點,而且我們要求不要音訊。

無聲很重要。影片模型自己加上的聲音會和你之後放上的音效互相干擾,而且無法乾淨地移除。

Ciyo 畫布上一個 8 秒的直式影片方塊,Agent 面板說這支無聲短片花了 9 點
畫板上的無聲短片(影片方塊在播放前顯示為黑色)。2026 年 9 月 30 日。
我們怎麼做出無聲短片
我經營一家小烘焙坊 Crumb & Kettle。為了一支 Instagram Reel,請幫我做一支 8 秒的無聲直式短片(最便宜的影片設定,不要音訊):雙手在白色盤子上方把剛出爐的可頌撕開的特寫,酥皮碎屑掉落,接著一杯咖啡被放在旁邊。鏡頭保持不動。先不要加任何聲音;我想在下一步加上音效。

說出時刻,而不只是說出聲音

只列出聲音還不夠。要說明每個聲音屬於哪個動作,讓 Agent 能在畫面中找到它:酥皮裂開、兩半被拉開、碎屑落下、杯子碰到桌面。加上一層環境音讓空間有空氣感,並說明它該多安靜。請它提供時間點,讓你可以檢查。

音效的要求
短片很好。現在請加上音效,讓它們落在動作上:酥皮裂開時清脆的碎裂聲、兩半被拉開時柔軟的拉扯聲、碎屑落在盤子上的聲音,以及杯子碰到桌面的聲音,底下再加一層安靜的咖啡館環境音。請你自己在影片中找出確切的時刻,告訴我每個音效的時間點,並把環境音壓低,讓動作的聲音突顯出來。不要音樂,不要人聲。

Agent 如何找出這些時刻

Agent 逐格瀏覽影片,並在畫板上放了一張時間表:32 格畫面,每 0.25 秒一格,每一格都標上時間。這是一份可以刪除的工作參考,也是你檢查結果最快的方法。

接著它生成五個聲音,混進短片的一份複本中,原片保留不動。五個聲音花了 7 點;混音不用錢。

Ciyo 畫板上一張由 32 格影片畫面組成的時間表,標示從 0.00 到 7.75 秒,畫面是可頌被撕開和咖啡杯被放下,同時 Agent 正在生成五個音效
Agent 的時間表,每 0.25 s 一格,旁邊它正在生成五個聲音。

它選的時間點

Agent 回報每個音效時都附上時間點的理由,例如杯子在 6.80 秒落下,「when the cup's downward movement stops」(在杯子向下的動作停止時)。環境音貫穿整支短片,比音效低約 20 dB。

下面的畫面是從完成影片中這四個時間點擷取的。

Ciyo Agent 於 2026 年 9 月 30 日回報的音效和時間點
音效開始時間對應畫面中的哪個動作
酥皮碎裂聲1.95 s酥皮第一次裂開;隨著裂口變大持續約 1.3 s
柔軟的拉扯聲3.20 s兩半被拉開,持續到約 5.0 s
碎屑落在盤子上3.75 s第一片碎屑落下
杯子放上桌面6.80 s杯子停止向下移動
咖啡館環境音0 到 8 s淡入淡出,比音效低約 20 dB
烘焙坊短片的四格畫面:雙手開始撕開可頌、兩半被拉開並牽出麵絲、碎屑落在盤子上,以及一杯咖啡被放下
1.95、3.20、3.75 和 6.80 秒的畫面,也就是四個音效的時間點。

我們量測了音訊

我們下載了完成的 MP4,每 50 毫秒量測一次響度。環境音大約在 −46 到 −48 dB。杯子碰撞是最響的時刻,−18 dB,而且正好從 6.80 秒開始。碎屑聲在 3.70 秒升起。碎裂聲放在 1.95 秒,但它最響的部分出現在 2.5 到 3.0 秒,也就是裂口最大的時候,仍然在 Agent 選定的區間之內。

所以環境音比最響的音效低約 28 dB,比 Agent 說的「about 20 dB」(約 20 dB)稍微安靜一些,而整支 Reel 量起來是 −19.7 LUFS。如果它和你其他的 Reels 相比聽起來太小聲,就請 Agent 把混音做大聲一點;Agent 提議不生成新聲音、免費重新混音。

Ciyo Agent 面板列出音效時間點,並說明這些聲音花了 7 點,旁邊是畫板上的時間表、原始影片和新影片
Agent 的時間點報告,畫板上是原始短片和加上聲音的版本。

用耳朵檢查,再調整

AI Agent 能量測波形,卻無法告訴你碎裂聲聽起來像不像可頌。請用耳機和手機喇叭都聽一次。對每個音效問兩個問題:它是否從動作開始的那一格開始?它聽起來像那個物體嗎?如果某個聲音太早或太晚,就把時間表上的畫面時間和調整方向告訴 Agent,例如「move the crackle 0.3 s later」(把碎裂聲往後移 0.3 s)。

音效檢查項目,以及我們的結果
檢查項目我們的 Reel
每個音效都從對應的動作開始杯子精準落在 6.80 s;碎裂聲的峰值在裂開過程之中
環境音低於音效比最響的碰撞聲低約 28 dB
沒要求就不要音樂或人聲沒有
整體響度−19.7 LUFS;需要的話可要求更大聲
保留原片是,無聲短片留在畫板上

這支 Reel 的下一步

音效、音樂和人聲各有自己的空間時,才能彼此配合。在音效底下加上音樂,或在音效之後加一段簡短的旁白,並保留無聲的原片供下次剪輯使用。

用 AI 加上音效

AI 能讓音效對上我的影片時間點嗎?

可以,只要它看得到畫面。在我們的測試中,Ciyo Agent 為短片做了一張時間表,並依照動作放置每個音效;根據我們的量測,杯子的碰撞聲正好從 6.80 秒開始。

應該讓影片模型產生聲音嗎?

如果你想掌控,就不要。先生成無聲的短片,再加上可以逐一移動和調整的音效。

環境音應該多大聲?

低到讓動作的聲音突顯出來就好。我們的環境音比最響的音效低約 28 dB。如果短片在聲音之間感覺太空,就把它調高。

花了多少?

2026 年 9 月 30 日共花 16 點:無聲短片 9 點,五個音效 7 點。混音以及不生成新聲音的重新混音都是免費的。

在 Ciyo 中為你的短片加上聲音

上傳一支無聲短片,說出需要聲音的時刻,並請 Ciyo Agent 提供時間點,讓你可以檢查。