影片音效 · 實測
用 AI 為影片加上音效,精準對到每一格畫面

無聲的商品短片感覺像沒做完,而光加音樂也解決不了。讓美食和商品影片看起來過癮的,是那些細小的聲音:酥皮裂開、杯子碰到桌面。這些聲音只有精準落在動作上才有效。碎裂聲早了半秒,聽起來就很假。
2026 年 9 月 30 日,我們在 Ciyo 中為虛構烘焙坊 Crumb & Kettle 做了一支 8 秒的 Reel,並請 Ciyo Agent 加上四個音效和一層安靜的環境音。它自己在影片中找出這些時刻,並回報每一個的時間點。我們量測了完成的音訊:杯子的聲音落在完全正確的那一格,碎裂聲最響的部分也落在裂開的過程之中。
從一支無聲短片開始
如果你已經有短片,就把它上傳。我們的短片是在 Ciyo 裡做的:一支 8 秒的直式特寫,雙手在盤子上方撕開可頌,酥皮碎屑掉落,接著一杯咖啡被放在旁邊。它用最便宜的影片設定花了 9 點,而且我們要求不要音訊。
無聲很重要。影片模型自己加上的聲音會和你之後放上的音效互相干擾,而且無法乾淨地移除。

我經營一家小烘焙坊 Crumb & Kettle。為了一支 Instagram Reel,請幫我做一支 8 秒的無聲直式短片(最便宜的影片設定,不要音訊):雙手在白色盤子上方把剛出爐的可頌撕開的特寫,酥皮碎屑掉落,接著一杯咖啡被放在旁邊。鏡頭保持不動。先不要加任何聲音;我想在下一步加上音效。說出時刻,而不只是說出聲音
只列出聲音還不夠。要說明每個聲音屬於哪個動作,讓 Agent 能在畫面中找到它:酥皮裂開、兩半被拉開、碎屑落下、杯子碰到桌面。加上一層環境音讓空間有空氣感,並說明它該多安靜。請它提供時間點,讓你可以檢查。
短片很好。現在請加上音效,讓它們落在動作上:酥皮裂開時清脆的碎裂聲、兩半被拉開時柔軟的拉扯聲、碎屑落在盤子上的聲音,以及杯子碰到桌面的聲音,底下再加一層安靜的咖啡館環境音。請你自己在影片中找出確切的時刻,告訴我每個音效的時間點,並把環境音壓低,讓動作的聲音突顯出來。不要音樂,不要人聲。2026-09-27 發布。這位創作者把一支靜音影片上傳到 Codex,請 Agent 在不使用 DAW 或音效素材庫的情況下設計音效,並分享了提示詞。其中兩條規則適用於任何工具:先標出畫面中的事件,而且不要相信 Agent 聽得到結果;請它提供一份音效提示表,由你自己判斷。這是另一個產品和他們自己的工作流程,不是 Ciyo。
Agent 如何找出這些時刻
Agent 逐格瀏覽影片,並在畫板上放了一張時間表:32 格畫面,每 0.25 秒一格,每一格都標上時間。這是一份可以刪除的工作參考,也是你檢查結果最快的方法。
接著它生成五個聲音,混進短片的一份複本中,原片保留不動。五個聲音花了 7 點;混音不用錢。

它選的時間點
Agent 回報每個音效時都附上時間點的理由,例如杯子在 6.80 秒落下,「when the cup's downward movement stops」(在杯子向下的動作停止時)。環境音貫穿整支短片,比音效低約 20 dB。
下面的畫面是從完成影片中這四個時間點擷取的。
| 音效 | 開始時間 | 對應畫面中的哪個動作 |
|---|---|---|
| 酥皮碎裂聲 | 1.95 s | 酥皮第一次裂開;隨著裂口變大持續約 1.3 s |
| 柔軟的拉扯聲 | 3.20 s | 兩半被拉開,持續到約 5.0 s |
| 碎屑落在盤子上 | 3.75 s | 第一片碎屑落下 |
| 杯子放上桌面 | 6.80 s | 杯子停止向下移動 |
| 咖啡館環境音 | 0 到 8 s | 淡入淡出,比音效低約 20 dB |

我們量測了音訊
我們下載了完成的 MP4,每 50 毫秒量測一次響度。環境音大約在 −46 到 −48 dB。杯子碰撞是最響的時刻,−18 dB,而且正好從 6.80 秒開始。碎屑聲在 3.70 秒升起。碎裂聲放在 1.95 秒,但它最響的部分出現在 2.5 到 3.0 秒,也就是裂口最大的時候,仍然在 Agent 選定的區間之內。
所以環境音比最響的音效低約 28 dB,比 Agent 說的「about 20 dB」(約 20 dB)稍微安靜一些,而整支 Reel 量起來是 −19.7 LUFS。如果它和你其他的 Reels 相比聽起來太小聲,就請 Agent 把混音做大聲一點;Agent 提議不生成新聲音、免費重新混音。

用耳朵檢查,再調整
AI Agent 能量測波形,卻無法告訴你碎裂聲聽起來像不像可頌。請用耳機和手機喇叭都聽一次。對每個音效問兩個問題:它是否從動作開始的那一格開始?它聽起來像那個物體嗎?如果某個聲音太早或太晚,就把時間表上的畫面時間和調整方向告訴 Agent,例如「move the crackle 0.3 s later」(把碎裂聲往後移 0.3 s)。
| 檢查項目 | 我們的 Reel |
|---|---|
| 每個音效都從對應的動作開始 | 杯子精準落在 6.80 s;碎裂聲的峰值在裂開過程之中 |
| 環境音低於音效 | 比最響的碰撞聲低約 28 dB |
| 沒要求就不要音樂或人聲 | 沒有 |
| 整體響度 | −19.7 LUFS;需要的話可要求更大聲 |
| 保留原片 | 是,無聲短片留在畫板上 |
這支 Reel 的下一步
音效、音樂和人聲各有自己的空間時,才能彼此配合。在音效底下加上音樂,或在音效之後加一段簡短的旁白,並保留無聲的原片供下次剪輯使用。
用 AI 加上音效
AI 能讓音效對上我的影片時間點嗎?
可以,只要它看得到畫面。在我們的測試中,Ciyo Agent 為短片做了一張時間表,並依照動作放置每個音效;根據我們的量測,杯子的碰撞聲正好從 6.80 秒開始。
應該讓影片模型產生聲音嗎?
如果你想掌控,就不要。先生成無聲的短片,再加上可以逐一移動和調整的音效。
環境音應該多大聲?
低到讓動作的聲音突顯出來就好。我們的環境音比最響的音效低約 28 dB。如果短片在聲音之間感覺太空,就把它調高。
花了多少?
2026 年 9 月 30 日共花 16 點:無聲短片 9 點,五個音效 7 點。混音以及不生成新聲音的重新混音都是免費的。
在 Ciyo 中為你的短片加上聲音
上傳一支無聲短片,說出需要聲音的時刻,並請 Ciyo Agent 提供時間點,讓你可以檢查。