影片 · 實測

用 AI 為無聲影片加上背景音樂,並在發布前先檢查

一條長長的象牙白紙帶在石墨色盤子上摺成柔和的波浪,下方是細細的炭黑色棒子,最高的波峰上放著一片琥珀色圓盤
原創抽象編輯插畫,於 Ciyo 中以 GPT Image 2.5 Sunburst 生成。

多數產品短片一開始都是無聲的:用手機拍的店面影片,或是關掉聲音的 AI 影片模型片段。音樂能讓它感覺像是完成品。音樂的麻煩在於,你無法從截圖判斷它的好壞;一段音軌在筆電喇叭上聽起來沒問題,卻可能有要到第十次播放才會注意到的問題。

2026 年 9 月 29 日,我們請 Ciyo Agent 為虛構花店 Bramble & Bloom 的一支 10 秒無聲 Reels 配上音樂,再用影片剪輯師使用的同一套工具量測結果。第一首音軌有一個缺陷,只聽一次的話我們根本不會發現。

從一支無聲短片開始

如果你已經有短片,就把它上傳到畫板。我們的短片是在 Ciyo 裡做的:用 GPT Image 2.5 Flare 做一張花束照片(2 點),再用它做一支 10 秒的 Seedance 2.5 影片(394 點),刻意做成無聲。Agent 檢查了檔案,確認它是 720 × 1280、長 10 秒,而且沒有音軌。

無聲在這裡很重要。影片模型自己加上的聲音(沙沙聲、環境底噪)之後會和音樂互相干擾。

Ciyo 畫布上一張牛皮紙包著蜜桃色玫瑰和白色陸蓮花的花束照片,旁邊是一支 10 秒的無聲影片
畫板上的花束照片和 10 秒無聲短片。2026 年 9 月 29 日。
我們怎麼做出無聲短片
我經營一家小花店 Bramble & Bloom。為了這個週末的 Instagram Reels,請為我們的週末花束拍一張 9:16 的照片(蜜桃色庭園玫瑰、白色陸蓮花和尤加利葉,用棕色牛皮紙包著,放在鋅製檯面上,柔和的日光,不要文字),然後用 Seedance 2.5 把它變成一支 10 秒的直式影片:鏡頭緩慢地繞著花束轉,花瓣輕輕擺動。影片要無聲,不要生成任何音訊。音樂我之後再加。

像寫需求說明一樣描述音樂,而不只是描述氛圍

寫明樂器、速度、「不要人聲」、確切的長度,以及開頭和結尾該怎麼處理。Ciyo Agent 用 MiniMax Music 3 製作音樂,並在它的工作區裡把音樂混進影片。它回報音軌花了 3 點,混音不花點數:音軌完整長 10.04 秒,開頭淡入 1.2 秒,結尾淡出 1.6 秒,平均約 −15 LUFS。

LUFS 是剪輯師用來表示感知響度的單位。線上影片常見的數值約在 −14 到 −16 之間;如果小聲很多,你的 Reels 在動態消息裡和其他影片相比會顯得無力。

Ciyo Agent 面板回報音樂長度、淡入淡出、響度和費用,旁邊是畫板上的無聲影片和完成影片
Agent 對第一首音軌的回報。
音樂的要求
這支短片很好看。現在請為這支 Reels 加上背景音樂:溫暖、輕快的木吉他配上柔和的鋼琴,悠閒的週末早晨氛圍,約 90 BPM,不要人聲。長度必須和短片完全一樣(10 s),開頭輕柔,結尾要跟著影片乾淨地結束,而不是在一個音符中間被切斷。響度要適合 Instagram。把加了音樂的完成影片存在無聲影片旁邊,並告訴我使用的點數。

量測一下:中間那安靜的一秒

我們下載完成的 Reels,用 ffmpeg 檢查。畫面完全沒有被動到:全部 241 格都和無聲短片一致。響度是 −15.2 LUFS,峰值 −1.4 dB,和 Agent 說的一樣,結尾也在最後一格淡出到幾乎無聲。

但音量曲線顯示出一個洞。大約從 5.1 秒到 5.95 秒,音樂掉到約 −32 dB,比音軌其他部分低了大約 15 dB。在一支 10 秒的 Reels 裡,這等於正中間有整整一秒幾乎無聲,而那正是觀眾決定要不要繼續看的時刻。

兩個版本在十秒內的音量折線圖:版本 1 在 5.1 到 5.95 秒之間掉到約負 32 dB,版本 2 維持在負 10 到負 23 dB 之間
兩支完成的 Reels 每 0.1 s 的音量,由我們用 ffmpeg 量測。

要求一段穩定的音軌,再檢查一次

我們把量測結果傳回去,要求一首風格相同、沒有停頓的新音軌。Agent 確認了這個下陷(還在 2.5 秒左右找到一個比較短的下陷),又花了 3 點做出第二首音軌,並沿用同一支影片。

第二個版本沒有中斷。淡入淡出之間最安靜的時刻約是 −23 dB,是吉他音符之間的短暫空隙。它的響度是 −14.0 LUFS,峰值 −1.3 dB,畫面同樣和無聲短片逐格一致。

兩個音樂版本的量測結果
檢查項目版本 1版本 2
長度10.04 s10.04 s
響度(整合)−15.2 LUFS−14.0 LUFS
峰值−1.4 dB−1.3 dB
淡入淡出之間最安靜的時刻5.9 s 處 −32.9 dB1.5 s 處 −23.2 dB
畫面是否改變否否
點數33
Ciyo Agent 面板確認安靜的部分已經消失,並回報第二首音軌的音量,畫板上有三支影片
畫板上的第二個版本,旁邊是第一個版本和無聲短片。
我們的後續訊息
我量了這首音軌:從 5.1 s 到 5.95 s,它掉了大約 15 dB,到 -32 dB 左右,所以 Reels 在中間有一秒幾乎無聲。請做一首新的音軌,風格相同,但從頭到尾都是穩定、連續的節奏,沒有任何停頓或中斷,保留輕柔的開頭和結尾的淡出,存成第二個版本。告訴我安靜的部分是否已經消失。

當 AI 音樂令人失望時

不是每次測試都會順利。模糊的要求只會得到一首平凡的音軌,而聽一次也不算檢查。把樂器和速度說清楚,量測音量曲線,或至少戴耳機聽兩次,然後重新生成:在這裡,一首新音軌花了 3 點。

發布前的檢查清單

檢查音軌長度是否和影片完全一樣、是否輕柔地開始並在最後一格結束、中間是否沒有空隙、響度是否接近 −14 到 −16 LUFS 且峰值不超過 −1 dB,以及畫面是否沒有改變。然後用手機開著聲音聽一次。

用 AI 為影片加上音樂

AI 能為我已經有的影片加上音樂嗎?

可以。在 Ciyo 裡,把短片放到畫板上,請 Ciyo Agent 配上音樂。它會生成一首和短片等長的純音樂音軌,並混進畫板上的一支新影片。

Reels 的音樂應該多大聲?

整合響度約 −14 到 −16 LUFS、峰值低於 −1 dB,是線上影片常見的目標。我們的兩個版本量到的是 −15.2 和 −14.0 LUFS。

為什麼我的 AI 音樂中間有一段很安靜?

音樂模型可能會在短音軌裡安排一段停頓。我們的音軌掉到約 −32 dB,將近一秒。請要求穩定、沒有停頓的節奏,然後再量測或再聽一次。

花了多少?

每首音樂音軌 3 點。製作我們的無聲測試短片花了 396 點(照片 2 點,Seedance 影片 394 點)。

在 Ciyo 裡完成你的 Reels

把短片放到畫板上,描述你要的音樂,讓 Ciyo Agent 混出一個你能量測、也能發布的版本。