語音 · 實測
用 Eleven v4 為產品影片配旁白:15 秒裡放得下多少

旁白能把一組產品照片的幻燈片變成一支小廣告。難的不是聲音,而是時間:一支 15 秒、三個鏡頭的影片,每句旁白大約只有五秒,而一句在紙上看起來很短的話,說出來可能要七秒。
ElevenLabs 在 2026 年 9 月 28 日發布了 Eleven v4,Ciyo 的 Agent 現在用它來配旁白。2026 年 9 月 29 日,我們為虛構陶藝工作室 Tidewell 的馬克杯 Low Tide 做了一支 15 秒的上市影片,並量測每個字落在哪裡。聲音很清楚。時間安排則花了兩輪才調好。
Eleven v4 是什麼
Eleven v4 是 ElevenLabs 最新的文字轉語音模型,同時推出的還有給即時語音代理使用、速度更快的 Eleven v4 Turbo。ElevenLabs 表示,兩者都支援超過 90 種語言,而且可以用行內標籤指示說話的方式。在 Ciyo 裡,Agent 的旁白工具使用 Eleven v4,提供固定的十種聲音;預設是 Sarah,一個溫暖、沉穩的女聲。
在 Ciyo 裡,旁白不是畫板上一個獨立的檔案。Agent 會依章節寫腳本,每個章節生成一段語音,再把它們混進一支完成的影片,存到畫板上。
2026-09-28 發布。ElevenLabs 的發表貼文介紹 Eleven v4 和 Eleven v4 Turbo,稱它們是「fastest and most emotive voice models yet」(至今最快、最富情感的語音模型),並表示它們在 Artificial Analysis 排名第一。我們沒有查證這個排名;下面的測試談的是為一支短產品影片安排旁白時間。
從彼此一致的照片開始
我們要求三張同一個馬克杯的 9:16 照片:單獨放在架子上、裝著咖啡被拿起來,以及三個排成一列。Agent 先做出第一張照片,再以它為參考做另外兩張,讓釉色和形狀保持一致。三張共花了 8 點。

我經營一間小陶藝工作室 Tidewell。我們星期六要推出一款新的馬克杯,叫做 Low Tide。請為一支短的直式影片做三張 9:16 的產品照:1) 馬克杯單獨放在窗邊的漂流木架子上,海玻璃綠的釉色覆蓋在帶斑點的奶油色陶土上,柔和的早晨光線;2) 一隻手拿起同一個裝滿咖啡的馬克杯;3) 三個一樣的馬克杯在架子上排成一列。三張照片裡的馬克杯要完全一樣。自然的色彩,不要文字,不要標誌。依章節寫腳本
我們給了 Agent 章節、聲音和確切的台詞。它為每個章節生成一段旁白,並在組合影片之前逐段量測。接著它告訴我們一個問題:「Chapter 1's narration came out at 6.53 s, longer than its 5 s slot.」(第 1 章的旁白長 6.53 s,超過它 5 s 的時段。)
它沒有在沒問過我們的情況下加快語速或刪減字句。它讓第一句延伸 1.5 秒到第二張照片裡,把後面的句子依序往後移,並回報時間安排。三段語音各花 1 點。

三張照片一致。現在用它們做一支 15 秒的直式影片(1080x1920),配上英文旁白,使用 Sarah 的聲音。章節:0 到 5 s 照片 1,5 到 10 s 照片 2,10 到 15 s 照片 3,每張都緩慢推近。旁白,一字不改:"Meet Low Tide. Sea-glass glaze over speckled clay, thrown by hand at Tidewell. It holds your morning coffee and feels like the shore. Low Tide mugs arrive Saturday at tidewell.shop." 不要音樂。在最後 3 秒顯示文字 "Low Tide - Saturday - tidewell.shop"。告訴我每段旁白多長,以及這支影片用了多少點數。聲音實際落在哪裡
我們用 ffmpeg 量測完成的影片。聲音出現在 0.26 到 6.49 秒、6.78 到 10.10 秒,以及 10.97 到 14.54 秒。所以第一句蓋過了第 5 秒的剪接點,第二句則剛好在第 10 秒的剪接點上結束。
這些數字帶出一個簡單的原則。第一句有 13 個英文單字,連同停頓花了 6.5 秒,大約每秒 2 個字。第二句 10 個字只花了 3.3 秒,因為句子中間沒有句點;光是「Meet Low Tide.」後面的句點,就多了 0.44 秒的停頓。一個 5 秒的鏡頭大約安排 8 到 10 個英文單字,每個句點或冒號大約算半秒。

只修一個章節,不要重寫整份腳本
我們縮短了第一句,請 Agent 只重做那一段。即使是縮短後的句子,出來還是稍微長了一點,所以 Agent 縮短了「Meet Low Tide:」後面的停頓,並把這段加速 3%,變成 4.62 秒。這花了 1 點,另外兩段則沿用。
在第二個版本裡,每一句都落在自己的照片內:0.33 到 4.86 秒、5.38 到 8.70 秒,以及 10.37 到 13.94 秒。響度是 −16.5 LUFS,峰值 −1.3 dB,接近 Agent 影片流程設定的目標 −16 LUFS。
請做兩項修正。1) 讓每一句都落在自己的照片內。只把第 1 段換成這句比較短的台詞,並只重做這一段:"Meet Low Tide: sea-glass glaze, thrown by hand at Tidewell." 第 2 段和第 3 段維持原樣沿用,並讓每段在它的照片出現後約 0.3 s 才開始。2) 結尾文字太小,又放在最上方,會被 Instagram 的頁首擋住。把它放大,置中在畫面高度約 60% 的位置,分成兩行:"Low Tide mugs" 和 "Saturday - tidewell.shop",後面加一條柔和的深色底帶。影片維持剛好 15 s,並告訴我新那段的長度和使用的點數。在手機尺寸的畫面上檢查結尾卡
第一版的結尾文字是靠近上方的一條小小灰色底帶,大約在 1,920 像素中的第 220 到 325 像素之間,App 的頁首可能會蓋住它。我們的修正讓它變大並置中在 60% 高度,結果它壓在三個馬克杯上。第三次要求把它移到架子上,位於 72% 高度,高於 Instagram 放說明文字的最下方 20% 區域。這次修改不花點數,音訊也完全沒變。

旁白時間現在對了。最後一個修改:在 60% 的位置,結尾文字壓在三個馬克杯上,把產品擋住了。把兩行文字往下移到馬克杯下方的木架上,大約在畫面高度 72% 的位置,避開 Instagram 放說明文字的最下方 20% 區域,並讓文字後面的深色底帶再明顯一點。其他全部保持不變,存成 v3。整支影片花了多少
總共 12 點:照片 8 點,第一次旁白 3 點,重做的章節 1 點。用照片組成影片,以及之後對文字和時間安排的每一次修改,都不花點數,因為沒有生成新的影片。
| 檢查項目 | 版本 1 | 版本 3(最終版) |
|---|---|---|
| 長度 | 15.000 s | 15.000 s |
| 每一句都在自己的照片內 | 否(第一句延伸到 6.49 s) | 是 |
| 響度 | −16.6 LUFS | −16.5 LUFS |
| 結尾文字 | 小字,在最上方 | 大字,在架子上,高於說明文字區 |
| 點數 | 11(照片 8 + 旁白 3) | 總共 12 |

Eleven v4 旁白
Eleven v4 是什麼?
ElevenLabs 在 2026 年 9 月 28 日發布的文字轉語音模型,另有速度更快的 Turbo 版本。ElevenLabs 表示它支援超過 90 種語言和行內語氣標籤。
一個 5 秒的鏡頭放得下幾個字?
在我們的測試中,Sarah 這個聲音在有停頓的句子裡大約每秒說 2 個英文單字,在沒有停頓的句子裡每秒 3 個。5 秒大約安排 8 到 10 個英文單字,每個句點或冒號大約算半秒。
在 Ciyo 裡可以選擇聲音嗎?
可以。在要求中指名其中一個 Ciyo 聲音:Sarah、Alice、Matilda、Jessica、Lily、George、Daniel、Brian、Eric 或 Will。難唸的名字也可以用 IPA 寫出發音。
我會拿到獨立的音訊檔案嗎?
不會。在 Ciyo 裡,旁白會混進完成的影片,由 Agent 存到你的畫板上。
在 Ciyo 裡做一支有旁白的產品影片
把照片、章節和確切的台詞交給 Ciyo Agent,然後在發布前檢查時間安排。