配音 · 实测

用 Eleven v4 给产品视频配音:15 秒里能说多少

一个象牙色陶瓷圆锥侧躺着,开口处升起三道细环,最后一道是琥珀色,旁边是一块石墨色方块
原创抽象编辑插画,在 Ciyo 中用 GPT Image 2.5 Sunburst 生成。

配音能把一组产品照片的幻灯片变成一支小广告。难的不是声音,而是时间:一条有三个镜头的 15 秒视频,每句话大约只有五秒,而一句在纸上看着很短的话,说出来可能要七秒。

ElevenLabs 在 2026年9月28日发布了 Eleven v4,Ciyo 的智能体现在用它来做旁白。2026年9月29日,我们为虚构陶艺工作室 Tidewell 的一款马克杯 Low Tide 做了一条 15 秒的上新视频,并测量了每个词落在哪里。声音很清晰。时间安排改了两轮才对。

Eleven v4 是什么

Eleven v4 是 ElevenLabs 最新的文本转语音模型,同时发布的还有一个更快、面向实时智能体的 Eleven v4 Turbo。ElevenLabs 称两者都支持 90 多种语言,并且可以用行内标签来指导语气和表达。在 Ciyo 里,智能体的旁白工具使用 Eleven v4,提供固定的十种声音;默认声音是温暖、平静的女声 Sarah。

在 Ciyo 里,旁白不是画板上的一个单独文件。智能体按章节写脚本,每个章节生成一段音频,再把它们混成一条成片视频,保存在画板上。

先准备风格一致的照片

我们要了同一只马克杯的三张 9:16 照片:单独放在架子上、盛着咖啡被拿起来、三只排成一排。智能体先做了第一张,再把它作为另外两张的参考图,让釉色和杯形保持一致。三张共花了 8 个额度。

Ciyo 画布上是三张竖版照片,海玻璃绿马克杯放在窗边的浮木架上:单独一只、被一只手拿起,以及三只排成一排
视频用的三张产品照片。2026年9月29日。
发给 Ciyo Agent 的第一条消息
我经营一家小陶艺工作室 Tidewell。我们周六要上新一款叫 Low Tide 的马克杯。请为一条竖版短视频做三张 9:16 的产品照片:1) 马克杯单独放在窗边的浮木架上,带斑点的奶油色陶土上施海玻璃绿釉,柔和的晨光;2) 一只手拿起同一只盛满咖啡的马克杯;3) 三只同样的马克杯在架子上排成一排。三张图里的马克杯要完全一样。自然的颜色,不要文字,不要标志。

按章节写脚本

我们把章节、声音和逐字的台词交给智能体。它为每个章节生成一段旁白,在组装视频之前逐段测量。然后它告诉我们一个问题:“Chapter 1's narration came out at 6.53 s, longer than its 5 s slot.”(第 1 章的旁白长 6.53 s,超过了它 5 s 的时段。)

它没有在不问我们的情况下加快语速或删词。它让第一句延续 1.5 秒进入第二张照片,把后面的句子顺延,并报告了时间安排。三段音频每段花了 1 个额度。

Ciyo 智能体面板显示三个旁白步骤,并注明第 1 章长 6.53 秒,超过了它 5 秒的时段
智能体在组装视频之前测量每段旁白。
视频请求
三张照片风格一致。现在用它们做一条 15 秒的竖版视频(1080x1920),配英文旁白,声音用 Sarah。章节:0 到 5 s 照片 1,5 到 10 s 照片 2,10 到 15 s 照片 3,每张都缓慢推近。旁白逐字如下:"Meet Low Tide. Sea-glass glaze over speckled clay, thrown by hand at Tidewell. It holds your morning coffee and feels like the shore. Low Tide mugs arrive Saturday at tidewell.shop." 不要音乐。在最后 3 秒显示文字 "Low Tide - Saturday - tidewell.shop"。告诉我每段旁白有多长,以及视频用了多少额度。

声音实际落在了哪里

我们用 ffmpeg 测量了成片。人声分别位于 0.26 到 6.49 秒、6.78 到 10.10 秒和 10.97 到 14.54 秒。所以第一句话压过了 5 秒处的剪辑点,第二句话正好在 10 秒的剪辑点上结束。

这些数字给出了一条简单的规则。第一句有 13 个词,加上停顿用了 6.5 秒,约每秒 2 个词。第二句 10 个词用了 3.3 秒,因为中间没有句号;光是“Meet Low Tide.”(来认识 Low Tide。)后面的句号就加了 0.44 秒的停顿。一个 5 秒的镜头按 8 到 10 个英文单词来规划,每个句号或冒号大约算半秒。

两个版本的语音时间线:版本 1 里第一句跨过了 5 秒的剪辑点;版本 2 里三句话都落在剪辑点之间
两个版本中的语音,对照 5 秒和 10 秒处的照片切换点。由我们测量。

只修一个章节,而不是整份脚本

我们缩短了第一句,请智能体只重做那一段。即使缩短后,这句话还是稍长了一点,所以智能体剪掉了“Meet Low Tide:”(来认识 Low Tide:)后面的停顿,并把这段加速 3%,变成 4.62 秒。这花了 1 个额度,另外两段音频沿用原来的。

在第二个版本里,每句话都落在自己的照片之内:0.33 到 4.86 秒、5.38 到 8.70 秒和 10.37 到 13.94 秒。响度为 −16.5 LUFS,峰值 −1.3 dB,接近智能体的视频方案所瞄准的 −16 LUFS。

我们的修改请求
请做两处修改。1) 让每句话都落在自己的照片之内。只替换第 1 段,改用这句更短的台词并只重做这一段:"Meet Low Tide: sea-glass glaze, thrown by hand at Tidewell." 第 2 段和第 3 段原样沿用,每段都在对应照片出现约 0.3 s 后开始。2) 结尾文字太小,而且在顶部,会被 Instagram 的顶栏挡住。把它放大并居中,放在画面高度约 60% 的位置,分两行:"Low Tide mugs" 和 "Saturday - tidewell.shop",后面加一条柔和的深色底带。视频保持正好 15 s,并告诉我新那段的时长和用掉的额度。

在手机尺寸的画面上检查结尾字卡

第一版的结尾文字是靠近顶部的一条灰色小字带,大约在 1,920 像素中的 220 到 325 像素之间,应用的顶栏可能会挡住它。我们的修改让它变大并居中在 60% 高度处,结果它压在了三只马克杯上。第三次请求把它移到了架子上,位于 72% 高度处,在 Instagram 放置说明文字的底部 20% 之上。这次修改没有花额度,音频也完全没变。

马克杯视频的三个结尾画面并排:顶部的小字、压在马克杯上的大字,以及马克杯下方架子上的大字
版本 1、2 和 3 的最后一帧。Ciyo Agent 的输出,由我们排版。
最后一处修改
旁白的时间现在对了。最后一处修改:在 60% 的位置,结尾文字压在三只马克杯上,挡住了产品。把两行文字都往下移到马克杯下方的木架上,大约在画面高度 72% 的位置,避开 Instagram 放说明文字的底部 20%,并把文字后面的深色底带加深一点。其他一切保持不变,另存为 v3。

整条视频花了多少

总共 12 个额度:照片 8 个,第一版旁白 3 个,重做的章节 1 个。用照片组装视频,以及之后对文字和时间的每一次修改,都没有花额度,因为没有生成新的视频。

配音检查:第一版与最终版
检查项版本 1版本 3(最终版)
时长15.000 s15.000 s
每句话都在自己的照片之内否(第一句延续到 6.49 s)是
响度−16.6 LUFS−16.5 LUFS
结尾文字小字,在顶部大字,在架子上,位于说明文字区域之上
额度11(照片 8 + 旁白 3)共 12
Ciyo 智能体面板描述版本 3:文字位于 72% 高度处,底带更深,没有花额度
智能体对最终版本的报告。

Eleven v4 配音

Eleven v4 是什么?

ElevenLabs 在 2026年9月28日发布的文本转语音模型,另有一个更快的 Turbo 版本。ElevenLabs 称它支持 90 多种语言和行内语气标签。

一个 5 秒的镜头能放多少个词?

在我们的测试中,Sarah 这个声音在有停顿的句子里约每秒说 2 个英文单词,在没有停顿的句子里约每秒 3 个。5 秒按 8 到 10 个词来规划,每个句号或冒号大约算半秒。

在 Ciyo 里能选声音吗?

能。在请求里点名 Ciyo 的一种声音即可:Sarah、Alice、Matilda、Jessica、Lily、George、Daniel、Brian、Eric 或 Will。难读的名字还可以用 IPA 写出发音。

我能拿到单独的音频文件吗?

不能。在 Ciyo 里,旁白会混进成片视频,由智能体保存在你的画板上。

在 Ciyo 里做一条带旁白的产品视频

把照片、章节和逐字台词交给 Ciyo Agent,发布之前先检查时间安排。