音声 · 実測
商品動画に Eleven v4 でナレーション: 15 秒に何が収まるか

ナレーションを付けると、商品写真のスライドショーが小さな広告になります。難しいのは声ではなく、時間です。三つのショットからなる 15 秒の動画では、一文あたり約五秒しかありません。紙の上では短く見える文でも、声に出すと七秒かかることがあります。
ElevenLabs は 2026年9月28日に Eleven v4 を公開し、Ciyo のエージェントは今ではナレーションにこれを使っています。2026年9月29日、架空の陶芸工房 Tidewell のマグカップ Low Tide の 15 秒の発売告知動画を作り、すべての言葉がどこに収まったかを測定しました。声ははっきりしていました。タイミングは二回の手直しが必要でした。
Eleven v4 とは
Eleven v4 は ElevenLabs の最新の音声合成モデルで、リアルタイムのエージェント向けに、より高速な Eleven v4 Turbo と一緒に公開されました。ElevenLabs によると、どちらも 90 以上の言語に対応し、文中のタグで話し方を指示できます。Ciyo では、エージェントのナレーションツールが Eleven v4 を使い、声は決まった十種類から選びます。温かく落ち着いた女性の声 Sarah が既定の声です。
Ciyo では、ナレーションはボード上の別ファイルにはなりません。エージェントは章ごとに台本を書き、章ごとにクリップを一つ生成し、それらを合成した完成動画をボードに保存します。
2026-09-28に投稿。ElevenLabs の公開告知の投稿で、Eleven v4 と Eleven v4 Turbo を “fastest and most emotive voice models yet”(これまでで最も速く、最も感情豊かな音声モデル)として紹介し、Artificial Analysis で一位になったと書いています。私たちはその順位を確かめていません。以下のテストは、短い商品動画のナレーションのタイミングについてのものです。
そろった写真から始める
同じマグカップの 9:16 の写真を三枚頼みました。棚に一つだけ置いたもの、コーヒーを入れて持ち上げたもの、三つ並べたものです。エージェントは一枚目を作り、それを残りの二枚の参照に使ったので、釉薬と形が同じに保たれました。三枚で 8 クレジットでした。

小さな陶芸工房 Tidewell を営んでいます。土曜日に Low Tide という新しいマグカップを発売します。短い縦長の動画用に、9:16 の商品写真を三枚作ってください: 1) 窓辺の流木の棚に一つだけ置いたマグカップ。斑点のあるクリーム色の土にシーグラスのような緑の釉薬、やわらかな朝の光。 2) コーヒーをいっぱいに入れた同じマグカップを持ち上げる手。 3) 同じマグカップ三つを棚に一列に並べたもの。三枚ともマグカップはまったく同じにしてください。自然な色で、文字やロゴは入れないでください。台本を章ごとに書く
エージェントに、章、声、正確な言葉を伝えました。エージェントは章ごとにナレーションのクリップを一つ生成し、動画を組み立てる前にそれぞれを測りました。そして問題を知らせてきました。“Chapter 1's narration came out at 6.53 s, longer than its 5 s slot.”(第 1 章のナレーションは 6.53 s になり、割り当ての 5 s より長くなりました)。
エージェントは、こちらに尋ねずに声を速めたり言葉を削ったりはしませんでした。一文目を二枚目の写真に 1.5 秒はみ出させ、後の文を順にずらし、タイミングを報告しました。三つのクリップはそれぞれ 1 クレジットでした。

三枚の写真はそろっています。次に、これらから 15 秒の縦長の動画(1080x1920)を作り、声 Sarah で英語のナレーションを付けてください。章: 0 から 5 s は写真 1、5 から 10 s は写真 2、10 から 15 s は写真 3。それぞれゆっくり寄っていく動きを付けます。ナレーションは一字一句このとおりに: "Meet Low Tide. Sea-glass glaze over speckled clay, thrown by hand at Tidewell. It holds your morning coffee and feels like the shore. Low Tide mugs arrive Saturday at tidewell.shop." 音楽はなし。最後の 3 秒間に "Low Tide - Saturday - tidewell.shop" という文字を表示してください。ナレーションの各クリップの長さと、動画で使ったクレジットを教えてください。声が実際に入った位置
完成した動画を ffmpeg で測定しました。声が入っていたのは 0.26 から 6.49 秒、6.78 から 10.10 秒、10.97 から 14.54 秒でした。つまり、一文目は 5 秒の切り替えをまたいで話し続け、二文目は 10 秒の切り替えぴったりで終わります。
この数字から簡単なルールが得られます。一文目は 13 語で、間を含めて 6.5 秒かかりました。一秒あたり約 2 語です。二文目は途中に句点がなかったため、10 語が 3.3 秒でした。“Meet Low Tide.” の後の句点だけで 0.44 秒の間が入っていました。5 秒のショットには約 8 から 10 語を目安にし、句点やコロンは一つにつき約半秒と数えてください。

台本全体ではなく、一つの章だけを直す
一文目を短くし、そのクリップだけを作り直すようエージェントに頼みました。短くした文でも少し長くなったので、エージェントは “Meet Low Tide:” の後の間を詰め、クリップを 3% 速めて 4.62 秒にしました。費用は 1 クレジットで、残りの二つのクリップは使い回されました。
二つ目のバージョンでは、どの文も自分の写真の中に収まっています。0.33 から 4.86 秒、5.38 から 8.70 秒、10.37 から 13.94 秒です。ラウドネスは −16.5 LUFS、ピークは −1.3 dB で、エージェントの動画の手順が目標にしている −16 LUFS に近い値です。
二点直してください。 1) 各文をそれぞれの写真の中に収めてください。クリップ 1 だけを次の短い文に差し替え、そのクリップだけを作り直してください: "Meet Low Tide: sea-glass glaze, thrown by hand at Tidewell." クリップ 2 と 3 はそのまま使い、各クリップは写真が現れてから約 0.3 s 後に始めてください。 2) 最後の文字は小さく、上端にあるため Instagram のヘッダーに隠れます。大きくして、画面の高さの約 60% の位置に中央揃えで、"Low Tide mugs" と "Saturday - tidewell.shop" の二行にし、後ろにやわらかな暗い帯を敷いてください。動画はちょうど 15 s のままにし、新しいクリップの長さと使ったクレジットを教えてください。スマートフォンの画面サイズで最後のカードを確かめる
最初の最後の文字は、上端近くの小さなグレーの帯で、1,920 ピクセルのうち約 220 から 325 ピクセルの位置にありました。ここはアプリのヘッダーに隠れることがあります。私たちの修正で文字は大きくなり、高さの 60% の位置に中央揃えになりましたが、そのせいで三つのマグカップの上に重なってしまいました。三回目の依頼で文字を棚の上、72% の位置に移しました。Instagram がキャプションを置く下端の 20% よりは上です。この変更は無料で、音声はまったく同じままでした。

声のタイミングはこれで合っています。最後にもう一つ変更をお願いします: 60% の位置だと、最後の文字が三つのマグカップの上に重なって商品が隠れます。二行とも、マグカップの下の木の棚の上、画面の高さの約 72% の位置まで下げ、Instagram がキャプションを置く下端の 20% にはかからないようにし、文字の後ろの暗い帯を少し濃くしてください。ほかはすべて同じままで、v3 として保存してください。動画全体の費用
合計で 12 クレジットでした。写真に 8、最初のナレーションに 3、作り直した章に 1 です。写真から動画を組み立てることと、その後の文字とタイミングの変更は、新しい動画を生成しなかったので、すべて無料でした。
| 確認項目 | バージョン 1 | バージョン 3(最終) |
|---|---|---|
| 長さ | 15.000 s | 15.000 s |
| どの文も自分の写真の中 | いいえ(一文目が 6.49 s まで続く) | はい |
| ラウドネス | −16.6 LUFS | −16.5 LUFS |
| 最後の文字 | 小さく、上端 | 大きく、棚の上、キャプション領域より上 |
| クレジット | 11(写真 8 + ナレーション 3) | 合計 12 |

Eleven v4 のナレーション
Eleven v4 とは何ですか
2026年9月28日に公開された ElevenLabs の音声合成モデルで、より高速な Turbo 版もあります。ElevenLabs によると、90 以上の言語と、文中で話し方を指示するタグに対応しています。
5 秒のショットに何語入りますか
私たちのテストでは、声 Sarah は、間のある文で一秒あたり約 2 語、間のない文で 3 語を話しました。5 秒には約 8 から 10 語を目安にし、句点やコロンは一つにつき約半秒と数えてください。
Ciyo で声を選べますか
はい。依頼の中で Ciyo の声を一つ指定してください: Sarah、Alice、Matilda、Jessica、Lily、George、Daniel、Brian、Eric、Will のいずれかです。読みにくい名前は、IPA で発音を書くこともできます。
音声ファイルは別にもらえますか
いいえ。Ciyo では、ナレーションは完成動画に合成され、エージェントがそれをボードに保存します。
Ciyo でナレーション付きの商品動画を作る
写真、章、正確な言葉を Ciyo Agent に渡し、投稿する前にタイミングを確かめましょう。