الصوت · مُختبَر
تعليق صوتي بـ Eleven v4 لفيديو منتج: ما الذي يتسع في 15 ثانية

يحوّل التعليق الصوتي عرض صور المنتج إلى إعلان صغير. والجزء الصعب ليس الصوت، بل الوقت: فيديو مدته 15 ثانية بثلاث لقطات يعطي كل جملة نحو خمس ثوانٍ، والجملة التي تبدو قصيرة على الورق قد تستغرق سبع ثوانٍ لقولها.
أطلقت ElevenLabs نموذج Eleven v4 في 28 سبتمبر 2026، وصار وكيل Ciyo يستخدمه الآن للسرد الصوتي. وفي 29 سبتمبر 2026 صنعنا فيديو إطلاق مدته 15 ثانية لـ Low Tide، وهو كوب من Tidewell، استوديو خزف متخيَّل، وقسنا أين وقعت كل كلمة. كان الصوت واضحاً. أما التوقيت فاحتاج إلى جولتين.
ما هو Eleven v4
Eleven v4 أحدث نموذج من ElevenLabs لتحويل النص إلى كلام، وقد صدر مع Eleven v4 Turbo الأسرع للوكلاء الذين يعملون في الوقت الفعلي. وتقول ElevenLabs إن النموذجين يدعمان أكثر من 90 لغة، وإنك تستطيع توجيه طريقة الأداء بوسوم داخل النص. وفي Ciyo تستخدم أداة السرد الصوتي لدى الوكيل Eleven v4 مع قائمة ثابتة من عشرة أصوات؛ والصوت الافتراضي هو Sarah، وهو صوت أنثوي دافئ وهادئ.
في Ciyo لا يكون السرد الصوتي ملفاً منفصلاً على لوحتك. بل يكتب الوكيل النص مقسَّماً إلى فصول، ويولّد مقطعاً واحداً لكل فصل، ثم يمزجها في فيديو نهائي يحفظه على اللوحة.
نُشر في 2026-09-28. يقدّم منشور الإطلاق من ElevenLabs نموذجي Eleven v4 وEleven v4 Turbo بوصفهما “fastest and most emotive voice models yet” (أسرع نماذجها الصوتية وأكثرها تعبيراً عن المشاعر حتى الآن)، ويقول إنهما يحتلان المرتبة الأولى لدى Artificial Analysis. لم نتحقق من هذا الترتيب؛ واختبارنا أدناه عن توقيت تعليق صوتي لفيديو منتج قصير.
ابدأ بصور متطابقة
طلبنا ثلاث صور بنسبة 9:16 للكوب نفسه: وحده على رف، ومرفوعاً وفيه قهوة، وثلاثة في صف. صنع الوكيل الصورة الأولى، ثم استخدمها مرجعاً للصورتين الأخريين ليبقى الطلاء الزجاجي والشكل كما هما. وكلّفت الصور الثلاث 8 أرصدة.

أدير Tidewell، وهو استوديو خزف صغير. سنطلق يوم السبت كوباً جديداً اسمه Low Tide. من فضلك اصنع له ثلاث صور منتج بنسبة 9:16 لفيديو عمودي قصير: 1) الكوب وحده على رف من خشب الشاطئ بجانب نافذة، بطلاء زجاجي أخضر بلون زجاج البحر فوق طين كريمي منقّط، في ضوء صباحي ناعم؛ 2) يد ترفع الكوب نفسه مليئاً بالقهوة؛ 3) ثلاثة من الأكواب نفسها في صف على الرف. أبقِ الكوب متطابقاً في الصور الثلاث. ألوان طبيعية، دون نص، ودون شعارات.اكتب النص مقسَّماً إلى فصول
أعطينا الوكيل الفصول والصوت والكلمات بالضبط. فولّد مقطع سرد واحداً لكل فصل وقاس كلاً منها قبل أن يجمع الفيديو. ثم أخبرنا بالمشكلة: “Chapter 1's narration came out at 6.53 s, longer than its 5 s slot.” (خرج سرد الفصل 1 بطول 6.53 ثانية، أطول من خانته البالغة 5 ثوانٍ).
لم يسرّع الصوت ولم يحذف كلمات دون أن يسأل. بل ترك الجملة الأولى تمتد 1.5 ثانية داخل الصورة الثانية، وأزاح الجمل اللاحقة، وأفاد بالتوقيت. وكلّف كل مقطع من المقاطع الثلاثة 1 رصيد.

الصور الثلاث متطابقة. اصنع منها الآن فيديو عمودياً مدته 15 ثانية (1080x1920) مع تعليق صوتي بالإنجليزية بصوت Sarah. الفصول: من 0 إلى 5 s الصورة 1، ومن 5 إلى 10 s الصورة 2، ومن 10 إلى 15 s الصورة 3، مع تقريب بطيء في كل منها. التعليق الصوتي، كلمة بكلمة: "Meet Low Tide. Sea-glass glaze over speckled clay, thrown by hand at Tidewell. It holds your morning coffee and feels like the shore. Low Tide mugs arrive Saturday at tidewell.shop." دون موسيقى. وفي آخر 3 ثوانٍ اعرض النص "Low Tide - Saturday - tidewell.shop". أخبرني بطول كل مقطع سرد وبعدد الأرصدة التي استخدمها الفيديو.أين وقع الصوت فعلاً
قسنا الفيديو النهائي باستخدام ffmpeg. امتد الصوت من 0.26 إلى 6.49 ثانية، ومن 6.78 إلى 10.10، ومن 10.97 إلى 14.54. أي أن الجملة الأولى تتكلم فوق القطع عند الثانية 5، وأن الجملة الثانية تنتهي على القطع تماماً عند الثانية 10.
تعطي الأرقام قاعدة بسيطة. كانت الجملة الأولى 13 كلمة واستغرقت 6.5 ثانية مع وقفاتها، أي نحو 2 كلمة في الثانية. وكانت الثانية 10 كلمات في 3.3 ثانية، لأنه لم تكن فيها نقطة في المنتصف؛ فالنقطة بعد “Meet Low Tide.” (تعرّف إلى Low Tide) أضافت وحدها وقفة مدتها 0.44 ثانية. خطّط لنحو 8 إلى 10 كلمات للقطة مدتها 5 ثوانٍ، واحسب كل نقطة أو نقطتين رأسيتين بنحو نصف ثانية.

أصلح فصلاً واحداً، لا النص كله
قصّرنا الجملة الأولى وطلبنا من الوكيل أن يعيد صنع ذلك المقطع وحده. وحتى الجملة الأقصر خرجت أطول قليلاً، فقصّر الوكيل الوقفة بعد “Meet Low Tide:” (تعرّف إلى Low Tide:) وسرّع المقطع بنسبة 3%، إلى 4.62 ثانية. وكلّف ذلك 1 رصيد، وأُعيد استخدام المقطعين الآخرين.
في النسخة الثانية تقع كل جملة داخل صورتها: من 0.33 إلى 4.86 ثانية، ومن 5.38 إلى 8.70، ومن 10.37 إلى 13.94. وارتفاع الصوت −16.5 LUFS مع ذُرى عند −1.3 dB، وهذا قريب من −16 LUFS التي تستهدفها وصفة الفيديو لدى الوكيل.
إصلاحان، من فضلك. 1) أبقِ كل جملة داخل صورتها. استبدل المقطع 1 وحده بهذه الجملة الأقصر وأعد صنع ذلك المقطع فقط: "Meet Low Tide: sea-glass glaze, thrown by hand at Tidewell." أعد استخدام المقطعين 2 و3 كما هما، وابدأ كل مقطع بعد نحو 0.3 s من ظهور صورته. 2) نص النهاية صغير ويقع في الأعلى، حيث يغطيه شريط Instagram العلوي. اجعله كبيراً وفي الوسط عند نحو 60% من ارتفاع الإطار، على سطرين: "Low Tide mugs" و"Saturday - tidewell.shop"، مع شريط داكن ناعم خلفه. أبقِ الفيديو 15 s بالضبط وأخبرني بطول المقطع الجديد وبالأرصدة المستخدمة.افحص بطاقة النهاية في إطار بحجم الهاتف
كان نص النهاية الأول شريطاً رمادياً صغيراً قرب الأعلى، بين نحو 220 و325 بكسل من أصل 1,920، حيث قد يغطيه شريط التطبيق العلوي. وجعله إصلاحنا كبيراً وفي الوسط عند 60% من الارتفاع، فوضعه فوق الأكواب الثلاثة. ونقله طلب ثالث إلى الرف، عند 72%، فوق الـ 20% السفلى حيث تضع Instagram الوصف. ولم يكلّف ذلك التغيير شيئاً، وبقي الصوت متطابقاً.

توقيت الصوت صحيح الآن. تغيير أخير واحد: عند 60% يقع نص النهاية فوق الأكواب الثلاثة ويخفي المنتج. انقل السطرين إلى الأسفل على الرف الخشبي تحت الأكواب، عند نحو 72% من ارتفاع الإطار، وأبعدهما عن الـ 20% السفلى حيث تضع Instagram الوصف، واجعل الشريط الداكن خلف النص أقوى قليلاً. أبقِ كل شيء آخر كما هو واحفظه باسم v3.كم كلّف الفيديو كله
اثنا عشر رصيداً في المجموع: 8 للصور، و3 للسرد الأول، و1 للفصل المعاد صنعه. ولم يكلّف بناء الفيديو من الصور، ولا أي تغيير لاحق في النص والتوقيت، شيئاً، لأنه لم يُولَّد أي فيديو جديد.
| الفحص | النسخة 1 | النسخة 3 (النهائية) |
|---|---|---|
| الطول | 15.000 ثانية | 15.000 ثانية |
| كل جملة داخل صورتها | لا (الجملة الأولى تمتد إلى 6.49 ثانية) | نعم |
| ارتفاع الصوت | −16.6 وحدة LUFS | −16.5 وحدة LUFS |
| نص النهاية | صغير، في الأعلى | كبير، على الرف، فوق منطقة الوصف |
| الأرصدة | 11 (8 للصور + 3 للسرد) | 12 في المجموع |

التعليق الصوتي بـ Eleven v4
ما هو Eleven v4؟
نموذج ElevenLabs لتحويل النص إلى كلام، صدر في 28 سبتمبر 2026، مع نسخة Turbo أسرع. وتقول ElevenLabs إنه يدعم أكثر من 90 لغة ووسوماً لطريقة الأداء داخل النص.
كم كلمة تتسع في لقطة مدتها 5 ثوانٍ؟
في اختبارنا نطق صوت Sarah نحو 2 كلمة في الثانية في جملة فيها وقفة، و3 في جملة بلا وقفة. خطّط لنحو 8 إلى 10 كلمات لكل 5 ثوانٍ، واحسب كل نقطة أو نقطتين رأسيتين بنحو نصف ثانية.
هل أستطيع اختيار الصوت في Ciyo؟
نعم. سمِّ أحد أصوات Ciyo في طلبك: Sarah، أو Alice، أو Matilda، أو Jessica، أو Lily، أو George، أو Daniel، أو Brian، أو Eric، أو Will. وتستطيع أيضاً كتابة نطق اسم صعب بأبجدية IPA الصوتية.
هل أحصل على ملف صوتي منفصل؟
لا. في Ciyo يُمزج السرد في الفيديو النهائي، الذي يحفظه الوكيل على لوحتك.
اصنع فيديو منتج بتعليق صوتي في Ciyo
أعطِ Ciyo Agent صورك وفصولك وكلماتك بالضبط، ثم افحص التوقيت قبل النشر.