الفيديو · مُختبَر
أضف موسيقى خلفية إلى فيديو صامت بالذكاء الاصطناعي، وافحصها قبل النشر

تبدأ معظم مقاطع المنتجات صامتة: فيديو للمتجر من الهاتف، أو مقطع من نموذج فيديو بالذكاء الاصطناعي أُطفئ صوته. والموسيقى هي ما يجعله يبدو مكتملاً. والمشكلة في الموسيقى أنك لا تستطيع الحكم عليها من لقطة شاشة، وقد يبدو المقطع جيداً على سماعات الحاسوب المحمول ومع ذلك تكون فيه مشكلات لا تلاحظها إلا في المرة العاشرة من التشغيل.
في 29 سبتمبر 2026 طلبنا من Ciyo Agent (وكيل Ciyo) أن يضع موسيقى تحت مقطع Reel صامت مدته 10 ثوانٍ لـ Bramble & Bloom، وهو متجر زهور متخيَّل، ثم قسنا النتيجة بالأدوات نفسها التي يستخدمها محرر الفيديو. كان في المقطع الموسيقي الأول عيب ما كنا لنلتقطه بالأذن من استماع واحد.
ابدأ بمقطع صامت
إذا كان لديك مقطع بالفعل، فارفعه إلى اللوحة. صنعنا مقطعنا في Ciyo: صورة واحدة لباقة زهور باستخدام GPT Image 2.5 Flare (مقابل 2 رصيد) وفيديو منها مدته 10 ثوانٍ باستخدام Seedance 2.5 (مقابل 394 رصيداً)، صامتاً عن قصد. فحص الوكيل الملف وأكّد أنه بمقاس 720 × 1280، ومدته 10 ثوانٍ، وليس فيه مسار صوتي.
الصمت مهم هنا. فالصوت الذي يضيفه نموذج الفيديو من تلقاء نفسه (حفيف، أو صوت الغرفة) يتعارض مع الموسيقى لاحقاً.

أدير Bramble & Bloom، وهو متجر زهور صغير. لمقطع Instagram Reel لهذا الأسبوع، من فضلك اصنع صورة واحدة بنسبة 9:16 لباقة عطلة نهاية الأسبوع (ورود حدائق بلون الخوخ، وحوذان أبيض، وأوكالبتوس في ورق كرافت بني، على منضدة من الزنك في ضوء نهار ناعم، دون نص)، ثم حوّلها إلى فيديو عمودي مدته 10 ثوانٍ باستخدام Seedance 2.5: حركة كاميرا بطيئة على شكل قوس حول الباقة، مع حركة خفيفة للبتلات. اجعل الفيديو صامتاً، دون صوت مولَّد. سأضيف الموسيقى لاحقاً.صِف الموسيقى كموجز عمل، لا كمزاج
حدّد الآلات، والإيقاع، و“بلا غناء”، والطول الدقيق، وكيف يجب أن تبدأ وتنتهي. يصنع Ciyo Agent الموسيقى باستخدام MiniMax Music 3 ويمزجها في الفيديو داخل مساحة عمله. أفاد بأن المقطع الموسيقي كلّف 3 أرصدة وأن المزج لم يكلّف شيئاً: يمتد المقطع طوال 10.04 ثانية كاملة، ويتصاعد تدريجياً خلال 1.2 ثانية ويتلاشى خلال 1.6 ثانية، ومتوسط ارتفاعه نحو −15 LUFS.
وحدة LUFS هي الوحدة التي يستخدمها المحررون لارتفاع الصوت كما تدركه الأذن. والقيم بين −14 و−16 تقريباً شائعة للفيديو على الإنترنت؛ وإذا كان أهدأ من ذلك بكثير بدا صوت مقطعك ضعيفاً بجانب المقاطع الأخرى في الخلاصة.

المقطع يبدو جميلاً. أضف إليه الآن موسيقى خلفية للـ Reel: غيتار صوتي دافئ وخفيف مع بيانو ناعم، ومزاج صباح عطلة هادئ، ونحو 90 BPM، دون غناء. يجب أن تكون بطول المقطع تماماً (10 s)، وأن تبدأ بنعومة، وأن تنتهي بنظافة مع الفيديو بدلاً من أن تنقطع في منتصف نغمة. اضبط ارتفاع الصوت بما يناسب Instagram. احفظ الفيديو النهائي بالموسيقى بجانب الفيديو الصامت وأخبرني بالأرصدة المستخدمة.قِسها: الثانية الهادئة في المنتصف
نزّلنا الـ Reel النهائي وفحصناه باستخدام ffmpeg. لم تُمس الصورة: الإطارات الـ 241 كلها طابقت المقطع الصامت. وكان ارتفاع الصوت −15.2 LUFS مع ذُرى عند −1.4 dB، كما قال الوكيل، وتلاشت النهاية إلى ما يقارب الصمت في الإطار الأخير.
لكن منحنى المستوى أظهر ثغرة. فمن نحو 5.1 إلى 5.95 ثانية هبطت الموسيقى إلى نحو −32 dB، أي أدنى بنحو 15 dB من بقية المقطع. وفي Reel مدته 10 ثوانٍ، هذه ثانية كاملة من شبه الصمت في المنتصف تماماً، وهي اللحظة التي يقرر فيها المشاهد هل يواصل المشاهدة.

اطلب مقطعاً ثابتاً وافحص مرة أخرى
أرسلنا القياس وطلبنا مقطعاً جديداً بالأسلوب نفسه دون توقف. أكّد الوكيل الهبوط (ووجد هبوطاً أقصر عند نحو 2.5 ثانية)، وصنع مقطعاً ثانياً مقابل 3 أرصدة أخرى، وأعاد استخدام الفيديو نفسه.
النسخة الثانية لا انقطاع فيها. وأهدأ لحظة فيها بين التصاعد والتلاشي نحو −23 dB، وهي فجوة قصيرة بين نغمات الغيتار. وارتفاع صوتها −14.0 LUFS مع ذُرى عند −1.3 dB، والصورة مرة أخرى هي المقطع الصامت إطاراً بإطار.
| الفحص | النسخة 1 | النسخة 2 |
|---|---|---|
| الطول | 10.04 ثانية | 10.04 ثانية |
| ارتفاع الصوت (المتكامل) | −15.2 وحدة LUFS | −14.0 وحدة LUFS |
| الذروة | −1.4 ديسيبل | −1.3 ديسيبل |
| أهدأ لحظة بين التصاعد والتلاشي | −32.9 ديسيبل عند 5.9 ثانية | −23.2 ديسيبل عند 1.5 ثانية |
| هل تغيّرت الصورة | لا | لا |
| الأرصدة | 3 | 3 |

قست المقطع الموسيقي: يهبط بنحو 15 dB، إلى قرابة -32 dB، من 5.1 s إلى 5.95 s، فيكاد الـ Reel يصمت ثانية كاملة في المنتصف. من فضلك اصنع مقطعاً موسيقياً جديداً واحداً بالأسلوب نفسه لكن بإيقاع ثابت متصل من البداية إلى النهاية، دون توقف أو انقطاع، واحتفظ بالبداية الناعمة والتلاشي في النهاية، واحفظه نسخةً ثانية. أخبرني هل اختفى الجزء الهادئ.حين تخيّب موسيقى الذكاء الاصطناعي الظن
لا ينجح كل اختبار. فالطلب المبهم يعطيك مقطعاً عاماً، والاستماع مرة واحدة ليس فحصاً. كن محدداً في الآلات والإيقاع، وقِس منحنى المستوى أو استمع على الأقل مرتين بسماعات الرأس، وأعد التوليد: هنا كلّف المقطع الجديد 3 أرصدة.
نُشر في 2026-09-29. أعطى محرر فيديو أداة ذكاء اصطناعي، لم يذكر اسمها، مقطعاً خاماً وطلب منها تصحيح ألوانه وإضافة موسيقى. ويقول إنه حصل على تصحيح ألوان ضعيف وأغنية مملة بعد 25 دقيقة، وإنه كان يستطيع إنجاز العمل أفضل في ثلاث دقائق. إنه ليس اختباراً لـ Ciyo؛ ونضمّنه تحذيراً منصفاً بأن الموجز والفحص ما زالا مهمين.
قائمة فحص قبل النشر
تحقق من أن المقطع الموسيقي بطول الفيديو تماماً، وأنه يبدأ بنعومة وينتهي عند الإطار الأخير، وأنه لا توجد فجوة في المنتصف، وأن ارتفاع الصوت قريب من −14 إلى −16 LUFS دون ذُرى فوق −1 dB، وأن الصورة لم تتغير. ثم استمع مرة واحدة على هاتف والصوت مفتوح.
إضافة الموسيقى إلى فيديو بالذكاء الاصطناعي
هل يستطيع الذكاء الاصطناعي إضافة موسيقى إلى فيديو لديّ بالفعل؟
نعم. في Ciyo، ضع المقطع على اللوحة واطلب من Ciyo Agent موسيقى. فيولّد مقطعاً آلياً بطول المقطع ويمزجه في فيديو جديد على اللوحة.
ما ارتفاع الصوت المناسب لموسيقى Reel؟
نحو −14 إلى −16 LUFS متكاملة، مع ذُرى أدنى من −1 dB، هدف شائع للفيديو على الإنترنت. وقيست نسختانا عند −15.2 و−14.0 LUFS.
لماذا في موسيقى الذكاء الاصطناعي لديّ فجوة هادئة؟
قد يبني نموذج الموسيقى استراحة داخل مقطع قصير. وهبط مقطعنا إلى نحو −32 dB لما يقارب ثانية. اطلب إيقاعاً ثابتاً دون توقف، ثم قِس أو استمع مرة أخرى.
كم كانت التكلفة؟
3 أرصدة لكل مقطع موسيقي. وكلّف صنع مقطع الاختبار الصامت 396 رصيداً (2 للصورة، و394 لفيديو Seedance).
أكمل الـ Reel في Ciyo
ضع مقطعك على اللوحة، وصِف الموسيقى، ودع Ciyo Agent يمزج نسخة تستطيع قياسها ونشرها.