الإجابة المختصرة
النسخة المختصرة
- المنظومات الصوتية وحدها تخلط المتحدثين المتداخلين في صوت واحد، فمشهد بثلاثة متحدثين هو أول اختبار ينبغي للاستوديو إجراؤه.
- سجّل ElevenLabs Dubbing v2 (Alpha) أخطاء في صوت الخلفية أكثر بنسبة 270% على المقاطع نفسها: الضحكات والموسيقى والأجواء (111 مخرجًا متقابلًا، 5 أغسطس 2026).
- تعادل ترجمة Familiar الإنتاجية المسودة الأولى لمترجمين محترفين خبراء بنسبة 100.3% من جودتهم في الفرنسية والصينية والهندية والإندونيسية.
- يعدّل الاستوديو أي سطر مترجم عند خطوة مراجعة قبل المعالجة، وتحفظ قائمة عدم الترجمة أسماء الشخصيات وعباراتها المميزة تمامًا كما قيلت.
01.ما الذي يجب أن تحفظه دبلجة الفيلم؟
يكدّس مشهد الفيلم كل الحالات الصعبة معًا: عدة ممثلين يتبادلون الأسطر، وموسيقى تصويرية تحت الحوار، وأجواء مكان يجب أن تجري متصلة عبر القطعات، وجمهور يعرف مسبقًا صوت كل ممثل.
- الصوت. الدبلجة ليست تحويلًا للنص إلى كلام: تأخذ سطر الممثل المسجَّل وتحفظ الهوية والإلقاء.
- الأداء كاملًا. يقرأ المشاهدون الشفاه وهم يستمعون، فالفم الذي لا يزال مشكَّلًا على اللغة الأصلية يقاوم السطر الجديد في كل إطار؛ والممثل يؤدي السطر بوجهه كله أيضًا: العينان والحاجبان والوجنتان والرأس (مزامنة الشفاه بالذكاء الاصطناعي: ما هي، وما يفوتها، وما يتفوّق عليها (2026)).
- المشهد. تبقى الموسيقى التصويرية وأجواء المكان والمؤثرات والحشد تحت الحوار: المقاطع التي تُرصد موسيقى لا تُدبلج أبدًا، وطبقات صوت الخلفية محفوظة تحت الكلام الجديد.
- كل متحدث. كل من يظهر أمام الكاميرا يُدبلج بصوته هو؛ أما المنظومات الصوتية وحدها فتخلط المتحدثين المتداخلين في صوت واحد (مشكلة حفل الكوكتيل).
- الكلمات. تحتاج الدبلجة إلى نص جديد مكتوب باللغة الهدف: نكات تُعاد كتابتها لتُفهم، وأسماء الشخصيات وعباراتها المميزة محفوظة تمامًا كما قيلت (ما الذي يهم في ترجمة الفيديو).
02.كيف تُقيّمها؟
بطاقة التقييم بأبعادها الستة والمنهج المتقابل في أفضل دبلجة بالذكاء الاصطناعي في العالم: كيف تقيسها؛ ومشهد الفيلم يضغطها في خمسة أسئلة.
| المعيار | السؤال الذي يطرحه الاستوديو | كيف يقيسه اختبار Familiar المقارن |
|---|---|---|
| كل متحدث يحتفظ بصوته | أغمض عينيك: هل كل ممثل أمام الكاميرا لا يزال الشخص نفسه، حتى حين يتحدث اثنان معًا؟ | تشابه الدبلجة مع المتحدث الحقيقي، لكل مقطع مصدر ولغة مستهدفة (دراسة ElevenLabs Dubbing v1، 11 لغة)؛ وتداخلات المتحدثين تُسجَّل كفئة أعطال في تدقيق المقاطع نفسها |
| الوجه يؤدي السطر | هل يحمل الفم والعينان والحاجبان والوجنتان والرأس الكلمات الجديدة، أم الشفاه وحدها؟ | جنبًا إلى جنب على المقطع نفسه؛ والدراسات المنشورة تقارن الصوت النهائي، فالأدوات الصوتية وحدها تتخطى هذا الصف |
| المشهد يصمد | هل الموسيقى التصويرية لا تزال تحت الحوار؟ وأجواء المكان؟ والمؤثرات؟ | أخطاء صوت الخلفية مقابل المشهد المصدر، بالديسيبل (دراسة ElevenLabs Dubbing v2 (Alpha)) |
| الكلمات تحمل المقصود | هل يقول كل سطر ما أراده النص؟ هل وصلت النكتة؟ هل نجا اسم الشخصية؟ | أخطاء الترجمة المهمة لكل مخرج مقابل معنى معتمد واحد (دراسة ElevenLabs Dubbing v2 (Alpha))؛ وجودة الترجمة بتقييم أعمى مقابل تنقيحات مرجعية أعدّها خبراء (دراسة الترجمة البشرية) |
| مقيسة ومنشورة | المقاطع نفسها عبر كل نظام، والعينات مجمّدة، والبيانات عامة؟ | دراسات متقابلة بأسلوب الصندوق الأسود بفترات ثقة وعينات استماع وعينات مجمّدة، منشورة على thefamiliarlab.com/benchmark |
- المعالجات المرجعية. مشهد استجواب بثلاثة متحدثين، من الإنجليزية إلى الإسبانية، يُعرض بجانب أصله على صفحة العروض التوضيحية؛ ومقارنة ثانية جنبًا إلى جنب هناك فيها ميكروفونات أمام الفم وأيدٍ تمرّ أمام الوجه: النموذج يفهم الحجب.
03.ما الذي قِيس؟
دراسات Familiar متقابلة وبأسلوب الصندوق الأسود: المقاطع المصدر نفسها تمرّ عبر كل نظام، ويُقارَن الصوت النهائي فقط، وتبقى كل عينة مجمّدة ومنفصلة.
سجّل ElevenLabs أخطاء في صوت الخلفية أكثر بنسبة 270%: الضحكات والموسيقى والأجواء.
ElevenLabs Dubbing v2 (Alpha) · 111 مخرجًا متقابلًا · الماندرين، الإسبانية، اليابانية · 5 أغسطس 2026يبدو صوت Familiar أقرب إلى المتحدث الحقيقي بنسبة 27.8%؛ ورجّحت اللغات الـ11 كلها Familiar.
ElevenLabs Dubbing v1 · 418 مخرجًا متقابلًا · 11 لغة · 5 أغسطس 2026تعادل ترجمة Familiar الإنتاجية جودة المسودة الأولى للمترجم المحترف الخبير، بمتوسط الفرنسية والصينية والهندية والإندونيسية، بتقييم أعمى مقابل تنقيحات مرجعية أعدّها خبراء.
دراسة الترجمة الإنتاجية مقابل المسودة الأولى لمترجمين محترفين خبراء · الفرنسية، الصينية، الهندية، الإندونيسية · أغسطس 2026- الكلمات، العينة نفسها. ارتكب Familiar أخطاء مهمة في الترجمة المنطوقة أقل بنسبة 54.7% من ElevenLabs Dubbing v2 (Alpha)، 29 مقابل 64، على المخرجات المتقابلة الـ111 نفسها.
04.ما الذي يظل الاستوديو يتحكم به؟
- كل سطر. تتوقف المنظومة عند خطوة مراجعة يُعدَّل فيها أي سطر مترجم قبل المعالجة، وتُعالَج كل لغة حين يعتمدها مراجعها (النص والمراجعة).
- الأسماء والعبارات المميزة. تحفظ قائمة عدم الترجمة أسماء الشخصيات والأماكن والجمل المميزة تمامًا كما قيلت في الدبلجة والترجمة المصاحبة والعنوان والوصف المترجمَين؛ وموجز سياق من سطر واحد يقول من يظهر على الشاشة وما هو الفيلم (قائمة عدم الترجمة).
- الصوت. يأتي الصوت من لقطة الممثل نفسه في المشهد؛ ولا خطوة لاختيار الأصوات.
- اللغات. يُعالَج مصدر واحد إلى ما يصل إلى 29 لغة مستهدفة، من أي من الـ30، على ثلاثة مستويات جودة منشورة، بدءًا بالأفضل (اللغات).
- التسليمات لكل لغة. الفيديو النهائي، والترجمة المصاحبة .srt و.vtt من النص المُراجَع، والعنوان والوصف مترجمَين، والصوت كملفات مستقلة: المزيج الكامل، أو الصوت وحده لمزيج الاستوديو الخاص (المخرجات).
- الحقوق. يُسجَّل تأكيد الحقوق على المهمة.
05.قبل الالتزام بمكتبة
- اختر أصعب مشهد. ثلاثة متحدثين، وموسيقى تصويرية تحت الحوار، ونكتة، وميكروفون أو يد أمام الفم.
- اكتب معايير القبول أولًا. الجدول 01 هو بطاقة التقييم؛ ويقيّم مراجعون من أهل اللغة كل لغة تقييمًا أعمى على لقطات الاستوديو نفسها قبل أن يسمع أحد المرشَّح.
- أدرج تعديلًا متأخرًا. غيّر سطرًا واحدًا بعد المعالجة الأولى وأمرره عبر خطوة المراجعة؛ وعدد الأسطر التي يغيّرها المراجع مقياس جودة بذاته.
- نفّذه كمشروع تجريبي. تصميم متقابل، ومشاهد متصلة، ولغتان أو ثلاث لغات ذات أولوية: كيف تنفّذ مشروعًا تجريبيًا للدبلجة بالذكاء الاصطناعي (2026).
- الوصول. بعقد Studio، مصمم بحسب حجم المكتبة؛ مع استرداد المال خلال 30 يومًا على العقود السنوية الموقّعة.
الأسئلة
هل يحتفظ كل ممثل في المشهد بصوته؟
نعم. كل من يظهر أمام الكاميرا يُدبلج بصوته هو. وبالقياس مقابل ElevenLabs Dubbing v1 على 418 مخرجًا متقابلًا عبر 11 لغة، بدا صوت Familiar أقرب إلى المتحدث الحقيقي بنسبة 27.8%، أقرب في اللغات الـ11 كلها.
هل تصمد الموسيقى التصويرية بعد الدبلجة؟
نعم. المقاطع التي تُرصد موسيقى لا تُدبلج أبدًا، وطبقات صوت الخلفية تحت الحوار محفوظة: الموسيقى التصويرية وأجواء المكان والمؤثرات. وعلى المقاطع نفسها، سجّل ElevenLabs Dubbing v2 (Alpha) أخطاء في صوت الخلفية أكثر بنسبة 270% (11.92 مقابل 3.22 ديسيبل؛ 111 مخرجًا متقابلًا، 5 أغسطس 2026).
لماذا يهم الفم إذا كان الصوت صحيحًا؟
يدمج المشاهدون حركات الشفاه مع الصوت ليفهموا الكلام؛ فإذا تعارضا صار الفهم أصعب، أو أدرك المشاهد صوتًا مختلفًا تمامًا (تأثير ماكغورك، McGurk & MacDonald, Nature, 1976). والدبلجة التي تغيّر الصوت وحده تُبقي هذا التعارض في كل إطار؛ أما Familiar فيولّد الصوت ومزامنة الشفاه معًا.
كم تكلف الدبلجة البشرية الكاملة، للمقارنة؟
الدبلجة البشرية الكاملة، أي الترجمة والصوت معًا، تكلف ما بين $70 و$150 لكل دقيقة نهائية لكل لغة: الترجمة $22–45 لدقيقة الكلام بحسب الأسعار المنشورة لكل كلمة، والصوت والاستوديو $39–94. ومعالجة واحدة من Familiar تحمل الترجمة وصوت الممثل وصوت المشهد ومزامنة الشفاه؛ والوصول بعقد Studio.
المراجع
- [1]الاختبار المقارن Familiar مقابل ElevenLabs: النتائج الكاملة وفترات الثقة وعينات الاستماع
- [2]Familiar مقابل المترجمين البشر: جودة الترجمة بتقييم أعمى مقابل تنقيحات مرجعية أعدّها خبراء، والسعر
- [3]أفضل دبلجة بالذكاء الاصطناعي في العالم: كيف تقيسها
- [4]لماذا تبدو الدبلجة غريبة في الخارج، وكيف تعالجها الاستوديوهات
- [5]كيف تنفّذ مشروعًا تجريبيًا للدبلجة بالذكاء الاصطناعي (2026)
- [6]McGurk & MacDonald, "Hearing lips and seeing voices," Nature 264, 746–748 (1976)
أخيرًا، الدبلجة صارت جيدة. اطّلع على القياسات، ثم تحدث مع الفريق عن مكتبة محتواك.
FAMILIAR · فيلم الإطلاق · 2:31
