MediaChef

MediaChef فيديو إلى SRT

إنشاء ترجمة SRT من فيديو

اسحب الفيديو إلى MediaChef، اختر «إنشاء ترجمة SRT لفيديو»، اترك النموذج على small واللغة على «تلقائي»، ثم شغّل. سيظهر بجوار الفيديو ملف ‎.srt بتوقيتاته الجاهزة. كل شيء يُحسب على جهازك: الكلام لا يغادر القرص، وبعد تنزيل النموذج تعمل الوصفة بلا شبكة أصلاً. على حاسوب M5 استغرقت دقيقتان و43 ثانية من الكلام 6.2 ثانية بالنموذج الافتراضي — أي أسرع من الزمن الحقيقي بنحو 26 ضعفاً — وأنتجت 73 سطراً بمتوسط 39 حرفاً، وهو قصير بما يكفي لقراءته بارتياح.

ما تحتاجه
MediaChef 0.8.5 مع تنزيل النموذج مرة واحدة
النموذج الافتراضي
small — 488 ميغابايت، يُنزَّل مرة ويبقى
السرعة
≈26× الزمن الحقيقي بالنموذج الافتراضي (قياس على M5)
يعمل بلا إنترنت
نعم، ما إن يستقر النموذج على القرص
الصيغ
SRT وVTT وTXT عادي وJSON — لكل منها وصفة
ما تحصل عليه
clip.subs.srt بجوار الفيديو، والفيديو نفسه سليم

مجاني ومفتوح المصدر — اطّلع على الكود في GitHub كل الملفات وملاحظات الإصدار

كيف تصنع ترجمة لفيديو

  1. نزّل MediaChef

    ملف واحد لنظام macOS أو Windows أو Linux. يأتي FFmpeg ومشغّل Whisper كلاهما داخل التنزيل: لا شيء تثبّته على حدة، ولا شيء تضيفه إلى PATH.

  2. نزّل النموذج مرة واحدة

    أول عملية تفريغ ستطلب نموذجاً صوتياً. الافتراضي هو small بحجم 488 ميغابايت، وعليه أُجريت كل القياسات أدناه؛ ووزن tiny 78 ميغابايت، وbase 148 ميغابايت، وlarge-v3-turbo 1.62 غيغابايت. يُجلب مرة، ويبقى على القرص، وبعدها لا تلمس الوصفة الشبكة إطلاقاً.

  3. ألقِ الفيديو واختر الوصفة

    «إنشاء ترجمة SRT لفيديو» يأخذ الفيديو مباشرة — لا حاجة إلى استخراج الصوت أولاً. يفكّ MediaChef ترميز المسار إلى أحادي بتردد 16 كيلوهرتز كما يشترط Whisper، في مجلد مؤقت لن تراه أبداً.

  4. شغّل وافتح ملف ‎.srt

    يهبط الملف بجوار الفيديو باسم clip.subs.srt، بسطور مرقّمة وتوقيتاتها. المشغّلات وبرامج المونتاج والمنصات تقرؤه مباشرة، ولأنه نص صرف يمكنك تصحيح اسم أو مصطلح في أي محرر.

MediaChef جاهز للتحويل: سطح العمل ينتظر ملف فيديو، وطابور المهام على اليمين.
سطح العمل الذي يهبط عليه الفيديو. تظهر الوصفات بمجرد أن يقرأ MediaChef الملف.

أي نموذج تختار

أربعة نماذج، وذات الدقيقتين و43 ثانية من الكلام، وذات الآلة: حاسوب M5 بذاكرة 16 غيغابايت، مع تسخين كل نموذج أولاً واعتماد الأفضل من تشغيلين.

النموذجحجم التنزيلالزمنمقابل الزمن الحقيقيكلمات أخطأ فيها
tiny78 ميغابايت2.1 ثانية×785 من 540
base148 ميغابايت2.6 ثانية×633 من 540
small — الافتراضي488 ميغابايت6.2 ثانية×260 من 540
large-v3-turbo1.62 غيغابايت11.5 ثانية×141 من 540

اقرأ العمود الأخير بتحفّظ، لأن الصوت الاختباري صوت مُركَّب يقرأ نصاً معدّاً سلفاً: بلا لكنة، وبلا ضجيج خلفي، وبلا من يقاطع. لهذا يكاد يصيب هنا حتى أصغر النماذج، وهذا لا يشبه تسجيل اجتماع حقيقي — فعلى الصوت الصعب تتّسع الفجوة بين هذه النماذج كثيراً. أما عمود الزمن فينتقل إلى حالتك كما هو. وثمة ما أخفته المقارنة الخام: كانت جل الفروق أرقاماً كُتبت بالأعداد بدل الحروف — كتب large-v3-turbo «70» و«10» و«50» و«30» حيث نطقها النص كاملة — وذلك تنسيق لا خطأ في السمع.

ما طول سطور الترجمة الخارجة

السطر الصحيح تقنياً يظل عديم الفائدة إن قذف عشرين كلمة على الشاشة دفعة واحدة. والنماذج تقطّع الكلام نفسه بطرق مختلفة جداً، وهذا مقيس من التشغيل نفسه أعلاه.

النموذجعدد السطورمتوسط المدةمتوسط الحروفأطول سطر
tiny354.7 ثانية8397 حرفاً
base354.7 ثانية83100 حرف
small — الافتراضي732.2 ثانية3958 حرفاً
large-v3-turbo305.4 ثانية97112 حرفاً

القاعدة الشائعة في البث نحو 42 حرفاً في السطر على سطرين، أي قرابة 84 حرفاً على الشاشة في وقت واحد. وبهذا المقياس لا يتّسع من الأربعة براحة إلا small: 39 حرفاً في المتوسط و58 في أطول سطر، بينما يتجاوز large-v3-turbo الحد عند سطر عادي. فالنموذج الافتراضي إذن ليس الخيار المتوازن في الدقة وحسب — بل هو أيضاً الذي يقطّع الكلام إلى أوضح القطع للقراءة.

SRT أم VTT أم نص صرف أم JSON

التفريغ نفسه مكتوباً بأربع طرق. والأحجام مأخوذة من الدقيقتين و43 ثانية نفسها، فهي قابلة للمقارنة مباشرة.

الصيغةالحجمما بداخلهامتى تأخذها
SRT5.5 كيلوبايتسطور مرقّمة، وتوقيت بفاصلة: 00:00:00,000في أغلب الحالات. تقبلها المشغّلات وبرامج المونتاج والمنصات
VTT5.3 كيلوبايتترويسة WEBVTT، وتوقيت بنقطة: 00:00:00.000ترجمة لمشغّل الويب، ومسار المتصفح
TXT3.0 كيلوبايتنص متصل، بلا أي توقيتاتتريد الكلمات لا الترجمة
JSON15.2 كيلوبايتكل سطر مع النموذج والمعاملات المستخدمةسيقرأ هذا برنامج، لا إنسان

يختلف SRT وVTT أساساً في الحرف الفاصل بين الثواني وأجزائها، فإن رفض مشغّلٌ أحدهما فالآخر تغيير وصفة لا إعادة تفريغ. أما JSON فيزن نحو ثلاثة أضعاف SRT لأنه يحمل بيانات التشغيل إلى جانب النص.

أي وصفة لأي حالة

الترجمة ليست وصفة واحدة بل عدة وصفات، واختيار الصحيحة يوفّر عليك خطوة. وكلها في كتالوج الوصفات الـ17.

ما لديكما تريدهالوصفة
فيديوترجمة بجوارهإنشاء ترجمة SRT لفيديو
ملف صوتيترجمةتفريغ الصوت إلى ترجمة SRT
كلام بلغة أخرىترجمة إنجليزية في مرور واحدترجمة الكلام إلى ترجمة إنجليزية
أي شيء فيه كلامالنص فقطتفريغ الصوت إلى نص
أي شيء فيه كلاممسار لمشغّل ويبتفريغ الصوت إلى WebVTT

وصفة الترجمة تمضي من الكلام الأجنبي مباشرة إلى ترجمة إنجليزية بتوقيتاتها، في مرور واحد — لا «فرّغ أولاً ثم ترجم». غير أنها لا تذهب إلا إلى الإنجليزية: وهذا حد في النموذج لا في التطبيق.

لماذا تصنع الترجمة على جهازك أنت

الكلام لا يغادر قرصك. تسجيلات الاجتماعات والمقابلات والمكالمات أشد ما يتعامل معه معظم الناس حساسية، والتفريغ عبر الإنترنت هو بالتعريف نسخة من ذلك الحديث على خادم شخص آخر. هنا لا يوجد رفع أصلاً حتى تفكر فيه.

لا حساب بالدقيقة. خدمات التفريغ تحاسب بدقيقة الصوت، وذلك يحوّل أرشيفاً طويلاً إلى فاتورة حقيقية. تنزيل النموذج لمرة واحدة، وبعده يكلّف تسجيل من ساعتين ما يكلّفه تسجيل من دقيقتين: لا شيء.

يعمل والشبكة مطفأة. ما إن يستقر ملف النموذج على القرص، لا تلمس هذه الوصفة الإنترنت إطلاقاً. تعمل في الطائرة، وعلى جهاز مغلق، وفي غرفة يكون فيها الواي فاي أقل ما يُعوَّل عليه.

بلا حد للمدة. أدوات التفريغ المجانية على الويب تقف عادة عند بضع دقائق للملف — وذلك بالضبط حين يستحق التسجيل التفريغ لأنه طويل. هنا لا سقف.

مجلد كامل دفعة واحدة. ألقِ مجلد تسجيلات: يمرّرها الطابور واحداً تلو الآخر ويخبرك أين كُتب كل ملف ترجمة.

متى لا تكون هذه الأداة المناسبة

الوصفة تكتب ملف ترجمة. وهذا أضيق من «وضع ترجمة على الفيديو»، والفرق يهم في هذه الحالات.

  1. تريد الترجمة محروقة داخل الصورة.

    هنا يخرج ملف ‎.srt منفصل يحمّله المشغّل بجوار الفيديو. أما طبع النص داخل الإطارات فعملية أخرى: تعيد ترميز الفيديو، وبعدها لا يمكن إطفاء تلك الكلمات ولا تصحيحها.

  2. تحتاج دقة صالحة للبث.

    حتى على الصوت النظيف في القياسات أعلاه تعثّرت النماذج في بضع كلمات، والتسجيلات الحقيقية أصعب. وكل ما يُنشر تحت التزام قانوني بإتاحة المحتوى يراجعه إنسان قبل الخروج، مهما كان ما أنتج المسودة.

  3. الصوت رديء فعلاً.

    التداخل الكثيف في الكلام، أو تسجيل غرفة بالهاتف، أو موسيقى أعلى من الصوت — كل ذلك يُسقط النماذج الأربعة جميعاً. وإصلاح الصوت أولاً — ولو باستخراج مسار أنظف — يفيد أكثر من الصعود إلى نموذج أكبر.

  4. تحتاج ترجمة إلى غير الإنجليزية.

    Whisper يترجم إلى الإنجليزية ولا يترجم إلى سواها. ولأي لغة هدف أخرى، فرّغ أولاً باللغة الأصلية ثم ترجم النص الناتج بأداة مصنوعة لذلك.

أسئلة

هل هذا مجاني؟

نعم، بالكامل. MediaChef مفتوح المصدر برخصة GPL-3.0: لا نسخة مدفوعة، ولا حساب بالدقيقة، ولا سقف لطول الملف. والنماذج أيضاً تُنزَّل مجاناً. والإصدار الحالي هو 0.8.5.

هل يُرفع الفيديو إلى أي مكان؟

لا. يعالج الكلامَ ملفُ نموذج موجود على قرصك أنت. والشيء الوحيد الذي يعبر الشبكة هو تنزيل النموذج لمرة واحدة، وبعدها تعمل الوصفة والإنترنت مطفأ.

كم يستغرق ذلك؟

أسرع من الزمن الحقيقي بنحو 26 ضعفاً على النموذج الافتراضي: قسنا 6.2 ثانية لدقيقتين و43 ثانية من الكلام على حاسوب M5. وبهذه النسبة ينتهي تسجيل من ساعة في دقيقتين أو ثلاث. وعلى الصوت نفسه أعطى tiny ×78 وأعطى large-v3-turbo ×14.

أي نموذج ينبغي أن أختار؟

ابدأ بـsmall، وهو الافتراضي. في قياساتنا أصاب كل كلمة في الصوت الاختباري وأنتج أوضح السطور للقراءة — 39 حرفاً في المتوسط مقابل 97 لـlarge-v3-turbo. لا تصعد فوقه إلا إذا كان صوتك صعباً، وانزل إلى tiny أو base إن أردت مسودة في ثانيتين.

كم يبلغ حجم النموذج؟

78 ميغابايت لـtiny، و148 ميغابايت لـbase، و488 ميغابايت لـsmall، و1.62 غيغابايت لـlarge-v3-turbo. والتنزيل لمرة واحدة. بعدها يبقى الملف على القرص ويستعمله كل تشغيل لاحق دون سؤال.

هل عليّ تحديد لغة الكلام؟

لا. اللغة موضوعة على «تلقائي» والنموذج يستنتجها من الصوت. ومع ذلك يمكنك تسميتها صراحة، ويستحق ذلك حين يفتتح التسجيل بجملتين بلغة أخرى.

هل يستطيع ترجمة النص إلى الإنجليزية؟

نعم، بوصفة «ترجمة الكلام إلى ترجمة إنجليزية»: يدخل كلام أجنبي ويخرج ملف SRT إنجليزي بتوقيتاته، في مرور واحد بدل التفريغ ثم الترجمة. والإنجليزية هي لغة الهدف الوحيدة التي يدعمها النموذج.

ما الفرق بين SRT وVTT؟

أساساً علامات الترقيم في التوقيتات: يكتب SRT ‏00:00:00,000 بفاصلة ويرقّم السطور، ويكتب VTT ‏00:00:00.000 بنقطة ويبدأ بسطر WEBVTT. وSRT هو ما تتوقعه المشغّلات وبرامج المونتاج، وVTT هو ما يريده مشغّل الويب لمسار ترجمته. وهما وصفتان منفصلتان، فتغيير الصيغة تشغيل جديد لا إعادة كتابة للملف.

هل أستطيع تعديل الترجمة بعد ذلك؟

نعم، فملف ‎.srt نص صرف. افتحه بأي محرر لتصحيح اسم عَلَم أو مصطلح أو توقيت. وهذه هي طريقة العمل المعتادة: يؤدي النموذج التسعين وشيئاً بالمئة، وتُتمّ أنت الباقي بيدك.

لماذا خرجت بعض سطوري طويلة أكثر من اللازم؟

لأن النموذج هو من يقرّر أين يقطع، والنماذج الأكبر تقطع أقل. قسنا 39 حرفاً للسطر عند small مقابل 97 عند large-v3-turbo، على الصوت نفسه. فإن كانت سطورك تستطيل، فالعودة إلى small تصلح ذلك عادة — وعلى الكلام النظيف لا يكلّفك ذلك شيئاً من الدقة.

هل يميّز بين المتحدثين؟

لا. يكتب Whisper ما قيل لا من قاله. فإن احتجت إلى إشارات «متحدث 1 / متحدث 2» فستضعها بيدك أو تستعين بأداة مصنوعة لهذا الغرض تحديداً.

ماذا يحدث إن لم يكن في الملف كلام؟

يتوقف التشغيل ويخبرك أنه لم يسمع شيئاً مفهوماً، بدل أن يكتب صامتاً ملفاً فارغاً. الصمت لا يُنتج ترجمة، وهذا مقصود.

هل يعمل على Windows وLinux؟

على المنصات الثلاث. يُعالَج الكلام على المعالج في كلها، ويستعين إضافةً بمعالج الرسوميات على Apple Silicon — ومن هنا جاءت الأرقام السريعة أعلاه. والوصفة نفسها على حاسوب Windows متواضع ستكون أبطأ، لكنها تظل أسرع من الاستماع إلى التسجيل كله.

هل أستطيع ترجمة عدة ملفات دفعة واحدة؟

نعم. ألقِ مجلداً كاملاً وأضف الوصفة، وسيمرّرها الطابور واحداً تلو الآخر. ويُكتب كل ملف ترجمة بجوار مصدره هو.

هل يتغير ملف الفيديو؟

لا. يُكتب بجواره ملف ‎.srt منفصل — clip.subs.srt — والفيديو لا يُعدَّل ولا يُعاد تسميته ولا يُعاد ترميزه. وهذه الوصفة لا تمسّ الصورة إطلاقاً.

خذ ترجمة ذلك الفيديو

MediaChef 0.8.5 — مجاني ومفتوح المصدر، macOS · Windows · Linux.

مجاني ومفتوح المصدر — اطّلع على الكود في GitHub كل الملفات وملاحظات الإصدار

‏MediaChef حديث: النسخ ليست موقّعة بعد من Apple ولا من Microsoft، لذا يطلب التشغيل الأول تأكيداً — وداخل كل تنزيل إرشادات بنص عادي.

شيء لا يعمل أو ينقص شيء؟ اكتب لنا: hello@mediachef.app