مباشر فعلا: يتدفق كلامك إلى الذكاء الاصطناعي الخاص بنا أثناء حديثك
أثناء التسجيل، تقطع الصفحة تدفق الميكروفون إلى مقاطع قصيرة — بضع ثوان لكل مقطع، تقص بشكل تكيفي بحيث يرسل المقطع التالي لحظة عودة السابق — وترسل كل مقطع مباشرة إلى خوادم GPU لدينا، حيث ينسخه فورا النموذج نفسه من فئة Whisper الذي يشغل الموقع بأكمله. يصل النص إلى العرض المباشر بعد صوتك بثوان ويستمر في التدفق ما دمت تتحدث. لا خدمة كلام في المتصفح ولا API إملاء من طرف ثالث — النص المباشر مخرجات Whisper حقيقية من عتادنا الخاص.
ولأنه لا يحتاج إلا إلى تسجيل الميكروفون، يعمل الوضع المباشر في كل متصفح حديث — Chrome وEdge وSafari وFirefox، على الحاسوب والهاتف. ويحذف كل مقطع صوتي من خوادمنا لحظة عودة نصه.
التغذية الحية مقابل النص النهائي
للنسخ مقطعا بمقطع حد بنيوي واحد: يرى النموذج بضع ثوان في كل مرة، لذا قد تخرج كلمة تمتد بين مقطعين مبتورة، ويصبح الترقيم عند حدود المقاطع تخمينا. لهذا ينتهي المسار بخطوة إضافية: يحتفظ بالتسجيل الكامل في متصفحك أثناء حديثك، والضغط على «نسخ» يمرره عبر النموذج كلقطة واحدة — سياق كامل، وترقيم صحيح، وطوابع زمنية، والمحرر، وتصدير TXT/SRT/VTT.
استخدم التغذية الحية للتأكد من أنها تسير مع الوقت وللحصول على النص في اللحظة التي يتم فيها التحدث (هناك زر نسخ على التغذية)؛ استخدم المرور النهائي لأي شيء ستحتفظ به. بالنسبة للصوت الذي لديك بالفعل كملف، طريقة تحميل على أي صفحة أداة هي المسار الأقصر.
الأسئلة المتكررة
هل هذا مباشر حقا، أم يسجل ثم يرسل لاحقا؟
مباشر فعلا: التسجيل والنسخ متداخلان. ترسل الصفحة كل مقطع صوتي من بضع ثوان إلى وحدات GPU لدينا بينما لا تزال تنطق المقطع التالي، لذا يتراكم النص أثناء التسجيل لا بعده. توقع أن يتأخر العرض عن صوتك ببضع ثوان — الوقت الذي يستغرقه المقطع حتى يكتمل ويرفع وينسخ.
لماذا يتأخر النص المباشر عني ببضع ثوان؟
هناك ثلاثة تأخيرات صغيرة تتراكم: يجب أن تنتهي شريحة من التسجيل (ثلاث ثوان أو نحو ذلك)، ثم تذهب إلى الخادم، ثم تمر عبر النموذج. وهذا عادة ما يضع التغذية حوالي 4-8 ثوان خلف صوتك - وإذا كانت وحدات المعالجة الرسومية مشغولة لفترة وجيزة، تتكيف الصفحة بإرسال شرائح أطول قليلاً بدلاً من التخلف. يبدو الكلام الطبيعي مع فترات التوقف سلساً.
ما هي المتصفحات التي يعمل فيها الوضع الحي؟
كلها حديثة - كروم، وإدج، وسافيري، وفايرفوكس، على سطح المكتب والهواتف. يعتمد على تسجيل الميكروفون القياسي بدلا من خدمة المتصفح الناطقة، لذلك يعمل في فايرفوكس كما يعمل في كروم.
أين يذهب صوتي بينما يجري النسخ الحي؟
إلى خوادمنا فقط، ووصفت بصدق: الوضع الحي ينقل صوتك إلينا في أجزاء قصيرة كما تتحدث - هذا ما يجعله حي - وكل جزء يتم حذفه فورا بعد أن يعود نصه. لا شيء يذهب إلى جوجل، أو آبل، أو أي خدمة صوتية من الطرف الثالث. يبقى التسجيل الكامل في متصفحك حتى تضغط على نسخ، والنسخ المجهولة الهوية يتم حذفها تلقائيا في غضون 24 ساعة.
هل يمكنني استخدامه لمتابعة اجتماع أو محاضرة في القاعة؟
كمساعد شخصي، نعم — ضع الجهاز قرب المتحدث وسيتابع العرض المباشر الكلام الواضح جيدا، بتأخر نحو عشر ثوان. اعرف الحدود: ميكروفون واحد، لذا تضعف النتيجة مع الأصوات البعيدة والكلام المتداخل، وهو ليس خدمة ترجمة شاشة معتمدة لأغراض إتاحة الوصول. اضغط «نسخ» في النهاية وغالبا ما يستعيد المرور بكامل السياق ما أخطأه العرض المباشر.
أي اللغات تعمل مباشرة، وهل يجب أن أختار واحدة؟
نفس اللغات التي تزيد عن 90 لغة مثل كل نسخة على هذا الموقع — إنه نفس النموذج. نصيحة واحدة خاصة بالوضع الحي: اختر لغتك في المختار بدلاً من ترك الاكتشاف الآلي مفتوحاً. الاكتشاف يجري على أساس كل جزء، وسبع ثوانٍ ليست دليلاً كبيراً، لذا فإن ربط اللغة يمنع التغذية من التردد على العبارات القصيرة أو ذات النغمة.