أعلنت شركة ميتا إطلاق خدمة جديدة لتحويل الكلام إلى نص تحمل اسم «Muse Voice Transcribe»، في خطوة جديدة لتعزيز قدراتها في مجال الذكاء الاصطناعي والصوتيات ، وتدعم الخدمة أكثر من 70 لغة حول العالم، من بينها خمس لغات هندية رئيسية.
وتتيح «Muse Voice Transcribe» تحويل الكلام إلى نص بشكل فوري أثناء التحدث، بدلاً من انتظار انتهاء التسجيل بالكامل قبل بدء عملية المعالجة، ما يجعلها مناسبة للاجتماعات والمحادثات الطويلة وتطبيقات الإملاء المباشر.
وتتميز الخدمة بقدرتها على التعرف على المتحدثين وفصل أصواتهم، إذ يمكنها التمييز بين أكثر من 20 متحدثًا في التسجيل الواحد، إلى جانب تحديد بداية ونهاية الحديث تلقائيًا.
كما تستطيع التقنية التعامل مع التسجيلات الطويلة التي تتجاوز ساعة كاملة، إضافة إلى دعم المحادثات التي ينتقل خلالها المتحدثون بين أكثر من لغة، حتى إذا حدث تغيير اللغة داخل الجملة نفسها، دون الحاجة إلى ضبط اللغة يدويًا في كل مرة.
تصفح أيضًا: جوجل على علم بالمشكلة منذ 4 أشهر.. خلل برمجى يستنزف بطارية هواتف Pixel
وبحسب ميتا، يعتمد النموذج على معالجة الصوت في أجزاء قصيرة للغاية، مع تحديد الوقت المناسب لنسخ الكلمات وفقًا لمدى وضوحها، بهدف تحقيق توازن بين سرعة الاستجابة ودقة تحويل الكلام إلى نص.
وتشمل اللغات الهندية المدعومة في المرحلة الحالية الهندية والتاميلية والتيلوجوية والكانادية والمالايالامية، ضمن منظومة دعم لغوي واسعة تضم أكثر من 70 لغة.
وأتاحت ميتا الخدمة للمطورين عبر واجهة «Meta Model API»، ما يسمح بدمج قدرات تحويل الصوت إلى نص في التطبيقات والخدمات المختلفة ، وتستخدم بعض أدوات ميتا هذه التقنية بالفعل في ميزات الإملاء، في إطار توجه الشركة لتوسيع استخدام الذكاء الاصطناعي في التعامل مع الصوت والمحادثات.
وتبلغ تكلفة استخدام واجهة البرمجة، وفقًا لما أعلنته الشركة، 3 دولارات لكل 1000 دقيقة من الصوت، وهو ما يعادل نحو 0.18 دولار لكل ساعة.
وتعكس هذه الخطوة اهتمام ميتا المتزايد بتطوير تقنيات الذكاء الاصطناعي القادرة على فهم الكلام وتحليله في الوقت الفعلي، خاصة مع تنامي الاعتماد على المساعدات الذكية والإملاء الصوتي وتفريغ الاجتماعات والمحتوى الصوتي.




