أعلنت شركة جوجل إطلاق أحدث نماذجها المتخصصة في معالجة الصوت، Gemini 3.5 Transcribe، الذي يقدم قدرات متقدمة لتحويل الكلام إلى نص مكتوب بدقة وسرعة.
وحقق النموذج معدل خطأ منخفضا بلغ 2.6% عبر 85 لغة ولهجة، ما يعزز قدرته على التعامل مع اللهجات المحلية والبيئات الصوتية المزدحمة، وتوفير تفريغ نصي فوري للمحادثات والاجتماعات والمكالمات.
فهم أدق للهجات والضوضاء
يعتمد Gemini 3.5 Transcribe على بنية عصبية متطورة تتيح له التعامل مع مصادر صوتية متعددة داخل المكان نفسه، مع القدرة على عزل الضوضاء المحيطة وتحسين دقة النص الناتج.
ويمثل النموذج خطوة جديدة في تطوير تقنيات التعرف على الكلام، خصوصا في التطبيقات التي تتطلب سرعة في تحويل المحادثات الصوتية إلى نصوص قابلة للمعالجة والاستخدام.

أدوات جديدة للمطورين
أتاحت جوجل النموذج للمطورين عبر واجهات برمجة التطبيقات السحابية، بما يفتح المجال أمام استخدامه في مجموعة واسعة من التطبيقات والخدمات الرقمية.
تكنولوجيابيل جيتس يحذر من هجمات الذكاء الاصطناعي ضد الكهرباء والبنوك
ومن أبرز المجالات المستفيدة من هذه التقنية خدمة العملاء، والتعليم الرقمي، وأتمتة عمليات التوثيق، إلى جانب الاستخدامات المتخصصة في قطاعات تحتاج إلى سرعة ودقة في معالجة المحتوى الصوتي.
نحو محادثات أكثر ذكاء
وتسعى جوجل من خلال Gemini 3.5 Transcribe إلى تعزيز قدرات خدماتها القائمة على الصوت، ودعم تطوير أدوات أكثر تفاعلا في المحادثات والترجمة الفورية.
ومن شأن هذه التقنيات أن تسهم في تقليص حواجز اللغة، وتحسين التواصل بين المستخدمين حول العالم، وتوفير حلول إنتاجية متقدمة للمؤسسات والأفراد.








