أعلنت جوجل يوم 26 أغسطس 2026 عن نموذج جديد للتفريغ الصوتي يحمل اسم Gemini 3.5 Transcribe، وصفته الشركة بأنه «أدق نموذج تحويل الكلام إلى نص» أنتجته حتى الآن. الفكرة الجوهرية التي تجعله مختلفاً عن أدوات التفريغ التقليدية بسيطة لكنها مهمة لكل من يتعامل مع الصوت يومياً: النموذج لا يكتفي بكتابة ما تسمعه الأذن حرفياً، بل يحوّل الصوت الخام إلى نص منسّق ونظيف، يحذف الكلمات الحشوية مثل «إمم» و«أهه» تلقائياً، ويلتقط المصطلحات المتخصصة، ويميّز المتحدثين عن بعضهم، مع طوابع زمنية دقيقة لكل كلمة.
جاء الإعلان على المدونة الرسمية لجوجل من فريق Gemini Audio، وهو متاح الآن للمطورين في شكل معاينة عامة عبر واجهة Gemini API في Google AI Studio ومنصة Gemini Enterprise Agent Platform، بينما بدأ وصوله تدريجياً للمستخدمين العاديين في تطبيق Gemini على macOS عبر ميزة الكتابة الصوتية Rambler على أندرويد في دول ولغات مختارة.

ماذا يفعل Gemini 3.5 Transcribe فعلياً؟
النموذج مصمم لثلاث مهام متصلة يمر بها أي صانع محتوى صوتي: التفريغ، التنظيف، والفهم. فبدلاً من أن تحصل على نص خام مليء بالتكرار والتلعثم ثم تقضي ساعة في تنظيفه، يعيد النموذج صياغة المخرجات مباشرة إلى نص «مصقول ومنسّق» كما وصفتها جوجل نفسها. ومن أبرز القدرات المعلنة:
- حذف عبارات التردد تلقائياً: «إمم»، «يعني»، «أهه» تختفي من النص النهائي دون تدخل منك.
- تمييز المتحدثين: في التسجيلات المسبقة يستطيع تمييز حتى ثلاثة متحدثين وفصل كلام كل منهم.
- طوابع زمنية على مستوى الكلمة: ميزة ذهبية لمن يصنع فيديوهات مترجمة أو يريد ربط كل جملة بلحظتها في التسجيل.
- مفردات مخصصة: أضف أسماء علامتك التجارية ومصطلحات مجالك، فيلتزمها النموذج كما كتبتها أنت لا كما يخمنها.
- التبديل اللغوي الحي: التعامل مع من يخلط بين لغتين في الجملة الواحدة — حالة يعرفها كل عربي يتحدث العربية والإنجليزية معاً — عبر بث مباشر دون انقطاع.
- التنسيق الذكي: إخراج نص منظم بعناوين وفقرات بدل كتلة كلام واحدة.
أرقام الأداء المعلنة
تقول جوجل إن النموذج يمثل قفزة عن سابقه Chirp 3 في ثلاثة أبعاد: دقة أعلى، سرعة أعلى، وقدرات جديدة كلياً. وفق قياسات منصة Artificial Analysis المستقلة، تحسّن زمن الوصول للنص النهائي بنسبة 70% مقارنة بالجيل السابق. وعلى معيار FLEURS متعدد اللغات سجّل النموذج نسبة خطأ في الكلمات 5.50% في وضع البث المباشر و5.04% في التفريغ غير المتزامن — مع إشارة جوجل إلى تحسن الأداء متعدد اللغات عن Chirp 3.

اللغة العربية تحديداً: إعلان جوجل يذكر أن قدرات التفريغ الجديدة تدعم اكتشاف المصطلحات المتخصصة في أكثر من 85 لغة، والمعيار المستخدم للقياس يغطي لغات متعددة بينها العربية، لكن الشركة لم تنشر حتى الآن قائمة رسمية مفصلة بمستوى الدعم العربي في التطبيقات الاستهلاكية. الانطلاقة الأولى للمستخدمين أعلنت بالإنجليزية على تطبيق macOS، وميزة Rambler على أندرويد في «دول ولغات مختارة» دون تسميتها. سنحدّث هذا المقال فور توفر تفاصيل رسمية عن العربية.
أين يجده المطوّر وصانع المحتوى اليوم؟
إلى جانب الواجهة البرمجية، دمجت جوجل النموذج في أسطحها المختلفة: لوحة المفاتيح Gboard، ومنصة Antigravity الخاصة بالمطورين، وتطبيق Gemini (حيث يستطيع مستخدمو macOS تحليل الملفات وتوليد الصور والبحث بالصوت فقط)، مع وعد بدعم Chrome «قريباً». كما أعلنت جوجل أن منصات مثل Agora وLangChain وLiveKit وPipecat وVercel تبني واجهات صوتية فوق واجهة Gemini Live API — ما يعني أن أدوات التفريغ والتسميات الصوتية المبنية على هذا النموذج ستظهر تدريجياً في منتجات أخرى خلال الأشهر القادمة.

ماذا يعني هذا لك كصانع محتوى؟
إن كنت تصنع بودكاست أو فيديوهات أو مقابلات، فهذا النوع من النماذج يغيّر اقتصاديات عملك في ثلاث نقاط ملموسة:
- وقت التفريغ ينكمش: الفارق بين «نص خام يحتاج تنظيفاً» و«نص جاهز للنشر» هو ساعة إلى ثلاث ساعات لكل حلقة بودكاست طويلة. حذف الحشو تلقائياً وفصل المتحدثين يلغي أغلب هذه الساعة.
- المقاطع القصيرة تصبح أرخص: الطوابع الزمنية الكلمية تجعل استخراج المقاطع (Clips) من حلقة طويلة مسألة بحث في نص لا إعادة استماع للتسجيل كاملاً.
- الترجمة والعناوين تُبنى على نص نظيف: أي سير عمل لترجمة الحلقات أو توليد عناوين وملخصات يبدأ من نص مرتب، وكلما كان النص الأول أنظف كانت المخرجات النهائية أدق.
وللمتاجر وأصحاب الأعمال: تسجيلات خدمة العملاء والاجتماعات ورسائل الصوت في واتساب يمكن تحويلها إلى ملخصات وقوائم مهام نصية قابلة للأرشفة والبحث — والواجهة البرمجية العامة تسمح ببناء ذلك داخل أدواتك الحالية.
مقارنة سريعة مع ما تستخدمه اليوم
| الأداة | حذف الحشو تلقائياً | تمييز المتحدثين | الطوابع الزمنية | الوصول |
|---|---|---|---|---|
| Gemini 3.5 Transcribe | نعم | حتى 3 متحدثين | لكل كلمة | API + تطبيق Gemini (انطلاقة تدريجية) |
| التفريغ في مستندات جوجل / لوحة المفاتيح | لا | لا | لا | مجاني للجميع |
| Whisper المفتوح المصدر | لا (نص حرفي) | محدود | لكل مقطع | يتطلب تشغيلاً تقنياً أو وسيطاً |
| التفريغ اليدوي عبر مستقل | حسب الطلب | نعم | ممكنة | تكلفة لكل دقيقة |
الخلاصة العملية: إن كان سير عملك يعتمد على «الكلام أولاً» — تفكير بصوت مسجّل ثم تحرير نصي — فالجيل الجديد من نماذج التفريغ يقترح عكس الاتجاه المعتاد: سلّم النموذج الصوت الخام واستلم مسودة جاهزة للتحرير الأدبي، لا نسخة حرفية متعبة. وإذا أردت تجربة سير عمل «من الصوت إلى المقال المنشور» بأدوات عربية جاهزة، اطّلع على كاتب المقالات والأبحاث في ARWriter الذي يكمل الرحلة بعد التفريغ: من مسودة إلى مقال منسّق جاهز للنشر.
حدود وعيوب يجب أن تعرفها قبل الاعتماد عليه
- الانطلاقة الاستهلاكية إنجليزية أولاً: إعلان macOS محدد بالإنجليزية، ودول Rambler الأندرويد «مختارة» دون قائمة معلنة — لا تفترض التوفر العربي الفوري قبل تجربته بنفسك.
- سقف ثلاثة متحدثين: في التسجيلات الجماعية الطويلة (بودكاست بأربعة ضيوف مثلاً) ستحتاج فصل المتحدث الرابع يدوياً.
- النص «المصقول» سلاح ذو حدين: حذف التلعثم ممتاز للمحتوى، لكنه غير مقبول صحافياً حين تحتاج الاقتباس الحرفي الدقيق — راجع الاقتباسات المهمة مقابل التسجيل الأصلي.
- تسعير الواجهة البرمجية لم يُعلن تفصيلاً في منشور الإطلاق؛ تحقق من صفحة الأسعار الرسمية قبل بناء أي خدمة عليها.
- المقارنات الرقمية تخص المعايير المعلنة (FLEURS وقياسات Artificial Analysis) وليست وعداً بأداء مماثل على ملفاتك أنت — جرّب عينة من تسجيلاتك الفعلية أولاً.
الأسئلة الشائعة
ما هو Gemini 3.5 Transcribe؟
نموذج تفريغ صوتي جديد من جوجل أُعلن في 26 أغسطس 2026، يحوّل الصوت الخام إلى نص منسّق ونظيف، يحذف الكلمات الحشوية، ويميّز المتحدثين، ويدعم المفردات المخصصة والتبديل اللغوي الحي.
هل يدعم Gemini 3.5 Transcribe اللغة العربية؟
الإعلان الرسمي يذكر دعم أكثر من 85 لغة في قدرات اكتشاف المصطلحات والتفريغ متعدد اللغات، لكن جوجل لم تنشر قائمة لغات تفصيلية، والانطلاقة الاستهلاكية الأولى أعلنت بالإنجليزية على macOS ودول مختارة لأندرويد. العربية واردة ضمن التغطية متعددة اللغات لكن بلا تفاصيل رسمية معلنة بعد.
هل Gemini 3.5 Transcribe مجاني؟
للمطورين يتوفر عبر Gemini API في Google AI Studio كمعاينة عامة وفق تسعير الواجهة المعتاد (لم يُعلن جدول خاص في منشور الإطلاق). للمستهلكين يصل تدريجياً داخل تطبيق Gemini وميزة Rambler دون إعلان باقة مدفوعة خاصة به.
كيف يستفيد صانع المحتوى منه عملياً؟
بتقصير مسافة «التسجيل إلى النص الجاهز»: حلقة بودكاست تُفرَّغ نظيفة مفصولة المتحدثين بطوابع زمنية كلمية، فيسهل استخراج المقاطع والترجمة والتلخيص وبناء المقالات فوقها.
ما الفرق بينه وبين Chirp 3 السابق؟
وفق جوجل: دقة أعلى (نسبة خطأ أقل على معيار FLEURS)، سرعة أعلى (تحسن 70% في زمن النص النهائي وفق Artificial Analysis)، وقدرات جديدة مثل حذف الحشو وتمييز المتحدثين والتنسيق الذكي.
خلاصة: إطلاق كهذا لا يعني أن تفريغ الصوت «انتهى» كحرفة، لكنه ينقل المنافسة من «من يكتب الحروف» إلى «من يفهم الصوت». لمن يبني سير عمل محتوى عربياً كاملاً، النصيحة اليوم: جرّب النموذج على عينة تسجيلاتك عند وصوله إليك، وقس الفارق الزمني بنفسك — ثم اربط مخرجه مباشرة بأدوات التحرير والنشر لديك، مثل أدوات ARWriter التي تتكامل مع هذه المخرجات النصية. ومقالنا عن إطلاق Gemini 3.7 Flash بنصف السعر يمنحك خلفية إضافية عن توجه جوجل الأخير في تسعير نماذجها، كما يمكنك مراجعة شرحنا السابق لميزة Gemini 3.5 Live Translate لفهم أين يقع التفريغ الجديد من خريطة عائلة Gemini الصوتية.