Qwen3.8-Omni-Flash من علي بابا: نموذج AI يسمع ويرى ويحرّر الفيديو

أطلقت Qwen نموذج Qwen3.8-Omni-Flash بسياق مليون توكن وفهم للصوت والفيديو وأسعار أقل بـ98% — إليك ماذا يعني لصناع المحتوى العرب.

Qwen3.8-Omni-Flash من علي بابا: نموذج AI يسمع ويرى ويحرّر الفيديو
جدول المحتويات

آخر تحديث: سبتمبر 2026 — خبر اليوم

أطلق فريق Qwen التابع لعلي بابا اليوم، 18 سبتمبر 2026، نموذج Qwen3.8-Omni-Flash، وهو نموذج "أومني" أصلي يفهم النص والصورة والصوت والفيديو معاً ضمن نافذة سياق تصل إلى مليون توكن، ومتاح الآن على منصة Qianwen للواجهات البرمجية. الخبر الأهم لصناع المحتوى ليس الأرقام بحد ذاتها، بل التوجّه: الموديل مصمم لينفّذ مهام إنتاج كاملة — تحرير فيديو، صناعة فيديوهات موسيقية، تعليق على أفلام، تلخيص سمعي بصري — لا ليفهم المحتوى فقط.

الإعلان الرسمي جاء في مدونة Qwen بعنوان "Omni Senses. Agentic Delivery"، ويؤكد أن هدف الموديل هو نقل النماذج متعددة الوسائط من "فهم المحتوى" إلى "تخطيط المهام واستدعاء الأدوات وإنجاز العمل الإبداعي".

مخطط رسمي من مدونة Qwen يوضح تطبيقات Qwen3.8-Omni-Flash في بيئات الإنتاج
مخطط رسمي من إعلان Qwen: تطبيقات الموديل في بيئات الإنتاج الفعلية (المصدر: مدونة Qwen الرسمية)

ما الذي أُطلق بالضبط؟

Qwen3.8-Omni-Flash نموذج أومني أصلي (Native Omni) يستقبل أربع وسائط في وقت واحد: النص والصورة والصوت والفيديو، مع الحفاظ على أداء نصي مقارب لنموذج نصي بحجمه، حسب الإعلان. أبرز المواصفات المعلنة رسمياً:

  • نافذة سياق مليون توكن — تكفي لساعات من المواد السمعية البصرية في جلسة واحدة.
  • إدخال سمعي بصري أصلي حتى ساعة كاملة للاجتماعات متعددة المتحدثين، مع فصل للمتحدثين وتفريغ نصي ومتابعة مهام.
  • نسخة Realtime (Qwen3.8-Omni-Flash-Realtime) تستقبل البث الحي وترد أثناء استقباله، مع وعي مكاني بالصوت — وتصفها Qwen بأنها "أول نموذج أومني قادر على تحديد الأهداف بالصوت".
  • أدوات مفتوحة مرافقة: توسيع Qwen-MM-Plugins، وإصدار مفتوح المصدر لـ Qwen-Live Harness (بيئة تشغيل للتفاعل الحي) عبر npm.

بالمقارنة مع الجيل السابق Qwen3.5-Omni-Plus، تحسّن المتوسط عبر 29 تقييماً بأكثر من 25%، مع قفزات نوعية في مهام الوكلاء السمعيين البصريين: WildClawBench-MM بفارق 36.5 نقطة، وAgenticVBench بفارق 22.3 نقطة، و69.6 نقطة على UniClawBench.

أرقام الأداء والسعر التي تهم مستخدم الفيديو

لمن ينتج محتوى سمعياً بصرياً بشكل يومي، الرقمان الأهم في الإعلان يتعلقان بالتكلفة: سعر الساعة من الإدخال الصوتي انخفض بأكثر من 98%، وسعر الساعة من الإدخال السمعي البصري انخفض بأكثر من 93% مقارنة بالجيل السابق، وفق منهجية احتساب موثقة في الإعلان (أسعار النص باليوان الصيني لكل مليون توكن). هذا يعني أن تحليل فيديو مدته ساعة صار ضمن المتناول الاقتصادي للمبدع المنفرد، بعد أن كان مشروعاً مؤسسياً.

جدول رسمي من مدونة Qwen يقارن تسعير Qwen3.8-Omni-Flash ونتائج المعايير مع Gemini 3.8 Flash وغيره
الشكل الرسمي لمقارنة التسعير والمعايير كما نشرته Qwen (المصدر: مدونة Qwen الرسمية)

وفي الفهم الطويل، تغيّر جوهري: بدلاً من معالجة الفيديو من أوله لآخره، يبدأ "الفهم الوكيلي" (Agentic Understanding) من السؤال ويقرر بنفسه ما يشاهد وما يستمع إليه — على OmniVideoBench رفعت الدقة من 63.4 إلى 67.8 مع خفض استهلاك التوكنات لكل استعلام من 145,736 إلى 79,117 توكن، أي توفير يقارب 45.7%. أما الادعاء التنافسي فهو صريح: أداء سمعي بصري "قريب من Gemini 3.8 Flash"، وأداء صوتي إجمالي "يتجاوز Gemini 3.8 Flash" — وهي أرقام تقرّها Qwen عن نفسها، فتعامل معها كادعاء مصنّع لا كحكم محايد.

ماذا يعني هذا لك كصانع محتوى؟

الانتقال من "فهم" إلى "تنفيذ" هو جوهر القصة لجمهورنا. الإعلان يسمّي سير عمل كاملة صارت ممكنة بموجب واحد يرى ويسمع ويخطط:

  • تحرير الفيديو الوكيلي: وصف الحاجة بجملة واحدة لينفّذ الموديل التعرف على المتحدثين والترجمة الحوارية واستنساخ الأصوات والدبلجة وإعادة المزج الصوتي ومراجعة الجودة النهائية — سلسلة توطين كانت تتطلب التبديل بين عدة منصات.
  • فيديوهات موسيقية من فهم الأغنية: يخرج الموديل كلمات الأغنية سطراً بسطر مع طوابع زمنية لمحاذاة الغناء والترجمة والمشاهد، من التخطيط الإبداعي حتى المراجعة النهائية.
  • تعليق وإنتاج سينمائي وتلخيص سمعي بصري لمحتوى طويل، وتقارير بحث معمقة مبنية على الفيديو.
  • تفريغ وصفت تحت سيطرتك: ميزة "الوصف القابل للتوجيه" تتيح تحديد الموضوع والمدى الزمني ومستوى التفصيل وشكل المخرجات — وصف للسرد، أو لتحديد مقاطع محددة، أو لتحليل الإضاءة والكادرات والصوت.
  • الاجتماعات والبودكاست: ساعة إدخال سمعي بصري أصلي مع تمييز المتحدثين — مفيد لتفريغ الحلقات واستخراج الأفكار ومتابعة المهام.

وللعربية تحديداً: قائمة المعايير الرسمية تشمل FLEURS-60 للتعرف على الكلام والترجمة الصوتية، وهي مجموعة تغطي 60 لغة من بينها العربية — أي أن الفريق قيّم الموديل على الكلام العربي ضمن اختباراته. الإعلان لا يقدّم وعداً تسويقياً محدداً بجودة عربية معينة، فجرّب بنفسك قبل الاعتماد. وإن كنت تريد كتابة النص العربي وتحسينه بعد التفريغ، أدوات مثل منصة ArWriter تكمل السلسلة بواجهة عربية كاملة.

كيف تجرّبه اليوم؟

  1. الواجهة البرمجية: الموديل متاح على منصة Qianwen (البوابة: qwen.ai) مع نقطتي وصول: Qwen3.8-Omni-Flash وQwen3.8-Omni-Flash-Realtime.
  2. تطبيقات Qwen Studio: متاحة للويب وiOS وAndroid وmacOS وWindows إن أردت تجربة الاستخدام قبل البناء.
  3. للمطورين: Qwen-Live Harness مفتوح المصدر — تثبيته بأمر واحد npm install -g qwen-live-harness — وتوسيع Qwen-MM-Plugins يجلب الإدراك عند الطلب وتنفيذ سير العمل للمحتوى الطويل.

ولسياق أوسع حول عائلة Qwen هذا الموسم، راجع تغطيتنا لنموذج Qwen3.8-Flash الكتابي بسياق المليون توكن ولإطلاق Qwen 3.8-Max الرسمي في أغسطس.

مقارنة سريعة

الجانبQwen3.8-Omni-FlashQwen3.5-Omni-Plus (السابق)Gemini 3.8 Flash
الوسائط المدخلةنص + صورة + صوت + فيديو (أصلي)أومني متعدد الوسائطمتعدد الوسائط
نافذة السياقمليون توكنأصغركبيرة
سعر ساعة الصوت المدخلةأقل بنسبة >98% من السابقمرتفعة نسبياًقارَن رسمياً في إعلان Qwen
مهام وكيلية سمعية بصرية+36.5 نقطة WildClawBench-MMخط الأساس"قريب" وفق ادعاء Qwen
التوفرAPI منصة Qianwen + RealtimeAPIGoogle

حدود وعيوب يجب أن تعرفها

  • لا أوزان مفتوحة (حتى الآن): على عكس إخوته Qwen3.8-27B وFlash-Next المتاحين على Hugging Face، لا توجد نسخة مفتوحة الأوزان من Omni-Flash لحظة الكتابة — الاستخدام عبر منصة علي بابا السحابية.
  • أرقام المصنّع: كل المقارنات أعلاه (بما فيها تجاوز Gemini صوتياً) أرقام أعلنها فريق Qwen نفسه ولم تُراجع مستقلاً.
  • تسعير باليوان ومنهجية احتساب خاصة (720p بمعدل إطار واحد في الثانية للفيديو) — احسب كلفتك الفعلية قبل الالتزام بسير عمل كامل.
  • العربية قيست لكنها ليست ميزة معلنة: لا ادعاءات رسمية عن دعم لهجات أو جودة ترجمة عربية محددة.
  • الوكالة تنفّذ وتخطئ: سير عمل الدبلجة والاستنساخ الصوتي يحتاج مراجعة بشرية، خاصة لحقوق الأصوات المستنسخة.

بالمناسبة: إن كان سير عملك يمرّ بمرحلة كتابة وتحسين النصوص العربية بعد التفريغ أو الترجمة، يمكن لـArWriter أن يتكامل مع ذلك بسهولة — كتابة وتحسين ومراجعة بالعربية من مكان واحد وبأسعار تناسب السوق العربي.

لماذا يهم هذا الخبر الآن؟

هذا الإطلاق هو ثالث تحديث كبير لعائلة Qwen خلال أقل من شهرين بعد Qwen3.8-Flash وFlash-Next و3.8-Max، وهو يؤكد اتجاهاً أوضح في سوق نماذج المحتوى خلال 2026: المنافسة انتقلت من "من يجيب أدق" إلى "من ينفّذ أرخص". عندما تنهار كلفة ساعة الصوت المدخلة بنسبة تفوق 98% في جيل واحد، تتحول مهام كانت خدمات مؤسسية — أرشفة البودكاست، تلخيص الورش، توطين المسلسلات القصيرة — إلى مهام يومية لصانع محتوى منفرد بميزانية محدودة.

كذلك تفتح نسخة Realtime باباً عملياً للتعليم والتدريب: الإعلان يصف قدرة الموديل على فهم النطق غير القياسي المتأثر باللهجات ومحاذاته بالكلمات الصحيحة مع توليد نطق قياسي توضيحي فوري — سمة تهم أي عربي يدرّب نفسه أو غيره على لغة أو مهارة عرض. المراقب لتحركات المزودين الكبار سيلاحظ أن الجميع يتجه نحو "الوكيل الذي يرى ويسمع"؛ ميزة Qwen هنا أنها قرنت الخطاب بالأرقام وبأدوات مفتوحة تسمح ببناء سير عمل حقيقي فوقها اليوم.

الأسئلة المتكررة

ما هو Qwen3.8-Omni-Flash؟

نموذج ذكاء اصطناعي أومني أطلقته علي بابا في 18 سبتمبر 2026، يفهم النص والصورة والصوت والفيديو معاً بنافذة سياق مليون توكن، ويصمم لتنفيذ مهام إنتاج محتوى كاملة عبر الواجهات البرمجية لا الفهم فقط.

هل Qwen3.8-Omni-Flash مجاني؟

لا، متاح عبر منصة Qianwen بتسعير استهلاكي أعلنت Qwen أنه يخفض كلفة ساعة الإدخال الصوتي بأكثر من 98% مقارنة بالجيل السابق، مع أسعار نصوص باليوان لكل مليون توكن موثقة في إعلانها.

هل يدعم Qwen3.8-Omni-Flash اللغة العربية؟

قُيّم الموديل رسمياً على مجموعة FLEURS-60 للتعرف على الكلام والترجمة الصوتية وتشمل العربية، لكن الإعلان لا يقدّم وعداً محدداً بمستوى جودة عربية — التجربة العملية هي الفيصل.

كيف يختلف عن Qwen3.8-Flash العادي؟

Flash نموذج نصي بصري للكتابة والقراءة، بينما Omni-Flash أومني أصلي يضيف الصوت والفيديو الحي والتنفيذ الوكيلي لسير عمل مثل الدبلجة والتحرير، ونسخة Realtime للتفاعل الفوري.

هل يمكن تشغيله محلياً؟

لا توجد أوزان مفتوحة للعموم من Omni-Flash حتى لحظة الكتابة؛ ما هو مفتوح هو أدوات مرافقة مثل Qwen-Live Harness وQwen-MM-Plugins، بينما الموديل نفسه يُستخدم سحابياً.

المصادر

إن كنت تبني سير عمل محتوى عربياً كاملاً — كتابة وتحسيناً وتحريضاً ونشراً — فجرّب ArWriter الذي يجمع هذه الأدوات تحت سقف واحد بواجهة عربية، وابدأ من قائمة الأدوات.