Tavus Griffin: أول موديل «تفاعل بشري» يجتاز اختبار تورينغ المرئي

أعلنت Tavus موديل Griffin في 1 أكتوبر 2026: 48% من المشاركين ظنوه إنساناً في مكالمة فيديو حية. كيف يعمل، وما صدق أرقامه، وما علاقته بصانع المحتوى — ومتى يمكن تجربته فعلاً.

Tavus Griffin: أول موديل «تفاعل بشري» يجتاز اختبار تورينغ المرئي
جدول المحتويات

في الأول من أكتوبر 2026 أعلنت شركة Tavus الأمريكية عن Griffin، أول موديل من فئة أسمتها «موديلات التفاعل البشري» (Human Interaction Model). الادعاء المركزي مثير بكل المقاييس: في دراسة مباشرة، اعتقد 48% من المشاركين الذين تحدثوا مع Griffin عبر مكالمة فيديو أنهم كانوا يتحدثون مع إنسان حقيقي، بينما لم يتجاوز أفضل أداء سابق 2% في الاختبار نفسه. وحتى لا يُفهم الإعلان كمبالغة تسويقية، ننقل التفاصيل كما وردت في منشور الشركة الرسمي الموقّع من مؤسسها التنفيذي — مع تحفظات صريحة سنذكرها بحقها.

القصة تستحق قراءة صانع المحتوى العربي لسببين: أولاً، لأنها ترسم ملامح المرحلة التالية بعد أدوات الفيديو الحالية — من أفاتار يتكلم بعد كتابة السكربت إلى أفاتار يرد عليك في مكالمة حية. وثانياً، لأن Tavus نفسها أجّلت الإصدار الأقوى من الموديل «حتى معالجة مخاوف السلامة» — وهي إشارة لا تخطئها العين إلى حجم الأسئلة الأخلاقية المفتوحة حول الفيديو الواقعي المزيف.

الصورة الرسمية لإعلان Tavus Griffin
الصورة الرسمية لصفحة إعلان Griffin على موقع Tavus (المصدر: Tavus)

ما هو Griffin؟ ومالمقصود بـ«موديل التفاعل البشري»؟

حسب منشور الإعلان الرسمي الموقّع من حسان رضا، المؤسس والرئيس التنفيذي، وإيونيس باتراس، رئيس البحث في Tavus، فإن Griffin هو موديل «فيديو إلى فيديو» يعمل بالاتجاهين في الوقت الحقيقي: يستقبل صورتك وصوتك أثناء التحدث، ويفهم التعابير والوقفاتات وليس الكلمات فقط، ويولّد رده — صوتاً ووجهاً وحركة — في نفس اللحظة. بمعنى آخر، هو ليس مساعداً صوتياً بوجه مرسوم، بل نظام كامل يبني كل بكسل في كل إطار من صورة مرجعية واحدة، ويتصرف كمشارك حقيقي في محادثة: يضحك، يغيّر نبرته، يقاطع، ويُقاطَع دون أن يفقد سياق الحديث.

هذه الفئة الجديدة — «موديلات التفاعل البشري» — هي محاولة Tavus تسمية شيء مختلف عن مساعدي الدردشة الحاليين: موديل لا تلتقيه في منتصف الطريق بل يأتي إليك، يتعلم لغة البشر في التواصل وجهاً لوجه: النظرة، والتعبير، والإيماءة، والتوقيت.

نتائج «اختبار تورينغ المرئي»: الأرقام كما نشرتها الشركة

الأرقام المعلنة في المنشور الرسمي تنقسم إلى شقين:

  • اختبار تورينغ المرئي الحي: 48% من المشاركين الذين جرت محادثاتهم مع Griffin ظنوا أنهم تحدثوا مع إنسان حقيقي. للمقارنة، فإن الأنظمة السابقة — بما فيها منصة Tavus ذاتها المبنية على حزمة Phoenix 4.5 وSparrow-2 وRaven-1 — لم تتجاوز نسبة نجاح 2% في الاختبار نفسه.
  • اختبار Nvidia المستقل: في تقييم «مدى إنسانية» الذكاء الاصطناعي في محادثة صوتية ومرئية مباشرة، سجّل Griffin 3.83 نقطة من 5، مقابل 3.92 للبشر الحقيقيين، و2.80 لأفضل موديل ذكاء اصطناعي سابق. وتقول الشركة إنه متقدم بنسبة 37% على أفضل منافس في «التفاعل في اللحظة».

بترجمة هذه الأرقام إلى لغة عملية: نصف الجمهور تقريباً لم يستطع التمييز في مكالمة قصيرة، والفجوة مع البشر الحقيقيين تقلصت إلى 0.09 نقطة في مقياس مستقل. هذه أرقام الشركة طبعاً، لكن اختبار Nvidia المذكور جهة خارجية، والاتجاه العام — أن الفيديو الحي الواقعي تجاوز عتبة «يُشتبه به» — أصبح موثقاً لأول مرة بهذا الوضوح.

كيف يعمل Griffin تقنياً؟ الشرح المبسط

المنشور الرسمي يشرح البنية في تفصيل يحترم عقل القارئ، ويمكن تلخيصها في ثلاث طبقات تعمل معاً في نفس اللحظة:

  • محرك النمذجة التحادثية المستمرة: بدل انتظار نهاية جولتك في الكلام ثم الرد (كما تفعل الأنظمة المتسلسلة: تعرف كلام، ثم موديل لغة، ثم تحويل نص لكلام، ثم أفاتار)، يقيّم Griffin حالة المحادثة كل أجزاء من الثانية. يقرر في كل «جولة مصغرة»: أن يصمت، أن يومئ، أن يقول «ممم» تشجيعياً، أو أن يقاطع — بناء على ما يسمعه ويراه، لا على توقف الصوت فقط.
  • محرك التوليد السمعي البصري: يحول قرارات المحرك الأول إلى صوت وفيديو متدفقين في نفس الوقت، بحيث يظهر قرار اتخذ في منتصف الجملة — وقفة، التفاتة، ابتسامة، مقاطعة — على الصوت والوجه خلال نفس الجولة المصغرة، لا بعد تسليم بين أنظمة منفصلة.
  • برمجية الصوت Tavec: مرمّز صوتي من تطوير Tavus يحول الصوت بدقة 48 كيلوهرتز إلى تمثيل رقمي مضغوط — 40 قيمة لكل جزء من مئة من الثانية، بدون قوائم رموز — مما يسمح بتوليد الصوت أسرع من زمنه الحقيقي وبثّه بحزم صغيرة مدتها 10 أجزاء من الألف من الثانية. النتيجة: استنساخ صوت المتحدث من نحو 10 ثوانٍ فقط من التسجيل.

وفي جانب الفيديو، تخلت Tavus عن «المرجعيات ثلاثية الأبعاد» التي كانت تقيد حركات موديلاتها السابقة — فكانت الإيماءات الواسعة والخلفيات المتحركة خارج المتناول — لصالح توليد انتشاري (Diffusion) يولّد المشهد كاملاً: الوجه واليدين والكرسي المتحرك والظلال والخلفية، كلها من صورة مرجعية واحدة.

صفحة إعلان Griffin الرسمية على موقع Tavus
صفحة الإعلان الرسمية لموديل Griffin على موقع Tavus، 1 أكتوبر 2026 (لقطة من الصفحة الرسمية)

القدرات الخمس كما تعرضها الشركة

يستعرض المنشور خمس قدرات موثقة بمقاطع تجريبية من محادثات فعلية أجرها باحثو Tavus مع مستخدمين جدد:

  • نمذجة السلوك والمشاعر: يضحك، يغيّر نبرته، ويتفاعل مع ما يقوله الطرف الآخر ويفعله بحسب سياق الحديث.
  • توليد المشهد الكامل: كل بكسل في كل إطار يُولّد في الوقت الحقيقي — بما فيها حركة الكرسي الذي يجلس عليه الشخص، والظلال التي يلقيها، والخلفية خلفه.
  • المحادثة الكاملة الاتجاهين: يقاطع ويُقاطَع ويؤكد استماعه دون أن يفقد موضعه في الحديث.
  • الإدراك البصري: يفهم ما يظهر في كاميرتك — البيئة حولك، شيئاً تريه له، شاشتك المشتركة — ويتفاعل معه، وليس الصوت وحده.
  • الفهم الزمني: يدرك كم استغرقت الصمتة وماذا تعني صمتة طويلة، ويعرف متى يتكلم من جديد من تلقاء نفسه.

من أين جاءت Tavus؟ سياق الشركة قبل Griffin

لفهم أهمية القفزة، يحتاج المرء سياقاً قصيراً. تأسست Tavus في سان فرانسيسكو عام 2020، وجمعت نحو 64 مليون دولار، وبدأت حياتها في عمل واضح المعالم: فيديوهات تسويقية شخصية بالذكاء الاصطناعي — رسائل فيديو يولّدها بائس لكل عميل باسمه وشركته، وهي فئة أثبتت فعاليتها في المبيعات. ثم توسعت تدريجياً إلى «الشخصيات الرقمية الحية» عبر حزمة موديلاتها السابقة: Phoenix لتحريك الوجه، وSparrow لإدارة المحادثة، وRaven للإدراك — وهي الحزمة التي تقول الشركة نفسها إنها لم تتجاوز 2% في اختبار تورينغ المرئي.

أي أن Griffin ليس قفزة شركة مبتدئة تبحث عن ضجة، بل الجيل التالي من شركة تعرف هذا السوق منذ ستة أعوام، واختارت أن تعلن فئة جديدة — «موديلات التفاعل البشري» — لأنها تقدّر أن ما وصلت إليه لا يندرج تحت أي تصنيف قائم. وهذا سياق مهم عند تقييم الادعاءات: شركة راسخة تربط سمعتها البحثية برقم قابل للفحص، وتُخضع معمارتها لاختبار جهة خارجية مثل Nvidia، أفضل بكثير من إعلان غامض من علامة مجهولة.

هل يمكنك تجربته الآن؟ الحقيقة كاملة

هنا يجب التمييز بين الإعلان والتوفر. المتاح فعلياً هو Griffin-Lite، نسخة معاينة بحثية مفتوحة لفئة مختارة من المختبرين الأوائل فقط — وليست منتجاً عاماً يمكن الاشتراك فيه اليوم. والنسخة الأقوى، التي تصفها الشركة بأنها «أوسع إصداراً»، مؤجلة صراحة «حتى معالجة مخاوف السلامة». أي أن أقرب تفسير واقعي: الشركة أثبتت الجدوى تقنياً، وتتحرك الآن بحذر قبل وضع القدرة في يد الجميع.

هذا الحذر ليس تفصيلاً شكلياً. موديل يجتاز اختبار تورينغ المرئي بنسبة 48% هو بالتعريف أداة احتيال محتملة من الطبقة الأولى: مكالمات فيديو مزيفة بأشخاص «حقيقيين» يطلبون تحويل أموال أو معلومات. صناعة الفيديو للمحتوى التسويقي — عمل Tavus الأساسي منذ تأسيسها عام 2020 وجمعها نحو 64 مليون دولار — تختلف جذرياً عن إسقاط رقمي يجلس أمامك في مكالمة يصعب تمييزها عن ابنك أو مديرك.

ماذا يعني هذا لك كصانع محتوى؟

على المدى القريب: لا شيء مباشراً — فالمنتج غير متاح عاماً. لكن على مدى أشهر قليلة، الاتجاه الذي يفتحه Griffin يعيد ترتيب ثلاث أفكار في ذهن صانع المحتوى:

  • الأفاتار ينتقل من «التسجيل» إلى «البث»: أدوات اليوم تولد فيديو أفاتار من سكربت مكتوب — مثل أفاتار Gemini Live الذي غطينا إطلاقه سابقاً. الجيل القادم يجعل الأفاتار متاحاً في بث حي يتفاعل مع الجمهور — بث تسويقي، جلسة أسئلة وأجوبة، دعم عملاء بوجه يتحدث لغة كل عميل.
  • التعليم والتدريب هم الاستخدام الأقرب: الشركة نفسها تضع في مقدمة استخداماتها التعليم الخصوصي و«تدريب المحادثات الصعبة» والدعم التقني عبر الكاميرا — تطبيقات يفهمها الجمهور العربي بسرعة، من تعليم اللغات إلى التدريب على مقابلات العمل.
  • من يملك «وجهك» يملك محتواك: إذا أصبح استنساخ صوتك ممكناً من 10 ثوانٍ وتشغيل وجهك من صورة واحدة، فإن قيمة أصولك الرقمية — صوتك وصورتك — ترتفع، وترتفع معها الحاجة لحمايتها وترخيصها بوعي.

مقارنة سريعة: Griffin مقابل أدواتك الحالية

المقارنة العادلة ليست بين Griffin وأدوات توليد الفيديو الحالية — فهذه تولد مقاطع مسجلة وتلك تجري محادثات حية. القسمة الجديدة للعمل بين ثلاث فئات: موديلات توليد فيديو من نص (للمحتوى المسجل)، أجهزة صوتية ذكية (للتفريغ والتسجيل)، وأفاتار حي (للتفاعل الفوري). من يبني قناة يوتيوب تعتمد على شخصية رقمية سيجد نفسه قريباً أمام سؤال: أنتج محتوى مسجلاً بتكلفة أقل، أم افتح جلسات حية بشخصيتي الرقمية؟ Griffin يجعل الخيار الثاني قابلاً للتصور لأول مرة. ولمن يعمل اليوم على المحتوى الصوتي والنصي بالعربية، هناك أدوات ناضجة فعللاً مثل استوديو الصوت في Gemini أو مساعدات الوكلاء الدائمة التي غطيناها في تغطية dots — أما Griffin فمشروع يستحق المتابعة لا الشراء.

ما الذي تراقبه في الأشهر القادمة؟ أربع علامات فاصلة

إن أردت متابعة هذه القصة بذكاء دون الانجراف وراء الضجيج، فهناك أربع علامات ستحدد إن كان Griffin بداية موجة أو مجرد عرض تقني منعزل:

  • فتح المعاينة للجمهور: انتقال Griffin-Lite من المختبرين المختارين إلى قائمة انتظار عامة هو أول مؤشر جدية؛ عندها فقط ستظهر اختبارات مستقلة حقيقية بأعداد كبيرة ولغات متعددة.
  • إطار السلامة المعلن: ما هي الضوابط التي سترافق الإصدار الأقوى — وسم المحتوى المولّد، وتوثيق الهوية، وحدود الاستنساخ — سيحدد إن كانت الصناعة ستمضي بمسؤولية أم ستعيد فيلم «التزييف العميق» من أوله.
  • ردود الفعل من جوجل وOpenAI: جوجل لديها بالفعل أفاتار حي في Gemini Live، وOpenAI لديها أنظمة صوت متقدمة؛ إن أعلنت أي منهما ترقية إلى محادثة فيديو حية كاملة، فالتحول من «عرض مذهل» إلى «فئة سوقية» يكون قد بدأ فعلاً.
  • التكلفة عند التشغيل الفعلي: توليد كل إطار في الوقت الحقيقي حسابياً باهظ؛ الأسعار عند الإصدار العام ستكشف الجمهور الحقيقي — شركات الدعم والتعليم أولاً، على الأرجح، قبل الأفراد.

حدود وعيوب يجب أن تُقال بصوت عالٍ

قبل اتخاذ أي قرار — أو قبل تصديق أي رقم في هذه القصة — هذه أبرز الحدود التي يجب أن تبقى في الذهن أثناء المتابعة:

  • معاينة بحثية مغلقة: لا يمكنك تجربة Griffin-Lite اليوم إلا إذا كنت من المختبرين المختارين؛ لا سعر عام ولا موعد إصدار عام معلن.
  • أرقام الشركة أولاً: نسبة 48% من دراسة أعدتها الشركة نفسها؛ اختبار Nvidia مستقل لكنه واحد، والمنهجية الكاملة تحتاج مراجعة مجتمع البحث.
  • سؤال السلامة مؤجل لا محلول: الشركة نفسها تربط الإصدار الأقوى بمعالجة مخاوف السلامة — أي أن أخطر قدرات الموديل موجودة تقنياً وتنتظر ضوابط لم تكتمل.
  • لا دعم عربي معلن: المنشور كله بالإنجليزية عن محادثات إنجليزية؛ أداء Griffin بالعربية غير موثق إطلاقاً حتى الآن.
  • تكلفة تشغيل مجهولة: توليد كل بكسل في كل إطار في الوقت الحقيقي مكمن حسابياً بامتياز؛ التسعير المستقبلي سيحدد من يستخدمه فعلاً.

أسئلة شائعة

ما هو Tavus Griffin؟

أول «موديل تفاعل بشري» من شركة Tavus الأمريكية، أُعلن في 1 أكتوبر 2026: نظام فيديو إلى فيديو يجري محادثات مرئية حية في الوقت الحقيقي، يفهم التعابير والوقفاتات ويولّد الصوت والفيديو معاً لحظة بلحظة.

هل حقق Griffin اختبار تورينغ فعلاً؟

في دراسة الشركة المباشرة، اعتقد 48% من المشاركين أنهم تحدثوا مع إنسان — وهي نسبة تقول عنها Tavus إنها أول اجتياز للاختبار المرئي الحي، مقابل 2% كأفضل نتيجة سابقة. النتيجة واعدة وموثقة من الشركة، لكن مراجعة بحثية مستقلة أوسع لم تُنشر بعد.

هل يمكنني استخدام Griffin الآن؟

لا. النسخة المتاحة هي Griffin-Lite، معاينة بحثية لعدد محدود من المختبرين المختارين، والنسخة الأقوى مؤجلة حتى معالجة مخاوف السلامة، دون سعر أو موعد عام معلن.

ما علاقة Griffin بأدوات الفيديو بالذكاء الاصطناع مثل Sora أو Veo؟

تلك الموديلات تولد مقاطع فيديو مسجلة من وصف نصي، بينما Griffin يجري محادثة حية تفاعلية بالفيديو في الوقت الحقيقي — فئتان مختلفتان في الاستخدام: الأولى للمحتوى الإنتاجي المسجل والثانية للتفاعل المباشر.

هل يدعم Griffin اللغة العربية؟

لا يوجد أي إعلان أو توثيق لأداء Griffin بالعربية حتى الآن؛ كل العروض والاختبارات المعلنة كانت بالإنجليزية، والانتظار حتى الإصدار العام هو طريق معرفة ذلك.

لماذا يستخدم Griffin توليد الفيديو بدل تحريك فيديو حقيقي؟

لأن التحريك التقليدي يقيد الموديل بحركات جاهزة مسبقاً، بينما التوليد الكامل لكل إطار — من الوجه واليدين حتى حركة الكرسي والظلال والخلفية — يمنحه حرية التعبير اللحظي: أن يغير تعبيره في منتصف جملتك أو يلتفت نحو شيء تريه له. وهي نفسها الميزة التي تجعل الحساب الحاسوبي مرتفعاً والفجوة التقنية كبيرة على المنافسين.

ما مخاطر هذا النوع من الموديلات؟

الأخطر هو انتحال الهوية بمكالمات فيديو واقعية يصعب تمييزها — احتيال مالي، انتحال شخصيات عامة، وتزييف عميق بأثر تفاعلي حي. الشركة نفسها أجّلت إصدار النسخة الأقوى لأسباب سلامة، والتنظيمات القادمة ستتصدى لهذه الفئة حتماً.

ما الفرق بين Griffin-Lite والنسخة الأقوى المؤجلة؟

Griffin-Lite هي نسخة المعاينة البحثية المتاحة لعدد محدود من المختبرين المختارين فقط، بينما النسخة الأقوى — ذات القدرات الأوسع — أجّلت الشركة إصدارها صراحة حتى معالجة مخاوف السلامة، دون سعر أو موعد معلن حتى الآن. عملياً: لا تتوقع إصداراً عاماً قريباً، وراقب إعلان إطار السلامة أولاً لأنه المؤشر الأهم.

الخلاصة: Griffin ليس منتجاً تشتريه اليوم، بل إشارة على اتجاه السوق غداً. الفجوة بين «فيديو رقمي مقنع» و«مكالمة رقمية لا تُميَّز» تقلصت فجأة من فارق هائل إلى 0.09 نقطة في مقياس مستقل. لصانع المحتوى، الرسالة العملية: راقب هذا الخط الزمني عن قرب — من يفهم مبكراً كيف يوظف الأفاتار الحي في التعليم والدعم والترفيه سيملك مساحة كاملة قبل ازدحامها. وحتى يصل ذلك الجيل، ابقِ في المقدمة بأدوات اليوم: ARWriter يكتب ويجدول محتواك بالعربية والإنجليزية من مكان واحد.