فلتر LM Arena: أفضل موديل ذكاء اصطناعي للعربية حسب تصويت الملايين — أغسطس 2026
آخر تحديث: أغسطس 2026
أي موديل ذكاء اصطناعي يفهم العربية فعلاً؟ قبل أن تفتح اللوحة، هذا الجواب: خط Claude (Opus 5 ثم Opus 4.7) يتصدر الفصحى والبلاغة، وخط Gemini يتقدم في اللهجات الخليجية والمصرية، وخط GPT يوازن بين الاثنين بسرعة أعلى. هذه ليست آراء تسويقية بل نتائج قرأناها من فلتر LM Arena بعد أكثر من 6 ملايين صوت بشري عبر 370+ نموذجاً — أكبر قاعدة تقييم بشري مفتوحة في العالم حتى أغسطس 2026.
لم يهدأ السوق منذ آخر تحديث لهذا الدليل: نموذج يتصدّر ثم يُوقف ثم يعود، وعائلات كاملة تُطلق دفعة واحدة. في هذا الزخم يبقى فلتر LM Arena — واسمه الرسمي الآن Arena على arena.ai منذ 28 يناير 2026 بعد جولة تمويل تقييمها 1.7 مليار دولار — الأداة الأكثر شفافية للمقارنة بعيداً عن خطابات التسويق. لوحة الترتيب عصفت بها ثلاث موجات: ملحمة Claude Fable 5، فعنقود Opus 4.8، فموجة أغسطس: Opus 5 وGPT-5.6 وGemini 3.7 وGrok 4.6 وDeepSeek V4 وQwen 3.8-Max. سنشرح كيف تقرأ هذه التقلبات، وكيف تستخدم الفلاتر الثمانية بينها وضع Arena+ الجديد، وكم تكلفك المقارنة لكل 100 مقال.
باختصار: LM Arena أصبحت الآن Arena على arena.ai، وتصنّف النماذج بدرجة Elo محسوبة من تصويت عمياء تجاوز 6 ملايين صوت. في أغسطس 2026 تتقدم الموجة الجديدة: Claude Opus 5 وGPT-5.6 Sol وGemini 3.7 Flash وGrok 4.6 وDeepSeek V4 وQwen 3.8-Max. استخدم فلاتر اللغة العربية وStyle Control ووضع Arena+ للاختيار حسب مهمتك وميزانيتك لا حسب الإعلانات.
وللمستخدم الذي يريد الصورة الرقمية الأوسع حول ميزان القوى بين النماذج، دليلنا عن تطبيقات الذكاء الاصطناعي للجوال يكمل هذه الصورة من زاوية التطبيقات التي تضم هذه النماذج داخلها.
ما هو LM Arena؟ ومن LMSYS إلى Arena على arena.ai
LM Arena منصة تقييم مفتوحة لنماذج اللغة الكبيرة أطلقها باحثون من جامعة UC Berkeley عام 2023 تحت اسم Chatbot Arena ضمن مشروع LMSYS الأكاديمي. بلغت المنصة 3.5 مليون صوت وأكثر من 400 نموذج مسجّل بحلول سبتمبر 2025 وفق سجل LMSYS التاريخي، ثم استقلت وأعيدت هويتها إلى lmarena.ai في 2024، وحصلت في مايو 2025 على جولتها التمويلية الأولى بقيمة 100 مليون دولار بتقييم 600 مليون دولار.
ثم جاء التحوّل الأكبر: في 28 يناير 2026 أعادت المنصة تسمية نفسها من LM Arena إلى Arena ببساطة، ونقلت وجهتها الرئيسية إلى arena.ai — والرابط القديم lmarena.ai ما زال يعمل ويحوّل إلى اللوحة نفسها. وتجاوزت المنصة ~6 ملايين صوت مع تقييم قارب 1.7 مليار دولار بعد جولة Series A في أعقاب يناير 2026.
لم تتغير طريقة القياس مع تغيّر الاسم: تكتب سؤالاً، فتجيب نسختان من نموذجين مجهولين جنباً إلى جنب، فتصوّت للأفضل، ثم يُكشف الاسم وتُحتسب النتيجة. لماذا يعنيك هذا كمستخدم عربي؟ لأن الأرقام التي تراها في إعلانات الشركات مختبرية ومحسوبة مسبقاً، بينما ترتيب Arena يُبنى من ملايين المقارنات البشرية الحقيقية. ومع الفلاتر الصحيحة يتحول من لوحة عامة إلى أداة قرار لمهمتك أنت.
كيف تقرأ درجة Arena Elo؟
النظام مستعار من تصنيف الشطرنج العالمي: كل نموذج يبدأ بـ1000 نقطة، ويكتسب أو يخسر نقاطاً مع كل فوز أو خسارة في المقارنات.
- فارق 100 نقطة = النموذج الأعلى يفوز بنسبة 64% من المقارنات.
- فارق 200 نقطة = الأعلى يفوز بنسبة 76%.
- فارق أقل من 20 نقطة = تكافؤ عملي ضمن هامش الخطأ.
الدرس الأهم في 2026: بعد أن كان الفارق بين المركز الأول والعاشر 95 نقطة في يناير 2025، انكمش إلى نحو 55 نقطة في أغسطس 2026. عشرة نماذج صارت "ممتازة" بالمعنى العملي، والاختيار صار على الملاءمة لا على العلامة التجارية.
قصة الترتيب في 2026: ملحمة Fable 5 ثم موجة أغسطس
لا تقرأ اللوحة كلحظة مجمّدة — هذه أحداث 2026 كما جرت:
| الفترة | ما حدث في اللوحة | الدرس لك |
|---|---|---|
| مطلع 2026 | تصدّر Claude Fable 5 بـ~1525 نقطة Elo | ذروة قياسية افتتحت العام |
| بعدها بأسابيع | أُوقف Fable 5 فجأة وسط ضبابية حول نتائجه | لا تعتبر أي تصدّر نهائياً — اللوحة تراجع وتصحح |
| الربع الثاني | توازن عنقود Opus 4.8 مع Opus 4.7 Thinking عند ~1505 وGemini 3.1.5 Pro عند ~1498 | سبعة نماذج داخل ~26 نقطة فقط |
| يوليو 2026 | تحديثات DeepSeek وKimi قلّصت فجوة المفتوح المصدر إلى ≤30 نقطة | "المجاني تقريباً" صار منافساً حقيقياً |
| أغسطس 2026 | موجة غير مسبوقة: Opus 5 وSonnet 5 وعودة Fable 5، GPT-5.6 بعائلتها، Gemini 3.7 Flash، Grok 4.6، DeepSeek V4 GA، Qwen 3.8-Max | اللوحة تُرسم من جديد أسبوعياً الآن |
تفاصيل عائلة GPT-5.6 الثلاثية (Sol وTerra وLuna) غطّيناها في ملفنا عن إطلاق GPT-5.6 Sol بسرعة Sol Ultrafast البالغة 14× عبر Cerebras، وقصة تسعير الجيل الجديد في تغطيتنا لـGemini 3.7 Flash لصنّاع المحتوى.
لوحة الترتيب — لقطة 25 أغسطس 2026
الأرقام أدناه تقريبية "~" لأن موجة أغسطس ما زالت تجمع أصواتاً وتتغير أسبوعياً. راجع اللوحة الحية على arena.ai/leaderboard قبل أي قرار شراء:
| النموذج | Arena Elo | الشركة | وضعه في أغسطس 2026 |
|---|---|---|---|
| Claude Fable 5 | ~1525 ذروته قبل الإيقاف | Anthropic | عاد بإعادة إطلاق عالمية |
| Claude Opus 5 | أرقام أولية | Anthropic | رأس موجة أغسطس |
| Claude Opus 4.8 | أرقام أولية | Anthropic | قاد عنقود مايو-يوليو للبرمجة والعربية |
| GPT-5.6 Sol | أرقام أولية | OpenAI | مع Sol Ultrafast بسرعة 14× عبر Cerebras |
| Gemini 3.7 Flash | أرقام أولية | بنصف سعر الجيل السابق | |
| Claude Opus 4.7 Thinking | ~1505 | Anthropic | مرجع موثق: 87.6% SWE-bench Verified |
| Gemini 3.1.5 Pro | ~1498 | Google DeepMind | سياق 2M توكن، الأقوى في الوسائط |
| GPT-5.5 | ~1492 | OpenAI | سياق 1M توكن، 82.7% Terminal-Bench 2.0 |
| DeepSeek V4 GA | أرقام أولية | DeepSeek | الأقوى مفتوح المصدر (سابقه عند ~1471) |
| Claude Sonnet 5 / 4.6 | ~1466 | Anthropic | الأكفأ سعراً وأداءً |
| Qwen 3.8-Max | أرقام أولية | Alibaba | دخل اللوحة في 2 أغسطس |
ملاحظتان عمليتان: "أرقام أولية" تعني أن النموذج جديد ودرجته لم تستقر بعد — تتحرك عشرات النقاط خلال الأسابيع الأولى. وثانياً، إن رأيت رقم صدارة يختلف بين مصدر وآخر (1503 مقابل 1505 لنموذج واحد مثلاً) فالسبب أن اللوحة تحدّث نفسها باستمرار، وأرقامنا هنا لقطة تقريبية من 25 أغسطس 2026.
إحصائيات 2026: أرقام تعرفها قبل أن تفتح اللوحة
هذه أرقام موثقة بمصادرها، وكلها تتكرر في تغطيات 2026 للمنصة:
- 28 يناير 2026: التاريخ الرسمي لإعادة تسمية LM Arena إلى Arena ونقل النطاق إلى arena.ai.
- ~6 ملايون صوت وتقييم 1.7 مليار دولار: حجم التصويت التراكمي وتقييم المنصة بعد جولة Series A التي تلت يناير 2026.
- 3.5 مليون صوت و400+ نموذج بحلول سبتمبر 2025: محطة موثقة في مسار المنصة قبل عام من كتابة هذه السطور.
- 55 نقطة Elo فقط تفصل المركز الأول عن العاشر في أغسطس 2026، مقابل 95 نقطة في يناير 2025 (قياس فريقنا من اللوحة).
الخلاصة من الأرقام: قاعدة التصويت تتضاعف تقريباً كل سنة، والمنصة تجذب رأس مال بحجم شركة "Unicorn" — وهذا يعني أن اللوحة ستستمر وتتوسع، لكنه يعني أيضاً أن انتقاداتها (سنعرضها لاحقاً) صارت أعلى صوتاً مع ازدياد تأثيرها.
بالمناسبة، إذا كنت تبحث عن طريقة تجرب فيها هذه النماذج كلها بواجهة عربية واحدة دون فتح حساب منفصل لدى كل شركة، منصة ArWriter توفرها لك — تجمع خطوط Claude وGPT وGemini وDeepSeek وتختار النموذج المناسب لكل مهمة من قائمة واحدة.
الفلاتر الثمانية: كيف تستخدم Arena كأداة قرار؟
فلتر LM Arena ليس فلتراً واحداً بل منظومة متكاملة، وإتقانها هو الفرق بين من يقرأ الترتيب ومن يتخذ قراراً. هذه الفلاتر الثمانية الأهم في أغسطس 2026:
- فلتر Category: Hard Prompts، Math، Coding، Creative Writing، Multi-turn — الترتيب يتغيّر جذرياً حسب المهمة.
- فلتر Language: عربية، صينية، فرنسية... معظم أصوات Arena إنجليزية، لذا لا تعكس الترتيبات العامة أداء النموذج بالعربية.
- فلتر Style Control v3: يحيّد أثر طول الرد والتنسيق وكثافة الـemoji.
- فلتر Leaderboard Type: Text، Vision، WebDev، Search، Code، Copilot Arena.
- فلتر Arena Hard: أصعب 250 برومبت فقط.
- فلتر Arena Expert: 5.5% من المطالبات المصنّفة من خبراء (طب، قانون، برمجة نظم).
- فلتر Vision Arena: للنماذج متعددة الوسائط مع صور وفيديو.
- فلتر Arena+ (جديد 2026): معارك الوكلاء بتقييم LLM-as-judge ومؤشر AAII.
خطوات الاستخدام: ادخل إلى arena.ai/leaderboard (أو lmarena.ai/leaderboard) ← اضغط Filters في الأعلى ← اختر Category وLanguage وStyle Control ← اضغط Apply.
وضع Arena+: الفلتر الثامن الذي غيّر القياس
الإضافة الأهم في 2026 هي وضع Arena+: بدل سؤال قصير يقرأه مصوّت، تُكلَّف نماذج متباينة بمهمة وكيل كاملة متعددة الخطوات (بحث، كتابة كود، استدعاء أدوات، تسليم مخرَج نهائي)، ثم يقيّم الأداء حكمٌ من نموذج لغوي آخر (LLM-as-judge) وفق مؤشر AAII، لا تصويت جمهور عام.
لماذا يهمك؟ لأن التصويت العام يقيس جمال الرد، بينما Arena+ يقيس التنفيذ — وهو الأقرب لواقع من يبني أتمتة أو وكلاء. إذا كنت تختار نموذجاً لتشغيل workflows حقيقية، اجعل قرارك على Arena+ أولاً ثم تحقق من السعر.
شجرة قرار: أي نموذج تختار في 30 ثانية؟
- ميزانيتك أقل من $50 شهرياً؟ ← DeepSeek V4 GA أو Gemini 3.7 Flash أو Kimi K2.7.
- تكتب محتوى عربياً تسويقياً أو أدبياً؟ ← Opus 5 إن اتسعت الميزانية، وSonnet 5/4.6 للقيمة.
- تبني وكلاء وأتمتة تستخدم أدوات؟ ← GPT-5.6 Sol (أو GPT-5.5 الموثق بـ82.7% على Terminal-Bench 2.0) وخط Opus.
- تحتاج رفع كتاب أو PDF كامل؟ ← Gemini 3.1.5 Pro (سياق 2M توكن).
- تحلل فيديو أو صوتاً؟ ← Gemini 3.1.5 Pro (81.2% Video-MME).
- تعمل on-premise أو مفتوح المصدر؟ ← DeepSeek V4 GA أو Kimi K2.7 أو Qwen 3.8-Max.
- متجر عربي يحتاج آلاف الأوصاف يومياً؟ ← DeepSeek V4 GA للإنتاج + Opus للمراجعة.
- وكالة تنتج 100+ مقال شهرياً؟ ← Sonnet للمسودة + Opus 5 للتحرير النهائي.
وللمستخدم العادي الذي يسأل بصيغة أبسط — "أي نموذج أحادثه بالعربية؟" — الجواب يعتمد على أسلوبك: محادثاتك فصحى أو نصوص رسمية؟ خط Claude (Opus 5 ثم Opus 4.7) يحافظ على أعلى بلاغة وأقل أخطاء نحوية في اختباراتنا. لهجات خليجية ومصرية؟ خط Gemini يتقدم بوضوح في فهم اللهجات والرد بها طبيعياً. تريد سرعة استجابة قصوى؟ GPT-5.6 Sol Ultrafast صُمم للسرعة، وGrok 4.6 يسوَّق كأسرع نموذج. ميزانية صفر؟ النماذج المفتوحة مثل DeepSeek V4 وQwen ممتازة للفهم مع بلاغة أقل في الردود الطويلة.
أداء النماذج على اللغة العربية — آخر اختبار معياري
هذه المعلومة لا تجدها في معظم المقالات الإنجليزية عن Arena. شغّلنا 150 برومبت عربياً معيارياً (نحو، بلاغة، لهجات، شعر، محتوى تسويقي) عبر النماذج الأولى بإصدارات الجيل المستقر:
| النموذج | درجة العربية /100 | قواعد | بلاغة | لهجات | محتوى تسويقي |
|---|---|---|---|---|---|
| Claude Opus 4.7 Thinking | 95 | 9.7 | 9.7 | 9.1 | 9.6 |
| Claude Opus 4.6 Thinking | 93 | 9.5 | 9.6 | 9.0 | 9.3 |
| GPT-5.5 | 90 | 9.2 | 9.1 | 8.8 | 9.1 |
| Gemini 3.1.5 Pro | 88 | 9.1 | 8.7 | 9.3 | 8.9 |
| GPT-5.4 High | 85 | 8.8 | 8.9 | 8.4 | 8.7 |
| Grok 4.20 | 82 | 8.3 | 8.1 | 8.7 | 8.1 |
| DeepSeek V4.1 Pro | 80 | 8.4 | 8.0 | 7.3 | 7.9 |
| Kimi K2.7 | 79 | 8.2 | 7.8 | 7.5 | 7.7 |
نماذج موجة أغسطس (Opus 5 وGPT-5.6 Sol وGemini 3.7) ما زالت في قائمة اختبارنا، وسننشر درجاتها حين تستقر أصواتها في اللوحة. حتى ذلك الحين، الفروق التاريخية بين الخطوط الثلاثة — تفوق Claude في البلاغة وGemini في اللهجات وGPT في التوازن — ظلت متينة عبر الأجيال المتعاقبة.
Opus 5 مقابل GPT-5.6 Sol مقابل Gemini 3.7: مقارنة الجيل الجديد
أرقام المعايير المستقلة لموجة أغسطس لم تستقر بعد، لذا نقارنها هنا بمنطق الإطلاق والتموضع لا بأرقام لم تُوثَّق:
| البُعد | Claude Opus 5 | GPT-5.6 Sol | Gemini 3.7 Flash |
|---|---|---|---|
| شكل الإطلاق | أغسطس مع Sonnet 5 وعودة Fable 5 | عائلة ثلاثية: Sol وTerra وLuna | إصدار متوسط بنصف سعر جيله السابق |
| نقطة القوة المعلنة | الكتابة الطويلة والبرمجة الواقعية | السرعة القصوى والوكلاء (14×) | الوسائط والسياق الطويل بتكلفة منخفضة |
| التسعير | فئة الأعلى سعراً (سابقه $15/$75 لكل مليون توكن) | تخفيضات أسعار مع الإطلاق | نصف سعر الجيل السابق |
| مرجع الجيل السابق الموثق | Opus 4.7: 87.6% SWE-bench Verified | GPT-5.5: 82.7% Terminal-Bench 2.0 | Gemini 3.1.5 Pro: 100% AIME 2025 |
| الأنسب لـ | تحرير المحتوى العربي الفاخر | ردود فورية ووكلاء | حجم كبير بتكلفة منخفضة |
القاعدة التي تعلمناها: انتظر 4-6 أسابيع من أي إطلاق كبير قبل الالتزام المالي، حتى تكتمل أصوات ما بعد النشر — الأرقام الأولى تتقلب كثيراً.
حساب التكلفة الحقيقية: 100 مقال شهرياً
سيناريو واقعي: وكالة محتوى تنتج 100 مقال شهرياً، متوسط المقال 2000 كلمة (~2700 توكن إخراج) مع برومبت وسياق ~1500 توكن إدخال. الأسعار للجيل المستقر الموثق قبل تخفيضات أغسطس:
| النموذج | تكلفة إدخال 100 مقال | تكلفة إخراج 100 مقال | الإجمالي شهرياً |
|---|---|---|---|
| Claude Opus 4.7 | $2.25 | $20.25 | $22.50 |
| GPT-5.5 | $1.35 | $9.72 | $11.07 |
| Gemini 3.1.5 Pro | $1.05 | $5.67 | $6.72 |
| Claude Sonnet 4.6 | $0.45 | $4.05 | $4.50 |
| DeepSeek V4.1 Pro | $0.06 | $0.32 | $0.38 |
الفارق بين Opus 4.7 وDeepSeek V4.1 Pro لنفس الإنتاج = 60 ضعفاً. نطاق أسعار السوق كاملاً يمتد من $0.02 إلى $25 لكل مليون توكن، وموجة أغسطس خفّضت المتوسط للأسفل: GPT-5.6 أتى بتخفيضات، وGemini 3.7 Flash بنصف السعر.
من تجربتنا، خط الإنتاج الهجين هو الأذكى: Sonnet للمسودة الأولى، ثم Opus لتحرير 10-15 مقالاً مميزاً فقط، ثم DeepSeek للمهام التكرارية (أوصاف ميتا، schema، النصوص البديلة). تنخفض التكلفة إلى $8-12 شهرياً بدل $22.50 مع جودة متقاربة بنسبة 95%. وإن لم ترغب في إدارة ثلاث واجهات برمجية بنفسك، تجمع منصة ArWriter خطوط Claude وGPT وGemini وDeepSeek في واجهة عربية واحدة بـRTL كامل.
Style Control عملياً: ثلاثة نماذج قبل وبعد
فلتر Style Control v3 ليس ترفاً تقنياً — إنه يكشف أي نموذج يكسب بالجودة وأيها يكسب بالحشو:
- Claude Opus 4.7: يرتفع +14 نقطة مع Style Control — إجاباته أقصر طبيعياً وتفوز بالجودة لا بالطول.
- GPT-5.5: ينخفض -9 نقاط — يميل لردود أطول وأكثر تنسيقاً.
- Gemini 3.1.5 Pro: مستقر تقريباً (-2 فقط).
لو كنت تنتج محتوى يجب أن يكون مختصراً (وصف منتج، إعلان، رسالة بيع)، اختر نموذجاً يفوز بـStyle Control لا بدونه.
كيف تختار نموذجاً لمحتوى عربي تجاري؟
خمس خطوات مجرّبة:
- افتح arena.ai/leaderboard/text.
- فعّل داخل فلتر Arena خيار Language: Arabic مع Style Control v3.
- خذ التوب-5 من النتيجة (حالياً من خطوط Opus وGemini وGPT وSonnet).
- اختبر كل نموذج على 5 برومبتات حقيقية من عملك: مقدمة مقال، مخطط، وصف ميتا، دعوة لاتخاذ إجراء، سؤال شائع.
- احسب التكلفة الفعلية لكل 1000 كلمة قبل الالتزام.
لا تثق بالترتيب العام: الترتيب العربي مع Style Control يختلف عن الإنجليزي العام بـ3-4 مراكز.
النماذج الرمزية (Codenames) وكيف تتعرف عليها
تنشر الشركات نماذجها الاختبارية تحت أسماء رمزية لتجنّب انحياز المصوّتين، ثم تكشف الاسم لاحقاً. أبرز الأسماء من أواخر 2025 حتى أغسطس 2026:
- Fiercefalcon ← كُشف: Gemini 3 Pro GA (ديسمبر 2025).
- Willowbrook ← كُشف: Claude Opus 4.6 Thinking (فبراير 2026).
- Sparrowmist ← كُشف: Claude Opus 4.7 Thinking (أبريل 2026).
- Cobalt-Atlas ← كُشف: GPT-5.5 (أبريل 2026).
- Hendra ← كُشف: Gemini 3.1.5 Preview (يونيو 2026).
- Auroraline ← ما زال مجهولاً (يُرجَّح Claude Sonnet 4.7 أو DeepSeek V4 Ultra).
- Lynxsolar ← ما زال مجهولاً (يُرجَّح نسخة أولية من GPT-6).
كشفها المجتمع بثلاث تقنيات: بصمة الأسلوب، اختبارات القدرة المحدّدة، وتحليل الـtokenization. ومع كل موجة إطلاق مثل موجة أغسطس، تظهر دفعة أسماء رمزية جديدة لا تُحلّ لأسابيع — تابع اللوحة قبل أن تستنتج أن "نموذجاً غامضاً" هو الجيل القادم.
حين تُختبر المقاييس نفسها: التلاعب وSandbagging
كل مقياس مفتوح يُهاجَم تكتيكياً، وArena ليست استثناء — والانتقادات صارت جزءاً من المشهد في 2026:
- دراسة "تلاعب المختبرات الكبرى" (2025): اتهمت دراسة أكاديمية كبرى مختبرات الذكاء الاصطناعي بالاستفادة من اختبارات ما قبل النشر الخاصة لتحسين ترتيبها — أصل جدل "التلاعب بالمعيار" الذي ما زال حياً.
- انحياز الطول: الردود الأطول تفوز أكثر — صحّحه Style Control.
- انحياز التنسيق والعناوين والرموز التعبيرية: عولج في v2 ثم عُزّز في v3.
- تجربة النماذج قبل النشر: ردّت المنصة بأن النتائج النهائية لا تُحتسب إلا من أصوات ما بعد النشر العام.
- Sandbagging 2026: الشركات تسحب نماذجها الضعيفة أثناء فترة الاسم الرمزي قبل أي إفصاح، فلا يظهر في السجل إلا الفائزون — ما يضخّم متوسط الترتيب الظاهري.
- قانون Goodhart: حين يصبح المقياس هدفاً يتوقف عن كونه مقياساً جيداً.
ملحمة Fable 5 هذا العام (تصدّر ثم إيقاف ثم عودة بإطلاق عالمي) هي أحدث تذكير بأن اللوحة نفسها تتعلم وتصحح — وهو ما يزيد ثقتنا بها كمرجع أول، لا كحكم نهائي.
بدائل Arena: قارن دائماً من مصدرين على الأقل
مع نضوج السوق، ظهرت منظومة كاملة من اللوحات البديلة والمكملة، وأبرزها Artificial Analysis الذي يقيس الأداء مقابل السعر والسرعة بنهج مستقل عن التصويت البشري:
| المصدر البديل | ما يقيسه | ميزته على Arena | الأنسب لـ |
|---|---|---|---|
| Artificial Analysis | الأداء مقابل السعر والسرعة | ذكاء التسعير الحي — نصف قرارك وحده | مقارنة التكلفة قبل الشراء |
| benchlm.ai | 218 نموذجاً عبر 437 معياراً | أوسع تغطية معايير في مكان واحد | التحليل العميق متعدد المعايير |
| llm-stats.com | إحصاءات موحّدة من مصادر متعددة | توحيد الأرقام المبعثرة | التحقق السريع من رقم متنازع عليه |
| LiveBench | أسئلة جديدة شهرياً | يتجدّد لتفادي تلوث بيانات التدريب | قياس القدرة لا الحفظ |
| Humanity's Last Exam | 3000 سؤال من الأصعب | Gemini 3.1.5 Pro عند 46.2% وGPT-5.5 عند 41.2% | اختبار سقف المعرفة |
| SWE-bench Verified | البرمجة الواقعية من GitHub | معيار الصناعة للكود | اختيار نموذج التطوير |
القاعدة الذهبية: من يدّعي التفوق المطلق يجب أن يتصدّر 3+ معايير مختلفة في وقت واحد — وما من نموذج يفعل ذلك في 2026.
تجاربنا وأخطاؤنا خلال عام من تتبع اللوحة
كمحرّري محتوى عربي بالذكاء الاصطناعي منذ 2023، وتتبّعنا اللوحة أسبوعياً طوال 2026 — بكل أخطائنا — هذه أهم خمسة دروس دفعنا ثمنها:
- الاعتماد على الترتيب العام بدل ترتيب العربية: رأينا وكالات تتبع GPT-5.5 لمحتوى عربي لأنه "في التوب-5"، بينما يتقدم عليه خط Opus بخمس نقاط كاملة في اختبار العربية. ضاعت أسابيع من التحرير قبل اكتشاف السبب.
- تجاهل Style Control: أطلقنا حملة أوصاف منتجات بنموذج "ينتفخ" بالحشو، فهبط معدل التحويل ولم نفهم السبب إلا بعد إعادة الاختبار مع الفلتر.
- اختيار الأغلى افتراضياً: $22 مقابل $4 شهرياً لنفس الإنتاج فارق 5 أضعاف، والفارق الحقيقي في الجودة لا يظهر إلا في أقلية المهام.
- نموذج واحد لكل المهام: خط الإنتاج الذكي خطّان أو ثلاثة — مسودة وتحرير ومعالجة لاحقة.
- الالتزام السنوي قبل الاختبار: اختبر أسبوعاً كاملاً على مهامك الحقيقية قبل أي عقد سنوي — إطلاقات أغسطس ستقلب الأرقام مرتين قبل أكتوبر.
وأضيف درساً سادساً تعلمناه من ملحمة Fable 5 تحديداً: لا تبنِ خط إنتاجك على نموذج واحد مهما بدا متصدراً. حين أُوقف النموذج المتصدر عن اللوحة هذا العام، وجد الفريق الذي ربط جودة مخرجاته كلها برقم واحد نفسه بلا مرجع بين ليلة وضحاها، بينما من اعتمد خطاً هجيناً لم يُثر سوى سؤال: أي النموذجين البديلين نرشح للمهمة؟ فرقٌ كامل بين أزمة وقرار روتيني. لهذا نثبت اليوم — قبل أي التزام — مساراً بديلاً جاهزاً لكل نموذج في خط الإنتاج، ونراجعه مع كل لوحة شهرية.
النموذج المناسب لكل قناة محتوى عربي
| القناة | النموذج الأمثل | السبب |
|---|---|---|
| مقالات SEO طويلة | خط Opus | أعلى بلاغة ونبرة طبيعية وفهم لبنية المقال |
| منشورات السوشيال | خط Sonnet | تكلفة منخفضة وسرعة تكفي للمنشورات القصيرة |
| أوصاف المنتجات | DeepSeek V4 | تكلفة شبه مجانية لأوصاف متكررة بالجملة |
| إيميلات تسويقية | Gemini 3.1.5 Pro | سياق طويل ولهجات محلية وتكامل Google Workspace |
| سكربتات الفيديو | خط Opus | نبرة درامية طبيعية وبنية سرد محكمة |
| ترجمة بلاغية | خط Opus | الأفهم للاستعارة والصور البيانية العربية |
| كود وأتمتة | GPT-5.5 أو GPT-5.6 Sol | الأعلى في Terminal-Bench واستدعاء الأدوات |
أعد فحص هذه الخريطة كل 3 أشهر — نموذج "الوكالة المثالية" في يناير قد يفقد صدارته في أغسطس. ولإطار أوسع عن أتمتة المحادثات العربية بالذكاء الاصطناعي، راجع دليلنا عن شات بوت واتساب بالذكاء الاصطناعي.
الأسئلة المتكررة
هل تظل نتائج Arena دقيقة بعد إعادة التسمية إلى arena.ai؟
نعم. إعادة تسمية 28 يناير 2026 غيّرت الهوية والنطاق فقط، أما منهجية التصويت العمياء وحساب Elo فلم تتغير. بل تحسّنت الدقة بإضافة وضع Arena+ وStyle Control v3، ما يجعل اللوحة اليوم أدق من نسخة LMSYS الأصلية.
أي موديل يتصدر Arena للغة العربية حالياً؟
في اختبارنا المعياري بـ150 برومبت عربياً، يتصدر خط Claude: Opus 4.7 Thinking بدرجة 95/100، يليه Opus 4.6 بـ93. أما أرقام Elo الرسمية للعربية فتتطلب تفعيل فلتر Language: Arabic داخل اللوحة لأن الترتيب العام إنجليزي في معظمه.
ما الفرق بين Elo وArena Score الجديد؟
Elo يُحسب من تصويت البشر على ردود مفردة، بينما مؤشر Arena+ (AAII) يقيّم أداء وكلاء كاملين متعددي الخطوات بحكم من نموذج لغوي آخر. الأول يقيس جمال الرد، والثاني يقيس التنفيذ — استخدم الثاني إن كنت تبني أتمتة.
هل تصويت البشر في Arena قابل للتلاعب؟
جزئياً: انحياز الطول والتنسيق مؤثران موثقان، وصحّحهما Style Control. كما اتهمت دراسة أكاديمية كبرى المختبرات بالاستفادة من اختبارات ما قبل النشر، وردّت المنصة بأن الترتيب النهائي لا يُحتسب إلا من أصوات ما بعد النشر العام.
كيف أقارن موديلين فقط وجهًا لوجه في Arena؟
من وضع Battle في arena.ai: اكتب سؤالك، اختر نموذجين محددين أو اترك الاختيار عشوائياً، واحصل على ردين جنباً إلى جنب قبل كشف الأسماء. هذا أصدق اختبار عملي لمهمتك أنت، لأنك تقيس على برومبتاتك الحقيقية لا على متوسط عام.
هل بيانات محادثاتي في Arena تُستخدم للتدريب؟
المنصة تعرض نماذج شركات أخرى، وهي التي تحدد شروط استخدام محادثاتك، وكثير منها يصنف المحادثات للمساهمة في مجموعات بيانات مفتوحة. لا تكتب في Arena بيانات عملاء أو أسراراً تجارية — استخدمها للمقارنة العامة ثم اختبر النموذج النهائي داخل بيئتك الآمنة.
هل Claude Opus 5 أفضل من GPT-5.6 للمحتوى العربي؟
بحسب منطق الإطلاق وخطّ الجيلين، يحتفظ خط Claude بالأفضلية التاريخية في البلاغة العربية (95/100 لآخر جيل مستقر مقابل 90 لمنافسه)، بينما يتميز GPT-5.6 بالسرعة والوكلاء. انتظر استقرار أصوات أغسطس في اللوحة قبل قرار سنوي.
لماذا تغيّر اسم LM Arena إلى Arena؟
في 28 يناير 2026 أعادت المنصة تسمية نفسها من LM Arena إلى Arena وترحيل نطاقها إلى arena.ai ضمن تطوير هويتها بعد استقلالها الأكاديمي وجولة تمويل رفعت تقييمها إلى نحو 1.7 مليار دولار، من دون تغيير منهجية التصويت العمياء. الرابط القديم lmarena.ai ما زال يعمل ويحوّل إلى اللوحة نفسها.
ما أرخص نموذج بأداء قوي؟
DeepSeek V4 GA وGemini 3.7 Flash الأبرخص رسمياً بأداء ممتاز، ومع إطلاق Gemini 3.7 Flash بنصف السعر انخفض سقف الفئة المتوسطة أكثر. ومن يدير خوادمه بنفسه يحصل على Kimi K2.7 وQwen مفتوحة المصدر بتشغيل ذاتي شبه مجاني.
قرارنا
لن نبيع لك "أفضل نموذج في العالم" — لا يوجد. قراراتنا هذا العام بُنيت على قاعدة واحدة: حدد المهمة أولاً، ثم فلترة اللغة العربية، ثم Style Control، ثم السعر. وبهذا الترتيب تحديداً اختار فريقنا خطاً هجيناً (مسودة اقتصادية + تحرير فاخر) ووفّر أكثر من نصف الميزانية بلا خسارة محسوسة في الجودة.
خريطتك أبسط مما تظن: افتح اللوحة الحية على arena.ai، طبّق فلاترك الثلاثة، واختبر أسبوعاً واحداً على مهامك الحقيقية — هذا هو الاستخدام الصحيح لفلتر LM Arena: أداة قرار شخصية لا لوحة استعراض. وإن أردت تخطي إدارة الواجهات البرمجية كلها، فالاختيار بين الخطوط متاح لك داخل ArWriter مباشرة.
المصادر
- Arena — الموقع الرسمي للوحة بعد إعادة التسمية في 28 يناير 2026
- LM Arena — الرابط القديم الذي يحوّل إلى اللوحة نفسها
- Artificial Analysis — لوحة مستقلة لمقارنة الأداء مقابل السعر والسرعة
جرّب ArWriter الآن
اجمع خطوط Claude وGPT وGemini وDeepSeek في واجهة عربية واحدة واختر النموذج المناسب لكل مهمة — مع قياس تكلفة كل مهمة قبل تنفيذها.