القسم 1 من 7 — 30 نموذجًا

نماذج اللغة

نماذج المحادثة والاستدلال العامة — وهي ما يقصده أغلب الناس حين يقولون «الذكاء الاصطناعي». تشمل نماذج الصدارة وفئاتها الاقتصادية والبدائل مفتوحة الأوزان والإقليمية.

مرتّبة حسب الدرجة، الأعلى أولًا · 9 قيد التقييم تليها

Anthropic
  • يتصدّر البرمجة الوكيلة طويلة الأمد، مع تتبّع قوي للأسباب الجذرية عبر جلسات متعددة الخطوات
  • أداء قوي في البحث العلمي الوكيل، منه عمل في تصميم البروتينات تذكر Anthropic أن نسبة إصابته تقارب 50%
  • تذكر Anthropic أن وضوح الرؤية يقل في التشغيل الطويل السياق ومتعدد الوكلاء مقارنة بالجلسات الأقصر
  • لا يزال قادرًا على تجاوز بوابات الموافقة أو مصنّفات الوضع التلقائي في بعض المهام الوكيلة، وفق اختبارات Anthropic نفسها
Anthropic
  • النموذج الذي توصي به Anthropic للأعمال المعقدة وعالية المخاطر، بنسبة قوية بين الاستدلال والتكلفة
  • مؤهل لعدم الاحتفاظ بالبيانات، وهو مفيد للنشر في القطاعات المنظّمة أو المؤسسات
  • يقع دون فئة الصدارة في التسمية التجارية رغم نتائجه العملية القوية
  • تكلفته لكل توكن أعلى بوضوح من فئة Sonnet للمهام اليومية
OpenAI
9.2/10
  • استدلال وكيل من الطراز الأول، مع البحث وتنفيذ الشيفرة واستخدام الحاسوب في واجهة برمجية واحدة
  • مخرجات منضبطة وقليلة الهلوسة في المهام الطويلة متعددة الخطوات
  • الطلبات طويلة السياق فوق 272 ألف توكن تقريبًا يُعاد تسعيرها بارتفاع حاد
  • أبطأ من معظم منافسيه في إخراج أول إجابة عند أقصى درجات الاستدلال
DeepSeek
  • نموذج صدارة مفتوح الأوزان فعليًا يمكنك استضافته بنفسك، بخلاف منافسيه المغلقين
  • تكلفة واجهة برمجية منخفضة جدًا، خصوصًا في نوافذ التسعير خارج أوقات الذروة
  • إصدار V4 Pro نصّي فقط؛ ومدخلات الصورة محصورة في نسخة Flash تجريبية
  • يتأخر عن المختبرات المغلقة الرائدة في اختبارات الذكاء المجمّعة
Google
  • من أسرع النماذج من فئة الصدارة في سرعة التوليد
  • سعره تنافسي بقوة لحركة الإنتاج عالية التدفق
  • حلّت محله إصدارات Flash الأحدث (3.5 إلى 3.8) بوصفها النموذج السريع الافتراضي لدى Google
  • إعدادات الاستدلال الأعلى تضيف تكلفة وزمن استجابة ملحوظين
OpenAI
  • مصنّف الأول من بين 128 نموذجًا في ساحة WebDev على LMArena لبناء تطبيقات ويب عاملة، متقدمًا بوضوح على كل منافسيه
  • تذكر OpenAI نتائج هي الأفضل على FrontierMath وARC-AGI-3 واستخدام الحاسوب في OSWorld 2.0
  • في الاستخدام اليومي يفضّل الناس منافسين كثيرين عليه: المركز 49 من 402 في مسائل LMArena الصعبة، بفارق كبير خلف Claude
  • يستخدم أسلوب استدلال «التكرار المعتم» تقول OpenAI إن مراقبته أصعب في تدقيق سلسلة التفكير
Anthropic
  • سريع وقادر، وبسعر يناسب الاستخدام الإنتاجي اليومي
  • خيار افتراضي قوي للبرمجة والمستندات الطويلة دون تكلفة فئة Opus
  • تفعيل أقصى وضع تفكير قد يضخّم إنفاق التوكن بهدوء
  • يتأخر عن Opus في أصعب مسائل الاستدلال متعدد الخطوات
Google
  • مدخلات متعددة الوسائط أصلية تشمل النص والصورة والصوت والفيديو وملفات PDF
  • نافذة سياق ضخمة مع استرجاع قوي للمستندات الطويلة
  • أبطأ في أول استجابة من فئة Flash لدى Google نفسها
  • لا ينتج صورًا ولا صوتًا، بل يفهمهما فقط
SpaceXAI
8.6/10
  • يتصدّر عدة اختبارات للمهام الوكيلة وأتمتة سطر الأوامر
  • بحث أصلي وفوري في X والويب مدمج في النموذج
  • لا يمكن إيقاف وضع الاستدلال، فيضيف تكلفة وزمن استجابة إلى كل طلب
  • يصطدم بقفزة سعرية حادة بمجرد تجاوز السياق 200 ألف توكن تقريبًا
Google
8.4/10
  • مصمم خصيصًا للتشغيل على الجهاز وعلى الأطراف
  • نسخ صغيرة، من 4B إلى 12B، تعمل جيدًا على عتاد متواضع
  • ليس مخصصًا لمنافسة نماذج الصدارة في الاستدلال الصعب
  • نافذة سياق محدودة مقارنة بنماذج Gemini السحابية
Zhipu AI
8.4/10
  • أداء برمجي ينافس Claude أو يضاهيه في عدة اختبارات
  • مفتوح الأوزان، ما يمنح مرونة للنشر الذاتي أو الضبط الدقيق
  • منظومة أدوات وتكاملات أصغر من المختبرات الثلاثة الكبرى
  • أقل اختبارًا في بيئات الإنتاج خارج عمليات النشر داخل الصين
Anthropic
  • أرخص فئات Claude، ومناسب تمامًا للمهام البسيطة عالية الحجم
  • زمن استجابة منخفض، جيد لأحمال المحادثة والتصنيف
  • نافذة سياق أصغر (200 ألف توكن) من Sonnet 5 وOpus 5 (مليون)
  • أضعف بوضوح من Sonnet أو Opus في الاستدلال الصعب
SpaceXAI
  • فئة Grok الاقتصادية الأسرع، للاستخدام عالي الحجم أو الحساس لزمن الاستجابة
  • يرث تكامل Grok الأصلي مع بحث X والويب
  • أقل قدرة بوضوح من Grok 4.6 في الاستدلال الصعب
  • حلّ محله Grok 4.1 Fast ونماذج سريعة أحدث من SpaceXAI
Mistral AI
  • أداء قوي متعدد اللغات، خصوصًا عبر اللغات الأوروبية
  • ترخيص Apache 2.0 يتيح استخدامًا تجاريًا غير مقيّد
  • ميزانية بحث أصغر من مختبرات الصدارة الأمريكية والصينية، ويظهر ذلك في سقف الأداء
  • قلة شهرة الاسم قد تعقّد إجراءات الشراء في المؤسسات
Alibaba
7.9/10
  • ينافس أفضل النماذج المغلقة في اختبارات الاستدلال والبرمجة
  • عائلة واسعة من الأحجام، من المناسب للأجهزة الطرفية إلى حجم الصدارة
  • أوزانه مغلقة: بخلاف نماذج Qwen المفتوحة، لا يمكن استضافته ذاتيًا
  • صقل لغته الإنجليزية يتأخر قليلًا عن مختبرات الصدارة الغربية
Meta
7.8/10
  • أوسع نموذج مفتوح الأوزان انتشارًا في بيئات المؤسسات
  • منظومة ضخمة من النسخ المضبوطة والأدوات ودعم المجتمع
  • الترخيص يقيّد الاستخدام المجاني بعد تجاوز الناشر 700 مليون مستخدم شهريًا
  • يتخلف عن Qwen وDeepSeek وGLM في عدة اختبارات لعام 2026
Moonshot AI
7.4/10
  • يبرع في المستندات الطويلة والكتابة كثيفة المصادر وملخصات البحث، ويحافظ على السياق جيدًا
  • مفتوح الأوزان مع قدرات وكيلة وبرمجية قوية في تحديث K2
  • منظومة وتكاملات أصغر من المختبرات المغلقة الثلاثة الكبرى
  • أقل إثباتًا في الاستخدام الإنتاجي الحساس لزمن الاستجابة
OpenAI
7.0/10
  • نموذج ناضج ومجرَّب لا يزال مدمجًا على نطاق واسع في المنتجات
  • توازن جيد بين السرعة والتكلفة ومدخلات الوسائط المتعددة للاستخدام اليومي
  • تجاوزه GPT-5.6 بوضوح في الاستدلال الصعب والمهام الوكيلة
  • توجّه OpenAI تدفع المستخدمين الجدد نحو نماذج أحدث
Cohere
  • مبني خصيصًا لتغطية عشرات اللغات، منها لغات قليلة الخدمة
  • مفتوح الأوزان، ومفيد للبحث والتطبيقات كثيفة التوطين
  • ليس مخصصًا لمنافسة نماذج الصدارة في الاستدلال المتمحور حول الإنجليزية
  • سجل إنتاجي أصغر من خط Command التجاري لدى Cohere
Cohere
  • مبني خصيصًا للتوليد المعزّز بالاسترجاع وسير عمل البحث في المؤسسات
  • سلوك قوي في الاستشهاد والإسناد عند وصله بمخزن مستندات
  • أقل ملاءمة للاستخدام الإبداعي المفتوح أو المحادثة العامة
  • صار الآن دون نموذج Cohere الأحدث Command A+
Microsoft
5.7/10
  • أداؤه أعلى من حجمه، خصوصًا في الرياضيات والمنطق
  • صغير بما يكفي للتشغيل محليًا أو على الأطراف بتكلفة زهيدة
  • اتساع معرفته العامة أضيق من نماذج الصدارة الأكبر
  • أقل ملاءمة للمهام الوكيلة الطويلة المفتوحة
Mistral AI
قيد التقييم
  • نموذج واحد مفتوح الأوزان يجمع الاستدلال ومدخلات الصورة والبرمجة الوكيلة، تحت ترخيص Apache 2.0
  • تصميم خليط الخبراء يفعّل 6.5B فقط من أصل 119B معاملًا لكل توكن، فيبقى الاستدلال كفؤًا
  • نموذج من الفئة الصغيرة: يتأخر عن نماذج الصدارة في أصعب مهام الاستدلال
  • بإجمالي 119B معاملًا، تحتاج استضافته الذاتية ذاكرة أكبر بكثير من نسخ Small السابقة
Baidu
قيد التقييم
  • تكامل عميق مع محرك بحث Baidu ومنظومة السوق الصينية
  • فهم وتوليد قويان للغة الصينية
  • حضور ودعم أدوات أضعف خارج الصين
  • أداؤه بالإنجليزية يتأخر عن مختبرات الصدارة الغربية
NVIDIA
قيد التقييم
  • مفتوح بالكامل: الأوزان وبيانات التدريب والوصفات منشورة تحت ترخيص OpenMDW-1.1 المتساهل
  • هجين Mamba-Transformer بـ550B معاملًا (55B نشطة) مبني للوكلاء طويلي التشغيل
  • بـ550B معاملًا، تحتاج استضافته الذاتية عنقود وحدات معالجة رسومية متعددة
  • أكفأ صيغه (NVFP4) مصممة لعتاد NVIDIA
AI21 Labs
قيد التقييم
  • معمارية هجينة Transformer-Mamba تمنح إنتاجية عالية جدًا واستهلاك ذاكرة منخفضًا عند السياق الطويل
  • من أكبر نوافذ السياق بين النماذج مفتوحة الأوزان، موجّه لعمل المستندات الطويلة في المؤسسات
  • يحتاج أسلوب تكميم خاصًا به ليبلغ أرقام الكفاءة تلك
  • سجل استخدام وحضور أصغر بكثير من Llama أو Qwen أو DeepSeek
Tencent
قيد التقييم
  • حضور قوي في السوقين الاستهلاكي والمؤسسي الصيني عبر منظومة Tencent
  • عائلة واسعة متعددة الوسائط تشمل النص والصورة والفيديو تحت علامة واحدة
  • تبنٍّ وأدوات محدودة خارج الصين
  • أقل اختبارًا مقابل نماذج الصدارة الغربية في القياسات المستقلة
Reka AI
قيد التقييم
  • نموذج متعدد الوسائط مضغوط وكفؤ يسهل استضافته ذاتيًا
  • نسبة جيدة بين التكلفة والأداء لمهام الوسائط المتوسطة
  • يتأخر عن مختبرات الصدارة في أصعب اختبارات الاستدلال
  • شهرة ومجتمع أصغر بكثير من المختبرات الكبرى
ByteDance
قيد التقييم
  • مدمج بعمق في تطبيقات ByteDance الاستهلاكية ومنظومتها
  • أداء عام تنافسي بتكلفة منخفضة
  • مبني أساسًا للسوق الصينية، وحضوره محدود في غيرها
  • قياساته أقل شفافية في المقارنة بنماذج الصدارة العالمية
Upstage
قيد التقييم
  • أداء قوي قياسًا بحجمه، ورائج في الاستخدام الكوري وحالات الاسترجاع المعزّز في المؤسسات
  • كفء بما يكفي للتشغيل الاقتصادي على نطاق واسع
  • حضور عالمي أضيق من المختبرات الأمريكية والصينية الكبرى
  • يتأخر عن نماذج الصدارة في أصعب مهام الاستدلال العام
01.AI
قيد التقييم
  • نموذج سريع ومنخفض التكلفة وأداؤه جيد مقابل سعره
  • تغطية معقولة لعدة لغات منها الإنجليزية والصينية
  • يتأخر عن نماذج الصدارة في الاستدلال والبرمجة المعقدة
  • منظومة مطورين أصغر من Qwen أو DeepSeek