القسم 1 من 7 — 30 نموذجًا
نماذج اللغة نماذج اللغة نماذج المحادثة والاستدلال العامة — وهي ما يقصده أغلب الناس حين يقولون «الذكاء الاصطناعي». تشمل نماذج الصدارة وفئاتها الاقتصادية والبدائل مفتوحة الأوزان والإقليمية.
مرتّبة حسب الدرجة، الأعلى أولًا · 9 قيد التقييم تليها
+ يتصدّر البرمجة الوكيلة طويلة الأمد، مع تتبّع قوي للأسباب الجذرية عبر جلسات متعددة الخطوات + أداء قوي في البحث العلمي الوكيل، منه عمل في تصميم البروتينات تذكر Anthropic أن نسبة إصابته تقارب 50% − تذكر Anthropic أن وضوح الرؤية يقل في التشغيل الطويل السياق ومتعدد الوكلاء مقارنة بالجلسات الأقصر − لا يزال قادرًا على تجاوز بوابات الموافقة أو مصنّفات الوضع التلقائي في بعض المهام الوكيلة، وفق اختبارات Anthropic نفسها
+ النموذج الذي توصي به Anthropic للأعمال المعقدة وعالية المخاطر، بنسبة قوية بين الاستدلال والتكلفة + مؤهل لعدم الاحتفاظ بالبيانات، وهو مفيد للنشر في القطاعات المنظّمة أو المؤسسات − يقع دون فئة الصدارة في التسمية التجارية رغم نتائجه العملية القوية − تكلفته لكل توكن أعلى بوضوح من فئة Sonnet للمهام اليومية
+ استدلال وكيل من الطراز الأول، مع البحث وتنفيذ الشيفرة واستخدام الحاسوب في واجهة برمجية واحدة + مخرجات منضبطة وقليلة الهلوسة في المهام الطويلة متعددة الخطوات − الطلبات طويلة السياق فوق 272 ألف توكن تقريبًا يُعاد تسعيرها بارتفاع حاد − أبطأ من معظم منافسيه في إخراج أول إجابة عند أقصى درجات الاستدلال
+ نموذج صدارة مفتوح الأوزان فعليًا يمكنك استضافته بنفسك، بخلاف منافسيه المغلقين + تكلفة واجهة برمجية منخفضة جدًا، خصوصًا في نوافذ التسعير خارج أوقات الذروة − إصدار V4 Pro نصّي فقط؛ ومدخلات الصورة محصورة في نسخة Flash تجريبية − يتأخر عن المختبرات المغلقة الرائدة في اختبارات الذكاء المجمّعة
+ من أسرع النماذج من فئة الصدارة في سرعة التوليد + سعره تنافسي بقوة لحركة الإنتاج عالية التدفق − حلّت محله إصدارات Flash الأحدث (3.5 إلى 3.8) بوصفها النموذج السريع الافتراضي لدى Google − إعدادات الاستدلال الأعلى تضيف تكلفة وزمن استجابة ملحوظين
+ مصنّف الأول من بين 128 نموذجًا في ساحة WebDev على LMArena لبناء تطبيقات ويب عاملة، متقدمًا بوضوح على كل منافسيه + تذكر OpenAI نتائج هي الأفضل على FrontierMath وARC-AGI-3 واستخدام الحاسوب في OSWorld 2.0 − في الاستخدام اليومي يفضّل الناس منافسين كثيرين عليه: المركز 49 من 402 في مسائل LMArena الصعبة، بفارق كبير خلف Claude − يستخدم أسلوب استدلال «التكرار المعتم» تقول OpenAI إن مراقبته أصعب في تدقيق سلسلة التفكير
+ سريع وقادر، وبسعر يناسب الاستخدام الإنتاجي اليومي + خيار افتراضي قوي للبرمجة والمستندات الطويلة دون تكلفة فئة Opus − تفعيل أقصى وضع تفكير قد يضخّم إنفاق التوكن بهدوء − يتأخر عن Opus في أصعب مسائل الاستدلال متعدد الخطوات
+ مدخلات متعددة الوسائط أصلية تشمل النص والصورة والصوت والفيديو وملفات PDF + نافذة سياق ضخمة مع استرجاع قوي للمستندات الطويلة − أبطأ في أول استجابة من فئة Flash لدى Google نفسها − لا ينتج صورًا ولا صوتًا، بل يفهمهما فقط
+ يتصدّر عدة اختبارات للمهام الوكيلة وأتمتة سطر الأوامر + بحث أصلي وفوري في X والويب مدمج في النموذج − لا يمكن إيقاف وضع الاستدلال، فيضيف تكلفة وزمن استجابة إلى كل طلب − يصطدم بقفزة سعرية حادة بمجرد تجاوز السياق 200 ألف توكن تقريبًا
+ مصمم خصيصًا للتشغيل على الجهاز وعلى الأطراف + نسخ صغيرة، من 4B إلى 12B، تعمل جيدًا على عتاد متواضع − ليس مخصصًا لمنافسة نماذج الصدارة في الاستدلال الصعب − نافذة سياق محدودة مقارنة بنماذج Gemini السحابية
+ أداء برمجي ينافس Claude أو يضاهيه في عدة اختبارات + مفتوح الأوزان، ما يمنح مرونة للنشر الذاتي أو الضبط الدقيق − منظومة أدوات وتكاملات أصغر من المختبرات الثلاثة الكبرى − أقل اختبارًا في بيئات الإنتاج خارج عمليات النشر داخل الصين
+ أرخص فئات Claude، ومناسب تمامًا للمهام البسيطة عالية الحجم + زمن استجابة منخفض، جيد لأحمال المحادثة والتصنيف − نافذة سياق أصغر (200 ألف توكن) من Sonnet 5 وOpus 5 (مليون) − أضعف بوضوح من Sonnet أو Opus في الاستدلال الصعب
+ فئة Grok الاقتصادية الأسرع، للاستخدام عالي الحجم أو الحساس لزمن الاستجابة + يرث تكامل Grok الأصلي مع بحث X والويب − أقل قدرة بوضوح من Grok 4.6 في الاستدلال الصعب − حلّ محله Grok 4.1 Fast ونماذج سريعة أحدث من SpaceXAI
+ أداء قوي متعدد اللغات، خصوصًا عبر اللغات الأوروبية + ترخيص Apache 2.0 يتيح استخدامًا تجاريًا غير مقيّد − ميزانية بحث أصغر من مختبرات الصدارة الأمريكية والصينية، ويظهر ذلك في سقف الأداء − قلة شهرة الاسم قد تعقّد إجراءات الشراء في المؤسسات
+ ينافس أفضل النماذج المغلقة في اختبارات الاستدلال والبرمجة + عائلة واسعة من الأحجام، من المناسب للأجهزة الطرفية إلى حجم الصدارة − أوزانه مغلقة: بخلاف نماذج Qwen المفتوحة، لا يمكن استضافته ذاتيًا − صقل لغته الإنجليزية يتأخر قليلًا عن مختبرات الصدارة الغربية
+ أوسع نموذج مفتوح الأوزان انتشارًا في بيئات المؤسسات + منظومة ضخمة من النسخ المضبوطة والأدوات ودعم المجتمع − الترخيص يقيّد الاستخدام المجاني بعد تجاوز الناشر 700 مليون مستخدم شهريًا − يتخلف عن Qwen وDeepSeek وGLM في عدة اختبارات لعام 2026
+ يبرع في المستندات الطويلة والكتابة كثيفة المصادر وملخصات البحث، ويحافظ على السياق جيدًا + مفتوح الأوزان مع قدرات وكيلة وبرمجية قوية في تحديث K2 − منظومة وتكاملات أصغر من المختبرات المغلقة الثلاثة الكبرى − أقل إثباتًا في الاستخدام الإنتاجي الحساس لزمن الاستجابة
+ نموذج ناضج ومجرَّب لا يزال مدمجًا على نطاق واسع في المنتجات + توازن جيد بين السرعة والتكلفة ومدخلات الوسائط المتعددة للاستخدام اليومي − تجاوزه GPT-5.6 بوضوح في الاستدلال الصعب والمهام الوكيلة − توجّه OpenAI تدفع المستخدمين الجدد نحو نماذج أحدث
+ مبني خصيصًا لتغطية عشرات اللغات، منها لغات قليلة الخدمة + مفتوح الأوزان، ومفيد للبحث والتطبيقات كثيفة التوطين − ليس مخصصًا لمنافسة نماذج الصدارة في الاستدلال المتمحور حول الإنجليزية − سجل إنتاجي أصغر من خط Command التجاري لدى Cohere
+ مبني خصيصًا للتوليد المعزّز بالاسترجاع وسير عمل البحث في المؤسسات + سلوك قوي في الاستشهاد والإسناد عند وصله بمخزن مستندات − أقل ملاءمة للاستخدام الإبداعي المفتوح أو المحادثة العامة − صار الآن دون نموذج Cohere الأحدث Command A+
+ أداؤه أعلى من حجمه، خصوصًا في الرياضيات والمنطق + صغير بما يكفي للتشغيل محليًا أو على الأطراف بتكلفة زهيدة − اتساع معرفته العامة أضيق من نماذج الصدارة الأكبر − أقل ملاءمة للمهام الوكيلة الطويلة المفتوحة
+ نموذج واحد مفتوح الأوزان يجمع الاستدلال ومدخلات الصورة والبرمجة الوكيلة، تحت ترخيص Apache 2.0 + تصميم خليط الخبراء يفعّل 6.5B فقط من أصل 119B معاملًا لكل توكن، فيبقى الاستدلال كفؤًا − نموذج من الفئة الصغيرة: يتأخر عن نماذج الصدارة في أصعب مهام الاستدلال − بإجمالي 119B معاملًا، تحتاج استضافته الذاتية ذاكرة أكبر بكثير من نسخ Small السابقة
+ تكامل عميق مع محرك بحث Baidu ومنظومة السوق الصينية + فهم وتوليد قويان للغة الصينية − حضور ودعم أدوات أضعف خارج الصين − أداؤه بالإنجليزية يتأخر عن مختبرات الصدارة الغربية
+ مفتوح بالكامل: الأوزان وبيانات التدريب والوصفات منشورة تحت ترخيص OpenMDW-1.1 المتساهل + هجين Mamba-Transformer بـ550B معاملًا (55B نشطة) مبني للوكلاء طويلي التشغيل − بـ550B معاملًا، تحتاج استضافته الذاتية عنقود وحدات معالجة رسومية متعددة − أكفأ صيغه (NVFP4) مصممة لعتاد NVIDIA
+ معمارية هجينة Transformer-Mamba تمنح إنتاجية عالية جدًا واستهلاك ذاكرة منخفضًا عند السياق الطويل + من أكبر نوافذ السياق بين النماذج مفتوحة الأوزان، موجّه لعمل المستندات الطويلة في المؤسسات − يحتاج أسلوب تكميم خاصًا به ليبلغ أرقام الكفاءة تلك − سجل استخدام وحضور أصغر بكثير من Llama أو Qwen أو DeepSeek
+ حضور قوي في السوقين الاستهلاكي والمؤسسي الصيني عبر منظومة Tencent + عائلة واسعة متعددة الوسائط تشمل النص والصورة والفيديو تحت علامة واحدة − تبنٍّ وأدوات محدودة خارج الصين − أقل اختبارًا مقابل نماذج الصدارة الغربية في القياسات المستقلة
+ نموذج متعدد الوسائط مضغوط وكفؤ يسهل استضافته ذاتيًا + نسبة جيدة بين التكلفة والأداء لمهام الوسائط المتوسطة − يتأخر عن مختبرات الصدارة في أصعب اختبارات الاستدلال − شهرة ومجتمع أصغر بكثير من المختبرات الكبرى
+ مدمج بعمق في تطبيقات ByteDance الاستهلاكية ومنظومتها + أداء عام تنافسي بتكلفة منخفضة − مبني أساسًا للسوق الصينية، وحضوره محدود في غيرها − قياساته أقل شفافية في المقارنة بنماذج الصدارة العالمية
+ أداء قوي قياسًا بحجمه، ورائج في الاستخدام الكوري وحالات الاسترجاع المعزّز في المؤسسات + كفء بما يكفي للتشغيل الاقتصادي على نطاق واسع − حضور عالمي أضيق من المختبرات الأمريكية والصينية الكبرى − يتأخر عن نماذج الصدارة في أصعب مهام الاستدلال العام
+ نموذج سريع ومنخفض التكلفة وأداؤه جيد مقابل سعره + تغطية معقولة لعدة لغات منها الإنجليزية والصينية − يتأخر عن نماذج الصدارة في الاستدلال والبرمجة المعقدة − منظومة مطورين أصغر من Qwen أو DeepSeek ← القسم التالي → البرمجة والوكلاء