القسم 2 من 7 — 17 نموذجًا

نماذج البرمجة والوكلاء

نماذج ووكلاء بُنيت خصيصًا لكتابة الشيفرة ومراجعتها وإطلاقها — من المساعدات داخل بيئة التطوير إلى وكلاء سحابيين يعملون باستقلال تام.

مرتّبة حسب الدرجة، الأعلى أولًا · 11 قيد التقييم تليها

Anthropic
  • قوي في استنتاج المقصود من الطلبات المبهمة ومن السياق المعماري
  • سياق بمليون توكن يدعم إعادة هيكلة متماسكة عبر ملفات ومستودعات متعددة
  • قد يستهلك توكن أكثر بكثير من نماذج برمجية أخف في العمل الروتيني
  • يسرد استدلاله بإسهاب، ما يبطئ المهام السريعة
Google
  • يحل 75.8% من مسائل SWE-bench Verified على الإطار المفتوح المعياري، وهو أعلى رقم مقاس في هذا الدليل
  • يحمل مليون توكن من السياق في فئة Flash الأرخص، فيتسع مستودع كبير في مرور واحد
  • مصنّف دون فئتي Claude وGPT الرائدتين في ساحة WebDev حيث يحكم الناس على تطبيقات ويب عاملة
  • دليله البرمجي تشغيل واحد على الإطار: ولا شيء هنا يقيس سلوكه عبر جلسة وكيل طويلة
Zhipu AI
6.3/10
  • يحل 72.8% من مسائل SWE-bench Verified، وهو أفضل نتيجة مفتوحة الأوزان مقاسة في هذا الدليل
  • أوزان مفتوحة يقدّمها عدة مستضيفين مستقلين، فيستطيع الفريق تشغيله داخل بيئته
  • مصنّف دون فئات الصدارة المغلقة في ساحة WebDev
  • سياق بـ200 ألف توكن يبقى مقيِّدًا أمام فئات المليون توكن عند العمل عبر مستودع كبير
Google
  • يحل 69.6% من مسائل SWE-bench Verified على الإطار المفتوح المعياري
  • استدلال عام أقوى من فئة Flash، ويظهر ذلك في المسائل التي تحتاج حكمًا معماريًا
  • درجته أقل من فئة Flash التابعة له على إطار SWE-bench نفسه، فدفع ثمن Pro لا يشتري إصلاحًا أفضل للمسائل
  • غير متاح عبر OpenRouter، فلا يُقاس سعره ونافذة سياقه هنا بشكل مستقل
Anthropic
  • يحل 66.6% من مسائل SWE-bench Verified، وهو رقم مرتفع على نحو غير معتاد لفئة صغيرة ورخيصة
  • أرخص فئات Anthropic مع استدعاء الأدوات والمخرجات المهيكلة، ما يناسب الإصلاحات الآلية عالية الحجم
  • أدنى رقم في SWE-bench بين النماذج البرمجية المقيَّمة هنا
  • سياق بـ200 ألف توكن يحدّ من قدر ما يحمله من مستودع كبير دفعة واحدة
Alibaba
  • أداء مفتوح الأوزان قريب من المتصدّرين المملوكين
  • مجاني للاستضافة الذاتية، وجذاب للفرق الحساسة للتكلفة أو المعزولة عن الإنترنت
  • يحتاج بنية تحتية جادة لتشغيله بحجمه الكامل
  • أدواته وتكاملاته مع بيئات التطوير أقل نضجًا من Copilot أو Cursor أو Codex
OpenAI
قيد التقييم
  • أتمتة ممتازة لسطر الأوامر وعمليات git وتتبّع أعطال CI/CD
  • أوفر بكثير في التوكن من منافسيه كثيفي الاستدلال في المهام الروتينية
  • يحتاج تعليمات مفصّلة لا لبس فيها؛ ويتعثّر مع الطلبات المبهمة
  • نافذة سياق أصغر من بعض منافسيه، وهو قيد على المستودعات الضخمة
Cursor
قيد التقييم
  • حلقة تغذية راجعة فورية ومحكمة؛ ترى كل تغيير وتوجّهه
  • تسعير ثابت معقول للمساعدة طوال اليوم
  • يحتاج مطوّرًا يقوده فعليًا؛ وليس مبنيًا للتشغيل دون إشراف
  • وضع الوكيل الخلفي وغير المتزامن لا يزال مبكرًا ومحدودًا
MiniMax
قيد التقييم
  • بديل منخفض التكلفة يصمد بشكل معقول في اختبارات البرمجة
  • خيار جيد للمهام الاستكشافية المتوازية عالية الحجم
  • متأخر بوضوح عن متصدّري البرمجة في المسائل الصعبة
  • منظومة ودعم مجتمعي أصغر من منافسيه الأكبر
Cognition AI
قيد التقييم
  • يعمل باستقلال في السحابة، بما في ذلك ليلًا ودون إشراف
  • قوي في المهام الكبيرة محددة المعالم كعمليات الترحيل وإعادة الهيكلة
  • التسعير بالاستخدام يصبح مكلفًا سريعًا مع الأحمال الثقيلة
  • يحتاج مواصفات واضحة مسبقًا؛ وضعيف في العمل الاستكشافي المفتوح
Microsoft
قيد التقييم
  • أوسع دعم لبيئات التطوير بين مساعدي البرمجة، وأكبر قاعدة مستخدمين
  • فئة مجانية متاحة وتكامل وثيق مع مراجعة طلبات الدمج
  • أقل تخصصًا في إعادة الهيكلة المعقدة متعددة الملفات من بيئات التطوير المبنية للذكاء الاصطناعي
  • جودة الاقتراحات تعتمد كثيرًا على النموذج الذي تختاره خلفه
Amazon
قيد التقييم
  • قوي للفرق المتمحورة حول AWS، بما في ذلك ترقيات إصدارات Java تلقائيًا
  • تكامل عميق مع CloudFormation وسير عمل البنية التحتية كشيفرة
  • قيمته محدودة للفرق خارج منظومة AWS
  • أقل إقناعًا من Cursor أو Copilot في التطوير العام
Codeium
قيد التقييم
  • تسعير مناسب للميزانية مع فهرسة تلقائية للمستودعات الكبيرة
  • خيارات نشر مرنة تشمل الاستضافة الذاتية
  • منظومة وحضور أصغر من Cursor أو Copilot
  • تكاملات خارجية أقل من المنصات الأكبر
Tabnine
قيد التقييم
  • مبني للمؤسسات التي تضع الخصوصية أولًا، مع نشر داخل المنشأة وعدم احتفاظ بالبيانات
  • يدعم إحضار نموذجك الخاص للفرق ذات متطلبات الامتثال الصارمة
  • اقتراحاته أكثر تحفظًا من المنافسين الوكلاء الجريئين
  • مجموعة ميزات أصغر للمهام المستقلة متعددة الخطوات
Replit
قيد التقييم
  • ينتقل من الطلب إلى تطبيق يعمل ومنشور داخل بيئة واحدة في المتصفح
  • سهل المنال لغير المحترفين الذين يبنون أدوات صغيرة بسرعة
  • أقل ملاءمة للمستودعات الكبيرة القائمة من الوكلاء داخل بيئات التطوير
  • النشر والاستضافة مرتبطان بمنصة Replit نفسها
Open source
قيد التقييم
  • رفيق برمجة مجاني ومفتوح المصدر يعمل من الطرفية مع أي نموذج تقريبًا
  • واعٍ بـ git، يودع التغييرات تلقائيًا مع فروق واضحة تسهّل المراجعة
  • لا واجهة رسومية مصقولة؛ ويحتاج ارتياحًا مع سطر الأوامر
  • يفتقر إلى البنية التحتية المُدارة والدعم الذي توفره الوكلاء التجارية مثل Devin
OpenAI
قيد التقييم
  • مصنّف الأول من 128 نموذجًا في ساحة WebDev على LMArena حيث يحكم الناس على تطبيقات ويب عاملة — بفارق 42 نقطة عن التالي
  • نافذة سياق بـ1,050,000 توكن، فيتسع مستودع كبير في مرور واحد
  • لا نتيجة له بعد على الإطار المعياري لـSWE-bench Verified، فمهارته في إصلاح مسائل المستودعات الحقيقية غير مقاسة هنا
  • سعره في أعلى السوق، نحو 20 دولارًا لكل مليون توكن مخلوط