SpaceXAI

Grok 4.6

8.6/10
الجهة الصانعة
SpaceXAI
المنشأ
الولايات المتحدة
تاريخ الإصدار
12 أغسطس 2026

نقاط القوة والضعف

  • يتصدّر عدة اختبارات للمهام الوكيلة وأتمتة سطر الأوامر
  • بحث أصلي وفوري في X والويب مدمج في النموذج
  • لا يمكن إيقاف وضع الاستدلال، فيضيف تكلفة وزمن استجابة إلى كل طلب
  • يصطدم بقفزة سعرية حادة بمجرد تجاوز السياق 200 ألف توكن تقريبًا

التقييم

80% من الوزن مقاس

قُيّم على Grok 4.6 · بيانات المصادر حتى 26 سبتمبر 2026

نطاق الثقة 8.6–8.7 · أي نموذج داخل هذا النطاق لا يفصله فارق ذو معنى عن هذا النموذج

  • Reasoningw458.7

    قاعدة B1,445 rating (95% 1,439–1,452) من 14,049 صوتًا · المقياس 700–1,550، من 0 إلى 10 · LMArena text arena, hard prompts (grok-4.6-high) · 25 سبتمبر 2026

  • Accuracyw20—

    لا يوجد قياس مستقل بعد

  • Writingw158.4

    قاعدة B1,430 rating (95% 1,420–1,439) من 4,559 صوتًا · المقياس 750–1,550، من 0 إلى 10 · LMArena text arena, creative writing (grok-4.6-high) · 25 سبتمبر 2026

  • Long contextw208.5

    قاعدة B500,000 tokens · المقياس 8,192–1,048,576 توكن، من 0 إلى 10 · OpenRouter, context window · 26 سبتمبر 2026

السعر والإتاحة

مقاسان بالطريقة نفسها، وخارج الدرجة عن عمد: تكلفة النموذج لا تغيّر ما يستطيع فعله.

w = الوزن، أي حصة كل معيار من الدرجة الإجمالية. والدرجات الغائبة لا تُحتسب لصالح النموذج ولا ضده. كيف يعمل التقييم

المزيد في نماذج اللغة

عرض الكل →
Anthropic
  • يتصدّر البرمجة الوكيلة طويلة الأمد، مع تتبّع قوي للأسباب الجذرية عبر جلسات متعددة الخطوات
  • أداء قوي في البحث العلمي الوكيل، منه عمل في تصميم البروتينات تذكر Anthropic أن نسبة إصابته تقارب 50%
  • تذكر Anthropic أن وضوح الرؤية يقل في التشغيل الطويل السياق ومتعدد الوكلاء مقارنة بالجلسات الأقصر
  • لا يزال قادرًا على تجاوز بوابات الموافقة أو مصنّفات الوضع التلقائي في بعض المهام الوكيلة، وفق اختبارات Anthropic نفسها
OpenAI
  • مصنّف الأول من بين 128 نموذجًا في ساحة WebDev على LMArena لبناء تطبيقات ويب عاملة، متقدمًا بوضوح على كل منافسيه
  • تذكر OpenAI نتائج هي الأفضل على FrontierMath وARC-AGI-3 واستخدام الحاسوب في OSWorld 2.0
  • في الاستخدام اليومي يفضّل الناس منافسين كثيرين عليه: المركز 49 من 402 في مسائل LMArena الصعبة، بفارق كبير خلف Claude
  • يستخدم أسلوب استدلال «التكرار المعتم» تقول OpenAI إن مراقبته أصعب في تدقيق سلسلة التفكير
OpenAI
9.2/10
  • استدلال وكيل من الطراز الأول، مع البحث وتنفيذ الشيفرة واستخدام الحاسوب في واجهة برمجية واحدة
  • مخرجات منضبطة وقليلة الهلوسة في المهام الطويلة متعددة الخطوات
  • الطلبات طويلة السياق فوق 272 ألف توكن تقريبًا يُعاد تسعيرها بارتفاع حاد
  • أبطأ من معظم منافسيه في إخراج أول إجابة عند أقصى درجات الاستدلال
Anthropic
  • النموذج الذي توصي به Anthropic للأعمال المعقدة وعالية المخاطر، بنسبة قوية بين الاستدلال والتكلفة
  • مؤهل لعدم الاحتفاظ بالبيانات، وهو مفيد للنشر في القطاعات المنظّمة أو المؤسسات
  • يقع دون فئة الصدارة في التسمية التجارية رغم نتائجه العملية القوية
  • تكلفته لكل توكن أعلى بوضوح من فئة Sonnet للمهام اليومية