المنهجية

كيف يعمل التقييم

الدرجة لا قيمة لها ما لم تر كيف صُنعت. تشرح هذه الصفحة كل خطوة، بكلام مبسّط أولًا، ثم بالتفصيل الكامل.

الإصدار 2.1 · 26 سبتمبر 2026 · 37 من 100 نموذجًا مقيَّمة. والبقية تبقى فارغة حتى تتوافر أدلة كافية.

باختصار

تخيّلها بطاقة درجات مدرسية

  1. 01

    لكل نوع من النماذج بطاقته

    لا يُقيَّم السمك بقدرته على تسلّق الشجر. فنماذج الصور تُقيَّم بأمور كجودة الصورة والالتزام بالتعليمات، ونماذج المحادثة بالاستدلال والدقة والسرعة. ولكل فئة موادها الخاصة.

  2. 02

    كل مادة تأخذ درجة من 0 إلى 10

    الاستدلال: 9. الدقة: 8. الكتابة: 7. وكل درجة مصدرها قياس عام أو قائمة تحقق منشورة، لا انطباع شخصي.

  3. 03

    بعض المواد تزن أكثر من غيرها

    في نموذج المحادثة، يمثل الاستدلال 45% من الدرجة النهائية والكتابة 15%. ووزن كل مادة مكتوب بجانبها (w45، w15).

  4. 04

    السعر ليس مادة من المواد

    تكلفة النموذج لا تغيّر ما يستطيع فعله، ولذلك يُقاس السعر والإتاحة ويظهران في كل بطاقة لكن خارج الدرجة. وإلا تفوّق نموذج رخيص على آخر أقوى في ترتيب يدّعي أنه يقول أيهما أفضل.

  5. 05

    الدرجة تقول كم نحن واثقون

    حين ينشر المصدر هامش خطأ نأخذ طرفه المتحفظ، والنموذج الذي اختُبر بضع مئات المرات فقط لا يأخذ درجة أصلًا. والنموذجان المتداخلان في الهامش يظهران متعادلين، لأن الأدلة لا تفرّق بينهما.

  6. 06

    الدرجة النهائية متوسط مرجّح

    الدرجات العالية في المواد الثقيلة ترفع النتيجة أكثر من مثيلاتها في المواد الخفيفة. وهذا هو الرقم في زاوية البطاقة، مثل 8.2/10.

  7. 07

    لا درجة نهائية دون واجبات كافية

    يحتاج النموذج إلى درجات تغطي 80% على الأقل مما يُحتسب قبل أن ينال درجة نهائية، حتى لا تجعله مادة واحدة محظوظة يبدو رائعًا.

  8. 08

    لا أحد يشتري درجة

    لا تدفع الشركات مقابل الإدراج أو التقييم، ولا ترى الدرجات قبل نشرها. وإن كان رقم خاطئًا، فعلاجه دليل أفضل لا مكالمة هاتفية.

بالتفصيل · الخطوة 1

من أين تأتي كل درجة

يُقيَّم كل معيار بإحدى ثلاث قواعد. والقاعدة المستخدمة والمصدر والتاريخ تظهر بجانب كل درجة في صفحة النموذج، فيمكن التحقق من أي رقم.

القاعدة A · نتائج الاختبارات

النسب المئوية تتحول مباشرة إلى درجات

حين ينشر اختبار عام نسبة مئوية، تكون الدرجة تلك النسبة مقسومة على عشرة. فـ72% تصبح 7.2. ولا تتحرك الدرجة حين تُضاف نماذج أخرى.

SWE-bench Verified: 75.6% ← 7.6

القاعدة B · الكميات المقاسة

توضع على مقياس ثابت منشور

تُوضع تقييمات الساحات والسعر وطول السياق بين حد أدنى درجته 0 وحد أعلى درجته 10، وكلاهما منشور أدناه وثابت. وحين يعطي المصدر نطاق ثقة، تُحتسب الدرجة عند حده الأدنى. ولا شيء يتوقف على النماذج الأخرى التي نصادف إدراجها.

تقييم 1,450 على مقياس 700–1,550 ← 8.8

القاعدة C · معايير التقدير

قائمة تحقق منشورة

أمور مثل الترخيص أو ضوابط البيانات لا تُختبر بالأرقام، فلكل منها قائمة من خمسة بنود، كل بند بنقطتين. وتُنشر كل قائمة في هذه الصفحة قبل تقييم أي نموذج بها.

استيفاء 4 من 5 بنود ← 8.0

  • يُقيَّم كل نموذج على إصدار واحد محدد بالاسم، يظهر في صفحته، ومعه المدخل الدقيق في لوحة الصدارة وراء كل درجة.
  • تستخدم التكلفة سعرًا مخلوطًا: 3 أجزاء إدخال إلى 1 جزء إخراج، لكل مليون توكن.
  • درجات القاعدة B مطلقة. فدرجة النموذج لا تتغير إلا حين يتغير قياسه هو، لا لأن نموذجًا آخر أُضيف إلى الدليل أو حُذف منه.
  • أي تقييم تفضيل بشري مبني على أقل من 500 صوت يُعامل معاملة غير المقاس لا معاملة النتيجة الضعيفة.
  • وحين تكون للنموذج إعدادات مختبَرة عدة، نعتمد أقوى نتيجة يمكن الوثوق بها: أعلى حد أدنى للنطاق، لا أعلى رقم معلن.
  • وإن لم يوجد مصدر موثوق لمعيار، يبقى فارغًا (يظهر «—»). ولا نقدّر الدرجات ولا نملأ الفجوات أبدًا.
  • ولا تُستخدم ادعاءات التسويق دليلًا أبدًا. بل القياسات المستقلة ونتائج الاختبارات المنشورة.
بالتفصيل · المقاييس

كل مقاييس القاعدة B، منشورة

ضُبط كل مقياس في 20 سبتمبر 2026 من المدى المنشور للوحة الصدارة نفسها: الحد الأدنى هو أقل تقييم مدرج فيها والحد الأعلى أعلاه، مقرَّبين إلى أقرب 50 للخارج. وهي ثابتة. وتغيير أحدها يعني إدخالًا جديدًا في سجل التغييرات أسفل هذه الصفحة، وإعادة احتساب كل الدرجات.

القياسدرجته 0درجته 10الشكل
LMArena text (hard prompts)7001,550متساوٍ
LMArena text (creative writing)7501,550متساوٍ
LMArena WebDev1,0501,800متساوٍ
LMArena text-to-image8501,450متساوٍ
LMArena text-to-image (text rendering)8501,500متساوٍ
LMArena text-to-image (commercial design)8501,450متساوٍ
LMArena image edit9501,550متساوٍ
LMArena text-to-video1,0001,550متساوٍ
LMArena image-to-video9501,500متساوٍ
السعر المخلوط لكل مليون توكن$30$0.05×10 steps
نافذة السياق (توكن)8,1921,048,576×10 steps

«متساوٍ» يعني خطوات متساوية: فمنتصف المسافة بين الحدين درجته 5. و«خطوات ×10» تعني أن كل تضاعف عشري يحرّك الدرجة بالمقدار نفسه، وهكذا يتغير السعر وطول السياق فعلًا — فالفرق بين 0.10$ و1$ يساوي في أهميته الفرق بين 1$ و10$. وأي قياس يتجاوز أحد الطرفين يُقيَّد عنده، فلا شيء ينزل تحت 0 ولا يعلو فوق 10.

بالتفصيل · المنطق

لماذا هذه ليست مجرد لوحة صدارة

لوحات الصدارة العامة هي المادة الخام هنا، وهي منسوبة إلى أصحابها في كل درجة. وأربعة اختيارات مقصودة تفصل الدرجة في هذا الموقع عن مركز في أي منها.

أكثر من نوع واحد من الأدلة

التفضيل البشري يخبرك بما أعجب الناس. ولا يخبرك إن كانت الإجابة صحيحة، ولا إن كانت الشيفرة تعمل. والدرجة هنا تجمع أصوات التفضيل مع النجاح في مهام حقيقية من GitHub ومع الاتساق الواقعي المقاس، لأن مؤشرًا واحدًا لا يغطي ما وُجد النموذج له.

الطرف المتحفظ من الأدلة

التقييم تقدير له هامش خطأ، وهذا الهامش أوسع لنموذج اختُبر بضع مئات المرات منه لنموذج اختُبر خمسين ألف مرة. وتُحتسب الدرجات عند الحد الأدنى للنطاق المنشور، فلا يبدو ضعف الاختبار تفوّقًا، وأي تقييم دون 500 صوت لا يُستخدم إطلاقًا.

التعادل يُسمّى تعادلًا

حين يتداخل نطاقا نموذجين، تعجز الأدلة عن التفريق بينهما، فتعلّمهما لوحة الصدارة متعادلين إحصائيًا بدل عرض ترتيب هو في حقيقته ضجيج.

فصل القدرة عن السعر

«رخيص» و«جيد» ادعاءان مختلفان. وكلاهما مقاس هنا، وكلاهما معروض في صفحة كل نموذج، لكن القدرة وحدها هي التي تحدد الترتيب — فتجيب اللوحة عن سؤال واحد في كل مرة.

لا شيء من هذا يجعل الدرجة الكلمة الأخيرة. فكل لوحة صدارة وراءها تقيس ما تستطيع قياسه، على الأسئلة التي جمعتها مصادفةً، في لحظة واحدة من الزمن. وما تضيفه هذه المنهجية أن كل رقم يمكن تتبّعه إلى مصدر عام مؤرَّخ، محسوب بقواعد منشورة، وصادق في بيان مدى رسوخه.

بالتفصيل · المصادر

كل مصدر نستخدمه

كلها مستقلة وعامة. وتُنسخ بياناتها في لقطة مؤرَّخة، فلا تتغير الدرجات إلا حين تُحدَّث اللقطة، والتاريخ ظاهر مع كل درجة.

LMArena ↗بيانات حتى 25 سبتمبر 2026

Human-preference ratings from blind, side-by-side votes: text (hard prompts, creative writing), web development, text-to-image, image editing, text-to-video, and image-to-video.

Arenas published 2026-09-13 to 2026-09-25

SWE-bench Verified ↗بيانات حتى 26 فبراير 2026

Share of real GitHub issues resolved. Only runs using the same open harness (mini-SWE-agent) are counted, so results are comparable.

OpenRouter ↗بيانات حتى 26 سبتمبر 2026

List prices, context windows, supported features, and the number of independent providers serving each model.

إجادة العربية

المصادر أعلاه تُجرى بالإنجليزية، فهي لا تقول شيئًا عن إجادة النموذج للعربية. وهذان المصدران يقولان، وهما لوحتا القياس العربيتان الوحيدتان اليوم اللتان تنشران نتائجهما في صورة يستطيع أي أحد قراءتها والتحقق منها. وهما يغذّيان لوحة النماذج العربية في الصفحة الرئيسة لا درجات الدليل: فمركز النموذج هناك قياس منفصل في ميدان نماذج مختلف، ولا تقرأ أيًّا من الرقمين على أنه الآخر.

AraGen v3 ↗بيانات حتى 4 أبريل 2026

Free-form Arabic answers scored on six qualities — correctness, completeness, conciseness, helpfulness, honesty and harmlessness — by a judge model (claude-sonnet-4-20250514), published with a bootstrap 95% interval. 67 models measured.

Open Arabic LLM Leaderboard (OALL v2) ↗بيانات حتى 2 مارس 2026

The average of seven native Arabic benchmarks — AlGhafa, ArabicMMLU, EXAMS, MadinahQA, AraTrust, ALRAGE, ArbMMLU-HT — run zero-shot through LightEval. 163 models measured.

قائمة تحقق قابلية النشر (القاعدة C)

نقطتان لكل بند، تُراجَع على بيانات OpenRouter.

  1. 1Weights can be downloaded and self-hosted
  2. 2Served by at least 2 independent providers
  3. 3Served by at least 4 independent providers
  4. 4Supports tool calling
  5. 5Supports structured (JSON) outputs
بالتفصيل · الخطوة 2

الحساب، مع مثال محلول

هذا مثال لنموذج لغوي. وهو ليس نموذجًا حقيقيًا؛ الدرجات مفترضة لبيان طريقة الحساب. والأرقام أدناه محسوبة بالشيفرة نفسها التي تقيّم الدليل.

المعيارالدرجةالوزنالدرجة × الوزن
Reasoning945405
Accuracy820160
Writing715105
Long context620120
الإجمالي100790
الدرجة الإجمالية

790 ÷ 100 = 7.9

اجمع حاصل ضرب كل درجة في وزنها، ثم اقسم على مجموع الأوزان. ويُقرَّب الناتج إلى منزلة عشرية واحدة، في النهاية فقط. والسعر والإتاحة ليسا في هذا الجدول: فهما مقاسان ومعروضان في صفحة النموذج، لكنهما لا يُحتسبان في الدرجة.

إذا لم توجد إلا بعض الدرجات

بدرجتي الاستدلال والكتابة فقط، تغطي الأدلة 60% من الوزن، أي دون حد 80%. فلا توجد درجة إجمالية، وتقول البطاقة «قيد القياس» بدلًا منها. وحالما يتجاوز النموذج الحد، يستخدم المتوسط الدرجات الموجودة وأوزانها فقط.

بالتفصيل · الخطوة 3

بماذا نتعهّد، وما الذي نرفضه

نحن دائمًا

  • نعرض المصدر والتاريخ لكل درجة.
  • ننشر المعايير والأوزان قبل التقييم بها.
  • نقيّم كل نموذج في الفئة بالقواعد والمصادر نفسها.
  • نعيد احتساب كل درجة كلما تغيّر وزن أو قاعدة، ونؤرّخ التغيير.
  • نصحّح الدرجة متى ظهر دليل أفضل، أيًّا كان من نبّه إليه، ونؤرّخ التصحيح.

ونحن أبدًا لا

  • نقبل مقابلًا ماليًا للإدراج أو التقييم أو الترتيب.
  • ندع جهة صانعة تراجع درجة أو توافق عليها قبل نشرها.
  • نستخدم ادعاءات تسويقية أو نتائج غير منشورة دليلًا.
  • نقدّر درجة لا نستطيع قياسها، أو نعدّل درجة يدويًا.
  • نقارن نماذج عبر الفئات. فـ8 في الصور و8 في البرمجة تعنيان أمرين مختلفين.
جدير بالانتباه

أشياء في الموقع تبدو درجات وليست كذلك

نسب التبنّي

مقدار استخدام كل حالة، من مؤشر Anthropic الاقتصادي. وهو يقيس ما يطلبه الناس من الذكاء الاصطناعي لا أي نموذج أجاب، والشائع ليس هو الجيد — ولذلك لا يُحتسب الاستخدام أبدًا في درجة أي نموذج.

اطّلع على حالات الاستخدام

التبنّي حسب الدولة

حصة الدولة من الاستخدام العالمي، واستخدامها لكل فرد، من المؤشر نفسه. وهما يصفان أين يُستخدم الذكاء الاصطناعي، لا جودة أي نموذج في تلك الدولة.

اطّلع على الخريطة
كل بطاقات الدرجات

كل بطاقة درجات، وكم تساوي كل مادة

الأوزان نسبية داخل كل بطاقة وتُعرض كحصة من الإجمالي. وهي مثبّتة قبل التقييم؛ وإن تغيّر أحدها، أُعيد احتساب كل درجة متأثرة وسُجّل التغيير أدناه.

نماذج اللغة

المعيار · ومصدر قياسهالوزن
Reasoning
Preferred by people on hard, multi-step prompts.
Rule BLMArena text arena, hard prompts
45%
Accuracy
Sticks to the facts it was given, with few hallucinations.
Rule AVectara hallucination leaderboard, factual consistency rate
20%
Writing
Preferred by people for creative and long-form writing.
Rule BLMArena text arena, creative writing
15%
Long context
How much text it can take in at once.
Rule BOpenRouter, context window
20%
Cost efficiency
Price per token; cheaper is better.
Rule BOpenRouter, blended price per token
يُعرض ولا يُقيَّم
Deployability
Open weights, choice of hosts, and integration features.
Rule CDeployability checklist (OpenRouter data)
يُعرض ولا يُقيَّم

البرمجة والوكلاء

المعيار · ومصدر قياسهالوزن
Code quality
Share of real GitHub issues it resolves on its own.
Rule ASWE-bench Verified, % resolved (mini-SWE-agent harness)
45%
Web development
Preferred by people for building working web apps.
Rule BLMArena WebDev arena
40%
Codebase context
How much code it can take in at once.
Rule BOpenRouter, context window
15%
Cost efficiency
Price per token; cheaper is better.
Rule BOpenRouter, blended price per token
يُعرض ولا يُقيَّم

توليد الصور

المعيار · ومصدر قياسهالوزن
Image quality
Preferred by people across all kinds of image prompts.
Rule BLMArena text-to-image arena
40%
Text rendering
Preferred by people for images that contain text.
Rule BLMArena text-to-image, text rendering
20%
Commercial design
Preferred by people for ads, product shots, and branding.
Rule BLMArena text-to-image, commercial design
20%
Editing
Preferred by people for editing existing images.
Rule BLMArena image-edit arena
20%

توليد الفيديو

المعيار · ومصدر قياسهالوزن
Text-to-video
Preferred by people for video made from a written prompt.
Rule BLMArena text-to-video arena
60%
Image-to-video
Preferred by people for video made from a starting image.
Rule BLMArena image-to-video arena
40%

الصوت والموسيقى

المعيار · ومصدر قياسهالوزن
Output quality
Naturalness, fidelity, and musicality — or transcription accuracy.
غير مقيَّم بعد: لا مصدر مستقل
35%
Control
Steering of voice, emotion, structure, or style.
غير مقيَّم بعد: لا مصدر مستقل
20%
Language coverage
Breadth and quality across languages and accents.
غير مقيَّم بعد: لا مصدر مستقل
15%
Latency
Fast enough for real-time or high-volume use.
غير مقيَّم بعد: لا مصدر مستقل
10%
Licensing & safety
Commercial rights and consent safeguards.
غير مقيَّم بعد: لا مصدر مستقل
10%
Cost efficiency
Price per minute or per track.
غير مقيَّم بعد: لا مصدر مستقل
10%

البحث والمؤسسات

المعيار · ومصدر قياسهالوزن
Answer grounding
Accurate answers anchored in retrieved sources.
غير مقيَّم بعد: لا مصدر مستقل
30%
Citations
Clear, checkable references back to sources.
غير مقيَّم بعد: لا مصدر مستقل
20%
Integrations
Connectors to company data, clouds, and tools.
غير مقيَّم بعد: لا مصدر مستقل
20%
Governance
Permissions, audit, data residency, and admin controls.
غير مقيَّم بعد: لا مصدر مستقل
15%
Cost efficiency
Predictable pricing at organisational scale.
غير مقيَّم بعد: لا مصدر مستقل
15%
سجل التغييرات

كل تغيير في المنهجية

إن تغيّرت قاعدة أو وزن، يُدرج هنا بتاريخه، وتُعاد حساب كل درجة متأثرة.

  1. v2.126 سبتمبر 2026صارت إجادة العربية قابلة للقياس. فلوحتان عربيتان مستقلتان — AraGen، حيث يقيّم نموذج حَكَم أجوبةً عربية حرة على ست صفات، ولوحة OALL المفتوحة لنماذج اللغة العربية، التي تأخذ متوسط سبعة مقاييس عربية أصيلة — تنشران اليوم نتائجهما في صورة تقرأها الآلة، فصار الموقع يقرأهما مباشرة ويرتّب عليهما نماذج العالم العربي. وتتبع العلامات القاعدة A، عند الحد الأدنى للنطاق المنشور حيث يوجد. ولم تتغيّر أي درجة قائمة: فهذه اللوحات تُعرض إلى جانب الدليل لا مدموجة فيه، لأنها تقيس شيئًا آخر في ميدان نماذج مختلف.
  2. v2.020 سبتمبر 2026ثلاثة تغييرات، بعد أن أنتجت المنهجية القديمة ترتيبًا لا يصمد أمام التدقيق. (1) لم تعد القاعدة B ترتّب النموذج مقابل بقية نماذج الدليل؛ بل تضع القياس على مقياس ثابت منشور، فصارت الفوارق تعكس اختلافات حقيقية، ولم تعد صدارة الفئة تعني 10 تلقائية، ولم تعد إضافة نموذج تحرّك درجات الآخرين. (2) وحين ينشر المصدر نطاق ثقة، تُحتسب الدرجة عند حده الأدنى، ويُعامل أي تقييم دون 500 صوت معاملة غير المقاس، وتحمل كل درجة نطاقها؛ والنماذج المتداخلة النطاقات تتشارك المرتبة. (3) ولا يزال السعر والإتاحة مقاسين ومعروضين، لكنهما لم يعودا يُحتسبان في الدرجة، التي صارت تقيس القدرة وحدها. وقد تغيّرت كل درجة في الموقع.
  3. v1.219 سبتمبر 2026رُفع حد التغطية من 60% إلى 80%. فصار النموذج يحتاج إلى درجات تغطي 80% على الأقل من وزن معاييره قبل أن ينال درجة إجمالية، حتى لا تتفوق نماذج ذات فجوات كبيرة على نماذج مقاسة بالكامل. والنماذج دون الحد تحتفظ بدرجاتها المفردة وتظهر قيد القياس.
  4. v1.119 سبتمبر 2026روجعت المعايير قبل نشر أي درجة ليكون لكل معيار مصدر مستقل واحد بالضبط. وحُذفت المعايير التي لا مصدر مستقل لها بعد (السرعة، والتزام الصورة بالتعليمات، وحركة الفيديو، وغيرها) حتى يوجد مصدر. وتبقى أدوات الصوت والبحث والمؤسسات بلا تقييم للسبب نفسه. ونُشرت أول الدرجات.
  5. v1.019 سبتمبر 2026نُشرت المنهجية: المعايير، وقواعد التقييم الثلاث، والمتوسط المرجّح، وحد تغطية 60%.