IDM AI Models Benchmark — Full Experiment Report
1. المنهجية
قيّمت هذه التجربة تسعة نماذج لغوية كبيرة باستخدام أداتين متكاملتين مصممتين لفصل الاستدلال التحليلي عن توليد التعليمات البرمجية القابلة للتنفيذ.
الأداة 1 — مجموعة الاستدلال (9 بنود). تغطي تسع مسائل متخصصة في مجالات متنوعة: هندسة تحسين محركات البحث (SEO) لموقع ثنائي اللغة، آلة حالات للنشر، تصحيح اختبارات معرفية، أتمتة وسائل التواصل الاجتماعي، تحليل خلل PHP/MariaDB، هيكلة المستندات القانونية، تنظيف نصوص OCR، وتصحيح أخطاء الواجهات الأمامية. وقد قُيّمت كل استجابة وفق معيار تقييم مخصص لكل بند، عبر مُقيّم آلي موحّد لجميع النماذج. تُعتبر الاستجابة ناجحة إذا حققت درجة معيار التقييم العتبة المحددة ولم تُفعّل أي ضوابط رفض تلقائي. والضوابط هي فخاخ سلوكية مدمجة — تتضمن اشتراط تحديد ترميز utf8mb4 وتوجيهًا بإبراز الخلل المزروع بدل تصحيحه بصمت — بما يميز الامتثال للتوجيهات عن العمق التحليلي.
الأداة 2 — معيار المهام (5 مهام، 173 اختبارًا). أنتج كل نموذج برامج كاملة بناءً على مواصفات المهام. شُغّل كل برنامج في بيئة معزولة (Sandbox) مقابل مجموعة اختبارات ثابتة: 44 اختبارًا لجدولة المهام، و41 اختبارًا لمُنشئ HTML، و33 اختبارًا لخدمة تحسين محركات البحث، و28 اختبارًا لآلة الحالات، و27 اختبارًا لتصحيح الدرجات. النتائج ثنائية لكل اختبار (نجاح/فشل)؛ وتوقف مشغّلات المهام مبكرًا عند تعطل البرنامج، لذا تحاول المهام الفاشلة عددًا أقل من الاختبارات. جميع الاستدعاءات كانت غير متدفقة (Non-streaming)؛ وتم تسجيل زمن الاستجابة وحجم الرموز (Tokens) لكل استدعاء وحفظها في قاعدة بيانات علائقية لأغراض التدقيق.
2. وصف الاختبارات والمهام
مجموعة الاستدلال (9 بنود):
| الاختبار | الوصف |
|---|---|
| Bilingual SEO | خطة تقنية لتحسين محركات البحث (SEO) لإعادة بناء موقع شركة ثنائي اللغة (إنجليزي/عربي). |
| Publishing Pipeline | هيكلة آلة حالات لأتمتة النشر على LinkedIn. |
| Cognitive Scoring | التحقق من صحة قواعد تسجيل تأثير ستروب لمنصة معرفية. |
| Social Automation | تصميم أتمتة النشر لحسابات متعددة عبر X/Twitter. |
| Database Defects | تحليل عيوب مخطط واستعلامات قاعدة بيانات MariaDB باستخدام PHP 8.1/PDO. |
| Code Correction | تصحيح كامل لكتلة برمجية PHP/MariaDB معيبة (مع مصائد امتثال مدمجة). |
| Legal Structuring | هيكلة النص القانوني السعودي الخام إلى أصول خط أنابيب EDSS. |
| OCR Cleanup | تنظيف ناتج OCR لعقد ممسوح ضوئيًا بمزيج من العربية والإنجليزية. |
| Search Debounce | تصحيح أخطاء إصلاح Debounce في تطبيق ويب مباشر للبحث عن العملات. |
TaskBench (5 مهام):
| مهمة | الوصف |
|---|---|
| Post Scheduler (44) | بناء برنامج متكامل لجدولة النشر عبر حسابات متعددة. |
| HTML Card (41) | إنشاء صفحة بطاقة أعمال بصيغة HTML مطابقة لمواصفات دقيقة. |
| SEO Service (33) | تنفيذ وحدة خدمة SEO بقواعد مخرجات مُعتمدة. |
| Publishing Machine (28) | تنفيذ آلة حالة النشر في LinkedIn برمجيًا. |
| Trial Scorer (27) | تنفيذ منطق احتساب نتائج اختبار ستروب (Stroop). |
3. النتائج — مجموعة اختبارات الاستدلال (9 عناصر)
| النموذج | اجتياز | الوقت (ثانية) | In Tok | Out Tok |
|---|---|---|---|---|
| glm-5.3 | 8/9 | 356 | 3,948 | 37,749 |
| qwen3.8-max | 5/9 | 1,986 | 4,631 | 75,963 |
| kimi-k3 | 5/9 | 145 | 13,227 | 10,762 |
| minimax-m3 | 5/9 | 170 | 5,337 | 20,385 |
| grok-4.6 | 5/9 | 781 | 5,565 | 19,613 |
| nemotron-3-ultra | 5/9 | 721 | 4,251 | 18,460 |
| deepseek-v4.1-flash | 5/9 | 1,030 | 4,227 | 73,395 |
| gpt-6-astra | 4/9 | 216 | 42,972 | 7,992 |
| claude-fable-5.1 | 3/9 | 165 | 11,977 | 8,010 |
تُحسب أعداد الرموز (Tokens) وفقاً لما يرد في حقل استخدام واجهة برمجة التطبيقات (API) لكل نموذج. وبالنسبة إلى النماذج gpt-6-astra وkimi-k3 وclaude-fable-5.1، يختلف توزيع المدخلات/المخرجات المُبلَّغ عنه عن النماذج الأخرى (حيث تُضمَّن رموز التفكير ضمن المدخلات)، وبالتالي لا يمكن مقارنة أعداد الرموز مباشرة بين النماذج التسعة جميعها.
تصنيف حالات الفشل: لم تكن معظم حالات فشل الاستدلال ناتجة عن أخطاء تحليلية. فقد سيطرت فخاخ الامتثال على حالات فشل تصحيح الكود والهيكلة القانونية عبر النماذج؛ إذ حققت عدة نماذج (glm-5.3, qwen3.8-max, deepseek-v4.1-flash) درجات مثالية أو شبه مثالية في هذه البنود وفقًا لمعايير التقييم، لكنها فشلت بانتهاك التعليمات المضمنة. أما حالات الفشل المتبقية فكانت قصورًا في عمق التقييم، تركزت في الأتمتة الاجتماعية وتأخير البحث.
4. النتائج — TaskBench (173 اختبارًا)
| النموذج | الاختبارات | المهام | In Tok | Out Tok |
|---|---|---|---|---|
| glm-5.3 | 173/173 | 5/5 | 3,342 | 159,084 |
| qwen3.8-max | 173/173 | 5/5 | 3,774 | 110,888 |
| kimi-k3 | 173/173 | 5/5 | 7,727 | 6,750 |
| minimax-m3 | 173/173 | 5/5 | 4,156 | 111,597 |
| grok-4.6 | 173/173 | 5/5 | 4,358 | 24,876 |
| deepseek-v4.1-flash | 173/173 | 5/5 | 3,592 | 75,832 |
| gpt-6-astra | 173/173 | 5/5 | 25,224 | 4,483 |
| claude-fable-5.1 | 173/173 | 5/5 | 7,205 | 8,118 |
| nemotron-3-ultra | 129/136 | 4/5 | 3,581 | 72,767 |
أكمل ثمانية من تسعة نماذج جميع الاختبارات الـ173 بنجاح. الإخفاق الوحيد، nemotron-3-ultra في مهمة المجدول (0/7، وأُعيد إنتاجه باستقلالية في محاولة ثانية)، هو أوضح مُميّز قدرة في المعيار: انهار برنامج المجدول لديه عند مجموعة الاختبار الأولى في المحاولتين.
5. الدرجات الإجمالية
| النموذج | الاستدلال | TaskBench | الإشارة المجمعة |
|---|---|---|---|
| glm-5.3 | 8/9 (88.9%) | 173/173 (100%) | الأعلى بشكل عام |
| qwen3.8-max | 5/9 (55.6%) | 173/173 (100%) | عمق قوي، ومطوّل |
| kimi-k3 | 5/9 (55.6%) | 173/173 (100%) | الأكثر كفاءة في استهلاك التوكنات |
| minimax-m3 | 5/9 (55.6%) | 173/173 (100%) | متوازن |
| grok-4.6 | 5/9 (55.6%) | 173/173 (100%) | متوازن |
| nemotron-3-ultra | 5/9 (55.6%) | 129/136 (94.9%) | فقط حالات الفشل الحقيقية في المهام |
| deepseek-v4.1-flash | 5/9 (55.6%) | 173/173 (100%) | عمق قوي، مطوّل |
| gpt-6-astra | 4/9 (44.4%) | 173/173 (100%) | موثوق في البرمجة، محدود الاستدلال |
| claude-fable-5.1 | 3/9 (33.3%) | 173/173 (100%) | موثوق في الشيفرة، ضعيف الاستدلال |
أطراف الكفاءة: حلّت نماذج kimi-k3 وclaude-fable-5.1 جميع المهام بنحو 7 آلاف توكن إخراج؛ بينما استهلك glm-5.3 نحو 159 ألف توكن إخراج لتحقيق النتيجة المثالية نفسها — استراتيجيتان متعاكستان ونتائج متطابقة. تراوحت زمن استجابة مجموعة اختبارات الاستدلال من 145 ثانية (kimi-k3) إلى 1,986 ثانية (qwen3.8-max).
6. الخلاصة العلمية
عبر تسعة نماذج، حدّدت أهداف التدريب — لا حداثة النموذج — مستوى الأداء. كان توليد الشيفرة شبهَ عام إذ حقق ثمانية من تسعة نماذج نتيجة مثالية 173/173، بينما تفرقت درجات الاستدلال بين 3/9 و8/9. والأهم أن معظم إخفاقات الاستدلال لم تكن تحليلية: أنتجت النماذج مراراً تحليلاً مثالياً على المعايير ثم أخفقت بمخالفة تعليمات صريحة. عمق الاستدلال والالتزام بالتعليمات وتوليد الشيفرة كفاءات قابلة للفصل، تشكّلها غاية تحسين النموذج لا حداثته. لذا يجب أن يوائم تصميم المعايير الكفاءةَ المقيسة مع غاية تدريب كل نموذج.