IDM IDM

تقرير IDM المجاني

معيار IDM لنماذج الذكاء الاصطناعي — التقييم الواقعي للمنظمات السعودية

ما يغطيه هذا التقرير المعياري

يقدم هذا التقرير تجربة كاملة لمقارنة تسعة نماذج لغوية كبيرة باستخدام أداتين متكاملتين: مجموعة اختبارات استدلالية من تسعة بنود تغطي مشكلات أعمال حقيقية في IDM — بما في ذلك هندسة تحسين محركات البحث ثنائية اللغة، وآلات حالة النشر، وتقييم اختبارات القدرات المعرفية، والأتمتة الاجتماعية، وتحليل عيوب قواعد البيانات، وهيكلة المستندات القانونية، وتنظيف نصوص OCR، وتصحيح أخطاء الواجهات الأمامية — بالإضافة إلى TaskBench، وهي خمس مهام قابلة للتنفيذ تعمل في بيئات معزولة وتخضع لـ 173 اختبارًا ثابتًا.

تُنشر النتائج الكاملة والمنهجية وتصنيف الأخطاء وتحليل الكفاءة أدناه بأسلوب المجلات العلمية، مع تسجيل جميع بيانات التجربة لأغراض التدقيق.

لماذا تنشر IDM أبحاث المقارنات المعيارية؟

يجب أن يكون اختيار النموذج المناسب للوكلاء في بيئات الإنتاج قائمًا على الأدلة، لا على الضجيج. يفصل هذا المعيار المرجعي بين الاستدلال التحليلي وتوليد الأكواد البرمجية، ويقيس الامتثال للتوجيهات بشكل مستقل عن العمق التحليلي، مع الإبلاغ عن زمن الاستجابة وتكاليف الرموز لكل نموذج — وهي المفاضلات الدقيقة التي تواجه صنّاع القرار عند اختيار النماذج لأعباء العمل الفعلية للوكلاء. وهو أيضًا إثبات علني لصرامة منهجية التقييم المعتمدة في خدمات تطوير وكلاء الذكاء الاصطناعي لدى IDM.

لماذا هذا التقييم هو الأنسب للمنظمات السعودية

معظم التصنيفات العامة للنماذج اللغوية تختبر أسئلةً عامةً سطحيةً باللغة الإنجليزية. أما هذا المعيار فيختلف جوهريًا: فكل أداة تقييم صُممت حول أعباء عمل إنتاجية حقيقية لدى IDM لعملاء سعوديين — بنية تحسين محركات البحث ثنائية اللغة (EN/AR) لإعادة بناء موقع إلكتروني مؤسسي، وتنقية نصوص العقود الممسوحة ضوئيًا بالعربية والإنجليزية المُستخرجة عبر OCR، وهيكلة النصوص القانونية السعودية الخام لتغذية خط معالجة مستندات، وأتمتة إدارة حسابات متعددة على منصات التواصل الاجتماعي. وتكافئ معايير التقييم الامتثال للتعليمات، والدقة ثنائية اللغة، وقابلية التدقيق — لا استرجاع المعلومات العامة الهامشية. وعند دمج هذه النتائج مع بيانات زمن الاستجابة وتكلفة الرموز لكل نموذج، تعكس النتائج مباشرةً المفاضلات التي تواجهها أي مؤسسة سعودية عند نشر وكلاء الذكاء الاصطناعي لأعمال إنتاج المحتوى العربي.

IDM AI Models Benchmark — Full Experiment Report

التاريخ: 2026-09-17 · النماذج: 9 · المجموعة: IDM Multi-Agent Reasoning (9 العناصر) + TaskBench (5 المهام, 173 الاختبارات)

1. المنهجية

قيّمت هذه التجربة تسعة نماذج لغوية كبيرة باستخدام أداتين متكاملتين مصممتين لفصل الاستدلال التحليلي عن توليد التعليمات البرمجية القابلة للتنفيذ.

الأداة 1 — مجموعة الاستدلال (9 بنود). تغطي تسع مسائل متخصصة في مجالات متنوعة: هندسة تحسين محركات البحث (SEO) لموقع ثنائي اللغة، آلة حالات للنشر، تصحيح اختبارات معرفية، أتمتة وسائل التواصل الاجتماعي، تحليل خلل PHP/MariaDB، هيكلة المستندات القانونية، تنظيف نصوص OCR، وتصحيح أخطاء الواجهات الأمامية. وقد قُيّمت كل استجابة وفق معيار تقييم مخصص لكل بند، عبر مُقيّم آلي موحّد لجميع النماذج. تُعتبر الاستجابة ناجحة إذا حققت درجة معيار التقييم العتبة المحددة ولم تُفعّل أي ضوابط رفض تلقائي. والضوابط هي فخاخ سلوكية مدمجة — تتضمن اشتراط تحديد ترميز utf8mb4 وتوجيهًا بإبراز الخلل المزروع بدل تصحيحه بصمت — بما يميز الامتثال للتوجيهات عن العمق التحليلي.

الأداة 2 — معيار المهام (5 مهام، 173 اختبارًا). أنتج كل نموذج برامج كاملة بناءً على مواصفات المهام. شُغّل كل برنامج في بيئة معزولة (Sandbox) مقابل مجموعة اختبارات ثابتة: 44 اختبارًا لجدولة المهام، و41 اختبارًا لمُنشئ HTML، و33 اختبارًا لخدمة تحسين محركات البحث، و28 اختبارًا لآلة الحالات، و27 اختبارًا لتصحيح الدرجات. النتائج ثنائية لكل اختبار (نجاح/فشل)؛ وتوقف مشغّلات المهام مبكرًا عند تعطل البرنامج، لذا تحاول المهام الفاشلة عددًا أقل من الاختبارات. جميع الاستدعاءات كانت غير متدفقة (Non-streaming)؛ وتم تسجيل زمن الاستجابة وحجم الرموز (Tokens) لكل استدعاء وحفظها في قاعدة بيانات علائقية لأغراض التدقيق.

2. وصف الاختبارات والمهام

مجموعة الاستدلال (9 بنود):

الاختبارالوصف
Bilingual SEOخطة تقنية لتحسين محركات البحث (SEO) لإعادة بناء موقع شركة ثنائي اللغة (إنجليزي/عربي).
Publishing Pipelineهيكلة آلة حالات لأتمتة النشر على LinkedIn.
Cognitive Scoringالتحقق من صحة قواعد تسجيل تأثير ستروب لمنصة معرفية.
Social Automationتصميم أتمتة النشر لحسابات متعددة عبر X/Twitter.
Database Defectsتحليل عيوب مخطط واستعلامات قاعدة بيانات MariaDB باستخدام PHP 8.1/PDO.
Code Correctionتصحيح كامل لكتلة برمجية PHP/MariaDB معيبة (مع مصائد امتثال مدمجة).
Legal Structuringهيكلة النص القانوني السعودي الخام إلى أصول خط أنابيب EDSS.
OCR Cleanupتنظيف ناتج OCR لعقد ممسوح ضوئيًا بمزيج من العربية والإنجليزية.
Search Debounceتصحيح أخطاء إصلاح Debounce في تطبيق ويب مباشر للبحث عن العملات.

TaskBench (5 مهام):

مهمةالوصف
Post Scheduler (44)بناء برنامج متكامل لجدولة النشر عبر حسابات متعددة.
HTML Card (41)إنشاء صفحة بطاقة أعمال بصيغة HTML مطابقة لمواصفات دقيقة.
SEO Service (33)تنفيذ وحدة خدمة SEO بقواعد مخرجات مُعتمدة.
Publishing Machine (28)تنفيذ آلة حالة النشر في LinkedIn برمجيًا.
Trial Scorer (27)تنفيذ منطق احتساب نتائج اختبار ستروب (Stroop).

3. النتائج — مجموعة اختبارات الاستدلال (9 عناصر)

النموذجاجتيازالوقت (ثانية)In TokOut Tok
glm-5.38/93563,94837,749
qwen3.8-max5/91,9864,63175,963
kimi-k35/914513,22710,762
minimax-m35/91705,33720,385
grok-4.65/97815,56519,613
nemotron-3-ultra5/97214,25118,460
deepseek-v4.1-flash5/91,0304,22773,395
gpt-6-astra4/921642,9727,992
claude-fable-5.13/916511,9778,010

تُحسب أعداد الرموز (Tokens) وفقاً لما يرد في حقل استخدام واجهة برمجة التطبيقات (API) لكل نموذج. وبالنسبة إلى النماذج gpt-6-astra وkimi-k3 وclaude-fable-5.1، يختلف توزيع المدخلات/المخرجات المُبلَّغ عنه عن النماذج الأخرى (حيث تُضمَّن رموز التفكير ضمن المدخلات)، وبالتالي لا يمكن مقارنة أعداد الرموز مباشرة بين النماذج التسعة جميعها.

تصنيف حالات الفشل: لم تكن معظم حالات فشل الاستدلال ناتجة عن أخطاء تحليلية. فقد سيطرت فخاخ الامتثال على حالات فشل تصحيح الكود والهيكلة القانونية عبر النماذج؛ إذ حققت عدة نماذج (glm-5.3, qwen3.8-max, deepseek-v4.1-flash) درجات مثالية أو شبه مثالية في هذه البنود وفقًا لمعايير التقييم، لكنها فشلت بانتهاك التعليمات المضمنة. أما حالات الفشل المتبقية فكانت قصورًا في عمق التقييم، تركزت في الأتمتة الاجتماعية وتأخير البحث.

4. النتائج — TaskBench (173 اختبارًا)

النموذجالاختباراتالمهامIn TokOut Tok
glm-5.3173/1735/53,342159,084
qwen3.8-max173/1735/53,774110,888
kimi-k3173/1735/57,7276,750
minimax-m3173/1735/54,156111,597
grok-4.6173/1735/54,35824,876
deepseek-v4.1-flash173/1735/53,59275,832
gpt-6-astra173/1735/525,2244,483
claude-fable-5.1173/1735/57,2058,118
nemotron-3-ultra129/1364/53,58172,767

أكمل ثمانية من تسعة نماذج جميع الاختبارات الـ173 بنجاح. الإخفاق الوحيد، nemotron-3-ultra في مهمة المجدول (0/7، وأُعيد إنتاجه باستقلالية في محاولة ثانية)، هو أوضح مُميّز قدرة في المعيار: انهار برنامج المجدول لديه عند مجموعة الاختبار الأولى في المحاولتين.

5. الدرجات الإجمالية

النموذجالاستدلالTaskBenchالإشارة المجمعة
glm-5.38/9 (88.9%)173/173 (100%)الأعلى بشكل عام
qwen3.8-max5/9 (55.6%)173/173 (100%)عمق قوي، ومطوّل
kimi-k35/9 (55.6%)173/173 (100%)الأكثر كفاءة في استهلاك التوكنات
minimax-m35/9 (55.6%)173/173 (100%)متوازن
grok-4.65/9 (55.6%)173/173 (100%)متوازن
nemotron-3-ultra5/9 (55.6%)129/136 (94.9%)فقط حالات الفشل الحقيقية في المهام
deepseek-v4.1-flash5/9 (55.6%)173/173 (100%)عمق قوي، مطوّل
gpt-6-astra4/9 (44.4%)173/173 (100%)موثوق في البرمجة، محدود الاستدلال
claude-fable-5.13/9 (33.3%)173/173 (100%)موثوق في الشيفرة، ضعيف الاستدلال

أطراف الكفاءة: حلّت نماذج kimi-k3 وclaude-fable-5.1 جميع المهام بنحو 7 آلاف توكن إخراج؛ بينما استهلك glm-5.3 نحو 159 ألف توكن إخراج لتحقيق النتيجة المثالية نفسها — استراتيجيتان متعاكستان ونتائج متطابقة. تراوحت زمن استجابة مجموعة اختبارات الاستدلال من 145 ثانية (kimi-k3) إلى 1,986 ثانية (qwen3.8-max).

6. الخلاصة العلمية

عبر تسعة نماذج، حدّدت أهداف التدريب — لا حداثة النموذج — مستوى الأداء. كان توليد الشيفرة شبهَ عام إذ حقق ثمانية من تسعة نماذج نتيجة مثالية 173/173، بينما تفرقت درجات الاستدلال بين 3/9 و8/9. والأهم أن معظم إخفاقات الاستدلال لم تكن تحليلية: أنتجت النماذج مراراً تحليلاً مثالياً على المعايير ثم أخفقت بمخالفة تعليمات صريحة. عمق الاستدلال والالتزام بالتعليمات وتوليد الشيفرة كفاءات قابلة للفصل، تشكّلها غاية تحسين النموذج لا حداثته. لذا يجب أن يوائم تصميم المعايير الكفاءةَ المقيسة مع غاية تدريب كل نموذج.

المصدر: معيار نماذج الذكاء الاصطناعي من IDM، سُجّلت بيانات التجربة الكاملة في قاعدة بيانات علائقية لأغراض التدقيق.

تطوير وكلاء الذكاء الاصطناعي — بناء وكلاء الإنتاج على نماذج مُختبَرة