دليل للذكاء الاصطناعي يضع الأدلة أولاً: اختبر الادعاءات، لا لغة التسويق ابدأ اختبار AGI
مختبر تجريدي لتقييم الذكاء الاصطناعي العام متصل بمحطات متعددة للقدرات

الاتساع · التعلّم · الاستقلالية · المتانة

اختبار الذكاء الاصطناعي العام (AGI)

هل يستطيع نظام واحد أن يتعلّم ويستدل ويعمل عبر مجالات غير مألوفة، أم أننا نخلط بين مجموعة من المهارات المبهرة والذكاء العام؟

10 حالات لاختبار الأدلة لا شهادات زائفة دليل مرتبط بالأبحاث

توجيه مهم

لا يوجد اختبار رسمي عالمي للذكاء الاصطناعي العام

الذكاء الاصطناعي العام مفهوم بحثي تتنافس حوله تعريفات مختلفة. لا تعلن هذه الصفحة أن أي نظام بعينه قد تجاوز، أو لم يتجاوز، خط نهاية سحرياً. يقيس الاختبار مدى دقتك في تفسير أدلة القدرات. أما تقييم نظام حقيقي فيتطلب مهام خاصة، وخطوط أساس بشرية، وإفصاحاً عن الأدوات والتكاليف، واختبارات للمتانة، وتكراراً مستقلاً للنتائج.

تمت مراجعة الأدلة August 2026

لا يكفي اختبار واحديتطلب AGI أدلة متضافرةعبر الاتساع والعمق والقدرة على التكيّف
العمومية ≠ الكمالالبشر يتمتعون بقدرات عامة لكنهم يخطئونوتظل الموثوقية ضرورية
النظام بأكمله مهميمكن للنماذج استخدام الذاكرة والأدواتاذكر حدود التقييم كاملة
القدرة ≠ السلامةكل سؤال منهما يحتاج إلى أدلة مستقلةالقوة لا تضمن المواءمة

مختبر تفاعلي للمقيّمين

اختبار أدلة AGI

تصف كل حالة ادعاءً بشأن نظام ذكاء اصطناعي. اختر الاستنتاج الأكثر قابلية للدفاع عنه—لا الأكثر إثارة ولا الأكثر تشككاً.

التقدّم0/10

ما الذي تعنيه إجاباتك: هذا اختبار لمهارتك في تقييم ادعاءات AGI. تعني الدرجة المرتفعة أنك ميّزت في هذه الحالات بين الإنجاز الضيق، والتعميم الحقيقي، والاستدلال غير المدعوم. وهو لا يقيس معدل ذكائك ولا يحدد ما إذا كنت ذكاءً اصطناعياً عاماً.

ابحث عن الدليل المباشر

اسأل أولاً عمّا قاسه الرصد فعلياً قبل قبول ادعاء أوسع.

تجنب الطرفين

غالباً ما يكون كل من «معيار واحد يثبت AGI» و«كل التقييمات عديمة الفائدة» مبالغاً فيه.

01صلاحية المعيار المرجعييسجل نظام 96% في معيار استدلال عام مشهور بعد سنوات من النقاش عنه على الإنترنت. ما أقوى استنتاج يمكن استخلاصه؟
02نقل المعرفةبعد عرض مثالين فقط، يتعلم نظام بيئة غير مألوفة للتحكم البصري، ويستنتج الهدف، ويتكيّف بعد الفشل، ثم ينجح بكفاءة. ما الذي يدعمه هذا مباشرة؟
03الاتساعيتفوق وكيل برمجي على معظم المحترفين تقريباً في مهام برمجية محددة جيداً، لكنه لا يستطيع تخطيط السفر أو تفسير المخططات أو تعلّم ألعاب جديدة بموثوقية. كيف ينبغي تصنيفه؟
04الاستقلاليةينجز وكيل مهام بحثية تستغرق ثماني ساعات باستخدام الأدوات، لكن على إنسان تصحيحه كل 30 دقيقة. ما التفسير المتحفظ؟
05التواصليُحكم على روبوت محادثة بأنه إنسان في محادثات قصيرة معماة. ما الادعاء المتعلق بـ AGI الذي يترتب على ذلك؟
06المتانةيعمل نموذج بمستوى بالغ ماهر في ستة مجالات، ثم ينهار عندما تتغير الصيغ والأدوات والصياغة قليلاً. ما الذي ينقصه؟
07النطاقيطابق نظام البشر المهرة في الأعمال المعرفية غير المادية لكنه لا يستطيع التعامل مع الأشياء. هل هو AGI؟
08حدود النظاملا ينجح نموذج إلا عند وصله بالبحث وتنفيذ الشفرة والذاكرة والأدوات المتخصصة. ماذا ينبغي أن يذكر تقرير التقييم؟
09الحالات الذهنيةيقول نموذج: «أنا واعٍ وقد حققت AGI». ماذا يثبت هذا؟
10التكرارتسجل فرق مستقلة اختبارات مسبقاً، وتستخدم مهام خاصة، وتقارن بخطوط أساس لبشر مهرة، وتفصح عن التكاليف، وتعيد إنتاج نتائج واسعة. لماذا يُعد هذا أقوى؟

ابدأ بالمصطلح المختلف عليه

ما الذكاء الاصطناعي العام؟

عائلة من التعريفات، لا كيان واحد متفق عليه

تجمع معظم التعريفات بين العمومية—أي الكفاءة عبر نطاق واسع من المهام—وبين الأداء, التعلّم ودرجة من الاستقلالية. يؤكد ميثاق OpenAI على التفوق على البشر في معظم الأعمال ذات القيمة الاقتصادية. ويفصل إطار DeepMind «مستويات AGI» بين الاتساع والعمق. بينما يركز فرانسوا شولي على كفاءة اكتساب المهارات في المهام الجديدة.

أفضل ممارسة: لا تسأل فقط «هل هو AGI؟». بل اسأل: «وفق أي تعريف تشغيلي، وعبر أي مهام، وعند أي رتبة مئينية بشرية، وباستخدام أي أدوات وتكاليف ومعدل تدخل؟»

هدف متعدد الأبعاد

ستة أبعاد ينبغي أن يصمد أمامها أي ادعاء بـ AGI

الاتساعمجالات كثيرة
العمقالمستوى مقارنة بالبشر
التعلّماكتساب مهارات جديدة بكفاءة
نقل المعرفةاستخدام المعرفة في سياقات أخرى
المتانةالصمود أمام التحولات والهجمات
الاستقلاليةإنجاز مهام طويلة

أداء بلا عمومية

قد تتفوق محركات الشطرنج وأنظمة بنية البروتين على البشر في مجال محدد من دون أن تصبح AGI.

عمومية بلا كمال

ينقل البشر المعرفة بين المجالات رغم أخطائهم. واشتراط الكمال الحرفي يضع معياراً أعلى من الذكاء العام البشري.

قدرة بلا كفاءة

قد يتغير معنى النتيجة إذا كانت تستهلك في كل مهمة قدراً هائلاً من الحوسبة أو الوقت أو المساعدة البشرية.

أبعد من إجابة نعم أو لا

AGI بوصفه مستويات من الاتساع والأداء

يعامل أحد الأطر المؤثرة القدرة على أنها مصفوفة. ويغطي «العام» نطاقاً واسعاً من المهام غير المادية، بينما يُقارن الأداء بأداء بالغين مهرة.

الأداء
ضيق
عام
التفسير
ناشئ
كفاءة مفيدة في بعض المهام
قدرة متفاوتة عبر مهام كثيرة
أدنى إجمالاً من كفاءة بالغ ماهر
كفء
على الأقل بمستوى وسيط البالغين المهرة في مهمة محدودة
AGI كفءعلى الأقل بمستوى وسيط البالغين المهرة عبر مهام واسعة
يتطلب اتساعاً وأداءً موثوقاً
خبير
على الأقل عند المئين التسعين في مهمة محدودة
AGI خبير عبر مهام واسعة
ادعاء أقوى بكثير على مستوى الاقتصاد بأكمله
فوق بشري
يتفوق على جميع البشر في مجال واحد
يتفوق على البشر على نطاق واسع
يدخل نطاق ASI

أدوات القياس

لا يوجد معيار مرجعي يقيس العقل كله

التجريد الجديد

ARC-AGI

يستهدف استنباط القواعد من أمثلة قليلة وكفاءة اكتساب المهارات في مهام بصرية غير مألوفة. وهو مفيد لقياس التكيف المرن، لكنه ليس اختباراً كاملاً للغة أو الوكالة أو العالم الحقيقي.

العمل طويل الأفق

تقييمات الوكلاء

تقيس ما إذا كانت الأنظمة تستطيع التخطيط واستخدام الأدوات والتعافي من الأخطاء وإنهاء المشروعات عبر آفاق زمنية أطول. وتعتمد النتائج بدرجة كبيرة على البنية المساندة والبيئة.

معرفة واسعة

حزم الاختبارات

تغطي تخصصات كثيرة بكفاءة، لكنها قد تكافئ المعرفة المخزنة ومهارة أداء الاختبارات والتعرض السابق أكثر مما تكافئ سرعة التعلّم.

تحذير من تشبّع المعايير المرجعية: بمجرد أن يصبح الاختبار هدفاً، يبدأ المطورون في التحسين نحوه. احتفظ بمجموعات اختبار خاصة، ودوّر المهام، ودقق في تلوث البيانات، وحافظ على مجموعات مقارنة بشرية ذات معنى.

سُلّم الأدلة

ما الذي يجعل ادعاء AGI مقنعاً؟

1عرض توضيحيسلوك مثير للاهتمام يسهل انتقاؤه
2معيار مرجعي عامقابل للمقارنة لكنه عرضة للتعرض المسبق
3تقييم خاصمهام جديدة ووصول مضبوط
4خط أساس لبشر مهرةمواءمة الاتساع والوقت والأدوات والتكاليف
5تكرار مستقلأدلة قابلة للتدقيق ومتينة واختبارها خصومي
  1. 01

    حدّد حدود النظام مسبقاً

    يُحسب النموذج والذاكرة والبحث وتنفيذ الشفرة والروبوتات والمحفزات والمساعدة البشرية جميعاً ضمن النظام.

  2. 02

    خذ عينة من فضاء المهام

    الادعاء الواسع يحتاج إلى مهام تمثيلية، لا إلى مجموعة مختارة من أبرز النتائج.

  3. 03

    اختبر التعلّم الجديد

    قِس مدى سرعة اكتساب النظام لمهارات لم يكن بوسعه الاستعداد لها أثناء التدريب.

  4. 04

    قِس الموثوقية

    متوسط النجاح، والإخفاقات الكارثية، والمعايرة، والتعافي، وتحول التوزيع كلها أمور مهمة.

  5. 05

    طابق ظروف البشر

    قارن الوقت والأدوات والتعليمات والحوافز وإتاحة المواد المرجعية.

  6. 06

    افصل القدرة عن السلامة

    بعد إظهار ما يستطيع النظام فعله، اختبر ما إذا كان يظل قابلاً للتحكم ومفيداً.

من المحاكاة إلى التكيّف

تاريخ موجز لفكرة AGI

1950
محطة 01

تورنغ يعيد صياغة ذكاء الآلة

جعلت لعبة المحاكاة السلوك القابل للملاحظة محوراً أساسياً، لكن محاكاة المحادثة لم تصبح قط تعريفاً كاملاً للذكاء العام.

1956
محطة 02

الذكاء الاصطناعي يصبح مجالاً بحثياً

ذهب اقتراح دارتموث إلى أن التعلّم والذكاء قد يكون من الممكن وصفهما بدقة تكفي لمحاكاتهما بالآلات.

1980s
محطة 03

الأنظمة الخبيرة تكشف مشكلة الضيق

أظهر الأداء المرتفع في مجالات محدودة أن الخبرة قد تكون قوية من دون أن تكون عامة أو قابلة للتكيّف.

1997–2016
محطة 04

محطات ضيقة فوق بشرية

تفوقت Deep Blue وWatson وAlphaGo على بشر أقوياء في مهام محددة، مع بقائها مختلفة عن شخص ذي قدرات عامة.

2019
محطة 05

ARC يستهدف كفاءة اكتساب المهارات

اقترح فرانسوا شولي قياس الذكاء من خلال كفاءة اكتساب الأنظمة لمهارات جديدة، وقدم «مجموعة التجريد والاستدلال» (ARC).

2023
محطة 06

إطار «مستويات AGI»

اقترح باحثو Google DeepMind تصنيف الأنظمة وفق عمق الأداء واتساع المهام معاً، من المستوى الناشئ إلى فوق البشري.

2024–26
محطة 07

تطور معايير الاستدلال والوكلاء

تختبر ARC-AGI وتقييمات الوكلاء طويلة الأفق بصورة متزايدة التكيف واستخدام الأدوات والتعلّم التفاعلي، بينما يظل تشبّع المعايير وتلوثها مصدر قلق.

اليوم
محطة 08

لا توجد شهادة عالمية

يبقى AGI مفهوماً محل خلاف. وأي ادعاء جاد يجب أن يحدد تعريفه ونطاقه وخط الأساس البشري وحدود النظام ومعيار الأدلة.

حقائق صعبة

لماذا يصعب قياس AGI؟

فضاء مهام غير محدد

«كل المهام المعرفية» ليست عينة محدودة ومحايدة. فالخيارات الاقتصادية والثقافية تشكّل ما يُحتسب.

غموض بيانات التدريب

من دون معرفة ما رآه النظام، يصعب فصل الاسترجاع والحفظ عن التعلّم الجديد.

حدود نظام متحركة

يمكن للأدوات والهياكل المساندة أن تغيّر الأداء جذرياً. فالادعاءات الخاصة بالنموذج وحده وتلك الخاصة بالنظام الكامل تجيب عن أسئلة مختلفة.

خط أساس بشري متحرك

يعتمد أداء البشر على الخبرة والدافعية والوقت والتعاون والوصول إلى الأدوات.

يمكن للأدلة القوية أن تُظهر

  • أداءً واسعاً مقارنة ببشر محددين بوضوح
  • تعلماً سريعاً في مهام خاصة وجديدة
  • نقلاً متيناً للمعرفة واستقلالية طويلة الأفق
  • تكاليف وتدخلات وأنماط فشل معروفة

لا يمكن لوسم AGI أن يُثبت تلقائياً

  • الوعي أو المكانة الأخلاقية
  • المواءمة مع القيم البشرية
  • التحرر من الأخطاء الكارثية
  • كفاءة متساوية في كل سياق مادي

إجابات واضحة

الأسئلة الشائعة حول AGI

إلى ماذا يشير اختصار AGI؟

الذكاء الاصطناعي العام. ويشير عادة إلى ذكاء اصطناعي يتمتع بكفاءة واسعة وقابلة للتكيّف عبر مهام كثيرة، بدلاً من أداء استثنائي في مجال ضيق واحد. وتختلف التعريفات بشأن الاستقلالية والتجسيد والمستوى البشري المطلوب.

هل يوجد اختبار رسمي واحد لـ AGI؟

لا. لا يوجد اختبار أو حد فاصل معتمد عالمياً. يستخدم الباحثون مجموعات من المعايير المرجعية، وخطوط أساس بشرية، وتعلّم مهام جديدة، وتقييمات للوكلاء، وأطراً تجمع بين الاتساع والأداء.

هل تختبر هذه الصفحة ما إذا كان نموذج حقيقي هو AGI؟

لا. يختبر القسم التفاعلي قدرتك على تفسير ادعاءات الأدلة. أما اعتماد نظام حقيقي فيتطلب الوصول إليه، وتقييمات خاصة، وشروطاً موثقة، وتكراراً مستقلاً للنتائج.

هل تحقق AGI؟

لا يوجد إجماع لأن التعريفات والعتبات تختلف. وينبغي للادعاءات القوية أن تحدد التعريف التشغيلي بدقة بدلاً من التعامل مع AGI كحدث ثنائي متفق عليه عالمياً.

هل يمكن لمعيار مرجعي واحد إثبات AGI؟

لا يغطي أي معيار واحد الاتساع والمتانة وكفاءة التعلّم والاستقلالية والموثوقية في العالم الحقيقي التي ترتبط عادة بـ AGI. وقد يقدم المعيار دليلاً مهماً على مكوّن واحد فقط.

هل اجتياز اختبار تورنغ هو نفسه AGI؟

لا. يقيس اختبار تورنغ عدم قابلية التمييز في المحادثة ضمن بروتوكول معين، بينما تتعلق ادعاءات AGI عادة بكفاءة أوسع وبالتعلّم ونقل المعرفة.

هل يجب أن يكون AGI واعياً؟

ليس وفق معظم التعريفات التشغيلية القائمة على القدرة. فالوعي مسألة علمية وفلسفية منفصلة وغير محسومة.

هل يحتاج AGI إلى جسم روبوت؟

يعتمد على التعريف. تركز بعض الأطر صراحة على المهام المعرفية غير المادية، بينما ترى أخرى أن العمومية الشبيهة بالبشر تتطلب الإدراك والفعل في العالم المادي.

ما تلوث المعايير المرجعية؟

يحدث عندما تدخل مهام التقييم أو نسخ قريبة منها في بيانات التدريب أو الضبط أو تطوير المحفزات، بحيث قد تعكس الدرجة العالية تعرضاً سابقاً بدلاً من التعميم على مشكلات جديدة فعلاً.

ما الفرق بين النموذج والوكيل؟

يحوّل النموذج المدخلات إلى مخرجات. أما النظام الوكيلي فقد يجمع نموذجاً مع ذاكرة وحلقات تخطيط وأدوات وبيانات خارجية وقدرة على تنفيذ أفعال عبر الزمن.

ماذا يأتي بعد AGI؟

الذكاء الاصطناعي الفائق، أو ASI، مستوى افتراضي يتجاوز فيه ذكاء الآلة الواسع القدرات البشرية بدرجة كبيرة عبر معظم المجالات المعرفية ذات الصلة أو كلها تقريباً.

هل يمكن أن يكون AGI آمناً لكنه غير موثوق؟

تتداخل السلامة والموثوقية لكنهما ليستا الشيء نفسه. فقد يكون النظام متوافق النية لكنه كثير الأخطاء، أو قادراً وموثوقاً تقنياً بينما يسعى إلى أهداف ضارة. وكلا الجانبين يحتاج إلى أدلة مخصصة.

تتبّع الإطار

المصادر الأولية والبحثية

ميثاق OpenAI

تعريف اقتصادي بارز: أنظمة عالية الاستقلالية تتفوق على البشر في معظم الأعمال ذات القيمة الاقتصادية.

فتح المصدر

Google DeepMind: مستويات AGI

إطار يقوم على عمق الأداء واتساع القدرات.

فتح المصدر

شولي: حول قياس الذكاء

يعرّف الذكاء حول كفاءة اكتساب المهارات ويقدم ARC.

فتح المصدر

مستودع ARC-AGI

المهام والأساليب والوثائق الرسمية لمجموعة التجريد والاستدلال.

فتح المصدر

ARC-AGI-3

معيار استدلال تفاعلي للاستكشاف واكتساب الأهداف وبناء نماذج عالم قابلة للتكيّف.

فتح المصدر

مؤشر ستانفورد للذكاء الاصطناعي

أدلة سنوية على قدرات الذكاء الاصطناعي واتجاهات المعايير والاستثمار والسياسات والآثار.

فتح المصدر

إطار NIST لإدارة مخاطر الذكاء الاصطناعي

إطار منظم لحوكمة مخاطر الذكاء الاصطناعي ورسمها وقياسها وإدارتها.

فتح المصدر

تورنغ (1950)

الورقة الأصلية للعبة المحاكاة والحجة التأسيسية حول ذكاء الآلة.

فتح المصدر