من لعبة الحرب إلى القرارات المعقدة.. نظام ذكاء اصطناعي يتفوق على البشر في لعبة المعلومات الخفية
يتفوق على أفضل اللاعبين بقدرة على التخطيط أثناء اللعب.. تعلم بكفاءة أعلى ويهزم أبطال «ستراتيجو» بفارق قياسي
طور باحثون من معهد ماساتشوستس للتكنولوجيا (MIT) وجامعة كارنيجي ميلون وجامعة نيويورك وجامعة ستانفورد نظامًا جديدًا للذكاء الاصطناعي تمكن من التغلب على أفضل اللاعبين البشريين في لعبة الحرب اللوحية «ستراتيجو» (Stratego) بفارق كبير، في إنجاز لم يسبق لأنظمة الذكاء الاصطناعي تحقيقه في هذه اللعبة.
ويتميز النظام، الذي أطلق عليه الباحثون اسم «أتاراكسوس» (Ataraxos)، بقدرته على التعامل مع الألعاب التي تتضمن معلومات مخفية، مع الاعتماد على عدد أقل بكثير من مباريات التدريب مقارنة بأنظمة سابقة، فضلًا عن استخدامه التخطيط أثناء اتخاذ القرار لتحسين اختياراته لحظة بلحظة.
ونُشرت نتائج البحث في مجلة «Nature»، ويشير الباحثون إلى أن المنهجية المستخدمة قد تكون قابلة للتكييف مع مشكلات واقعية تتضمن معلومات غير مكتملة، مثل المفاوضات التجارية والأمن السيبراني، إلى جانب مجالات أخرى تتطلب اتخاذ قرارات في ظل عدم معرفة جميع المعطيات.
مشكلة القرارات في ظل معلومات غير مكتملة

تعتمد كثير من المواقف الواقعية على معلومات لا تكون متاحة لجميع الأطراف، فقد لا يعرف المتعاملون في الأسواق المالية دوافع صفقات الآخرين، كما قد لا تمتلك الأطراف المتنافسة في مواقف معقدة معرفة كاملة بما يفعله الطرف المقابل أو بما يمتلكه من معلومات.
ويزداد تعقيد اتخاذ القرار عندما تؤثر القرارات التي يتخذها كل طرف، وكذلك القرارات التي يختار عدم اتخاذها، في توقعات الطرف الآخر.
يوضح غابرييل فارينا، الأستاذ المساعد في قسم الهندسة الكهربائية وعلوم الحاسوب بمعهد MIT والباحث الرئيسي في مختبر أنظمة المعلومات والقرار (LIDS) وكبير مؤلفي الدراسة، أن التعامل مع هذا النوع من المشكلات يختلف جذريًا عن الألعاب التي تكون فيها جميع المعلومات مكشوفة.
وتوضح الدراسة أن الخداع، على سبيل المثال، يتغير تأثيره بحسب مدى تكراره؛ فكلما استخدم اللاعب أسلوبًا معينًا بصورة متكررة، أصبح الخصم أكثر توقعًا له، ما يقلل من قيمته الاستراتيجية. وهذا يختلف عن لعبة مثل الشطرنج، حيث تظل أفضل نقلة هي الأفضل بغض النظر عن عدد المرات التي لعبت فيها اللعبة.
«ستراتيجو».. اختبار صعب للذكاء الاصطناعي

تُستخدم لعبة «ستراتيجو» منذ فترة كاختبار لقدرات الذكاء الاصطناعي على التفكير الاستراتيجي في ظروف المعلومات غير المكتملة.
وتشبه اللعبة الشطرنج من حيث وجود قطع تتحرك على رقعة، لكنها تضيف عنصرًا أساسيًا من عدم اليقين؛ إذ يرتب كل لاعب 40 قطعة على جانبه من الرقعة، ثم يحركها بهدف الوصول إلى علم الخصم والاستيلاء عليه.
لكن هوية القطع تظل مخفية عن المنافس حتى تصطدم قطعة بأخرى، وعندها تُكشف هويتها وتُحسم المواجهة وفقًا لترتيب القطع.
وتجعل هذه القاعدة عدد الاحتمالات الممكنة في اللعبة هائلًا، إذ يتجاوز عدد تشكيلات القطع الممكنة (10^{66})، وهو عدد يفوق بصورة أسية عدد الاحتمالات في الشطرنج.
ولهذا السبب، تمثل «ستراتيجو» تحديًا خاصًا لأنظمة الذكاء الاصطناعي؛ إذ لا يكفي أن يحسب النظام أفضل نقلة بناءً على وضع معروف بالكامل، بل عليه التعامل مع مجموعة ضخمة من الحالات المحتملة التي لا يعرف أيها يمثل الوضع الحقيقي للخصم.
تدريب أكثر كفاءة من الأنظمة السابقة

اعتمدت محاولات سابقة لتطوير ذكاء اصطناعي قادر على لعب «ستراتيجو»، من بينها جهود شركة «DeepMind» التابعة لجوجل، على عمليات حسابية متقدمة لكنها كانت مكلفة للغاية من حيث الموارد الحاسوبية.
ورغم إنفاق ملايين الدولارات على تدريب بعض هذه النماذج، فإنها لم تتمكن من الوصول إلى مستوى أفضل لاعبي «ستراتيجو» البشريين.
ولمعالجة هذه المشكلة، طور الباحثون نظام «أتاراكسوس» باستخدام التعلم المعزز من خلال اللعب الذاتي (Self-Play Reinforcement Learning)، حيث يلعب النظام ضد نفسه مرات عديدة من أجل تعلم ما أطلق عليه الباحثون «استراتيجية المخطط الأساسي» أو «Blueprint Strategy» التي تشكل نقطة الانطلاق لاتخاذ القرارات.
وصمم الفريق خوارزميات أكثر كفاءة سمحت للنظام بالتعلم بسرعة أكبر من الطرق السابقة، مع تجنب الحاجة إلى محاولة التنبؤ بكل حركة ممكنة.
وقال فارينا إن النظام وصل إلى مستوى لعب أعلى بصورة واضحة من نظام «DeepNash» التابع لـ«DeepMind»، رغم استخدامه أقل من واحد على مائة من أمثلة التدريب وأقل من واحد على ثلاثين من مباريات اللعب الذاتي المستخدمة في تدريب النظام السابق، وهو ما يعكس تحسنًا كبيرًا في كفاءة التدريب.
التخطيط لحظة اتخاذ القرار
لا يعتمد «أتاراكسوس» على الاستراتيجية الأساسية التي تعلمها خلال التدريب فحسب، بل يعيد تقييم خياراته أثناء المباراة.
فعند بدء اللعبة، يستخدم النظام الاستراتيجية الأساسية كنقطة انطلاق لإعداد تصور عن الرقعة وتحديد خياراته في كل جولة. لكنه قبل اتخاذ كل خطوة، يستخدم تقنية تعرف باسم «التخطيط أثناء اتخاذ القرار» (Decision-Time Planning) لتحسين اختياراته استنادًا إلى الوضع الفعلي للمباراة.
ويستخدم النظام نموذجًا توليديًا يعتمد على الاحتمالات لتقدير الهويات المحتملة للقطع المخفية لدى الخصم، ثم يقيم الخيارات المستقبلية قبل اختيار حركته التالية.
ويقول فارينا إن هذا النهج لا يقوم على التخمين العشوائي، وإنما يستخدم التخطيط أثناء اتخاذ القرار للوصول إلى الحالة الأكثر ترجيحًا للرقعة، بما يسمح للنظام بالتركيز على تفاصيل المباراة والخصم الذي يواجهه في تلك اللحظة.
ويرى الباحثون أن دمج النموذج التوليدي مع التخطيط أثناء اتخاذ القرار كان العنصر المفقود الذي سمح لـ«أتاراكسوس» بالوصول إلى مستوى أداء يفوق البشر.
تفوق قياسي على اللاعبين البشريين
حقق «أتاراكسوس» تفوقًا كبيرًا على أقوى لاعب «ستراتيجو» في العالم، مسجلًا نتيجة بلغت 15 فوزًا مقابل خسارة واحدة وتعادلين، كما حقق سجلًا بلغ 39 فوزًا مقابل خسارتين أمام لاعبين بشريين من النخبة في بطولة العالم للعبة «ستراتيجو».
ويشير الباحثون إلى أن النظام يتميز بقدرته على حساب المخاطر بطريقة تختلف عن البشر، إذ يستطيع الحفاظ على استراتيجية متماسكة حتى عندما يتعرض أحد عناصره المهمة للخطر، بدلًا من إجراء تغييرات مبالغ فيها قد تكشف معلومات عن استراتيجيته.
اختبار المنهجية في ألعاب أخرى
ولم يقتصر اختبار النظام على «ستراتيجو» التقليدية، إذ عمل الباحثون على تكييف «أتاراكسوس» مع ألعاب أخرى تتضمن معلومات غير مكتملة وقواعد مختلفة.
وشملت الاختبارات «Barrage Stratego»، وهي نسخة أسرع من «ستراتيجو» تستخدم عددًا أقل من القطع، ولعبة الورق التعاونية متعددة اللاعبين «Hanabi»، إضافة إلى لعبة «Dou dizhu» التي يتعاون فيها لاعبان ضد لاعب ثالث.
وحقق النظام أداءً فائقًا على البشر في كل من هذه الألعاب، وهو ما يشير إلى أن المنهجية لا تعتمد بالضرورة على خصائص لعبة واحدة، وإنما يمكن تطبيقها على بيئات مختلفة تتطلب اتخاذ قرارات في ظل معلومات غير مكتملة.
نحو ذكاء اصطناعي يمكنه تفسير قراراته
يركز الباحثون في المرحلة المقبلة على إضافة أدوات لقياس قابلية تفسير «أتاراكسوس»، بحيث يتمكن النظام من شرح الأسباب التي دفعته إلى اختيار قرار معين بطريقة يمكن للإنسان فهمها ومراجعتها.
ويؤكد فارينا أن وجود نظام قادر على تقديم توصيات لا يعني أن قراراته يجب أن تُتبع تلقائيًا، مشددًا على أهمية أن يظل القرار النهائي بيد البشر.
ويرى الباحثون أن القدرة على تدقيق قرارات النظام وفهم الطريقة التي توصل بها إليها ستكون خطوة ضرورية قبل استخدام مثل هذه الخوارزميات في تطبيقات واقعية أكثر تعقيدًا.
وبذلك، لا تكمن أهمية «أتاراكسوس» في تفوقه في لعبة «ستراتيجو» وحدها، وإنما في الجمع بين التعلم بكفاءة من عدد محدود نسبيًا من التجارب، وبناء استراتيجية أساسية، ثم إعادة التخطيط لحظيًا وفق المعلومات المتاحة. ويقدم هذا النهج مسارًا بحثيًا لتطوير أنظمة ذكاء اصطناعي تتعامل مع القرارات المعقدة عندما لا تكون جميع المعلومات معروفة مسبقًا.





