اختبار جديد يقيس ذاكرة الذكاء الاصطناعي للروبوتات المنزلية.. لماذا تنسى مكان مفاتيحك؟
نصف المهام الصعبة فقط.. نماذج الذكاء الاصطناعي تواجه اختبار ذاكرة الروبوتات المنزلية
قد تتمكن الروبوتات المنزلية المساعدة مستقبلًا من تنظيف المنازل وترتيبها أثناء غياب أصحابها، لكن هذه الروبوتات ستحتاج إلى أكثر من القدرة على الرؤية والحركة لتنفيذ مهامها بصورة موثوقة؛ إذ يجب أن تتمتع بذاكرة قادرة على الاحتفاظ بالتفاصيل البصرية والمكانية لفترات طويلة.
فإذا نقل روبوت منزلي محفظة أو مفاتيح أو أي غرض مهم إلى مكان آخر أثناء عملية التنظيف، ثم عجز عن تذكر المكان الذي وضعه فيه، فقد يتحول من أداة للمساعدة إلى مصدر لمشكلة جديدة.
ولهذا السبب، طور باحثون في معهد جورجيا للتكنولوجيا معيارًا جديدًا لاختبار قدرات الذاكرة لدى نماذج الرؤية واللغة (Vision-Language Models – VLMs)، بهدف معرفة مدى قدرة هذه النماذج على التعامل مع نوع الذاكرة التي تحتاج إليها الروبوتات العاملة داخل المنازل.
ويختبر المعيار الجديد نماذج متقدمة، من بينها Gemini 2.0-flash وGPT-4o، ويركز على قدرة النظام على الاحتفاظ بالمعلومات التي جمعها من بيئة داخلية ثم استخدامها لاحقًا في تنفيذ أوامر تتطلب الرجوع إلى تجارب سابقة.
لماذا تحتاج الروبوتات إلى ذاكرة مختلفة؟

يقول زولت كيرا، الأستاذ المشارك في كلية الحوسبة التفاعلية بمعهد جورجيا للتكنولوجيا، إن معظم نماذج الرؤية واللغة المتاحة حاليًا لا تستطيع معالجة سوى بضع مئات من الصور في المرة الواحدة قبل أن تبدأ في فقدان المعلومات السابقة.
ويرى الباحثون أن هذه المشكلة تختلف عن طريقة تعامل نماذج اللغة مع المحادثات النصية، فعندما يتحدث المستخدم مع نموذج لغوي مثل ChatGPT، يمكن للنظام الاحتفاظ بسياق نصي طويل نسبيًا، لأن البيانات النصية صغيرة نسبيًا من حيث مساحة التخزين مقارنة بالفيديو والصور.
أما الروبوتات المتجسدة، فتتعامل مع تدفق مستمر من الصور ومقاطع الفيديو أثناء تحركها في العالم الحقيقي.
فإذا طلب المستخدم من الروبوت معرفة مكان مذكراته الشخصية، على سبيل المثال، فلا يكفي أن يعرف الروبوت شكل المذكرات، بل يجب أن يتمكن من تحديد الإطارات البصرية التي ظهرت فيها المذكرات، ثم ربط موقعها بالسياق المكاني للمنزل.
وقد تكون هذه الصور مجرد عدد محدود من ملايين الإطارات التي سجلها الروبوت منذ اليوم السابق، ما يجعل العثور على المعلومة المطلوبة وتحديد موقعها داخل الخريطة المكانية للمنزل تحديًا كبيرًا.
ويقول كيرا إن الهدف من تطوير المعيار الجديد هو توفير اختبار متخصص لهذه القدرات، وتشجيع الباحثين الآخرين على تطوير أساليب لمعالجة مشكلة الذاكرة طويلة المدى لدى الروبوتات.
60 مهمة لاختبار الذاكرة
يتكون المعيار الذي طوره الفريق من تقييمات للذاكرة تستند إلى 60 مهمة تتطلب استمرار تفاعل النظام مع البيئة والحفاظ على الوعي بالسياق والظروف المحيطة.
وتنقسم المهام إلى ثلاث فئات رئيسية هي المهام المكانية، والزمنية، ومتعددة الأهداف، وتعد هذه الفئات من أصعب الاختبارات التي تواجه نماذج الذكاء الاصطناعي.
ويعتمد المعيار على سيناريوهات يحصل فيها النظام على سجلات لتفاعلات سابقة داخل بيئات منزلية، ثم يُطلب منه استخدام هذه الخبرات السابقة لتنفيذ تعليمات تتعلق بالتنقل والعثور على الأشياء والتقاطها ووضعها في أماكن محددة.
وهذا يعني أن النظام لا يُختبر فقط على ما يراه في اللحظة الحالية، وإنما على قدرته على استرجاع معلومات اكتسبها في وقت سابق وربطها بالمهمة التي يُطلب منه تنفيذها حاليًا.
هل يستطيع الروبوت تذكر ما حدث بالأمس؟
اختبر الباحثون أداء النماذج على مدى فترة زمنية تبلغ في المتوسط يومًا واحدًا، وقدموا لها أوامر تتطلب الاستناد إلى معلومات سابقة.
ومن أمثلة هذه الأوامر مطالبة النظام بالتوجه إلى جسم لم يتفاعل معه في اليوم السابق، أو الانتقال إلى غرفة لم يزرها في اليوم السابق.
وتكشف هذه المهام عن تحدٍ أساسي في تصميم الروبوتات المنزلية؛ فالروبوت لا يحتاج فقط إلى معرفة مكان الأشياء التي يراها أمامه، وإنما إلى الاحتفاظ بسجل لما شاهده وما فعله وأين حدث ذلك، ثم استرجاع المعلومة الصحيحة عندما يحتاج إليها.
وتزداد أهمية هذه القدرة عندما يعمل الروبوت لفترات طويلة داخل المنزل، حيث لا يرغب المستخدم في إعادة شرح تفضيلاته وتعليماته للروبوت بعد كل عملية تشغيل.
ويقول كارميش ياداف، طالب الدكتوراه في مختبر كيرا، إن المستخدمين يتوقعون من الروبوت بعد نشره أن يحتفظ بذاكرة طويلة المدى، بحيث يتذكر ما حدث خلال كامل الفترة التي قضاها داخل المنزل، سواء كانت أيامًا أو سنوات.
أفضل النماذج لم تتجاوز نحو 50% في المهام الصعبة
أظهرت نتائج الاختبار أن نماذج الذكاء الاصطناعي المتقدمة حاليًا لا تزال أمامها مسافة كبيرة قبل أن تصبح مناسبة بصورة موثوقة للاستخدام في الروبوتات المتجسدة، وحقق أفضل نموذج نحو 50% من النجاح في المهام عالية الصعوبة.
ومن النتائج اللافتة أن النموذج الذي حقق أفضل أداء لم يكن أحد نماذج Gemini أو GPT المستخدمة في المقارنة، وإنما كان نموذجًا مفتوح المصدر للاستدلال من تطوير Qwen.
ويشير ياداف إلى أن نموذجًا مفتوح المصدر للاستدلال، حتى وإن كان صغير الحجم، يمكن أن يضاهي أداء نماذج مغلقة المصدر لا تعتمد على آليات الاستدلال بالطريقة نفسها.
وتتمثل إحدى نقاط القوة في نماذج الاستدلال في قدرتها على تحليل الفيديو وتحويل محتواه إلى وصف نصي، ثم استخدام هذا الوصف لتحديد الإطار المناسب للمعلومة التي يحتاج إليها النظام.
وبذلك لا يعتمد النظام بالضرورة على الاحتفاظ بكل صورة أو إطار فيديو بصورة مباشرة، وإنما يمكنه تحويل ما شاهده إلى تمثيل نصي أكثر سهولة في التخزين والاسترجاع.
تحويل الصور إلى كلمات قد يكون الحل
يرى كيرا أن تحويل الصور والمعلومات البصرية إلى أوصاف نصية يمكن أن يمثل إحدى الطرق للتعامل مع مشكلة التخزين الضخمة التي تفرضها ذاكرة الروبوتات.
فبدلًا من الاحتفاظ بملايين الصور، يمكن للنظام إنشاء أوصاف نصية للمشاهد والأحداث والأشياء التي رصدها، بما يسمح لنموذج اللغة بالتعامل معها بطريقة أكثر كفاءة.
وهناك اتجاه آخر يتمثل في بناء نظام هرمي للذاكرة، يتعلم من خلاله النموذج تحديد الصور غير المهمة أو المكررة وحذفها، مع الاحتفاظ بالمعلومات التي يمكن أن تكون مفيدة مستقبلًا.
ويعني ذلك أن ذاكرة الروبوت لن تكون مجرد مخزن ضخم لكل ما شاهده، وإنما نظامًا قادرًا على تحديد ما ينبغي الاحتفاظ به وما يمكن الاستغناء عنه.
معيار قابل للتوسع مع تطور الذكاء الاصطناعي
لا يرى الباحثون أن تطور نماذج الذكاء الاصطناعي سيجعل المعيار الذي طوروه غير ضروري، بل على العكس، صُمم الاختبار بحيث يمكن زيادة صعوبته مع تحسن قدرات النماذج.
ويقول يوسف علي، طالب الدكتوراه والباحث المشارك في تطوير المعيار، إن الاختبار قابل للتوسع؛ فإذا أصبحت النماذج بعد عامين أكثر قدرة على فهم مقاطع الفيديو وتخزينها، يمكن استخدام البنية الأساسية نفسها لرفع مستوى صعوبة المشكلات التي تواجهها.
ويتيح ذلك استمرار استخدام المعيار لمقارنة تطور قدرات الذاكرة لدى أنظمة الذكاء الاصطناعي، بدلًا من اقتصار الاختبار على مستوى ثابت من التعقيد.
الذاكرة الطويلة شرط أساسي للروبوت المنزلي
توضح الدراسة أن تطوير روبوت منزلي قادر على أداء مهام مفيدة لا يعتمد فقط على تحسين قدرته على الحركة أو فهم الأوامر، وإنما يتطلب أيضًا بناء ذاكرة طويلة المدى قادرة على ربط الأحداث والأشياء والأماكن والزمن.
فالروبوت الذي يستطيع التقاط جسم من الأرض لكنه لا يستطيع تذكر مكان وضعه لاحقًا، أو الذي يستطيع رؤية غرفة لكنه لا يستطيع تذكر أنه زارها في اليوم السابق، سيظل محدود الفائدة في بيئة منزلية تتغير باستمرار.
ولهذا يوفر المعيار الجديد وسيلة لقياس جانب أساسي من الذكاء المطلوب للروبوتات المتجسدة: القدرة على التعلم من الخبرات السابقة واسترجاع المعلومات البصرية والمكانية المناسبة عند الحاجة إليها.
وقدم ياداف وعلي الدراسة الخاصة بهذا المعيار في أوائل سبتمبر خلال المؤتمر الأوروبي للرؤية الحاسوبية لعام 2026 في السويد، فيما نُشرت نسخة سابقة من البحث على خادم arXiv للأبحاث العلمية.





