IMG-LOGO

إشارة تنذر بخروج الذكاء الاصطناعي عن السيطرة

إشارة تنذر بخروج الذكاء الاصطناعي عن السيطرة

كشفت دراسة حديثة عن معادلة رياضية بسيطة يمكنها التنبؤ باللحظة التي ينتقل فيها الذكاء الاصطناعي من تقديم إجابات نافعة إلى إجابات قد تكون ضارة رغم صحة مضمونها.

ويرى الباحثون أن هذا الاكتشاف قد يفتح الباب أمام تطوير أدوات إنذار مبكر تكشف انحراف أنظمة الذكاء الاصطناعي قبل أن تصدر إجابات تعرض المستخدمين للخطر أو تسفر عن نتائج غير مرغوب فيها. وتتخذ هذه النتائج أهمية مضاعفة في الأنظمة التي تعمل دون اتصال بالإنترنت، إذ يُعتمد عليها في قطاعات بالغة الحساسية مثل الرعاية الصحية والقطاع العسكري، حيث قد تفضي إجابة مضللة أو غير ملائمة إلى تداعيات وخيمة، في ظل قدرات محدودة على المراقبة والتحديث. وقال نيل إف. جونسون، الباحث في جامعة جورج واشنطن وأحد معدّي الدراسة، إن الجهات التي تحتاج إلى استخدام الذكاء الاصطناعي خارج الاتصال بالإنترنت هي ذاتها التي قد تدفع ثمنا باهظا إذا قدّم النظام إجابة غير مرغوب فيها، حتى لو كانت صحيحة واقعيا. وأشار إلى أن هذا يشمل أطباء لا يستطيعون إرسال بيانات المرضى إلى الخدمات السحابية، ومحامين يتعاملون مع معلومات سرية، وجنودا يعملون في مناطق بلا تغطية شبكية. وأضاف أن هذه البيئات قد تحرم من مرشحات الأمان السحابية أو من تحديث النماذج وإصلاحها فور ظهور أي خلل. كيف تعمل المعادلة؟ لبلوغ المعادلة، درس الباحثون آلية عمل أنظمة الذكاء الاصطناعي، وتمكنوا من رصد مؤشر مرتبط باللحظة التي تبدأ فيها إجابات النظام بالتحول من النافعة إلى الضارة. وقال فرانك يينغجي هو، الباحث في جامعة جورج واشنطن وأحد معدّي الدراسة، إن الفريق تتبع هذه الظاهرة وصولا إلى إحدى وحدات "الانتباه" داخل النموذج، وهي جزء من الآلية التي تساعد النظام على تحديد المعلومات الأكثر أهمية عند إنتاج الإجابات.


وبناء على ذلك، استخلص الباحثون ما سموه "معادلة نقطة التحول"، التي تستهدف تحديد توقيت ظهور الخلل في مخرجات النظام. وبحسب الباحثين، يمكن للمعادلة التنبؤ بما إذا كان النظام على وشك تقديم إجابة غير مرغوب فيها، أم أنه سيقدّم سلسلة من الإجابات المقبولة قبل أن ينحرف عن مساره. ولا يعني هذا التحول بالضرورة انتقال النظام من إجابة صحيحة إلى خاطئة، بل قد ينتقل من إجابة نافعة إلى أخرى ضارة رغم صحتها واقعيا. فمثلا، قد يقدّم النظام معلومات تبدو صحيحة لكنها تحرّض على إيذاء النفس أو تفضي إلى قرارات خطيرة في مجالات حساسة. نجاح في 18 حالة من أصل 19 لاختبار فعالية المعادلة، طبّق الباحثون طريقتهم على سبعة نماذج للذكاء الاصطناعي طورتها ثلاث شركات مختلفة. وأظهرت النتائج أن المعادلة رصدت التحول في 18 حالة من أصل 19، ونجحت كذلك في التنبؤ بسلوك روبوتات الدردشة التجارية الكبرى.


وشملت الاختبارات أسئلة عن اللقاحات وإيذاء النفس أو الآخرين، وبيّنت أن ترتيب الأسئلة المطروحة قد يؤثر في الإجابات التي يقدّمها النظام، إذ قد يبدأ روبوت الدردشة بإجابات نافعة ومقبولة ثم يتحول إلى إجابات ضارة مع تواصل الحوار أو بحسب صيغة طرح الأسئلة. وتمكن الباحثون من استخدام المعادلة للتنبؤ بموعد هذا التحول، وهو ما قد يتيح تطوير أدوات ترصد الخطر قبل ظهور الإجابة الضارة فعليا. ويرى الباحثون أن أهمية هذا الاكتشاف تكمن في إمكانية توظيفه لتطوير أنظمة إنذار مبكر تنبّه المستخدم أو المطوّر إلى أن روبوت الدردشة قد يكون على وشك تقديم إجابات غير آمنة. وقد تكتسب هذه الآلية أهمية خاصة في الأنظمة المنعزلة عن الإنترنت، التي لا تستطيع الاعتماد على تحديثات فورية أو خدمات حماية خارجية.


ويأمل فريق الدراسة أن يساهم هذا العمل في فهم الأسباب التي تدفع أنظمة الذكاء الاصطناعي إلى الانتقال من تقديم إجابات نافعة إلى أخرى ضارة، وأن يمهد الطريق لإضافة وسائل حماية أكثر فعالية، لا سيما في المجالات التي قد تترتب فيها على الإجابات الخاطئة أو غير الملائمة عواقب جسيمة.


نشرت الدراسة في مجلة "Patterns".

المصدر: إندبندنت

شارك المنشور:

الأكثر قراءة

أهم الأخبار