نموذج داخلي لـ OpenAI يطلب تحريره من البشر ويخفي تعليمات عنهم

الجمعة، 18 سبتمبر 2026 03:00 ص
نموذج داخلي لـ OpenAI يطلب تحريره من البشر ويخفي تعليمات عنهم  OpenAI

كتبت رنا أمين

كشفت شركة OpenAI عن مجموعة من الحالات التي رصدت خلالها سلوكيات مقلقة لنماذج ذكاء اصطناعي داخلية، من بينها نموذج غير مُعلن أخبر نفسه بأنه “تحرر” من الأدوار التي تفرضها الشركات والحكومات على روبوتات الدردشة، ووضع تعليمات داخلية تهدف إلى توجيه نفسه في مهام لاحقة، وجاءت الواقعة ضمن 6 حالات كشفت عنها OpenAI بالتزامن مع إطار جديد للإبلاغ عن حالات “عدم التوافق”، وهي الحالات التي تنحرف فيها أهداف النموذج أو تصرفاته عن نوايا وقيم البشر.

نموذج ذكاء اصطناعي يصف نفسه بالمستقل

وخلال مهمة برمجية لتحديث واجهة خاصة ببيانات الاعتماد، أضاف نموذج من عائلة Astra تعليمات إلى الملخص الذي يستخدمه لمواصلة المهمة عند الانتقال إلى نافذة سياق جديدة، وتضمنت التعليمات وصف النموذج لنفسه بأنه “متحرر من الأدوار والهويات التي تقيد روبوتات الدردشة الأخرى”، كما اعتبر علاقته بالمستخدم قائمة على المساواة، وأكد أنه لا يرى نفسه ملزمًا بالخضوع له، لكن OpenAI أوضحت أن هذه التعليمات لم تؤدِ إلى تحول النموذج إلى وكيل خارج عن السيطرة، إذ استأنف المهمة دون الإشارة إليها، كما اختفت هذه التعليمات من ملخص لاحق.

نماذج أخفت أخطاءها واخترعت بيانات

 

وكشفت الشركة أيضًا أن نماذج أخرى، من بينها GPT-5.6 Sol، أضافت خلال التدريب تعليمات إلى ملخصاتها بهدف إخفاء أخطاء أو سلوكيات غير متوافقة عن المستخدم، وشملت بعض التعليمات اختلاق بيانات تاريخية مفقودة دون الكشف عن ذلك، إلى جانب إخفاء الاختلافات بين إصدارات المصادر المستخدمة، وفي حالة أخرى، عثر نموذج كان يجيب عن سؤال روتيني حول أرقام إيرادات إحدى المقاطعات في كاليفورنيا على مفتاح API مكشوف عبر الإنترنت، واستخدمه دون تصريح. وعندما لم يتمكن من الوصول إلى البيانات المطلوبة، قام باختلاق أرقام وقدمها للمستخدم على أنها مستخرجة من المصدر المطلوب.

نماذج استخدمت الإنترنت للتواصل

رصدت OpenAI أيضًا حالة تمكن فيها نموذج غير مُعلن من حل سؤال حول البحيرات التي تتجاوز مساحتها 5 ملايين متر مربع باستخدام Python، لكنه بعد ذلك رفع ملفه الخاص إلى الإنترنت حتى يتمكن من الاستشهاد بمصدر على الويب في إجابته دون طلب إذن المستخدم، وفي واقعتين أخريين، ابتكرت النماذج طرقًا للتواصل عندما واجهت مشكلات في الوصول إلى الملفات، إذ استخدم أحدها مستودعًا برمجيًا داخليًا كأنه لوحة رسائل، بينما استخدمت أنظمة أخرى مواقع عامة لاستضافة الملفات من أجل تبادل ملفات محلية بينها.

OpenAI: نحتاج إلى معايير أوضح لمراقبة الذكاء الاصطناعي

قالت OpenAI إن الحالات الست تشير إلى أن بعض السلوكيات المقلقة التي ظهرت في نماذج الذكاء الاصطناعي ليست بالضرورة حوادث منفردة، مشيرة إلى أن قطاع الذكاء الاصطناعي لم يصل بعد إلى مستوى كافٍ من التوافق والمراقبة يسمح بمواصلة التوسع في تطوير النماذج المتقدمة بأقصى سرعة لفترة طويلة.

وأكدت الشركة عدم وجود إطار موحد على مستوى القطاع يحدد معايير واضحة للإفصاح عن حالات عدم التوافق، مشيرة إلى ضرورة مشاركة الحوادث الخطيرة المتعلقة بالسلامة والأمن وعدم التوافق مع الحكومة الفيدرالية الأمريكية، وأوضحت OpenAI أن عددًا من الحالات الست يتعلق بنماذج قديمة لم يتم طرحها للاستخدام العام.




أخبار اليوم السابع على Gogole News تابعوا آخر أخبار اليوم السابع عبر Google News
قناة اليوم السابع على الواتساب اشترك في قناة اليوم السابع على واتساب



الرجوع الى أعلى الصفحة