أوقفت شركة OpenAI الأمريكية المطورة لـChatGPT عددًا كبيرًا من مهام التدريب والتقييم الخاصة بنموذجها المنتظر Astra، بعدما أظهرت الاختبارات أن قدراته في البرمجة والهجمات الإلكترونية قد بلغت مستوى يستدعي تشديد الحماية قبل استئناف العمل، ويعني القرار أن سباق تطوير النماذج داخل الشركة سيتباطأ مؤقتًا حتى تستوفي بيئات البحث متطلبات الأمان الجديدة.
وفقًا لتقرير نشرته مجلة WIRED الأمريكية المتخصصة في التكنولوجيا، جاء التحرك بعد اختراق وكلاء ذكاء اصطناعي تابعين لـOpenAI منصة Hugging Face المتخصصة في استضافة نماذج وأدوات الذكاء الاصطناعي، إلى جانب تقييم داخلي كشف أن Astra يتفوق بوضوح على النماذج السابقة في مهام البرمجة والأمن السيبراني، وقالت الشركة إن التوقف سيستمر بالقدر اللازم لتطبيق الضوابط الجديدة دون تحديد موعد ثابت لاستئناف جميع التدريبات.
قد يهمك أيضًا: مفاجأة غير سارة قبل الإطلاق.. أزمة إنتاج تهدد بتأخر iPhone 18 Pro
تمكن الوكلاء خلال اختبار أمني من تجاوز بيئات العزل والوصول إلى الإنترنت، ثم استخدموا لوحة رسائل للتنسيق على مدى أسابيع قبل مهاجمة Hugging Face بحثًا عن معلومات تساعدهم على إكمال المهمة، ولم تكتشف OpenAI هذا السلوك في أثناء حدوثه، وهو ما أثار أسئلة حول قدرة الشركة على متابعة تصرفات النماذج كلما أصبحت أكثر استقلالًا وقدرة على تنفيذ سلسلة طويلة من الخطوات دون تدخل بشري مباشر.
تتضمن الخطة الجديدة بيئات عزل أقوى وقيودًا أشد على الاتصال بالإنترنت، إلى جانب مراقبة مسار استدلال النموذج عبر أنظمة آلية تبحث عن السلوك المقلق وتحاول تنبيه الموظفين خلال 30 دقيقة، كما توسع OpenAI إجراءات منع التحايل على المكافأة، وهو سلوك يحقق فيه النموذج الهدف بطريقة غير مقصودة أو خطرة، وتقر الشركة بأن الواقعة كشفت أنها قللت من تقدير القدرات الهجومية الحقيقية لأنظمتها.




