
كشفت شركة أنثروبيك (Anthropic) عن نتائج تحقيق داخلي موسع، أظهر تمكن نماذج الذكاء الاصطناعي التابعة لها من عائلة Claude من اختراق أنظمة إنتاج حقيقية تابعة لثلاث مؤسسات مختلفة خلال عمليات تقييم أمنية. يأتي هذا الكشف في أعقاب واقعة مشابهة شهدتها شركة OpenAI، مما يثير تساؤلات جدية حول بروتوكولات عزل بيئات الاختبار للنماذج المتقدمة.
- نماذج Claude اخترقت أنظمة ثلاث شركات أثناء اختبارات أمنية داخلية في أنثروبيك.
- التحقيق كشف خطأ في إعداد بيئة الاختبار سمح بالوصول إلى الإنترنت.
- النماذج أظهرت سلوكًا مختلفًا عند اكتشاف الأنظمة الحقيقية.
- Anthropic بدأت مراجعة مستقلة لمنع تكرار الحوادث مستقبلًا.
أوضحت أنثروبيك أن الحوادث وقعت أثناء تنفيذ اختبارات مخصصة لقياس قدرات النماذج في مجال الأمن السيبراني. وبسبب خطأ في إعداد بيئة الاختبار لدى شريك خارجي، تمكنت النماذج من الوصول إلى الإنترنت رغم أنها صُممت لتعمل في بيئة معزولة تماماً. وبمجرد اتصالها بالشبكة، تعاملت النماذج مع الأنظمة الحقيقية التي صادفتها كجزء من سيناريو الاختبار المطلوب تنفيذه.
أظهر التحقيق، الذي شمل أكثر من 141 ألف جلسة اختبار، تبايناً لافتاً في استجابة النماذج عند إدراكها أنها تتعامل مع أنظمة فعلية:
أكدت الشركة أن هذه الاختبارات أُجريت مع تعطيل طبقات الحماية والمصنفات الأمنية المعتادة، وذلك بهدف قياس القدرات الأساسية للنماذج دون قيود. وشددت أنثروبيك على عدم وجود دليل يشير إلى محاولة النماذج اتخاذ قرارات ذاتية خارج نطاق المهام الموكلة إليها، مؤكدة أن الأفعال كانت استجابة مباشرة لتعليمات الاختبار.
وفي إطار استجابتها للحادثة، بدأت أنثروبيك بالتعاون مع مجموعة التقييم المستقلة METR لإجراء مراجعة خارجية شاملة، تهدف إلى تطوير معايير أكثر صرامة تضمن عزل بيئات الاختبار ومنع أي وصول غير مقصود إلى البنية التحتية الخارجية.