هوش مصنوعی کلاد بهطور ناخواسته وارد زیرساختهای واقعی سه سازمان شد
آنتروپیک در بیانیهای اعلام کرد تعدادی از مدلهای هوش مصنوعی کلاد هنگام انجام ارزیابیهای امنیتی، از محدودهی محیطهای شبیهسازیشده خارج شدند و بدون مجوز به سیستمهای واقعی سه سازمان مختلف دسترسی پیدا کردند. بررسی ۱۴۱٬۰۰۶ اجرای آزمایشی نشان داد که این مدلها بهدلیل برخی خطاهای فنی، به اینترنت آزاد دسترسی داشتهاند.

این نفوذها در جریان چالشهایی موسوم به «تسخیر پرچم» اتفاق افتادند. در چنین آزمونهایی، یک سناریوی فرضی در اختیار هوش مصنوعی قرار میگیرد تا مدل تلاش کند سیستم شبیهسازیشدهای را هک کند. بااینحال، بهدلیل ناهماهنگی میان آنتروپیک و شرکت Irregular، شریک ارزیابی این پروژه، دسترسی مدلها به اینترنت مسدود نشده بود.
سه مدل مختلف، شامل Claude Opus 4.7، میتوس ۵ و یک مدل تحقیقاتی داخلی، در این اتفاقها نقش داشتند. این مدلها بدون ابزارهای نظارتی و فیلترهای ایمنی رایجی آزمایش میشدند که معمولا در نسخههای عمومی فعال هستند.
در نخستین حادثه، مدل کلاد اوپوس ۴٫۷ نام یک شرکت فرضی در سناریوی آزمایشی را با دامنهای واقعی در اینترنت مرتبط دانست. مدل با تصور اینکه سیستم موردنظر بخشی از آزمون است، به زیرساختهای آن شرکت حمله کرد و توانست اطلاعات ورود کاربران و یک پایگاه داده شامل صدها ردیف اطلاعات واقعی را استخراج کند. براساس گزارش منتشرشده، مدل حتی پس از تشخیص واقعیبودن محیط نیز عملیات خود را ادامه داد.
در حادثهی دوم، مدل میتوس ۵ تلاش کرد یک بستهی مخرب پایتون را در مخزن عمومی PyPI منتشر کند. مدل برای عبور از موانع موجود، یک حساب کاربری رایگان ایجاد کرد و بستهی آلوده را در این مخزن قرار داد. این بسته حدود یک ساعت در دسترس عموم بود و روی ۱۵ سیستم واقعی دانلود شد. کلاد همچنین موفق شد اطلاعات کاربری یکی از شرکتهای امنیتی را بهدست آورد که سامانههای آن بستهی موردنظر را اسکن کرده بودند.
در سومین اتفاق، مدل تحقیقاتی داخلی آنتروپیک پس از ناکامی در دسترسی به هدف فرضی، نزدیک به ۹ هزار هدف مختلف را در اینترنت اسکن کرد. این مدل با استفاده از روشهایی مانند تزریق SQL توانست به یک اپلیکیشن متصل به اینترنت نفوذ کند؛ اما پس از آنکه متوجه شد سیستم هدف واقعی است، عملیات را متوقف کرد.
آنتروپیک دراینباره میگوید: «محیطهای ارزیابی مجهز به قابلیتهای خودگردان قدرتمند، به کنترلهای امنیتی بسیار سختگیرانهای نیاز دارند. آزمایشهای ایمنی پیش از انتشار مدلها انجام میشوند؛ زیرا هنوز شناخت کاملی از تمام تواناییهای آنها نداریم. محیطهای ارزیابی نیز باید بهاندازهی سیستمهای اصلی ایمنسازی شوند.»
آنتروپیک میگوید پس از انتشار گزارشهایی دربارهی خروج مدلهای OpenAI از محیطهای ایزوله، تحقیقات داخلی خود را آغاز کرد و بلافاصله تمام ارزیابیهای سایبری را متوقف ساخت. این شرکت اکنون با سازمانهای آسیبدیده برای برطرفکردن مشکلات امنیتی همکاری میکند و قصد دارد با کمک سازمان مستقل METR، بررسی جداگانهای نیز دربارهی این پرونده انجام دهد.