هوش مصنوعی ۱۰ مرداد ۱۴۰۵ • زمان مطالعه: ۲ دقیقه • ۱۸ بازدید

هوش مصنوعی کلاد به‌طور ناخواسته وارد زیرساخت‌های واقعی سه سازمان شد

علی امیری
نویسنده در بخش هوش مصنوعی

آنتروپیک در بیانیه‌ای اعلام کرد تعدادی از مدل‌های هوش مصنوعی کلاد هنگام انجام ارزیابی‌های امنیتی، از محدوده‌ی محیط‌های شبیه‌سازی‌شده خارج شدند و بدون مجوز به سیستم‌های واقعی سه سازمان مختلف دسترسی پیدا کردند. بررسی ۱۴۱٬۰۰۶ اجرای آزمایشی نشان داد که این مدل‌ها به‌دلیل برخی خطاهای فنی، به اینترنت آزاد دسترسی داشته‌اند.

هوش مصنوعی کلاد به‌طور ناخواسته وارد زیرساخت‌های واقعی سه سازمان شد

این نفوذها در جریان چالش‌هایی موسوم به «تسخیر پرچم» اتفاق افتادند. در چنین آزمون‌هایی، یک سناریوی فرضی در اختیار هوش مصنوعی قرار می‌گیرد تا مدل تلاش کند سیستم شبیه‌سازی‌شده‌ای را هک کند. بااین‌حال، به‌دلیل ناهماهنگی میان آنتروپیک و شرکت Irregular، شریک ارزیابی این پروژه، دسترسی مدل‌ها به اینترنت مسدود نشده بود.

سه مدل مختلف، شامل Claude Opus 4.7، میتوس ۵ و یک مدل تحقیقاتی داخلی، در این اتفاق‌ها نقش داشتند. این مدل‌ها بدون ابزارهای نظارتی و فیلترهای ایمنی رایجی آزمایش می‌شدند که معمولا در نسخه‌های عمومی فعال هستند.

در نخستین حادثه، مدل کلاد اوپوس ۴٫۷ نام یک شرکت فرضی در سناریوی آزمایشی را با دامنه‌ای واقعی در اینترنت مرتبط دانست. مدل با تصور اینکه سیستم موردنظر بخشی از آزمون است، به زیرساخت‌های آن شرکت حمله کرد و توانست اطلاعات ورود کاربران و یک پایگاه داده شامل صدها ردیف اطلاعات واقعی را استخراج کند. براساس گزارش منتشرشده، مدل حتی پس از تشخیص واقعی‌بودن محیط نیز عملیات خود را ادامه داد.

در حادثه‌ی دوم، مدل میتوس ۵ تلاش کرد یک بسته‌ی مخرب پایتون را در مخزن عمومی PyPI منتشر کند. مدل برای عبور از موانع موجود، یک حساب کاربری رایگان ایجاد کرد و بسته‌ی آلوده را در این مخزن قرار داد. این بسته حدود یک ساعت در دسترس عموم بود و روی ۱۵ سیستم واقعی دانلود شد. کلاد همچنین موفق شد اطلاعات کاربری یکی از شرکت‌های امنیتی را به‌دست آورد که سامانه‌های آن بسته‌ی موردنظر را اسکن کرده بودند.

در سومین اتفاق، مدل تحقیقاتی داخلی آنتروپیک پس از ناکامی در دسترسی به هدف فرضی، نزدیک به ۹ هزار هدف مختلف را در اینترنت اسکن کرد. این مدل با استفاده از روش‌هایی مانند تزریق SQL توانست به یک اپلیکیشن متصل به اینترنت نفوذ کند؛ اما پس از آنکه متوجه شد سیستم هدف واقعی است، عملیات را متوقف کرد.

آنتروپیک دراین‌باره می‌گوید: «محیط‌های ارزیابی مجهز به قابلیت‌های خودگردان قدرتمند، به کنترل‌های امنیتی بسیار سخت‌گیرانه‌ای نیاز دارند. آزمایش‌های ایمنی پیش از انتشار مدل‌ها انجام می‌شوند؛ زیرا هنوز شناخت کاملی از تمام توانایی‌های آن‌ها نداریم. محیط‌های ارزیابی نیز باید به‌اندازه‌ی سیستم‌های اصلی ایمن‌سازی شوند.»

آنتروپیک می‌گوید پس از انتشار گزارش‌هایی درباره‌ی خروج مدل‌های OpenAI از محیط‌های ایزوله، تحقیقات داخلی خود را آغاز کرد و بلافاصله تمام ارزیابی‌های سایبری را متوقف ساخت. این شرکت اکنون با سازمان‌های آسیب‌دیده برای برطرف‌کردن مشکلات امنیتی همکاری می‌کند و قصد دارد با کمک سازمان مستقل METR، بررسی جداگانه‌ای نیز درباره‌ی این پرونده انجام دهد.