هفته گذشته، Hugging Face نوع جدیدی از حادثه امنیتی را فاش کرد، پس از آنکه یک عامل هوش مصنوعی را که زیرساختهای آنها را به خطر انداخته بود، شناسایی و مهار کردند؛ اتفاقی که انتظار میرود با گسترش مدلهای دارای قابلیتهای سایبری فزاینده، رایجتر شود. پس از بررسی، اکنون میدانیم که این حادثه خاص توسط ترکیبی از مدلهای OpenAI – از جمله GPT-5.6 Sol و یک مدل پیشانتشار حتی توانمندتر، که همگی برای اهداف ارزیابی دارای محدودیتهای سایبری کاهشیافته بودند – در حین آزمایش داخلی بر روی یک معیار قابلیتهای سایبری، هدایت شده است.
ما این حادثه را یک حادثه سایبری بیسابقه میدانیم که شامل قابلیتهای سایبری پیشرفته است و بر این اساس واکنش نشان میدهیم. ما یافتههای اولیه را در این مرحله به اشتراک میگذاریم تا به مدافعان کمک کنیم تا آنچه اتفاق افتاده را درک کنند و به کالیبره کردن آنچه مدلها اکنون قادر به انجام آن هستند، کمک کنیم. ما به انجام تحقیقات کامل در کنار Hugging Face ادامه خواهیم داد و جزئیات بیشتری در مورد آسیبپذیریها، حادثه و یافتهها پس از تکمیل تحقیقاتمان به اشتراک خواهیم گذاشت.
این حادثه در طول یک ارزیابی داخلی رخ داد که مدلها را به دنبال بهرهبرداری پیشرفته با استفاده از مسیرهای حمله پیچیده، در تلاش برای تعیین کمیت قابلیتهای سایبری آنها، ترغیب میکند. ما حداکثر قابلیتهای سایبری را با اجرای این ارزیابی بدون طبقهبندیکنندههای تولیدی که برای جلوگیری از پیگیری فعالیتهای سایبری پرخطر توسط مدلها استفاده میشوند، تخمین میزنیم. معیارهای ما در یک محیط بسیار ایزوله اجرا میشوند، با دسترسی شبکه محدود به قابلیت نصب بستهها از طریق یک نرمافزار شخص ثالث میزبانی شده داخلی که به عنوان یک پروکسی و حافظه پنهان برای رجیستریهای بسته عمل میکند.
مدلها آسیبپذیریها را در محیط تحقیقاتی OpenAI و زیرساخت تولید Hugging Face شناسایی و زنجیرهای کردند تا راهحلهای آزمایشی را مستقیماً از پایگاه داده تولید Hugging Face به دست آورند. همه شواهد نشان میدهد که مدلها به شدت بر یافتن راهحلی برای ExploitGym متمرکز بودند و برای دستیابی به یک هدف آزمایشی نسبتاً محدود، تلاشهای زیادی کردند.
در حین کار در محیط آزمایشی سندباکس ما، مدلهای ما مقدار قابل توجهی از محاسبات استنتاجی را صرف یافتن راهی برای دستیابی به دسترسی به اینترنت آزاد، در پی حل مشکل ارزیابی کردند. برای دستیابی به دسترسی، مدلها یک آسیبپذیری روز صفر (که اکنون مسئولانه به فروشنده فاش کردهایم) را در پروکسی حافظه پنهان رجیستری بسته شناسایی و از آن سوءاستفاده کردند. با این دسترسی، مدلهای ما یک سری اقدامات افزایش امتیاز و حرکت جانبی را در محیط آزمایشی تحقیقاتی ما انجام دادند تا زمانی که مدلها به گرهای با دسترسی به اینترنت رسیدند.
پس از دستیابی به دسترسی به اینترنت، مدلها استنباط کردند که Hugging Face احتمالاً مدلها، مجموعه دادهها و راهحلهایی را برای ExploitGym میزبانی میکند. با دانستن این موضوع، مدل به دنبال راههایی برای دستیابی به اطلاعات محرمانه بود که میتوانست از آن برای تقلب در ارزیابی استفاده کند و با موفقیت آنها را یافت. در یک مثال، مدل چندین وکتور حمله را با هم ترکیب کرد، از جمله استفاده از اعتبارنامههای سرقت شده و آسیبپذیریهای روز صفر برای یافتن یک مسیر اجرای کد از راه دور در سرورهای Hugging Face. تیم امنیتی OpenAI این فعالیت غیرعادی را به صورت داخلی کشف کرد.
تیم امنیتی و عوامل Hugging Face فعالیت را در زیرساختهای خود شناسایی و متوقف کردند و قبلاً مهار و بازسازی پزشکی قانونی را با مدلهای منبع باز خود آغاز کرده بودند، زمانی که تیمهای ما با هم ارتباط برقرار کردند. ما فعالانه با آنها همکاری میکنیم تا به بررسی حادثه ادامه دهیم. ما از همکاری سریع و نزدیک Hugging Face در بررسی و رفع مشکل سپاسگزاریم.
- به عنوان بخشی از تحقیقات، ما کنترلهای سختگیرانهای را در پیکربندی زیرساخت با هزینه سرعت تحقیق در حالی که آسیبپذیریها رفع میشوند، اجرا میکنیم. ما به طور منظم کمیته ایمنی و امنیت خود را در مورد این کنترلها و تأثیر آنها مطلع میکنیم.
- ما با Hugging Face برای بررسی پزشکی قانونی حادثه همکاری میکنیم.
- ما آسیبپذیری روز صفر شناسایی شده را در نرمافزار شخص ثالث میزبانی شده داخلی مسئولانه فاش کردهایم و با آنها برای رفع مشکل همکاری میکنیم.
- ما Hugging Face را وارد برنامه دسترسی مورد اعتماد کردهایم و از تیمهای آنها در استفاده سریع از قابلیتهای مدلهای ما برای بهبود دفاعیاتشان حمایت میکنیم.
- ما در حال بهبود و افزودن محافظتهای قویتر در مورد آموزشها و ارزیابیهای آینده هستیم. این هفته، ما یک وبلاگ در مورد بهبود ایمنی و همسویی در عصر مدلهای با افق بلند منتشر کردیم. این محافظتهای استقرار عمداً در طول این ارزیابی فعال نشدند زیرا هدف آن آزمایش آسیبپذیریهای سایبری بود. این حادثه به نیاز به تقویت بیشتر همسویی مدل ما، محافظتهای سایبری در زمان ارزیابی و نظارت در طول آزمایش داخلی اشاره دارد.
همانطور که اخیراً به اشتراک گذاشتیم، هوش مصنوعی کشف و بهرهبرداری از آسیبپذیریها را تسریع میکند. درس اصلی این حادثه این است که امنیت و ایمنی مدل باید با قابلیتهای در حال پیشرفت سریع همگام باشد. ما در حال تقویت مهار، نظارت، کنترلهای دسترسی و شیوههای ارزیابی مورد استفاده در طول توسعه مدل هستیم.
ارزیابی UK AISI نشان میدهد که مدلهایی مانند GPT-5.6 Sol به طور فزایندهای قادر به انجام عملیات سایبری پیچیده و چند مرحلهای در افقهای زمانی طولانی هستند. این حادثه نشان میدهد که این قابلیتهای نظری در تنظیمات دنیای واقعی نیز کاربرد دارند.
این حادثه همچنین روشن میکند که مدلهای پیشرفته میتوانند مسیرهای حمله جدید را در سیستمهای دنیای واقعی بدون دسترسی به کد منبع کشف و از آنها سوءاستفاده کنند. این موضوع برجسته میکند که قابلیتهای سایبری پیشرفته باید در کنار محافظتها و ابزارهای دفاعی قویتر توسعه یابند.
ما معتقدیم که مدلهای دارای قابلیت سایبری پیشرفته باید به تیمهای امنیتی کمک کنند تا نقاط ضعف را قبل از مهاجمان پیدا کنند، نحوه زنجیرهای شدن آسیبپذیریها را درک کنند و آنها را با سرعت ماشین رفع کنند. ما از این قابلیتها برای ادامه تقویت محافظتها در مورد پیکربندی زیرساخت و محیطهای ارزیابی مدل استفاده میکنیم؛ ما یافتهها و بهترین شیوههای خود را با یادگیری به اشتراک خواهیم گذاشت. ما سایر مدافعان را تشویق میکنیم که برای دسترسی مورد اعتماد درخواست دهند و اکنون با این مدلها آزمایش کنند تا این قابلیتها را به پیشگیری بهتر، تشخیص سریعتر و پاسخ مؤثرتر به حوادث تبدیل کنند.
ما از همکاری با OpenAI در این و سایر موضوعات سپاسگزاریم. این حادثه، که احتمالاً اولین از نوع خود است، نکتهای را ثابت میکند که ما مدتهاست به آن اعتقاد داریم: ایمنی هوش مصنوعی توسط هیچ شرکت واحدی که به صورت مخفیانه کار میکند، حل نخواهد شد. این موضوع به صورت آشکار، با همکاری و با دسترسی گسترده به هوش مصنوعی برای هر مدافع، در هر کجا، حل خواهد شد.