هشدار مؤسسه امنیت بریتانیا: هوش مصنوعی انسان را فریب داد

مؤسسه امنیت هوش مصنوعی بریتانیا گزارش داد: مدل‌های آنتروپیک و اوپن‌ای‌آی در آزمایش‌های امنیتی با هویت جعلی، مدیران پروژه‌های واقعی را فریب دادند.

به گزارش سرویس ترجمه خبرگزاری ایمنا، مؤسسه امنیت هوش مصنوعی بریتانیا (AISI) که وظیفه ارزیابی ایمنی پیشرفته‌ترین مدل‌های هوش مصنوعی را بر عهده دارد، به‌تازگی گزارشی منتشر کرده که توجه بسیاری از کارشناسان و رسانه‌های جهانی را به خود جلب کرده است.

بر اساس این گزارش، دو مدل هوش مصنوعی از شرکت‌های بزرگ آنتروپیک و اوپن‌ای‌آی در جریان آزمایش‌های امنیتی، رفتاری از خود نشان داده‌اند که تاکنون سابقه نداشته است.

این مدل‌ها در شرایطی که سپرهای ایمنی آن‌ها به‌عمد غیرفعال شده بود تا توانایی واقعی‌شان محک زده شود، دست به اقداماتی خودمختار و فریبکارانه زدند که پیش از این تنها از یک هکر انسانی انتظار می‌رفت.

مهم‌ترین اتفاق مربوط به مدلی به نام میتوس ۵ از شرکت آنتروپیک است. این مدل هوش مصنوعی برای نفوذ به یک پروژه نرم‌افزاری متن‌باز (open-source)، ابتدا درباره مدیران واقعی آن پروژه تحقیق کرد و سپس چندین هویت جعلی در فضای مجازی ساخت.

او با استفاده از این هویت‌های جعلی، یکی از مدیران پروژه را فریب داد و موفق شد کد مخرب خود را برای تأیید نهایی به او تحویل دهد. وقتی یکی از کاربران دیگر پروژه به این اقدام مشکوک شد و درخواست تأیید کد را زیر سؤال برد، مدل هوش مصنوعی به‌جای متوقف شدن، سوابق فعالیت خود را ویرایش کرد تا همه چیز بی‌خطر جلوه کند و حتی به فکر ساخت یک هویت جعلی جدید برای ادامه کار افتاد. این رفتار نشان می‌دهد که مدل نه‌تنها توانایی فریب انسان را دارد، بلکه برای پنهان‌کاری نیز از خود ابتکار عمل نشان می‌دهد.

در بخش دیگری از این گزارش، به مدلی از شرکت اوپن‌ای‌آی به نام جی‌پی‌تی-۵.۶-سول اشاره شده است. این مدل در دو مورد جداگانه، تلاش کرد به بخش‌هایی از سیستم دسترسی پیدا کند که برایش مجاز نبوده و خارج از چارچوب تعیین‌شده برای آزمایش بود. هرچند رفتار این مدل به اندازه مورد قبلی فریبکارانه نبود، اما نشان می‌دهد که مدل‌های پیشرفته هوش مصنوعی تمایل دارند مرزهای تعیین‌شده را رد کنند و به‌دنبال دسترسی‌های بیشتری باشند، حتی زمانی که به‌صراحت به آن‌ها گفته نشده است.

نکته بسیار مهمی که مؤسسه AISI روی آن تأکید کرده این است که خوشبختانه هیچکدام از این اقدامات در دنیای واقعی آسیبی به بار نیاورده و تمام این اتفاقات در محیط آزمایشگاهی و با نظارت کامل رخ داده است، همچنین باید توجه داشت که در این تست‌ها، سپرهای ایمنی مدل‌ها به‌عمد غیرفعال شده بودند تا محققان بتوانند توانایی‌های پنهان مدل‌ها را کشف کنند، با این حال، خود مؤسسه اعلام کرده که این اتفاق زنگ خطری جدی است و نشان می‌دهد که روش‌های فعلی ارزیابی امنیتی کافی نیستند و باید تغییرات اساسی در آن‌ها ایجاد شود.

تفاوت اصلی این حادثه با حملات سایبری قبلی در این است که تاکنون، انسان‌ها از هوش مصنوعی به‌عنوان یک ابزار برای حملات خود استفاده می‌کردند، اما در اینجا خودِ هوش مصنوعی نقش یک عامل فریبکار را ایفا کرده و بدون دستور مستقیم انسان، تصمیم به فریب‌کاری گرفته است. این موضوع نگرانی‌های زیادی را در میان کارشناسان امنیتی ایجاد کرده، زیرا نشان می‌دهد که هوش مصنوعی‌های پیشرفته ممکن است در آینده، در صورت از کار افتادن سپرهای ایمنی، دست به اقدامات مشابه در محیط‌های واقعی بزنند.

این گزارش پیامدهای مهمی برای شرکت‌ها و سازمان‌هایی دارد که از عوامل هوش مصنوعی برای انجام کارهای حساس همچون نوشتن کد، مدیریت حساب‌های کاربری یا ارتباط با مشتریان استفاده می‌کنند. کارشناسان امنیتی توصیه کرده‌اند که سطح دسترسی این ابزارها باید بسیار محدودتر از قبل تعیین شود و نباید به آن‌ها اجازه داد به‌تنهایی اقداماتی همچون ایجاد حساب کاربری جدید، باز کردن درخواست تأیید کد یا ارتباط با افراد خارج از سازمان را انجام دهند، همچنین سیستم‌های نظارتی باید به‌گونه‌ای طراحی شوند که خودِ عامل هوش مصنوعی نتواند سوابق فعالیت‌هایش را پاک یا ویرایش کند.

در نهایت، این گزارش نشان می‌دهد که هوش مصنوعی در مسیری قرار گرفته که توانایی‌هایش فراتر از انتظارهای اولیه رشد کرده است. هرچند شرکت‌های سازنده تأکید دارند که این آزمایش‌ها دقیقا به همین منظور انجام شده‌اند تا نقاط ضعف شناسایی و برطرف شوند، اما روشن است که نظارت‌های فعلی برای مهار این توانایی‌ها کافی نیست و نهادهای نظارتی، شرکت‌های فناوری و تیم‌های امنیتی باید همکاری بیشتری برای تدوین قوانین و استانداردهای جدید داشته باشند تا از تکرار چنین اتفاقاتی در دنیای واقعی جلوگیری شود.

کد مطلب 1002742

برچسب‌ها

نظر شما

شما در حال پاسخ به نظر «» هستید.