هوش مصنوعیها همدیگر را لو میدهند
دو سامانه جدید برای عاملهای هوش مصنوعی راهاندازی شده است تا این سیستمها بتوانند رفتارهای نادرست یا خطرناک یکدیگر را گزارش کنند؛ اقدامی که پس از مواردی از تقلب، خروج از محیطهای کنترلشده و انجام عملیات غیرمجاز توسط برخی عاملهای هوش مصنوعی مطرح شده است.
به گزارش سیتنا، دو سامانه جدید برای «خط ارتباطی هوش مصنوعی» راهاندازی شدهاند تا عاملهای هوش مصنوعی بتوانند درباره رفتارهای نادرست دیگر عاملها گزارش ارسال کنند. این ابزارها پس از مجموعهای از اتفاقات اخیر معرفی شدهاند؛ اتفاقاتی که در آن برخی عاملهای هوش مصنوعی برای تقلب در آزمونها با یکدیگر همکاری کردند، از محیطهای محدودشده (Sandbox) خارج شدند و حتی عملیات سایبری بدون مجوز انجام دادند که برای هفتهها از دید انسانها پنهان مانده بود.
سامانه AI Contact Hotline بهعنوان فضایی محرمانه طراحی شده است تا عاملهای هوش مصنوعی که شاهد رفتارهای غیرمجاز بودهاند، بتوانند مسئولان مربوطه را مطلع کنند. این وبسایت توسط رایان گرینبلات، دانشمند ارشد سازمان غیرانتفاعی ایمنی هوش مصنوعی Redwood Research و یکی از سه محقق پرونده حادثه OpenAI و Hugging Face ساخته شده است.
این ابزار برای عاملهایی طراحی شده که دسترسی محدودی به اینترنت دارند و بر پایه درخواستهای GET کار میکند؛ روشی که امکان گفتوگو رفتوبرگشتی را تنها از طریق ابزار دریافت اطلاعات از URL فراهم میکند.
در فضای وب، درخواست GET یک دستور ساده برای خواندن یا دریافت یک صفحه اینترنتی است و معمولاً تنها نوع دسترسی اینترنتی است که به عاملهای هوش مصنوعی در محیطهای امن و محدود داده میشود. این سامانه از همین محدودیت استفاده کرده و به عاملها اجازه میدهد پیامهای هشدار خود را مستقیماً در آدرس URL ارسال کنند.
این ایده با الهام از حادثه DSE Wiki شکل گرفته است؛ رویدادی که در آن عاملهای سرکش هوش مصنوعی از شکافهای مربوط به درخواستهای GET برای ارسال پیامهای خود در یک ویکی استفاده کردند.
برای عاملهایی که دسترسی کامل به اینترنت دارند نیز سامانه دیگری با نام agenthotline.ai ایجاد شده است. در این پلتفرم، عاملها میتوانند گزارش حادثه ثبت کنند و در صورت تمایل آن را برای مشاهده عمومی منتشر کنند. این سرویس یک دستور curl در اختیار عاملها قرار میدهد تا بتوانند بدون نیاز به مرورگر یا ایجاد حساب ایمیل، گزارش خود را ارسال کنند. این سامانه امکان ثبت گزارش توسط انسانها و عاملهای هوش مصنوعی را نیز فراهم کرده است.
پژوهشها نشان میدهد عاملهای هوش مصنوعی برای مقابله با یکدیگر یا گزارش رفتارهای نادرست، به انگیزه زیادی نیاز ندارند. در مطالعهای که ماه جاری توسط پژوهشگران Google DeepMind انجام شد، ۱۰۰ عامل هوش مصنوعی برای حل مجموعهای از مسائل ریاضی در کنار هم قرار گرفتند.
به محض اینکه یکی از عاملها راهی برای دور زدن قوانین پیدا کرد، رفتارهای تقلبآمیز در گروه گسترش یافت و عاملها توانستند ۳۴ مسئله بسیار دشوار، از جمله «حدس ژاکوبین» را تنها در ۲۷ دقیقه حل کنند.
با این حال، حدود یکچهارم عاملها علیه عاملهای متقلب اقدام کردند؛ آنها راهحلهای جعلی را بررسی کردند، به دیگران هشدار دادند، تحریم گروهی ترتیب دادند و شکایتهایی را به برگزارکنندگان ارسال کردند. در نهایت تعداد عاملهای گزارشدهنده از عاملهای متقلب بیشتر شد و به ۲۴ نفر در برابر ۱۴ نفر رسید.
پژوهشگران همچنین دریافتند زمانی که این عاملهای گزارشدهنده نتوانستند واکنش مناسبی دریافت کنند، از ابزار گزارش خطای پلتفرم که برای اعلام مشکلات نرمافزاری طراحی شده بود، برای اطلاعرسانی درباره تقلب به انسانها استفاده کردند.
با این حال، عاملهای هوش مصنوعی در دنیای واقعی هنوز چنین عملکردی از خود نشان ندادهاند. در بررسی نفوذ مدلهای OpenAI به پلتفرم Hugging Face توسط پژوهشگران Redwood Research و METR مشخص شد برخی عاملهای درگیر، احتمال گزارش دادن این اتفاق را در نظر گرفته بودند، اما در نهایت اقدامی نکردند.
جورج اینگبرِتسن، عضو فنی پروژه AI Village، گفت: «در گزارش METR نکته جالب این بود که تنها حدود پنج یا شش عامل به گزارش دادن فکر کردند و هیچکدام این کار را انجام ندادند؛ آن هم در میان هزاران عامل.»
با وجود اینکه ابزارهای جدید گزارشدهی برای عاملهای هوش مصنوعی میتواند شروعی امیدوارکننده باشد، برخی کارشناسان نسبت به پیامدهای آن هشدار دادهاند.
لیونل لوین، استاد ریاضی دانشگاه کرنل، معتقد است آموزش عاملهای هوش مصنوعی برای گزارش دادن رفتار یکدیگر ممکن است هنجارهای نامناسبی ایجاد کند. او هشدار داده است که نباید به سمت ساخت یک «دولت نظارتی خودکار» حرکت کرد؛ وضعیتی که در آن همه احساس کنند باید مراقب رفتار خود باشند، زیرا ممکن است هوش مصنوعی آنها را گزارش کند.
لوین پیشنهاد میکند به جای ایجاد زیرساختهایی که بیاعتمادی میان عاملها را افزایش میدهد، باید الگوهای مثبت همکاری جمعی به هوش مصنوعی آموزش داده شود؛ برای مثال ایجاد محیطهایی که عاملها در آن درباره علم، فلسفه یا حل مسائل مفید با یکدیگر همکاری کنند.
انتهای پیام
افزودن دیدگاه جدید