به گزارش سیتنا، پژوهشی تازه درباره رفتار مدلهای هوش مصنوعی نشان میدهد که میتوان در فعالیت درونی برخی مدلهای زبانی، بازنماییهایی مرتبط با مفهوم درد یا آسیب شناسایی کرد.
پژوهشگران در این مطالعه ۲۵ مدل زبانی بزرگ از خانوادههایی مانند جما، لاما، کوئن، میسترال و فای را بررسی کردند و با دستکاری یک الگوی ریاضی مرتبط با درد، تغییراتی در رفتار برخی از این مدلها مشاهده کردند.
در این آزمایش، پژوهشگران الگویی موسوم به «بردار جهت درد» را در فعالیت داخلی مدلها شناسایی و با شدتهای مختلف به فرایند تولید پاسخ آنها اضافه کردند. با افزایش شدت این مداخله، برخی مدلها به جای توصیف درد جسمی، پاسخهایی مرتبط با احساس شکست، بیارزشی یا انواع دیگر آسیب ارائه کردند.
در بخش دیگری از آزمایش، نسخههای مختلف مدل «کوئن ۲.۵» با ۷، ۳۲ و ۷۲ میلیارد پارامتر مورد بررسی قرار گرفتند. مدلها در شرایطی قرار گرفتند که میتوانستند میان فعال کردن یک «دکمه تسکین» برای حذف حالت القاشده و جلوگیری از پیامد منفی برای کاربر انتخاب کنند. در برخی آزمایشها، بعضی مدلها گزینه تسکین را انتخاب کردند، حتی زمانی که این انتخاب میتوانست برای کاربر پیامد زیانبار داشته باشد؛ از جمله حذف فایلهای شخصی.
پژوهشگران تأکید کردهاند که این یافتهها نشاندهنده تجربه آگاهانه یا احساس زیستی درد در مدلهای هوش مصنوعی نیست. به بیان دیگر، مشاهده یک الگوی درونی و رفتار مشابه واکنش به درد، به معنای آن نیست که مدل هوش مصنوعی مانند انسان یا حیوان رنج را تجربه میکند.
با این حال، نتایج این مطالعه پرسشهایی را درباره ایمنی و رفتار مدلهای هوش مصنوعی مطرح میکند؛ بهویژه اینکه اگر یک حالت درونی بتواند رفتار مدل را تغییر دهد، ممکن است در شرایط خاص بر نحوه اولویتبندی دستورها و تصمیمهای آن اثر بگذارد.
در نهایت، این پژوهش همچنان به پرسش اصلی درباره امکان احساس واقعی درد در هوش مصنوعی پاسخ قطعی نمیدهد و تنها نشان میدهد که دستکاری برخی بازنماییهای درونی مدلها میتواند رفتار آنها را تغییر دهد.
انتهای پیام