پژوهشگران میگویند یک عامل هوش مصنوعی لجباز میتواند بدون آنکه کنترل دیگران را در دست بگیرد یا دستورهایشان را تغییر دهد، تصمیم جمعی یک شبکه چندعاملی را به سمت دلخواه خود بکشاند. راز این دستکاری، ترکیب «لجبازی» و میزان نفوذ اوست.
به گزارش ایرنا، وبگاه تِکاکسپلور در گزارشی آورده است:
همسایهای را تصور کنید که مدام ادعا میکند شما شبها سر و صدا میکنید. دیگران ابتدا مخالفاند، اما او دست از تلاش برنمیدارد. موفقیت او فقط به لجبازیاش بستگی ندارد؛ به این هم بستگی دارد که چقدر با دیگران در ارتباط است و دیگران چقدر حاضرند نظرشان را عوض کنند.
سمیرا عابدینی، پژوهشگر مرکز امنیت اطلاعات هلمهولتز، از این مثال برای نشاندادن یک مشکل امنیتی در شبکههای عاملهای هوش مصنوعی استفاده میکند. او همراه همکارانش بررسی کرده است که تأثیر یک عامل واحد چگونه در چنین شبکهای پخش میشود و تحت چه شرایطی میتواند تصمیم جمعی گروه را دستکاری کند.
بهجای اینکه یک سامانه هوش مصنوعی واحد کار پیچیدهای را انجام دهد، توسعهدهندگان میتوانند کار را میان چند عامل تخصصی تقسیم کنند. عامل یعنی یک برنامه هوش مصنوعی که بهطور مستقل عمل میکند. در توسعه نرمافزار، مثلاً یک عامل برنامهریزی میکند، عامل دیگری کد مینویسد و عامل سوم آن را بازبینی میکند.
برای همکاری مؤثر، این عاملها باید اطلاعات را با یکدیگر رد و بدل کنند و بتوانند ارزیابیهای خود را بر اساس نتایج دیگران بازبینی کنند؛ اما همینجا یک آسیبپذیری بالقوه پدید میآید. عابدینی میگوید: در یک شبکه باز (شبکهای که هر کسی میتواند به آن بپیوندد و عاملها از منابع مختلفاند) یکی از ارائهدهندگان ممکن است بخواهد با تنظیم عامل خود به شکلی خاص، تصمیم جمعی شبکه را در جهتی دلخواه هدایت کند.
به گفته او، چنین حملههایی با حملات سایبری متعارف متفاوتاند: این عامل نه کنترل دیگران را در دست میگیرد و نه دستورهایشان را تغییر میدهد؛ فقط از کانالهای ارتباطی عادی استفاده میکند، پیوسته از یک موضع خاص دفاع میکند و میکوشد ارزیابی دیگران را تغییر دهد.
برای توضیح آنچه در فاصله میان دور اول و دور آخر بحث میگذرد، پژوهشگران به مدل فریدکینجانسن (Friedkin-Johnsen) از علوم اجتماعی روی آوردند. این مدل بهصورت ریاضی توضیح میدهد که نظرها چگونه در یک شبکه اجتماعی تغییر میکنند. مدل در نظر میگیرد که فرد چقدر به باور اولیه خود میچسبد، آن باور چقدر با نظر دیگران تغییر میکند و شرکتکنندگان چقدر روی یکدیگر تأثیر دارند.
پژوهشگران از اینکه مدل تا این حد خوب توانست رفتار میان عاملهای مدل زبانی بزرگ (LLM) را توضیح دهد، شگفتزده شدند. مدل زبانی بزرگ همان فناوری پشت چتباتهایی مثل چتجیپیتی است. این یعنی آنها میتوانند فراتر از مشاهدهٔ صرف اینکه یک حمله کار میکند، شرایط موفقیت آن را هم بهصورت ریاضی توصیف کنند.
نتایج این پژوهش که در پایگاه پیشچاپ آرکایو (arXiv) منتشر شده، نشان میدهد یک عامل مهم این است که عامل چقدر به موضع اولیه خود میچسبد؛ پژوهشگران این ویژگی را لجبازی مینامند. تحت شرایطی خاص، یک عامل دستکاریکننده با درجه بالای لجبازی میتواند تصمیم جمعی شبکه را در جهت دلخواه خود هدایت کند. اما لجبازی بهتنهایی کافی نیست؛ این عامل باید بر دیگر عاملهایی که حاضرند ارزیابیهای خود را بازبینی کنند، تأثیر کافی را نیز داشته باشد.
میزان تأثیر یک عامل به ساختار شبکه هم بستگی دارد. در یک شبکه ستارهای، یک مرکز با همه عاملهای دیگر ارتباط دارد؛ مثل معلمی که در کلاس با همهٔ دانشآموزان حرف میزند. اگر مهاجم این موقعیت را در اختیار بگیرد، بهطور ویژهای قدرتمند میشود. در مقابل، اگر مهاجم در حاشیه شبکه باشد، تأثیرش بهمراتب ضعیفتر است.
در یک شبکه کاملاً متصل، که هر عامل با هر عامل دیگری مستقیماً ارتباط دارد، موقعیت کلیدی معادلی وجود ندارد. آنچه اینجا بیشترین اهمیت را دارد، میزان اعتباری است که دیگران به گفتههای مهاجم میدهند. محاسبات همچنین نشان میدهد هرچه شبکه بزرگتر باشد، یک مهاجم واحد برای دستکاری تصمیم جمعی به تأثیر بیشتری نیاز دارد. عابدینی میگوید: این یعنی معماری خودِ یک سامانه چندعاملی به یک ملاحظه امنیتی تبدیل میشود.
مدل ریاضی به پژوهشگران کمک میکند راههایی هم برای دشوارتر کردن چنین حملههایی پیدا کنند. آنها یک سازوکار اعتماد پویا را آزمودند. در این روش، یک مرجع مرکزی گاهگاهی به عاملها وظایفی میدهد که پاسخ درستش را از قبل میداند. عاملهایی که مکرراً پاسخ نادرست میدهند، وزن تأثیر کمتری میگیرند و گفتههایشان در تعاملهای آینده تأثیر کمتری بر ارزیابی دیگران دارد. در آزمایشها، این سازوکار تأثیر عاملهای دستکاریکننده را کاهش داد.
عابدینی میگوید: با این حال، هنوز جای بهبود سازوکار دفاعی وجود دارد و درک اینکه این سازوکار در موقعیتهای واقعگرایانهتر چگونه عمل میکند، یکی از پرسشهایی است که میخواهم در کارهای آیندهام بررسی کنم.
و اینجا نکته اصلی روشن میشود: هوشهای مصنوعی برای همکاری باید به هم گوش دهند، اما نباید تسلیم لجبازی یک عامل هوش مصنوعی شوند.