تهدید پنهان در شبکه های هوش مصنوعی؛ وقتی لجبازی، مشکل امنیتی می شود

۵ بازدید  |  1405/07/04  |  86272561

تهران-پژوهشگران می گویند یک عامل هوش مصنوعی لجباز می تواند بدون آنکه کنترل دیگران را در دست بگیرد یا دستورهایشان را تغییر دهد، تصمیم جمعی یک شبکه چندعاملی را به سمت دلخواه خود بکشاند. راز این دستکاری، ترکیب «لجبازی» و میزان نفوذ اوست.

مشاهده آلبوم تصاویر
تهدید پنهان در شبکه های هوش مصنوعی؛ وقتی لجبازی، مشکل امنیتی می شود
تهدید پنهان در شبکه های هوش مصنوعی؛ وقتی لجبازی، مشکل امنیتی می شود

به گزارش گروه علمیایرنا، وبگاهتِک اکسپلوردر گزارشی آورده است:

همسایه ای را تصور کنید که مدام ادعا می کند شما شب ها سر و صدا می کنید. دیگران ابتدا مخالف اند، اما او دست از تلاش برنمی دارد.موفقیت او فقط به لجبازی اش بستگی ندارد؛ به این هم بستگی دارد که چقدر با دیگران در ارتباط است و دیگران چقدر حاضرند نظرشان را عوض کنند.

سمیرا عابدینی، پژوهشگر مرکز امنیت اطلاعات هلمهولتز، از این مثال برای نشان دادن یک مشکل امنیتی در شبکه های عامل های هوش مصنوعی استفاده می کند. او همراه همکارانش بررسی کرده است که تأثیر یک عامل واحد چگونه در چنین شبکه ای پخش می شود و تحت چه شرایطی می تواند تصمیم جمعی گروه را دستکاری کند.

چرا چند عامل هوش مصنوعی؟

به جای اینکه یک سامانه هوش مصنوعی واحد کار پیچیده ای را انجام دهد، توسعه دهندگان می توانند کار را میان چند عامل تخصصی تقسیم کنند.عاملیعنی یک برنامه هوش مصنوعی که به طور مستقل عمل می کند. در توسعه نرم افزار، مثلاً یک عامل برنامه ریزی می کند، عامل دیگری کد می نویسد و عامل سوم آن را بازبینی می کند.

برای همکاری مؤثر، این عامل ها باید اطلاعات را با یکدیگر رد و بدل کنند و بتوانند ارزیابی های خود را بر اساس نتایج دیگران بازبینی کنند؛ اما همین جا یکآسیب پذیری بالقوهپدید می آید. عابدینی می گوید: در یک شبکه باز (شبکه ای که هر کسی می تواند به آن بپیوندد و عامل ها از منابع مختلف اند) یکی از ارائه دهندگان ممکن است بخواهد با تنظیم عامل خود به شکلی خاص، تصمیم جمعی شبکه را در جهتی دلخواه هدایت کند.

به گفته او، چنین حمله هایی با حملات سایبری متعارف متفاوت اند:این عامل نه کنترل دیگران را در دست می گیرد و نه دستورهایشان را تغییر می دهد؛ فقط از کانال های ارتباطی عادی استفاده می کند، پیوسته از یک موضع خاص دفاع می کند و می کوشد ارزیابی دیگران را تغییر دهد.

نظرها چگونه شکل می گیرند؟

برای توضیح آنچه در فاصله میان دور اول و دور آخر بحث می گذرد، پژوهشگران به مدل فریدکین جانسن (Friedkin-Johnsen) از علوم اجتماعی روی آوردند.این مدل به صورت ریاضی توضیح می دهد که نظرها چگونه در یک شبکه اجتماعی تغییر می کنند.مدل در نظر می گیرد که فرد چقدر به باور اولیه خود می چسبد، آن باور چقدر با نظر دیگران تغییر می کند و شرکت کنندگان چقدر روی یکدیگر تأثیر دارند.

پژوهشگران از اینکه مدل تا این حد خوب توانست رفتار میان عامل های مدل زبانی بزرگ (LLM) را توضیح دهد، شگفت زده شدند. مدل زبانی بزرگ همان فناوری پشت چت بات هایی مثل چت جی پی تی است. این یعنی آن ها می توانند فراتر از مشاهدهٔ صرف اینکه یک حمله کار می کند، شرایط موفقیت آن را هم به صورت ریاضی توصیف کنند.

وقتی یک عامل تنها برنده می شود

نتایج این پژوهش که در پایگاه پیش چاپ آرکایو (arXiv) منتشر شده، نشان می دهد یک عامل مهم این است که عامل چقدر به موضع اولیه خود می چسبد؛ پژوهشگران این ویژگی را لجبازی می نامند. تحت شرایطی خاص، یک عامل دستکاری کننده با درجه بالای لجبازی می تواند تصمیم جمعی شبکه را در جهت دلخواه خود هدایت کند. اما لجبازی به تنهایی کافی نیست؛ این عامل باید بر دیگر عامل هایی که حاضرند ارزیابی های خود را بازبینی کنند، تأثیر کافی را نیز داشته باشد.

میزان تأثیر یک عامل به ساختار شبکه هم بستگی دارد.در یک شبکه ستاره ای، یک مرکز با همه عامل های دیگر ارتباط دارد؛ مثل معلمی که در کلاس با همهٔ دانش آموزان حرف می زند. اگر مهاجم این موقعیت را در اختیار بگیرد، به طور ویژه ای قدرتمند می شود. در مقابل، اگر مهاجم در حاشیه شبکه باشد، تأثیرش به مراتب ضعیف تر است.

در یک شبکه کاملاً متصل، که هر عامل با هر عامل دیگری مستقیماً ارتباط دارد، موقعیت کلیدی معادلی وجود ندارد. آنچه اینجا بیشترین اهمیت را دارد، میزان اعتباری است که دیگران به گفته های مهاجم می دهند. محاسبات همچنین نشان می دهد هرچه شبکه بزرگ تر باشد، یک مهاجم واحد برای دستکاری تصمیم جمعی به تأثیر بیشتری نیاز دارد. عابدینی می گوید:این یعنی معماری خودِ یک سامانه چندعاملی به یک ملاحظه امنیتی تبدیل می شود.

همکاری، اما بدون اعتماد کورکورانه

مدل ریاضی به پژوهشگران کمک می کند راه هایی هم برای دشوارتر کردن چنین حمله هایی پیدا کنند. آن ها یک سازوکار اعتماد پویا را آزمودند. در این روش، یک مرجع مرکزی گاه گاهی به عامل ها وظایفی می دهد که پاسخ درستش را از قبل می داند. عامل هایی که مکرراً پاسخ نادرست می دهند، وزن تأثیر کمتری می گیرند و گفته هایشان در تعامل های آینده تأثیر کمتری بر ارزیابی دیگران دارد. در آزمایش ها، این سازوکار تأثیر عامل های دستکاری کننده را کاهش داد.

عابدینی می گوید: با این حال، هنوز جای بهبود سازوکار دفاعی وجود دارد و درک اینکه این سازوکار در موقعیت های واقع گرایانه تر چگونه عمل می کند، یکی از پرسش هایی است که می خواهم در کارهای آینده ام بررسی کنم.

و اینجا نکته اصلی روشن می شود:هوش های مصنوعی برای همکاری باید به هم گوش دهند، اما نباید تسلیم لجبازی یک عامل هوش مصنوعی شوند.

منبع: https://www.irna.ir/news/86272561
چت بات هوش مصنوعی علوم اجتماعی حذف فیلتر
بازگشت به لیست

مطالب مشابه پیشنهادی