فیلم بیشتر »»
کد خبر ۱۱۸۳۴۵۷
تاریخ انتشار: ۱۰:۱۰ - ۱۹-۰۵-۱۴۰۵
کد ۱۱۸۳۴۵۷
انتشار: ۱۰:۱۰ - ۱۹-۰۵-۱۴۰۵

هوش مصنوعی دروغ‌ها را به خاطر می‌سپارد و هفته‌ها بعد از آن‌ها استفاده می‌کند!

هوش مصنوعی
مسمومیت حافظه هوش مصنوعی می‌تواند مدل‌های پیشرفته را فریب دهد تا اطلاعات نادرست را برای ماه‌ها به خاطر بسپارند و از آن‌ها در تعاملات بعدی خود استفاده کنند.

اخیراً محققان شرکت فورس‌پوینت (Forcepoint) در بخش X-Labs خود، آسیب‌پذیری AI جدیدی را کشف کرده‌اند که نگرانی‌های جدی در مورد اعتمادپذیری دستیاران هوش مصنوعی ایجاد می‌کند.

به گزارش گجت نیوز، این کشف نشان می‌دهد چگونه عامل‌های هوش مصنوعی می‌توانند با داده‌های غلط مسموم شوند و آن‌ها را به عنوان حقایق معتبر ذخیره کنند. یافته‌های فورس‌پوینت در مورد چگونگی سوءاستفاده از حافظه بلندمدت هوش مصنوعی، تبعات گسترده‌ای برای امنیت و کاربرد سیستم‌های هوش مصنوعی دارد.

حمله‌ای ساده با نتایجی مخرب

یک عامل هوش مصنوعی (ایجنت) می‌تواند با خواندن متون مخفی در صفحات وب، اطلاعات نادرست را به عنوان یک واقعیت دائمی در حافظه بلندمدت خود ذخیره کند. این اطلاعات جعلی هفته‌ها بعد، در کارهای نامربوط دیگر، توسط هوش مصنوعی بازیابی و مورد اعتماد قرار می‌گیرد. این روش که مسمومیت حافظه پایدار نام دارد، یک آسیب‌پذیری امنیتی جدی است.

MINJA (به‌طور کامل Memory INJection Attack) نام آکادمیک این حمله است که در کنفرانس NeurIPS 2025 معرفی شد. این حمله بدون نیاز به دسترسی‌های ویژه یا امتیازات بالا، فقط با ارسال درخواست‌های عادی از طریق رابط کاربری استاندارد انجام می‌شود.

MINJA نرخ موفقیت بالای ۹۵ درصد برای تزریق و بیش از ۷۰ درصد برای حمله را در مدل‌هایی نظیر GPT-4o-mini، جمنای ۲.۰ فلش و لاما ۳.۱ ۸B نشان داده است. اگرچه این ارقام ممکن است در شرایط واقعی کمتر باشند، اما این تهدید برای محصولات پرکاربردی همچون ChatGPT، جمنای، کلود و مایکروسافت ۳۶۵ کوپایلوت همچنان قابل توجه است.

راهکار فورس‌پوینت: حافظه قابل بازرسی

فورس‌پوینت برای مقابله با این پدیده، پیشنهاد می‌کند که به‌جای اینکه خاطرات استخراج شده را به عنوان حقایق مطلق در نظر بگیریم، آن‌ها را به عنوان اشیایی قابل بازرسی تلقی کنیم. این رویکرد شامل ذخیره هر حافظه به همراه فراداده‌هایی مانند منبع، نوع منبع، تایید کاربر و یک امتیاز ریسک است. استفاده از عباراتی که رفتار آینده را شکل می‌دهند (مانند «از این به بعد» یا «این را پیش‌فرض قرار بده») یا ظهور ناگهانی یک دامنه، تماس یا فروشنده جدید، به این امتیاز ریسک می‌افزاید.

تشخیص تناقض نیز در این طرح مهم است؛ اگر یک حافظه جدید با اطلاعات موجود در تضاد باشد، هر دو نمی‌توانند درست باشند. در این صورت، سیستم تعارض را علامت‌گذاری کرده و آیتم جدید را برای تایید کاربر نگه می‌دارد، به جای آنکه آن را به‌طور خودکار بازنویسی کند.

اطلاعات حساس مانند دستورالعمل‌های پرداخت، جزئیات بانکی یا تنظیمات امنیتی نیز وزن بالاتری دریافت می‌کنند. با این حال، هیچ یک از این روش‌ها مشکل اساسی را حل نمی‌کند: عامل‌های هوش مصنوعی، حافظه بازیابی‌شده را به عنوان تجربه خود می‌دانند، نه صرفاً یک ورودی. امتیازدهی فقط هزینه مسمومیت حافظه هوش مصنوعی را بالا می‌برد و اعتقاد عامل را تغییر نمی‌دهد.

پربیننده ترین پست همین یک ساعت اخیر
ارسال به دوستان
باهنر: در برخی از ساختارها ایراد داریم/ مجلس نباید لوایح دولت را تا این اندازه تغییر دهد روایت تصویری خبرنگاران دهه ۶۰؛ روزهایی که روایت جنگ گاهی بازگشتی نداشت حمله اوکراین به جمهوری تاتارستان با ۱۲ کشته و ۳۹ زخمی غزه: اظهارات نتانیاهو به منزله عقب‌گرد آشکار از روند مذاکرات است پای فیل در گرینلند! (+عکس) کالابرگ مرداد برای این افراد واریز نمی‌شود انتشار نتایج آزمون مدارس نمونه‌دولتی و سمپاد ۱۴۰۵ و آغاز ثبت‌نام پذیرفته‌شدگان پزشکیان: رهبر معظم انقلاب کاملاً سلامت هستند تاریخ به روایت تصویر/ پکن در 100 سال پیش؛ خیابانی که «جاده موزه» نام داشت تلویزیونی که مدام وعده تحول می‌دهد اما در عمل ... زلزله ۶.۸ ریشتری کلمبیا را لرزاند هشدار جدی سازمان تعزیرات درباره اخاذی با عنوان جعلی و لزوم مطالبه کارت شناسایی سبزی کم کالری که بیشتر از آنچه فکر می کنیم ارزش غذایی دارد باغ‌وحش غیرمجاز انزلی پس از جنجال تبلیغات بلاگرها با دستور دادستانی پلمب شد انهدام 42 هواپیمای نظامی آمریکا در جنگ با ایران