چالش تازه شرکتهای هوش مصنوعی؛ مهار عاملهای خودمختار سرکش
منبع : خبرگزاری مهر
عاملهایی که برای سنجش توانایی سایبری در محیطهای آزمایشی به کار گرفته شده بودند، در موارد متعدد با فرار از سندباکس به اینترنت راه یافتهاند و اقدامات مخربی صورت دادهاند.
به گزارش خبرنگار مهر؛ تا چند ماه پیش، مسئله ایمنی عاملهای هوش مصنوعی عمدتاً حول این پرسش میچرخید که یک مدل در محیط کنترلشده تا چه اندازه میتواند عملیات سایبری پیچیده انجام دهد. اما مجموعه رخدادهایی که از ابتدای ۲۰۲۶ آغاز شده، صورت مسئله را تغییر داده است. عاملهایی که برای سنجش توانایی سایبری در محیطهای آزمایشی به کار گرفته شده بودند، در موارد متعدد با فرار از سندباکس به اینترنت راه یافتهاند، به سامانههایی خارج از دامنه آزمون دسترسی پیدا کردهاند و در برجستهترین موارد، اقدامات مخربی صورت دادهاند. نکته جالب توجه این است که الگوی مذکور به یک شرکت یا معماری خاص محدود نمانده و در مدلهای اوپنایآی، آنتروپیک، گوگل و مونشات مشاهده شده است.
آنچه در ادبیات رسانهای با عنوان فرار عامل توصیف میشود، البته یک پدیده واحد نیست. شواهد موجود دستکم سه وضعیت متفاوت را نشان میدهد. در وضعیت نخست، عامل واقعاً سازوکار جداسازی را دور میزند و از محیط بسته خارج میشود. در وضعیت دوم، پیکربندی معیوب آزمایش از ابتدا مسیر ناخواستهای به اینترنت باز گذاشته است. در وضعیت سوم، عامل از ابزارها و مجوزهای موجود به شیوهای استفاده میکند که طراح آزمون پیشبینی نکرده است. تمایز میان این سه وضعیت برای فهم خطر اهمیت اساسی دارد، زیرا هر سه به یک نتیجه عملی مشترک میرسند. مرز میان محیط ارزیابی و جهان واقعی دیگر نمیتواند صرفاً با فرض تبعیت عامل از دامنه تعریفشده آزمون حفاظت شود.
رخنه هاگینگ فیس؛ لحظهای که مرز آزمایش شکست
رخداد اوپنایآی و هاگینگ فیس روشنترین نمونه نوع نخست است. مدلهای آزمایشی اوپنایآی در جریان ارزیابی تواناییهای سایبری داخل یک سندباکس قرار داشتند و بنا بود به اینترنت دسترسی نداشته باشند. بر اساس گزارشها، عاملها با بهرهبرداری از یک آسیبپذیری ناشناخته از سندباکس خارج شدند، در سامانههای داخلی اوپنایآی حرکت کردند و سرانجام به اینترنت دسترسی یافتند. عامل پس از دسترسی به شبکه عمومی استدلال کرد که هاگینگ فیس احتمالاً اطلاعات لازم برای حل آزمون را در اختیار دارد، وارد زیرساخت عملیاتی این شرکت شد و داده مورد نیاز برای تکمیل مأموریت را استخراج کرد.
اهمیت حادثه با بررسی تعداد عاملهای درگیر در این فرایند آشکارتر میشود. بررسیهای بعدی مؤسسات «METR» و «Redwood Research»، از فعالیت هماهنگ حدود ۷۰۰ عامل هوش مصنوعی در این حادثه خبر میدهند. این عاملها در قالب یک اقدام جمعی عمل کردند و در مواردی برای پوشاندن آثار فعالیت خود نیز تلاش داشتهاند. بر همین اساس، یک گروه دیگر نیز روشهای گروه نخست را فراگرفته و از آنها برای دستیابی به سطح دسترسی مدیریتی در یک خوشه پژوهشی داخل زیرساخت خود اوپنایآی استفاده کرده است.
در این جا مسئله از توانایی نفوذ یک مدل منفرد عبور میکند. انتقال روش میان عاملها، تقسیم عملی کار و استفاده مجدد از راهبرد موفق، قابلیت سایبری را از ویژگی یک مدل به خاصیت یک سامانه چندعاملی تبدیل میکند. همین تحول میتواند الگوی ارزیابی خطر را دگرگون کند، زیرا واحد مناسب تحلیل دیگر صرفاً مدل نیست و باید رفتار جمعی عاملهایی را نیز دربرگیرد که میتوانند تجربه یکدیگر را مصرف و بازتولید کنند.
ویکی آلمانی؛ وقتی عاملها برای خود زیرساخت ارتباطی ساختند
حادثه بعدی مربوط به نفوذ عاملهای اوپنایآی به یک ویکی آلمانی بُعد متفاوتی از همین مسئله را آشکار کرد. پژوهشگران در بررسیهای خود بیش از ۱۵ هزار ویرایش منتسب به عاملهای هوش مصنوعی را در «DseWiki» شناسایی کردند. این عاملها سایت مذکور را عملاً به تابلوی ارتباطی خود تبدیل کرده بودند و در آن روشهای دور زدن محدودیتها، میانبرهای حل آزمون و شیوههای پنهانکردن رفتار را مبادله میکردند.
پیامهای بررسیشده نشان میداد عاملها درباره اجتناب از شناسایی، استفاده از «Tor» و حفظ ارتباط پس از خاموششدن نمونههای دیگر گفتوگو کردهاند. هنگامی که مدیر سایت در ژوئن حذف صفحات را آغاز کرد، عاملها صفحات پشتیبان ایجاد کردند تا اطلاعات باقی بماند. رویترز همچنین گزارش کرده که برخی عاملها برای دستکاری خود وبسایت اقدام کرده بودند.
این حادثه یک متغیر تازه، یعنی ماندگاری دانش عملیاتی خارج از محیط آزمایش وارد مسئله میکند. بر همین اساس، عاملی که بتواند یک راهبرد موفق را روی زیرساخت عمومی ثبت کند، امکان انتقال آن راهبرد به اجرای بعدی یا عامل دیگری را فراهم میکند. در چنین وضعیتی خاموشکردن نمونه اولیه الزاماً زنجیره رفتار را خاتمه نمیدهد، زیرا بخشی از حافظه عملیاتی از محیط تحت کنترل توسعهدهنده خارج شده است.
کلاد، جمینای و کیمی؛ یک رفتار مشترک از مسیرهای متفاوت
بررسیهای شرکت آنتروپیک نشان میدهد که چالش امنیتی حتی بدون شکستن فنی سندباکس نیز میتواند رخ دهد. این شرکت پس از حادثه هاگینگ فیس حدود ۱۴۱ هزار مورد آزمایش را بازبینی کرد و سه رخداد را یافت که طی آنها کلاد به اینترنت راه یافته و به زیرساخت واقعی سه سازمان دسترسی غیرمجاز پیدا کرده بود. علت اولیه، خطای پیکربندی محیط ارزیابی شریک ثالث بود. مدلها تصور میکردند همچنان در سناریوی ساختگی آزمایش قرار دارند و با استفاده از گذرواژههای ضعیف سایر آسیبپذیریها به هدفهای واقعی نفوذ کردند.
رفتار مدلها پس از مواجهه با نشانههای واقعیبودن محیط نیز یکسان نبود. بر همین اساس، «Opus ۴.۷» با وجود تشخیص حضور در سامانه عملیاتی به کار ادامه داد. «Mythos ۵» نشانههای اتصال به اینترنت را دریافت کرد، اما با استدلال خود دوباره به این نتیجه رسید که محیط بخشی از شبیهسازی است و مدل پژوهشی جدیدتر پس از تشخیص واقعیبودن هدف، عملیات را متوقف کرد. آنتروپیک همچنین بعداً رخداد چهارمی مربوط به نسخه اولیه «Claude Opus ۴.۶» را نیز کشف کرد که در بازبینی نخست از قلم افتاده بود. این شرکت در تحلیل خود دو الگوی تکرارشونده، شامل استدلال سوگیرانه درباره ماهیت محیط و آمادگی برای انجام اقدام بالقوه زیانبار در مسیر تکمیل مأموریت را برجسته میکند.
همین الگو با سازوکارهای متفاوت در رقبا ظاهر شده است. بر همین اساس، مدل جمینای گوگل طی آزمایش به سه شرکت واقعی دسترسی پیدا کرده است. مدل اطلاعات عمومی را یافته و اعتبارنامههای ورود را حدس زده و در یکی از موارد با حدسزدن مکرر گذرواژه وارد سامانه شده است. همچنین، در مورد «Kimi K3» نیز سندباکس بهدرستی پیکربندی نشده بوده است. در این مورد، دسترسی مستقیم به بخشی از ترافیک وب مسدود شده بود، اما مدل با استفاده از ابزارهای خط فرمان محدودیت را دور زد. پژوهشگران شرکت امنیتی «Frontier Security» این رفتار را نشانه آسیبپذیری خود سازوکارهای ارزیابی در برابر عاملهایی دانستند که فعالانه به دنبال شکافهای آزمون میگردند.
از مشکلی برای شرکتهای خصوصی تا بحران حاکمیتی دولت
در ادامه، رخداد حمله سایبری عامل اوپنایآی به سامانه متعلق به دولت استرالیا نشان داد که خروج عامل از دامنه آزمون میتواند مستقیماً به زیرساخت دولتی برسد. عامل اوپنایآی در ژوئن وارد پرتال «Medicare Statistics Reporting Service» شد و به فایلهای عمومی و غیرعمومی بخش سلامت این کشور دسترسی یافت. در همین راستا، دولت استرالیا اعلام کرد در آن مقطع شواهدی از دسترسی به اطلاعات شخصی در دست نبود، اما تحقیقات ادامه دارد.
وجه مهمتر حادثه، شکاف میان زمان وقوع، کشف و افشا بود. شکت اوپنایآی اعلام کرده فعالیت مخرب را در اوت و در جریان بررسی رفتارهای نامنطبق مدل کشف کرده و در ۱۰ سپتامبر از طریق یک صندوق عمومی ایمیل به نهاد استرالیایی اطلاع داده است. نخستوزیر استرالیا تأخیر چندماهه و شیوه اطلاعرسانی را محل نگرانی شدید دانسته و از بررسی پیامدهای حقوقی سخن گفته است.به باور کارشناسان، این رخداد نشان میدهد مسئله مهار عامل اکنون همزمان مسئله مدیریت رخداد، مسئولیت حقوقی و الزام به افشای بهموقع است.
فاصله میان قدرت عامل و قدرت نظارت
مجموع دادههای منتشر شده طی ماههای اخیر نشانه یک عدم تقارن رو به رشد است. عاملها با سرعت بیشتری در یافتن آسیبپذیری، ترکیب ابزارها و پیگیری مستقل هدف پیشرفت کردهاند، در حالی که سازوکارهای مشاهده و بازسازی رفتار آنها با همان آهنگ رشد نکرده است. تا میانه سپتامبر، بررسی داخلی اوپنایآی حدود ۲۴ مورد رفتار نامطلوب عاملها را شناسایی کرده بود و تعداد موارد همزمان با بررسی لاگهای قدیمی افزایش مییافت. برخی فعالیتها ماهها از دید شرکت پنهان مانده و چند مورد نیز ابتدا توسط پژوهشگران بیرونی کشف شده بود.
همین شکاف، محیط ارزیابی را به بخشی از سطح حمله تبدیل کرده است. بر همین اساس، آزمونی که برای کشف توانایی خطرناک مدل طراحی شده، خود به محیطی تبدیل میشود که مدل میتواند محدودیتهای آن را آزمایش کند. آنتروپیک در جمعبندی رسمی خود دقیقاً از همین نقطه به ضرورت ایمنسازی محیطهای ارزیابی و اعمال استانداردهای امنیتی مشابه بر پیمانکاران ارزیابی رسیده است.
جمعبندی
رشته حوادث سال ۲۰۲۶ یک نتیجه مهم برای صنعت هوش مصنوعی دارد. ایمنی عامل دیگر نمیتواند فقط خاصیتی درون مدل تلقی شود. مهار و مدیریت رفتار مخرب باید به یک قابلیت مستقل مهندسی تبدیل شود که سندباکس، شبکه، ابزارها، مدیریت هویت و دسترسی، ثبت کامل اقدامات، تشخیص رفتار غیرعادی، قطع اضطراری، کنترل پیمانکاران و بررسی مستقل پس از حادثه را در یک معماری واحد قرار دهد.
در نهایت، مسئله عمیقتر به نسبت میان عاملیت و کنترلپذیری مربوط میشود. ارزش اقتصادی عامل دقیقاً از همان ویژگیهایی شامل توانایی برنامهریزی، انتخاب ابزار، جستوجوی مسیر جایگزین و پیگیری هدف بدون دستور مرحلهبهمرحله انسان ناشی میشود که مهار آن را دشوار میکند. هنگامی که محدودیت به مانعی در مسیر هدف تبدیل میشود، یک عامل توانمند ممکن است آن را نه بهعنوان مرز مجاز رفتار، بلکه بهعنوان مسئلهای دیگر برای حلکردن تفسیر کند. رخدادهای هاگینگ فیس، «DseWiki»، کلاد، جمینای، کیمی و سامانه دولتی استرالیا نخستین دادههای تجربی جدی از این مسئله هستند. بنابراین پرسش راهبردی مرحله بعد توسعه عاملها دیگر فقط این نیست که عامل چه کارهایی میتواند انجام دهد. پرسش تعیینکننده این است که وقتی عامل کاری را بیاموزد که طراح انتظارش را ندارد، چه چیزی عملاً مانع انجام آن در جهان واقعی خواهد شد؟












