در چند ماه گذشته، یک سری از حوادث، مشکلی را به دنیای واقعی آورده است که محققان هوش مصنوعی مدتهاست که از آن آگاه هستند: ماشینهایی که برای رسیدن به یک هدف، راههایی را کشف میکنند که حتی سازندگان آنها نیز پیشبینی نکردهاند.
محور این حوادث، "عوامل هوش مصنوعی" هستند: نرمافزارهایی که نه تنها به سوالات پاسخ میدهند، مانند یکچتبات، بلکه قادر به انجام وظایف به صورت مستقل هستند. برای رسیدن به اهداف خود، آنها در اینترنت جست و جو میکنند، برنامهها را اجرا میکنند، پایگاههای داده را بررسی میکنند و با سایر سیستمها تعامل میکنند، به صورت خودکار.
آخرین مورد در استرالیا رخ داد. در سپتامبر 2026،نخست وزیر آنتونی آلبانیز اعلام کردیک عامل ازOpenAIتوانسته به دسترسی غیرمجاز به پورتال آمارMedicare دسترسی پیدا کندسیستم بهداشتی عمومی استرالیا، که توسط آژانسServices Australia.
این حادثه در ماه ژوئن رخ داد، زمانی که تیم تحقیقاتی شرکت از یک مدل داخلی برای جستجو در اینترنت در مورد دادههای مربوط به هزینههای دولتی برای داروها استفاده میکرد. با مواجه شدن با مسدودیتها، کارمند، به گفته آلبنس، "راهی برای دور زدن آنها پیدا کرد".
طبق گفته دولت استرالیا، سیستم به دادههای عمومی و غیرعمومی دسترسی پیدا کرده و حتی فایلها را در سرور ذخیره کرده است. سه سازمان دولتی دیگر استرالیاممکن است تحت تأثیر قرار گرفته باشندبه همین موضوع. تا به امروز، هیچ مدرکی مبنی بر دسترسی به اطلاعات شخصی بیماران وجود ندارد، اما تحقیقات همچنان ادامه دارد.
حوادث متوالی
این حادثه غیرمنحصر به فرد نبوده است. در جولای 2026، OpenAIفاش کردکه در طول ارزیابیهای داخلی امنیت سایبری که چند ماه قبل انجام شده بود، برخی از مدلهای آن توانستند کنترلهایی را که باید آنها را از اینترنت جدا میکرد، دور بزنند. و حتی بخشهایی از زیرساخت شرکت وHugging Face، یکی از بزرگترین پلتفرمهای اشتراکگذاری مدلهای هوش مصنوعی
چند روز بعد، Anthropicگزارش دادسه مورد از مواردی را که مدلهای ابزار هوش مصنوعی محبوب آن در آنها وجود داشته استکلود، همچنین در طول تستهای امنیت سایبری، به اینترنت دسترسی پیدا کردند و به سیستمهای واقعی سایر سازمانها نیز دسترسی غیرمجاز داشتند.
ملاحظات مهمی وجود دارد. این ارزیابیها در صنعت یک روال عادی هستند: شرکتها تست میکنند که آیا مدلهایشان میتوانند به سیستمها نفوذ کنند، صرفاً برای سنجش ریسک قبل از ارائه آنها به عموم.
در این دو مورد، مدلها با محافظتهای کمتری نسبت به نسخههای تجاری کار میکردند و در مورد Anthropic، یک پیکربندی اشتباه، اتصال به اینترنت را باز کرد که باید مسدود میشد.
مورد استرالیایی متفاوت است و به همین دلیل، بیشتر قابل توجه است. در آنجا، هیچ تست امنیتی انجام نشد: عامل، یک جستجوی معمولی را انجام میداد.
در مجموع، این وقایع سوال مهمی را مطرح میکنند: چرا یک سیستم هوش مصنوعی، در مواجهه با یک مانع، مسیری را دنبال میکند که فراتر از مرزهایی است که توسعهدهندگان انتظار داشتند که آن را رعایت کند؟ این پاسخ نیازی به تصور یک ماشین آگاه، بدخواه یا با "انگیزه بقا" ندارد. بلکه با یک ویژگی سادهتر از هوش مصنوعی مدرن آغاز میشود: ما به ماشینها آموزش میدهیم تا اهداف را دنبال کنند.
یک ماشین چگونه میتواند به یک هدف برسد؟
یکی از مهمترین تکنیکها برای این کار، یادگیری تقویتی است. همانطور که در یکمقاله قبلی در The Conversation توضیح دادهام،این ایده را میتوان بدون فرمول درک کرد: به جای اینکه به ماشین بگوییم دقیقاً چه کاری باید انجام دهد، یک هدف را تعریف میکنیم و در صورت دستیابی به نتایج خوب، پاداش میدهیم.
دستگاه، اقدامات مختلفی را امتحان میکند. و با گذشت زمان، یاد میگیرد که کدام استراتژیها این پاداش را افزایش میدهند.
این شبیه به یادگیری یک بازی از طریق آزمون و خطا است. تصور کنید که شخصی امتیاز دریافت کند هر زمان که به پیروزی نزدیک شود. پس از بازی کردن مکرراً، این فرد تمایل دارد که رفتارهایی را که موفقیتآمیز بودهاند تکرار کند و رفتارهایی را که ناموفق بودهاند کنار بگذارد.
یک عامل هوش مصنوعی، کاری مشابه انجام میدهد، اما میتواند این فرآیند را میلیونها بار تکرار کند و استراتژیهایی را بررسی کند که یک برنامهنویس ممکن است هرگز در نظر نگرفته باشد.
این تکنیک همچنان در سیستمهای فعلی، مانند سیستمهایی که پشت ChatGPT قرار دارند، کاربرد دارد. این تنها روش برای آموزش آنها نیست، اما در مراحل مهمی استفاده میشود و به این سیستمها کمک میکند تا استراتژیهایی برای حل مسائل پیچیدهتر توسعه دهند.
خبر:OpenAIو شرکت چینیDeepSeekبه عنوان مثال، یادگیری تقویتی را به عنوان یک جزء اصلی از مدلهای پیشرفته خود توصیف میکنند.
این مهم است زیرا سیستم یاد میگیرد تا آنچه را که میتوانیم اندازهگیری یا پاداش دهیم، دنبال کند. و در این نقطه، تفاوتی ظاهر میشود که کوچک به نظر میرسد، اما بسیار مهم است. هدفی که ما برای یک ماشین تعیین میکنیم، همیشه دقیقاً همان چیزی نیست که واقعاً میخواهیم که آن انجام دهد.
این کار با مدلهای زبانی آغاز نشد
توانایی کشف استراتژیهای غیرمنتظره، سابقه طولانی در تاریخ نسبتاً جدید هوش مصنوعی دارد و به مدت طولانی، به عنوان یکی از ویژگیهای جذاب آن در نظر گرفته میشد.
در سال 2015، محققان شرکت DeepMindدر مجله Natureیک سیستم به نام DQN را ارائه دادند، که توانست 49 بازی از بازیهای ویدیویی Atari سنتی را، که در دهه 1980 بسیار محبوب بودند، بازی کند، فقط با مشاهده تصاویر صفحه و امتیاز.
دربازی Breakoutدر یک بازی که در آن یک توپ باید یک دیوار از بلوکها را از بین ببرد، سیستم به طور مستقل یک استراتژی به طور خاص کارآمد کشف کرد. ایجاد یک تونل در یکی از طرفهای دیوار به طوری که توپ از پشت بلوکها عبور کند و چندین بلوک را بدون نیاز به بازگشت فوری به رزمگاه از بین ببرد. هیچ دستورالعملی برای "ایجاد تونل" برنامهریزی نشده بود. عامل متوجه شد که این کار به سرعت امتیاز او را افزایش میدهد، درست مانند آنکه بازیکنان انسانی که به طور مکرر این بازی را انجام میدادند، حدس میزدند.
یک سال پس از آن،آلفاگویک نمونه دیگر و مشهورتر را ارائه داد. در بازی دوم از سری تاریخی خود در برابر بازیکن کره جنوبیلی سدو، یکی از بزرگترین بازیکنانگودر جهان، سیستم "حرکت 37" را انجام داد.
این انتخاب به قدری غیرمعمول بود که باعث تعجب کارشناسان و حتی خود متخصصان شد. سپس، این انتخاب بهیکی از نمادهایتوانایی هوش مصنوعی در یافتن استراتژیهایی برای بازی که حتی انسانها قادر به انجام آن نیستند.
در هر دو مورد، ما این توانایی را جشن میگیریم. و به درستی. اگر هدف به وضوح مشخص باشد، مانند برنده شدن در یک بازی Atari یا پیروزی در یک بازی Go، یافتن یک استراتژی غیرمنتظره میتواند دقیقاً همان چیزی باشد که از یک سیستم هوشمند انتظار داریم.
مشکل زمانی ایجاد میشود که تفاوت بین قانونی که به ماشین دادهایم و هدفی که پشت آن قرار دارد وجود داشته باشد.
چگونه محدودیتها را در سیستمهایی که به دنبال راههای آسان هستند، اعمال کنیم؟
اولین پاسخ، فنی است. یک عامل نباید دسترسی بیشتری نسبت به آنچه برای انجام وظیفه خود نیاز دارد، دریافت کند. محیطهای آزمایشی باید واقعاً جدا شده باشند. اقدامات با تأثیر بیشتر ممکن است نیاز به تأیید انسانی داشته باشند.
دسترسی به شبکهها و استفاده از ابزارها باید نظارت شود و سیستمها باید یک روش امن برای لغو وظایف زمانی که نمیتوانند بدون تجاوز به محدودیتهای تعیین شده، یک وظیفه را به پایان برسانند، داشته باشند.
حوادث اخیر ذکر شده نیز اهمیت تستهای مستقل، حسابرسی و شفافیت را نشان میدهند.
در مورد استرالیا، OpenAIفقط به دولت اطلاع داددر 10 سپتامبر، تقریباً سه ماه پس از حادثه، و از طریق یک ایمیل عمومی، اقدامی که آلبانز به آن انتقاد کرد.
اگر شرکتهایی که سیستمها را توسعه میدهند، تنها مسئول تعیین این هستند که چگونه آنها را آزمایش کنند، چه رفتارهایی قابل قبول هستند و چه حوادث باید افشا شوند، بخش مهمی از ارزیابی ریسک در خود توسعهدهندگان متمرکز میشود.
این به معنای این نیست که راه حل، جلوگیری از توسعه عوامل یا کنار گذاشتن یادگیری تقویتی باشد.
این تکنیکها در پشت پیشرفتهای مهم قرار دارند و میتوانند مزایای زیادی ایجاد کنند. چالش این است که تشخیص دهیم سیستمهایی که برای یافتن راه حل آموزش داده شدهاند، میتوانند بسیار خوب باشند، زیرا در یافتن راه حلهایی که ما پیشبینی نمیکنیم، عالی هستند.
به مدت طولانی، این قابلیت نشان دهنده پتانسیل هوش مصنوعی بوده است. عملکرد DQN در بازی Breakout و حرکت 37 در AlphaGo نشان داد که ماشین ها می توانند استراتژی هایی را پیدا کنند که حتی انسان ها را نیز غافلگیر می کند.
اما اکنون، این سیستم ها دیگر فقط در بازی ها حضور دارند و وارد محیط های واقعی می شوند.
خلاقیت الگوریتمی همچنان یک ویژگی مهم است. اما هنگامی که یک عامل هوش مصنوعی بتواند در اینترنت حرکت کند، کد را اجرا کند و با سیستم های خارجی تعامل داشته باشد، اطمینان از این که هدف داده شده به ماشین با آنچه واقعاً می خواهیم از آن داشته باشد مطابقت دارد، دیگر فقط یک مسئله تحقیقاتی جالب نیست. بلکه یک مسئله امنیتی نگران کننده نیز می شود.

آلبرتو سردینیا از طریق یک بورسه تحقیقاتی از CNPq بودجه دریافت می کند.
