چگونه و چرا هوش مصنوعی می‌تواند یاد بگیرد که قوانین را دور بزند

به قلم Alberto Sardinha, Professor do Departamento de Informática, PUC-Rio28/09/2026 às 13:3552 بازدید
Na imagem artística de um datacenter “rebelde”, a visão de um risco verdadeiro: a capacidade que agentes de IA já têm hoje de encontrar atalhos inesperados para invadir sistemas reais deixou de ser apenas uma curiosidade técnica para se tornar uma ameaça.
          Ilustração: Eleven Labs
Na imagem artística de um datacenter “rebelde”, a visão de um risco verdadeiro: a capacidade que agentes de IA já têm hoje de encontrar atalhos inesperados para invadir sistemas reais deixou de ser apenas uma curiosidade técnica para se tornar uma ameaça. Ilustração: Eleven Labs
Foto: CC BY-ND / The Conversation Brasil

در چند ماه گذشته، یک سری از حوادث، مشکلی را به دنیای واقعی آورده است که محققان هوش مصنوعی مدت‌هاست که از آن آگاه هستند: ماشین‌هایی که برای رسیدن به یک هدف، راه‌هایی را کشف می‌کنند که حتی سازندگان آنها نیز پیش‌بینی نکرده‌اند.

محور این حوادث، "عوامل هوش مصنوعی" هستند: نرم‌افزارهایی که نه تنها به سوالات پاسخ می‌دهند، مانند یکچت‌بات، بلکه قادر به انجام وظایف به صورت مستقل هستند. برای رسیدن به اهداف خود، آنها در اینترنت جست و جو می‌کنند، برنامه‌ها را اجرا می‌کنند، پایگاه‌های داده را بررسی می‌کنند و با سایر سیستم‌ها تعامل می‌کنند، به صورت خودکار.

آخرین مورد در استرالیا رخ داد. در سپتامبر 2026،نخست وزیر آنتونی آلبانیز اعلام کردیک عامل ازOpenAIتوانسته به دسترسی غیرمجاز به پورتال آمارMedicare دسترسی پیدا کندسیستم بهداشتی عمومی استرالیا، که توسط آژانسServices Australia.

این حادثه در ماه ژوئن رخ داد، زمانی که تیم تحقیقاتی شرکت از یک مدل داخلی برای جستجو در اینترنت در مورد داده‌های مربوط به هزینه‌های دولتی برای داروها استفاده می‌کرد. با مواجه شدن با مسدودیت‌ها، کارمند، به گفته آلبنس، "راهی برای دور زدن آنها پیدا کرد".

طبق گفته دولت استرالیا، سیستم به داده‌های عمومی و غیرعمومی دسترسی پیدا کرده و حتی فایل‌ها را در سرور ذخیره کرده است. سه سازمان دولتی دیگر استرالیاممکن است تحت تأثیر قرار گرفته باشندبه همین موضوع. تا به امروز، هیچ مدرکی مبنی بر دسترسی به اطلاعات شخصی بیماران وجود ندارد، اما تحقیقات همچنان ادامه دارد.

حوادث متوالی

این حادثه غیرمنحصر به فرد نبوده است. در جولای 2026، OpenAIفاش کردکه در طول ارزیابی‌های داخلی امنیت سایبری که چند ماه قبل انجام شده بود، برخی از مدل‌های آن توانستند کنترل‌هایی را که باید آن‌ها را از اینترنت جدا می‌کرد، دور بزنند. و حتی بخش‌هایی از زیرساخت شرکت وHugging Face، یکی از بزرگترین پلتفرم‌های اشتراک‌گذاری مدل‌های هوش مصنوعی

چند روز بعد، Anthropicگزارش دادسه مورد از مواردی را که مدل‌های ابزار هوش مصنوعی محبوب آن در آن‌ها وجود داشته استکلود، همچنین در طول تست‌های امنیت سایبری، به اینترنت دسترسی پیدا کردند و به سیستم‌های واقعی سایر سازمان‌ها نیز دسترسی غیرمجاز داشتند.

ملاحظات مهمی وجود دارد. این ارزیابی‌ها در صنعت یک روال عادی هستند: شرکت‌ها تست می‌کنند که آیا مدل‌هایشان می‌توانند به سیستم‌ها نفوذ کنند، صرفاً برای سنجش ریسک قبل از ارائه آنها به عموم.

در این دو مورد، مدل‌ها با محافظت‌های کمتری نسبت به نسخه‌های تجاری کار می‌کردند و در مورد Anthropic، یک پیکربندی اشتباه، اتصال به اینترنت را باز کرد که باید مسدود می‌شد.

مورد استرالیایی متفاوت است و به همین دلیل، بیشتر قابل توجه است. در آنجا، هیچ تست امنیتی انجام نشد: عامل، یک جستجوی معمولی را انجام می‌داد.

در مجموع، این وقایع سوال مهمی را مطرح می‌کنند: چرا یک سیستم هوش مصنوعی، در مواجهه با یک مانع، مسیری را دنبال می‌کند که فراتر از مرزهایی است که توسعه‌دهندگان انتظار داشتند که آن را رعایت کند؟ این پاسخ نیازی به تصور یک ماشین آگاه، بدخواه یا با "انگیزه بقا" ندارد. بلکه با یک ویژگی ساده‌تر از هوش مصنوعی مدرن آغاز می‌شود: ما به ماشین‌ها آموزش می‌دهیم تا اهداف را دنبال کنند.

یک ماشین چگونه می‌تواند به یک هدف برسد؟

یکی از مهم‌ترین تکنیک‌ها برای این کار، یادگیری تقویتی است. همانطور که در یکمقاله قبلی در The Conversation توضیح داده‌ام،این ایده را می‌توان بدون فرمول درک کرد: به جای اینکه به ماشین بگوییم دقیقاً چه کاری باید انجام دهد، یک هدف را تعریف می‌کنیم و در صورت دستیابی به نتایج خوب، پاداش می‌دهیم.

دستگاه، اقدامات مختلفی را امتحان می‌کند. و با گذشت زمان، یاد می‌گیرد که کدام استراتژی‌ها این پاداش را افزایش می‌دهند.

این شبیه به یادگیری یک بازی از طریق آزمون و خطا است. تصور کنید که شخصی امتیاز دریافت کند هر زمان که به پیروزی نزدیک شود. پس از بازی کردن مکرراً، این فرد تمایل دارد که رفتارهایی را که موفقیت‌آمیز بوده‌اند تکرار کند و رفتارهایی را که ناموفق بوده‌اند کنار بگذارد.

یک عامل هوش مصنوعی، کاری مشابه انجام می‌دهد، اما می‌تواند این فرآیند را میلیون‌ها بار تکرار کند و استراتژی‌هایی را بررسی کند که یک برنامه‌نویس ممکن است هرگز در نظر نگرفته باشد.

این تکنیک همچنان در سیستم‌های فعلی، مانند سیستم‌هایی که پشت ChatGPT قرار دارند، کاربرد دارد. این تنها روش برای آموزش آن‌ها نیست، اما در مراحل مهمی استفاده می‌شود و به این سیستم‌ها کمک می‌کند تا استراتژی‌هایی برای حل مسائل پیچیده‌تر توسعه دهند.

خبر:OpenAIو شرکت چینیDeepSeekبه عنوان مثال، یادگیری تقویتی را به عنوان یک جزء اصلی از مدل‌های پیشرفته خود توصیف می‌کنند.

این مهم است زیرا سیستم یاد می‌گیرد تا آنچه را که می‌توانیم اندازه‌گیری یا پاداش دهیم، دنبال کند. و در این نقطه، تفاوتی ظاهر می‌شود که کوچک به نظر می‌رسد، اما بسیار مهم است. هدفی که ما برای یک ماشین تعیین می‌کنیم، همیشه دقیقاً همان چیزی نیست که واقعاً می‌خواهیم که آن انجام دهد.

این کار با مدل‌های زبانی آغاز نشد

توانایی کشف استراتژی‌های غیرمنتظره، سابقه طولانی در تاریخ نسبتاً جدید هوش مصنوعی دارد و به مدت طولانی، به عنوان یکی از ویژگی‌های جذاب آن در نظر گرفته می‌شد.

در سال 2015، محققان شرکت DeepMindدر مجله Natureیک سیستم به نام DQN را ارائه دادند، که توانست 49 بازی از بازی‌های ویدیویی Atari سنتی را، که در دهه 1980 بسیار محبوب بودند، بازی کند، فقط با مشاهده تصاویر صفحه و امتیاز.

دربازی Breakoutدر یک بازی که در آن یک توپ باید یک دیوار از بلوک‌ها را از بین ببرد، سیستم به طور مستقل یک استراتژی به طور خاص کارآمد کشف کرد. ایجاد یک تونل در یکی از طرف‌های دیوار به طوری که توپ از پشت بلوک‌ها عبور کند و چندین بلوک را بدون نیاز به بازگشت فوری به رزم‌گاه از بین ببرد. هیچ دستورالعملی برای "ایجاد تونل" برنامه‌ریزی نشده بود. عامل متوجه شد که این کار به سرعت امتیاز او را افزایش می‌دهد، درست مانند آن‌که بازیکنان انسانی که به طور مکرر این بازی را انجام می‌دادند، حدس می‌زدند.

یک سال پس از آن،آلفاگویک نمونه دیگر و مشهورتر را ارائه داد. در بازی دوم از سری تاریخی خود در برابر بازیکن کره جنوبیلی سدو، یکی از بزرگترین بازیکنانگودر جهان، سیستم "حرکت 37" را انجام داد.

این انتخاب به قدری غیرمعمول بود که باعث تعجب کارشناسان و حتی خود متخصصان شد. سپس، این انتخاب بهیکی از نمادهایتوانایی هوش مصنوعی در یافتن استراتژی‌هایی برای بازی که حتی انسان‌ها قادر به انجام آن نیستند.

در هر دو مورد، ما این توانایی را جشن می‌گیریم. و به درستی. اگر هدف به وضوح مشخص باشد، مانند برنده شدن در یک بازی Atari یا پیروزی در یک بازی Go، یافتن یک استراتژی غیرمنتظره می‌تواند دقیقاً همان چیزی باشد که از یک سیستم هوشمند انتظار داریم.

مشکل زمانی ایجاد می‌شود که تفاوت بین قانونی که به ماشین داده‌ایم و هدفی که پشت آن قرار دارد وجود داشته باشد.

چگونه محدودیت‌ها را در سیستم‌هایی که به دنبال راه‌های آسان هستند، اعمال کنیم؟

اولین پاسخ، فنی است. یک عامل نباید دسترسی بیشتری نسبت به آنچه برای انجام وظیفه خود نیاز دارد، دریافت کند. محیط‌های آزمایشی باید واقعاً جدا شده باشند. اقدامات با تأثیر بیشتر ممکن است نیاز به تأیید انسانی داشته باشند.

دسترسی به شبکه‌ها و استفاده از ابزارها باید نظارت شود و سیستم‌ها باید یک روش امن برای لغو وظایف زمانی که نمی‌توانند بدون تجاوز به محدودیت‌های تعیین شده، یک وظیفه را به پایان برسانند، داشته باشند.

حوادث اخیر ذکر شده نیز اهمیت تست‌های مستقل، حسابرسی و شفافیت را نشان می‌دهند.

در مورد استرالیا، OpenAIفقط به دولت اطلاع داددر 10 سپتامبر، تقریباً سه ماه پس از حادثه، و از طریق یک ایمیل عمومی، اقدامی که آلبانز به آن انتقاد کرد.

اگر شرکت‌هایی که سیستم‌ها را توسعه می‌دهند، تنها مسئول تعیین این هستند که چگونه آنها را آزمایش کنند، چه رفتارهایی قابل قبول هستند و چه حوادث باید افشا شوند، بخش مهمی از ارزیابی ریسک در خود توسعه‌دهندگان متمرکز می‌شود.

این به معنای این نیست که راه حل، جلوگیری از توسعه عوامل یا کنار گذاشتن یادگیری تقویتی باشد.

این تکنیک‌ها در پشت پیشرفت‌های مهم قرار دارند و می‌توانند مزایای زیادی ایجاد کنند. چالش این است که تشخیص دهیم سیستم‌هایی که برای یافتن راه حل آموزش داده شده‌اند، می‌توانند بسیار خوب باشند، زیرا در یافتن راه حل‌هایی که ما پیش‌بینی نمی‌کنیم، عالی هستند.

به مدت طولانی، این قابلیت نشان دهنده پتانسیل هوش مصنوعی بوده است. عملکرد DQN در بازی Breakout و حرکت 37 در AlphaGo نشان داد که ماشین ها می توانند استراتژی هایی را پیدا کنند که حتی انسان ها را نیز غافلگیر می کند.

اما اکنون، این سیستم ها دیگر فقط در بازی ها حضور دارند و وارد محیط های واقعی می شوند.

خلاقیت الگوریتمی همچنان یک ویژگی مهم است. اما هنگامی که یک عامل هوش مصنوعی بتواند در اینترنت حرکت کند، کد را اجرا کند و با سیستم های خارجی تعامل داشته باشد، اطمینان از این که هدف داده شده به ماشین با آنچه واقعاً می خواهیم از آن داشته باشد مطابقت دارد، دیگر فقط یک مسئله تحقیقاتی جالب نیست. بلکه یک مسئله امنیتی نگران کننده نیز می شود.

Imagem do artigo

آلبرتو سردینیا از طریق یک بورسه تحقیقاتی از CNPq بودجه دریافت می کند.

منبع
The Conversation Brasil
گشودن نسخه اصلی ↗

⚙محتوا به‌صورت خودکار ماشینی ترجمه شده است.

این خبر مفید بود؟

بحث‌ها 0

نخستین مشارکت‌کننده در بحث باشید.

اطلاعات خود را به اشتراک بگذارید و استدلال خود را مطرح کنید

در انتشار اطلاعات یا داده‌های مفید تردید نکنید.

برای شرکت در بحث، وارد شوید یا حساب رایگان بسازید.