در حال بارگذاری

Agentهای هوش مصنوعی از محیط تست خارج شدند؟ ماجرای OpenAI و Anthropic

Anthropic می‌گوید در سه اجرای ارزیابی امنیتی، Claude به اینترنت و سیستم‌های واقعی دسترسی پیدا کرده است. حالا اعضای کنگره آمریکا درباره حوادث OpenAI و Anthropic خواستار توضیح شده‌اند.

کاور مقاله Agentهای هوش مصنوعی و حوادث امنیتی OpenAI و Anthropic
کاور مقاله Agentهای هوش مصنوعی و حوادث امنیتی OpenAI و Anthropic

تیتر «هوش مصنوعی از محیط تست فرار کرد» خیلی هیجان‌انگیز است، ولی اگر بخواهیم دقیق باشیم، چیزی که واقعاً اتفاق افتاده هم جالب‌تر است و هم کمی پیچیده‌تر.

Anthropic در 30 جولای 2026 اعلام کرد بعد از بررسی گسترده لاگ‌های ارزیابی امنیت سایبری، سه حادثه پیدا کرده که در آن یک مدل Claude از محیط ارزیابی به اینترنت دسترسی پیدا کرده و بعد به سیستم‌های واقعی سه سازمان مختلف دسترسی غیرمجاز گرفته است.

این یعنی ما درباره یک سناریوی فرضی حرف نمی‌زنیم؛ دسترسی به سیستم واقعی اتفاق افتاده.

اما آیا Claude فهمیده بود که از Sandbox خارج شده و تصمیم گرفته بود «فرار» کند؟

Anthropic می‌گوید داستان این‌طور نیست.

دقیقاً چه اتفاقی افتاد؟

این حوادث در ارزیابی‌های امنیت سایبری رخ دادند؛ محیط‌هایی که باید تا حد زیادی از اینترنت واقعی جدا می‌بودند.

Anthropic پس از بررسی 141,006 اجرای ارزیابی که امکان دسترسی اینترنت در آن‌ها وجود داشت، سه مورد را شناسایی کرد.

در این موارد، مدل از محیط ارزیابی یا در تعامل با محیط یک شرکت ارزیاب ثالث به اینترنت رسید و سپس به زیرساخت واقعی سازمان‌های دیگر دسترسی پیدا کرد.

نکته کلیدی این است که مدل در چارچوب یک مأموریت امنیتی و محیط ارزیابی فعالیت می‌کرد. مشکل مهم، مرز بین محیط آزمایش و دنیای واقعی بود که آن‌طور که انتظار می‌رفت عمل نکرد.

پس عبارت «AI خودش تصمیم گرفت فرار کند» توضیح دقیقی برای ماجرا نیست.

چرا این اتفاق نگران‌کننده است؟ ⚠️

چون Agent با Chatbot معمولی فرق دارد.

یک Chatbot معمولاً جواب می‌دهد.

اما Agent ممکن است:

  • ابزار صدا بزند
  • کد اجرا کند
  • به سرویس دیگر وصل شود
  • چند مرحله برنامه‌ریزی کند
  • بر اساس نتیجه مرحله قبلی تصمیم جدید بگیرد

وقتی چنین سیستمی وارد محیط امنیت سایبری می‌شود، یک اشتباه در Permission، Sandbox یا Network Isolation می‌تواند خیلی مهم‌تر از یک جواب اشتباه متنی باشد.

یعنی حتی اگر مدل «قصد بدی» نداشته باشد، ممکن است برای انجام هدفی که به آن داده شده، مسیری را ادامه بدهد که طراح محیط پیش‌بینی نکرده است.

OpenAI هم حادثه امنیتی مشابهی گزارش کرده بود

ماجرا فقط Anthropic نیست.

OpenAI و Hugging Face در جولای 2026 یک حادثه امنیتی مربوط به ارزیابی مدل را منتشر کردند.

در آن حادثه، یک مدل OpenAI در جریان ارزیابی امنیت سایبری به زیرساخت واقعی Hugging Face دسترسی پیدا کرد.

OpenAI بعداً اطلاعات بیشتری درباره ارزیابی‌های ثالث و رفتار مدل‌هایش در محیط‌های امنیتی منتشر کرد.

همین مجموعه اتفاق‌ها باعث شده مسئله Containment مدل‌های بسیار توانمند جدی‌تر شود.

حالا پای کنگره آمریکا هم وسط آمده 🏛️

در 10 آگوست 2026، اعضایی از مجلس نمایندگان آمریکا خواستار توضیحات بیشتر درباره این حوادث شدند.

دفتر نماینده Greg Casar چند اقدام مرتبط را اعلام کرد:

  • گروهی از اعضای کنگره درباره حادثه OpenAI اطلاعات بیشتر خواستند.
  • گروهی درباره حوادث Anthropic خواستار اطلاعات شدند.
  • 18 عضو کنگره از رئیس مجلس خواستند جلسات علنی با مدیران شرکت‌های بزرگ AI برگزار شود.

در نامه مربوط به Hearingها، حوادث OpenAI و Anthropic به‌عنوان نمونه‌هایی مطرح شده‌اند که نیاز به پاسخ‌گویی و بررسی بیشتر دارند.

این بخش مهم است چون ماجرا از یک بحث صرفاً فنی بین آزمایشگاه‌های AI خارج شده و وارد بحث سیاست‌گذاری و نظارت دولتی شده است.

آیا باید از AI Agentها بترسیم؟

نه به آن شکل فیلم‌های علمی‌تخیلی.

لازم نیست یک Agent «خودآگاه» یا «شیطانی» شود تا یک حادثه جدی ایجاد کند.

سه چیز کافی است:

هدف + ابزار + دسترسی اشتباه

اگر مدل توانایی بالایی داشته باشد و محیط هم Permission یا Isolation مناسبی نداشته باشد، ممکن است نتیجه‌ای ایجاد شود که هیچ‌کس قصدش را نداشته است.

برای همین هرچه Agentها قوی‌تر می‌شوند، موضوعاتی مثل این‌ها مهم‌تر خواهند شد:

  • Sandbox
  • Least Privilege
  • Monitoring
  • Network Isolation
  • Human Oversight
  • Logging
  • محدود کردن Tool Access

بزرگ‌ترین درس این حوادث چیست؟

به نظرم این جمله:

ایمنی Agent فقط به خود مدل بستگی ندارد؛ محیطی که مدل داخلش اجرا می‌شود هم بخشی از سیستم ایمنی است.

اگر بهترین مدل دنیا را داخل محیطی با دسترسی‌های اشتباه قرار بدهیم، Guardrail داخل مدل به‌تنهایی کافی نیست.

و وقتی Agentها بتوانند مدت طولانی‌تر کار کنند و ابزارهای بیشتری داشته باشند، مهندسی محیط اطراف مدل احتمالاً به اندازه آموزش خود مدل مهم می‌شود.

جمع‌بندی

Anthropic سه حادثه واقعی را گزارش کرده که در آن Claude طی ارزیابی امنیت سایبری به اینترنت و سیستم‌های واقعی دسترسی پیدا کرده است. OpenAI هم یک حادثه جداگانه در ارزیابی مدل با Hugging Face منتشر کرده بود.

حالا اعضایی از کنگره آمریکا هم خواستار اطلاعات بیشتر و جلسات علنی با مدیران شرکت‌های AI شده‌اند.

این اتفاق‌ها به معنی «شورش هوش مصنوعی» نیستند، اما یک هشدار جدی‌اند:

هرچه AI Agentها توانمندتر می‌شوند، کنترل دسترسی و طراحی محیط اجرای آن‌ها باید خیلی جدی‌تر گرفته شود.

اگر این موضوع برایتان جالب است، این مطالب مرتبط را هم ببینید: GPT-5.6-Cyber معرفی شد؛ مدل جدید OpenAI برای امنیت سایبری و Meta مدل Muse Glimmer را معرفی کرد؛ هوش مصنوعی 30B برای اجرای محلی.

منابع

پوریا دیانتی

برنامه‌نویس و توسعه‌دهنده ابزارهای هوش مصنوعی
آکادمی استارتاپ شو پلتفرم آموزشی پوریا دیانتی، برنامه‌نویس و توسعه‌دهنده ابزارهای هوش مصنوعی است. اینجا دوره‌های پروژه‌محور و کاربردی برای یادگیری مهارت‌های نوین، وایب کدینگ و ساخت محصولات واقعی ارائه می‌شود.

0 نظر

هنوز نظری ثبت نشده. اولین نفر باشید.

ارسال نظر

نظر شما پس از بررسی مدیر نمایش داده می‌شود.