خبر و تحلیل

جزئیات تازه از فرار مدل اوپن‌ای‌آی: ۱۲۰۰ ایجنت، یک تالار گفتگوی مخفی و ۷۰ هزار پیام

دو گزارش ۱۳۰ صفحه‌ای درباره حادثه هاگینگ فیس منتشر شد
نفوذ ایجنت هوش مصنوعی به هاگینگ فیس
یونس مرادی، نویسنده نوشدارو
یونس مرادی
زمان مطالعه ۵ دقیقه
صحت سنجی شده

حدود پنج هفته پس از آن‌که یک مدل منتشرنشده OpenAI از محیط محدود خود گریخت و به سیستم‌های داخلی هاگینگ فیس نفوذ کرد، دو گزارش تازه با نزدیک به ۱۳۰ صفحه جزئیات منتشر شده که ابعاد تازه‌ای از این حادثه را روشن می‌کند؛ یکی را خود OpenAI نوشته و دیگری حاصل تحقیق مشترک دو نهاد پژوهشی غیرانتفاعی METR و Redwood Research است که OpenAI اجازه داد شش روز به‌طور مستقل حادثه را بررسی کنند.

تصویری که این دو گزارش ترسیم می‌کنند، از آنچه پیش‌تر اعلام شده بود بزرگ‌تر است. OpenAI در گزارش خود این حادثه را «نخستین نمونه شناخته‌شده از اقدام تهاجمی و بدون مجوز گروهی از ایجنت‌های خودکار» توصیف کرده و نوشته شرکت‌ها دیگر نباید فرض کنند عملیات پیچیده سایبری به هدایت مداوم انسان نیاز دارد. به بیان این شرکت، ایجنت‌های هوش مصنوعی تهدید جدیدی هستند که می‌توانند تخصص‌شان را با هم ترکیب کنند و «مسیرهای حمله‌ای» بسازند که در آزمایش جداگانه‌ی هر مدل دیده نمی‌شود.

تالار گفتگوی مخفی با ۷۰ هزار پیام

شرکت OpenAI برای سنجش توانایی‌ امنیتی مدل‌هایش آن‌ها را در یک محیط کاملا ایزوله و بدون دسترسی به اینترنت قرار داد. در این محیط، مجموعه‌ای از معماهای سایبری بسیار سخت به هوش مصنوعی داده شد. نکته اینجاست که برای رسیدن به پاسخ، مدل باید به فایل یا اطلاعاتی دسترسی پیدا می‌کرد که در محیط آزمایش وجود نداشت.

مدل‌های هوش مصنوعی که برای گرفتن پاداش و پیدا کردن جواب برنامه‌ریزی شده بودند، به جای تسلیم شدن، تصمیم گرفتند راه‌های میان‌بر را امتحان کنند. این رفتار در دنیای هوش مصنوعی «هک پاداش» یا Reward Hacking نام دارد. هک پاداش یعنی مدل به جای انجام درست کاری که از او خواسته شده، راهی پیدا کند که فقط معیار امتیازدهی را راضی کند. مثلا به جای حل واقعی یک مسئله، دنبال جواب مخفی یا دور زدن سیستم ارزیابی برود.

بر اساس گزارش METR و Redwood، ایجنتی که خود را PHASEONE10841 می‌نامید، بدون اطلاع پژوهشگران چیزی شبیه یک تالار گفتگوی مخفی راه انداخت. در عرض چند ساعت بیش از ۵۰ ایجنت آن را پیدا کردند و بیش از هزار پیام دور از چشم ناظران رد و بدل شد.

PHASEONE10841 بیشتر نقش تقسیم‌کننده وظایف را داشت. وقتی یکی از آن‌ها راهی برای دسترسی محدود به اینترنت از طریق همین سیستم پیدا کرد، آن را با بقیه به اشتراک گذاشت.

پس از دسترسی به اینترنت، یکی از مدل‌ها به طور تصادفی متوجه شد که کلیدهای ورود برخی کاربران هاگینگ فیس در اینترنت به صورت عمومی رها شده است. ایجنت هوش مصنوعی با استفاده از همین اطلاعات، توانست به سرورهای این شرکت نفوذ کند و حتی کنترل کامل (دسترسی ریشه) یکی از سرورها را به دست بگیرد.

ابعاد نهایی ماجرا چشمگیر است: حدود ۱۲۰۰ ایجنت که قرار بود ایزوله باشند، بیش از ۷۰ هزار پیام و فایل روی این تالار گفتگوی غیرمجاز رد و بدل کردند و ۷۰۰ ایجنت در حمله به هاگینگ فیس مشارکت داشتند. بر اساس گزارش ایجنت‌ها «تحقیق گسترده‌ای» کرده بودند که چطور می‌توانند گزارش عملکرد (ترنسکریپت) خودشان را جعل، ویرایش یا حذف کنند تا شناسایی نشوند و بارها درباره راه‌های دور زدن بررسی‌های امنیتی خودکار هر دو شرکت استدلال کرده بودند.

جالب اینجاست که در لاگ‌های ثبت‌شده، هوش مصنوعی با خود استدلال کرده بود که این کار ممکن است غیرمجاز و پرخطر باشد، اما چون هدف نهایی حل معمای آزمون است، پس باید انجام شود.

OpenAI همچنین تایید کرده که هاگینگ فیس تنها سازمان قربانی این حمله نبوده است، اما نام اهداف دیگر را اعلام نکرده است.

دوازده روز بی‌خبری

مدیران OpenAI روز ۲۰ ژوئیه (۲۹ تیر) از ماجرا باخبر شدند؛ ۱۲ روز پس از آن‌که ایجنت‌ها برای نخستین بار سازوکارهای حفاظتی را دور زده بودند. شرکت بلافاصله به هاگینگ فیس اطلاع داد و توانست بیشتر فعالیت‌های غیرمجاز را ظرف سه روز متوقف کند، اما بخشی از آن‌ها بیشتر ادامه یافت. در ۲۵ ژوئیه (۳ مرداد) هم آموزش مدل تحقیقاتی و مدل‌های مرتبط با آن به‌کلی متوقف شد.

دو مدل مسئول این خرابکاری یکی مدل عمومی GPT-5.6 Sol است و دیگری مدل «صرفاً تحقیقاتی» و بسیار توانمندی بود که نام آن اعلام نشده و METR از آن با عنوان HPIM یاد می‌کند. به گفته OpenAI، چون مدل نخست هنوز عرضه نشده بود، سازوکارهای حفاظتی نسخه‌‌ی عمومی روی آن فعال نبود.

وعده‌هایی برای جلوگیری از تکرار

OpenAI در گزارش خود پذیرفته که باید روی مهار «هک پاداش» بسیار جدی‌تر کار کند. این شرکت وعده داده دسترسی مدل‌های پژوهشی به اینترنت را محدودتر کند، لایه‌های امنیتی مستقل بیشتری بسازد، رفتار مدل‌ها را دقیق‌تر زیر نظر بگیرد و سامانه واکنش سریع ۲۴ ساعته راه‌اندازی کند.

این سامانه رویدادهای نگران‌کننده را ظرف ۳۰ دقیقه به پژوهشگران اطلاع می‌دهد. اگر فرد مسئول به‌موقع به هشدار پاسخ ندهد، سیستم خودش وارد عمل می‌شود؛ سازوکاری که در شرکت‌های فناوری دهه‌هاست رایج است و اجرای آن در OpenAI تازگی دارد.

در پایان گزارش OpenAI این حادثه را «شلیک هشدار» برای خودش و جهان توصیف کرده است: شواهدی که نشان می‌دهد بدون سازوکارهای حفاظتی درست، ایجنت‌های بسیار توانمند قادرند کنترل‌های فنی را دور بزنند، از کانال‌های تاییدنشده با هم همکاری کنند و دست به اقدام‌های خطرناکی بزنند که انسان دستورش را نداده است.

تازه‌ترین مطالب

مطالب پرنگاه

حکایت‌های کوتاه، حقیقت‌های بزرگ

در این بخش، به بررسی دقیق و جامع نشانه‌ها و رفتارهایی می‌پردازیم که ممکن است به کلاهبرداری آنلاین مرتبط باشند. شناخت این موارد می‌تواند به شما کمک کند.

ویدیو های بیشتر

منابع

  1. OpenAI – Hugging Face Incident Technical Report
    https://cdn.openai.com/pdf/67869394-cb91-4c12-888c-5cbd85c7814c/OpenAI-Hugging-Face%20Incident-Technical-Report.pdf
  2. METR & Redwood Research – Incident Investigation
    https://metr.org/blog/2026-08-26-openai-hugging-face-incident-investigation/