اوپن‌ای‌آی توسعه مدل‌های هوش مصنوعی را به دلیل افزایش خطرات سایبری موقتاً کند کرد
اوپن‌ای‌آی در واکنش به افزایش توانایی سایبری مدل‌های مرزی، آموزش تقویتی برخی مدل‌های پیشرفته را موقتاً متوقف کرده و استانداردهای نظارت، امنیت و هم‌راستاسازی را افزایش داده است. پیام اصلی این اقدام آن است که سرعت توسعه مدل‌های هوش مصنوعی باید با سرعت ارتقای سازوکارهای ایمنی و امنیتی هماهنگ باشد.

اوپن‌ای‌آی سرعت توسعه برخی مدل‌های پیشرفته هوش مصنوعی را موقتاً کاهش داد.

دلیل این تصمیم، افزایش توانایی‌های سایبری مدل‌های مرزی و نگرانی درباره خطرات احتمالی آنهاست.

اوپن‌ای‌آی آموزش تقویتی برخی مدل‌ها را متوقف کرده و سه لایه حفاظتی را در مرکز رویکرد جدید خود قرار داده است:

نظارت، هم‌راستاسازی و امنیت.

این شرکت همچنین محیط‌های تحقیقاتی را ایزوله‌تر کرده، نظارت بر فعالیت مدل‌ها را افزایش داده و اعلام کرده است در صورت مشاهده رفتارهای نگران‌کننده، هشدارهای امنیتی باید حداکثر ظرف ۳۰ دقیقه صادر شوند.

پیام این تحول برای صنعت هوش مصنوعی روشن است: هرچه مدل‌ها قدرتمندتر می‌شوند، امنیت و حکمرانی آنها نیز باید سریع‌تر توسعه پیدا کند.


عنوان فارسی: اوپن‌ای‌آی توسعه مدل‌های هوش مصنوعی را به دلیل افزایش خطرات سایبری موقتاً کند کرد
عنوان اصلی: Pacing model development in an era of cyber-critical capabilities
نویسنده: اوپن‌ای‌آی
تاریخ انتشار: ۱۸ اوت ۲۰۲۶
منبع: اوپن‌ای‌آی
موضوع: هوش مصنوعی, امنیت سایبری, مدل‌های مرزی, هم‌راستاسازی, نظارت بر مدل‌ها, آمادگی هوش مصنوعی
نسخه فارسی: شبکه اطلاع‌رسانی روابط‌عمومی ایران (شارا)


شبکه اطلاع‌رسانی روابط‌عمومی‌ ایران (شارا) اوپن‌ای‌آی اعلام کرد در پی افزایش توانمندی مدل‌های هوش مصنوعی و نگرانی‌های فزاینده درباره قابلیت‌های سایبری آن‌ها، سرعت توسعه برخی از مدل‌های پیشرفته خود را به‌طور موقت کاهش داده است.

این شرکت می‌گوید دو تحول اخیر، ضرورت بازنگری در شیوه‌های نظارت، هم‌راستاسازی (Alignment) و مهار مدل‌های هوش مصنوعی را بیشتر کرده است. یکی از این موارد، حادثه امنیتی مرتبط با اوپن‌ای‌آی و هاجینگ‌فیس (Hugging Face) و دیگری شواهد اولیه‌ای است که نشان می‌دهد مدل آینده اوپن‌ای‌آی با نام «آسترا» (Astra) ممکن است به آستانه «قابلیت حیاتی سایبری» (Critical Cybersecurity Capability) در چارچوب آمادگی (Preparedness Framework) این شرکت برسد.

اوپن‌ای‌آی اعلام کرده برای آنکه استانداردهای جدید امنیت، نظارت و هم‌راستاسازی را رعایت کند، به مدت دو هفته آموزش تقویتی (RL) جدیدترین مدل‌های خود را که برای استقرار آماده می‌شوند، متوقف کرده است. در این مدت، محیط‌های تحقیقاتی تحت آزمایش‌های امنیتی و «ردتیمینگ» (Red Teaming) بیشتری قرار گرفته و پوشش سامانه‌های نظارتی نیز گسترش یافته است.

بزرگ‌ترین اجرای برنامه‌ریزی‌شده آموزش تقویتی برای مدل‌های مرزی نیز همچنان متوقف است و شرکت در حال انجام آموزش‌ها و ارزیابی‌های کوچک‌تر است تا رفتار مدل‌ها، اثربخشی سازوکارهای حفاظتی و میزان هم‌راستایی آن‌ها پیش از ادامه مسیر با شواهد بیشتری بررسی شود.

سه لایه حفاظتی برای مدل‌های پیشرفته

اوپن‌ای‌آی رویکرد جدید خود را بر سه سازوکار اصلی استوار کرده است: نظارت، هم‌راستاسازی و امنیت.

نظارت برای شناسایی رفتارهای نگران‌کننده و واکنش به آن‌ها، هم‌راستاسازی برای کاهش احتمال اقدامات زیان‌بار یا غیرمجاز و اقدامات امنیتی برای محدود کردن دسترسی یا تأثیرگذاری مدل‌های هوش مصنوعی بر سامانه‌ها و منابع به کار گرفته می‌شوند.

این شرکت انتظار دارد مدل‌های هوش مصنوعی در آینده نزدیک بخش عمده‌ای از فعالیت‌های امنیتی، از جمله دفاع در برابر سایر مدل‌های هوش مصنوعی، را بر عهده بگیرند. به اعتقاد اوپن‌ای‌آی، این روند می‌تواند به مقیاس‌پذیری هر سه لایه حفاظتی متناسب با افزایش توانایی مدل‌ها کمک کند.

سخت‌گیری بیشتر در محیط‌های تحقیقاتی

با افزایش توانایی مدل‌های مرزی در حوزه امنیت سایبری، اوپن‌ای‌آی استانداردهای امنیتی محیط‌هایی را که مدل‌ها در آن‌ها آموزش و ارزیابی می‌شوند، افزایش داده است.

این شرکت پس از حادثه اوپن‌ای‌آی و هاجینگ‌فیس، اجرای استنتاج مدل‌های مرزی در خوشه‌های تحقیقاتی را برای فعالیت‌هایی که امکان اجرای کد یا استفاده از ابزارهای متصل به اینترنت داشتند، متوقف کرد. سپس یک مسیر محدودتر و ایمن‌تر برای اجرای کد ایجاد شد و هر فعالیت به‌صورت جداگانه برای تعیین امکان بازگشت به محیط عملیاتی مورد بررسی قرار گرفت.

استانداردهای جدید شامل ایزوله‌سازی بارهای کاری، ایزوله‌سازی شبکه و آزمون مستمر امنیتی است. بر اساس این الزامات، فعالیت‌هایی که کد تولیدشده توسط مدل یا کد غیرقابل‌اعتماد اجرا می‌کنند باید در محیط‌های ایزوله‌تر و اصطلاحاً «سندباکس» (Sandbox) قرار گیرند.

همچنین کنترل‌های بیشتری برای محدود کردن دسترسی بارهای کاری پرخطر و غیرقابل‌اعتماد به اینترنت و شبکه‌های داخلی ایجاد شده است. اوپن‌ای‌آی می‌گوید ساختار جدید به‌گونه‌ای طراحی شده که حتی نفوذ به یک بار کاری یا سرویس پشتیبان، به‌تنهایی نتواند دسترسی غیرمجاز به اینترنت یا سایر شبکه‌های داخلی را فراهم کند.

نظارت گسترده‌تر بر فرایند استدلال مدل‌ها

اوپن‌ای‌آی همچنین از توسعه سامانه جدیدی برای نظارت بر فرایندهای داخلی مدل‌ها خبر داده است.

این سامانه به‌صورت چندمرحله‌ای عمل می‌کند. در مرحله نخست، «طبقه‌بندهای فعال‌سازی» (Activation Classifiers) فعالیت داخلی مدل را در هر توکن نمونه‌برداری‌شده بررسی می‌کنند. در صورت مشاهده نشانه‌های مشکوک، موضوع به سامانه‌های خودکار پیچیده‌تر و پرهزینه‌تر برای بررسی بیشتر ارجاع داده می‌شود.

این سامانه‌ها اقدام‌های انجام‌شده توسط ابزارها، فرایند استدلال در دسترس و کل توالی فعالیت‌ها را برای شناسایی مواردی مانند دسترسی غیرمجاز، سرقت داده، رفتار مخرب و تلاش برای دور زدن سازوکارهای حفاظتی بررسی می‌کنند.

هدف اوپن‌ای‌آی این است که در صورت مشاهده رفتار نگران‌کننده، حداکثر ظرف ۳۰ دقیقه هشدار صادر شود. اگر سامانه احتمال نقض یک مرز امنیتی حیاتی را تشخیص دهد، بالاترین سطح هشدار فعال می‌شود و تیم‌های ایمنی، امنیت و پژوهش در جریان قرار می‌گیرند.

اگر این تیم‌ها نتوانند ظرف ۳۰ دقیقه به‌طور قطعی مشخص کنند که هشدار ناشی از یک خطای تشخیص است، انتظار می‌رود فعالیت مربوطه متوقف شود.

اوپن‌ای‌آی اعلام کرده این سطح از نظارت برای تمام آموزش‌های تقویتی و ارزیابی‌های مجهز به ابزار در مدل‌هایی با سطح توانایی «Sol» یا بالاتر الزامی است. پس از آنکه در ۷ اوت مشخص شد آسترا ممکن است از قابلیت‌های حیاتی سایبری برخوردار باشد، الزام نظارت مضاعف برای تمام فرایندهای استنتاج آسترا با ابزار نیز اعمال شده است.

برآورد فعلی اوپن‌ای‌آی نشان می‌دهد نظارت جدید تقریباً ۲۰ درصد از توان محاسباتی استنتاج فرایند تحت نظارت را مصرف می‌کند؛ هرچند این هزینه بسته به نوع آموزش و ارزیابی تفاوت قابل‌توجهی دارد.

تمرکز بیشتر بر هم‌راستاسازی

اوپن‌ای‌آی هم‌راستاسازی را یکی از محورهای اصلی مأموریت خود می‌داند. با افزایش توانایی مدل‌ها، به‌ویژه در زمینه حملات سایبری و فعالیت در محیط‌های پیچیده، رفتارهایی مانند «هک پاداش» (Reward Hacking)، فریب و دسترسی غیرمجاز می‌توانند خطرات جدی‌تری ایجاد کنند.

این شرکت اعلام کرده در آموزش تقویتی مدل‌های پیشرفته‌تر، تکنیک‌های اصلی هم‌راستاسازی را در مراحل بیشتری از فرایند آموزش به کار می‌گیرد. این اقدامات شامل بهبود مدل‌های پاداش برای شناسایی رفتارهای ناایمن، آموزش مدل‌ها برای ارائه گزارش صادقانه‌تر درباره اقدامات، توانایی‌ها و محدودیت‌های خود و کاهش رفتارهایی است که از ضعف پاداش‌ها، ارزیاب‌ها، ابزارها یا سازوکارهای نظارتی سوءاستفاده می‌کنند.

اوپن‌ای‌آی همچنین قصد دارد پوشش آموزش و ارزیابی رفتارهایی را که ممکن است هنگام تعامل مدل‌ها با سامانه‌ها یا منابع خارجی به آسیب منجر شوند، افزایش دهد.

گام بعدی چیست؟

اوپن‌ای‌آی اعلام کرده چارچوب آمادگی خود را توسعه خواهد داد تا این سازوکارهای حفاظتی را در مراحل آموزش و استقرار مدل‌ها به شکل منسجم‌تری به کار گیرد و قابلیت‌های مدل‌های آینده و محیط‌هایی را که در آن فعالیت می‌کنند، بهتر در نظر بگیرد.

این شرکت تأکید کرده است که همگام شدن سازوکارهای امنیتی با سرعت رشد توانایی مدل‌های مرزی، به سرمایه‌گذاری مستمر در امنیت مبتنی بر مدل‌های هوش مصنوعی، نظارت مؤثرتر و پیشرفت در پژوهش‌های هم‌راستاسازی نیاز دارد. همچنین اوپن‌ای‌آی قصد دارد سازمان‌های بیرونی را نیز در این مسیر مشارکت دهد و اطلاعات بیشتری درباره یافته‌های خود منتشر کند.

در نهایت، پیام اصلی اوپن‌ای‌آی روشن است: توانایی مدل‌های مرزی هوش مصنوعی با سرعت زیادی در حال افزایش است و ظرفیت صنعت برای درک، هم‌راستا کردن و ایمن‌سازی این مدل‌ها باید همواره جلوتر از این شتاب حرکت کند.