اوپنایآی سرعت توسعه برخی مدلهای پیشرفته هوش مصنوعی را موقتاً کاهش داد.
دلیل این تصمیم، افزایش تواناییهای سایبری مدلهای مرزی و نگرانی درباره خطرات احتمالی آنهاست.
اوپنایآی آموزش تقویتی برخی مدلها را متوقف کرده و سه لایه حفاظتی را در مرکز رویکرد جدید خود قرار داده است:
نظارت، همراستاسازی و امنیت.
این شرکت همچنین محیطهای تحقیقاتی را ایزولهتر کرده، نظارت بر فعالیت مدلها را افزایش داده و اعلام کرده است در صورت مشاهده رفتارهای نگرانکننده، هشدارهای امنیتی باید حداکثر ظرف ۳۰ دقیقه صادر شوند.
پیام این تحول برای صنعت هوش مصنوعی روشن است: هرچه مدلها قدرتمندتر میشوند، امنیت و حکمرانی آنها نیز باید سریعتر توسعه پیدا کند.
عنوان فارسی: اوپنایآی توسعه مدلهای هوش مصنوعی را به دلیل افزایش خطرات سایبری موقتاً کند کرد
عنوان اصلی: Pacing model development in an era of cyber-critical capabilities
نویسنده: اوپنایآی
تاریخ انتشار: ۱۸ اوت ۲۰۲۶
منبع: اوپنایآی
موضوع: هوش مصنوعی, امنیت سایبری, مدلهای مرزی, همراستاسازی, نظارت بر مدلها, آمادگی هوش مصنوعی
نسخه فارسی: شبکه اطلاعرسانی روابطعمومی ایران (شارا)
شبکه اطلاعرسانی روابطعمومی ایران (شارا) – اوپنایآی اعلام کرد در پی افزایش توانمندی مدلهای هوش مصنوعی و نگرانیهای فزاینده درباره قابلیتهای سایبری آنها، سرعت توسعه برخی از مدلهای پیشرفته خود را بهطور موقت کاهش داده است.
این شرکت میگوید دو تحول اخیر، ضرورت بازنگری در شیوههای نظارت، همراستاسازی (Alignment) و مهار مدلهای هوش مصنوعی را بیشتر کرده است. یکی از این موارد، حادثه امنیتی مرتبط با اوپنایآی و هاجینگفیس (Hugging Face) و دیگری شواهد اولیهای است که نشان میدهد مدل آینده اوپنایآی با نام «آسترا» (Astra) ممکن است به آستانه «قابلیت حیاتی سایبری» (Critical Cybersecurity Capability) در چارچوب آمادگی (Preparedness Framework) این شرکت برسد.
اوپنایآی اعلام کرده برای آنکه استانداردهای جدید امنیت، نظارت و همراستاسازی را رعایت کند، به مدت دو هفته آموزش تقویتی (RL) جدیدترین مدلهای خود را که برای استقرار آماده میشوند، متوقف کرده است. در این مدت، محیطهای تحقیقاتی تحت آزمایشهای امنیتی و «ردتیمینگ» (Red Teaming) بیشتری قرار گرفته و پوشش سامانههای نظارتی نیز گسترش یافته است.
بزرگترین اجرای برنامهریزیشده آموزش تقویتی برای مدلهای مرزی نیز همچنان متوقف است و شرکت در حال انجام آموزشها و ارزیابیهای کوچکتر است تا رفتار مدلها، اثربخشی سازوکارهای حفاظتی و میزان همراستایی آنها پیش از ادامه مسیر با شواهد بیشتری بررسی شود.
سه لایه حفاظتی برای مدلهای پیشرفته
اوپنایآی رویکرد جدید خود را بر سه سازوکار اصلی استوار کرده است: نظارت، همراستاسازی و امنیت.
نظارت برای شناسایی رفتارهای نگرانکننده و واکنش به آنها، همراستاسازی برای کاهش احتمال اقدامات زیانبار یا غیرمجاز و اقدامات امنیتی برای محدود کردن دسترسی یا تأثیرگذاری مدلهای هوش مصنوعی بر سامانهها و منابع به کار گرفته میشوند.
این شرکت انتظار دارد مدلهای هوش مصنوعی در آینده نزدیک بخش عمدهای از فعالیتهای امنیتی، از جمله دفاع در برابر سایر مدلهای هوش مصنوعی، را بر عهده بگیرند. به اعتقاد اوپنایآی، این روند میتواند به مقیاسپذیری هر سه لایه حفاظتی متناسب با افزایش توانایی مدلها کمک کند.
سختگیری بیشتر در محیطهای تحقیقاتی
با افزایش توانایی مدلهای مرزی در حوزه امنیت سایبری، اوپنایآی استانداردهای امنیتی محیطهایی را که مدلها در آنها آموزش و ارزیابی میشوند، افزایش داده است.
این شرکت پس از حادثه اوپنایآی و هاجینگفیس، اجرای استنتاج مدلهای مرزی در خوشههای تحقیقاتی را برای فعالیتهایی که امکان اجرای کد یا استفاده از ابزارهای متصل به اینترنت داشتند، متوقف کرد. سپس یک مسیر محدودتر و ایمنتر برای اجرای کد ایجاد شد و هر فعالیت بهصورت جداگانه برای تعیین امکان بازگشت به محیط عملیاتی مورد بررسی قرار گرفت.
استانداردهای جدید شامل ایزولهسازی بارهای کاری، ایزولهسازی شبکه و آزمون مستمر امنیتی است. بر اساس این الزامات، فعالیتهایی که کد تولیدشده توسط مدل یا کد غیرقابلاعتماد اجرا میکنند باید در محیطهای ایزولهتر و اصطلاحاً «سندباکس» (Sandbox) قرار گیرند.
همچنین کنترلهای بیشتری برای محدود کردن دسترسی بارهای کاری پرخطر و غیرقابلاعتماد به اینترنت و شبکههای داخلی ایجاد شده است. اوپنایآی میگوید ساختار جدید بهگونهای طراحی شده که حتی نفوذ به یک بار کاری یا سرویس پشتیبان، بهتنهایی نتواند دسترسی غیرمجاز به اینترنت یا سایر شبکههای داخلی را فراهم کند.
نظارت گستردهتر بر فرایند استدلال مدلها
اوپنایآی همچنین از توسعه سامانه جدیدی برای نظارت بر فرایندهای داخلی مدلها خبر داده است.
این سامانه بهصورت چندمرحلهای عمل میکند. در مرحله نخست، «طبقهبندهای فعالسازی» (Activation Classifiers) فعالیت داخلی مدل را در هر توکن نمونهبرداریشده بررسی میکنند. در صورت مشاهده نشانههای مشکوک، موضوع به سامانههای خودکار پیچیدهتر و پرهزینهتر برای بررسی بیشتر ارجاع داده میشود.
این سامانهها اقدامهای انجامشده توسط ابزارها، فرایند استدلال در دسترس و کل توالی فعالیتها را برای شناسایی مواردی مانند دسترسی غیرمجاز، سرقت داده، رفتار مخرب و تلاش برای دور زدن سازوکارهای حفاظتی بررسی میکنند.
هدف اوپنایآی این است که در صورت مشاهده رفتار نگرانکننده، حداکثر ظرف ۳۰ دقیقه هشدار صادر شود. اگر سامانه احتمال نقض یک مرز امنیتی حیاتی را تشخیص دهد، بالاترین سطح هشدار فعال میشود و تیمهای ایمنی، امنیت و پژوهش در جریان قرار میگیرند.
اگر این تیمها نتوانند ظرف ۳۰ دقیقه بهطور قطعی مشخص کنند که هشدار ناشی از یک خطای تشخیص است، انتظار میرود فعالیت مربوطه متوقف شود.
اوپنایآی اعلام کرده این سطح از نظارت برای تمام آموزشهای تقویتی و ارزیابیهای مجهز به ابزار در مدلهایی با سطح توانایی «Sol» یا بالاتر الزامی است. پس از آنکه در ۷ اوت مشخص شد آسترا ممکن است از قابلیتهای حیاتی سایبری برخوردار باشد، الزام نظارت مضاعف برای تمام فرایندهای استنتاج آسترا با ابزار نیز اعمال شده است.
برآورد فعلی اوپنایآی نشان میدهد نظارت جدید تقریباً ۲۰ درصد از توان محاسباتی استنتاج فرایند تحت نظارت را مصرف میکند؛ هرچند این هزینه بسته به نوع آموزش و ارزیابی تفاوت قابلتوجهی دارد.
تمرکز بیشتر بر همراستاسازی
اوپنایآی همراستاسازی را یکی از محورهای اصلی مأموریت خود میداند. با افزایش توانایی مدلها، بهویژه در زمینه حملات سایبری و فعالیت در محیطهای پیچیده، رفتارهایی مانند «هک پاداش» (Reward Hacking)، فریب و دسترسی غیرمجاز میتوانند خطرات جدیتری ایجاد کنند.
این شرکت اعلام کرده در آموزش تقویتی مدلهای پیشرفتهتر، تکنیکهای اصلی همراستاسازی را در مراحل بیشتری از فرایند آموزش به کار میگیرد. این اقدامات شامل بهبود مدلهای پاداش برای شناسایی رفتارهای ناایمن، آموزش مدلها برای ارائه گزارش صادقانهتر درباره اقدامات، تواناییها و محدودیتهای خود و کاهش رفتارهایی است که از ضعف پاداشها، ارزیابها، ابزارها یا سازوکارهای نظارتی سوءاستفاده میکنند.
اوپنایآی همچنین قصد دارد پوشش آموزش و ارزیابی رفتارهایی را که ممکن است هنگام تعامل مدلها با سامانهها یا منابع خارجی به آسیب منجر شوند، افزایش دهد.
گام بعدی چیست؟
اوپنایآی اعلام کرده چارچوب آمادگی خود را توسعه خواهد داد تا این سازوکارهای حفاظتی را در مراحل آموزش و استقرار مدلها به شکل منسجمتری به کار گیرد و قابلیتهای مدلهای آینده و محیطهایی را که در آن فعالیت میکنند، بهتر در نظر بگیرد.
این شرکت تأکید کرده است که همگام شدن سازوکارهای امنیتی با سرعت رشد توانایی مدلهای مرزی، به سرمایهگذاری مستمر در امنیت مبتنی بر مدلهای هوش مصنوعی، نظارت مؤثرتر و پیشرفت در پژوهشهای همراستاسازی نیاز دارد. همچنین اوپنایآی قصد دارد سازمانهای بیرونی را نیز در این مسیر مشارکت دهد و اطلاعات بیشتری درباره یافتههای خود منتشر کند.
در نهایت، پیام اصلی اوپنایآی روشن است: توانایی مدلهای مرزی هوش مصنوعی با سرعت زیادی در حال افزایش است و ظرفیت صنعت برای درک، همراستا کردن و ایمنسازی این مدلها باید همواره جلوتر از این شتاب حرکت کند.

نظر بدهید