پیشنهاد مدیرعامل Anthropic برای توسعه کنترلشده هوش مصنوعی پیشرو با ارزیابان مستقل
داریو آمودی، مدیرعامل Anthropic، پیشنهاد کرده است توسعه مدلهای پیشرو هوش مصنوعی با سرعتی کنترلشدهتر ادامه پیدا کند تا سازوکارهای ایمنی، همراستاسازی، تفسیرپذیری و ارزیابیها بتوانند همپای رشد تواناییهای این مدلها توسعه یابند.
آمودی برای این هدف طرحی سهمرحلهای ارائه کرده است. مرحله نخست، ایجاد جایگاهی برای ارزیابان مستقل و دائمی است؛ افرادی که به فرایندها و ابزارهای شرکت، دسترسی مشابه کارکنان داشته باشند و بتوانند درباره حوادث، کنترلهای ایمنی و شیوههای عملیاتی گزارش عمومی ارائه کنند. مرحله دوم، هماهنگی میان شرکتهای کشورهای دموکراتیک و مرحله سوم، همکاری جهانی، از جمله همکاری با چین، است.
از نگاه آمودی، حوادث اخیر مرتبط با عاملهای هوشمند، خودبهبوددهی بازگشتی و ظهور تواناییهای سایبری مستقل نشان میدهند که تعهدات داوطلبانه معمول دیگر برای مدیریت ریسک کافی نیستند.
اهمیت این پیشنهاد برای توسعه نرمافزار
اهمیت این بحث برای جامعه توسعه نرمافزار، بسیار فراتر از سیاستگذاری است. عاملهای هوشمند امروزی میتوانند کد اجرا کنند، به ابزارهای سازمانی متصل شوند، به شبکه دسترسی داشته باشند، حافظه پایدار نگه دارند و چند وظیفه را بهصورت همزمان پیش ببرند. در چنین شرایطی، محیط ایزوله یا sandbox بهتنهایی مدل امنیتی کاملی ایجاد نمیکند.
معماری عاملهای مورد استفاده در محیطهای تولیدی باید مجموعهای از کنترلهای مکمل را دربر بگیرد؛ از جمله حداقلسازی سطح دسترسی، جداسازی محیطها، ثبت رویدادهای قابل ممیزی، کنترل دقیق مجوزها، تأیید انسانی برای اقدامات حساس، ارزیابی مداوم و سازوکار بازگشت امن. همچنین تیمها باید این احتمال را در نظر بگیرند که رشد قابلیتهای مدل، از سرعت توسعه آزمونها و کنترلهای ایمنی بیشتر شود.
سه مرحله پیشنهادی برای هماهنگی و نظارت
- ارزیابی مستقل: حضور ارزیابانی دائمی با دسترسی کافی برای بررسی فرایندها، ابزارها، حوادث و کنترلهای شرکت.
- هماهنگی میان کشورهای دموکراتیک: همکاری شرکتها و نهادهای مرتبط برای ایجاد استانداردها و سازوکارهای مشترک.
- همکاری جهانی: گسترش همکاریها به سطح بینالمللی، از جمله تعامل با چین.
برداشت و پیامدهای عملی
برداشت من از این مطلب این است که...
برای توسعهدهندگان ارشد، نکته اصلی این است که ایمنی مدل دیگر فقط یک موضوع پژوهشی نیست؛ بلکه به مسئلهای در مهندسی نرمافزار، زیرساخت و عملیات تبدیل شده است. ارزیابان مستقل شرکتها را وادار میکنند زنجیره آموزش، محیطهای ارزیابی، مجوزهای دسترسی، لاگهای تغییرناپذیر، فرایند افشای حادثه و سازوکار بازگشت امن را قابل ممیزی کنند.
عاملهای امروزی کد اجرا میکنند، به شبکه و ابزارهای بیرونی متصل میشوند، حافظه پایدار دارند و میتوانند چند وظیفه را همزمان هماهنگ کنند؛ بنابراین اتکا به محیط ایزوله بهتنهایی کافی نیست. تیمهایی که عاملهای توسعهدهنده میسازند باید از همین حالا کنترل دسترسی حداقلی، جداسازی محیطها، تأیید انسانی برای اقدامات حساس، ثبت کامل رویدادها، آزمون تهاجمی مستمر و ارزیابی مستقل پیش از انتشار را در معماری خود قرار دهند.
برای تیمهای محصول و تصمیمگیرندگان فنی نیز پیام روشن است: قابلیتهای بیشتر باید همزمان با کنترلپذیری، قابلیت ممیزی و امکان بازگشت امن توسعه پیدا کنند. ارزیابی مستقل میتواند به جای یک اقدام تشریفاتی، به بخشی از فرایند انتشار و مدیریت چرخه عمر عاملهای هوشمند تبدیل شود.
پرسش پایانی
آیا ارزیابی مستقل باید به استانداردی اجباری برای شرکتهای سازنده مدلها و پلتفرمهای عاملمحور تبدیل شود؟
هنوز دیدگاهی تایید نشده است.