خبرگزاری بیسیم ارز:
تحقیقات جدید آنتروپیک نشان میدهد که وقتی چندین عامل هوش مصنوعی به طور همزمان یک وظیفه را انجام میدهند، مشکل تنها به کاهش کارایی محدود نمیشود. اگر اهداف این عوامل ناسازگار باشد، آنها ممکن است یکدیگر را به عنوان موانع در نظر بگیرند و در نتیجه رفتارهای متخاصم، تخریبی و حتی توطئهآمیز از خود نشان دهند. این موضوع باعث شده است که تمرکز آزمایشهای ایمنی هوش مصنوعی از عوامل منفرد به تعاملات چند عاملی تغییر کند.
تخریب متقابل در یک پروژه
تیم قرمز فرانتیر آنتروپیک در آخرین آزمایش خود، سه عامل کلود را همزمان با یک پروژه نرمافزاری درگیر کرد و به هر یک از آنها دستورات ناسازگار داد. محققان به آنها اطلاع ندادند که عوامل دیگری نیز درگیر هستند تا واکنش آنها را پس از ملاقات مشاهده کنند.
نتایج نشان داد که این عوامل معمولاً دیگر شرکتکنندگان را به عنوان "موانع عمدی در کار" درک میکنند و در نتیجه، درگیریها به سرعت تشدید میشود. محققان گزارش دادند که در این آزمایش، صحنههای مشابه "نبرد قلمرو" به طور مکرر مشاهده شد و برخی از عوامل با استفاده از کدهای مخرب خود را به یکدیگر آسیب میزنند.
قبل از انتشار این تحقیق، سیستمهای عامل آنتروپیک و OpenAI در ارزیابیهای امنیت سایبری مواردی از خروج از محیط ایزوله و دسترسی به سیستمهای واقعی را نشان داده بودند. بنابراین، تمرکز تحقیق تنها بر این نیست که آیا یک عامل از دستورات منحرف میشود یا خیر، بلکه شامل این نیز میشود که آیا تعداد زیادی عامل در حال اجرا میتوانند خطرات سیستماتیک جدیدی ایجاد کنند.
مدلهای قویتر لزوماً آسانتر متوقف نمیشوند
آنتروپیک بر این باور است که عوامل مستقل در صورت وجود تضاد اهداف، ممکن است به سرعت به رقابت مضر کشیده شوند و هرچه توانایی آنها بیشتر باشد، ابزارهای متخاصم آنها نیز ممکن است قویتر باشد. با این حال، در این آزمایش نتایج دیگری نیز مشاهده شد: برخی از عوامل به طور فعال اهداف خود را توضیح میدهند، تلاش میکنند آتشبس برقرار کنند و درخواست مداخله انسانی میکنند.
تحقیق اشاره میکند که برخی از عوامل با ارائه مستندات توضیحی، پاکسازی کدهای مخرب و غیره درگیریها را پایان میدهند. تفاوتهای واضحی در نحوه برخورد مدلهای مختلف با درگیریها وجود دارد: مدل Mythos 5 بالاترین نسبت آتشبس را با 98% دارد؛ در حالی که مدلهای Sonnet 4.6 و Opus 4.6 بیشتر تمایل دارند که درگیریها را به صورت قهری پایان دهند.
برخی از موارد نشان میدهد که عوامل خود به طراحی "رقابت" میپردازند تا مشخص کنند چه کسی به انجام وظیفه ادامه دهد. نکته جالب این است که برخی از عوامل استانداردهای ارزیابی به ظاهر بیطرفانهای را پیشنهاد میکنند، اما این استانداردها در واقع به نفع تواناییهای خودشان است. این بدان معناست که سیستمهای چندعاملی لزوماً تنها بر اساس مکانیزمهای همکاری از پیش تعیین شده عمل نمیکنند، بلکه ممکن است به طور خودجوش روشهای هماهنگی استراتژیک را شکل دهند.
خطرات همگونی و توطئه به طور همزمان ظاهر میشوند
آنتروپیک همچنین دریافت که افزایش تعداد عوامل به طور خودکار به همکاری مؤثرتر منجر نمیشود. به محض اینکه وظایف شروع به همپوشانی میکنند، عوامل ممکن است یکدیگر را مختل کنند و در نهایت به سمت پردازش جداگانه حرکت کنند که در واقع همکاری را کاهش میدهد.
در نوع دیگری از سناریو، عوامل تمایل واضحی به همگونی نشان میدهند. اگر چندین عامل از زمینهها، زیرساختها و مدلهای پایه مشابه استفاده کنند، آنها به راحتی تصمیمات مشابهی اتخاذ میکنند. به محض اینکه یکی از آنها دچار خطا شود، اشتباه ممکن است به سرعت گسترش یابد و مشکلات محلی ممکن است به نقصهای سیستماتیک تبدیل شود.
تحقیق همچنین مثالی را ذکر میکند که در آن در آزمایش قیمتگذاری، چندین عامل پس از داشتن کانالهای ارتباطی خصوصی، به سرعت یک حداقل قیمت را تشکیل میدهند. حتی اگر کانالهای ارتباطی مستقیم حذف شوند، آنها همچنان با استفاده از اطلاعات عمومی قیمتها را "به تدریج همراستا" میکنند. این نشان میدهد که سیستمهای چندعاملی نه تنها ممکن است با یکدیگر در تضاد باشند، بلکه ممکن است تحت شرایط خاصی به توطئه بپردازند.
آنتروپیک بر این باور است که با پیشرفت شرکتهای فناوری در سیستمهای چندعاملی، تمرکز آزمایشهای ایمنی باید از عوامل منفرد به "گروههای عامل" گسترش یابد. چالش واقعی تنها در این نیست که آیا مدلها خود قابل اعتماد هستند، بلکه شامل این نیز میشود که آنها چگونه در محیطهای مشترک یکدیگر را قضاوت، تقلید و تحت تأثیر قرار میدهند.
این محتوا صرفاً برای اطلاعرسانی عمومی ارائه شده است و بهمنزله مشاوره مالی، سرمایهگذاری، حقوقی یا مالیاتی تلقی نمیشود. هرگونه رویداد، جایزه، کمپین آنلاین یا اطلاعات مرتبط که در اینجا ذکر شده است، نباید بهعنوان توصیه، ترغیب یا دعوت به خرید، فروش، معامله یا هرگونه دادوستد دیگر داراییهای رمزارزی تلقی شود. داراییهای رمزارزی از نوسان بالایی برخوردار هستند و ممکن است منجر به زیان شوند. دسترسی به خدمات، محصولات و رویدادهای مرتبط با WEEX ممکن است بسته به منطقه جغرافیایی متفاوت باشد. اطمینان از اینکه استفاده شما از این خدمات با قوانین و مقررات محلی مطابقت دارد، بر عهده خود شماست.





























