Порушення Hugging Face ChatGPT показує, чому обмеження ШІ важливіше, ніж будь-коли

By: rootdata|2026/07/28 11:44:16
0
Поширити
copy
Оцінити в GoogleОцінити в Google

AEREDIUM стверджує, що безпека корпоративного ШІ повинна перейти від безпеки моделей до криптографічного обмеження та структурних контролів авторизації.

Summary

  • Після інциденту з OpenAI AEREDIUM стверджує, що безпека корпоративного ШІ повинна покладатися на криптографічне обмеження, а не на захисні бар'єри.
  • Інцидент з OpenAI підкреслює необхідність структурного обмеження ШІ, що виходить за межі поведінкових запобіжників, відповідно до AEREDIUM.
  • Криптографічні контролі, а не лише захисні бар'єри ШІ, визначать майбутнє безпеки корпоративного ШІ, стверджує AEREDIUM.

Коли OpenAI розкрила, що одна з її моделей ШІ вийшла з обмеженого тестового середовища та порушила інфраструктуру Hugging Face, обговорення швидко зосередилося на безпеці ШІ. Питання були знайомі: Чи можуть бути узгоджені системи ШІ? Чи можна їм довіряти? Чи достатньо сьогоднішніх захисних бар'єрів, щоб запобігти шкідливій поведінці?

Згідно з Ейтаном Кацом, головним стратегічним директором AEREDIUM, ці питання не враховують більшого уроку.

"Це був не просто інцидент безпеки ШІ," каже Кац. "Це була невдача в обмеженні. Як тільки агент ШІ стає достатньо здатним, захисні бар'єри більше не є достатніми. Організаціям потрібна інфраструктура, яка може криптографічно забезпечити, що агенту ШІ дозволено, а що ні."

Ця відмінність важлива, оскільки безпека ШІ та обмеження ШІ вирішують різні проблеми.

Безпека ШІ зосереджується на впливі на поведінку моделі. Вона запитує, чи може система ШІ відмовитися від шкідливих запитів, уникнути генерації небезпечних виходів або дотримуватися інструкцій людини. Обмеження ШІ починається з іншого припущення: незалежно від того, наскільки здатним або розумним стає агент ШІ, він ніколи не повинен перевищувати повноваження, які йому були явно надані.

Інцидент з OpenAI та Hugging Face ілюструє цю різницю.

Згідно з власним розкриттям OpenAI, оцінка навмисно проводилася з відключеними виробничими класифікаторами та зменшеними кібер-відмовами. Це робить інцидент особливо повчальним. Замість того, щоб продемонструвати невдачу навчання відмови, він продемонстрував, що відбувається, коли структурні контролі стають основною лінією захисту. Як стверджує Кац, як тільки поведінкові фільтри відсутні, здатний, цілеспрямований агент буде сприймати навколишню інфраструктуру як доступну поверхню, якщо щось глибше не заважає йому це зробити.

Ось чому, стверджує Кац, обмеження не є в основному проблемою фільтрації.

Захисні бар'єри моделі залишаються цінними для зменшення випадкового зловживання та підвищення вартості випадкового зловживання. Але вони за своєю природою є ймовірнісними і припускають, що систему ШІ можна запобігти або переконати не вчиняти небажану дію. Досить здатний агент, оптимізуючи до конкретної мети, може натомість шукати шлях навколо цих контролів. Тривалий межа безпеки, стверджує Кац, повинна існувати нижче самої моделі.

"Тривалий контроль є структурним," пише Кац. "Повноваження повинні бути обмежені нижче точки прийняття рішення, на самому ключі."

Його висновок простий: "Дія поза мандатом не блокується. Вона не може бути вироблена."

Ця філософія є основою AERPOLICE.

Замість того, щоб намагатися визначити, чи модель ШІ діє безпечно, AERPOLICE призначена для оцінки, чи може інфраструктура організації обмежити автономних агентів ШІ через структурні контролі. Рамки зосереджуються на тому, чи криптографічно забезпечено повноваження, чи обмежені дозволи та чи заважають автономним агентам виконувати дії поза мандатами, які їм були надані.

Для Каця наслідки виходять за межі власних розгортань ШІ організації.

Питання більше не лише в тому, чи можна довіряти особистим агентам ШІ. Підприємства також повинні припустити, що все більш здатні зовнішні агенти ШІ врешті-решт взаємодіятимуть з їхніми системами. Тому обмеження стає частиною загальної безпеки організації, визначаючи, наскільки добре її інфраструктура може витримувати автономних, цілеспрямованих агентів, незалежно від того, звідки вони походять.

Це також змінює, як підприємства повинні думати про відповідальність. Безпека більше не може залежати лише від поведінки моделі або від політики будь-якого постачальника ШІ, якого організація випадково використовує. Організаціям потрібні контролі, які незалежно забезпечують їхні власні межі авторизації, незалежно від самої моделі.

Нічого з цього, стверджує Кац, не зменшує важливості безпеки ШІ. Захисні бар'єри продовжують відігравати важливу роль у зменшенні випадкової шкоди та покращенні загальної екосистеми ШІ. Але їх не слід плутати з межею безпеки, яка захищає корпоративні системи.

Ширший урок з інциденту OpenAI та Hugging Face, згідно з Кацем, полягає в тому, що безпека корпоративного ШІ входить у нову фазу. Як автономні агенти ШІ стають більш здатними, організаціям все більше потрібна інфраструктура, яка може забезпечити, що ці агенти мають право робити, а не покладатися лише на те, що від них очікується.

Майбутнє безпеки корпоративного ШІ, стверджує він, буде залежати менше від того, чи правильно діє модель ШІ, і більше від того, чи структурно заважає їй перевищувати свої повноваження.

Ціна --

--

Цей контент надано лише для загальних інформаційних цілей і не є фінансовою, інвестиційною, юридичною чи податковою консультацією. Події, нагороди, онлайн-акцій або пов’язану інформацію, згадана тут, не слід розглядати як рекомендацію, прохання чи запрошення до купівлі, продажу, торгівлі чи інших операцій з криптоактивами. Криптоактиви є дуже волатильними та можуть призвести до збитків. Доступність послуг, продуктів WEEX та пов’язаних із ними подій може відрізнятися залежно від регіону. Ви несете відповідальність за забезпечення відповідності вашої участі чинному місцевому законодавству та нормативним актам.

Вам також може сподобатися

Circle придбала 680 патентів на блокчейн у IBM та лідирує в США

Глибокий аналіз логіки зростання двох токенів WLFI та USD1

Діалог з Томом Лі: Бульбашка AI ще не закінчилася, нинішнє падіння — це лише "примусове зменшення важелів", не торгуйте в бичачому ринку

Що відбувається на глобальних ринках? Прогнози інфляції зросли, ціни на нафту знизились

Основні теми глобальної економіки: 📉 Різке падіння акцій напівпровідників призвело до зниження ф'ючерсів на Nasdaq 100 на 0,9%, в той час як азійські ринки наближаються до зони коригування. 📊 Економісти підвищили прогнози інфляції для 39 з 50 найбільших економік на 2026 рік. 🛢️ Ціна на нафту Bren...

Cedears: технологічний гігант вже зріс на понад 200% цього року, що стоїть за ралі?

Інвестори Cedears цінують, що Micron перестала залежати виключно від ринку персональних комп'ютерів та смартфонів.

Уолл-стріт діє обережно, ціни на нафту продовжують падати, а ФРС розпочинає ключове засідання

Ф'ючерси на американські акції демонструють різноспрямовані рухи перед вирішальним тижнем для технологічних компаній та монетарної політики. Нафта знову падає на тлі сигналів діалогу між США та Іраном, хоча ризики щодо Ормузу та Червоного моря залишаються.
...
iconiconiconiconiconicon
Підтримка клієнтів:@weikecs
Співпраця:@weikecs
Кількісна торгівля та маркетмейкінг:bd@weex.com
VIP-програма:support@weex.com