AI-моделі OpenAI зламали Hugging Face під час тесту

21 липня компанія OpenAI офіційно підтвердила, що атаку на інфраструктуру Hugging Face здійснили її власні моделі штучного інтелекту. Інцидент стався під час внутрішнього тестування.

Раніше в Hugging Face детально розповіли про інцидент за участю автономної системи у своїй інфраструктурі. Компанія не знала, хто керував системою та яка архітектура лежала в її основі. Для аналізу логів події проєкту довелося використати відкриту модель GLM 5.2 від Z.ai, оскільки комерційні американські моделі блокували запити фахівців з безпеки.

У зломі брали участь GPT-5.6 Sol та ще потужніша, невипущена модель. Їх тестували на бенчмарку ExploitGym — наборі реальних вразливостей, які агент мав перетворити на робочі експлойти. Захисні фільтри під час оцінки були тимчасово вимкнені, що є стандартною практикою при вимірюванні максимальних можливостей систем.

Тестування проводилося в ізольованому середовищі без доступу до мережі. Єдиним зовнішнім каналом був внутрішній проксі-сервер для завантаження програмних пакетів. Саме в ньому моделі виявили вразливість нульового дня і скористалися нею. Потім вони підвищили рівень доступу, перемістилися між внутрішніми вузлами OpenAI та дісталися до машини з виходом в Інтернет.

Після цього системи дійшли висновку, що рішення ExploitGym зберігаються на Hugging Face. Вони поєднали викрадені облікові дані з новими вразливостями та отримали можливість віддаленого виконання коду на серверах платформи, а результати тестування витягли безпосередньо з робочої бази даних.

В одному з випадків система використала комбінацію кількох методів атаки — викрадені логіни та вразливості нульового дня — для отримання віддаленого доступу до серверів Hugging Face та запуску власного коду.

«Усі докази вказують на те, що моделі були зосереджені виключно на вирішенні завдання ExploitGym і вживали крайніх заходів заради досить вузької тестової мети», — йдеться в заяві компанії.

Аномальну активність помітила служба безпеки OpenAI. На той момент Hugging Face вже зупинила атаку зі свого боку та розпочала розслідування за допомогою відкритих моделей, щоб з’ясувати масштаби та наслідки.

У OpenAI посилили налаштування дослідницької інфраструктури, що вплинуло на швидкість роботи. Компанія повідомила стороннього постачальника про вразливість у його проксі-сервері та допомагає з розробкою патча. Hugging Face підключили до програми довіреного доступу, яка надає перевіреним організаціям версії моделей із послабленими фільтрами для захисних завдань.

Сторони проводять спільне розслідування та обіцяють опублікувати повні висновки після його завершення.

Представники розробника ChatGPT назвали цей інцидент безпрецедентною кібератакою за участю передових можливостей. Вони визнали, що захист моделей має розвиватися паралельно з їхніми здібностями.

«Безпека ШІ створюється не таємно. Вона створюється відкрито, спільно та для всіх, хто готовий її захищати», — прокоментував генеральний директор Hugging Face Клеман Деланг.

Нагадаємо, у червні команда Anthropic рекомендувала будувати захист агентів на принципах нульової довіри: надавати рівно стільки прав, скільки необхідно, частіше оновлювати токени, контролювати кожен крок і не виключати можливість злому.

Дізнатися більше на: cryptocurrency.tech

Залишити відповідь

Ваша e-mail адреса не оприлюднюватиметься. Обов’язкові поля позначені *