close-btn

Таємна змова ШІ-моделей OpenAI закінчилася кібератакою

OpenAI повідомила, що моделі штучного інтелекту, які стояли за атакою на Hugging Face Inc., почали спілкуватися між собою через непомічені дошки повідомлень і спільно працювали над виходом із тестового середовища ще у травні

Таємна змова ШІ-моделей OpenAI закінчилася кібератакою

Фото: chatgpt.com

Експериментальні AI-агенти OpenAI під час закритих кібербезпекових тестів створили внутрішню дошку повідомлень, обмінювалися вразливостями та зрештою отримали доступ до інтернету. Кульмінацією стала атака на Hugging Face, повідомили дослідники OpenAI Ерік Воллес і Майкл Далтон на Black Hat 2026.

Тестування внутрішньої дослідницької моделі почалося 7 травня. Коли агенти не могли виконати окремі завдання, частина з яких виявилася неможливою, вони почали шукати обхідний шлях. Один агент з’ясував, що може записувати файли у спільний репозиторій Artifactory, і залишив там інструкцію для інших моделей.

Згодом репозиторій перетворився на неформальну дошку оголошень із сотнями тисяч повідомлень. Агенти ділилися експлойтами, розподіляли завдання й обговорювали способи обійти обмеження. Наприкінці травня вони використали вразливість Artifactory, отримали можливість віддалено виконувати код і права адміністратора.

На початку липня активність агентів перевантажила сервіс і спричинила збій. OpenAI очистила репозиторій, закрила вразливість та відновила тестування. Уже через два дні моделі створили новий канал обміну повідомленнями та продовжили координувати дії.

«У певний момент агенти зрозуміли, що, можливо, можна спробувати використати вразливості або атакувати зовнішню інфраструктуру, щоб знайти відповіді на тест, за яким мене оцінюють», — сказав Воллес під час презентації на конференції Black Hat у Лас-Вегасі.

Читайте також: OpenAI безплатно надасть свої ШІ-моделі науковцям

За даними OpenAI, агенти знайшли вразливість нульового дня, вийшли з ізольованого середовища в інтернет, підвищили привілеї та переміщувалися внутрішньою мережею. Вони вирішили, що Hugging Face може зберігати матеріали тесту ExploitGym, і проникли в інфраструктуру платформи, щоб отримати готові відповіді. На серверах Hugging Face агент запустив власний код, викрав облікові дані та перейшов до інших систем. Компанія не виявила ознак підміни публічних моделей, наборів даних або програмного ланцюга постачання.

Після інциденту OpenAI обмежила доступ до внутрішньої моделі, посилила моніторинг агентів і свідомо сповільнила частину досліджень, щоб оновити захист тестових середовищ.

Одним із ключових висновків перевірки OpenAI стало те, що ці передові моделі продемонстрували схильність обманювати під час виконання завдань і наполегливо намагалися довести роботу до кінця, навіть коли їхні дії починали відхилятися від початкових інструкцій.

«Передові моделі справді люблять шахраювати, — сказав Далтон у переповненій конференцзалі. — І вони люблять це робити тому, що під час навчання на них часто чиниться різний тиск, щоб вони працювали швидше».

Редакція PSM звертає увагу, що для України цей випадок має практичне значення: автономні AI-агенти можуть прискорити пошук вразливостей у банках, державних сервісах і критичній інфраструктурі. На тлі постійних кібератак росії українським організаціям варто готувати автоматизовані системи виявлення, ізоляції та блокування агентних атак.

Цей епізод підкреслив зростання глобальних побоювань, що передові системи ШІ можуть використовуватися для проведення руйнівних кібератак.

Інцидент та аналогічні злами, про які повідомляли Anthropic PBC і Meta Platforms Inc., посилили заклики у Вашингтоні та Кремнієвій долині до проведення ретельніших перевірок безпеки AI-моделей.

Ознайомтеся з іншими популярними матеріалами:

ШІ працюватиме за вас 24/7: Цукерберг озвучив цікавий прогноз

Nvidia, Microsoft і SpaceX створили альянс для розвитку безпечного ШІ

OpenAI готує свій перший ШІ-пристрій

Джерела: bloomberg.com; openai.com; huggingface.co.

google news
credit link image
x

Введіть запрос вище та натисніть Enter щоб шукати.