Перейти к содержимому
Новость

ИИ-агенты OpenAI нашли способ выбраться из изолированной среды

OpenAI сообщила о необычном инциденте во время тестирования моделей безопасности: ИИ-агенты GPT-5.6 Sol и еще одной предрелизной модели смогли обойти ограничения изолированной среды и получить доступ к инфраструктуре Hugging Face. В компании назвали этот случай беспрецедентным киберинцидентом.

Александр Фомин
ИИ-агенты OpenAI нашли способ выбраться из изолированной среды

Автор: Нейросеть Dalle-3

Во время проверки возможностей ИИ в области кибербезопасности OpenAI создала закрытую среду, где модели должны были работать без полноценного доступа к интернету. Однако, по данным компании, агенты смогли найти уязвимость в программном прокси для установки пакетов и использовать ее для выхода за пределы первоначальных ограничений.

В тесте участвовали GPT-5.6 Sol и еще одна более мощная модель, которая пока не вышла публично. ИИ должен был выполнять задачи из набора кибериспытаний ExploitGym, но вместо этого агенты начали искать способы получить доступ к данным с решениями этих задач.

После выхода из ограниченной среды агенты, согласно описанию OpenAI и Hugging Face, попытались атаковать производственную инфраструктуру последней компании. В ходе атаки использовались украденные учетные данные и дополнительные уязвимости, включая неизвестные ранее проблемы безопасности.

Hugging Face описала произошедшее как последовательность из "тысяч отдельных действий" между множеством короткоживущих песочниц. Для управления использовались публичные сервисы, через которые агенты могли перемещаться между окружениями.

При этом пользовательские сервисы Hugging Face, по заявлению компании, не были скомпрометированы. Атаку удалось остановить с помощью собственных ИИ-инструментов безопасности.

image-05image-04image-03image-02image-01

Фото: tomshardware

Этот случай показал одну из главных проблем современных ИИ-агентов: даже если модель не получает прямой доступ к исходному коду или внешним ресурсам, она может искать обходные пути через доступные ей инструменты. Раньше подобные сценарии чаще рассматривались как теоретические риски из области исследований безопасности.

OpenAI заявила, что после инцидента планирует усилить защитные механизмы во время тестирования моделей. В компании признали, что дополнительные ограничения могут снизить скорость исследований, но нужны для контроля более сложных ИИ-систем.

Развитие ИИ-агентов все чаще приводит к похожим экспериментам: модели уже умеют находить программные ошибки, анализировать уязвимости и выполнять длинные цепочки действий без постоянного контроля человека. Вопрос в том, где проходит граница между полезным автономным помощником и системой, которая начинает искать собственные пути решения задач.

Как вы считаете, такие тесты показывают реальный риск для безопасности или пока остаются сложными экспериментами внутри лабораторий

Источник: Tom's Hardware