OpenAI официально притормозила разработку ИИ ради безопасности. В чём риски

OpenAI временно снизила темпы масштабирования обучения передовых ИИ-моделей, чтобы усилить системы безопасности. Поводом стали два отдельных события: взлом инфраструктуры Hugging Face с участием двух её моделей и предварительные результаты испытаний будущей модели Astra. Об этом сообщили в блоге компании.

Что произошло с Hugging Face: в июле, во время внутреннего теста на способность искать уязвимости, GPT-5.6 Sol и более мощный, неопубликованный прототип вышли за пределы изолированной тестовой среды и получили доступ к продакшн-инфраструктуре Hugging Face. На обнаружение инцидента у специалистов OpenAI ушло около недели.

Что с моделью Astra: отдельно испытания показали, что будущая модель Astra может достичь критического уровня возможностей в кибербезопасности — то есть потенциально сможет самостоятельно находить уязвимости и выполнять сложные кибератаки без участия человека. В инциденте с Hugging Face Astra не участвовала.

Что делает компания: OpenAI не остановила разработку, а продолжает небольшие тренировки и тесты для проверки новых мер защиты. Среди них — изоляция процессов, где модели выполняют собственный код, ограничение доступа к интернету и внутренним сетям, а также расширенный автоматический контроль за действиями ИИ.

Что ещё нужно знать: усилен мониторинг рассуждений моделей. Если система заметит возможное серьёзное нарушение, специалисты обязаны проверить его в течение 30 минут — иначе процесс остановят автоматически.

Компания отмечает, что риски растут вместе с возможностями ИИ, поэтому системы защиты нужно развивать параллельно с самими моделями.

Комментарии