OpenAI активировала дополнительные меры безопасности при разработке новой ИИ-модели Astra после того, как компания не смогла исключить наличие у системы критически высокого уровня возможностей в сфере кибербезопасности.
Речь идёт о способности современных моделей самостоятельно искать слабые места в программном обеспечении, анализировать сложные системы и помогать проводить атаки с гораздо меньшим участием человека.
Внутренняя классификация OpenAI предусматривает несколько уровней риска. Критическим считается уровень, при котором модель потенциально способна самостоятельно обнаруживать и использовать серьёзные неизвестные уязвимости или выполнять сложные атаки против хорошо защищённых целей.
Компания пока не утверждает, что Astra точно обладает такими возможностями. Однако результаты оценки оказались достаточно серьёзными, чтобы применить усиленный режим защиты.
Часть внутренних работ была приостановлена, а доступ к отдельным возможностям модели ограничили дополнительными средствами безопасности.
Подобные испытания становятся всё важнее. Ещё несколько лет назад главным соревнованием между нейросетями было качество текста, изображений и программного кода. Теперь разработчикам приходится одновременно оценивать, что произойдёт, если модель попробует использовать эти способности без постоянного контроля человека.
Особое внимание уделяется ИИ-агентам. В отличие от обычного чат-бота, такой агент может самостоятельно выполнять последовательность действий, пользоваться инструментами и принимать промежуточные решения.
Чем больше самостоятельности получает искусственный интеллект, тем важнее становится вопрос не только о том, что он умеет, но и о том, где заканчиваются границы этих возможностей.




Комментарии