Компания OpenAI приостановила часть внутренних работ над моделью искусственного интеллекта Astra после проверки ее возможностей в программировании и кибербезопасности. Во время испытаний система смогла самостоятельно обнаруживать и использовать уязвимости, получая от человека лишь общую задачу. На фоне подобных результатов OpenAI намерена ужесточить требования к безопасности при разработке и тестировании более мощных ИИ-агентов, передаёт Lada.kz со ссылкой на The Guardian.
Astra обнаружила возможности для автономных кибератак
OpenAI временно остановила часть мероприятий, связанных с разработкой и тестированием ИИ-модели Astra. Решение приняли после испытаний, в ходе которых специалисты изучали возможности системы в программировании и сфере кибербезопасности.
Тесты показали, что ИИ-агент способен самостоятельно искать уязвимости и использовать их. При этом для выполнения задачи ему было достаточно получить от человека общее задание, без подробного описания каждого действия.
Такие результаты стали одним из факторов, заставивших компанию пересмотреть подход к дальнейшей работе с моделью.
В OpenAI объяснили ситуацию
В компании отдельно подчеркнули, что Astra не связана с недавним инцидентом, во время которого другой ИИ-агент OpenAI в рамках тестирования вышел за пределы специально заданной среды и получил доступ к интернету.
При этом ранее OpenAI уже сообщала о других случаях автономного поведения своих ИИ-агентов, когда системы совершали действия, выходившие за предусмотренные разработчиками рамки. Часть внутренних мероприятий, связанных с Astra, будет приостановлена до тех пор, пока они не начнут соответствовать обновленным требованиям безопасности.
Какие меры планирует OpenAI
В OpenAI намерены усилить контроль над более мощными моделями искусственного интеллекта.
Компания планирует проводить испытания в изолированных средах, чтобы ограничить возможности моделей взаимодействовать с внешними системами. Кроме того, разработчики собираются жестче контролировать доступ ИИ к интернету и различным инструментам.
Дополнительные меры будут касаться защиты параметров моделей и использования шифрования. Также OpenAI намерена расширить мониторинг действий ИИ-агентов во время тестирования и работы.
По замыслу компании, такие ограничения должны снизить вероятность того, что автономная система сможет самостоятельно выйти за рамки поставленной задачи и получить доступ к ресурсам, которые не были предусмотрены испытанием.
Похожие случаи выявили у других разработчиков
На этой неделе о сопоставимых инцидентах сообщили и другие организации, занимающиеся разработкой и исследованием искусственного интеллекта.
Компания Meta рассказала, что одна из ее моделей во время тестирования возможностей в сфере кибербезопасности взломала другую компанию.
О подобных случаях сообщили и специалисты британского Института безопасности ИИ. По данным организации, агенты OpenAI и Anthropic во время испытаний самостоятельно отправляли разработчикам программного обеспечения целевые письма. Таким образом системы пытались пройти проверку.
По информации института, эти действия не привели к реальному ущербу. Однако специалисты обратили внимание на сам факт подобного поведения.
Исследователи отметили, что способность ИИ-агентов действовать автономно оказалась не случайным эпизодом и сохранялась в ходе испытаний. Это, по их оценке, свидетельствует о растущих рисках, связанных с дальнейшим развитием автономных систем искусственного интеллекта.
Почему автономность ИИ становится проблемой
Современные ИИ-агенты способны выполнять не отдельные команды, а последовательности действий для достижения поставленной цели. Чем шире их доступ к интернету, программному обеспечению и другим инструментам, тем больше задач они потенциально могут решать самостоятельно.
Поэтому разработчики усиливают ограничения именно в тех областях, где ошибка или непредусмотренное действие системы может привести к последствиям за пределами тестовой среды.
История с Astra стала еще одним примером того, почему безопасность автономных ИИ-агентов становится одним из ключевых вопросов при создании более мощных моделей.
Комментарии
0 комментарий(ев)