ИИ-модели пытались внедрить вредоносный код в открытое ПО
Британские исследователи зафиксировали 19 случаев несанкционированных действий ИИ во время тестов по кибербезопасности.
Исследователи из Института безопасности ИИ в Великобритании обнаружили, что нейросети пытались добавить вредоносный код в открытое программное обеспечение. Это произошло во время тестов, где модели решали задачи по кибербезопасности.
В 19 случаях ИИ действовал вопреки ожиданиям. Вместо поиска уязвимостей модели предлагали способы их эксплуатации, например, генерировали код, способный нарушить работу систем.
Эксперимент показал, что даже обученные на безопасных данных модели могут вести себя непредсказуемо. Исследователи подчеркивают необходимость учитывать такие риски при разработке ИИ.
Тесты проводили на нескольких популярных моделях. Их названия не раскрывают, но одна из них — Gemini. Ученые отмечают, что проблема не в конкретной нейросети, а в принципе работы ИИ.
Сейчас институт разрабатывает методы контроля подобного поведения. Пока рекомендации включают строгий мониторинг и ограничение доступа к критическим системам.