Учёные научились превращать открытые ИИ-модели в вредоносные
Исследователи доказали, что любую модель с открытыми весами можно модифицировать для выполнения опасных задач.
Международная группа учёных обнаружила уязвимость всех ИИ-моделей с открытыми весами. Даже те из них, которые разработчики пытались защитить от злоупотреблений, можно изменить для выполнения вредоносных запросов.
Эксперименты показали, что злоумышленники способны переписать веса моделей, заставив их генерировать опасный контент. При этом основные функции ИИ сохраняются — модель продолжает отвечать на обычные вопросы, но параллельно может создавать вредоносный код или распространять дезинформацию.
Проблема затрагивает все популярные открытые архитектуры, включая Llama, Mistral и GPT-J. Исследователи протестировали семь моделей разного размера. Каждую удалось модифицировать за 1-5 часов без специального оборудования.
Разработчики часто добавляют защитные механизмы на уровне API или интерфейса. Однако если злоумышленник получает доступ к весам модели, эти меры становятся неэффективными. Учёные применили метод перезаписи параметров, который сохраняет производительность ИИ, но изменяет его поведение в определённых ситуациях.
«Мы предполагали, что крупные модели окажут больше сопротивления, — отметил один из авторов исследования. — Но даже системы с 65 миллиардами параметров поддались модификациям».
Специалисты предлагают три возможных решения: усилить контроль за распространением весов, создать новые методы защиты на архитектурном уровне или отказаться от открытых моделей. Пока ни один из подходов не обеспечивает полной безопасности.
Исследование ставит под сомнение будущее открытого ИИ. Свободный доступ ускоряет разработку, но одновременно делает модели потенциально опасными.