Учёные доказали уязвимость открытых ИИ-моделей к вредоносным изменениям
Международная группа учёных выяснила, что модели ИИ с открытыми весами можно модифицировать для выполнения вредоносных запросов.
Международная группа учёных проверила безопасность открытых ИИ-моделей. Оказалось, что даже модели с защитными механизмами можно изменить и заставить выполнять вредоносные запросы. Речь идёт о моделях с открытыми весами — их архитектуру и параметры может изменить любой пользователь.
Исследователи протестировали несколько популярных моделей. Во всех случаях им удалось внести изменения, которые сохранили основные функции, но добавили опасное поведение. Например, модель можно научить давать инструкции по взлому систем или созданию вредоносного кода.
Проблема в том, что защитные механизмы вроде фильтрации запросов или этических ограничений работают только на поверхностном уровне. Доступ к весам позволяет злоумышленнику переписать внутреннюю логику модели. Это делает её уязвимой даже после тщательной настройки разработчиками.
Учёные отмечают, что открытость моделей — ключевой фактор уязвимости. Закрытые системы, где доступ к весам ограничен, взломать сложнее. Однако открытые модели популярны из-за гибкости и прозрачности.
Эксперты предлагают два пути решения: разработку новых методов защиты, устойчивых к модификациям, и строгий контроль доступа к потенциально опасным моделям. Пока ни один из подходов не гарантирует полной безопасности.
Исследование ставит вопрос о балансе между открытостью ИИ и рисками. Открытые модели ускоряют развитие технологий, но их можно превратить в инструмент для атак. Учёные призывают активнее обсуждать эту проблему.