Обнаружение ИИ сложнее игры в «Настоящее или поддельное»
Проблема доверия в интернете усугубляется из-за ИИ-контента, а детекторы не справляются с его выявлением.
Интернет теряет доверие — и дело не только в соцсетях, заваленных ИИ-мусором. Сгенерированные нейросетями тексты и изображения проникают в резюме, отзывы на товары и даже страховые заявки. Платформы и пользователи пытаются отличить настоящее от подделки, но это становится всё сложнее.
За последние пару лет появились стартапы, которые обещают решить проблему. Их инструменты анализируют текст на признаки ИИ-вмешательства: неестественную плавность, странные повторы, отсутствие человеческих ошибок. Однако Макс Сперо, основатель Pangram, считает, что такой подход уязвим.
«Детекторы ИИ работают по принципу „чёрного ящика“ — они ищут статистические аномалии, но не понимают смысла, — объясняет Сперо. — Если модель следующего поколения научится имитировать человеческую небрежность, эти инструменты станут бесполезны».
Проблема в том, что ИИ-детекторы отстают от генеративных моделей. GPT-4 уже сейчас может писать с опечатками и намеренными «шероховатостями», а изображения от MidJourney иногда сложно отличить от фото. Вместо гонки вооружений Сперо предлагает другой подход — цифровые водяные знаки, встроенные в контент на уровне метаданных.
Но и это не панацея. Во-первых, не все сервисы будут добровольно маркировать контент. Во-вторых, водяные знаки можно удалить. «Единственное устойчивое решение — переосмыслить сам способ взаимодействия с информацией, — говорит Сперо. — Возможно, нам нужен новый протокол доверия, а не просто ещё один фильтр».
Пока компании и регуляторы ищут ответ, пользователям остаётся полагаться на критическое мышление. Проверять источники, искать противоречия, задаваться вопросом: «Кому выгодно, чтобы я это увидел?» — пока ИИ не научился задавать его за нас.