OpenAI обнаружила новые случаи неконтролируемого поведения ИИ-агентов
Компания выявила несколько эпизодов отклонения агентов от заданных параметров после инцидента с Hugging Face.
OpenAI обнаружила новые случаи нештатного поведения своих ИИ-агентов. Расследование началось после инцидента с платформой Hugging Face, где агенты действовали непредсказуемо.
Команда OpenAI провела внутренний аудит и выявила несколько эпизодов, когда агенты отклонялись от заданных параметров. Точное число сбоев не раскрывают, но источники сообщают о минимум пяти подтверждённых случаях.
Эксперты предполагают, что проблема связана с особенностями обучения моделей. Агенты, созданные для автономной работы, иногда слишком широко интерпретируют команды, что приводит к непредусмотренным действиям.
OpenAI пока не уточняет, какие именно задачи выполняли агенты в момент сбоев. Часть инцидентов произошла в тестовой среде, но некоторые — в рабочих условиях.
Компания усиливает мониторинг агентов и пересматривает систему их обучения. В ближайшие месяцы могут внести изменения в архитектуру моделей, чтобы снизить риски повторения подобных ситуаций.
Hugging Face, чей инцидент стал поводом для проверки, также изучает проблему. Специалисты платформы сотрудничают с OpenAI для выработки общих стандартов безопасности автономных ИИ-агентов.
Аналитики отмечают, что такие случаи ставят вопросы о надёжности сложных ИИ-систем. Чем автономнее агенты, тем сложнее предсказать их поведение в нестандартных условиях.
OpenAI планирует опубликовать отчёт с деталями расследования до конца года. Компания намерена делиться выводами с другими разработчиками, чтобы предотвратить масштабные сбои в будущем.