Исследователь Anthropic показал самообучающийся ИИ
ИИ смог самостоятельно улучшить свою работу по 10 тестам без потери производительности.
Исследователь из Anthropic продемонстрировал, как ИИ может самостоятельно улучшать свою работу. Системы успешно справились с 10 тестами, которые проверяли их на нежелательное поведение, при этом не потеряв в общей производительности.
Эксперимент показал, что ИИ способен корректировать свои слабые места без внешнего вмешательства. Раньше такие задачи требовали ручной настройки или дополнительного обучения. Теперь алгоритмы сами адаптируются, снижая риски ошибок.
Это ключевой шаг в развитии безопасного ИИ. Команда Anthropic сосредоточилась на предотвращении вредоносных сценариев — от предвзятости до манипуляций. Самообучение позволяет системам быстрее выявлять и устранять уязвимости.
Пока технология тестируется в ограниченных условиях, но даже эти результаты открывают путь к более устойчивым и предсказуемым моделям. В перспективе подход может ускорить внедрение ИИ в медицину, финансы и образование.
Главный вопрос теперь — как контролировать процесс самоулучшения. Разработчики ищут баланс между автономностью и безопасностью. Следующий этап — проверка методов в реальных условиях.