Главная / Аналитика / Модели
Модели

Разработчики ИИ скупают корпоративные переписки для обучения моделей

OpenAI и Anthropic активно приобретают внутренние данные компаний из-за нехватки общедоступных текстов.

Артём Соколов2 минсегодня
Разработчики ИИ скупают корпоративные переписки для обучения моделей

Крупные разработчики языковых моделей, такие как OpenAI и Anthropic, ищут новые источники данных для обучения нейросетей. Они столкнулись с дефицитом общедоступных текстов в интернете и теперь активно скупают корпоративные переписки.

Спрос на внутренние данные резко вырос за последние месяцы. Разработчиков интересуют чаты из мессенджеров, электронные письма, записи видеоконференций и история изменений кода. Эти материалы помогают обучать модели на более специализированных и разнообразных данных.

Раньше ИИ-компании использовали открытые источники — книги, статьи, форумы. Теперь их недостаточно для масштабирования моделей. Корпоративные данные ценны тем, что отражают реальные бизнес-процессы и живую коммуникацию.

Пока неясно, как компании получают доступ к такой информации. Возможны прямые сделки с корпорациями или покупка у поставщиков специализированных датасетов. Эксперты предполагают, что это может вызвать вопросы о конфиденциальности.

Тренд, вероятно, усилится: разработчики ищут любые качественные тексты для улучшения ИИ, а корпоративные данные остаются одним из немногих доступных ресурсов.