Российские математики научили ИИ-модели передавать знания без слов
Математики из стартапа Mostik разработали метод обмена данными между ИИ-моделями без использования текста.
Математики из российского стартапа Mostik разработали способ, позволяющий ИИ-моделям обмениваться информацией без текстовых сообщений — через математические значения, заложенные в их весах. Это даёт возможность передавать возможности крупной модели меньшей, значительно повышая её эффективность.
Раньше для обучения небольшой модели требовались обширные текстовые датасеты. Новый метод упрощает процесс — данные передаются напрямую, что ускоряет обучение и сокращает затраты на вычислительные ресурсы.
Разработчики заявляют, что их подход совместим с разными нейросетевыми архитектурами. Он особенно полезен для сжатия больших моделей, позволяя запускать их на маломощных устройствах.
Тесты показали, что после обучения малая модель выполняет задачи почти на уровне большой с погрешностью не более 2-3%.
Технологию проверили на нескольких датасетах, включая GPT-подобные модели, и подтвердили её эффективность.
Mostik планирует коммерциализировать разработку в ближайшие месяцы и ведёт переговоры с крупными IT-компаниями о внедрении.