Сбербанк научил нейросети учитывать время в генерации видео
Команда Kandinsky создала адаптер, который помогает нейросетям корректно передавать динамику событий в видео.
Команда Kandinsky из Сбербанка разработала Time Adapter — компактную надстройку для генеративных моделей. Она позволяет нейросетям учитывать течение времени при создании видео. Раньше модели просто комбинировали кадры без понимания временной логики. Теперь они могут управлять динамикой событий, например показывать, как медленно распускается цветок или быстро бьется крыло колибри.
Time Adapter весит 75 МБ и работает с любыми видео моделями. Для обучения потребовалось 10 000 видеопар — в 100 раз меньше, чем у аналогов. Технология повысила стабильность генерации на 30%.
Система анализирует временные паттерны и распределяет внимание модели между кадрами. Это снижает количество артефактов, таких как внезапное исчезновение объектов или скачкообразное движение. В тестах Time Adapter корректно передал динамику в 85% случаев против 52% у базовых моделей.
Разработчики открыли код и шаблоны для интеграции с популярными фреймворками. Первые эксперименты показали, что адаптер ускоряет обучение новых моделей в четыре раза.
Технологию можно применять в кинематографии, медицинской визуализации и других областях. В Сбербанке ее уже тестируют для создания обучающих роликов и симуляций.