Распространенную проблему видео-генерации — некорректную передачу скорости и динамики происходящего в ролике — удалось решить команде Kandinskу. Исследователи разработали Time Adapter — надстройку к генеративным моделям, управляющую динамикой событий и частотой кадров в ролике, сообщила пресс-служба Сбера.
Обучающий датасет, как рассказали в компании, состоял из 40 тыс. видео с разной частотой и динамикой. В процессе обучения модель учили отличать реальную скорость действия от скорости действия в видео с измененной динамикой.
В результате создан модуль из двух независимых блоков, занимающий меньше 1% от размера основной модели, можно подключить к готовой нейросети. Далее один блок берет на себя управление частотой кадров, другой — динамику происходящего в каждый момент сцены.
Отмечается, что у модуля два режима использования. В первом адаптер обучается и далее подключается к предварительно обученной модели генерации видео. Во втором ИИ учится совместно с адаптером, что позволяет генерировать физические процессы, которые базовой моделью создавать не удавалось.
В компании отметили, что дообученная с адаптером модель Kandinsky 5.0 Video Lite превзошла обычную версию при тестировании на наборе динамичных видео с людьми и природой сразу по нескольким показателям. В частности, естественность движения возросла на 29%.
«Раньше скорость происходящего в кадре задавали только слова в промпте, повлиять на реальную динамику в создаваемом видео было сложно. С помощью Time Adapter модель понимает, как процессы разворачиваются во времени, и умеет естественно задавать нужный ритм в любой сцене, а не заучивает готовые шаблоны. Это ключевое условие для обучения физического ИИ и будущих моделей мира», — отметил CTO Kandinsky, управляющий директор по исследованию данных Сбера Денис Димитров.
Уточняется, что код доступен разработчикам бесплатно под открытой лицензией MIT.
Кроме того, о подходе создана научная статья, она была представлена на ведущей конференции по машинному обучению ICML.