
Нейросеть научили чувствовать время
Представьте, что вы пишете нейросети промпт «человек наливает кофе в чашку». Кадр получается красивым — идеальное освещение, реалистичная чашка, капли застыли в воздухе как на обложке журнала. Но стоит запустить видео, и магия рассыпается. Вода вылетает из чайника рывками, чашка дёргается, а рука будто проходит сквозь ручку. Знакомая картина? Именно так ведёт себя большинство генеративных моделей, когда дело доходит до движения. Они блестяще рисуют каждый отдельный кадр, но между кадрами время словно исчезает, потому что для ИИ нет разницы, длится действие секунду или минуту.
Команда Kandinsky подошла к проблеме с неожиданной стороны. Вместо того чтобы переучивать всю модель заново, они создали Time Adapter — маленькую надстройку, которая встраивается в готовую нейросеть и подсказывает ей, как выстраивать ритм. Внутри адаптера два независимых механизма. Один управляет частотой кадров — то есть технической плавностью. Второй отвечает за динамику событий — то есть за то, в какой момент и с какой скоростью происходит действие в сцене. Эти два рычага можно настраивать раздельно. Например, можно оставить ролик плавным, 60 кадров в секунду, но при этом замедлить взмах руки персонажа, чтобы жест выглядел осмысленным, а не как быстрая перемотка.
Надстройку тренировали на 40 тысячах видеороликов с разной динамикой. В датасет вошли и быстрый спорт (бег, танцы, удары) и медленные природные процессы (волны, движение облаков, дождь, туман). Система сравнивала оригинальные видео с теми же сценами, но с изменённым темпом — так она выучивала, как именно должна выглядеть естественная динамика.
На модели Kandinsky 5.0 Video Lite после дообучения с адаптером естественность движений выросла на 29%, визуальное качество — на 8%, а соответствие текстовому запросу — на 19%. При этом надстройка занимает меньше процента от размера основной модели — то есть её можно подключить, не раздувая требования к вычислениям.
У адаптера есть два режима работы. Первый, когда он подключается к уже обученной модели и движения в кадря становятся более плавными, но характер генерации не меняется. Второй — совместное дообучение, когда адаптер и модель учатся вместе. В этом режиме нейросеть начинает лучше понимать физику: как ткань ведёт себя на ветру, как жидкость растекается по поверхности или как распускается цветок. Это открывает дорогу к генерации сцен, с которыми базовые модели раньше просто не справлялись.
Код модуля опубликован в открытом доступе на Hugging Face под лицензией MIT, которая допускает коммерческое использование. Научная статья была представлена на конференции ICML — одной из ключевых площадок по машинному обучению.