Нейросеть научилась генерировать видео с множественными персонажами
Исследовательская группа преодолела ограничение предыдущих видеогенераторов, которые деградировали при попытке синтезировать несколько интерактивных персонажей одновременно. Новая версия модели использует многоагентное представление сцены, где каждый персонаж описывается независимой траекторией, а их взаимодействие регулируется контроллером на уровне композиции.
Система корректно обрабатывает перекрытия персонажей, тени, отражения и вторичное движение. Пользователь может описать диалог или совместное действие в текстовом промпте, и модель сама согласует движения обеих фигур.
Применение в сценариях
Мультиперсонажная генерация открывает возможность создания диалоговых видео, драматических сцен и групповых интервью без привлечения актёров. Сценарист пишет диалог и описание действия, а модель берёт на себя визуальную реализацию.
Первые тесты показали приемлемое качество для видеомарок, презентаций и обучающего контента. Для высокобюджетной кинопродукции требуется дополнительная полировка через видеоредакторы, но базовая работа выполняется автоматически.
Модель поддерживает до 5 персонажей в кадре с контролем позиций и ориентации каждого. Разработчики работают над расширением числа одновременных фигур и добавлением поддержки животных и фантастических существ.