Долгие видео без потери смысла: как Sora генерирует 30-минутные ролики

Генерация 30-минутного видео требует новой архитектуры обработки временных последовательностей, где каждый кадр должен логически следовать из предыдущих, сохраняя сюжетную линию и визуальное единство. Раньше видеомодели теряли контекст уже на 10-15 минутах, приводя к несогласованности и разрывам в повествовании.

Решение заключается в иерархическом подходе к кодированию видеопотока, где модель работает одновременно с локальным контекстом отдельных сцен и глобальным контекстом всего видео. Это позволяет ей отслеживать как мелкие детали, так и общую дугу сюжета.

Техника многоуровневой памяти

Нейросеть использует разные уровни абстракции: на одном слое отслеживаются движения камеры и персонажей в текущей сцене, на другом — информация о месте действия, установленном сюжете и характерах действующих лиц. При переходе к новым кадрам эта информация пересчитывается и уточняется.

Практический результат — видео, в котором персонажи последовательно развивают сюжет, окружающая среда остаётся узнаваемой, и слушатель может следить за развитием событий без ощущения фрагментарности.

Такие длинные видео открывают путь к генерации полноценных фильмов и образовательного контента, где важна временная линейность и логическая связанность.