Локальный запуск мултимодальной модели: требования к VRAM упали в три раза

Мультимодальные модели, которые обрабатывают текст, изображения и видео одновременно, долго считались привилегией серверов из-за огромного потребления памяти. Архитектурные улучшения позволили сократить этот разрыв: модель с 27 миллиардами параметров теперь влезает в 8 ГБ VRAM.

Разработчики добились этого за счёт компрессии кэша активаций при обработке видеопотока, переупорядочения операций в кодере изображений и использования низкоранговых адаптеров вместо полного пересчёта весов. Качество ответов не пострадало.

Практический результат

На RTX 4070 или RTX 4080 можно теперь обрабатывать видеоролики 30 секунд и давать описания, отвечать на вопросы о содержимом. Раньше это требовало H100 или мощный кластер.

Локальный вариант мультимодальной модели открывает возможность для небольших компаний встроить видео-анализ в свой сервис без облачных платёжных интеграций. Приватность данных остаётся на стороне клиента.

Несколько компаний уже предлагают готовые приложения с такими моделями: видео-аннотация, автотитры, анализ совещаний. Спрос растёт, а стоимость оборудования падает.