Требования к памяти упали, когда появился инференс-оптимизированный формат
Специализированный формат для инференса переупаковывает веса модели так, чтобы минимизировать обращения к медленной памяти и уменьшить размер, необходимый для загрузки. Компрессия работает за счёт переупорядочивания данных и избирательного квантизирования слоёв, нечувствительных к потере точности.
На практике пользователи видят, что модели, требовавшие 24 ГБ GPU, теперь помещаются в 16 ГБ. Это расширяет доступность к локальному запуску на потребительских картах и небольших серверах.
Повседневный эффект
Формат поддерживают основные фреймворки — пересборка кода минимальна. Команды уже перемигрируют на него постепенно, нестоп заменяя чекпойнты по мере публикации оптимизированных версий.
Побочный результат: инференс становится практичнее для мобильных и встроенных систем, где память всегда критична.
Тренд укрепляет позицию открытых моделей против замкнутых API, так как стоимость локального запуска продолжает падать.