Инженеры Google предложили способ сжимать большие модели без потери точности
Группа инженеров Google представила новый подход к сжатию больших языковых моделей. Метод, основанный на адаптивной квантизации весов, достигает сокращения размера модели на 60—75 процентов при сохранении качества выходных данных на уровне 95 процентов от исходного.
Ключевое преимущество подхода — применение дифференцированной точности для разных слоёв нейросети. Критические слои сохраняют полную разрядность, а вспомогательные компоненты переводятся в низкоразрядное представление.
Практическое применение
Сжатые модели легче развёртывать на мобильных устройствах и в периферийных вычислительных средах, где память и вычислительная мощность ограничены. Это снижает требования к аппаратной части и ускоряет инференс.
Google опубликовала исследование с полным описанием метода и выложила код в открытый доступ. Инженеры из других компаний уже начинают адаптировать подход для своих моделей.
Разработка свидетельствует о растущем интересе индустрии к оптимизации больших моделей и демократизации доступа к ним за счёт уменьшения требований к ресурсам.