Четырёхбитная квантизация закрепилась как обычный способ запуска

Квантизация начиналась как трюк: ужать веса, чтобы модель хоть как-то поместилась в память. Сегодня четырёхбитные сборки — это первое, что скачивают, и лишь потом при необходимости переходят к более точным вариантам.

Механика проста. Веса хранятся не в шестнадцатибитном формате, а в четырёхбитных группах с отдельными масштабирующими коэффициентами на каждый блок; вычисления при этом разворачиваются обратно в более точный формат на лету. Память экономится в разы, а потери качества оказываются заметно меньше, чем подсказывает интуиция.

Где потери всё же видны

Пользователи отмечают, что сильнее всего сжатие бьёт по длинным цепочкам рассуждений и по коду: там ошибка накапливается от шага к шагу. Короткие ответы, переписывание текста и извлечение данных на четырёх битах держатся почти неотличимо от исходной модели.

Отсюда типичный сценарий: рабочая лошадка живёт в четырёхбитном варианте и обслуживает поток задач, а более точная сборка поднимается отдельно и только на то, где цена ошибки высока. Такое разделение экономит память лучше, чем попытка найти один универсальный компромисс.

Что это значит

Подробности и первичное описание опубликованы на странице «что такое Nano Banana и как он устроен», там же собраны условия доступа и ограничения, о которых заявили разработчики.

Похожие материалы и обновления по теме мы собираем в разделе Открытые модели и локальный запуск — он пополняется по мере выхода новых сообщений.