Четырёхбитная квантизация закрепилась как обычный способ запуска
Квантизация начиналась как трюк: ужать веса, чтобы модель хоть как-то поместилась в память. Сегодня четырёхбитные сборки — это первое, что скачивают, и лишь потом при необходимости переходят к более точным вариантам.
Механика проста. Веса хранятся не в шестнадцатибитном формате, а в четырёхбитных группах с отдельными масштабирующими коэффициентами на каждый блок; вычисления при этом разворачиваются обратно в более точный формат на лету. Память экономится в разы, а потери качества оказываются заметно меньше, чем подсказывает интуиция.
Где потери всё же видны
Пользователи отмечают, что сильнее всего сжатие бьёт по длинным цепочкам рассуждений и по коду: там ошибка накапливается от шага к шагу. Короткие ответы, переписывание текста и извлечение данных на четырёх битах держатся почти неотличимо от исходной модели.
Отсюда типичный сценарий: рабочая лошадка живёт в четырёхбитном варианте и обслуживает поток задач, а более точная сборка поднимается отдельно и только на то, где цена ошибки высока. Такое разделение экономит память лучше, чем попытка найти один универсальный компромисс.
Что это значит
Подробности и первичное описание опубликованы на странице «что такое Nano Banana и как он устроен», там же собраны условия доступа и ограничения, о которых заявили разработчики.
Похожие материалы и обновления по теме мы собираем в разделе Открытые модели и локальный запуск — он пополняется по мере выхода новых сообщений.