Редактирование картинки словами вытесняет ручную работу с масками
Ещё пару лет назад изменить деталь в готовом изображении означало нарисовать маску: обвести область, задать растушёвку, подобрать описание. Сейчас всё чаще достаточно фразы вида «сделай куртку кожаной» — модель сама находит объект и перерисовывает только его.
Внутри это два разных механизма, работающих последовательно. Сначала текстовое описание сопоставляется с областями изображения, фактически строится маска автоматически. Затем на эту область накладывается обычная генерация с условием на окружающий контекст, чтобы стык не бросался в глаза.
Где схема даёт сбой
Слабое звено — именно первый шаг. Если в кадре два похожих объекта, модель регулярно выбирает не тот, а при описании через отношения — «стакан слева от тарелки» — путается в пространстве. Пользователи отмечают, что чем абстрактнее правка, тем выше шанс, что изменится вся сцена вместо одной детали.
Второе типичное расхождение — незаметный дрейф остального кадра. Формально редактируется одна область, но перекодирование изображения слегка меняет цвет и зернистость по всей площади, и после пяти-шести правок подряд картинка ощутимо уезжает от оригинала.
Поэтому интерфейсы возвращают ручную маску как дополнительный, а не основной инструмент: описание задаёт что делать, маска ограничивает где. Такое сочетание пока даёт самый предсказуемый результат.
Что это значит
Подробности и первичное описание опубликованы на странице подборка альтернатив Nano Banana, там же собраны условия доступа и ограничения, о которых заявили разработчики.
Похожие материалы и обновления по теме мы собираем в разделе Нейросети для генерации изображений — он пополняется по мере выхода новых сообщений.