Запуск quantized моделей через WebGPU: новое в браузерах

WebGPU — это низкоуровневый API для работы с графическими процессорами из браузера. До недавнего времени браузеры могли использовать GPU только через WebGL, который был ориентирован на графику. WebGPU предоставляет прямой доступ к вычислительным возможностям видеокарты, что открыло дорогу инфернесу моделей машинного обучения на клиентской стороне.

Quantized модели — с весами в формате int4 или int8 — идеально подходят для браузерного запуска. Модель размером 7 миллиардов параметров, quantized до int4, занимает около 3–4 гигабайт, что позволяет загрузить её в браузер и работать с ней локально. Скорость инференса через WebGPU приближается к настольным приложениям благодаря прямому доступу к железу.

Практические применения

Браузерные LLM снимают нагрузку с серверов, улучшают приватность (данные не уходят в облако) и снижают задержку. Компании вроде Together AI и Hugging Face создали первые playground-приложения на WebGPU, где пользователи запускают модели прямо на своём устройстве. Поддержка WebGPU есть уже в Chrome, а Firefox и Safari подходят к выпуску.

Ограничение пока в доступности: сильные видеокарты нужны не всем пользователям, а на мобильных устройствах WebGPU работает медленнее, чем на десктопах. Тем не менее, это открывает дорогу персональным AI-помощникам, которые работают без интернета.

WebGPU — часть более широкого тренда: индустрия движется к edge-инфернесу, когда вычисления происходят на устройстве, а не на удалённом сервере. Браузер становится платформой для запуска приватных, быстрых и экономных моделей машинного обучения.