CPU-инференс: медленнее сотни раз, но работает везде без ограничений
Локальная модель на GPU даёт ответ за доли секунды. Та же модель на CPU даёт ответ за минуту. Казалось бы, выбор очевиден, но это не всегда верно. На CPU нет требований к видеопамяти — можно запустить модель в 13 миллиардов параметров на обычном ноутбуке с 16 гигабайтами оперативки.
CPU-инференс — это запасной вариант, когда GPU не подходит: старая машина, ноутбук другого производителя, облачный сервер без GPU. Тот же процесс работает везде, но сроки растягиваются. Для интерактивного использования это маета, но для ночных прогонов или локального прототипирования сойдёт.
Компромисс в отсутствие выбора
Разработчики открытых фреймворков добавили CPU-поддержку не потому, что это быстро, а потому что это должно работать везде. На практике пользователи редко выбирают CPU намеренно, но иногда оказываются в ситуации, когда это единственный вариант.
Новые процессоры лучше справляются с векторными операциями, нужными модели. Intel добавил специальные команды, AMD делает то же самое, Apple дала GPU в каждый чип. CPU инференс медленный, но становится менее дико медленным.
На локальной машине CPU-инференс — это не цель, а подстраховка. Цель — GPU, но когда GPU нет, эта подстраховка работает.