Движок ускорения по ОС: Linux требует CUDA, macOS требует Metal
Вес открытой модели — это просто набор чисел. Но запустить эти числа через вычисления может только движок, который умеет говорить с железом. На Linux это CUDA для Nvidia, на Windows тоже CUDA, но установка сложнее, на Mac это Metal Performance Shaders. Каждая пара система-железо требует своего движка.
Появилась мода на универсальные рефреймворки, которые якобы работают везде. На практике они либо работают медленно, либо требуют, чтобы ты вручную выбрал правильную подсистему ускорения. Хитрость в том, что ускорители не взаимозаменяемы — ROCm на Nvidia даст медленность, CUDA на AMD не запустится вообще.
Экосистема важнее универсальности
Разработчики открытых инструментов узнали, что кроссплатформенность стоит дорого. Проще поддерживать CUDA хорошо, чем CUDA, ROCm и Metal плохо. Часть команд именно так и поступила: выбрали главную платформу и там сделали всё хорошо.
На практике это означает, что пользователь начинает с выбора: у меня Linux с Nvidia? Беру CUDA-версию. Mac? Жду, пока сделают Metal-поддержку, а пока через CPU. AMD? Ждём ROCm. Это не значит, что универсального решения нет, но оно всегда медленнее специализированного.
Локальный запуск требует знать свою систему до деталей: не только какая карта, но и какой операционной системы версия, какой драйвер, какой Python. Это цена независимости от облака.