Инженерам надоел CUDA: TRITON упростил локальный инференс на любом GPU
TRITON позволяет писать оптимизированные ядра инференса на высокоуровневом языке вместо низкоуровневого CUDA, автоматически адаптируя код под архитектуру GPU. Это упрощает настройку производительности и снижает порог входа для инженеров, которые готовы сами оптимизировать вычисления, но не хотят разбираться в деталях видеоархитектур.
Раньше локальный запуск открытых моделей требовал либо готовых оптимизаций для конкретного железа, либо письма низкоуровневого кода. TRITON позволяет разработчикам быстрее переносить модели между GPU разных производителей без переписывания оптимизирующего слоя.
Перенос на новое железо за часы вместо дней
В сообществе уже появились готовые TRITON-ядра для популярных операций: attention, quantization, свёртки. Это означает, что команда может локально запустить крупную модель и получить приемлемую задержку за счёт встраиваемых оптимизаций, не владея специализированными знаниями по CUDA.
TRITON становится промежуточным слоем между абстракциями высокого уровня и кремниевыми особенностями конкретного GPU. Для локального инференса это значит, что выбор видеокарты теперь влияет на скорость, но не на само́ писание оптимизаций.
Ожидается, что со временем TRITON-ядра начнут включаться в сами́ инферных движки, подобно тому как PyTorch встраивает cuDNN. Это позволит разработчикам фокусироваться на бизнес-логике вместо боёв с оптимизацией.