Nvidia представила новый чип специально для инференса языковых моделей
Nvidia объявила о выпуске нового чипа, разработанного для снижения времени отклика и повышения пропускной способности при работе с языковыми моделями в режиме инференса. Архитектура оптимизирована под специфические вычислительные паттерны трансформеров, включая операции внимания и линейные преобразования.
Новый чип предназначен для облачных датацентров и корпоративных развёртываний, где требуется обслуживание большого количества одновременных запросов от пользователей. Тесты показывают снижение задержки в 40-60 процентов по сравнению с предыдущим поколением архитектур Nvidia для этого сегмента.
Экономическая эффективность
Улучшенная энергоэффективность позволяет снизить операционные расходы на охлаждение и электроэнергию в центрах обработки данных. Производитель заявляет о совместимости с популярными фреймворками машинного обучения без необходимости изменения кода приложений.
Новый чип ориентирован на провайдеров облачных услуг и компаний, развёртывающих собственные сервисы на базе больших языковых моделей. Стоимость и сроки поставки ещё уточняются.
Выпуск чипа продолжает стратегию Nvidia по доминированию в сегменте инфраструктуры для вывода моделей ИИ и отражает растущий спрос на оптимизированные аппаратные решения.