Новое поколение чипов для инференса обещает вдвое ускорить обработку запросов
Новые чипы разработаны с учётом особенностей инференса больших языковых моделей и оптимизированы для батарейной обработки токенов. Архитектура позволяет увеличить пропускную способность памяти и снизить задержку при работе с контекстом, что особенно критично для длинных промптов.
По предварительным тестам производителя, новое поколение обеспечивает ускорение вдвое по сравнению с текущим поколением при работе с моделями размером от 70 миллиардов параметров. Энергопотребление при этом снизилось на 30 процентов.
Внедрение в облачные сервисы
Облачные провайдеры уже объявили о планах интеграции новых чипов в свои дата-центры. Это позволит улучшить экономику запросов и снизить стоимость обслуживания.
Первые системы на базе новых процессоров поступят в production на четвёртом квартале этого года. Для критичных приложений с высокой нагрузкой это может означать переход на более крупные модели при сохранении текущего времени отклика.
Разработчики уже выражают интерес к интеграции: новые возможности откроют путь для более сложных многошаговых рассуждений и обработки более объёмных данных в едином запросе.