Новое поколение чипов для инференса обещает вдвое ускорить обработку запросов

Новые чипы разработаны с учётом особенностей инференса больших языковых моделей и оптимизированы для батарейной обработки токенов. Архитектура позволяет увеличить пропускную способность памяти и снизить задержку при работе с контекстом, что особенно критично для длинных промптов.

По предварительным тестам производителя, новое поколение обеспечивает ускорение вдвое по сравнению с текущим поколением при работе с моделями размером от 70 миллиардов параметров. Энергопотребление при этом снизилось на 30 процентов.

Внедрение в облачные сервисы

Облачные провайдеры уже объявили о планах интеграции новых чипов в свои дата-центры. Это позволит улучшить экономику запросов и снизить стоимость обслуживания.

Первые системы на базе новых процессоров поступят в production на четвёртом квартале этого года. Для критичных приложений с высокой нагрузкой это может означать переход на более крупные модели при сохранении текущего времени отклика.

Разработчики уже выражают интерес к интеграции: новые возможности откроют путь для более сложных многошаговых рассуждений и обработки более объёмных данных в едином запросе.