Повышена скорость ответов на 25 процентов благодаря оптимизации
OpenAI провела комплексную оптимизацию вычислительного конвейера ChatGPT и добилась снижения латентности на 25 процентов. Ускорение достигнуто за счёт переструктуризации кэширования, параллелизации обработки токенов и изменения управления ресурсами серверов.
Улучшение касается как веб-интерфейса, так и API для разработчиков. Пользователи теперь получают ответы быстрее на всех типах запросов, от коротких уточнений до развёрнутых аналитических текстов.
Технические детали
Компания модифицировала архитектуру обслуживания пиковых нагрузок, введя более гибкое распределение запросов между кластерами. Кроме того, улучшена работа с повторными запросами через предварительное кэширование.
Ускорение заметно при работе с длинными контекстами и сложными задачами, где раньше была наибольшая задержка.
OpenAI продолжает работу над оптимизацией и обещает дальнейшее повышение скорости в последующих обновлениях без ущерба качеству генерации.