Стартап повысил скорость инференса ChatGPT-5 благодаря инновационной архитектуре

Стартап, работающий в области оптимизации больших языковых моделей, представил результаты испытаний ускоренной версии ChatGPT-5. Инновационная архитектура позволила повысить пропускную способность инференса на 40% без снижения качества генерируемого текста.

Основное улучшение достигнуто за счет переструктурирования трансформер-слоев и внедрения адаптивного кэширования активаций. Авторы решения предложили новую схему распределения вычислений между процессорами и графическими ускорителями.

Практическое применение

По данным компании, оптимизация позволяет обрабатывать на 30% больше запросов на одном сервере при том же энергопотреблении. Стартап уже получил интерес от крупных облачных провайдеров.

Метод может быть адаптирован для других моделей семейства GPT без переобучения исходной архитектуры. Исследователи планируют опубликовать детальное описание подхода в ближайшем квартале.

Результаты демонстрируют, что потенциал оптимизации инференса далеко не исчерпан, и дальнейшее снижение латенции возможно за счет изменения организации вычислений, а не только увеличения вычислительных ресурсов.