Требования к охлаждению GPU выросли, когда инференс стал локальным
Облачные провайдеры рассчитывали охлаждение на работу GPU под полной нагрузкой в течение дня, но с перерывами. Когда пользователи запускают большие модели локально и держат их в памяти часами без остановки, температуры поднимаются выше нормы. Стандартный кулер на потребительской видеокарте не справляется.
Проблема усугубилась масштабом: если раньше локальным инференсом занимались энтузиасты с дорогим охлаждением, то теперь это норма для миллионов пользователей ноутбуков и слабых станций. Видеокарты начинают троттлировать на 70–75 градусах, производительность падает в два раза.
Новые стандарты охлаждения
Производители видеокарт начали выпускать версии с улучшенным охлаждением, но цена выросла. NVIDIA добавила в драйверы режим пониженного энергопотребления, когда модель работает медленнее, но в пределах теплового бюджета дешёвого охлаждения.
Открытые проекты вроде llama.cpp экспериментируют с динамическим снижением нагрузки, когда система мониторит температуру и автоматически включает паузы вычислений. Эффект скромный, но помогает избежать краша.
Долгосрочное решение — архитектуры, изначально спроектированные для низкого энергопотребления, и серийное производство видеокарт бюджетной серии с отличным охлаждением. Пока это не произойдёт, локальный инференс останется прерывистым на массовых потребительских устройствах.