Исследователи нашли метод обучения моделей в четыре раза быстрее обычного
Метод основан на адаптивной схеме градиентного спуска с динамической настройкой скорости обучения на разных этапах. Исследователи продемонстрировали его эффективность на моделях различной архитектуры и размера.
Ускорение достигнуто за счёт сокращения числа итераций, необходимых для сходимости, при одновременном сохранении показателей точности на тестовых наборах данных. Это означает значительное снижение вычислительных затрат на подготовку моделей.
Последствия для индустрии
Четырёхкратное ускорение обучения существенно снижает стоимость разработки: компаниям требуется меньше времени работы GPU-кластеров и, соответственно, меньше электроэнергии на подготовку моделей.
Ускоренное обучение позволяет чаще обновлять модели под новые данные и быстрее адаптировать их к специфическим задачам, что особенно важно в динамично меняющихся областях.
Результаты исследования уже интегрированы в открытые фреймворки и доступны для использования в исследовательских и промышленных проектах.