Исследователи обнаружили способ обучать модели на 70 процентов дешевле
Группа исследователей опубликовала работу о методе снижения стоимости обучения больших языковых моделей на 70 процентов. Подход основан на улучшенной дистилляции знаний с использованием синтетических данных и селективного обучения.
Вместо полного обучения модели с нуля авторы предлагают сначала получить от крупной модели набор синтетических примеров высокого качества, а затем обучать меньшую модель на смешанных реальных и синтетических данных. Это позволяет избежать избыточных вычислений и сосредоточиться на релевантных сценариях.
Результаты тестирования
Модели, обученные таким способом, показывают качество на уровне 95-98 процентов от исходной крупной модели при четырехкратном снижении параметров. Экономия достигается как за счет уменьшения размера модели, так и за счет сокращения объема данных для обучения.
Исследование проверено на нескольких задачах классификации, суммаризации и вопросно-ответного взаимодействия. Результаты согласованы и воспроизводимы на разных наборах данных.
Открытие актуально для компаний и исследовательских центров, которые хотят развивать собственные модели, но ограничены бюджетом на вычислительные ресурсы.