Исследователи обнаружили способ обучать модели на 70 процентов дешевле

Группа исследователей опубликовала работу о методе снижения стоимости обучения больших языковых моделей на 70 процентов. Подход основан на улучшенной дистилляции знаний с использованием синтетических данных и селективного обучения.

Вместо полного обучения модели с нуля авторы предлагают сначала получить от крупной модели набор синтетических примеров высокого качества, а затем обучать меньшую модель на смешанных реальных и синтетических данных. Это позволяет избежать избыточных вычислений и сосредоточиться на релевантных сценариях.

Результаты тестирования

Модели, обученные таким способом, показывают качество на уровне 95-98 процентов от исходной крупной модели при четырехкратном снижении параметров. Экономия достигается как за счет уменьшения размера модели, так и за счет сокращения объема данных для обучения.

Исследование проверено на нескольких задачах классификации, суммаризации и вопросно-ответного взаимодействия. Результаты согласованы и воспроизводимы на разных наборах данных.

Открытие актуально для компаний и исследовательских центров, которые хотят развивать собственные модели, но ограничены бюджетом на вычислительные ресурсы.