Исследование показало, что дообучение более эффективно, чем увеличение данных
Команда исследователей провела сравнительный анализ двух подходов к улучшению производительности языковых моделей: увеличение объёма тренировочных данных и целевое дообучение на специализированном датасете. Результаты показали, что дообучение на качественных данных даёт лучший выигрыш, чем простое расширение датасета в несколько раз.
Исследование охватило задачи от медицинского текстопроизводства до финансового анализа. В среднем дообучение на 10 тысячах высококачественных примеров превосходило увеличение основного датасета на 100 тысяч случайных примеров по точности и релевантности.
Практические следствия
Результаты поддерживают тренд в отрасли к переходу от погони за масштабом к инвестициям в качество данных и методологию дообучения. Это снижает барьер входа для организаций, которые не могут собрать петабайты текста, но имеют доступ к качественным доменным данным.
Авторы также выявили, что эффективность дообучения значительно растёт при использовании современных техник, таких как инструкция-тюнинг и адаптация на основе обратной связи. Комбинация этих методов показала синергию, которая не была предсказана предыдущими исследованиями.
Вывод представляет интерес для стартапов и корпораций, планирующих быстро адаптировать модели к своим задачам с ограниченным бюджетом на сбор данных.