Исследование выявило связь между разнообразием датасета и переносимостью моделей
Исследователи из нескольких ведущих лабораторий установили прямую зависимость между вариативностью тренировочных данных и способностью моделей переноситься на новые задачи. Анализ охватил более сотни моделей различных архитектур и масштабов.
Выводы свидетельствуют, что датасеты с высоким разнообразием источников, жанров и контекстов ведут к формированию более универсальных представлений, которые эффективнее работают при небольших объёмах fine-tuning.
Практические следствия для разработки
Результаты имеют значение для курирования датасетов и выбора стратегии предварительного обучения. Организации, готовящие модели для применения в различных отраслях, могут оптимизировать инвестиции в сбор данных, фокусируясь на составах, а не на объёме.
Исследование также показало, что разнообразие эффективнее сокращает количество требуемых примеров для адаптации к новому домену на 30–40 процентов по сравнению со специализированными датасетами.
Полные результаты опубликованы в препринте и уже цитируются в работах по трансферному обучению и оптимизации корпусов для обучения.