Исследование выявило связь между разнообразием датасета и переносимостью моделей

Исследователи из нескольких ведущих лабораторий установили прямую зависимость между вариативностью тренировочных данных и способностью моделей переноситься на новые задачи. Анализ охватил более сотни моделей различных архитектур и масштабов.

Выводы свидетельствуют, что датасеты с высоким разнообразием источников, жанров и контекстов ведут к формированию более универсальных представлений, которые эффективнее работают при небольших объёмах fine-tuning.

Практические следствия для разработки

Результаты имеют значение для курирования датасетов и выбора стратегии предварительного обучения. Организации, готовящие модели для применения в различных отраслях, могут оптимизировать инвестиции в сбор данных, фокусируясь на составах, а не на объёме.

Исследование также показало, что разнообразие эффективнее сокращает количество требуемых примеров для адаптации к новому домену на 30–40 процентов по сравнению со специализированными датасетами.

Полные результаты опубликованы в препринте и уже цитируются в работах по трансферному обучению и оптимизации корпусов для обучения.