Большие модели перестали улучшаться при простом увеличении данных
Ведущие лаборатории фиксируют эффект плато в улучшении производительности больших языковых моделей при добавлении новых текстовых данных в тренировочный набор. За первые два года развития больших моделей каждое удвоение объёма данных давало заметный прирост качества, но сейчас этот эффект резко ослабел или исчез полностью.
Проблема заключается в том, что датасеты достигли пределов плотности полезной информации: наиболее информативные тексты уже включены в тренировку, а добавление оставшихся не компенсирует затраты вычислительных ресурсов. Исследователи предполагают, что существует объективный верхний предел качества при фиксированной архитектуре модели.
Поворот в методологии
Вместо расширения датасетов компании начинают экспериментировать с синтетическими данными, генерируемыми самими моделями, и с более тонкой очисткой текстов перед обучением. Другое направление — переход от масштабирования размера модели к оптимизации процесса обучения и применению специализированных архитектур.
Выявленное плато стимулирует интерес к альтернативным подходам, включая обучение с подкреплением, мультимодальные модели и системы с долгосрочной памятью. Таким образом, следующий этап развития ИИ может быть определён не объёмом данных, а качеством инженерных решений.
Некоторые аналитики видят в этом переходе точку зрелости: индустрия переходит от гонки размеров к рациональному проектированию систем с заданными характеристиками.