Дистилляция превращает большую модель в компактную рабочую
Между «взять готовую компактную модель» и «дообучить её под себя» есть третий путь: обучить маленькую модель повторять поведение большой на интересующем классе задач. Приём давно известен, но именно сейчас стал массовым.
Логика в том, что большая модель выступает разметчиком. Она генерирует ответы на десятки тысяч запросов из нужной области, а компактная учится их воспроизводить, унаследовав стиль и способ рассуждения, но не размер.
Границы приёма
Дистилляция хорошо переносит навык и плохо переносит знания. Компактная модель научится отвечать в нужной форме, но не вместит всё, что помнила исходная, поэтому на фактических вопросах разрыв остаётся заметным.
Есть и юридическая сторона: условия использования многих закрытых моделей прямо запрещают обучение на их выводе. Для открытых весов такого ограничения обычно нет, и это ещё одна причина, по которой дистилляцию всё чаще строят именно на них.
Что это значит
Подробности и первичное описание опубликованы на странице слова, которые двигают объект в кадре, там же собраны условия доступа и ограничения, о которых заявили разработчики.
Похожие материалы и обновления по теме мы собираем в разделе «Инструменты для разработчиков» — он пополняется по мере выхода новых сообщений.