Дистилляция GPT-4 в компактную локальную модель: кейс от Anthropic
Процесс дистилляции использовал специальный набор синтетических примеров, где крупная модель разъясняет свой ход решения задачи. Компактный аналог обучался воспроизводить не только ответ, но и логику рассуждений, что улучшило его обобщающие способности.
На практике полученная 8-гигабайтная модель показала результаты близкие к исходной на бенчмарках HumanEval и MMLU, а на задачах рассуждения отставала на 5–8 процентов. Для большинства production-сценариев это приемлемо.
Значение для Open Source
Методика открывает путь для компаний и стартапов: взять сильную замкнутую модель как учителя и получить свою компактную версию под свои нужды. Лицензия дистиллята остаётся в руках создателей.
Это нарушает прежний статус-кво, где крупные закрытые модели казались недостижимы для локального запуска. Теперь вопрос в качестве данных для дистилляции, а не в невозможности самого процесса.
Другие лаборатории уже воспроизводят подход на своих моделях, что прогнозирует волну компактных дистиллятов в следующие месяцы.