Дистилляция GPT-4 в компактную локальную модель: кейс от Anthropic

Процесс дистилляции использовал специальный набор синтетических примеров, где крупная модель разъясняет свой ход решения задачи. Компактный аналог обучался воспроизводить не только ответ, но и логику рассуждений, что улучшило его обобщающие способности.

На практике полученная 8-гигабайтная модель показала результаты близкие к исходной на бенчмарках HumanEval и MMLU, а на задачах рассуждения отставала на 5–8 процентов. Для большинства production-сценариев это приемлемо.

Значение для Open Source

Методика открывает путь для компаний и стартапов: взять сильную замкнутую модель как учителя и получить свою компактную версию под свои нужды. Лицензия дистиллята остаётся в руках создателей.

Это нарушает прежний статус-кво, где крупные закрытые модели казались недостижимы для локального запуска. Теперь вопрос в качестве данных для дистилляции, а не в невозможности самого процесса.

Другие лаборатории уже воспроизводят подход на своих моделях, что прогнозирует волну компактных дистиллятов в следующие месяцы.