Karpathy выложил микромодель на 3 миллиона параметров: она работает
Известный исследователь выпустил микромодель, обученную на стандартном датасете за несколько часов на одном GPU. Несмотря на крошечный размер, модель показывает неожиданно хорошие результаты на тестах понимания смысла и генерации текста.
Качество достигается за счёт осторожного отбора данных для обучения и оптимизации архитектуры под малый размер. Модель легко запускается на процессорах, поэтому интерес к ней велик среди разработчиков embedded-систем.
Значение для локального запуска
Выкладка кода и весов в открытый доступ позволит разработчикам экспериментировать с микромоделями, не требующими облачных вычислений. Это развивает область на пересечении machine learning и edge computing.
Примеры обучения микромоделей от авторитета вроде Карпатского часто становятся стандартом для подражания. Выходит новый инструмент, несколько фреймворков добавляют примеры кода, и через полгода это уже де-факто best practice.
Следующий этап — адаптация микромоделей под конкретные задачи через LoRA и других лёгких адаптеров, что позволит комбинировать малый размер базовой модели с персонализацией.