Когда меньше слоёв лучше чем меньше размер: архитектура против масштаба

Длительное время разработчики оптимизировали модели в одну сторону: уменьшали количество параметров, сохраняя глубину архитектуры. Результат предсказуем — сеть деградирует, теряя способность моделировать сложные зависимости. Но оказалось, что направление неправильное.

Новые эксперименты показали: сеть с 3 миллиардами параметров и 100 слоями качественнее работает, чем сеть с 7 миллиардами и 30 слоями. Парадокс объясняется тем, как информация распространяется сквозь слои. Глубокая сеть пропускает знание через больше трансформаций, каждая из которых добавляет нюаносности.

Скорость против качества

На инференс это влияет противоречиво. Глубокую сеть медленнее вычислять — для 100 слоёв нужно 100 проходов. Но качество ответов выше, что может сэкономить токены: модель будет точнее и потребует меньше переделок и уточнений в диалоге.

Выбор между скоростью и точностью остаётся за разработчиком приложения. Для чатов, где пользователь готов ждать — глубокая узкая сеть. Для потоковой генерации текста, где задержка критична — скорость важнее.

Вывод влияет на дизайн открытых моделей: появляется новая категория моделей среднего размера, которые жертвуют шириной слоёв ради глубины и получают качество, близкое к моделям вдвое большего размера.