Fallback к маленькой модели гарантирует ответ даже когда большая отказывает
Большая модель даёт лучшие ответы, но требует больше памяти. Когда пользователь отправляет очень длинный контекст или машина загружена другими процессами, большая модель может отказать: либо зависнет, либо выдаст ошибку. Маленькая модель на той же машине часто справится на том же контексте, просто чуть хуже.
Идея fallback'а простая: попробовать большую модель, если не поместилась или зависла, переключиться на маленькую. Пользователь получит ответ и в 90% случаев его устроит. На облаке такого механизма нет — либо ответил, либо timeout'нулся, третьего не дано.
Надёжность вместо идеала
Разработчики локальных систем начинают строить иерархии моделей: если задача простая, срабатывает маленькая. Если вроде бы сложная, но рутинная, нужна средняя. Только на сложные рассуждения запускают большую. Это позволяет обрабатывать в 5 раз больше запросов на той же машине.
Для этого нужны веса маленькой модели всегда в памяти, чтобы быстро переключиться. Это не много памяти — 3 миллиарда параметров в четырёхбитном формате это примерно гигабайт. Но это требует предусмотрения архитектуры и отладки сценариев.
На локальной машине надёжность и экономность важнее, чем максимальное качество на каждый запрос.