Phi-3.5 требует всего 4 Гб памяти и бьёт GPT-3.5 по скорости

Phi-3.5 — компактная модель от Microsoft, обученная на высококачественных данных и синтетических примерах. По тестам на бенчмарках MMLU и GSM8K она показывает результаты на уровне GPT-3.5, но занимает в памяти в десятки раз меньше места.

Модель поддерживает контекстное окно в 128K токенов и работает на мобильных устройствах, маломощных серверах и даже ноутбуках с интегрированной графикой. Задержка вывода первого токена составляет 50-100 миллисекунд.

Целевой сценарий использования

Phi-3.5 рассчитана на edge-сценарии: локальный ассистент в приложении, обработка данных без отправки на облако, встраивание в IoT-устройства. Лицензия разрешает коммерческое использование при соблюдении условий.

Открытые веса доступны на Hugging Face с поддержкой ONNX Runtime, что обеспечивает оптимизацию под разные платформы. Время вывода ответа на типовой запрос укладывается в полсекунды.

Появление конкурентных моделей такого размера сужает рынок облачных API для простых задач и подталкивает разработчиков к локальному запуску, особенно для приватных данных и задач с жёсткими требованиями к задержке.