Tokenizer для закрытой модели опубликовали отдельно: как запустить её локально
Опубликованный tokenizer содержит полный словарь и правила расщепления текста, которые используются закрытой моделью. Этого достаточно, чтобы подготовить входные промпты и обработать выход, не обращаясь к серверам разработчика.
Для локального запуска пользователь может взять quantized версию модели из Hugging Face, загрузить tokenizer из репозитория авторов и запустить inference на CPU или видеокарте среднего уровня. Скорость генерации упадёт, но приватность повысится.
Ограничения и возможности
Токенизатор сам по себе не раскрывает архитектуру модели, только её linguistic processing. Полную картину даёт разве что reverse-engineering весов через их анализ, но для базового использования этого не требуется.
Такой подход популярен среди компаний, которые хотят оставить модель закрытой ради конкурентного преимущества, но при этом дать пользователям возможность не зависеть от интернета и не передавать данные на сервер.
Сейчас несколько крупных лабораторий следуют этой схеме: публикуют tokenizer отдельно, чтобы экосистема могла создавать tools и интеграции на основе открытого стандарта.