SafeTensors скорость загрузки выше ONNX в два раза: новый стандарт Hugging Face
SafeTensors использует линейное расположение данных в памяти и минимизирует парсинг метаданных, что позволяет загружать многогигабайтные модели быстрее. ONNX требует больше операций десериализации и проверки integrity каждого слоя.
Hugging Face рекомендует SafeTensors как стандарт для новых моделей в своём hub, и большинство авторов уже перестраивают чекпойнты на этот формат. Старые ONNX-файлы остаются, но теряют актуальность.
Масштаб и производительность
На моделях размером 70 млрд параметров разница в загрузке составляет 15–20 секунд в пользу SafeTensors. Для production-систем это означает снижение latency при cold-start и экономию ресурсов на масштабировании.
SafeTensors также проще интегрировать с hardware accelerators вроде TPU и специализированных акселераторов, так как format изначально разработан с ориентацией на modern hardware.
Переход на SafeTensors занял менее полугода, и сейчас это facto standard для open-source моделей; закрытые модели пока придерживаются своих внутренних форматов, но давление на унификацию растёт.