Cohere обновила embeddings-модель с повышением точности на 18% для русского языка
Cohere опубликовала обновление embeddings-модели, которое повышает точность векторизации на русском языке на 18% по стандартным бенчмаркам. Улучшение достигнуто путём дообучения модели на корпусе русскоязычных текстов и оптимизации обработки морфологии.
Новая версия лучше различает семантические отношения в русском языке, что особенно важно для поиска релевантных документов и классификации текстов. Модель получила название Embed 3-multilingual и доступна через стандартный API Cohere.
Совместимость с приложениями
Обновление совместимо с существующим кодом, использующим embeddings от Cohere. Размер вектора и интерфейс API остались без изменений, поэтому мигрировать приложение можно путём переиндексирования корпуса текстов с новой моделью.
Cohere рекомендует пересчитать embeddings для документов, но оставила возможность использовать старую версию модели для приложений, где переиндексирование невозможно.
Обновление включено в стандартный план обслуживания и не требует дополнительной оплаты для существующих пользователей Cohere API.