OpenAI выпустила библиотека для автоматического разбиения больших изображений на чанки
OpenAI выпустила открытую библиотеку для разбиения больших изображений на чанки, адаптированные для обработки модельюю Vision. Утилита автоматически анализирует содержимое изображения и разбивает его с учётом объектов, текста и структурных элементов, минимизируя потерю контекста при фрагментации.
Библиотека реализует несколько стратегий разбиения: по сетке с перекрытием, по границам объектов, детектируемым компьютерным зрением, и по семантическим регионам. Разработчики могут выбрать алгоритм в зависимости от типа содержимого.
Интеграция в приложения
Утилита обеспечивает корректное восстановление результатов обработки чанков — она отслеживает пространственные отношения между фрагментами и позволяет слить ответы модели в единый результат с сохранением геометрии исходного изображения.
Библиотека совместима с Vision API OpenAI и может использоваться для предварительной обработки входных данных перед отправкой на сервер. Она доступна в виде Python-модуля и JavaScript-пакета.
Исходный код опубликован под открытой лицензией, и сообщество может предлагать расширения для специализированных случаев обработки документов, карт и научных изображений.