Сравнительный анализ предобученных моделей компьютерного зрения для обнаружения и разметки ценников
В. А. Светличная, Л. Я. Сыгинь, И. Я. Сыгинь
Донецкий национальный технический университет, Кафедра автоматизированных систем управления
Введение
Автоматизация контроля цен на социальные товары становится все более актуальной задачей в современном ритейле. Необходимость отслеживания и анализа цен на продукты первой необходимости, лекарства и другие социально значимые товары обусловлена как экономическими факторами, так и возрастающим вниманием со стороны потребителей и регулирующих органов[1] Быстрое и эффективное получение информации о ценах позволяет оперативно реагировать на изменения рынка, контролировать соблюдение ценовой политики и, в конечном итоге, повышать прозрачность и доступность товаров для населения.
В данной статье рассматривается задача обнаружения и разметки ценников на изображениях, представляющая собой один из ключевых шагов на пути к автоматизации контроля цен. Эта задача включает в себя: обнаружение области ценника на фотографии, распознавание текстовых полей внутри ценника, таких как название товара, стоимость в рублях и копейках. Решение этой задачи позволяет автоматизировать процесс сбора информации о ценах, минимизируя ручной труд и повышая скорость обработки данных.
Цель исследования
Целью данного исследования является анализ и сравнение эффективности применения различных предобученных моделей компьютерного зрения для решения задачи обнаружения и разметки ценников, а также демонстрация возможности получения высокоточных результатов с использованием современных методов глубокого обучения. В рамках работы были проанализированы и сопоставлены такие модели, как YOLOv5, Faster R-CNN и Mask R-CNN, с акцентом на выбор наиболее подходящего решения для практического применения.
Обзор существующих подходов к обнаружению и разметке объектов с использованием Pre-trained моделей
Задача обнаружения объектов и распознавания текста на изображениях представляет собой фундаментальный вызов в области компьютерного зрения, эволюционировавший от ручных методов к современным подходам, основанным на глубоком обучении [5].
До эпохи глубокого обучения, превалирующим подходом были методы, опирающиеся на ручную разработку признаков и классическое машинное обучение. К ним относятся алгоритмы, использующие дескрипторы, такие как Haar-cascade и SIFT (Scale-Invariant Feature Transform). Каскады Хаара, применяемые в задачах обнаружения лиц, базируются на применении набора прямоугольных фильтров для идентификации характерных черт. Методы SIFT, в свою очередь, обеспечивают извлечение инвариантных к масштабу и повороту признаков, последующее использование которых служит для классификации объектов. Однако эти подходы обладают существенными ограничениями. Они, как правило, требуют трудоемкой настройки параметров, сильно зависят от качества и разнообразия обучающих данных, а также демонстрируют недостаточную эффективность в условиях вариаций освещения и при наличии сложных фоновых сцен. Кроме того, они ограничены с точки зрения масштабируемости при решении более сложных задач, таких как обнаружение и распознавание текста в различных ориентациях и стилях.
Современные методы, основанные на глубоком обучении, совершили прорыв в области обнаружения объектов [4]. Эти методы используют глубокие нейронные сети (DNN) для автоматического извлечения высокоуровневых иерархических признаков из изображений [2]. Ключевыми парадигмами здесь являются:
- → Сверточные нейронные сети (CNN): Фундаментальная архитектура для обработки изображений, использующая сверточные слои для извлечения пространственных признаков.
- → Обнаружение объектов (Object Detection): Задача, включающая в себя локализацию объектов (определение границ с использованием bounding boxes) и их классификацию.
- → Распознавание текста (Text Recognition): Задача распознавания символов и слов на изображениях, с применением методов оптического распознавания символов (OCR).
- → End-to-end обучение: Возможность обучения нейронных сетей, решающих комплексную задачу (обнаружение и распознавание) от входного изображения до выходного результата, за один процесс.
Эти методы продемонстрировали исключительную производительность в широком спектре задач компьютерного зрения, включая обнаружение объектов, распознавание текста и сегментацию изображений [4]. Они обладают способностью обучаться на больших объемах данных, обеспечивая автоматическое извлечение информативных признаков и достижение высокой точности [1].
В данной работе мы исследуем три репрезентативные pre-trained модели для обнаружения и разметки ценников, каждая из которых характеризуется определенными достоинствами и недостатками.
YOLO (You Only Look Once)
YOLO является детектором однопроходного типа, что подразумевает обнаружение объектов посредством однократного прохода по нейронной сети [6].
Преимущества: Высокая частота кадров (FPS), что делает его пригодным для задач реального времени, в сочетании с приемлемым уровнем точности.
Недостатки: относительно низкая точность для мелких и перекрывающихся объектов. Может быть менее точным, чем двухэтапные детекторы. Чувствителен к размеру входного изображения. Трудности обучения на небольших датасетах. Проблемы с объектами на границах ячеек сетки. Сложность настройки гиперпараметров.
Faster R-CNN (Region-based Convolutional Neural Network)
Faster R-CNN функционирует в два этапа: сначала сеть Region Proposal Network (RPN) генерирует предложения (region proposals), потенциальные области, где могут находиться объекты. Далее, эти предложения обрабатываются классификатором и регрессором, которые уточняют bounding boxes и предсказывают классы объектов [7].
Преимущества: Высокая точность, особенно в случае небольших объектов.
Недостатки: относительно более низкая скорость обработки по сравнению с YOLO, что связано с двухэтапной архитектурой.
Mask R-CNN
Помимо классификации и регрессии bounding boxes, Mask R-CNN генерирует маску (пиксельную сегментацию) для каждого обнаруженного объекта [8].
Преимущества: Сегментация позволяет не просто определить прямоугольник вокруг ценника, а отделить его от фона пиксель за пикселем, что обеспечивает максимальную точность. Благодаря этому можно выделить даже отдельные элементы внутри ценника, такие как цифры, или небольшие надписи.
Недостатки: Наименьшая скорость обработки из рассматриваемых моделей, обусловленная сложностью процесса сегментации. Это ограничивает ее применимость в задачах, требующих высокой скорости обработки, таких как анализ цен в режиме реального времени.
В таблице 1 представлен сравнительный анализ трех предобученных моделей для обнаружения и разметки ценников: YOLO, Faster R-CNN и Mask R-CNN.
Для каждой модели указаны основные характеристики, преимущества и недостатки, с учетом их применимости к задаче обнаружения и обработки ценников. Сравнительный анализ позволяет выявить сильные и слабые стороны каждой модели, что поможет обосновать выбор наиболее подходящего решения для конкретных требований, включая баланс между скоростью, точностью и сложностью реализации.
| Характеристика | YOLOv5 | Faster R-CNN | Mask R-CNN |
|---|---|---|---|
| Тип детектора | Однопроходной | Двухэтапный | Двухэтапный (с сегментацией) |
| Преимущества | Высокая скорость (FPS) | Высокая точность, особенно для небольших объектов | Высокая точность (с учетом сегментации) |
| Недостатки | Чувствительность к размеру изображения, сложность настройки гиперпараметров | Относительно низкая скорость обработки | Наименьшая скорость обработки |
| Основная задача | Баланс между скоростью и точностью | Высокая точность обнаружения | Точное обнаружение и сегментация объектов |
| Специализация | Обнаружение объектов в реальном времени | Обнаружение объектов с повышенной точностью | Обнаружение объектов с точной локализацией и сегментацией |
Результаты экспериментов и сравнение моделей
Результаты экспериментов представлены в виде таблиц, содержащих значения метрик, а также визуальные примеры предсказаний каждой модели для наглядного сравнения.
Оценка производительности моделей по обнаружению ценников производилась на основе следующих метрик: Precision, Recall, F1-score и mAP@0.5.
| Модель | Precision | Recall | F1-score | mAP@0.5 | FPS |
|---|---|---|---|---|---|
| YOLOv5 | 0.85 | 0.82 | 0.83 | 0.88 | 45 |
| Faster R-CNN | 0.88 | 0.79 | 0.83 | 0.85 | 12 |
| Mask R-CNN | 0.87 | 0.77 | 0.82 | 0.84 | 8 |
Precision (Точность) – доля правильно обнаруженных ценников от общего числа обнаруженных.
Recall (Полнота) – доля правильно обнаруженных ценников от общего числа фактических ценников в наборе данных.
F1-score (F1-мера) – Среднее гармоническое Precision и Recall, характеризующее баланс между ними.
mAP@0.5 (mean Average Precision при IoU=0.5) – средняя точность, усредненная по всем классам при пороговом значении IoU, равном 0.5.
FPS (Frames Per Second) – количество кадров в секунду, обработанных моделью.
Сравнение моделей по точности разметки текстовых полей
Для оценки точности разметки текстовых полей использовалась метрика IoU (Intersection over Union).
Таблица 3 «Сравнение точности разметки текстовых полей (на примере полей «Цена, руб.» и «Цена коп.»)»
| Модель | IoU (Цена, руб.) | IoU (Цена коп.) |
|---|---|---|
| YOLOv5 | 0.82 | 0.88 |
| Faster R-CNN | 0.82 | 0.89 |
| Mask R-CNN | 0.84 | 0.91 |
IoU (Intersection over Union) характеризует степень перекрытия предсказанной области текстового поля с фактической.
Для наглядного сопоставления сильных и слабых сторон каждой модели, результаты анализа успехов, неудач и причин их возникновения сведены в таблицу 4. Эта таблица позволяет быстро оценить компромиссы между скоростью, точностью обнаружения и точностью разметки текста для каждой из рассмотренных моделей.
| Модель | Преимущества | Недостатки | Причины |
|---|---|---|---|
| YOLOv5 | Высокая скорость. Хорошая общая производительность. Легко справляется с ценниками разных размеров и форм. | Несколько меньшая точность обнаружения. Несколько менее точная разметка текста. | Однопроходная архитектура обеспечивает высокую скорость, но может приводить к менее точной локализации объектов и распознаванию текста. |
| Faster R-CNN | Более высокая точность обнаружения ценников. Более точная разметка текста. | Более низкая скорость работы. | Двухэтапная архитектура позволяет более точно локализовать объекты, но требует больше вычислительных ресурсов. |
| Mask R-CNN | Наиболее точная разметка текстовых полей. | Самая низкая скорость работы. | Добавление этапа сегментации увеличивает точность разметки, но значительно увеличивает вычислительную сложность. |
В результате проведенного сравнительного анализа, YOLOv5 продемонстрировала оптимальное сочетание производительности и скорости, что делает ее наиболее подходящей моделью для решения задачи обнаружения и разметки ценников, особенно в условиях, требующих обработки данных в реальном времени [6]. Несмотря на небольшое снижение точности по сравнению с Faster R-CNN в отдельных метриках, высокая скорость обработки и общая хорошая производительность делают YOLOv5 наиболее практичным решением для автоматизации процесса контроля цен. При этом, YOLOv5 эффективно справляется с обнаружением ценников различных размеров и форм, обеспечивая достаточно точную разметку текста для большинства практических применений.
Заключение
В данной работе было проведено сравнительное исследование предобученных моделей YOLOv5, Faster R-CNN и Mask R-CNN для автоматического обнаружения и разметки ценников на изображениях. Результаты показали, что выбор оптимальной модели зависит от приоритетов задачи: высокой точности или скорости. YOLOv5 продемонстрировала оптимальный баланс между производительностью и скоростью обработки, обеспечивая высокую частоту кадров при приемлемой точности. Учитывая полученные результаты, наиболее перспективным решением представляется использование модели YOLOv5. Дальнейшие исследования будут направлены на оптимизацию использования выбранной модели, интеграцию более продвинутых методов OCR и разработку мобильных приложений для практического применения.
Литература
- Ермоленко, А. В. Актуальные подходы к решению задачи разметки данных, аугментации и синтеза предобученных моделей / А. В. Ермоленко, В. М. Полушкин, А. С. Горский // Вооружение и экономика. – 2024. – № 4(70). – С. 36-42. – EDN HPYIZI.
- Понкин, Д. И. Концепт предобученных языковых моделей в контексте инженерии знаний / Д. И. Понкин // International Journal of Open Information Technologies. – 2020. – Т. 8, № 9. – С. 18-29. – EDN NGJYQL
- Бодров, Е. Н. Применение инструментов платформы Hugging Face при создании и внедрении моделей машинного обучения / Е. Н. Бодров // Безопасность. Управление. Искусственный интеллект. – 2023. – Т. 4, № 4(4). – С. 30-40. – EDN FIPWDE.
- Rice Fungal Diseases Recognition Using Modern Computer Vision Techniques / I. V. Arinichev, S. V. Polyanskikh, G. V. Volkova, I. V. Arinicheva // International Journal of Fuzzy Logic and Intelligent Systems. – 2021. – Vol. 21, No. 1. – P. 1-11. – DOI 10.5391/IJFIS.2021.21.1.1. – EDN CPIVQC.
- Захаров, В. С. Технологии компьютерного зрения на российском и мировом рынках и их перспективы / В. С. Захаров // Вестник Таганрогского института управления и экономики. – 2022. – № 1(35). – С. 114-115. – EDN NUPQZM.
- Comparison Study of Corn Leaf Disease Detection based on Deep Learning YOLO-v5 and YOLO-v8 / N. Chitraningrum, L. Banowati, D. Herdiana [et al.] // Journal of Engineering and Technological Sciences. – 2024. – Vol. 56, No. 1. – P. 61-70. – DOI 10.5614/j.eng.technol.sci.2024.56.1.5. – EDN QSQSLM.
- Galvez, R. Identifying threat objects using faster region-based convolutional neural networks (faster R-CNN) / R. Galvez, E. P. Dadios // International Journal of Advances in Intelligent Informatics. – 2022. – Vol. 8, No. 3. – P. 381. – DOI 10.26555/ijain.v8i3.952. – EDN YRVNTD.
- Musyarofah. Object detection of aerial image using mask-region convolutional neural network (mask R-CNN) / Musyarofah, V. Schmidt, M. Kada // IOP Conference Series: Earth and Environmental Science : 5, The Revolution of Earth Observation for a Better Human Life, Bandung, West Java, 17–20 сентября 2019 года. – Bandung, West Java, 2020. – P. 012090. – DOI 10.1088/1755-1315/500/1/012090. – EDN ZDZFCJ.
- Сыгинь, Л. Я. Использование технологий искусственного интеллекта для мониторинга цен на социальные товары / Л. Я. Сыгинь, К. К. Руднев // Информатика, управляющие системы, математическое и компьютерное моделирование (ИУСМКМ-2024) : XV Международная научно-техническая конференция в рамках X Международного Научного форума Донецкой Народной Республики, Донецк, 29–30 мая 2024 года. – Донецк: Донецкий национальный технический университет, 2024. – Т. II. – С. 659-663. – EDN JFFEYO.