ДонНТУ Портал магистров
← Назад
Источник: М. В. Гордиенко, Е. С. Сёмёнкин. Об исследовании эффективности свёрточных нейронных сетей в задачах классификации визуальных данных // Актуальные проблемы авиации и космонавтики. — 2020. — Т. 2.

ОБ ИССЛЕДОВАНИИ ЭФФЕКТИВНОСТИ СВЁРТОЧНЫХ НЕЙРОННЫХ СЕТЕЙ В ЗАДАЧАХ КЛАССИФИКАЦИИ ВИЗУАЛЬНЫХ ДАННЫХ

УДК 332.85

Автор: M. B. Гордиенко, научный руководитель – E. C. Сёмёнкин, Сибирский государственный университет науки и технологий имени академика М. Ф. Решетнева, Россия, 660037, г. Красноярск, просп. им. газеты «Красноярский рабочий», 31, Manamah24@yandex.ru

B представленной работе проведено исследование свëрточных нейронных сетей в задаче детектирования объектов. Для ссылки на литературу: [1], [2], [3].

Ключевые слова: свëрточные нейронные сети, задача детектирования объектов.

ON INVESTIGATION OF CONVOLUTIONAL NEURAL NETWORKS EFFECTIVENES IN VISUAL CLASSIFICATION PROBLEMS, M. V. Gordienko, Scientific supervisor – E. S. Semenkin, Reshetnev Siberian State University of Science and Technology, 31, Krasnoyarskii rabochii prospekt, Krasnoyarsk, 660037, Russian Federation, E-mail: Manamah24@yandex.ru

In this paper, the convolutional neural networks are tested in objects detection task. Keywords: convolutional neural networks, objects detection.

B настоящее время свëрточные нейронные сети (CНC) показывают хорошие результаты в решении задачах распознавания изображений и детектирования объектов на изображении. B работе представлено сравнение эффективности двух архитектур CНC для решения задачи детектирования цветов. Для решения задачи использовалась такие архитектуры как RetinaNet [4], YOLOv3, YOLOv3-tiny - урезанная версия модели YOLOv3 [1,2,3].

You Only Look Once (YOLO) — это one stage detector [6], использующий подход наложения сетки S×S на входное изображение, каждая ячейка которой имеет ряд параметров: • Количество предсказанных рамок B × 5, каждая рамка содержит 5 параметров x,y,w,h и уверенность предсказания. Координаты (x,y) представляют центр рамки, w и h - ширина и высота изображения. • C - вероятностей принадлежности к классу, равное количеству классов. Общее количество параметров определяется, как S × S × (B * 5 + C). Далее используя алгоритм non maximum suppression выбирающий наиболее подходящие кандидаты – регионы.

RetinaNet — это one stage detector, использующий Feature pyramid net (FPN) [7] и focal [4] loss для обучения. FPN - это структура для обнаружения многомасштабных объектов. Она сочетает в себе семантически сильные объекты с низким разрешением и семантически слабые объекты с высоким разрешением через нисходящий путь и боковые связи. Конечным результатом являются карты признаков различного масштаба на различных уровнях сети. Полученная карта признаков используется для классификации объекта и нахождения наиболее подходящих кандидатов – регионов подсетями классификации и регрессии. Также модель использует модифицированную функцию потерь focal loss для фокусировки на более сложных примерах во время обучения.

Пример работы YOLO
Рис. 1. Пример работы YOLO
Архитектура RetinaNet
Рис. 2. Архитектура RetinaNet

Для обучения архитектур CНC использовались данные Flower recognition [5]. Данные включают в себя 4242 изображения 5 видов цветов: ромашка, подсолнух, роза, тюльпан и одуванчик. Для обучения CНC использовалось 824 фотографии. Для создания аннотаций была использована программа LabelImg [8]. При создании наборов данных необходимо выделить области с цветами. Bсего было сделано 5 603 аннотации. Для определения скорости работоспособности использовались 9 разных по длине видео с цветами. Результаты работы представлены в таблице.

Сравнение характеристик СНС
Рис. 3. Сравнение характеристик СНС

Были обучены две архитектуры свëрточных нейронных сетей типа YOLOv3 и RetinaNet, а также урезанная версия YOLOv3 - YOLOv3-tiny. Для обучения использовалось 824 изображения цветов, по 164 изображений на каждый из 5-х классов. Для каждого изображения была сделана аннотация. Эффективность CНC оценивалась при помощи двух критериев - mAP и скорость обработки видео в секундах. По результатам таблицы 1 можно заметить, что архитектура CНC типа YOLO обрабатывает видео быстрее, но проигрывает в точности архитектуре типа RetinaNet. B свою очередь YOLOv3-tiny намного быстрее, что дает возможность использовать ее на устройствах с небольшой производительностью.

Библиографические ссылки

  1. J. Redmon. Darknet: Open source neural networks in c. http://pjreddie.com/darknet/, 2013 – 2016. ↑ к тексту
  2. J. Redmon and A. Farhadi. Yolo9000: Better, faster, stronger. In Computer Vision and Pattern Recognition (CVPR), 2017 IEEE Conference on, pages 6517–6525. IEEE, 2017. ↑ к тексту
  3. J. Redmon and A. Farhadi. Yolov3: An incremental improvement. arXiv, 2018. ↑ к тексту
  4. T.-Y. Lin, P. Goyal, R. Girshick, K. He, and P. Dollar. Focal loss for dense object detection. arXiv preprint arXiv:1708.02002, 2017. ↑ к тексту
  5. Flower recognition [Электронный ресурс] – URL: https://www.kaggle.com/alxmamaev/flowers-recognition#102841525_bd6628ae3c.jpg (дата обращения 14.04.2020) ↑ к тексту
  6. Jianjun L., Kangjian P. An efficient object detection algorithm based on compressed networks [Text] // Symmetry. – 2018, Vol. 10. – Pp. 235-249. ↑ к тексту
  7. T.-Y. Lin, P. Dollar, R. Girshick, K. He, B. Hariharan, and S. Belongie. Feature pyramid networks for object detection. In Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, pages 2117–2125, 2017. ↑ к тексту
  8. LabelImg [Электронный ресурс]. URL: https://github.com/tzutalin/labelImg (дата обращения 14.04.2020) ↑ к тексту
← Назад