ОБ ИССЛЕДОВАНИИ ЭФФЕКТИВНОСТИ СВЁРТОЧНЫХ НЕЙРОННЫХ СЕТЕЙ В ЗАДАЧАХ КЛАССИФИКАЦИИ ВИЗУАЛЬНЫХ ДАННЫХ
УДК 332.85
B представленной работе проведено исследование свëрточных нейронных сетей в задаче детектирования объектов. Для ссылки на литературу: [1], [2], [3].
Ключевые слова: свëрточные нейронные сети, задача детектирования объектов.
ON INVESTIGATION OF CONVOLUTIONAL NEURAL NETWORKS EFFECTIVENES IN VISUAL CLASSIFICATION PROBLEMS, M. V. Gordienko, Scientific supervisor – E. S. Semenkin, Reshetnev Siberian State University of Science and Technology, 31, Krasnoyarskii rabochii prospekt, Krasnoyarsk, 660037, Russian Federation, E-mail: Manamah24@yandex.ru
In this paper, the convolutional neural networks are tested in objects detection task. Keywords: convolutional neural networks, objects detection.
B настоящее время свëрточные нейронные сети (CНC) показывают хорошие результаты в решении задачах распознавания изображений и детектирования объектов на изображении. B работе представлено сравнение эффективности двух архитектур CНC для решения задачи детектирования цветов. Для решения задачи использовалась такие архитектуры как RetinaNet [4], YOLOv3, YOLOv3-tiny - урезанная версия модели YOLOv3 [1,2,3].
You Only Look Once (YOLO) — это one stage detector [6], использующий подход наложения сетки S×S на входное изображение, каждая ячейка которой имеет ряд параметров: • Количество предсказанных рамок B × 5, каждая рамка содержит 5 параметров x,y,w,h и уверенность предсказания. Координаты (x,y) представляют центр рамки, w и h - ширина и высота изображения. • C - вероятностей принадлежности к классу, равное количеству классов. Общее количество параметров определяется, как S × S × (B * 5 + C). Далее используя алгоритм non maximum suppression выбирающий наиболее подходящие кандидаты – регионы.
RetinaNet — это one stage detector, использующий Feature pyramid net (FPN) [7] и focal [4] loss для обучения. FPN - это структура для обнаружения многомасштабных объектов. Она сочетает в себе семантически сильные объекты с низким разрешением и семантически слабые объекты с высоким разрешением через нисходящий путь и боковые связи. Конечным результатом являются карты признаков различного масштаба на различных уровнях сети. Полученная карта признаков используется для классификации объекта и нахождения наиболее подходящих кандидатов – регионов подсетями классификации и регрессии. Также модель использует модифицированную функцию потерь focal loss для фокусировки на более сложных примерах во время обучения.
Для обучения архитектур CНC использовались данные Flower recognition [5]. Данные включают в себя 4242 изображения 5 видов цветов: ромашка, подсолнух, роза, тюльпан и одуванчик. Для обучения CНC использовалось 824 фотографии. Для создания аннотаций была использована программа LabelImg [8]. При создании наборов данных необходимо выделить области с цветами. Bсего было сделано 5 603 аннотации. Для определения скорости работоспособности использовались 9 разных по длине видео с цветами. Результаты работы представлены в таблице.
Были обучены две архитектуры свëрточных нейронных сетей типа YOLOv3 и RetinaNet, а также урезанная версия YOLOv3 - YOLOv3-tiny. Для обучения использовалось 824 изображения цветов, по 164 изображений на каждый из 5-х классов. Для каждого изображения была сделана аннотация. Эффективность CНC оценивалась при помощи двух критериев - mAP и скорость обработки видео в секундах. По результатам таблицы 1 можно заметить, что архитектура CНC типа YOLO обрабатывает видео быстрее, но проигрывает в точности архитектуре типа RetinaNet. B свою очередь YOLOv3-tiny намного быстрее, что дает возможность использовать ее на устройствах с небольшой производительностью.
Библиографические ссылки
- J. Redmon. Darknet: Open source neural networks in c. http://pjreddie.com/darknet/, 2013 – 2016. ↑ к тексту
- J. Redmon and A. Farhadi. Yolo9000: Better, faster, stronger. In Computer Vision and Pattern Recognition (CVPR), 2017 IEEE Conference on, pages 6517–6525. IEEE, 2017. ↑ к тексту
- J. Redmon and A. Farhadi. Yolov3: An incremental improvement. arXiv, 2018. ↑ к тексту
- T.-Y. Lin, P. Goyal, R. Girshick, K. He, and P. Dollar. Focal loss for dense object detection. arXiv preprint arXiv:1708.02002, 2017. ↑ к тексту
- Flower recognition [Электронный ресурс] – URL: https://www.kaggle.com/alxmamaev/flowers-recognition#102841525_bd6628ae3c.jpg (дата обращения 14.04.2020) ↑ к тексту
- Jianjun L., Kangjian P. An efficient object detection algorithm based on compressed networks [Text] // Symmetry. – 2018, Vol. 10. – Pp. 235-249. ↑ к тексту
- T.-Y. Lin, P. Dollar, R. Girshick, K. He, B. Hariharan, and S. Belongie. Feature pyramid networks for object detection. In Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, pages 2117–2125, 2017. ↑ к тексту
- LabelImg [Электронный ресурс]. URL: https://github.com/tzutalin/labelImg (дата обращения 14.04.2020) ↑ к тексту