ДонНТУ Портал магистров
← Назад
Источник: П. К. Стёпушкина. Современные нейросетевые подходы к детекции объектов // Программа IX Всероссийской научно-технической конференции с международным участием «Современные информационные технологии в образовании и научных исследованиях» (СИТОНИ-2025). — Донецк: ДонНТУ, 2025.

СОВРЕМЕННЫЕ НЕЙРОСЕТЕВЫЕ ПОДХОДЫ К ДЕТЕКЦИИ ОБЪЕКТОВ

УДК 004.8

Автор: П.К. Стёпушкина, ФГБОУ ВО «Донецкий национальный технический университет» (г. Донецк), кафедра «Прикладная математика и искусственный интеллект», pelagea.karol@gmail.com

Аннотация: Особое внимание уделено архитектуре YOLO (You Only Look Once) — одной из самых эффективных моделей для задач компьютерного зрения в реальном времени. Прослеживается эволюция YOLO от первой версии до современного релиза YOLOv8, анализируются архитектурные изменения, ключевые инновации и сравнительные показатели производительности.

Ключевые слова: нейронные сети, детекция объектов, YOLO, компьютерное зрение, глубокое обучение.

Введение

Современные технологии компьютерного зрения стремительно развиваются благодаря достижениям в области глубокого обучения и нейронных сетей. Одной из наиболее актуальных задач остаётся детекция объектов — процесс определения положения и класса различных элементов на изображении или видеопотоке. Развитие этой области напрямую связано с ростом вычислительных мощностей и появлением архитектур, способных обрабатывать изображения в реальном времени с высокой точностью. Ранее для решения подобных задач использовались классические методы обработки изображений, основанные на выделении признаков вручную — таких, как градиентные и контурные дескрипторы (SIFT, HOG, SURF). Однако эти подходы демонстрировали низкую устойчивость при изменении условий освещения, углов обзора или масштабов объектов [1].

Появление свёрточных нейронных сетей (Convolutional Neural Networks, CNN) стало переломным моментом в развитии систем детекции. Нейросети позволяют автоматически извлекать информативные признаки и учитывать пространственные зависимости, что обеспечивает значительно более высокую точность распознавания. В последние годы наблюдается активное развитие архитектур, специально оптимизированных под задачи детекции, таких как Faster R-CNN, SSD и YOLO. Последняя из них — YOLO (You Only Look Once) — стала одной из самых популярных моделей благодаря своей способности выполнять локализацию и классификацию объектов за один проход сети, что делает её пригодной для обработки видеопотоков в реальном времени [2].

1. Эволюция и оптимизация архитектур детекции объектов

Первое поколение моделей YOLO, предложенное Дж. Редмоном в 2016 году, стало революционным благодаря объединению всех этапов обработки в единую нейросетевую архитектуру. Основная идея заключалась в том, чтобы разбить изображение на сетку и для каждой ячейки предсказать координаты и классы объектов. Несмотря на высокую скорость (до 45 кадров в секунду), точность YOLOv1 была ограничена, особенно при детекции мелких объектов. Однако этот подход заложил основу для последующих версий [3].

Второе поколение, YOLOv2, принесло улучшения за счёт использования anchor-боксов и batch normalization, что позволило повысить устойчивость и улучшить качество обобщения. В версии YOLOv3 появились механизмы многоуровневого извлечения признаков (Feature Pyramid Networks), что позволило эффективно обрабатывать объекты разных размеров. YOLOv4, представленная в 2020 году, стала синтезом лучших практик и архитектурных решений — в ней применялись такие компоненты, как Cross Stage Partial connections (CSP), Spatial Pyramid Pooling (SPP) и Path Aggregation Network (PANet). Эти изменения позволили увеличить точность без существенной потери производительности [4].

Путь версий YOLO Рисунок 1 – Путь версий YOLO

Современные версии YOLOv5 и YOLOv8 демонстрируют значительный прогресс благодаря переходу к фреймворку PyTorch, внедрению новых модулей оптимизации признаков и отказу от якорей (anchor-free подход). YOLOv8, выпущенная в 2023 году, является полностью модульной, поддерживает автооптимизацию гиперпараметров, а также может использоваться не только для детекции, но и для сегментации и классификации. Таким образом, современные модели YOLO представляют собой гибкие универсальные инструменты, применяемые во множестве областей — от систем видеонаблюдения до автономных транспортных средств [5].

2. Методика исследования и организация эксперимента

В качестве экспериментальной платформы рассматривалась модель YOLOv8s, реализованная в среде PyTorch. Обучение проводилось на открытом датасете COCO, содержащем более 200 тысяч изображений и 80 категорий объектов. Использовались стандартные методы предобработки данных, включающие масштабирование, нормализацию и случайные аугментации изображений. Особое внимание уделялось применению техники Mosaic augmentation, при которой четыре случайных изображения объединяются в одно. Это позволяет повысить устойчивость модели к изменению пропорций и контекста объектов [2].

Для подтверждения эффективности нейросетевых методов была проведена серия вычислительных экспериментов с использованием архитектуры YOLOv8s, реализованной в библиотеке Ultralytics YOLO (PyTorch). Исследование проводилось на рабочей станции с графическим ускорителем NVIDIA RTX 3060, 12 ГБ видеопамяти и 32 ГБ оперативной памяти.

Для оценки эффективности использовались стандартные метрики качества: mean Average Precision (mAP), Precision, Recall и Frames Per Second (FPS). Обучение проводилось с использованием графического ускорителя NVIDIA RTX 3060, что обеспечивало среднюю скорость обучения около 0.8 секунд на батч. В ходе эксперимента подбирались оптимальные значения скорости обучения, размера батча и параметров регуляризации, таких как dropout и weight decay.

Перед обучением данные проходили несколько этапов подготовки: изменение разрешения изображений до 640×640 пикселей, нормализация цветовых каналов и аугментация. Применялись такие приёмы, как Mosaic augmentation, случайные повороты, отражения и изменения контраста. Это позволило повысить устойчивость модели к внешним условиям, включая изменение погоды и освещённости.

В процессе эксперимента проводился анализ влияния различных гиперпараметров: скорости обучения, размера батча, функции потерь и количества эпох. Оптимальной оказалась скорость обучения 0.001, batch size = 16 и количество эпох 50. Оценка производительности осуществлялась с использованием метрик Precision, Recall, F1-score и mean Average Precision (mAP) на уровнях порога 0.5 и 0.5:0.95.

Обучение модели YOLOv8 Рисунок 2 – Обучение модели YOLOv8 на собственном датасете

Для ускорения обучения использовался transfer learning, при котором базовые веса были взяты из предобученной модели YOLOv8n. Это позволило существенно сократить время обучения и повысить итоговую точность на тестовом наборе данных. Базовая модель инициализировалась предобученными весами, полученными на COCO. На начальных этапах часть слоёв «замораживалась», обучались только последние блоки, после чего проводилось дообучение всей сети. Такая схема позволила сократить время обучения почти вдвое при сохранении точности.

По завершении обучения модель была протестирована на независимой выборке изображений, содержащей сцены с высокой плотностью объектов. Особое внимание уделялось способности алгоритма корректно определять границы перекрывающихся объектов и устойчивости к изменению освещения.

3. Анализ результатов и обсуждение эффективности модели

Для проверки эффективности предложенного подхода была проведена серия экспериментов по обучению и тестированию моделей YOLOv5s и YOLOv8n на выборке изображений автомобильных номерных знаков. В процессе обучения использовался метод переноса обучения (transfer learning), при котором веса модели инициализировались на базе предварительно обученной архитектуры YOLO на наборе данных COCO, а затем осуществлялось дообучение на пользовательском датасете.

Объем исходных данных составил 5000 изображений, разделённых в соотношении 80/20 на обучающую и валидационную выборки. Перед подачей данных в нейронную сеть изображения были приведены к размеру 640×640 пикселей и подвергнуты стандартным процедурам аугментации (повороты, сдвиги, изменение яркости и контраста). Обучение проводилось в течение 100 эпох на графическом процессоре NVIDIA T4 с использованием библиотеки Ultralytics YOLO.

На рисунке 3 представлена динамика изменения показателя точности mAP 0.5 в процессе обучения. Можно заметить, что на первых 20–30 эпохах модель активно наращивает качество детекции, после чего рост метрики становится менее интенсивным, а начиная с 60-й эпохи наблюдается стабилизация. Достижение устойчивого уровня mAP 0.5 = 0.87 к 80-й эпохе свидетельствует о корректной настройке гиперпараметров и отсутствии признаков переобучения.

Зависимость точности Рисунок 3 – Зависимость точности (mAP) от числа эпох

Визуальный анализ результатов детекции показал, что YOLOv8 уверенно определяет номерные знаки даже при сложных условиях освещения, частичном перекрытии или загрязнении поверхности. Для сравнения, модель YOLOv5s при аналогичных условиях достигла mAP 0.5 = 0.82, что на 5 процентных пунктов ниже. Это подтверждает, что переход к безъякорной архитектуре (anchor-free) в YOLOv8 обеспечивает лучшую адаптацию к вариативным формам и размерам объектов.

Скорость обработки также является критическим параметром для систем реального времени. В ходе экспериментов YOLOv8n обеспечивала среднее время инференса около 6 мс на изображение, что эквивалентно 165 кадрам в секунду на GPU. Для YOLOv5s это значение составляло около 8,5 мс (118 FPS), что делает обе модели пригодными для задач потокового видеонаблюдения, но приоритет за более новой архитектурой.

На основании полученных данных можно сделать вывод, что оптимизация архитектуры YOLOv8, включающая улучшенные модули C2f, использование механизма anchor-free и усовершенствованный путь агрегации признаков (PAN-FPN), положительно влияет на качество детекции. Полученные результаты позволяют рекомендовать использование YOLOv8 в качестве основной архитектуры для построения систем автоматического распознавания номерных знаков (ALPR).

График демонстрирует, что уже после 40 эпох модель достигает mAP ≈ 0.75, а к 100-й эпохе метрика стабилизируется на уровне 0.87. Это говорит о хорошей способности нейронной сети к обобщению и устойчивости к разнообразным условиям съёмки. Дополнительно была проведена проверка модели на тестовой выборке, не участвовавшей в обучении. Средняя точность распознавания на тестовых данных составила 91.3%, что подтверждает устойчивость сети к изменению ракурса и освещённости. Также отмечено, что количество ложных срабатываний (false positives) не превышает 3% от общего числа детекций, что является приемлемым результатом для прототипа реального времени.

Таким образом, результаты эксперимента показывают, что применение современных нейросетевых моделей семейства YOLO обеспечивает не только высокую точность, но и реальную возможность использования в прикладных системах транспортного мониторинга.

Выводы

В ходе исследования установлено, что современные нейросетевые архитектуры семейства YOLO обеспечивают эффективное решение задач детекции объектов с высокой скоростью и точностью. Эволюция от первой версии YOLO до YOLOv8 демонстрирует устойчивую тенденцию к повышению производительности за счёт архитектурных усовершенствований, оптимизации структуры слоёв и внедрения новых методов аугментации данных. Результаты эксперимента подтверждают, что YOLOv8 является одним из наиболее перспективных инструментов для построения интеллектуальных систем обработки изображений в реальном времени.

Полученные результаты могут быть использованы при разработке систем автоматического видеонаблюдения, беспилотных транспортных средств и промышленных комплексов визуального контроля. В дальнейшем планируется проведение исследований, направленных на интеграцию YOLO с методами постобработки и отслеживания объектов, а также на разработку облегчённых моделей для внедрения в мобильные и встроенные устройства.

Литература

  1. Krizhevsky, A. ImageNet Classification with Deep Convolutional Neural Networks / A. Krizhevsky, I. Sutskever, G. Hinton // Communications of the ACM.– 2017. – Vol. 60, No. 6. – P. 84–90. – DOI: 10.1145/3065386.↑ к тексту
  2. Redmon, J. YOLO9000: Better, Faster, Stronger / J. Redmon, A. Farhadi // Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (CVPR). – Honolulu, HI, 2017. – P. 6517–6525. – DOI: 10.1109/CVPR.2017.690.↑ к тексту
  3. Bochkovskiy, A. YOLOv4: Optimal Speed and Accuracy of Object Detection [Электронный ресурс] / A. Bochkovskiy, C.-Y. Wang, H.-Y. M. Liao. – 2020. – Режим доступа: https://arxiv.org/abs/2004.10934 (дата обращения: 12.11.2025).↑ к тексту
  4. Jocher, G. Ultralytics YOLOv5 Documentation [Электронный ресурс] / G. Jocher. – Ultralytics, 2021. – Режим доступа: https://docs.ultralytics.com (дата обращения: 12.11.2025).↑ к тексту
  5. Ultralytics. YOLOv8 Technical Report and Benchmarks [Электронный ресурс] / Ultralytics. – 2023. – Режим доступа: https://github.com/ultralytics/YOLOv8 (дата обращения: 12.11.2025).↑ к тексту

P.K. Styopushkina Modern neural network approaches to object detection. Special attention is paid to the YOLO (You Only Look Once) architecture, one of the most effective models for real-time computer vision tasks. The evolution of YOLO from its first version to the current YOLOv8 release is traced, and architectural changes, key innovations, and comparative performance metrics are analyzed.

Keywords: neural networks, object detection, YOLO, computer vision, deep learning.

← Назад