ИСПОЛЬЗОВАНИЕ НЕЙРОСЕТЕВОГО ПОДХОДА В ВИДЕОАНАЛИТИЧЕСКИХ СИСТЕМАХ

Авторы: Хрюкин Е.А., Мартыненко Т.В., Васяева Т.А.
Донецкий национальный технический университет, кафедра автоматизированных систем управления
E-mail: wadealer@yandex.ru

Аннотация

Хрюкин Е.А., Мартыненко Т.В., Васяева Т.А. Использование нейросетевого подхода в видеоаналитических системах. В статье рассматривается использование нейросетевых моделей для анализа видеоинформации и их применение в видеоаналитических системах. Определены основные парадигмы нейросетевого подхода, анализируются различные типы нейросетевых моделей в контексте видеоаналитических систем. Работа подчеркивает значимость нейросетевого подхода в развитии видеоаналитических систем и его потенциал для улучшения эффективности и точности анализа видеоинформации.

Abstract

Khriukin Y.A., Martynenko T.V., Vasyaeva T.A. Using a neural network approach in video analytical systems. The article explores the use of neural network models in analysing video information and their application in video analytical systems. It outlines the main paradigms of the neural network approach and analyses various types of neural network models within the realm of video analytical systems. The study highlights the importance of using a neural network approach to advance video analytics systems, which has the potential to improve the efficiency and accuracy of video information analysis.

Ключевые слова

машинное обучение, нейросетевой подход, глубокое обучение, распознавание видео.

Keywords

machine learning, neural network approach, deep learning, video recognition.

Введение

Для повышения уровня "интеллекта" и эффективности современных видеоаналитических подходов, расширения их возможностей, применяются различные методы искусственного интеллекта. Самым перспективным направлением является использование нейросетевого подхода (НП).

Основные особенности нейросетевого подхода

  1. Обучение на данных. Одной из ключевых особенностей НП является возможность обучения моделей на больших объемах данных. Нейронные сети способны извлекать сложные зависимости, что делает их эффективными для анализа видеоинформации.
  2. Извлечение признаков. НП автоматически извлекают признаки из видеоинформации, что сокращает ручную работу по определению характеристик объектов или событий на видео.
  3. Глубокое обучение. Современные НП часто основаны на глубоком обучении (Deep Learning), которое подразумевает создание моделей, состоящих из множества слоев, иерархически представляющих признаки более высоких порядков.
  4. Использование предобученных моделей. Обеспечивает возможность эффективного и быстрого дообучения моделей под конкретную задачу и повышает их обобщающую способность за счет предварительного изучения широкого спектра признаков на больших наборах данных.
  5. Адаптивность. Нейросетевые модели могут быть адаптированы под различные задачи анализа видеоинформации, такие как распознавание объектов, сегментация сцен, предсказание действий и т. д.
  6. Работа в реальном времени. С развитием аппаратного обеспечения и оптимизации алгоритмов НП становятся все более пригодными для работы в реальном времени, что делает их полезными для широкого спектра приложений, включая видеонаблюдение и автоматизацию процессов.

Эти особенности делают НП одним из наиболее перспективных и эффективных для разработки современных видеоаналитических систем.

Основные архитектуры моделей, используемые в НП: свёрточные нейронные сети (CNN), рекуррентные нейронные сети (RNN), сети долгой краткосрочной памяти (LSTM), сети глубокого обучения на основе внимания (Attention-based models), генеративные состязательные сети (GAN), трансформеры (Transformers), 3D сверточные нейронные сети (3D CNN).

Отличаются они, в основном способностью учитывать пространственные и временные зависимости, обработкой последовательных данных, использованием механизма внимания (attention) и специализацией на конкретных типах признаков. Следует отметить, что в настоящее время все архитектуры используются при анализе видео.

Общая постановка проблемы

Основными задачами, решаемыми в рамках компьютерных систем анализа видеоинформации (КСАВИ), являются: автоматическое распознавание объектов сцены, интерпретация и извлечение полезной информации из видеоданных для различных целей, включая безопасность, наблюдение, медицину, рекламу и другие области.

Рис. 1. Обобщенная функциональная схема КСАВИ

Рис. 1. Обобщенная функциональная схема КСАВИ

Обобщенную функциональную схему КСАВИ можно представить как последовательность этапов: предварительная обработка, обнаружение и захват объектов интереса, слежение за объектом интереса, анализ перемещений объекта. Каждый из указанных этапов представляет собой отдельную сложную задачу в обработке и анализе видеоинформации.

Первый из этапов, указанных на схеме, отражает процессе формирования последовательности цифровых изображений (кадров) с помощью различных отображающих систем. При этом существуют различные стратеги формирования последовательности кадров. Например, для экономии вычислительных ресурсов извлекается каждый N-ый кадр видеоряда. В результате формирования видеопоследовательности, кадры обычно подвергаются воздействию различных случайных помех и шумов, которые необходимо уменьшить на этапе предварительной обработки.

На следующем этапе происходит разбиение исходного изображения на набор непустых непересекающихся связанных подмножеств в соответствии с некоторым условием (например, критерий однородности, основанный на оценке максимальной разности яркости отдельного пикселя и среднего значения яркости, вычисленного по соответствующей области). Следующий этап производит расчет признаков выделенных объектов, который позволяет осуществить дальнейшее слежение за каждым из найденных объектов. Рассчитываются пространственно-временные характеристики движения, а также определяется контекст сцены. На последних этапах происходит анализ перемещений объекта и представление его полезной составляющей в виде, удобном для специалиста.

Применение нейросетевого подхода при анализе видео

В контексте решения видеоаналитических задач нейросетевой подход становится важным инструментом, обеспечивающим возможность автоматизированного и высокоэффективного анализа информации. Существующие на данный момент подходы, основанные на нейронных сетях, могут охватывать как отдельные этапы из обобщенной функциональной схемы КСАВИ, так и объединять в себе несколько функциональных блоков.

В последние десятилетия нейросетевые подходы привлекают все большее внимание в области анализа видео, предлагая инновационные и эффективные методы обработки и интерпретации видеоинформации. Количество исследований в области НП растет с каждым годом.

Рис. 2. Временная зависимость количества статей по использованию
        нейросетевого подхода в задачах анализа видео

Рис. 2. Временная зависимость количества статей по использованию нейросетевого подхода в задачах анализа видео

Наиболее значимые работы, посвященные использованию НП в анализе видео, сведены в таблицу 1.

Таблица 1 – Применение НП при анализе видео

Этап анализа видео Год Исследователи Описание
Обнаружение и захват объектов интереса 2021 Ze Liu и др. [4] Предложена пространственно-временная адаптация архитектуры Swin Transformer для целей распознавания видео.
2023 Qianjun Li [6] В основе системы лежит CNN YOLOv8
2024 Long Zhao и др. [10] Разработана система VideoPrism, видеокодировщик общего назначения, позволяющий решать различные задачи понимания видео с помощью одной модели.
Слежение за объектом интереса 2019 Shengyong Ch и др. [7] Произведен аналитический обзор основных методов трекинга объектов, использующих методы МО.
2023 Qianjun Li [3] Для отслеживания объектов между кадрами изображения использован алгоритм DeepSort.
Анализ перемещений объекта слежения 2019 Lincon Souza и др. [8] Разработан усовершенствованный подход с использованием дискриминантного анализа Грасемана, включающий проецирование подпространства классов на подпространство обобщенных разностей до отображение на многообразие.
2020 Weizhe Liu, Mathieu Salzmann, Pascal Fua [3] Определяются потоки людей между отдельными локациями в последовательности изображений
2022 Antonio Carlos Cob-Parro и др. [1] На основе композиции сетей с архитектурой MobileNet v2 SSD и LSTM разработан фреймворк для определения действий человека.
2023 Wenhao Wu и др. [9] Разработан фреймворк BIKE, использующий кроссмодальный мост для передачи двунаправленных знаний. Представлены механизмы ассоциации видеоатрибутов и определения временной концепции видео.

Параллельно с ростом количества исследований в области использования НП для анализа видео, растет и количество созданных наборов данных (datasets), позволяющих обучать и оценивать модели. Одними из первых публичных наборов данных являются КТН (2004 г.) и Weizmann (2005 г.), созданные в лабораторных условиях, включающие в себя видео последовательности простых действий, таких как ходьба, бег, прыжки, хлопки руками и т.д. Современные системы анализа видео очень хорошо справляются с распознаванием действий на этих наборах данных, достигая 100%. Более поздние наборы данных, например UCF-50 и UCF-101 (2012 г.), YouTube-VOS (2018 г.), включают более реалистичные видео, собранные из социальных сетей, фильмов и спортивных передач. Наиболее современные наборы данных, например, NTU RGB+D 120 (2019 г.) создавались с учетом специфики глубокого обучения, требующего очень большого количества данных для достижения высокой точности. Многие из указанных наборов не являются статичными и постоянно дополняются новыми данными.

Сравнение точности различных подходов

Для определения эффективности применения НП в задачах распознавания действий человека на видео было проведено аналитическое сравнение основных подходов [1], [2], [5]. Результаты анализа литературных источников сведены в таблицу 2.

Таблица 2 – Сравнение точности различных подходов при распознавании действий человека

Основной подход Парадигма* Точность
MobileNetV2-SSD + LSTM DL 99.06%
Bag of Visual Words (BoVW) + Support Vector Machine (SVM) ML 96.52%
Deep Belief Network (DBN) DL 94.3%
Independent Subspace Analysis (ISA) + Norm-thresholding NN 93.9%
Harris3D + Histograms of Optic Flow (HOF) T 92.1%
Harris3D + Histograms of Gradient Orientations (HOG)/HOF T 91.8%
Hierarchical Model and X (HMAX) ML 91.7%
3D CNN DL 90.2%
Cuboids + ISA NN 90.0%
Gated Restricted Boltzmann Machines (GRBM) ML 90.0%
Dense + HOF ML 88.0%
probabilistic Latent Semantic Analysis (pLSA) ML 83.3%
Volumetric ML 62.7%

*ML – машинное обучение, NN – нейронная сеть, DL – глубокое обучение, T – классические методы.

В результате проведенного анализа можно отметить, что при сравнении решений, полученных с помощью классических методов и нейросетевых подходов (ML, NN, DL), последние дают значительно большую точность.

Следует отметить, что применение методов глубокого обучения обладает определенными недостатками. Одним из них является высокая вычислительная сложность, обусловленная миллионами параметров (весов). Кроме этого, эффективность обучения зависит от рациональных значений гиперпараметров. Подбор этих значений является отдельной сложной задачей, для решения которой существуют различные походы, например, применение традиционных оптимизационных методов. Также для достижения высокой точности работы видеоаналитической системы требуется большое количество разнообразных и репрезентативных данных для обучения нейросетевой модели. Частично данная проблема решается при помощи дообучения предобученных моделей (transfer learning).

Выводы

В результате проведенного исследования выявлено, что в последние годы демонстрируется рост интереса к нейросетевому подходу в контексте анализа видео, а также наблюдается увеличение точности используемых методов.

При выборе метода решения конкретной задачи предлагается выполнить такую последовательность действий:

  1. Определить требования задачи. На этом этапе необходимо четко определить цели и требования задачи распознавания видео (тип объектов, требуемую точность, условия окружающей среды, скорость обработки видео и др.).
  2. Провести анализ данных. Необходимо оценить объем и качество данных, их разнообразие, наличие разметки и т. д. Это поможет определить, какой тип модели или алгоритма может быть наиболее подходящим.
  3. Исследовать существующие методы. На этом этапе проводится обзор существующих методов и оценивается их применимость к конкретной задаче. Это может включать в себя проведение экспериментов на тестовых данных или использование инструментов для оценки производительности моделей.

Эти шаги позволят выбрать эффективный подход или их комбинацию для решения задачи распознавания видео. Последующие этапы включают в себя донастройку параметров выбранной модели, проведение экспериментов, тестирование ее эффективности.

В целом применение нейросетевых подходов позволяет повысить эффективность при решении видеоаналитических задач.

Литература

  1. Antonio Carlos Cob-Parro et al. A new framework for deep learning video based Human Action Recognition on the edge. //Expert Systems with Applications, Volume 238, Part E –2022.
  2. Aslan, M.F., Durdu, A. & Sabanci, K. Human action recognition with bag of visual words using different machine learning methods and hyperparameter optimization. //Neural Comput & Applic 32, 8585–8597. – 2020.
  3. Liu W., Salzmann M., Fua P. Estimating people flows to better count them in crowded scenes //Computer Vision–ECCV 2020: 16th European Conference, Glasgow, UK, August 23–28, 2020, Proceedings, Part XV 16. – Springer International Publishing, 2020. – C. 723-740.
  4. Liu Z. et al. Video swin transformer //Proceedings of the IEEE/CVF conference on computer vision and pattern recognition. – 2022. – C. 3202-3211.
  5. Pham H. H. et al. Video-based human action recognition using deep learning: a review //arXiv preprint arXiv:2208.03775. – 2022.
  6. Qianjun Li Advanced people flow monitoring and gender classification: A joint application of YOLO, DeepSORT, and convolutional neural networks // Proceedings of the 2023 International Conference on Machine Learning and Automation. – 2023.
  7. Shengyong Ch., Yingkun X., Xiaolong Zh., Fenfen Li. Deep Learning for Multiple Object Tracking: A Survey. // IET Computer Vision. 2019. Vol. 13.
  8. Souza L. S. et al. Enhanced Grassmann discriminant analysis with randomized time warping for motion recognition //Pattern Recognition. – 2020. – T. 97. – C. 107028.
  9. Wenhao Wu et al. Bidirectional Cross-Modal Knowledge Exploration for Video Recognition with Pre-trained Vision-Language Models. – 2023 – arXiv:2301.00182v2 [cs.CV] 25 Mar 2023
  10. Zhao L. et al. VideoPrism: A Foundational Visual Encoder for Video Understanding //arXiv preprint arXiv:2402.13217. – 2024.