Хрюкин Е.А., Мартыненко Т.В., Васяева Т.А. Использование нейросетевого подхода в видеоаналитических системах. В статье рассматривается использование нейросетевых моделей для анализа видеоинформации и их применение в видеоаналитических системах. Определены основные парадигмы нейросетевого подхода, анализируются различные типы нейросетевых моделей в контексте видеоаналитических систем. Работа подчеркивает значимость нейросетевого подхода в развитии видеоаналитических систем и его потенциал для улучшения эффективности и точности анализа видеоинформации.
Khriukin Y.A., Martynenko T.V., Vasyaeva T.A. Using a neural network approach in video analytical systems. The article explores the use of neural network models in analysing video information and their application in video analytical systems. It outlines the main paradigms of the neural network approach and analyses various types of neural network models within the realm of video analytical systems. The study highlights the importance of using a neural network approach to advance video analytics systems, which has the potential to improve the efficiency and accuracy of video information analysis.
машинное обучение, нейросетевой подход, глубокое обучение, распознавание видео.
machine learning, neural network approach, deep learning, video recognition.
Для повышения уровня "интеллекта" и эффективности современных видеоаналитических подходов, расширения их возможностей, применяются различные методы искусственного интеллекта. Самым перспективным направлением является использование нейросетевого подхода (НП).
Эти особенности делают НП одним из наиболее перспективных и эффективных для разработки современных видеоаналитических систем.
Основные архитектуры моделей, используемые в НП: свёрточные нейронные сети (CNN), рекуррентные нейронные сети (RNN), сети долгой краткосрочной памяти (LSTM), сети глубокого обучения на основе внимания (Attention-based models), генеративные состязательные сети (GAN), трансформеры (Transformers), 3D сверточные нейронные сети (3D CNN).
Отличаются они, в основном способностью учитывать пространственные и временные зависимости, обработкой последовательных данных, использованием механизма внимания (attention) и специализацией на конкретных типах признаков. Следует отметить, что в настоящее время все архитектуры используются при анализе видео.
Основными задачами, решаемыми в рамках компьютерных систем анализа видеоинформации (КСАВИ), являются: автоматическое распознавание объектов сцены, интерпретация и извлечение полезной информации из видеоданных для различных целей, включая безопасность, наблюдение, медицину, рекламу и другие области.
Рис. 1. Обобщенная функциональная схема КСАВИ
Обобщенную функциональную схему КСАВИ можно представить как последовательность этапов: предварительная обработка, обнаружение и захват объектов интереса, слежение за объектом интереса, анализ перемещений объекта. Каждый из указанных этапов представляет собой отдельную сложную задачу в обработке и анализе видеоинформации.
Первый из этапов, указанных на схеме, отражает процессе формирования последовательности цифровых изображений (кадров) с помощью различных отображающих систем. При этом существуют различные стратеги формирования последовательности кадров. Например, для экономии вычислительных ресурсов извлекается каждый N-ый кадр видеоряда. В результате формирования видеопоследовательности, кадры обычно подвергаются воздействию различных случайных помех и шумов, которые необходимо уменьшить на этапе предварительной обработки.
На следующем этапе происходит разбиение исходного изображения на набор непустых непересекающихся связанных подмножеств в соответствии с некоторым условием (например, критерий однородности, основанный на оценке максимальной разности яркости отдельного пикселя и среднего значения яркости, вычисленного по соответствующей области). Следующий этап производит расчет признаков выделенных объектов, который позволяет осуществить дальнейшее слежение за каждым из найденных объектов. Рассчитываются пространственно-временные характеристики движения, а также определяется контекст сцены. На последних этапах происходит анализ перемещений объекта и представление его полезной составляющей в виде, удобном для специалиста.
В контексте решения видеоаналитических задач нейросетевой подход становится важным инструментом, обеспечивающим возможность автоматизированного и высокоэффективного анализа информации. Существующие на данный момент подходы, основанные на нейронных сетях, могут охватывать как отдельные этапы из обобщенной функциональной схемы КСАВИ, так и объединять в себе несколько функциональных блоков.
В последние десятилетия нейросетевые подходы привлекают все большее внимание в области анализа видео, предлагая инновационные и эффективные методы обработки и интерпретации видеоинформации. Количество исследований в области НП растет с каждым годом.
Рис. 2. Временная зависимость количества статей по использованию нейросетевого подхода в задачах анализа видео
Наиболее значимые работы, посвященные использованию НП в анализе видео, сведены в таблицу 1.
| Этап анализа видео | Год | Исследователи | Описание |
|---|---|---|---|
| Обнаружение и захват объектов интереса | 2021 | Ze Liu и др. [4] | Предложена пространственно-временная адаптация архитектуры Swin Transformer для целей распознавания видео. |
| 2023 | Qianjun Li [6] | В основе системы лежит CNN YOLOv8 | |
| 2024 | Long Zhao и др. [10] | Разработана система VideoPrism, видеокодировщик общего назначения, позволяющий решать различные задачи понимания видео с помощью одной модели. | |
| Слежение за объектом интереса | 2019 | Shengyong Ch и др. [7] | Произведен аналитический обзор основных методов трекинга объектов, использующих методы МО. |
| 2023 | Qianjun Li [3] | Для отслеживания объектов между кадрами изображения использован алгоритм DeepSort. | |
| Анализ перемещений объекта слежения | 2019 | Lincon Souza и др. [8] | Разработан усовершенствованный подход с использованием дискриминантного анализа Грасемана, включающий проецирование подпространства классов на подпространство обобщенных разностей до отображение на многообразие. |
| 2020 | Weizhe Liu, Mathieu Salzmann, Pascal Fua [3] | Определяются потоки людей между отдельными локациями в последовательности изображений | |
| 2022 | Antonio Carlos Cob-Parro и др. [1] | На основе композиции сетей с архитектурой MobileNet v2 SSD и LSTM разработан фреймворк для определения действий человека. | |
| 2023 | Wenhao Wu и др. [9] | Разработан фреймворк BIKE, использующий кроссмодальный мост для передачи двунаправленных знаний. Представлены механизмы ассоциации видеоатрибутов и определения временной концепции видео. |
Параллельно с ростом количества исследований в области использования НП для анализа видео, растет и количество созданных наборов данных (datasets), позволяющих обучать и оценивать модели. Одними из первых публичных наборов данных являются КТН (2004 г.) и Weizmann (2005 г.), созданные в лабораторных условиях, включающие в себя видео последовательности простых действий, таких как ходьба, бег, прыжки, хлопки руками и т.д. Современные системы анализа видео очень хорошо справляются с распознаванием действий на этих наборах данных, достигая 100%. Более поздние наборы данных, например UCF-50 и UCF-101 (2012 г.), YouTube-VOS (2018 г.), включают более реалистичные видео, собранные из социальных сетей, фильмов и спортивных передач. Наиболее современные наборы данных, например, NTU RGB+D 120 (2019 г.) создавались с учетом специфики глубокого обучения, требующего очень большого количества данных для достижения высокой точности. Многие из указанных наборов не являются статичными и постоянно дополняются новыми данными.
Для определения эффективности применения НП в задачах распознавания действий человека на видео было проведено аналитическое сравнение основных подходов [1], [2], [5]. Результаты анализа литературных источников сведены в таблицу 2.
| Основной подход | Парадигма* | Точность |
|---|---|---|
| MobileNetV2-SSD + LSTM | DL | 99.06% |
| Bag of Visual Words (BoVW) + Support Vector Machine (SVM) | ML | 96.52% |
| Deep Belief Network (DBN) | DL | 94.3% |
| Independent Subspace Analysis (ISA) + Norm-thresholding | NN | 93.9% |
| Harris3D + Histograms of Optic Flow (HOF) | T | 92.1% |
| Harris3D + Histograms of Gradient Orientations (HOG)/HOF | T | 91.8% |
| Hierarchical Model and X (HMAX) | ML | 91.7% |
| 3D CNN | DL | 90.2% |
| Cuboids + ISA | NN | 90.0% |
| Gated Restricted Boltzmann Machines (GRBM) | ML | 90.0% |
| Dense + HOF | ML | 88.0% |
| probabilistic Latent Semantic Analysis (pLSA) | ML | 83.3% |
| Volumetric | ML | 62.7% |
*ML – машинное обучение, NN – нейронная сеть, DL – глубокое обучение, T – классические методы.
В результате проведенного анализа можно отметить, что при сравнении решений, полученных с помощью классических методов и нейросетевых подходов (ML, NN, DL), последние дают значительно большую точность.
Следует отметить, что применение методов глубокого обучения обладает определенными недостатками. Одним из них является высокая вычислительная сложность, обусловленная миллионами параметров (весов). Кроме этого, эффективность обучения зависит от рациональных значений гиперпараметров. Подбор этих значений является отдельной сложной задачей, для решения которой существуют различные походы, например, применение традиционных оптимизационных методов. Также для достижения высокой точности работы видеоаналитической системы требуется большое количество разнообразных и репрезентативных данных для обучения нейросетевой модели. Частично данная проблема решается при помощи дообучения предобученных моделей (transfer learning).
В результате проведенного исследования выявлено, что в последние годы демонстрируется рост интереса к нейросетевому подходу в контексте анализа видео, а также наблюдается увеличение точности используемых методов.
При выборе метода решения конкретной задачи предлагается выполнить такую последовательность действий:
Эти шаги позволят выбрать эффективный подход или их комбинацию для решения задачи распознавания видео. Последующие этапы включают в себя донастройку параметров выбранной модели, проведение экспериментов, тестирование ее эффективности.
В целом применение нейросетевых подходов позволяет повысить эффективность при решении видеоаналитических задач.