По мере роста населения мира преступность и отсутствие безопасности быстро растут в городских районах [1]. В целях борьбы с преступностью и усиления безопасности, с 1960-х годов было разработано несколько систем распознавания лиц: от традиционных методов извлечения признаков до передовых моделей на основе глубокого обучения. Эти системы повышают безопасность, обеспечивая наблюдение в реальном времени и оперативную идентификацию людей, что способствует более быстрому раскрытию дел, предотвращению преступлений, а также эффективной идентификации [2]. Однако их эффективность зависит от различных факторов, таких как управление шумом, условия освещения, размытость изображения и справедливость алгоритмов [3]. Технология распознавания лиц опирается на уникальность лица человека, и этот подход идет еще дальше, учитывая историю криминальной деятельности человека [4]. Типичная система распознавания лиц состоит из следующих ключевых этапов: обнаружение лица, предварительная обработка, извлечение признаков и сопоставление лиц [5]. Вклад отдельных этапов описан ниже:
a. Обнаружение лица: Первоначальный шаг заключается в идентификации и определении местоположения лиц в потоке изображений или видео. Обычно для этого используются такие методы, как классификатор Хаара (Haar Cascade) или HOG. Для более точного обнаружения лиц в реальном времени современные системы используют модели на основе глубокого обучения, такие как YOLO и MTCNN [3].
b. Предварительная обработка: Предварительная обработка обеспечивает постоянное качество лица путем корректировки таких вариаций, как: нормализация освещения (где яркость или тени регулируются для улучшения однородности), выравнивание изображения (где лицо выравнивается на основе ключевых ориентиров, например, глаз, носа, для уменьшения вариаций угла) и шумоподавление (где используются фильтры для удаления нежелательного шума и повышения точности извлечения признаков) [6].
c. Извлечение признаков: Этот этап преобразует необработанное изображение лица в вектор признаков, который фиксирует основные атрибуты лица. Методы включают: созданные вручную признаки (где текстуры и структуры лица анализируются алгоритмами, такими как фильтры Габора или LBP) и модели глубокого обучения (где сверточные нейронные сети (CNN) значительно превосходят традиционные методы в сложных обстоятельствах, автоматически извлекая многомерные характеристики) [7].
d. Сопоставление или распознавание лиц: Чтобы идентифицировать или подтвердить личность человека, полученные атрибуты сравниваются с сохраненными данными [8]. Некоторые методы сопоставления включают, но не ограничиваются ими [9]:
Диаграмма на Рисунке 1 изображает типичный процесс обнаружения или распознавания лиц. Однако эффективность процесса распознавания, представленного на Рисунке 1, сильно зависит от шума, присутствующего на изображении. Эти шумы присущи изображению, что затрудняет процесс распознавания лиц. Таким образом, это приводит к неточности систем распознавания лиц. В связи с этим данное исследование представляет собой обзор различных подходов к шумоподавлению и их влияния на точность с целью развертывания устойчивой к шуму системы распознавания лиц в реальных приложениях.
Вклад данного обзора заключается в следующем:
Остальная часть статьи организована следующим образом: Раздел 2 подробно описывает основные концепции и типы алгоритмов. Раздел 3 представляет соответствующие обзоры для этого исследования, в то время как Раздел 4 представляет обсуждение результатов. Наконец, в Разделе 5 авторы резюмируют выводы и рекомендации для будущей работы.
Шум можно определить как любые нежелательные особенности, которые затрудняют идентификацию кого-либо или чего-либо на изображении [6]. Типы и интенсивность этих шумов различаются. Обычно изображение имеет шум, который необходимо отфильтровать. На изображения могут влиять различные источники шума. Эти типы шума включают, но не ограничиваются ими:
Шум «соль и перец», размытие, спекл-шум и гауссов шум [10]. Спекл-шум возникает, когда пиксели умножаются на случайный фактор из-за случайного мультипликативного шума. Размытие возникает в результате затуманенности или нерезкости изображения, обычно из-за движения камеры или других элементов. Спекл-шум, который включает темновой ток, шум считывания и тепловой шум, обычно вызывается датчиком камеры [11]. Гауссов шум — это статистический шум, который имеет функцию плотности вероятности (PDF), эквивалентную нормальному распределению. Диаграмма на Рисунке 2 изображает различные типы шума.
Шум на изображениях является критической проблемой в системах распознавания лиц, в основном в вопросах безопасности, и должен быть устранен с помощью алгоритмов и моделей шумоподавления [12]. Передовые модели обычно включают такие методы, как обработка гауссова, равномерного или шума «соль и перец», которые часто встречаются в реальных данных [13]. Эти типы шума влияют как на распределение пикселей, так и на четкость изображений, требуя специальных этапов предварительной обработки для смягчения последствий. Чтобы извлечь надежные характеристики, системы распознавания лиц все чаще используют модели глубокого обучения, в частности сверточные нейронные сети (CNN). Однако CNN могут быть восприимчивы к зашумленным данным, поэтому для улучшения производительности внедряются устойчивые к шуму модели [14].
Некоторые известные алгоритмы, которые используются для удаления шума на изображениях лиц:
i. Методы на основе вейвлетов: Методы шумоподавления на основе вейвлетов широко используются в обработке изображений. Эти методы используют математическую структуру вейвлет-преобразований для разложения изображений на различные частотные компоненты [15]. Путем установки пороговых значений коэффициентов в вейвлет-домене эти методы эффективно подавляют шум, сохраняя важные особенности изображения [16]. Однако одним из ограничений вейвлет-шумоподавления является сложность выбора подходящих порогов, и их производительность может снижаться при сложных паттернах шума.
ii. Блочное сопоставление и 3D-фильтрация (BM3D): BM3D — это популярный алгоритм шумоподавления, который использует как 2D, так и 3D совместную фильтрацию. Он работает путем группировки похожих блоков из 3D-массива данных и применения совместной фильтрации внутри этих групп [17]. BM3D продемонстрировал впечатляющую эффективность шумоподавления, особенно при наличии аддитивного белого гауссова шума. Однако его вычислительная сложность может быть высокой, что делает его менее подходящим для приложений реального времени в системах наблюдения.
iii. Шумоподавляющие автоэнкодеры (DAE): Шумоподавляющие автоэнкодеры — это тип искусственной нейронной сети, обученной восстанавливать чистые изображения из зашумленных входных данных. Эти модели изучают отображение зашумленных данных в чистые, эффективно удаляя шум с изображений в процессе. Делая это, DAE может идентифицировать важные характеристики во входящих данных, игнорируя шум и несущественные детали [18]. Функция потерь DAE выражается следующим образом:
где X представляет чистые входные данные, а X' обозначает зашумленные входные данные. Хотя шумоподавляющие автоэнкодеры показали успех в различных приложениях, обучение глубоких нейронных сетей требует значительных вычислительных ресурсов, и их производительность может быть чувствительна к количеству и типу шума в обучающих данных.
iv. Нелокальные средние (NLM): NLM — это нелокальный алгоритм шумоподавления, который работает путем усреднения значений пикселей похожих участков на изображении. Этот подход использует избыточность изображения для различения шума и реальных признаков. NLM известен своей способностью обрабатывать различные типы шума и является относительно эффективным с вычислительной точки зрения. Однако его производительность может ухудшаться при наличии сильного шума [19].
v. Шумоподавление полной вариации (TV): Шумоподавление полной вариации — это метод регуляризации, направленный на сохранение краев при уменьшении шума на изображениях [20]. Это достигается путем минимизации полной вариации изображения, эффективно сглаживая области с небольшими изменениями при сохранении важных признаков. Шумоподавление TV эффективно с вычислительной точки зрения и подходит для приложений реального времени [21], но оно может чрезмерно сглаживать текстурированные области.
vi. Алгоритмы низкой сложности: Признавая ограничения существующих алгоритмов шумоподавления, недавние исследования акцентировали внимание на разработке моделей низкой сложности. Эти алгоритмы, такие как Локальный бинарный шаблон (LBP) со стековым автоэнкодером (AE), отдают приоритет эффективности без ущерба для эффективности шумоподавления. LBP захватывает локальные паттерны, а стековый AE дополнительно снижает влияние шума, что делает их перспективными кандидатами для приложений реального времени в уличном наблюдении.
vii. Локальный бинарный шаблон (LBP): Это дескриптор текстуры, широко используемый в анализе изображений и компьютерном зрении [22]. Он работает путем присвоения бинарного кода каждому пикселю на изображении на основе относительной интенсивности его соседей [23]. LBP — это простой, но мощный дескриптор признаков для распознавания лиц. Он кодирует информацию о локальной текстуре изображения путем сравнения интенсивности каждого пикселя с его соседями и присвоения бинарного кода. LBP может вычисляться эффективно и устойчив к изменениям освещения и шуму [24]. Математическая основа LBP базируется на концепции однородных шаблонов (uniform patterns), которые представляют собой бинарные шаблоны, имеющие не более двух побитовых переходов от 0 к 1 или наоборот. Например, 00000000, 01110000 и 01011011 являются однородными шаблонами, а 01010101 — нет. Однородные шаблоны составляют около 90% всех возможных шаблонов на естественных изображениях, что снижает размерность и сложность пространства признаков. Некоторые применения LBP включают обнаружение лиц, распознавание лиц, анализ выражения лица, классификацию пола и оценку возраста [25]. Оператор LBP определяется следующим образом:
Где: P — количество соседей, R — радиус, xc представляет центральный пиксель, gp — интенсивность p-го соседа, gc — интенсивность центрального пикселя, а s(z) — ступенчатая функция, определяемая как: s(z) = 1, если z ≥ 0, иначе 0.
viii. Гистограмма направленных градиентов (HOG): Это дескриптор признаков, который часто используется в распознавании лиц и компьютерном зрении из-за его способности захватывать информацию о текстуре и краях. Ориентация градиента в каждой из крошечных ячеек, составляющих изображение, вычисляется HOG. После этого он создает гистограмму этих ориентаций, чтобы изобразить структуру и форму изображения. HOG продемонстрировал успех в различных приложениях, включая распознавание лиц. Исследования [26] внедрили HOG для распознавания лиц в видеопотоке, продемонстрировав его эффективность в сохранении существенных признаков при удалении шума.
Метрики производительности, используемые для оценки этих алгоритмов:
1. PSNR, определяемый уравнением (3):
Где MAX — максимально возможное значение пикселя (например, 255 для 8-битного изображения). MSE (Mean Squared Error) рассчитывается как среднее значение квадратов разностей между соответствующими пикселями оригинального и очищенного от шума изображений.
2. SSIM, определяемый уравнением (4):
Где μx и μy — средние значения исходного и очищенного изображений. σx2 и σy2 — дисперсии, σxy — ковариация. c1 и c2 — константы для избежания нестабильности, когда знаменатель близок к нулю.
В этом подразделе представлен обзор соответствующих работ. Работы выбраны случайным образом, без какого-либо порядка превосходства. Однако случайно выбранные работы — это те, в которых использовался один или комбинация существующих алгоритмов для удаления шума с изображений лиц. В Таблице 1 суммированы все результаты, обсужденные в этом разделе.
| № | Автор, Год, Название | Проделанная работа | Наблюдаемое ограничение |
|---|---|---|---|
| 1 | [9] Face Recognition Using Machine Learning (Распознавание лиц с использованием машинного обучения) | Использованы методы машинного обучения для создания структуры распознавания лиц. | Требуется настройка типов предварительных фильтров для каждого типа шума. Универсальных фильтров может быть недостаточно для надежного распознавания в различных условиях окружающей среды, что требует адаптивной настройки типов предварительных фильтров. |
| 2 | [15] Wavelet-Based Feature Enhancement for Face Recognition (Улучшение признаков на основе вейвлетов для распознавания лиц) | Исследован метод улучшения признаков на основе вейвлетов для распознавания лиц. | Производительность падает при сложном или смешанном шуме. Несмотря на обнадеживающие результаты в контролируемых средах, эффективность подхода значительно ухудшалась при воздействии сложных или смешанных источников шума, что говорит об ограничениях в реальных динамических сценариях городского мониторинга. |
| 3 | [27] Comparative evaluations of denoising algorithms (Сравнительная оценка алгоритмов шумоподавления) | Проведены сравнительные оценки алгоритмов шумоподавления для улучшения результатов распознавания лиц. В заметном исследовании сравнивалась производительность традиционных методов (фильтры Гаусса, медианные) с передовыми метриками (PSNR, SSI). Результаты показали, что алгоритмы на основе глубокого обучения, особенно CNN, превзошли традиционные методы. | Не затрагивает конкретно проблемы в сценариях городского наблюдения. |
| 4 | [28] Data-driven denoising technique leveraging generative adversarial networks (GANs) (Метод шумоподавления на основе данных с использованием GAN) | Внедрен метод шумоподавления на основе данных с использованием генеративно-состязательных сетей (GAN). Модель продемонстрировала беспрецедентную производительность в сохранении мелких деталей при устранении шума. | Ограниченное обсуждение применимости алгоритма к проблемам шумоподавления уличных изображений. |
| 5 | [29] Hybrid model for handling diverse noise sources in real-world urban scenarios (Гибридная модель для обработки различных источников шума в реальных городских сценариях) | Представлена гибридная модель, сочетающая статистические методы с методами машинного обучения для шумоподавления изображений лиц, полученных в реальных городских сценариях. Исследование подчеркнуло важность адаптации алгоритмов шумоподавления к сложностям городских условий наблюдения. | Ограниченное обсуждение производительности модели при конкретных проблемах шумоподавления уличных изображений. |
| 6 | [30] Image Denoising for Video Surveillance Cameras Based on Deep Learning Techniques (Шумоподавление изображений для камер видеонаблюдения на основе методов глубокого обучения) | Разработана система автоматического шумоподавления изображений, где оценивались различные методы глубокого обучения с точки зрения их влияния на качество обнаружения/распознавания объектов для очистки изображений, затронутых неблагоприятными погодными условиями. | Сконцентрировано на объектах, не хватает распознавания лиц. |
| 7 | [31] Comprehensive comparison between traditional denoising techniques and machine learning-based methods (Всестороннее сравнение традиционных методов шумоподавления и методов на основе машинного обучения) | Проведен тщательный анализ, противопоставляющий современные алгоритмы на основе машинного обучения традиционным методам шумоподавления. Исследование оценивало устойчивость к различным видам шума, точность и вычислительную эффективность, и пришло к выводу, что современные алгоритмы работают заметно лучше старых, особенно в сложных сценариях городского наблюдения. | Ограниченное исследование алгоритмов шумоподавления в условиях конкретных городских проблем, таких как окклюзии, низкая освещенность и плохое качество изображения. |
| 8 | [32] Local Binary Patterns and Its Application to Facial Analysis (Локальные бинарные шаблоны и их применение к анализу лиц) | Одновременно исследовалась функция локальных бинарных шаблонов (LBP) в распознавании лиц, подчеркивая, насколько хорошо она работает как простая, но мощная техника для извлечения признаков и описания текстуры. Их исследование подтвердило, что LBP и его вариации широко используются в повседневных биометрических системах и системах аутентификации из-за их надежной работы и простоты вычислений. | Исследование применения LBP к уличным изображениям показало восприимчивость к шуму. |
| 9 | [33] Proposed a novel hybrid model incorporating elements of deep learning and fuzzy logic (Предложена новая гибридная модель, включающая элементы глубокого обучения и нечеткой логики) | Предложен новый гибридный метод шумоподавления, сочетающий нечеткую логику и глубокое обучение. Хотя модель показала замечательную эффективность шумоподавления в условиях городского наблюдения, исследование не выявило обсуждения того, как она справлялась с конкретными трудностями шумоподавления уличных изображений в реальном мире. | Ограниченное обсуждение производительности модели при обработке конкретных проблем шумоподавления уличных изображений для реального развертывания. |
| 10 | [34] Comparative evaluations of denoising algorithms (Сравнительная оценка алгоритмов шумоподавления) | Исследованы различные алгоритмы шумоподавления для определения того, как они влияют на точность распознавания лиц. Хотя выводы исследования были проницательными, не обсуждалось, как эти алгоритмы могут быть использованы в реальных сценариях развертывания. | Ограниченное обсуждение применимости оцененных алгоритмов к реальным условиям городского наблюдения. |
| 11 | [35] An evaluation of denoising techniques and classification of biometric images based on deep learning (Оценка методов шумоподавления и классификации биометрических изображений на основе глубокого обучения) | Представлена оценка методов шумоподавления в сочетании с категоризацией биометрических изображений на основе методологий глубокого обучения. Исследование продемонстрировало, как модели глубокого обучения могут улучшить качество изображения, но не анализировало тщательно различные проблемы шума, часто присутствующие в уличной фотографии. | Отсутствие более широкой оценки, охватывающей различные проблемы шумоподавления, встречающиеся на уличных изображениях. |
Результаты синтезируются и обсуждаются по основным алгоритмическим категориям для определения конкретных требований, адаптированных к реальному развертыванию устойчивой к шуму системы распознавания лиц.
Обзор показал, что классические методы, такие как BM3D и вейвлет-преобразования, остаются конкурентоспособными благодаря своим сильным возможностям сохранения текстуры и низкой сложности модели. BM3D продемонстрировал улучшенную точность и был особенно эффективен на полутоновых изображениях лиц. Вейвлет-методы сохраняли краевые признаки с хорошей точностью. Однако оба метода показали ухудшение производительности в присутствии структурированного или смешанного шума и не обладали адаптивностью для развертывания в реальном времени или в условиях ограниченных ресурсов из-за вычислительных накладных расходов.
Было обнаружено, что улучшения на основе локальных бинарных шаблонов (LBP) предлагают улучшение на 28% по сравнению со стандартными методами LBP с минимальными вычислительными затратами, что делает их подходящими для встраиваемых или маломощных систем, хотя они работают хуже на цветных или входных данных высокого разрешения по сравнению с HoG.
Превосходная устойчивость к шуму и возможности адаптивного обучения обеспечиваются моделями на основе глубокого обучения, в частности стековыми шумоподавляющими автоэнкодерами (Stacked Denoising Autoencoders, SDAE). Тем не менее, они чувствительны к архитектурной настройке и требуют большого объема обучающих данных. В свете этих выводов интеграция стековых автоэнкодеров и гистограммы направленных градиентов (HoG) предлагается как легковесное развертывание устойчивой к шуму системы распознавания лиц.
Как отмечалось, традиционные методы, такие как BM3D, вейвлет-преобразования и варианты локальных бинарных шаблонов, остаются весьма актуальными для сред с ограниченными ресурсами, предлагая конкурентоспособную производительность с минимальными вычислительными накладными расходами. Для сценариев, включающих непарные данные или ограниченную доступность истинных данных (ground-truth), подходы неконтролируемого обучения, такие как Cycle GAN и Noise2Noise, предоставляют гибкие альтернативы. Однако для систем с низким энергопотреблением и развертывания с ограниченными ресурсами, как наблюдалось, наиболее подходящим является стековый автоэнкодер.
Поэтому в качестве будущего направления и реального развертывания распознавания лиц на городских улицах авторы рассмотрят интеграцию стекового автоэнкодера и HoG. Сочетание абстрактных, инвариантных к шуму представлений от автоэнкодеров с пространственной точностью и характеристиками сохранения краев HoG может привести к сбалансированному и надежному конвейеру признаков для реального развертывания. Цель этой гибридной структуры — объединить сохраняющее края, пространственно чувствительное извлечение признаков HoG с возможностями шумоподавления автоэнкодеров. Методология позволит преодолеть разрыв между инновациями в исследованиях и практической реализацией в реальных ситуациях городского наблюдения, повысив адаптивность, надежность и вычислительную эффективность, одновременно устраняя недостатки текущих методов в обработке структурированного и смешанного шума.
В данном исследовании представлен специализированный обзор методов шумоподавления, применяемых в системах распознавания лиц для реального развертывания. Этот обзор был сделан в контексте реального городского наблюдения. Результаты подчеркивают преимущества и недостатки традиционных методов, таких как вейвлет-преобразования, которые хорошо сохраняют текстуры, но страдают от структурированного или смешанного шума и ограничений развертывания в реальном времени. Аналогичным образом, улучшения на основе LBP работают хуже в настройках высокого разрешения и цветной визуализации, хотя они эффективны с вычислительной точки зрения. Превосходная устойчивость к шуму и возможности адаптивного обучения обеспечиваются моделями на основе глубокого обучения, в частности стековыми шумоподавляющими автоэнкодерами. Тем не менее, они чувствительны к архитектурной настройке и требуют большого объема обучающих данных. В свете этих выводов предлагается интеграция стековых автоэнкодеров и гистограммы направленных градиентов (HoG) в качестве легковесного развертывания устойчивой к шуму системы распознавания лиц. Будущим направлением для создания надежных систем распознавания лиц в реальном времени является комбинация стековых автоэнкодеров и гистограммы направленных градиентов (HoG).
Авторы хотели бы выразить свою благодарность Директорату ИКТ Западного кампуса Международного университета Кампалы и Факультету науки и технологий KIU за поддержку, оказанную при проведении этого исследования.
Авторы коллективно внесли вклад в концептуализацию, дизайн и выполнение этого журнала. Они работали над составлением и критическим пересмотром статьи для включения значимого интеллектуального контента. Эта рукопись ранее не представлялась и не рецензировалась каким-либо другим журналом или издательской платформой. Кроме того, авторы не имеют никакой аффилиации с какой-либо организацией, которая имеет прямой или косвенный финансовый интерес в предмете, обсуждаемом в этой рукописи.