Journal of Computer Allied Intelligence
ISSN: 2584-2676
Vol.02(06), Декабрь 2024, стр. 65-78

Профильное распознавание и классификация лиц с использованием многозадачных каскадных сверточных сетей

Шриниваса Саи Абхиджит Чаллапалли1,*, Бала Кандукури2, Хари Бандиредди3 и Джахнави Пуди4
1,2,3 Студент, Техасский университет в Арлингтоне, Арлингтон, Техас, Соединенные Штаты Америки.
* Автор для корреспонденции: Srinivasa Sai Abhijit Challapalli. Email: abhijitchallapalli99@gmail.com
Аннотация: В данной статье представлен глубокий анализ многозадачных каскадных сверточных сетей (MTCNN) для распознавания лиц, с акцентом на обнаружение и классификацию как фронтальных лиц, так и лиц в профиль. MTCNN, известная своей способностью одновременно выполнять обнаружение лиц, локализацию ориентиров и выравнивание лица, оценивается с помощью серии экспериментов. Мы оцениваем её производительность по ключевым параметрам, включая косинусное сходство, уверенность обнаружения, время обработки и метрики точности, такие как истинно положительные и ложно положительные результаты. Результаты показывают, что MTCNN превосходно справляется с распознаванием фронтальных лиц с высокой точностью и быстрым временем обработки, достигая отличной уверенности обнаружения и низкого уровня ложных срабатываний. Хотя система также хорошо работает при распознавании бокового профиля, в более сложных случаях наблюдаются некоторые проблемы с ложными срабатываниями. Это оценивается с использованием декартовой системы координат вместе с углами между левым глазом, правым глазом и носом в 2D евклидовом пространстве. Оценка проводилась на нашем собственном наборе данных, так как мы не смогли найти подходящего для этого подхода, с точностью 84,7%. Мы также использовали классификатор для этого подхода, называемый классификатором «Случайный лес» (Random Forest Classifier). Предлагаемый подход включает интеграцию нашего набора данных в модель MTCNN, которая эффективно извлекает ключевые признаки и распознает ориентиры лица. Извлеченные атрибуты организованы в структурированный кадр данных с соответствующими метками классов, которые служат входными данными для классификатора Random Forest. Этот классификатор эффективно обучается классифицировать и обнаруживать лица, используя извлеченные черты лица для выявления связей и закономерностей в данных. Применение передовых методов глубокого обучения для извлечения признаков, наряду с интерпретируемостью и эффективностью классификатора Random Forest, являются важными аспектами этой стратегии. Сочетание этих методов обеспечивает надежный и расширяемый подход к проблемам распознавания лиц, подходящий для различных практических применений, таких как идентификация биометрической информации, безопасность и наблюдение.
Ключевые слова: Обнаружение лиц, Модель MTCNN, Ориентиры, Глубокое обучение, Классификация, Косинус.

1. Введение

Распознавание лиц — это биометрическая технология, которая идентифицирует или верифицирует людей на основе их черт лица [1]. Этот процесс включает захват изображения или видео лица, обнаружение ключевых ориентиров лица, таких как глаза, нос и рот, и извлечение уникальных паттернов или дескрипторов [11]. Эти паттерны затем сравниваются с сохраненными базами данных для аутентификации или идентификации. Эта интеграция компьютерного зрения делает распознавание лиц высокоточным и эффективным, позволяя использовать его в системах безопасности, разблокировке смартфонов и персонализированном опыте [12]. Синергия между компьютерным зрением и глубоким обучением значительно повысила надежность распознавания лиц, даже в сложных условиях, таких как различное освещение, углы и выражения, одновременно поднимая важные дискуссии о конфиденциальности и этичном использовании. Сверточные нейронные сети (CNN) произвели революцию в области компьютерного зрения, обеспечив высокоэффективное извлечение признаков и анализ изображений [13]. Их многослойная архитектура, включающая сверточные слои, слои пулинга и полносвязные слои, позволяет CNN автоматически изучать иерархические паттерны из сырых данных изображений. Это делает их особенно подходящими для таких задач, как классификация изображений, обнаружение объектов и распознавание лиц. В распознавании лиц CNN извлекают отчетливые черты лица, такие как контуры глаз, носа и рта, и кодируют их в многомерные представления для точного сопоставления [14]. Их способность обрабатывать вариации в масштабе, ориентации и освещении значительно повысила точность систем компьютерного зрения. CNN также способствовали прорывам в области автономных транспортных средств, медицинской визуализации и дополненной реальности, закрепив свою роль краеугольного камня в современном искусственном интеллекте [15].

В областях ИИ и компьютерного зрения распознавание лиц приобрело большое значение. Точные и эффективные системы для распознавания лиц находятся в изобилии из-за растущего спроса на безопасность и индивидуальное внимание [16]. В данной статье рассматривается применение MTCNN (Multi-Task Cascaded Convolutional Networks) для распознавания профиля лица. Это каскадная архитектура сверточных нейронных сетей. Алгоритмы распознавания лиц имеют множество подходов, которые мы попытались использовать для обнаружения лиц, что по сути представляет собой серию простых блоков отклонения [17]. Это может быть приложение, способное идентифицировать или проверять человеческое лицо на видео или изображении. Хотя были представлены различные методы и достигнут прогресс, существует несколько проблем, препятствующих достижению соответствующей точности. Проблемы могут заключаться во внешнем виде, таком как условия освещения, шум в пикселях изображения, масштаб и т. д. [18]. В этой статье используется алгоритм MTCNN, который имеет нашу собственную базу данных и другие передовые методы обработки изображений. Универсальность CNN в распознавании лиц распространяется на такие задачи, как обнаружение лиц в реальном времени, распознавание эмоций и отслеживание, что делает их бесценными в таких областях, как наблюдение, здравоохранение и развлечения [19-20]. Передовые архитектуры, такие как ResNet и VGGNet, еще больше повышают производительность, позволяя создавать более глубокие сети, которые улавливают сложные паттерны в данных лица. Кроме того, CNN облегчили интеграцию распознавания лиц в мобильные и периферийные (edge) устройства путем оптимизации моделей для сред с ограниченными ресурсами без ущерба для точности.

Предлагаемая методология
Рисунок 1: Предлагаемая методология

2. Предложенная MTCNN для распознавания лиц

Изначально vgg16. VGG16 состоит из 16 слоев, отсюда и название «VGG16». Эти слои включают сверточные слои, слои макс-пулинга и полносвязные слои. Сверточные слои используют малые рецептивные поля (3x3) с шагом 1, и за ними следуют функции активации выпрямленной линейной единицы (ReLU). Эти слои отвечают за изучение признаков на разных уровнях абстракции. Слои макс-пулинга чередуются между сверточными слоями для уменьшения пространственных размеров и контроля переобучения, обеспечивая инвариантность к сдвигу. Полносвязные слои в конце сети выполняют рассуждения высокого уровня и принятие решений на основе признаков, изученных сверточными слоями. Размер весов VGG-16, обученной на imageNet, составляет 528 МБ. Таким образом, она занимает довольно много дискового пространства и пропускной способности, что делает её неэффективной. Следовательно, Multi-task Cascaded Convolutional Networks (MTCNN) является фреймворком, разработанным как решение для обнаружения лиц и выравнивания лиц.

Процесс состоит из фреймворка Multi-task Cascaded Convolutional Networks (MTCNN), который разработан для выполнения эффективного и точного обнаружения лиц и выравнивания путем объединения трех взаимосвязанных сверточных сетей. Эти сети работают в каскадном режиме для постепенного уточнения результатов. Метод включает три ключевых этапа:

  1. Proposal Network (P-Net): Первый этап обнаруживает кандидатов областей лица путем выполнения быстрого сканирования входного изображения с использованием неглубокой CNN. Он генерирует предложения ограничивающих рамок и их оценки уверенности. Затем применяется подавление немаксимумов (NMS) для устранения перекрывающихся рамок и сохранения наиболее вероятных кандидатов.
  2. Refine Network (R-Net): Второй этап обрабатывает выходные данные P-Net, уточняя ограничивающие рамки и дополнительно уменьшая количество ложных срабатываний. Этот этап улучшает точность локализации путем отклонения областей, не являющихся лицами, сохраняя при этом наиболее вероятных кандидатов для обнаружения лиц.
  3. Output Network (O-Net): Финальный этап выполняет детальный анализ оставшихся областей для вывода окончательных ограничивающих рамок лица и ориентиров. O-Net не только подтверждает обнаружение лица, но и оценивает пять лицевых ориентиров (например, глаза, нос и уголки рта) для точного выравнивания.
Архитектура MTCNN
Рисунок 2: Архитектура MTCNN

Подход MTCNN является многозадачным по своей природе, поскольку он совместно оптимизирует обнаружение лиц и локализацию лицевых ориентиров в едином фреймворке. Это обучение с двумя задачами повышает надежность и точность системы. Используя каскадные сети, MTCNN достигает баланса между вычислительной эффективностью и точностью обнаружения, что делает его пригодным для приложений реального времени. Его эффективность сделала его популярным выбором для таких задач, как распознавание лиц, анализ эмоций и дополненная реальность. Предлагаемый метод идентификации лица представлен на Рисунке 1.

Потери регрессии ограничивающей рамки рассчитываются как среднеквадратичная ошибка между предсказанной ограничивающей рамкой и истинной ограничивающей рамкой, выраженная как в уравнении (1):

$$ L_{box} = \| \hat{y}_{box} - y_{box} \|^2 $$ (1)

Здесь $\hat{y}_{box}$ — предсказанная ограничивающая рамка, $y_{box}$ — истинная ограничивающая рамка, и $N$ — количество ограничивающих рамок. Потеря локализации лицевых ориентиров измеряет разницу между предсказанными лицевыми ориентирами и истинными ориентирами и вычисляется как в уравнении (2):

$$ L_{landmark} = \| \hat{y}_{landmark} - y_{landmark} \|^2 $$ (2)

В уравнении (2) $\hat{y}_{landmark}$ — это предсказанный набор лицевых ориентиров, а $y_{landmark}$ — истинные ориентиры. Общая функция потерь объединяет классификацию, регрессию ограничивающей рамки и потери локализации ориентиров с использованием уравнения (3):

$$ L = L_{cls} + \lambda_{box} L_{box} + \lambda_{landmark} L_{landmark} $$ (3)

В уравнении (3) $L_{cls}$ — это потеря классификации (для различения лиц от не-лиц), а $\lambda_{box}$ и $\lambda_{landmark}$ — весовые коэффициенты для потерь ограничивающей рамки и ориентиров соответственно.

3. Оценка косинусного угла в чертах лица

Во-первых, наш предложенный метод использовал модель лица на основе ориентиров, которая предполагает, что все ориентиры видны. После того как модель выдает ориентиры, мы проводим линию между тремя точками, т.е. правым глазом, левым глазом и носом. Формируя треугольник, и через этот треугольник мы вычисляем углы $\theta_1$ и $\theta_2$. Этот шаг, геометрический объект, который обладает как величиной, так и направлением. Вектор можно представить как стрелку или линию. Его величина — это длина, а направление — это то, куда указывает линия. Величина вектора $a$ обозначается $\|a\|$.

Скалярное (точечное) произведение двух евклидовых векторов $a$ и $b$ определяется следующим образом, где $\theta$ — угол между $a$ и $b$. Иллюстрацию можно увидеть на рисунке 2 (прим. пер.: вероятно, имеется в виду рис. 3). Кроме того, скалярное произведение может быть определено геометрически. Геометрическое определение основано на понятиях угла и расстояния (величины векторов). Эквивалентность этих двух определений опирается на декартову систему координат для евклидова пространства 2D. Оценка косинусного угла — это метод, используемый для оценки сходства между векторами признаков лица в системах распознавания лиц. Он основан на косинусном сходстве, которое измеряет косинус угла между двумя ненулевыми векторами. В контексте черт лица эти векторы обычно получаются из вложений (embeddings) или дескрипторов изображений лиц после извлечения признаков, часто с использованием сверточных нейронных сетей (CNN) или других моделей глубокого обучения. Косинусное сходство между двумя векторами $A$ и $B$ дается уравнением (4):

$$ \text{Cosine Similarity} = \frac{A \cdot B}{\|A\| \|B\|} $$ (4)

В уравнении (4) $A \cdot B$ — это скалярное произведение векторов $A$ и $B$, а $\|A\|$ и $\|B\|$ — это величины (нормы) векторов $A$ и $B$ соответственно. В распознавании лиц, как только изображение лица обрабатывается нейронной сетью, полученный вектор признаков можно сравнить с другими векторами признаков (либо из базы данных, либо из изображения запроса) с использованием косинусного сходства.

Косинус угла между двумя векторами дает меру сходства:

Оценка косинусного угла особенно полезна в распознавании лиц, потому что она фокусируется на направлении векторов признаков, а не на их величине, что делает её устойчивой к вариациям освещения, масштаба и позы. Сравнивая косинус угла между векторами признаков, система может эффективно определить, принадлежат ли два изображения лица одному и тому же человеку, даже если изображения имеют разные условия. На практике оценка косинусного сходства часто используется в качестве порога для определения того, представляют ли два изображения лица одного и того же человека. Если оценка косинусного сходства превышает определенный порог, лица считаются совпадением.

Алгоритм 1: Модель MTCNN для распознавания лиц

# Функция для обнаружения и выравнивания лиц с использованием MTCNN def mtcnn_face_detection_and_alignment(image): # Шаг 1: Использовать Proposal Network (P-Net) для генерации предложений лиц face_proposals = P_Net(image) # Обнаружение потенциальных областей лица # Шаг 2: Применить Non-Maximum Suppression (NMS) для удаления перекрывающихся предложений filtered_faces = apply_nms(face_proposals) # Фильтрация перекрывающихся ограничивающих рамок # Шаг 3: Использовать Refine Network (R-Net) для уточнения рамок и отклонения не-лиц refined_faces = R_Net(filtered_faces) # Уточнение ограничивающих рамок для точности # Шаг 4: Использовать Output Network (O-Net) для дальнейшего уточнения рамок и предсказания ориентиров final_faces_and_landmarks = O_Net(refined_faces) # Обнаружение финальных рамок и ориентиров # Шаг 5: Вернуть обнаруженные лица и их ориентиры return final_faces_and_landmarks # Функция для извлечения признаков из выровненных лиц для распознавания def extract_face_features(face_image): # Шаг 1: Извлечь вектор признаков (embedding) с использованием предварительно обученной модели (например, CNN) feature_vector = extract_features_with_cnn(face_image) # Шаг 2: Вернуть извлеченный вектор признаков return feature_vector # Функция для сравнения двух векторов признаков лиц с использованием косинусного сходства def compare_faces(face_image_1, face_image_2, threshold=0.9): # Шаг 1: Обнаружить и выровнять лица с использованием MTCNN aligned_face_1 = mtcnn_face_detection_and_alignment(face_image_1) aligned_face_2 = mtcnn_face_detection_and_alignment(face_image_2) # Шаг 2: Извлечь векторы признаков из выровненных лиц feature_vector_1 = extract_face_features(aligned_face_1) feature_vector_2 = extract_face_features(aligned_face_2) # Шаг 3: Вычислить косинусное сходство между двумя векторами признаков similarity = cosine_similarity(feature_vector_1, feature_vector_2) # Шаг 4: Если сходство выше порога, считать лица совпадением if similarity >= threshold: return "Match" else: return "No Match" # Пример использования face_image_1 = load_image("face1.webp") face_image_2 = load_image("face2.webp") result = compare_faces(face_image_1, face_image_2)

3.5. Преимущества гибридной модели в контексте окклюзии

Таблица 1: Оценка признаков с помощью MTCNN
Треугольник на лице
(a)
Косинусный угол
(b)
Рисунок 3: MTCNN для признаков лица (a) Формирование треугольника (b) Косинусный угол

Распознавание лиц с помощью MTCNN (Multi-task Cascaded Convolutional Networks) — это надежный и эффективный процесс, объединяющий несколько этапов для обнаружения лиц и выравнивания лицевых ориентиров, обеспечивая точное распознавание лиц, как показано на Рисунке 3(a) и Рисунке 3(b). Процесс начинается с Proposal Network (P-Net), которая сканирует изображение для обнаружения потенциальных областей лица, генерируя предложения ограничивающих рамок. Затем применяется подавление немаксимумов (NMS) для фильтрации избыточных рамок, сохраняя только наиболее вероятные области лица. Далее Refine Network (R-Net) уточняет ограничивающие рамки, устраняя области, не являющиеся лицами, и улучшая точность обнаружения лиц. Затем следует Output Network (O-Net), обнаруживающая ключевые лицевые ориентиры, такие как глаза, нос и рот, которые имеют решающее значение для выравнивания лица. Это выравнивание гарантирует, что черты лица расположены последовательно, минимизируя вариации, вызванные позой, освещением или масштабом. После того как лицо обнаружено и выровнено, сверточная нейронная сеть (CNN) или подобная модель извлекает вектор признаков, представляющий уникальные характеристики лица. Эти векторы признаков, также известные как вложения (embeddings), используются для сравнения лиц. Рассчитывается косинусное сходство или евклидово расстояние между вложениями двух лиц, и если оценка сходства превышает определенный порог, лица считаются совпадением.

4. Результаты и обсуждение

Результаты использования MTCNN для распознавания лиц являются весьма многообещающими, демонстрируя его эффективность в точном обнаружении и выравнивании лиц в различных условиях. Многоступенчатый процесс MTCNN, включающий обнаружение лица, уточнение ограничивающей рамки, локализацию ориентиров и выравнивание, значительно повышает точность распознавания, гарантируя, что лица будут правильно обнаружены и выровнены перед извлечением признаков. Использование P-Net для начальных предложений лиц, R-Net для уточнения областей лица и O-Net для точной локализации ориентиров позволяет MTCNN справляться с широким спектром проблем, таких как различные позы лица, окклюзии и изменения освещения. Эти улучшения в выравнивании лица гарантируют, что признаки, извлеченные последующими моделями, будут более последовательными и репрезентативными для человека, повышая производительность систем распознавания лиц.

Вывод ориентиров Левый профиль
Рисунок 6: Вывод ориентиров     Рисунок 7: Левый профиль (входные данные из Google)

Рисунок 5(a) и Рисунок 5(b) (прим. пер.: вероятно, имеются в виду рис. 6 и 7) демонстрируют вывод использования Multi-task Cascaded Convolutional Networks (MTCNN) для обнаружения лицевых ориентиров и поз из случайно выбранного изображения Google. Поза субъекта идентифицируется как «Левый профиль», и система предоставляет подробные координаты для ключевых лицевых ориентиров, включая глаза и нос. Углы для правого и левого глаз даны как 31.92 и 94.90 градусов соответственно. Этот пример подчеркивает эффективность MTCNN в анализе и обработке черт лица из онлайн-изображений, как показано на Рисунке 6 и Рисунке 7.

Производительность классификации MTCNN
Рисунок 4: Производительность классификации MTCNN
Таблица 2: Классификация с помощью MTCNN для распознавания лиц
Тестовый случай Тип профиля Изображение 1 Изображение 2 Косинусное сходство Уверенность обнаружения Время обработки (с) FP TP Заметки
Тест 1 Фронтальный Face A Face A 0.98 0.99 0.15 0 1 Лица совпадают; распознавание фронтального вида успешно.
Тест 2 Боковой профиль Face B Face B 0.92 0.96 0.18 0 1 Лица совпадают; распознавание бокового профиля точно.
Тест 3 Фронтальный Face A Face B 0.85 0.94 0.16 0 1 Разные люди; фронтальные лица идентифицированы правильно.
Тест 4 Боковой профиль Face C Face D 0.80 0.89 0.20 1 0 Совпадение профиля не удалось; обнаружение бокового профиля эффективно.
Тест 5 Фронтальный Face E Face E 0.96 0.98 0.14 0 1 Лица совпадают; фронтальный вид, высокая точность.
Тест 6 Боковой профиль Face F Face F 0.91 0.93 0.17 0 1 Точное распознавание бокового профиля с надежным результатом.
Тест 7 Фронтальный Face G Face G 0.99 0.99 0.12 0 1 Чрезвычайно высокое совпадение; идеальное распознавание фронтального лица.
Тест 8 Боковой профиль Face H Face I 0.70 0.85 0.19 1 0 Низкий балл совпадения, обнаружен ложноположительный результат.
Тест 9 Фронтальный Face J Face J 0.94 0.97 0.13 0 1 Фронтальное распознавание с высокой точностью и быстрой обработкой.
Тест 10 Боковой профиль Face K Face K 0.89 0.92 0.21 0 1 Успешное совпадение для обнаружения бокового профиля. Надежное обнаружение бокового профиля с умеренным временем обработки.

В Таблице 2 представлены результаты классификации с использованием MTCNN для распознавания лиц, с акцентом на такие параметры, как косинусное сходство, уверенность обнаружения, время обработки, ложноположительные (FP) и истинноположительные (TP) результаты. Эти метрики в совокупности дают представление о точности, скорости и надежности системы распознавания лиц как для фронтальных изображений, так и для изображений бокового профиля. Оценки косинусного сходства, как правило, высоки, что указывает на то, что система способна точно сопоставлять лица. Например, Тест 7, который включает сопоставление фронтального лица, показывает самое высокое косинусное сходство 0.99, в сочетании с уверенностью обнаружения 0.99 и временем обработки всего 0.12 секунды, что подчеркивает как точность, так и скорость системы для распознавания фронтальных лиц. Аналогично, Тест 1 и Тест 5 показывают высокое косинусное сходство (0.98 и 0.96) с соответствующей уверенностью обнаружения 0.99 и 0.98, что еще больше подтверждает надежность и быструю обработку распознавания фронтальных лиц.

Что касается распознавания бокового профиля, система также демонстрирует солидную производительность. Тест 2 и Тест 6 показывают косинусное сходство 0.92 и 0.91, с уверенностью обнаружения 0.96 и 0.93 соответственно, оба с весьма разумным временем обработки около 0.18 секунды и 0.17 секунды. Эти результаты предполагают, что MTCNN эффективно обрабатывает изображения бокового профиля, обеспечивая точные совпадения и умеренную скорость обработки. Однако, Тест 4 и Тест 8 выделяются как случаи с проблемами в распознавании. В Тесте 4 косинусное сходство относительно низкое (0.80) и обнаружен ложноположительный результат, показывающий, что модель неправильно классифицировала один из профилей. Аналогично, Тест 8 показывает косинусное сходство 0.70, с ложноположительным результатом и отсутствием совпадения между лицами, указывая на то, что распознавание бокового профиля все еще может сталкиваться с проблемами, когда изображения значительно различаются. Несмотря на эти проблемы, система постоянно обеспечивает высокие показатели истинноположительных результатов, что свидетельствует о ее надежности для практического применения в задачах распознавания лиц.

5. Заключение

Данная статья демонстрирует эффективность многозадачных каскадных сверточных сетей (MTCNN) для распознавания лиц, уделяя особое внимание обнаружению и классификации как фронтальных лиц, так и лиц в профиль. Результаты подчеркивают способность MTCNN точно обнаруживать и распознавать лица в различных ориентациях с высокой уверенностью обнаружения, надежностью и скоростью обработки. Система работает исключительно хорошо для распознавания фронтальных лиц, достигая высоких оценок косинусного сходства и быстрого времени обработки, обеспечивая как точность, так и эффективность. Для распознавания бокового профиля MTCNN также показывает солидную производительность, хотя иногда возникают проблемы с ложными срабатываниями, особенно когда лица менее четко выровнены или значительно отличаются. Несмотря на эти проблемы, система стабильно обеспечивает высокие показатели истинноположительных результатов, что указывает на ее надежность для практического применения в задачах распознавания лиц.

Благодарности

Не применимо.

Заявление о финансировании

Автор(ы) не получали специального финансирования для этого исследования.

Конфликт интересов

Авторы заявляют об отсутствии конфликта интересов в отношении данного исследования.

Список литературы

[1] S. S. Khan, D. Sengupta, A. Ghosh and A. Chaudhuri, “MTCNN++: A CNN-based face detection algorithm inspired by MTCNN,” The Visual Computer, vol.40, no.2, pp.899-917, 2024.

[2] A.B. Hajira Be, “Feature Selection and Classification with the Annealing Optimization Deep Learning for the Multi-Modal Image Processing,” Journal of Computer Allied Intelligence, vol.2, no.3, pp.55-66, 2024.

[3] B. Sriman, D. J. Wise, S. A. Silviya and S. Bruhathi, “Robust Smart Face Recognition System Based on Integration of Local Binary Pattern (LBP), CNN and MTCNN for Attendance Registration,” In 2023 International Conference on Artificial Intelligence and Knowledge Discovery in Concurrent Engineering (ICECONF), Chennai, India, pp. 1-5, 2023.

[4] V. Srihari, “The Use of Novel MTCNN Over Traditional CNN in a Facial Recognition System to Increase the Accuracy in Screen Time Calculation of an Actor in a Video,” Journal of Survey in Fisheries Sciences, vol.10, no.1S, pp.1497-1507, 2023.

[5] Swapna Saturi and Sandhya Banda, “Advanced Lung Disease Detection and Classification Using Ge-U-Net-ODLwith Gabor Filters and Entropy-Based Feature Selection,” Journal of Sensors, IoT & Health Sciences, vol.2, no.2, pp.69-86, 2024.

[6] S. Tariyal, R. Chauhan, Y. Bijalwan, R. Rawat and R. Gupta, “A comparitive study of MTCNN, Viola-Jones, SSD and YOLO face detection algorithms,” In 2024 International Conference on Intelligent and Innovative Technologies in Computing, Electrical and Electronics (IITCEE), Bangalore, India, pp. 1-7, 2024.

[7] A. Nath, R. Dutta, K. Ghosh, H. Dutta, R. Patra et al., “An MTCNN-Based Attendance Monitoring System Powered by Inception-ResNet-V1,” In Explainable AI for Education: Recent Trends and Challenges, pp. 287-308, 2024.

[8] N. Jantarasorn, J. Whasphuttisit and W. Jitsakul, “Face Recognition using Deep Learning,” In 2023 7th International Conference on Information Technology (InCIT), pp. 470-474, 2023.

[9] P. Lisena, J. Laaksonen and R. Troncy, “Understanding videos with face recognition: a complete pipeline and applications,” Multimedia Systems, vol.28, no.6, pp.2147-2159, 2022.

[10] D. T. Long, “Efficient Multi-Task CNN for Face and Facial Expression Recognition Using Residual Dense Architectures for Application in Monitoring Online Learning,” International Journal of Fuzzy Logic and Intelligent Systems, vol.23, no.3, pp.229-243, 2023.

[11] E. Irfan, C. Jacob and R. Resmi, “Facial Recognition and CCTV Integration for Enhanced Security Using Deep Learning Techniques,” In 2024 IEEE Recent Advances in Intelligent Computational Systems (RAICS), Kothamangalam, Kerala, India, pp. 1-5, 2024.

[12] A. H. Majeed, A. H. Ali, A. A. Al-Hilali, M. S. Jabbar, S. Ghasemi et al., “Behavioral drowsiness detection system execution based on digital camera and MTCNN deep learning,” Bulletin of Electrical Engineering and Informatics, vol.12, no.6, pp.3717-3726, 2023.

[13] Y. S. Dosso, D. Kyrollos, K. J. Greenwood, J. Harrold and J.R.Green, “NICUface: Robust neonatal face detection in complex NICU scenes,” IEEE Access, vol.10, pp.62893-62909, 2022.

[14] I. Al-Amoudi, R. Samad, N.R.H. Abdullah, M. Mustafa and D. Pebrianti, “Automatic attendance system using face recognition with deep learning algorithm,” In Proceedings of the 12th National Technical Seminar on Unmanned System Technology 2020: NUSYS’20, pp. 573-588, 2022.

[15] O. Yakovleva, A. Kovtunenko, V. Liubchenko, V. Honcharenko and O. Kobylin, “Face Detection for Video Surveillance-based Security System,” In COLINS, vol. 3, pp. 69-86, 2023.

[16] X. Luan, Z. Ding, L. Liu, W. Li and X. Gao, “A Symmetrical Siamese Network Framework with Contrastive Learning for Pose-Robust Face Recognition,” IEEE Transactions on Image Processing, vol.32, pp.5652 – 5663, 2023.

[17] R.H. Pailus, “Enhancing Face Recognition Systems by Focusing on Pose Robustness,” In Intelligent Systems Modeling and Simulation III: Artificial Intelligent, Machine Learning, Intelligent Functions and Cyber Security, pp. 477-504, 2024.

[18] R. K. Shukla and A. K. Tiwari, “Masked face recognition using mobilenet v2 with transfer learning,” Computer Systems Science and Engineering, vol.45, no.1, 2023.

[19] L. Kumar and A. Biswanath Saha, “Evaluating the impact of AI-driven project prioritization on program success in hybrid cloud environments,” International Journal of Research in All Subjects in Multi Languages (IJRSML), vol.7, no.1, pp.78-99, 2019.

[20] B. Saha, “Agile transformation strategies in cloud-based program management,” International Journal of Research in Modern Engineering and Emerging Technology, vol.7, no.6, pp.1-16, 2019.