Ансамблевый подход к распознаванию лиц в системах контроля доступа

Владимир Николаевич Опанасенко1,*, Шавкат Хайруллаевич Фазилов2,
Олимжон Номазович Мирзаев2, Шукрулло Садулло угли Кахаров3
1 Отдел микропроцессорной техники № 205, Институт кибернетики им. В.М. Глушкова НАН Украины, Украина
2 Лаборатория биометрических систем, Научно-исследовательский институт развития цифровых технологий и искусственного интеллекта, Республика Узбекистан
3 Кафедра цифровых технологий и математики, Факультет экономики и туризма, Кокандский университет, Республика Узбекистан

E-mail: Opanasenkoincyb@gmail.com; sh.fazilov@yahoo.com; omirzaev@gmail.com; sh.kaxarov93@gmail.com
* Автор для переписки
Получено 01 ноября 2023; Принято 29 февраля 2024
Аннотация
В статье предлагается метод распознавания лиц в мобильных устройствах, основанный на ансамблевом подходе к решению задачи распознавания образов, обеспечивающий высокую точность результатов. Согласно этому подходу, базовый алгоритм декомпозируется на два оператора: оператор распознавания и решающее правило. Оператор распознавания вычисляет оценки близости проверяемого объекта к заданным классам. Решающее правило на основе этих оценок определяет принадлежность проверяемого объекта к одному из заданных классов. Ансамбль распознающих операторов формируется в виде линейного полинома. Значения параметров полинома рассчитываются на основе решения задачи многопараметрической оптимизации. Экспериментальные исследования проводились с использованием открытых баз данных изображений лиц. При проведении экспериментов предполагалось, что будут реализованы два варианта использования базовых алгоритмов: раздельный и ансамблевый. Точность распознавания объектов в контрольной выборке с использованием ансамбля операторов распознавания оказалась выше по сравнению с точностью лучшего базового алгоритма распознавания. Предлагаемый метод распознавания лиц может быть использован в мобильных устройствах, в частности, для верификации пользователей при удаленном доступе к информационным ресурсам с ограниченным статусом доступа.
Ключевые слова: Изображение лица, распознавание лиц, идентификация личности, опорные операторы, ансамбль алгоритмов распознавания.

1. Введение

Предложено множество методов компьютерного зрения для создания мобильных систем распознавания, используемых в различных сферах человеческой деятельности [1, 2]. Среди этих методов широко применяются методы автоматического распознавания лиц. Быстрое развитие технологий, таких как цифровые камеры и портативные устройства видеозаписи, а также повышенный спрос на безопасность, делают технологию распознавания лиц основной биометрической технологией. Существует множество применений для распознавания лиц, включая контроль доступа с использованием мобильных устройств подтверждения личности, мобильные системы активного видеонаблюдения и быстрый поиск записей в удаленных базах данных лиц. Распознавание лиц определяется как процесс, который идентифицирует и сравнивает запрашиваемое изображение лица со всеми образцами изображений в базе данных лиц и подтверждает личность человека [3]. При идентификации проверяемый человек сравнивается с множеством лиц для поиска наиболее вероятного совпадения, а при верификации проверяемый человек сравнивается с известным лицом в базе данных для принятия решения о принятии или отклонении проверяемого лица [4].

Существует два основных подхода к распознаванию лиц, различающихся способом представления лиц: целостный (холистический) (Рисунок 1, а) или покомпонентный (Рисунок 1, б). Оба эти подхода показаны и описаны на Рисунке 1.

a)

Целостный подход

b)

Покомпонентный подход
Рисунок 1. Два подхода к распознаванию лиц: а) целостный; б) покомпонентный.

Как показано на Рисунке 1, при целостном представлении лица вся информация извлекается с помощью одного вектора из всего изображения лица, а при покомпонентном представлении извлекаются локальные признаки, описывающие выбранные компоненты лица (глаза, нос, рот и т.д.).

Целостный подход к распознаванию лиц в основном представлен методами Eigen-face и Fisherface [5], анализом независимых компонентов (ICA) [6], инвариантами моментов [7], дискретным косинусным преобразованием (DCT) [8] и др. Покомпонентный подход реализуется в следующих широко используемых методах: метод опорных векторов (SVM) [9], линейный дискриминантный анализ (LDA) [10], статистические методы [11, 12] и др.

Данная работа направлена на разработку покомпонентного подхода к распознаванию лиц для систем контроля доступа. При использовании этих систем в критически важных приложениях необходимо обеспечить высокую точность и надежность идентификации проверяемого лица.

Как отмечено в [13], система, построенная на основе корректного метода распознавания, сама по себе не обеспечивает стопроцентную надежность идентификации. Поэтому, если требуется высокая надежность, особенно в критических приложениях систем распознавания, следует использовать комбинацию нескольких методов (алгоритмов) распознавания. Именно такой подход к решению задачи распознавания лиц используется в данной работе.

Совместное использование нескольких методов (алгоритмов) для принятия окончательного решения об идентифицируемом объекте называется комбинацией алгоритмов, слиянием алгоритмов (fusion), смесью экспертов, классификацией на основе ансамблей, композицией алгоритмов и т.д. в научной литературе по распознаванию образов.

На Рисунке 2 показана одна из возможных схем покомпонентного распознавания лиц с использованием алгоритмического ансамбля. Фундаментальное различие между этой схемой и классической схемой покомпонентного распознавания лиц (Рисунок 1, б) заключается в том, что каждый компонент лица распознается соответствующим базовым алгоритмом, который генерирует оценки близости рассматриваемого компонента к заданным классам. Затем эти оценки подаются на вход интегратора, который на их основе принимает окончательное решение по распознаваемому лицу в целом (Рисунок 2).

Схема распознавания лиц
Рисунок 2. Предлагаемая схема распознавания лиц с использованием алгоритмических ансамблей.

2. Связанные работы

На сегодняшний день разработаны различные схемы комбинирования алгоритмов, и экспериментально продемонстрировано, что в некоторых случаях набор базовых алгоритмов превосходит по точности лучший алгоритм, представленный в этом наборе [14–18]. В основном существует два сценария комбинирования алгоритмов [19].

В первом сценарии алгоритмы могут быть разными, но использовать один и тот же набор признаков в качестве входных данных. Типичным примером этого сценария является набор алгоритмов, основанных на методе k-ближайших соседей. Каждый алгоритм в этом наборе использует один и тот же вектор признаков, но отличается от других алгоритмов своими параметрами (значением параметра k, определяющего количество ближайших соседей, или типом используемой метрики расстояния для определения ближайших соседей). Другим примером является набор алгоритмов, представленных нейронными сетями фиксированной архитектуры, но имеющих разные наборы весов, полученные с использованием разных стратегий обучения. Более того, каждый алгоритм определяет для входного объекта степень принадлежности к заданным классам, например, в виде оценок апостериорной вероятности классов.

Во втором сценарии каждый алгоритм, включенный в набор алгоритмов (которые могут быть идентичными), использует свое собственное описание атрибутов входного объекта. Другими словами, вектор признаков, описывающий входной объект, уникален для каждого алгоритма. Важным применением набора алгоритмов, объединенных в этом сценарии, является возможность интеграции физически различных типов измерений признаков. В этом случае вычисленная апостериорная вероятность не может считаться оценками одной и той же функциональной величины, поскольку системы классификации работают в разных пространствах признаков [20].

Важным вопросом при объединении алгоритмов является то, что отдельные алгоритмы не должны принимать одинаковые ошибочные решения для одних и тех же распознаваемых объектов, то есть они должны предоставлять дополнительную информацию относительно этих объектов. Успешная комбинация набора отдельных алгоритмов должна повысить общую точность системы распознавания, поэтому эта концепция комбинирования алгоритмов широко используется в различных приложениях, где требуется высокая точность.

Согласно [21], комбинация алгоритмов может осуществляться на трех уровнях: уровень данных датчиков, уровень признаков и уровень принятия решений. Уровень слияния датчиков создает набор данных, собранных с двух или более датчиков. В этом случае слияние данных осуществляется до применения методов извлечения признаков из этих данных. На уровне комбинации признаков признаки с равными или разными весами конкатенируются. На уровне принятия решений локальные решения базовых алгоритмов интегрируются на основе одного из трех подходов: абстрактного, рангового и бального (score). В абстрактном подходе каждый базовый алгоритм создает одну метку класса, которая затем подается на вход интегратора. Последний формирует окончательное решение на основе выходных меток базовых алгоритмов. В подходе, основанном на рангах, каждый базовый алгоритм создает несколько меток, ранжированных от наиболее вероятных к наименее вероятным. Эти метки затем используются для принятия окончательного решения. Подход, основанный на баллах, предполагает, что каждый алгоритм выдает n лучших меток вместе с их оценками достоверности. Слияние баллов может быть выполнено несколькими способами путем объединения оценок достоверности: на основе плотности, на основе преобразования и на основе алгоритма (например, нейронной сети). Как отмечено в [22], подход, основанный на баллах, является наиболее информативным по сравнению с другими подходами к объединению алгоритмов.

Следует отметить, что вышеупомянутый абстрактный подход к объединению алгоритмов на уровне принятия решений основан на использовании жестких решений базовых алгоритмов, в то время как подход, основанный на баллах, использует мягкие решения, создаваемые этими алгоритмами, например, в виде оценок апостериорных вероятностей. Объединение жестких решений базовых алгоритмов может осуществляться на основе мажоритарного голосования, а объединение мягких решений этих алгоритмов может быть реализовано с использованием правил суммы, произведения, максимума, минимума, среднего и медианы. Эти правила используют выходные апостериорные вероятности или баллы алгоритмов. Правило произведения количественно определяет вероятность гипотезы путем объединения апостериорных вероятностей базовых алгоритмов с использованием операции умножения, в то время как правило суммы использует операцию суммирования апостериорных вероятностей. Правило максимума является аппроксимацией правила суммы и берет максимум из апостериорных вероятностей. Аналогично, правило минимума является аппроксимацией правила произведения. Перечисленные правила объединения решений базовых алгоритмов подробно обсуждаются и изучаются в [23, 24].

Правило мажоритарного голосования, объединяющее жесткие решения базовых алгоритмов, может использовать три варианта голосования: единогласное голосование, более половины голосов и наибольшее количество голосов [22].

Рассмотрим бинарный вектор выходных меток алгоритма Ai: (ai1, ..., aiN)T ∈ {0, 1}N, i = 1, ..., M, где M – общее количество базовых алгоритмов, N – количество классов. Здесь aij = 1, если алгоритм Ai относит данный объект к классу ωj, и aij = 0 в противном случае.

Мажоритарное голосование приводит к решению в пользу класса ω, если

i=1M aiℓ = maxj=1...Ni=1M aij.

В этом случае мажоритарное голосование дает точную метку класса, когда по крайней мере M/2 + 1 алгоритмов предоставляют эту метку класса [23].

Завершая рассмотрение основных подходов к объединению алгоритмов распознавания образов, можно сделать важный вывод, что объединение позволяет получить высокое качество распознавания, недостижимое для отдельных базовых алгоритмов. Анализ этих подходов показывает, что, хотя одна стратегия может превосходить другие для данного приложения, результаты реализации этой стратегии могут не быть лучшими для другого приложения. Наиболее общий подход к объединению алгоритмов распознавания предложен в алгебраической теории распознавания образов [24–29]. Как отмечено в [13], эта теория позволяет строить корректные алгоритмические композиции, используя чисто алгебраические методы.

3. Основные понятия и обозначения

Пусть имеется множество F объектов, представленных в виде изображений лиц. Исходные данные о каждом объекте F заданы в виде матрицы X размером m × n (где m и n — количество строк (изображений) и столбцов (признаков) соответственно) [8]:

X = |xij|n×m.

Предполагается, что элементы множества F образуют непересекающихся классов K1, ..., Kj, ..., K, каждый из которых представлен изображениями лица одного человека. В этом случае мы имеем:

F = ∪j=1 Kj, Ki ∩ Kj = ∅, i ≠ j, i, j ∈ {1, ..., ℓ}. (1)

Выражение (1) не полностью определено, и имеется лишь некоторая начальная информация I0 о классах K1, ..., Kj, ..., K. Пусть имеется некоторая выборка Fm (Fm ⊂ F), состоящая из m объектов:

m = {F1, ..., Fu, ..., Fm}, (2)

где Fu ∈ F, u = 1, m.

Введем следующие обозначения для объектов (2): j = Fm ∩ Kj, K̃j = Fm \ Kj. Тогда начальная информация I0 о классах согласно [23] может быть задана в виде:

I0 = {(F1, α̃(F1)), ..., (Fu, α̃(Fu)), ..., (Fm, α̃(Fm))},

где α̃(Fu) – информационный вектор объекта Fu (Fu ∈ Fm): α̃(Fu) = (αu1, ..., αuj, ..., αu), αuj = Pj(Fu). (7)

Здесь αuj – значение предиката, который имеет следующий вид:

Pj(Fu) = { 1, если Fu ∈ Kj; 0, если Fu ∉ Kj }. (3)

Известно [26], что произвольный алгоритм распознавания A может быть представлен как последовательное выполнение операторов B (оператор распознавания) и C (решающее правило):

A = B · C. (4)

Из (4) следует, что алгоритм A реализуется в два этапа. На первом этапе оператор B переводит допустимый объект Fu в числовой вектор оценок u:

B(Fu) = b̃u, (5)

где u = (bu1, ..., buv, ..., bu) – числовая оценка.

На втором этапе, в соответствии с числовой оценкой u, решающее правило C определяет принадлежность объекта Fu к классам K1, ..., Kj, ..., K:

C(buv) = { 1, если buv > c2; ∆, если c1 ≤ buv ≤ c2; 0, если buv < c1; } (6)

где c1, c2 – параметры решающего правила. В этом случае оценка buv вычисляется с использованием оператора распознавания (5). Первое условие в (6) означает, что объект Fu принадлежит к классу Kv, второе условие означает, что алгоритм отказывается от распознавания, третье условие означает, что объект Fu не принадлежит к классу Kv.

В литературе рассматриваются различные решающие правила, однако, как показано в [23], мы можем ограничиться рассмотрением только правила (6).

После введения основных понятий и обозначений мы можем сформулировать проблему распознавания личности по изображению лица в следующей постановке.

4. Постановка задачи

Пусть имеется некоторый алгоритм распознавания A (A = B · C), который на основе начальной информации I0 вычисляет значения информационного вектора α̃(Fu) для произвольного объекта Fu (Fu ∈ Fm): Ã(I0, Fu) = β̃u, β̃u = (βu1, ..., βuj, ..., βu), βuj = Pj(Fu). (7)

Здесь βuj интерпретируется следующим образом: βuj = 1, если объект Fu принадлежит классу Kj; βuj = 0, если объект Fu не принадлежит классу Kj; βuj = ∆, если модель не вычислила значение предиката Pj(Fu).

В этом случае предполагается: (i) алгоритм A реализует определенное правило, характеризующее зависимость между ответом (β̃u) и объектом (Fu); (ii) правило, характеризующее эту зависимость, неизвестно; (iii) имеется k элементарных алгоритмов распознавания, множество которых обозначим через A: A = {A1, ..., Ai, ..., Ak}, (8) где Ai(Fu) = α̃(Fu), Fu ∈ F, (i = 1, 2, ..., k). Алгоритмы в (8) решают задачу распознавания с разной точностью. Учитывая (4), вместо алгоритмов распознавания (8) рассмотрим множество соответствующих операторов распознавания, которое обозначим через B: B = {B1, ..., Bi, ..., Bk}. (9)

Следует отметить, что операторы распознавания, представленные в (9), будем называть операторами распознавания первого уровня. Пусть оператор распознавания B состоит из определенной композиции k элементарных операторов распознавания (9): B(Fu) = B(B1, ..., Bi, ..., Bk). (10) Оператор распознавания B(Fu) в (10) будем называть оператором распознавания второго уровня.

Тогда задача (7) может быть переформулирована следующим образом: Ã* = B* · C = arg maxBi ∈ B QA(X̃, Fu), (11) где QA(X̃, Fu) = 1/m ∑u=1m y(β̃u − A(Fu)), A(Fu) = B(Fu) · C(c1, c2), Fu ∈ Fm, y(x) = { 1, если x = 0; 0, если x ≠ 0 }.

5. Предлагаемый метод решения

Для решения задачи (11) предлагается ансамблевый подход. Этот подход является логическим продолжением работы [25], в которой рассматривались теоретические вопросы построения композиций алгоритмов распознавания. На основе этого подхода предлагается модель операторов распознавания, построенная на основе интеграции операторов распознавания первого уровня. Основная идея предлагаемой модели заключается в формировании репрезентативных операторов распознавания в рамках операторов распознавания первого уровня. Предлагаемая модель операторов распознавания включает следующие основные этапы.

На первом этапе формируется набор k' (k' < k) «независимых» подмножеств взаимосвязанных операторов распознавания. Пусть W — все возможные непересекающиеся подмножества рассматриваемых операторов распознавания {B1, ..., Bi, ..., Bk}. Из W выбираем набор подмножеств взаимосвязанных операторов распознавания, который обозначается W' (W' ⊂ W, k' = |W'|). В результате выполнения действий, предусмотренных на этом этапе, определяются k' подмножеств взаимосвязанных операторов распознавания W' = {B'1, ..., B'v, ..., B'k'} (12). В этом случае подмножества в (12) удовлетворяют следующим условиям: v=1k' B'v = ∅; ∪v=1k' B'v = W'.

Таким образом, на этом этапе задается параметр k', значение которого определяется в процессе обучения при решении конкретных задач.

На втором этапе задачи определяется набор опорных операторов распознавания. При определении набора опорных операторов распознавания используются следующие условия: (1) выбранные опорные операторы распознавания должны быть сильно связаны в своих подмножествах (B'v, v = 1, k') операторов распознавания; (2) все выбранные по одному из каждого подмножества B'v, v = 1, k' опорные операторы должны быть независимы друг от друга. В ходе выполнения этого этапа мощность рассматриваемого множества операторов распознавания B уменьшается.

Сформированный набор опорных операторов распознавания обозначим B' : B' = (Bi1, ..., Biv, ..., Bik'), где k' < k, k' = |B'|, k = |B|.

Таким образом, в результате этого этапа определяются опорные операторы распознавания, которые соответствуют k'-мерному булеву вектору r = (r1, ..., ri, ..., rk), где ri = 1, если оператор распознавания Bi является опорным, или ri = 0 – в противном случае.

На третьем этапе определяется обобщенный оператор распознавания, который вычисляет числовую оценку близости, характеризующую сходство объекта Fu с объектами, принадлежащими классу Kj. Пусть каждая оценка для класса Kj, вычисленная с использованием опорного оператора распознавания Bi (Bi ∈ B'), соответствует числовому параметру gi. Тогда оценка для класса Kj вычисляется с использованием всех опорных операторов распознавания B' следующим образом: B(Kj, Fu) = ∑Bi ∈ B' gi Bi(Kj, Fu), (13) где gi — параметр опорного оператора распознавания Bi. Обозначим набор таких параметров для всех опорных операторов B' как g̃ = (g1, ..., gi, ..., gk').

Таким образом, мы определили модель двухуровневых операторов распознавания, построенную на основе ансамблевого подхода. Произвольный оператор распознавания B из этой модели полностью определяется заданием набора параметров π̃ : π̃ = (k', g̃).

Обозначим множество всех алгоритмов распознавания из предлагаемой модели через B(π̃, F). Поиск наилучшего оператора распознавания осуществляется в пространстве параметров π̃ согласно [28–30].

6. Экспериментальные исследования

Экспериментальные исследования проводились с использованием обучающих и контрольных выборок, которые формировались в ходе экспериментов для каждого компонента лица отдельно с использованием метода k-кратной (k-fold) перекрестной проверки.

Для обеспечения репрезентативности и разнообразия исходных данных для формирования исходных выборок изображений лиц использовались изображения как из базы данных ORL, так и из базы данных LABDPS.

База данных ORL (Olivetti Research Laboratory) включает 400 фронтальных изображений лиц 40 человек, различающихся выражением лица, условиями освещения, наличием бороды, усов и очков [13]. Все образцы были получены на темном однородном фоне, лица представлены в вертикальном положении с небольшим боковым поворотом. Каждое изображение лица имеет размер 92*112 пикселей с 256 оттенками серого. Допустимый наклон и поворот головы составляет до 20°. На Рисунке 3 показаны примеры изображений лиц, представленных в базе данных ORL.

Лицо 3 Лицо 4
Рисунок 3. Примеры изображений лиц, представленных в базе данных ORL.

База данных LABDPS (Laboratory Data Processing Systems) была создана в лаборатории биометрических систем Научно-исследовательского института развития цифровых технологий и искусственного интеллекта в рамках данного проекта. Эта база данных включает 415 цветных изображений лиц 34 человек, полученных в разные периоды и различающихся условиями освещения, поворотом и наклоном головы. На Рисунке 4 показаны примеры изображений лиц, представленных в базе данных LABDPS. Размер изображения лица составляет 210*250 пикселей.

Примеры лиц LABDPS
Рисунок 4. Примеры изображений лиц, представленных в базе данных LABDPS.

В качестве базовых алгоритмов распознавания, используемых для создания алгоритмического ансамбля, были выбраны четыре алгоритма, относящихся к моделям алгоритмов вычисления оценок (АВО, ACE), известным в распознавании изображений [23]. Основой для формирования этих моделей является принцип частичного прецедента. Основная идея этого принципа заключается в оценке «близости» между частями ранее описанных классифицированных объектов и объектом, принадлежащим к распознаванию. Наличие близости является частичным прецедентом и оценивается согласно некоторому заданному правилу.

Принцип работы АВО заключается в вычислении степени сходства, характеризующей «близость» распознаваемого и эталонного объектов согласно системе опорных признаков, которые представляют собой набор подмножеств заданного множества признаков. В этих алгоритмах объект распознавания рассматривается одновременно в множестве подпространств пространства признаков. Как указывалось ранее, основная идея класса АВО заключается в сравнении объектов по частям, называемым ω-частями. Однако не всегда известно, какие комбинации признаков являются наиболее информативными. Поэтому в этой модели алгоритмов степень сходства объектов рассчитывается путем сравнения всех возможных или определенных комбинаций признаков, включенных в описания объектов. Задача определения сходства и различия объектов формулируется как параметрическая, поэтому выделяется этап настройки АВО с использованием обучающей выборки, на котором выбираются оптимальные значения введенных параметров. Критерием качества является точность распознавания.

В рамках модели АВО реализация процедуры распознавания осуществляется в следующей последовательности: – задается система опорных множеств алгоритма, в соответствии с которой анализируется распознаваемый объект; – определяется понятие близости на множестве ω-частей описаний объектов; – определяется схема вычисления оценки близости эталонного и распознаваемого объекта, т.е. вычисляется величина, называемая оценкой для пар объектов; – указывается метод формирования оценок для каждого из классов на основе фиксированного опорного множества на основе оценок для пар объектов; – определяется метод формирования итоговой оценки для каждого из классов для всех опорных подмножеств; – задается правило принятия решений, которое на основе оценок для классов гарантирует, что распознаваемый объект будет отнесен к одному из классов или что решение будет отклонено.

Завершая рассмотрение алгоритмов вычисления оценок, следует отметить, что установка значений соответствующих параметров определяет конкретный алгоритм. Варьируя метод отбора и параметры, можно построить модель АВО, обеспечивающую наилучшее решение задачи распознавания (например, с точки зрения минимума ошибок и отказов от распознавания).

Таким образом, как отмечалось выше, для создания ансамбля алгоритмов, используемых в экспериментальных исследованиях, были выбраны четыре алгоритма вычисления оценок, обозначенные в экспериментах как A1, A2, A3, A4. В соответствии с общим структурным представлением алгоритмов распознавания в виде (4), эти алгоритмы могут быть представлены как A1 = B1 · C1, A2 = B2 · C2, A3 = B3 · C3, A4 = B4 · C4. Учитывая, что эти алгоритмы принадлежат к одному семейству, для устранения корреляции их результатов каждый алгоритм обучался на отдельной выборке, случайно сгенерированной из баз данных ORL и LABDPS. В результате обучения этих алгоритмов были определены оптимальные значения параметров для операторов распознавания B1, B2, B3, B4 и решающих правил C1, C2, C3, C4.

В ходе экспериментов были реализованы два варианта использования базовых алгоритмов — раздельно и в виде ансамбля. В первом варианте, согласно (4), последовательно реализуются оператор распознавания Bi (i = 1, ..., 4) и решающее правило Ci (i = 1, ..., 4). Другими словами, при использовании алгоритмов по отдельности выполнялось жесткое распознавание, то есть распознавание с принятием окончательного решения по рассматриваемому изображению лица. Тестирование базовых алгоритмов, реализованных по первому варианту, показало, что алгоритм A1 обеспечивает точность распознавания объектов в контрольной выборке 93,57%, A2 – 89,28%, A3 – 95,31%, A4 – 91,43%.

При использовании базовых алгоритмов в составе ансамбля реализуются только операторы распознавания Bi (i = 1, ..., 4), которые определяют числовые оценки близости распознаваемого объекта Fu к классам K1, ..., Kj, ..., K. Затем вычисляется интегральная оценка u близости объекта Fu к классу Kj на основе оценок bui. Принадлежность объекта Fu к классу Kj определяется с использованием решающего правила (6). Точность распознавания объектов в контрольной выборке с использованием ансамбля базовых алгоритмов A1, A2, A3, A4 составила 98,84%.

Таким образом, можно констатировать, что совместное использование базовых алгоритмов в виде ансамбля обеспечило более высокую точность распознавания по сравнению с результатами раздельного использования этих алгоритмов.

Четыре алгоритма (A1 − A4), принадлежащие к классу алгоритмов вычисления оценок, использовались в качестве базовых алгоритмов распознавания, формирующих алгоритмический ансамбль [29, 30]. Для устранения корреляции результатов этих алгоритмов они обучались на четырех обучающих выборках, случайно сгенерированных из баз данных ORL и LABDPS. При проведении экспериментов предполагалось, что будут реализованы два варианта использования базовых алгоритмов: раздельный и ансамблевый. Результаты раздельного использования показали, что A3 обеспечивает точность распознавания 95,31%, A1 – 93,57%, A4 – 91,43%, A2 – 89,28%. Использование ансамбля этих алгоритмов обеспечило точность 98,84%, что превышает точность лучшего базового алгоритма A3.

7. Заключение

Основная цель данной работы, мотивированной научными исследованиями в области лицевой биометрии, заключается в демонстрации большого потенциала ансамблевого подхода к распознаванию лиц для критически важных приложений мобильных устройств идентификации личности.

Основная цель данной работы, мотивированной научными исследованиями в области лицевой биометрии, заключается в демонстрации большого потенциала ансамблевого подхода к распознаванию лиц для критически важных приложений мобильных устройств идентификации личности. В предыдущих исследованиях, включающих использование отдельных алгоритмов, возникали трудности с выбором правильного алгоритма распознавания для конкретной задачи. Эти трудности можно устранить с помощью алгоритмических ансамблей, что подтверждается, в частности, результатами экспериментальных исследований, представленных в данной работе. Использование базовых алгоритмов в мобильных устройствах в виде ансамбля обеспечило более высокую точность распознавания лиц по сравнению с результатами использования этих алгоритмов по отдельности.

Таким образом, следует сделать вывод, что мобильная система контроля доступа, построенная на основе корректного алгоритма распознавания лиц, сама по себе не обеспечивает стопроцентно надежную идентификацию и верификацию. Поэтому, если требуется высокая надежность таких систем, особенно в критически важных приложениях, в частности мобильных устройствах, то следует использовать комбинацию нескольких алгоритмов распознавания лиц в форме ансамбля. Именно этот подход к решению задачи распознавания лиц рассматривается в данной работе.

Одним из основных направлений дальнейших исследований ансамблевого подхода к распознаванию лиц должно быть широкое использование математического аппарата алгебраической теории распознавания образов, который является общим подходом к построению корректных алгоритмических композиций с использованием чисто алгебраических методов. Результаты этих исследований особенно важны для создания мобильных устройств, предназначенных, в частности, для верификации пользователей при удаленном доступе к информационным ресурсам, имеющим статус ограниченного использования. Эта особенность указанной системы расширяет сферу ее практического применения, в частности, в системах активного видеонаблюдения бортовых систем [31, 32] и облачных системах [33].


Список литературы

[1] Kondratenko, Y., and Mokhor, V. (2023). Guest Editorial Column: Special Issue of Journal of Mobile Multimedia “Artificial Intelligence in Automation with Mobile Applications”. Journal of Mobile Multimedia, 19(03), 1–3.
[2] Kuntsevich, V., Gubarev V., Kondratenko Y., Lebedev D. and Lysenko V. (Eds). Control Systems: Theory and Applications. River Publishers, Gistrup, Delft, 2018.
[3] Purahong, B., Chutchavong, V., Aoyama, H., and Pintavirooj, C. (2020). Hybrid Facial Features with Application in Person Identification. Journal of Mobile Multimedia, 16(1–2), 245–266.
[4] Kortli, Yassin, Maher Jridi, Ayman Al Falou, and Mohamed Atri. 2020. Face Recognition Systems: A Survey. Sensors 20, no. 2: 342.
[5] Belhumeour PN, Hespanha JP, Kriegman DJ (1997) Eigenfaces vs. fisherfaces : recognition using class specific linear projection. IEEE Trans Pattern Anal Mach Intell 19(7):711–720.
[6] Comon P (1994) Independent component analysis; A new concept? Signal Process 36(3):287–314.
[7] Nabatchian A, Abdel-Raheem E, Ahmadi M (2008) Human face recognition using different moment invariants: a comparative study, image and signal processing, 2008. In: CISP ’08. Congress on, 27–30 May 2008, China.
[8] Narzillo M, Bakhtiyor A, Shukrullo K, Bakhodirjon O, Gulbahor A (2021) Peculiarities of face detection and recognition. 2021 International Conference on Information Science and Communications Technologies (ICISCT). Tashkent, Uzbekistan.
[9] Heisele B, Serre T, Poggio T (2007) A component-based framework for face detection and identification. Int J Comput Vis 74(2):167–181.
[10] Zhang W, Shan S, Gao W, Chang Y, Cao B (2005) Component-based cascade Linear Discriminant Analysis for face recognition. In: Advances in biometric person authentication lecture notes in computer science, Vol. 3338, pp. 19–79.
[11] Paul SK, Bouakaz S, Rahman CM, Uddin MS. Component-based face recognition using statistical pattern matching analysis. Pattern Anal Appl. 2021;24(1):299–319.
[12] S. Takeda, T. Terada, and M. Tsukamoto. (2012). Implicit context awareness by face recognition. Journal of Mobile Multimedia, Vol. 8, No. 2, pp. 132–148.
[13] Воронцов К.В. Машинное обучение (курс лекций). Часть первая. – Школа анализа данных, 2019. – URL: http://www.machinelearning.ru [на русском].
[14] Adjabi I., Ouahabi A., Benzaoui A., Taleb-ahmed A. (2020) Past, Present, and Future of Face Recognition: A Review. Electronics, 9(8), 1188.
[15] Striuk, O., and Kondratenko, Y. (2023). Implementation of Generative Adversarial Networks in Mobile Applications for Image Data Enhancement. Journal of Mobile Multimedia, 19(03), 823–838.
[16] Mohd Naved, V. Ajantha Devi, Loveleen Gaur, Ahmed A. Elngar (Eds). IoT-enabled Convolutional Neural Networks: Techniques and Applications. River Publishers, Gistrup, Delft, 2023.
[17] Kondratenko, Y., Gerasin, O., Kozlov, O., Topalov, A, Topalov, A, Kilimanov, B. (2021). Inspection mobile robot’s control system with remote iot-based data transmission. Journal of Mobile Multimedia, 17(04), 499–526.
[18] Adhikari S., Saha S., “Multiple classifier combination technique for sensor drift compensation using ANN & KNN,” 2014 IEEE International Advance Computing Conference (IACC), Gurgaon, India, 2014, pp. 1184–1189.
[19] Kittler J., Hatef M., Robert P., Duin W., Matas J. On combining classifiers. IEEE Trans. Pattern Anal. Mach. Intell., vol. 20, no. 3, pp. 226–239, Mar. 1998.
[20] Mohandes M., Deriche M., Aliyu S. Classifiers Combination Techniques: A Comprehensive Review. IEEE Access. pp. 1–14., Apr. 2018.
[21] Chitroub S. Classifier combination and score level fusion: Concepts and practical aspects. Int. J. Image Data Fusion., vol. 1, no. 2, pp. 113–135.
[22] Polikar R. Ensemble based systems decision making. IEEE Circuits Syst. Mag., vol. 6, no. 3, pp. 21–45.
[23] Kuncheva L. Combining Pattern Classifier: Methods and Algorithms. Hoboken, NJ, USA: Wiley, 2004.
[24] Журавлев Ю.И. Об алгебраическом подходе к решению задач распознавания или классификации // Проблемы кибернетики. – Москва, 1978. – Т.33 – С. 5 – 68. [на русском].
[25] Журавлев Ю.И., Рудаков К.В. Об алгебраической коррекции процедур обработки (преобразования) информации // Проблемы прикладной математики и информатики. – 1987. – С. 187–198. [на русском].
[26] Воронцов К.В. Оптимизационные методы линейной и монотонной коррекции в алгебраическом подходе к проблеме распознавания // ЖВМ и МФ. – 2000. – Т. 40, № 1. – С. 166–176. [на русском].
[27] Рудаков К.В. Полнота и универсальные ограничения в проблеме коррекции эвристических алгоритмов классификации // Кибернетика. – 1987. – № 3. – С. 106–109. [на русском].
[28] Fazilov, Sh.Kh., Mirzaev, O.N., Kakharov, S.S. (2023). Building a Local Classifier for Component–Based Face Recognition. Lecture Notes in Computer Science, vol. 13741. Springer, Cham.
[29] Yu.I. Zhuravlev, V.V. Ryazanov, and O.V. Senko, Recognition. Mathematical methods. Software system Practical applications. Moscow: Fazis, 2006.
[30] Камилов М.М., Фазылов Ш.Х., Мирзаев Н.М., Раджабов С.С. Модели алгоритмов распознавания, основанных на оценке взаимосвязанности признаков – Ташкент: Наука и технология, 2020. – 149 с. [на русском].
[31] Opanasenko, V., Palahin, A., and Zavyalov, S. “The FPGA–Based Problem-Oriented On–Board Processor”, in Proceedings of the 10th IEEE International Conference on Intelligent Data Acquisition and Advanced Computing Systems: Technology and Applications, vol. 1, (IDAACS’2019), 18–21 September 2019. – Metz, France. – pp. 152–157.
[32] Opanasenko V.M., Fazilov Sh. Kh, Radjabov S.S., Kakharov S.S. “Multilevel Face Recognition System,” Cybern Syst Anal, 60, pp. 146–151, 2024.
[33] Malakhov, K. S. (2023). Letter to the Editor – Update from Ukraine: Development of the Cloud–based Platform for Patient–centered Telerehabilitation of Oncology Patients with Mathematical–related Modeling. International Journal of Telerehabilitation, 15(01). 1–3.

Journal of Mobile Multimedia, Vol. 20_3, 749–768.
doi: 10.13052/jmm1550-4646.20310
© 2024 River Publishers