Статистические классификаторы в компьютерном зрении
Дж. Хорнеггер, Д. Паулюс, Х. Ниманн
Кафедра распознавания образов (Информатика 5), Университет Эрлангена, Мартенштрассе 3, D-91058 Эрланген, Германия
Аннотация: В этой статье представлен унифицированный байесовский подход к трёхмерному компьютерному зрению с использованием сегментированных признаков изображения. Теоретическая часть поднимает базовые модели, требуемые для улучшения статистических систем распознавания. Нестандартные типы моделей вводятся и рассчитываются с использованием параметрических функций плотности вероятности, которые позволяют реализовать байесовские классификаторы для целей распознавания объектов. Важность плотности моделей демонстрируется на конкретных примерах. Нормально распределённые признаки используются для автоматического обучения, локализации и классификации. В заключение приводится экспериментальная оценка представленного теоретического подхода.
Классификация в компьютерном зрении обычно доминируется геометрическими, модельно-ориентированными подходами (Фожерас (1993)). Эвристика для многих алгоритмов обработки изображений ограничена данной предметной областью и мотивирована связанными приложениями, описанными в литературе. Здесь, модельно-ориентированный анализ изображений обеспечивает научную основу для сопоставления алгоритмов и для понимания процесса обработки информации. Всеобъемлющая цель заключается в описании внутренней природы изображений несимволическим или параметрическим способом.
Байесовские методы позволяют находить решения для различных классических задач в распознавании образов. Особенно прогресс в области обработки речи является существенным и частично основан на применении статистических методов. Общее использование байесовских классификаторов обусловлено несколькими аспектами: они демонстрируют оптимальность в теоретическом смысле принятия решений в рамках функции затрат (Дуда и Харт (1973)). Кроме того, статистические методы могут обрабатывать неопределенность естественным образом, имеют разработанную математическую теорию и обеспечивают унифицированную структуру, в рамках которой множество различных задач можно рассмотреть. По этой причине мы отдаем предпочтение алгоритмам компьютерного зрения, которые применяют статистические дискриминанты или, по крайней мере, приближения байесовских классификаторов.
В этой статье мы представляем вероятностную структуру для 3D зрения: статистические методы для объектного моделирования, алгоритмы для автоматической оценки параметров модели — даже при наличии неполных и искажённых обучающих данных — правила классификации и методы локализации для 3D объектов с использованием 2D представлений. Представленная функция плотности модели показывает несколько степеней свободы, и стандартные скрытые марковские модели или смеси плотностей могут быть получены как специализация. Эксперименты доказывают, что классификация и определение положения 3D объектов с использованием реальных данных изображений могут быть обработаны статистически.
Авторы выражают благодарность Немецкому исследовательскому фонду (DFG), который частично финансировал работу, представленную здесь, в рамках гранта SFB 182.
Общее рассмотрение байесовского анализа изображений (раздел 2) сопровождается статистическим описанием объектов и их появления в сценах (раздел 3). Проблемы распознавания и локализации объектов формализованы (раздел 4), и приведены экспериментальные результаты по этим проблемам (раздел 5).
Существует широкий спектр модельно-ориентированных методов для компьютерного зрения. Модельно-ориентированные статистические алгоритмы, в общем, требуют этапов выбора модели, выборки, оценки параметров и проверки соответствия. Главное отличие между стандартными геометрическими методами и вероятностными схемами моделирования заключается в обязательном факте, что байесовские методы анализа также используют статистические модели для включения как родовых, так и объектно-специфических априорных знаний.
Проблема распознавания объектов понимается как назначение вектора наблюдаемых признаков изображения для шаблонного класса Ωκ, которые характеризуют один объект или набор объектов. Статистические классификаторы, известные из теории распознавания образов, требуют векторы признаков нефиксированной размерности и вероятностное описание классов. Для наблюдаемого вектора признаков байесовское правило решения есть:
argmaxΩκ P(Ωκ | x), т.е., мы решаем для этого класса с наибольшей апостериорной вероятностью.
Основная проблема для внедрения статистических классификаторов является определением адекватности апостериорной вероятности. Это априори не очевидно, как это статистическое понятие может быть применено для решения задач распознавания трёхмерных объектов и оценки положения. Требуется обобщение определения (1). Ориентированный на первый план подход байесовского анализа изображений изложен Бесагом (1993), который прокомментирован далее:
Эти инструкции составляют основу для введения статистических моделей для 3D объектов в целях распознавания.
Байесовские рамки для распознавания 3D объектов на основе 2D изображений должны включать следующие элементы: предварительные знания, вращение и перемещение объектов, самозатенение, проекция из модельного пространства в пространство изображения и статистическое моделирование ошибок и неточностей, вызванных изменяющимся освещением, шумом датчика или ошибками сегментации.
Здесь мы будем рассматривать не отдельные пиксели или сеточные модели, а ограничимся статистикой, которая моделируется на сегментированных изображениях. Мы предполагаем, что изображение преобразовано в набор векторов признаков изображения размерности M, т. е., оператор сегментации определяет: x = Φ(IR).
В процессе сегментации могут быть вычислены точки, линии, регионы или другие признаки. Количество наблюдаемых признаков N, которые проецируются на 2D плоскость изображения, не постоянно для разных изображений. Мощность N зависит от направления взгляда, от применённого алгоритма сегментации и от условий освещения. Из-за проекции, информация о глубине и соответствие между признаками изображения и модели теряется. Статистическое моделирование, генерация моделей, классификация и локализация ограничены этими предполагаемыми признаками. В целом, плотность моделирования 3D объектов, появляющихся в изображениях, воплощает три основных компонента: неопределенность в отношении наблюдаемых векторов признаков, зависимость признаков от позы объекта и соответствие между признаками изображения и модели.
Статистическое описание объекта, принадлежащего к классу Ωκ, определяется плотностью p(x | κ, θ), и дискретным суждением P(κ) (κ = 1, если только отдельные объекты появляются, или κ ∈ {Ω1, Ω2, ...} для нескольких объектов сцены). Здесь x представляет набор векторов наблюдаемых признаков, и заданный параметр θ содержит параметры, относящиеся к конкретной модели, которые моделируют статистическое поведение признаков, зависящее так же, как и назначение. Параметры φ и t, однако, символизируют вращение, перемещение и проекцию из модельного пространства в плоскость изображения. Основной проблемой сейчас является четкое определение p(x | κ, θ). Вообще, мы различаем трёхмерную модель и пространство с изображением в 2D масштабе. Наблюдаемые M-мерные признаки изображения характеризуются x1, ..., xN. Соответствующие K-мерные объекты в модели обозначаются y1, ..., yK, где в общем N ≠ K из-за ошибок сегментации и заслонения.
Пример: Если трёхмерный куб характеризуется тем, что у него есть 8 углов, y включает в себя 8 трёхмерных углов. На двумерном изображении видны N ≤ 8 спроецированных трехмерных углов модели.
Давайте предположим, что параметрическая плотность объекта модели p(y | κ) задаётся. Преобразование стандартной плотности приводит к плотности p(x | κ, φ, t), который характеризует статистическое поведение признака в плоскости изображения, зависящее от параметров позы объекта φ и t.
Пример: Если функции 3-мерной модели y распределены нормально, тогда θ включает 3D вектор средних μy и матрицу ковариации 3x3 Σy. Пусть аффинное преобразование x = A y + b определяет отображение из модели в пространство изображения. Признак изображения x снова нормально распределён со средним вектором μx = A μy + b и матрицей ковариации Σx = A Σy AT.
Функция назначения a(i) определяет дискретное отображение, которое даёт для наблюдаемого признака xi индекс j ∈ {1,2,...,K} соответствующего признака модели, т. е., a(i) = j. Набор наблюдаемых признаков может таким образом быть связан с вектором назначения a = (a(1), a(2), ..., a(N)), который считается случайным вектором, т. е. классическая проблема сопоставления также моделируется статистически. Дискретная вероятность этого случайного вектора обозначается P(a | κ, φ, t). Функция плотности вероятности для наблюдения набора признаков x = (x1, ..., xN) таким образом есть:
p(x | κ, φ, t) = Σa∈A P(a | κ, φ, t) Πi=1N p(xi | κ, φ, t, a(i))
где не наблюдаемое назначение a исключается маргинализацией, т. е., мы суммируем по всем назначениям. Оценка (3) вычислительно ограничена O(KN). Если предполагаются попарно статистически независимые назначения, эта сложность снижается до O(N·K), и мы получаем произведение смесей плотностей. Скрытые марковские модели выводятся из (3), если предполагаются статистически зависимые назначения первого порядка и преобразование признака опущено. Стратегия вывода для этого случая ограничена O(N·K2) (Хорнеггер (1996)).
Этот гибкий формализм плотностей моделей может легко быть применен для использования нескольких видов для оценки позы или классификации. Предположим, есть R разных видов, дающих наборы признаков x(1), ..., x(R). Правильные параметры позы обозначаются φ0 и t0. Изображения захватываются камерой, которая установлена на откалиброванной руке робота. Таким образом, приблизительные внешние параметры φ̃r и t̃r для каждого вида известны. Эти параметры могут быть выражены в терминах суммы, используя позу рассматриваемого объекта и отклонения ∆φr, ∆tr:
φ̃r = φ0 + ∆φr и t̃r = t0 + ∆tr.
Таким образом, плотность для нескольких наблюдений составляет:
p(x(1), ..., x(R) | κ, φ0, t0) = Πr=1R p(x(r) | κ, φ0+∆φr, t0+∆tr)
если предполагаются статистически независимые виды. Использование множества типичных представлений приведёт к улучшению различающей силы наблюдаемых признаков, потому что чем больше данных доступно для оценки позы и классификации, тем более надёжных результатов можно ожидать, даже если калибровка не предоставит точные параметры.
Автоматическая генерация плотностей моделей включает в себя различные компоненты: определение структуры и вычисление частых параметров. Число функций модели K, распределение отдельных функций, отображение на основе модели в пространство изображений и зависимость от назначений характеризуют структуру. Практическое решение автоматической генерации структуры — это открытая исследовательская проблема (Хорнеггер (1996)). Тем не менее, существуют алгоритмы для оценки установленного параметра θ, если структура плотности модели определена; вычисление для каждого класса объектов Ωκ, κ ∈ {1,...,C} включает в себя оценку дискретных вероятностей P(a | κ), которая моделирует функцию присвоения, и p(y | κ, θ), который характеризует отдельные особенности модели.
Доступные обучающие данные состоят из признаков x, которые являются проецируемыми признаками модели. Информация о глубине, а также о назначении функции будут отсутствовать. Поэтому, вычисление соответствует задаче оценки неполных данных. Установленный метод, который может работать с этим типом проблемы оценки параметра, обеспечивается алгоритмом максимизации ожиданий (Демпстер и др. (1977)). Для нормально распределённых точечных объектов, к примеру, существуют итерационные формулы замкнутой формы, которые позволяют оценивать mean векторы из проекций. Заинтересованный читатель найдёт полный вывод нескольких алгоритмов обучения для нормально распределённых точечных и линейных объектов в Хорнеггере (1996).
Вероятностное моделирование объектов делает применение байесовского правила принятия решений (1) возможным, но требуются некоторые расширения. Вместо единого вектора признаков x задан набор объектов X = {x(1), ..., x(R)}. Кроме того, параметры позы φ, t являются частью функции плотности вероятности. Модифицированное байесовское правило принятия решений, которое позволяет проводить статистическую классификацию объектов:
argmaxκ P(κ | X) = argmaxκ ∫∫ p(X | κ, φ, t) p(κ, φ, t) dφ dt / p(X)
Поскольку вращение и перемещение объектов априори неизвестны, φ и t — свободные параметры. Апостериорная вероятность P(κ | X) не может быть вычислена явно.
На этапе оценки позы необходимо вычислить наилучшее положение и ориентацию, прежде чем классификационное решение возможно; он оценивает φ, t, что соответствует проблеме максимизации:
argmaxφ, t p(X | κ, φ, t)
Эта задача оценки параметров связана с проблемой глобальной оптимизации вогнутой мультимодальной функции правдоподобия. Процедуры вероятностной оптимизации обсуждаются у Хорнеггера (1996), которые позволяют принимать практически эффективные решения.
В экспериментальных исследованиях рассматриваются несколько аспектов: мы сравниваем стандартные методы для оценки положения с предложенным статистическим подходом, показываем улучшение результатов оценки позы с использованием нескольких видов и обсуждаем показатели распознавания, основанные на наборе тестов, включающем 1600 случайно выбранных сцен из простых многогранных объектов (рисунок 1). Все эксперименты выполняются на HP 9000/735 (99 МГц, 124 MIPS).
Рис. 1: Многогранные 3D объекты.
Сначала сравнение методов оценки позы, основанных на геометрическом расположении — метод Хаттенлохера (1993) и статистический подход — были выполнены с использованием 49 тестовых изображений. Алгоритм статистической оценки положения требует 80с при использовании глобальной оптимизации, а метод выравнивания требует в среднем 70с. Правильная поза вычисляется для 45 изображений с использованием статистического подхода (см. Рисунок 2). Метод выравнивания не сработал для 11 изображений. Этот эксперимент показывает, что статистический подход может соперничать с геометрическими методами как в отношении надёжности, так и времени выполнения. Время вычислений для оценки положения находится под решающим влиянием модуля глобальной оптимизации и его эффективности.
Пространство параметров непрерывных модельных плотностей легко разбивается на непересекающиеся подмножества, которые можно считать независимыми друг от друга. Использование четырёх процессоров, например, приводит к ускорению на 3.5. Таблица 1 суммирует ускорение для увеличения числа процессоров.
| number of processors | 2 | 3 | 4 | 5 | 6 |
|---|---|---|---|---|---|
| speed–up | 1.7 | 2.8 | 3.5 | 3.9 | 4.2 |
Table 1: Parallelization of pose estimation
Figure 2: Examples of scenes with heterogeneous background (left: gray–level image, middle: segmentation result, right: estimated pose).
Использование нескольких изображений для оценки позы приводит к значительным улучшениям соответствующих параметров позы. Мы проводим эксперименты, используя 400 сцен. Доля правильных параметров позы была увеличена с 96% до 100%. Существующие двусмысленности при рассмотрении одного изображения устраняются со вторым видом, но среднее время вычисления для двух видов, а не одного, в три раза выше. В среднем требуется 420 секунд, чтобы вычислить правильное положение.
Результаты распознавания с использованием 1600 тестовых изображений объектов, показанных на рисунке 1, обобщены в таблице 2. Она различает точечные и линейные объекты.
| 3–D объект | скорость распознавания [%] | время выполнения на изображение [сек] | ||
|---|---|---|---|---|
| точки | линии | точки | линии | |
| Ω1 | 47 | 44 | 466 | 1882 |
| Ω2 | 78 | 82 | 485 | 2101 |
| Ω3 | 58 | 36 | 465 | 1933 |
| Ω4 | 89 | 76 | 471 | 1520 |
| в среднем | 68 | 59 | 472 | 1859 |
Table 2: Run time and recognition rate of 3–D experiments
В этой статье мы предложили основу для байесовского анализа изображений. Мы предложили согласованный подход как к моделированию отдельных объектов, так и к вероятностному моделированию характеристики функции присвоения функций между элементами изображения и модели. Введенная концепция плотностей моделей сочетает в себе назначение, вращение, перемещение, проектирование функций и предшествующие знания в унифицированном виде. Процесс генерации модели должен иметь дело с проблемами оценки неполных данных, тогда как вычисление позы соответствует оценке максимального правдоподобия.
Благодаря статистической природе введенной схемы моделирования, реализация байесовских классификаторов для распознавания объектов стала возможной. Экспериментальные результаты с реальными данными показывают практическую пользу статистических классификаторов в компьютерном зрении. Действительно, в отношении приложений компьютерного зрения статистические методы ещё находятся в зачаточном состоянии, но реализованные и оцененные приложения показывают, что существует значительный потенциал для будущего развития и исследований.
БЕСАГ, J. (1993): К подопечным байесовского анализа изображений В: К.В. Мардиа и Г.К. Кандзи (ред.): Статистика и изображения, том 1. Издательство Карфакс, Абингдон, 107–119.
ДЕМПСТЕР, А., ЛЭРД, Н. и РУБИН, Д. (1977): Максимальная вероятность из неполных данных с помощью алгоритма EM, Серия B (Методологический), том 39, номер 1, 1–38.
ДУДА, Р. и ХАРТ, П. (1973): Классификация паттернов и анализ сцены. Джон Уайли и сыновья, Нью-Йорк.
ФОЖЕРАС, О. (1993): Трехмерное компьютерное зрение – геометрическая точка зрения. MIT Пресс, Кембридж, Массачусетс.
ХОРНЕГГЕР, Й. (1996): Статистическое моделирование, классификация и локализация объектов. Шейкер, Аахен.
ХУТТЕНЛОХЕР, Д. (1993): Распознавание по выравниванию В: А.К. Джайн и П.Дж. Флинн (ред.): Системы распознавания трехмерных объектов. Эльзевир, Амстердам, 311-324.
РАБИНЕР, Л. и ХУАНГ, Б.–Х. (1993): Основы распознавания речи. Prentice Hall, Энглвуд Клиффс, Нью-Джерси.