Назад в библиотеку

Лёгкая нейронная сеть для обнаружения замыкания петли в визуальном SLAM для помещений

Источник: International Journal of Computational Intelligence Systems (2023) 16:49

Тип публикации: Научно-исследовательская статья (открытый доступ)

Дата публикации: 05 апреля 2023

Перевод: Выполнен для библиотеки научных трудов. Сохранена структура и ключевые научные положения оригинала.

Аннотация

Обнаружение замыкания петли (LCD) играет важную роль в системах визуального одновременного картирования и локализации (SLAM), поскольку оно позволяет эффективно снижать накапливающиеся ошибки системы после длительного периода движения [1].

Свёрточные нейронные сети (CNN) имеют значительное преимущество в сравнении сходства изображений, и исследователи достигли хороших результатов, интегрируя CNN в задачи LCD [16]. LCD на основе CNN более устойчива, чем традиционные методы. Поскольку архитектуры глубоких нейронных сетей от AlexNet и VGG до ResNet стали меньше, сохраняя при этом хорошую точность, для LCD в помещениях не требуется, чтобы роботы выполняли большое количество сложных операций обработки. Чтобы снизить сложность глубоких нейронных сетей, в данной статье представлена новая лёгкая нейронная сеть на основе MobileNet V2 [19].

Мы предлагаем стратегию использования модуля Efficient Channel Attention (ECA) [22], встраиваемого в сжатую версию MobileNet V2 (ECMobileNet) для уменьшения количества операций при сохранении точности. На основе равномерного распределения векторов признаков ECMobileNet в сочетании с сопоставлением по евклидову расстоянию разработан соответствующий метод обнаружения петли. Для оценки результатов использовались наборы данных TUM, и эксперименты показывают, что этот метод превосходит современные подходы. Хотя модель обучалась только на наборе данных indoorCVPR, она также продемонстрировала превосходную производительность на наборах данных TUM. В частности, предложенный подход является более лёгким и высокоэффективным по сравнению с существующими на данный момент подходами на основе нейронных сетей. Наконец, мы использовали наборы данных TUM для тестирования LCD на основе ECMobileNet в системе PTAM, и экспериментальные результаты показывают, что эта лёгкая нейронная сеть является работоспособной.

1. Введение

С развитием сервисных роботов для помещений всё большее количество таких роботов внедряется в нашу жизнь. Благодаря невысокой стоимости визуальных сенсоров, способных получать богатую информацию о сцене, визуальному SLAM уделяется значительное внимание [1]. Как важный компонент робототехнических устройств для помещений, визуальный SLAM [2] не только помогает роботам в навигации, но и способствует избеганию препятствий [3]. LCD в SLAM [4], [5] позволяет роботу или наблюдающему агенту определить, что он вернулся в ранее посещённую область [6]. Следовательно, LCD крайне важно для поддержания точности позиции машины в процессе исследования. Когда робот возвращается в свою начальную точку после периода движения, его позиция может не совпадать с исходной из-за дрейфа позы. Используя LCD, расчётную позицию можно перекалибровать, эффективно устраняя дрифт и минимизируя кумулятивные ошибки, что позволяет создавать более точную карту [7].

Важным аспектом улучшения производительности визуального LCD является получение эффективных описаний сцены на основе входных изображений [8]. Традиционные методы LCD полагаются на созданные вручную дескрипторы признаков для сопоставления изображений. Лоу и др. [9] разработали признак SIFT, который стал широко используемым дескриптором признаков изображений в области компьютерного зрения, но процесс его вычисления очень затратен по времени и не может удовлетворить требованиям SLAM к работе в реальном времени. Рубле и др. [10] улучшили признаки SIFT и предложили признак ORB. Бэй и др. [11] предложили признак SURF, ускоренный устойчивый признак, который значительно повышает скорость вычислений при соответствующем снижении устойчивости. Модель "Мешок слов" (BoW), изначально применявшаяся для поиска текстов [12], как выяснилось, также может распознавать изображения. Другими словами, путём построения словаря визуальных слов [13]. BoW извлекает признаки изображений с помощью SIFT и ORB, оставаясь при этом методом традиционного описания признаков. Однако общей чертой традиционного описания признаков является неспособность эффективно извлекать различные динамические изменения в сцене, что приводит к неочевидному или ошибочному извлечению признаков. Более того, размер словаря в BoW требует больше памяти [14], что не очень реалистично для робототехники в помещениях.

В последние годы глубокое обучение становится всё более популярным для извлечения признаков изображений. Глубокие нейронные сети особенно эффективны в распознавании и классификации изображений [15]. Продемонстрировано, что признаки CNN обладают более высокой устойчивостью к изменениям точки обзора, условиям освещения и вариациям масштаба и могут эффективно устранять недостатки традиционных методов [16]. Чжан X. [16] предложил общий алгоритм для встраивания свёрточных сетей в LCD. Этот алгоритм извлекает векторы признаков изображений с помощью CNN и сравнивает сходство изображений для реализации LCD. Хотя распространённые в настоящее время VGG и ResNet устраняют недостатки традиционных методов, они добавляют в SLAM огромные вычислительные операции [17]. В результате SLAM в реальном времени с глубокими нейронными сетями непрактичен во многих реальных сценариях. Лёгкие нейронные сети, такие как небольшие CNN, недавно были успешно применены во многих областях. Эти модели сохраняют высокую точность, используя очень мало параметров. Например, MobileNet V1 от Google [18], предложенная в 2016 и опубликованная в 2017 году, использует глубинно-разделимую свёртку и стопку глубинно-разделимых модулей для достижения высокой точности на мобильных устройствах. Впоследствии были предложены MobileNet V2 [19] и MobileNet V3 [20] с меньшим количеством параметров и более высокой точностью. Аналогично, модель ShuffleNet [21] чрезвычайно лёгкая и эффективная с вычислительной точки зрения. Как и MobileNet, и SqueezeNet, ShuffleNet в первую очередь предназначена для использования на мобильных устройствах. Использование лёгких нейронных сетей может снизить вычислительные затраты и повысить производительность в реальном времени для LCD.

В этой статье мы предлагаем новую модель лёгкой нейронной сети ECMobileNet на основе MobileNet V2, которую можно интегрировать в LCD. Мы используем модуль Efficient Channel Attention (ECA) [22], встраиваемый в "бутылочные горлышки" (bottlenecks) MobileNet, и удаляем некоторые bottlenecks для уменьшения количества параметров. Сначала мы обучаем ECMobileNet, используя набор данных indoorCVPR, и достигаем желаемых результатов. Затем мы используем изображения из общедоступных наборов данных в качестве входных данных для ECMobileNet, чтобы получить векторы признаков изображений. Во-вторых, мы уменьшаем размер вектора и используем алгоритм евклидова расстояния для вычисления оценок сходства для сравнения изображений и определения, относятся ли они к LCD. В-третьих, мы демонстрируем работоспособность этого алгоритма, сравнивая его с современным основным алгоритмом по нескольким аспектам, включая количество параметров и PR-кривую. Наконец, мы интегрируем этот алгоритм LCD в PTAM, чтобы проверить его эффективность с использованием набора данных TUM RGB-D. По сравнению с траекторией движения, полученной с использованием только PTAM, траектория движения, полученная с помощью этого метода, является более плавной и более соответствует реальной траектории, что может эффективно снизить кумулятивную ошибку всей системы. Основные вклады этой статьи можно резюмировать следующим образом:

  1. Предложена новая модель лёгкой нейронной сети ECMobileNet.
  2. Использование конкретного небольшого набора данных для помещений также может давать хорошие результаты.
  3. Мы демонстрируем, что наш подход достигает конкурентоспособных показателей полноты при 100% точности по сравнению с современными методами с использованием четырёх сложных публичных последовательностей изображений.
  4. Мы показываем, что этот алгоритм LCD работоспособен в системе SLAM.

2. Связанные работы

2.1 Efficient Channel Attention (ECA)

Цилун Ван и др. [22] предложили модуль ECA для глубоких CNN, который позволяет избежать уменьшения размерности и эффективно захватывать информацию из локального межканального взаимодействия.

Чтобы понять ECA, необходимо сначала ознакомиться с SENet (SE) [23]. Автор ECA экспериментально оценил эффекты уменьшения размерности и нелинейного межканального взаимодействия в блоке SE, что послужило мотивацией для предложения модуля ECA. Кроме того, автор разработал метод адаптивного определения параметров ECA и в конечном итоге продемонстрировал, как его можно использовать с глубокими CNN.

2.2 MobileNet V2

MobileNet V2 [19] — это модель лёгкой нейронной сети, предложенная Google, которая улучшает MobileNet V1 [18] за счёт усовершенствования глубинно-разделимой свёртки и добавления инвертированного остаточного блока.

Сначала используется свёртка 1×1 для увеличения количества каналов, затем применяется глубокая свёртка 3×3 в пространстве высокой размерности, после чего используется ещё одна свёртка 1×1 для уменьшения количества каналов и, наконец, применяется линейная функция активации. Когда шаг (stride) = 1, MobileNet V2 использует остаточные соединения для связи входов и выходов. Однако когда шаг = 2, остаточные соединения не обязательны, поскольку признаки входов и выходов различаются по размеру. Функция активации, используемая в MobileNet V2, — ReLU6, которая ограничивает любое значение сверху 6, а снизу 0. Функция ReLU6 имеет диапазон значений [0,6] и обеспечивает лучшую производительность представления при числах с плавающей запятой низкой точности.

3. Предлагаемый подход (Краткое изложение)

В данной работе предлагается новый лёгкий метод обнаружения замыкания петли на основе нейронных сетей под названием ECMobileNet. Основная идея заключается в интеграции модуля внимания Efficient Channel Attention (ECA) [22] в архитектуру MobileNet V2 [19] и последующем сокращении её сложности.

Архитектура ECMobileNet: Модуль ECA встраивается в bottlenecks (блоки глубинно-разделимой свёртки) сети MobileNet V2. Этот модуль позволяет сети динамически перевзвешивать важность различных каналов признаков, улучшая способность к выделению значимой информации без значительного увеличения вычислительной сложности. Кроме того, для дальнейшего облегчения модели некоторые из bottlenecks удаляются.

Процесс обнаружения замыкания петли:

  1. Извлечение признаков: Входное изображение пропускается через обученную сеть ECMobileNet. На выходе последнего свёрточного слоя (перед полносвязными слоями) получается многомерный картографический вектор признаков (feature map).
  2. Формирование глобального дескриптора: Для создания компактного вектора-дескриптора всего изображения применяется стратегия усреднения по пространственным измерениям (Global Average Pooling) к полученному картографическому вектору признаков.
  3. Сравнение и принятие решения: Для сравнения двух дескрипторов изображений вычисляется Евклидово расстояние. Если расстояние между дескриптором текущего кадра и дескриптором какого-либо предыдущего кадра оказывается ниже заданного порога, система регистрирует событие замыкания петли.

4. Экспериментальные результаты и выводы (Краткое изложение)

Эксперименты проводились на общедоступных наборах данных TUM RGB-D, которые являются стандартным benchmark для оценки SLAM-систем.

Ключевые результаты:

Вывод: В статье представлена работоспособная лёгкая нейронная сеть ECMobileNet для задачи обнаружения замыкания петли в визуальном SLAM. Модель сочетает в себе высокую точность и низкие вычислительные затраты, что делает её пригодной для использования в системах на мобильных платформах или устройствах с ограниченными ресурсами. Предложенный подход превосходит ряд современных методов по балансу между точностью и эффективностью.

Список литературы

  1. Mur-Artal, R., Montiel, J.M.M., Tardos, J.D.: ORB-SLAM: a versatile and accurate monocular SLAM system. IEEE Trans. Robot. 31(5), 1147–1163 (2015)
  2. Engel, J., Koltun, V., Cremers, D.: Direct sparse odometry. IEEE Trans. Pattern Anal. Mach. Intell. 40(3), 611–625 (2018)
  3. Zhang, X., Wang, L., Su, Y.: Visual place recognition: A survey from deep learning perspective. Pattern Recognit. 113, 107760 (2021)
  4. Cadena, C., et al.: Past, present, and future of simultaneous localization and mapping: Toward the robust-perception age. IEEE Trans. Robot. 32(6), 1309–1332 (2016)
  5. Fuentes-Pacheco, J., Ruiz-Ascencio, J., Rendón-Mancha, J.M.: Visual simultaneous localization and mapping: a survey. Artif. Intell. Rev. 43(1), 55–81 (2015)
  6. Williams, B., Cummins, M., Neira, J., Newman, P., Reid, I., Tardós, J.: A comparison of loop closing techniques in monocular SLAM. Robot. Auton. Syst. 57(12), 1188–1197 (2009)
  7. Strasdat, H., Montiel, J.M.M., Davison, A.J.: Scale drift-aware large scale monocular SLAM. Robot. Sci. Syst. VI, 121–128 (2010)
  8. Galvez-López, D., Tardos, J.D.: Bags of binary words for fast place recognition in image sequences. IEEE Trans. Robot. 28(5), 1188–1197 (2012)
  9. Lowe, D.G.: Distinctive image features from scale-invariant keypoints. Int. J. Comput. Vis. 60(2), 91–110 (2004)
  10. Rublee, E., Rabaud, V., Konolige, K., Bradski, G.: ORB: An efficient alternative to SIFT or SURF. In: Proceedings of the IEEE International Conference on Computer Vision, pp. 2564–2571 (2011)
  11. Bay, H., Ess, A., Tuytelaars, T., Van Gool, L.: Speeded-up robust features (SURF). Comput. Vis. Image Underst. 110(3), 346–359 (2008)
  12. Sivic, J., Zisserman, A.: Video Google: A text retrieval approach to object matching in videos. In: Proceedings of the IEEE International Conference on Computer Vision, pp. 1470–1477 (2003)
  13. Nister, D., Stewenius, H.: Scalable recognition with a vocabulary tree. In: Proceedings of the IEEE Computer Society Conference on Computer Vision and Pattern Recognition, vol. 2, pp. 2161–2168 (2006)
  14. Angeli, A., Filliat, D., Doncieux, S., Meyer, J.A.: Fast and incremental method for loop-closure detection using bags of visual words. IEEE Trans. Robot. 24(5), 1027–1037 (2008)
  15. Krizhevsky, A., Sutskever, I., Hinton, G.E.: ImageNet classification with deep convolutional neural networks. In: Advances in Neural Information Processing Systems, pp. 1097–1105 (2012)
  16. Zhang, X., et al.: A general algorithm for loop closure detection based on convolutional neural network. In: Proceedings of the IEEE International Conference on Robotics and Automation (ICRA), pp. 881–886 (2017)
  17. Chen, Z., Lam, O., Jacobson, A., Milford, M.: Convolutional neural network-based place recognition. In: Proceedings of the Australian Conference on Robotics and Automation (2014)
  18. Howard, A.G., et al.: MobileNets: Efficient convolutional neural networks for mobile vision applications. arXiv preprint arXiv:1704.04861 (2017)
  19. Sandler, M., Howard, A., Zhu, M., Zhmoginov, A., Chen, L.C.: MobileNetV2: Inverted residuals and linear bottlenecks. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, pp. 4510–4520 (2018)
  20. Howard, A., et al.: Searching for MobileNetV3. In: Proceedings of the IEEE International Conference on Computer Vision, pp. 1314–1324 (2019)
  21. Zhang, X., Zhou, X., Lin, M., Sun, J.: ShuffleNet: An extremely efficient convolutional neural network for mobile devices. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, pp. 6848–6856 (2018)
  22. Wang, Q., Wu, B., Zhu, P., Li, P., Zuo, W., Hu, Q.: ECA-Net: Efficient channel attention for deep convolutional neural networks. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, pp. 11534–11542 (2020)
  23. Hu, J., Shen, L., Sun, G.: Squeeze-and-excitation networks. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, pp. 7132–7141 (2018)
  24. He, K., Zhang, X., Ren, S., Sun, J.: Deep residual learning for image recognition. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, pp. 770–778 (2016)