УЛУЧШЕНИЕ РАСПОЗНАВАНИЯ МАРКИ И МОДЕЛИ АВТОМОБИЛЯ С МОДУЛЯМИ 3D ATTENTION
Аннотация: Распознавание марки и модели транспортного средства (VMMR) является важнейший компонент интеллектуальной транспортной системы, привлекающий значительное внимание в последние годы. VMMR широко используется для обнаружения подозрительных транспортных средств, мониторинга городского движения- fic и системы автономного вождения. Сложность VMMR возникает из-за тонких визуальных различий между моделями транспортных средств и большое разнообразие классов, выпускаемых производителями. Сверточные нейронные сети (CNN), известный тип модели глубокого обучения широко использовались в различных задачах компьютерного зрения, включая VMMR, что дает замечательные Результаты. Поскольку VMMR является мелкозернистой проблемой классификации, она в первую очередь сталкивается с межклассовым сходством и внутриклассовыми вариациями проблемами. В этом исследовании мы внедряем модуль внимания для решения этих проблем и повышения сосредоточенности модели на критических областях, содержащих отличительные особенности. Этот модуль, который не увеличивает параметры исходной модели, генерирует трехмерные (трехмерные) веса внимания для уточнения карта объектов. Предлагаемая нами модель объединяет модуль attention в двух разных местах в средней части сверточная модель, где объекты отображаются из этих разделов предоставлять достаточную информацию о входных кадрах, не не будучи чрезмерно подробной или грубой. Производительность наших предлагаемая модель, наряду с современными сверточными моделями (SOTA) и моделями на основе трансформаторов, была оценена с использованием стэнфордского Набора данных Cars. Предложенная нами модель достигла наивысшей точности, 90,69%, среди сравниваемых моделей.
Ключевые слова: глубокое обучение, распознавание транспортных средств, модификация внимания- ule.
1. Введение
В области интеллектуальных транспортных систем (ИТС) новой темой, относящейся к анализу транспортных средств, является VMMR. В в автомобильной промышленности термин "марка" обозначает производителя конкретного транспортного средства (такого как Hyundai, Ford и Toyota), тогда как "модель" определяет определенный тип транспортного средства, созданного этими производителями (такими как Azera, Corolla и Focus). Управление дорожным движением, наблюдение, статистика дорожного движения, правоохранительные органы, самоуправляемые автомобили транспортные средства и обнаружение подозрительных транспортных средств - это лишь несколько областей, в которых системы VMMR широко используются используется [1]. VMMR Можно рассматривать как своего рода мелкозернистую классификацию , целью которой является идентификация и разграничение категорий с очень похожими характеристиками в задаче классификации. огромные существующие категории, низкая межклассовая и высокая внутриклассовая дисперсия различия в классе делают VMMR чрезвычайно сложной задачей. появление незначительных визуальных различий в конкретных случаях может чрезвычайно затруднить распознавание даже для людей [2]. В настоящее время часто используются сети глубокого обучения в различных задачах компьютерного зрения, одной из которых является изображениераспознавание. CNNs, как одна из моделей глубокого обучения, значительно улучшили выполнение задач, связанных с видением благодаря их богатой репрезентативной силе [3-6]. Многие из в предложенных методах для VMMR использовались модели на основе CNN и были достигнуты замечательные результаты. Трансформатор является также разновидность глубокой нейронной сети, которая впервые была использована в области обработки естественного языка (NLP). Мотивировано значительное достижение transformer в области NLP, сеть на основе transformer используется во многих задачах компьютерного зрения, включая распознавание изображений [7]. Поскольку transformer основан на механизме самоконтроля, подходит для извлечения долгосрочных зависимостей и более способен извлекать глобальные функции [8]. Напротив, CNN в большей степени способны выделять местные особенности. В человеческом восприятии внимание имеет решающее значение. Один ключевой аспект особенность анатомии человеческого глаза заключается в том, что люди не стремятся обрабатывать всю сцену одновременно. Скорее, люди используют подмножество частичных представлений и выборочная концентрация на выдающихся элементах для более эффективного восприятия визуальной структуры. Эта концепция вдохновила на создание механизма внимания в глубоком обучении [9]. Поскольку в задачах компьютерного зрения, включая распознавание изображений, важны как локальные, так и глобальные особенности чрезвычайно важно, что механизм внимания может быть использован для повышения способности CNNS извлекать глобальную информацию. В этой статье мы представляем расширенную сеть для VMMR который включает в себя простой модуль внимания без параметров (SimAM). Этот модуль, который мы демонстрируем, является более эффективнее, чем другие существующие модули SOTA attention, сочетается с подходящей сверточной моделью эффективным способом. Результатом является значительное увеличение репрезентативности модели . Механизм внимания помогает модели сосредоточиться на важной части изображения, выделяя наибольший объем информации при игнорировании менее важных областей. Это уменьшение негативного воздействия внутриклассовых различий и межклассовое сходство вселяет уверенность в эффективности наш подход. Остальная часть этого исследования организована следующим образом: Мы исследуем соответствующие работы в разделе II. В разделе III объясняется структура предлагаемой нами модели. В разделе IV мы демонстрируем результаты оценки производительности нашей предлагаемой сети и других архитектур SOTA и анализируем наши результаты. Наконец, мы подводим к завершению наше исследование в Разделе V.
Рисунок 1 - Сетевая архитектура предлагаемой модели
2. Сопутствующие работы
В этом разделе, несколько известных работ по распознаванию изображений кратко рассмотрены модели и модули внимания.
А. Модели глубокого обучения
CNN обычно встречаются в различных задачах компьютерного зрения , включая VMMR. Несколько исследований сосредоточены на де- архитектуре моделей подписи для повышения репрезентативности CNN. Например, в ResNet [3] быстрые соединения используется, позволяя CNN расширяться до сотен уровней. Их результаты показывают, что увеличение глубины архитектуры может значительно повысить репрезентативность CNN. DenseNet [5] использует плотные соединения между слоями, позволяя каждому слою получать доступ к картам объектов всех предыдущих слоев в качестве входных данных. Такая конструкция обеспечивает несколько ключевых преимуществ: она помогает устранить проблему исчезающего градиента, облегчает повторное использование объектов, улучшает распространение объектов и заметно сокращает общую площадь подсчет раметров. На основе разделяемых по глубине сверток [10] предлагается MobileNetV2, который специально разработан для ограниченных ресурсов и мобильных сред, в которых используется новая перевернутая остаточная структура в качестве строительного блока. Используя поиск нейронной архитектуры, [11] разрабатывает новую базовую архитектуру архитектура и масштабирует ее с использованием нового метода комплексного масштабирования вывести семейство моделей, известных как EfficientNets, которые превосходят более ранние CNN с точки зрения эффективности и точности. Производительность Transformer в области NLP привлекла общество компьютерного зрения обратило на это внимание, и с появлением ViT Трансформатор был серьезно включен в задачи компьютерного зрения. Вслед за ViT были предложены другие модели на базе трансформатора для повышения производительности в задачах компьютерного зрения . Например, Swin Transformer [12] , который эффективно функционирует как универсальная магистраль для компьютера vision, создает иерархическую структуру и имеет линейный вычислительные затраты в зависимости от размера входного изображения. Смещенное внимание к себе на основе окна, фундаментальный компонент продемонстрировано, что Swin Transformer успешен и эффективен при решении проблем со зрением. CrossViT [13] - это архитектура трансформатора с двумя ответвлениями для извлечения многомасштабных функции, в которых используется объединяющий подход, основанный на перекрестном внимании используется для эффективного смешивания графических маркеров разных масштабов патчей и обмена информацией между двумя ветвями. гибридные архитектуры объединяют трансформаторы со сверточными структурные слои для введения локальности в модель трансформатора. MaxViT [14] использует иерархическую структуру с многоосевыми механизмами привлечения внимания для эффективного локального и глобального выделения объектов . Этот дизайн объединяет как свертку, так и самоконтроль уровни внимания новым и эффективным образом. Иерархический конструкция химического трансформатора Pyramid ViT (PVT) [15] предлагает пирамиду последовательного сжатия и уменьшения размеров внимание. PVT-V2 улучшает оригинальный PVT, включив в него три ключевые особенности: во-первых, слой внимания с линейной сложностью гибкость, во-вторых, перекрывающиеся вложения исправлений и, наконец, сверточная сеть прямой связи.
В. Attention
В различных работах были представлены модули attention, которые могут могут применяться ко многим CNN [16-17] . Эти модули внимания изменяют карты объектов, позволяя CNN настраивать таргетинг на im- важные области изображения или специфические и информативные характеристики и принимать решения на их основе. Репрезентативная работа является Сжатие и возбуждение (SE), который предлагает внимание с учетом канала и моделирует взаимозависимости между Каналы. Это достигается с помощью трехэтапного процесса: сжатие (глобальное среднее объединение), возбуждение (зависит от канала обучения) плотности с полностью связанными слоями) и масштабирование (изменение веса карты объектов). В более поздних работах CBAM сочетает пространственный и механизмы внимания по каналам. SRM [18] улучшает репрезентативность CNN за счет встраивания стилей в карты объектов. GC [19] эффективно фиксирует изображения на большом расстоянии зависимости для улучшения понимания семантики. ECA [20] использует метод локального межканального взаимодействия без ди- уменьшения масштабности, эффективно реализованный с помощью ID свертка. CA [21] представляет новое облегченное внимание метод, называемый координационным вниманием, разработанный для мобильных сетей- работает. Этот механизм сочетает в себе преимущества канала внимание при моделировании межканальных взаимосвязей со способностью фиксировать зависимости на большом расстоянии и поддерживать точность позиционная информация. Чтобы вычислить трехмерные веса, СимАМ [22] разрабатывает энергетическую функцию, используя некоторые устоявшиеся нейро- научные теории.Используя простые, но эффективные операции, такие как объединение средних значений для получения долгосрочных зависимостей и скалярное произведение для представления межпространственных взаимодействий, SIAM [23] генерирует трехмерные карты внимания с минимальными вычислительными накладными расходами.
3. Меттодология
В этом разделе мы представляем нашу предлагаемую модель. Чтобы обеспечить чтобы лучше понять его архитектуру, мы сначала рассмотрим характеристики некоторых известных модулей attention. Затем мы опишите формулировку SimAM [22], прежде чем детализировать нашу структуру модели.
А. Возвращаясь к модулям внимания
Модули внимания обычно встроены в каждый блок для улучшения выходных данных предыдущих слоев. Это изменение доработка обычно происходит либо по каналу, либо по пространству измерение, создание одномерных или двумерных весов и обработка нейронов аналогично в каждом канале или пространственном положении, что может ограничивать способность узнавать более четкие характеристики. Следовательно, создание трехмерных весов внимания и присвоение уникального веса каждому нейрону для уточнения карты объектов внутри слоя считается более эффективным. Прямая оценка трехмерных весов является сложной задачей. В [24] , предлагается использование структуры кодировщика-декодера для изучения трехмерных весов. . Однако этот метод вводит различные подсети от нижних уровней до более высоких уровней повторной сети, затрудняет интеграцию в другие модульные сети. CBAM - еще один пример последовательного применения модулей канала и пространственного внимания без прямого генерация трехмерных весов. Этот двухэтапный подход в CBAM требует значительного времени вычислений, предполагая, что трехмерный вычисление веса должно быть упрощено, чтобы сохранить модуль эффективный и легкий. Метод утяжеления является еще одним важным аспектом модулей attention. Проектирование конструкции требует значительных усилий. cant engineering и веса внимания рассчитываются с использованием нескольких необоснованных эвристик в большинстве исследований, которые существуют в настоящее время. Например, по сравнению с SE, CBAM использует глобальный максимальный пул (GMP) в дополнение к глобальному среднему значению объединение (GAP) для привлечения большего внимания. Как показано в таблице I, модули внимания основаны на многих распространенных операторах, таких как как FC, Conv2D, BN и т.д., а также некоторые специальные операторы, такие как свертка на основе каналов (C1D). SimAM может создавать трехмерные веса внимания для слоя карта объектов, присваивая отдельный вес каждому нейрону. Это модуль основан на концепции пространственного подавления в мозге млекопитающих, использующем энергетическую функцию для вычисления этих весов. Кроме того, SimAM ускоряет вычисление веса за счет использования быстрого решения замкнутой формы для энергетической функции.
Рисунок 2 - Сравнение различных модулей внимания на основе их структурной конструкции и параметров. К операторам относятся: свертка на основе каналов (C1D) или стандартная свертка (C2D), пространственное объединение (GAP) или среднее объединение каналов (CAP), максимальное объединение каналов (CMP) или максимальное объединение пространств (GMP), пакетное нормализация (BN), нормализация слоев (LN), вычисленное стандартное отклонение по пространственному измерению (GSP), стандартным полносвязным (FC) или канальным уровням с полным подключением (CFC), а также функциям активации, таким как Softmax и ReLU. Здесь kk и rr обозначают количество фильтров и коэффициент уменьшения, соответственно, в то время как CC представляет текущее количество функциональных каналов.
В. Модуль внимания
В SimAM оценивается важность каждого нейрона для получения трехмерных весов внимания. В визуальной нейронауке нейроны, которые предоставляют наиболее важную информацию, часто демонстрируют уникальные паттерны по сравнению со своими соседями. Кроме того, феномен пространственного подавления указывает на то, что активный нейрон может подавлять активность соседних нейронов. Нейроны, проявляющие сильные эффекты пространственного подавления, как правило, более значимы при обработке изображений.
Для выявления таких нейронов мы можем измерить линейную разделимость между целевым нейроном и окружающими его нейронами. Это понимание приводит к определению энергетической функции каждого нейрона.
Предполагая, что все пиксели одного канала следуют одинаковому распределению, среднее значение и дисперсия вычисляются один раз и повторно используются для всех нейронов в этом канале, что значительно сокращает вычислительные затраты.
Рисунок 3 - Сеть EfficientNet-B4
SimAM совместим с большинством стандартных архитектурных сооружений Эн- ТуреС. Мы выбираем сильную сверточную модель EfficientNet- B4 в качестве базовой модели. Развернув SimAM на в этой базовой модели мы получаем новую модель под названием SimAM- EfficientNetB4, как показано на рисунке 1. Ядро EfficientNet строительным блоком является мобильное инвертированное узкое место MBConv, который представляет собой тот же инвертированный остаточный блок, который используется в структуре MobileNetV2. Однако он использует не только свертки 3 × 3- , но и свертки 5 × 5 и включает оптимизацию сжатия и возбуждения. Согласно таблице II, в которой подробно описана архитектура EfficientNet-B4, она состоит из девяти этапов. Четвертая ступень состоит из четырех блоков MBConv, а Пятая ступень состоит из шести блоков MBConv. Модуль внимания - это встроен в сверточную нейронную сеть на уровне где извлеченная карта объектов содержит оптимальный уровень информация из входных кадров, балансирующая между деталями и абстракция. С этой целью SimAM добавлен в EfficientNet-B4 состоит из двух частей: 1) В первом MBConv из четвертый этап, после свертки по глубине 5 ×5 (DW Conv) и до BN. Модуль attention получает карту пространственных объектов размером 28 × 28 × 192 и выводит измененную карту объектов того же размера, 28 ×28 × 192. 2) В первом MBConv на этапе hith, после свертки по глубине 3 ×3 и до BN. Модуль attention получает карту объектов размером 14 × 14 × 336 и выводит измененную карту пространственных объектов того же размера размер 14 × 14 × 336.
4. Эксперимент
В этом разделе мы начнем с представления используемого набора данных для обучения предлагаемой нами модели следует описание экспериментальных настроек. Затем мы проводим исследование абляции чтобы продемонстрировать влияние значения коэффициента в модуль внимания нашей модели. Наконец, мы сравниваем нашу модель с самыми современными моделями (SOTA), оценивая точность racy, параметры модели и операции с плавающей запятой (FLOPs) для целевого набора данных.
Рисунок 4 - Некоторые примеры транспортных средств в наборе данных stanford car dataset
А. Набор данных и детали реализации
Мы проводим эксперименты и оцениваем эффективность предлагаемая нами модель на наборе данных о транспортных средствах. Автомобили из Стэнфорда [25] набор данных состоит из 16 185 изображений автомобилей из 196 классов, с разделением примерно 50 на 50 между данными обучения и тестирования. Обучающий набор включает 8 144 изображения, в то время как тестовый набор состоит из 8041 изображения, каждое из которых представляет один из 196 классов автомобилей. Изображения сделаны под разными углами и дают разные виды транспортных средств. Образцы из этого набора данных показаны на рисунке 2. Для проведения наших экспериментов мы использовали Google Colab в качестве нашей среды программирования, которая предлагала графический процессор Tesla T4 и 15 гигабайт оперативной памяти. Мы использовали фреймворк PyTorch для реализации наших экспериментов. Мы обучили и протестировали предлагаемые и несколько моделей SOTA в наборе данных Stanford Cars, включая модели на основе сверток и трансформаторов. Мы использовали Adam optimizer для обучения предлагаемой нами модели и всех сверточных функциональных моделей. Кроме того, планировщик CosineAnnealingLR при T-max 21000 и eta-min 1e было использовано 7 для снижения скорости обучения в процессе тренировки. Все модели на основе трансформатора были обучены с использованием стохастического Оптимизатора градиентного спуска (SGD) с импульсом 0,9 и снижением веса на 1e-4. Использовался планировщик StepLR для снижения скорости обучения во время процесса обучения, так что скорость обучения делилась на 10 через каждые 20 эпох. Все модели обучались в течение 80 эпох. Начальное обучение Скорость была установлена равной 1e-3. Мы установили размер пакета для обоих тестов и тренировался до 32 и использовал функцию потери кросс-энтропии. размер изображений был изменен до 224 × 224 Мы использовали несколько методы увеличения данных, такие как случайный поворот по горизонтали, случайный поворот до 15, случайные оттенки серого и случайный постеризация во время обучения.
В. Результаты
В таблице III представлена оценка производительности различных моделей SOTA наряду с предлагаемой моделью с использованием Stanford Cars набор данных. Сравнение основано на трех показателях: точности, Параметры измеряются миллионами, а провалы - миллиардами. Предлагаемая модель достигает высочайшей точности в 90,69%, превосходя все другие модели при сохранении относительно низкого параметра количество и провалы. Это указывает на то, что наша модель - это не только более точный, но и более эффективный с точки зрения вычислительных ресурсов по сравнению со многими методами SOTA. В таблице IV рассматриваются показатели производительности предлагаемой модели при различных значениях гиперпараметра λ. Предложенная предложенная модель демонстрирует наилучшие характеристики с точностью 90,69% при 𝜆 = 7 × 10 -4 Параметры и провалы остаются неизменными при разл значениях λ, указывая на то, что вычислительная эффективность и сложность модели остаются неизменными изменением величины λ. Следовательно, регулировка λ в первую очередь влияет на точность, при этом 𝜆 = 7 × 10 -4 является оптимальным значением для максимума.
Рисунок 5 - Оценка характеристик предлагаемой модели и моделей SOTA на автомобилях stanford набор данных
5. Заключение
В этом исследовании мы рассмотрели проблемы VMMR, включив интегрировав модуль внимания в сверточную модель. модуль attention, предназначенный для фокусировки на критических областях, содержащих отличительные особенности, был встроен без параметров, что позволило повысить способность модели справляться с межклассовым сходством и внутриклассовая вариативность без увеличения вычислительной сложности сложность. Используя набор данных Stanford Cars, предложенная нами модель был оценен наряду с методами CNN и transformer. Результаты показали, что наша модель превосходит все другие сравниваемые модели. Анализ также показал, что наша модель поддерживала относительно низкое количество параметров и сбоев, что указывает на ее эффективность с точки зрения использования вычислительных ресурсов. В будущей работе можно было бы изучить применение этого механизма внимания перейти к другим мелкозернистым проблемам классификации и исследовать ее интеграция с более продвинутыми архитектурами нейронных сетей.
Список литературы
- Ali, M.; Tahir, M.A.; Durrani, M.N. Vehicle images dataset for make and model recognition / M. Ali, M.A. Tahir, M.N. Durrani. // Data in Brief. – 2022. – Vol. 42.↑ к тексту
- Gayen, S.; Maity, S.; Singh, P.K.; Geem, Z.W.; Sarkar, R. Two decades of vehicle make and model recognition – survey, challenges and future directions / S. Gayen et al. // Journal of King Saud University – Computer and Information Sciences. – 2023. – Article 101885. – DOI: 10.1016/j.jksuci.2023.101885.↑ к тексту
- He, K.; Zhang, X.; Ren, S.; Sun, J. Deep residual learning for image recognition / K. He et al. // Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (CVPR). – 2016. – P. 770–778.↑ к тексту
- Hu, J.; Shen, L.; Sun, G. Squeeze-and-Excitation Networks / J. Hu et al. // Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (CVPR). – 2018. – P. 7132–7141.↑ к тексту
- Huang, G.; Liu, Z.; Van Der Maaten, L.; Weinberger, K.Q. Densely Connected Convolutional Networks / G. Huang et al. // Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (CVPR). – 2017. – P. 4700–4708.↑ к тексту
- Manzari, O.N.; Bayrami, F.; Khaloo, H.; Khodakaramimaghsoud, Z.; Shokouhi, S.B. DenUNet: Enhancing dental image segmentation through edge and body fusion / O.N. Manzari et al. // Multimedia Tools and Applications. – 2024. – P. 1–21. – DOI: 10.1007/s11042-024-XXXXX.↑ к тексту
- Vaswani, A.; Shazeer, N.; Parmar, N.; Uszkoreit, J.; Jones, L.; Gomez, A.N.; Kaiser, Ł.; Polosukhin, I. Attention Is All You Need / A. Vaswani et al. // Advances in Neural Information Processing Systems. – 2017. – Vol. 30.↑ к тексту
- Manzari, O.N.; Asgariandehkordi, H.; Koleilat, T.; Xiao, Y.; Rivaz, H. Medical image classification with KAN-integrated transformers and dilated neighborhood attention [Электронный ресурс] / O.N. Manzari et al. – 2025. – Режим доступа: https://arxiv.org/abs/2502.13693.↑ к тексту
- Woo, S.; Park, J.; Lee, J.-Y.; Kweon, I.S. CBAM: Convolutional Block Attention Module / S. Woo et al. // Proceedings of the European Conference on Computer Vision (ECCV). – 2018. – P. 3–19.↑ к тексту
- Sandler, M.; Howard, A.; Zhu, M.; Zhmoginov, A.; Chen, L.-C. MobileNetV2: Inverted residuals and linear bottlenecks / M. Sandler et al. // Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (CVPR). – 2018. – P. 4510–4520.↑ к тексту
- Tan, M.; Le, Q. EfficientNet: Rethinking Model Scaling for Convolutional Neural Networks / M. Tan, Q. Le. // International Conference on Machine Learning (ICML). – PMLR, 2019. – P. 6105–6114.↑ к тексту
- Liu, Z.; Lin, Y.; Cao, Y.; Hu, H.; Wei, Y.; Zhang, Z.; Lin, S.; Guo, B. Swin Transformer: Hierarchical Vision Transformer Using Shifted Windows / Z. Liu et al. // Proceedings of the IEEE/CVF International Conference on Computer Vision (ICCV). – 2021. – P. 10012–10022.↑ к тексту
- Chen, C.-F.R.; Fan, Q.; Panda, R. CrossViT: Cross-Attention Multi-Scale Vision Transformer for Image Classification / C.-F.R. Chen et al. // Proceedings of the IEEE/CVF International Conference on Computer Vision (ICCV). – 2021. – P. 357–366.↑ к тексту
- Tu, Z.; Talebi, H.; Zhang, H.; Yang, F.; Milanfar, P.; Bovik, A.; Li, Y. MaxViT: Multi-Axis Vision Transformer / Z. Tu et al. // European Conference on Computer Vision (ECCV). – Springer, 2022. – P. 459–479.↑ к тексту
- Wang, W.; Xie, E.; Li, X.; Fan, D.-P.; Song, K.; Liang, D.; Lu, T.; Luo, P.; Shao, L. Pyramid Vision Transformer: A Versatile Backbone for Dense Prediction Without Convolutions / W. Wang et al. // Proceedings of the IEEE/CVF International Conference on Computer Vision (ICCV). – 2021. – P. 568–578.↑ к тексту
- Manzari, O.N.; Kaleybar, J.M.; Saadat, H.; Maleki, S. BeFuNet: A Hybrid CNN–Transformer Architecture for Precise Medical Image Segmentation [Электронный ресурс] / O.N. Manzari et al. – 2024. – Режим доступа: https://arxiv.org/abs/2402.08793.↑ к тексту
- Saadati, D.; Manzari, O.N.; Mirzakuchaki, S. Dilated-UNet: A Fast and Accurate Medical Image Segmentation Approach Using a Dilated Transformer and U-Net Architecture [Электронный ресурс] / D. Saadati et al. – 2023. – Режим доступа: https://arxiv.org/abs/2304.11450.↑ к тексту
- Lee, H.; Kim, H.-E.; Nam, H. SRM: A Style-Based Recalibration Module for Convolutional Neural Networks / H. Lee et al. // Proceedings of the IEEE/CVF International Conference on Computer Vision (ICCV). – 2019. – P. 1854–1862.↑ к тексту
- Cao, Y.; Xu, J.; Lin, S.; Wei, F.; Hu, H. Global Context Networks / Y. Cao et al. // IEEE Transactions on Pattern Analysis and Machine Intelligence. – 2020. – Vol. 45, No. 6. – P. 6881–6895.↑ к тексту
- Wang, Q.; Wu, B.; Zhu, P.; Li, P.; Zuo, W.; Hu, Q. ECA-Net: Efficient Channel Attention for Deep Convolutional Neural Networks / Q. Wang et al. // Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR). – 2020. – P. 11534–11542.↑ к тексту
- Hou, Q.; Zhou, D.; Feng, J. Coordinate Attention for Efficient Mobile Network Design / Q. Hou et al. // Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR). – 2021. – P. 13713–13722.↑ к тексту
- Yang, L.; Zhang, R.-Y.; Li, L.; Xie, X. SimAM: A Simple, Parameter-Free Attention Module for Convolutional Neural Networks / L. Yang et al. // International Conference on Machine Learning (ICML). – PMLR, 2021. – P. 11863–11874.↑ к тексту
- Han, G.; Huang, S.; Zhao, F.; Tang, J. SIAM: A Parameter-Free, Spatial Intersection Attention Module / G. Han et al. // Pattern Recognition. – 2024. – Vol. 153. – Article 110509. – DOI: 10.1016/j.patcog.2024.110509.↑ к тексту
- Wang, F.; Jiang, M.; Qian, C.; Yang, S.; Li, C.; Zhang, H.; Wang, X.; Tang, X. Residual Attention Network for Image Classification / F. Wang et al. // Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (CVPR). – 2017. – P. 3156–3164.↑ к тексту
- Krause, J.; Stark, M.; Deng, J.; Fei-Fei, L. 3D Object Representations for Fine-Grained Categorization / J. Krause et al. // Proceedings of the IEEE International Conference on Computer Vision Workshops (ICCVW). – 2013. – P. 554–561.↑ к тексту