ДонНТУ Портал магистров
← Назад
Источник: I. Tanvir, A. Ruslan, S. Solaiman. Comparative Analysis of Custom CNN Architectures versus Pre-trained Models and Transfer Learning: A Study on Five Bangladesh Datasets // arXiv preprint arXiv:2601.04752. — Dhaka: University of Dhaka, 2026. — 1–12 p.

СРАВНИТЕЛЬНЫЙ АНАЛИЗ ПОЛЬЗОВАТЕЛЬСКИХ CNN АРХИТЕКТУРЫ ПО СРАВНЕНИЮ С ПРЕДВАРИТЕЛЬНО ПОДГОТОВЛЕННЫМИ МОДЕЛЯМИ И ПЕРЕДАЧА ОБУЧЕНИЯ

Автор перевода: П.К. Стёпушкина

Авторы оригинала: Ибрагим Танвир, Алиф Руслан и Сартадж Солайман, Факультет компьютерных наук и инженерии, Университет Дакка, Дакка, Бангладеш

Аннотация: В данном исследовании представлен комплексный сравнительный анализ изготовленных на заказ конструкций волевые нейронные сети (CNN) на основе популярных предварительно обученных архитектур (ResNet-18 и VGG-16), использующие как извлечение признаков, так и обучение передаче подходы. Мы оценили эти модели на пяти различных классификациях изображений наборы данных из Бангладеш: видение пешеходной дорожки, обнаружение авторикши, Mango Классификация изображений, распознавание разновидностей риса и обнаружение повреждений на дорогах. Наши экспериментальные результаты демонстрируют, что обучение переносится с точной настройкой неизменно превосходит как пользовательские CNN, созданные с нуля, так и функциональные методы извлечения, позволяющие повысить точность в различных наборах данных. Примечательно, что ResNet-18 с точной настройкой добился идеальной 100%-ной точности в Наборе данных BD о дорожных повреждениях. В то время как пользовательские CNN имеют преимущества в размере модели (3,4 млн параметров по сравнению с 11-134 МЛН для предварительно обученных моделей) и эффективность обучения для более простые задачи, предварительно обученные модели с трансферным обучением обеспечивают превосходную производительность управления, особенно в сложных задачах классификации с ограниченными обучающими данными. Это исследование дает практическую информацию практикам при выборе подходящих применял подходы к глубокому обучению на основе характеристик набора данных, вычислительных ресурсы и требования к производительности.

Ключевые слова: сверточные нейронные сети, переносное обучение, предварительно обученные модели, Классификация изображений, глубокое обучение, компьютерное зрение, наборы данных Бангладеш.

1. Введение

Глубокое обучение, особенно сверточные нейронные сети (CNN), произвели революцию за последнее десятилетие задачи компьютерного зрения изменились. Однако практики сталкиваются с критической решение при разработке систем классификации изображений: должны ли они создавать пользовательские Архитектура CNN с нуля, использовать предварительно обученные модели для выделения объектов или использовать переносное обучение с точной настройкой? Этот выбор существенно влияет на модель производительность, время обучения, вычислительные ресурсы и возможность развертывания. Предварительно обученные модели, такие как ResNet и VGG, обученные на крупномасштабных наборах данных, таких как ImageNet, стали фактическими стандартами в области компьютерного зрения. Эти модели охватывают обобщаемые функции миллионов изображений, потенциально снижая потребность в обширные обучающие данные и вычислительные ресурсы. Однако пользовательские CNN, разработанные специально для конкретной задачи, могут предложить преимущества с точки зрения размера модели, скорости вывода, и адаптация к характеристикам, специфичным для конкретной предметной области. В этом исследовании рассматривается исследовательский вопрос: Как пользовательские архитектуры CNN сравниваются с предварительно подготовленными моделями (с использованием извлечения объектов и обучения передаче) в различных задачах классификации изображений? Мы оцениваем три различных подхода:
1. Кастомный CNN (обучение с нуля): упрощенная архитектура CNN, разработанная и обученная с нуля.
2. Предварительно обученные модели (извлечение объектов): ResNet-18 и VGG-16 с замороженными сверточными слоями.
3. Перенос обучения (точная настройка): ResNet-18 и VGG-16 с обучаемыми уровнями
Наша оценка охватывает пять наборов данных, представляющих реальные приложения в Бангладеш: обнаружение нарушений пешеходной дорожки, идентификация авторикши, манго классификация сортов, распознавание сортов риса и оценка ущерба на дорогах. Эти наборы данных различаются по сложности, количеству классов и характеристикам изображений, что обеспечивает надежную испытательную базу для сравнения подходов к моделированию.
Это исследование вносит следующий вклад:
• Всестороннее эмпирическое сравнение пользовательских CNN с предварительно обученными моделями в пяти различных наборах данных.
• Систематическая оценка извлечения признаков в сравнении с подходами точной настройки для обучения передаче. Анализ компромиссов между производительностью модели, размером и эффективностью обучения.
• Практические рекомендации по выбору подходящих подходов к глубокому обучению на основе характеристик набора данных.
• Представление об эффективности трансфертного обучения на предметно-ориентированных наборах данных Бангладеш.

2. Связанная работа

Трансфертное обучение стало краеугольным камнем современного глубокого обучения, позволяя практикам специалистам использовать знания из крупномасштабных наборов данных для решения специализированных задач. Йосински et al. [7] продемонстрировал, что функции, изученные CNNs в ImageNet, могут передаваться к другим задачам визуального распознавания, с изучением общих характеристик на ранних уровнях и более поздних слои, изучающие особенности, специфичные для конкретной задачи. В нескольких исследованиях сравнивались пользовательские архитектуры с предварительно подготовленными моделями. Рават и Ван [4] предоставляют всесторонний обзор глубоких архитектур CNN, высоко- освещающий эволюцию от AlexNet к ResNet и растущую глубину успешных архитектур. Он и др. [1] представили ResNet с остаточными подключениями, решив проблему деградации в очень глубоких сетях и достигнув самых современных результатов в нескольких тестах. Для приложений с ограниченными ресурсами Сэндлер и др. [5] разработали MobileNetV2, демонстрируя, что эффективные архитектуры могут достигать конкурентоспособной точности при значительных затратах. значительно меньшее количество параметров. Этот компромисс между размером модели и производительностью остается критически важным фактором в практических приложениях. Исследования по переносу обучения в специализированные области показали неоднозначные результаты. Корнблит и др. [2] обнаружили, что повышение производительности ImageNet обычно приводит к повышению эффективности передачи знаний, но корреляция зависит от целевой задачи. Рагу и др. [3] подвергли сомнению традиционную мудрость обучения трансферу, показав, что при наличии достаточного количества данных обучение с нуля может соответствовать обучению трансферу Производительность. Существуют ограниченные исследования сравнительных исследований с использованием наборов данных для конкретной Бангладеш. Это исследование восполняет этот пробел, систематически оценивая различные подходы к моделированию на разнообразные локальные наборы данных, обеспечивающие понимание, актуальное для специалистов, работающих над аналогичными региональными приложениями.

3. Методология

3.1 Наборы данных

Мы оценили наши модели на пяти различных наборах данных классификации изображений из Бангладеш: Набор данных Footpath Vision Dataset: Бинарная классификация проникновения на пешеходную дорожку, различающая различение пешеходных дорожек с проникновением и без. Этот набор данных адресует проблемы городского планирования и доступности. Набор данных для обнаружения авторикш: многоклассовая классификация различных типов авторикши, актуальные для транспортных исследований и управления дорожным движением. Набор данных Mango Image BD: Классификация часто встречающихся сортов манго в Бангладеш, для поддержки сельскохозяйственного применения и контроля качества. Набор данных Paddy Variety BD: многоклассовая классификация сортов риса (пэдди), имеет решающее значение для сельскохозяйственных исследований и управления растениеводством в Бангладеш. Набор данных BD о дорожном ущербе: классификация состояния дорожного покрытия и типы повреждений, применимые к мониторингу инфраструктуры и планированию технического обслуживания. Каждый набор данных был предварительно разделен на обучающие, валидационные и тестовые наборы для обеспечения последовательная оценка по всем моделям. В таблице 1 представлен полный обзор всех пяти наборов данных, использованных в этом исследовании.

Обзор пяти наборов данных по Бангладеш, использованных в этом исследовании Рисунок 1 – Обзор пяти наборов данных по Бангладеш, использованных в этом исследовании.

3.2 Типовые архитектуры

3.2.1 Пользовательская архитектура CNN

Наш пользовательский CNN был разработан как легкий, но эффективный, состоящий из четырех конвоев. графические блоки с прогрессивным расширением канала 32 → 64 → 128 → 256 каналы). Каждый блок:
• Два сверточных слоя 3 × 3 с пакетной нормализацией и повторной активацией.
• Максимальное объединение (2 × 2) для уменьшения пространственных размеров.
• Отсев (от 0,1 до 0,3, постепенно увеличивающийся) для регуляризации.
За извлечением объектов следует адаптивное объединение средних и трехслойный полностью подключенный классификатор 512 → 256 → num.classes с отсевом (0,5 и 0,3). Архитектура была инициализирована с использованием инициализации Kaiming и обучена на основе случайных весов:
• Общие параметры: 3,40 Млн.
• Обучаемые параметры: 3,40 Млн.

3.2.2 Предварительно обученные модели

Мы использовали две популярные архитектуры CNN, предварительно обученные в ImageNet: ResNet-18: остаточная сеть с 18 уровнями, включающими пропускные соединения, которые позволяют обучать очень глубокие сети. Архитектура содержит остаточные блоки с ярлыками идентификации, пакетной нормализацией и повторными активациями:
• Общее количество параметров: 11.18 Млн.
• Обучаемые параметры (выделение признаков): ~ 0.00М (только классификатор).
• Обучаемые параметры (точная настройка): 11,18 М (все слои).
VGG-16: глубокая сеть с 16 весовыми уровнями, обеспечивающая небольшую (3 × 3) свертку фильтры и простой архитектурный дизайн. Сеть состоит из пяти сверточных блоки, за которыми следуют три полностью соединенных слоя:
• Общее количество параметров: 134,27 Млн. Обучаемые параметры (выделение объектов): ~ 0,01 Млн (только для классификатора).
• Обучаемые параметры (точная настройка): 134,27 М (все слои).

3.3 Подходы к обучению

Мы оценили три различных подхода к обучению:
1. Пользовательский CNN (обучение с нуля): пользовательская архитектура была обучена на основе случайно инициализированных весов с помощью оптимизатора Adam (скорость обучения: 0.001), использование потери кросс-энтропии.
2. Извлечение объектов: в качестве фиксированных средств извлечения объектов использовались предварительно обученные модели. Все сверточные слои были заморожены, и только конечный полностью связанный классификатор был обучен. Этот подход использует предварительно изученные функции, требуя минимального обучения время.
3. Перенос обучения (точная настройка): Предварительно обученные модели были инициализированы с помощью Веса ImageNet, но все слои были сделаны обучаемыми. Это позволяет модели адаптироваться предварительно изученные функции соответствуют конкретным характеристикам целевых наборов данных с сохранением преимущество обучения при переносе.
Все модели обучались в течение 10 эпох с размером пакета 32.

3.4 Показатели оценки

Эффективность модели оценивалась с использованием следующих показателей:
• Точность теста: процент правильно классифицированных образцов в тестовом наборе.
• Оценка F1: среднее гармоническое значение точности и отзыва, обеспечивающее сбалансированный показатель (доступно для двоичных и некоторых многоклассовых наборов данных).
• Время обучения: общее время, необходимое для обучения модели (секунды).
• Размер модели: общее количество параметров (миллионы).
• Обучаемые параметры: Количество параметров, обновленных во время обучения (миллионы).
Мы сообщаем о максимальной точности проверки, достигнутой во время обучения и финального набора тестов Производительность. Все эксперименты проводились с использованием согласованного оборудования, разделения данных и гиперпараметров для обеспечения объективного сравнения.

4. Экспериментальных результата

В этом разделе представлены наши комплексные экспериментальные результаты по всем пяти наборам данных и три подхода к моделированию. Мы анализируем показатели производительности, эффективность обучения и характеристики модели, чтобы получить представление о компромиссах между различными подходами.

4.1 Сравнение общей производительности

В таблице 2 представлено всестороннее сравнение всех моделей во всех наборах данных. результаты демонстрируют четкие закономерности в относительной производительности различных подходов к моделированию.

Всестороннее сравнение производительности всех моделей и наборов данных. FE = Характеристика Рисунок 2 – Всестороннее сравнение производительности всех моделей и наборов данных. FE = Характеристика

4.2 Анализ для конкретного набора данных

4.2.1 Набор данных Footpath Vision

Набор данных Footpath Vision продемонстрировал постоянное улучшение по сравнению с пользовательским CNN (точность тестирования 78,16%) благодаря переносу подходов к обучению. VGG-16 с точной настройкой достигнута высочайшая точность - 91,38% (F1: 0,912), что соответствует улучшению на 16,9%- улучшен по сравнению с пользовательским CNN. Методы извлечения объектов достигли промежуточного уровня производительность (85-88%), демонстрируя, что даже замороженные предварительно обученные объекты захватывают полезные шаблоны для этой задачи. Время обучения было одинаковым для всех подходов (~ 1070- 1108 секунд), предполагая, что размер набора данных и сложность влияют на обучение продолжительность, а не архитектура модели 𝐅𝐢𝐠 и (f) повышение производительности по сравнению с пользовательским CNN.

Сравнение данных Рисунок 3 – Сравнение данных
4.2.2 Набор данных авторикш

Набор данных для Auto Rickshaw оказался более сложным: пользовательский CNN достиг точности проверки всего 67,84%. ResNet-18 с точной настройкой показал наиболее существенные результаты. среднее улучшение составило 79,90%, в то время как точная настройка VGG-16 достигла 76,38%. Интересно, что методы извлечения признаков (71-74%) обеспечили умеренные улучшения, предполагая, что что функции ImageNet могут быть перенесены на задачи классификации транспортных средств, но для оптимальной производительности необходима точная настройка. Этот набор данных демонстрирует ценность передачи данных когда пользовательские архитектуры сталкиваются со сложностью задач.

4.2.3 Набор данных Mango Image BD

Набор данных Mango Image BD продемонстрировал исключительную эффективность передачи данных. ResNet-18 и VGG-16 с точной настройкой достигли почти идеальной точности (99,67% и 99,70% соответственно), значительно превосходя пользовательский CNN (90,04%). Даже точность методов извлечения признаков превысила 90%. Эта замечательная производительность предполагает, что детализированные визуальные характеристики, полученные из ImageNet (который включает различные категории фруктов), эффективно переносятся в классификацию сортов манго. Обычай Приличная точность CNN в 90% указывает на то, что сама задача относительно четко определена, но предварительно обученные модели улавливают тонкие отличительные особенности, которые значительно повышают Производительность.

4.2.4 Набор данных Paddy Variety BD

Набор данных Paddy Variety BD представлял наибольшую сложность во всех экспериментах . Пользовательский CNN достиг точности тестирования всего 52,89%, что указывает на значительную сложность в изучении отличительных признаков с нуля. Метод извлечения признаков- ods незначительно улучшил производительность (60-68%), но настоящий прорыв произошел с точная настройка: ResNet-18 достигла 93,10%, а VGG-16 - 92,30%. Это 76% относительное улучшение демонстрирует эффективность обучения передаче данных, когда наборы данных имеют суб- выявлять межклассовые различия. Результаты показывают, что различение сортов риса требует сложного представления признаков, которое значительно выигрывает от ImageNet предварительная подготовка.

4.2.5 Набор данных BD о дорожном ущербе

Набор данных BD о дорожном ущербе дал наиболее впечатляющие результаты. Оба ResNet- 18 и VGG-16 с точной настройкой достигли идеальной 100% точности тестирования (F1: 1.000), в то время как пользовательский CNN достиг 91.18%. Методы извлечения объектов также показали себя хорошо (98,53%). Время обучения было заметно короче для этого набора данных (~ 400-434 секунд), вероятно, из-за меньшего размера набора данных или более четкого разделения классов. Идеальная точность, достигаемая точно настроенными моделями, предполагает, что структура повреждений на дорогах хорошо изучена представленные в ImageNet разнообразные визуальные функции и адаптация за счет тонкой настройки идеально отражают характеристики, характерные для конкретного набора данных.

5. Анализ и обсуждение

5.1 Сравнение производительности между подходами

Наши результаты выявляют четкие закономерности в относительной производительности различных методов моделирования подходы. Доминирует перенос обучения (точная настройка): во всех пяти наборах данных, точная настройка предварительно подготовленных моделей (ResNet-18 или VGG-16) неизменно обеспечивала высочайшую точность. Разрыв в производительности был наиболее значительным на сложных наборах данных (Paddy Разнообразие: относительное улучшение на + 76%) и оставалось значительным даже для наборов данных, где пользовательские CNN показали достаточно хорошие результаты (изображение пешеходной дорожки: улучшение на +17%). Выделение признаков как "золотую середину": с помощью предварительно обученных моделей, как фиксированные характеристика экстракторы предоставленных промежуточными производительности между таможенной CNNs и тонкой тюнинг. Этот подход предлагает практический компромисс: более быстрое обучение, чем точная настройка с более высокая производительность, чем обучение с нуля. Особенно хорошо работало извлечение функций хорошо изучен показатель ущерба от дорожных происшествий (98,53% против 100% при точной настройке), предполагающий, что предварительно сами по себе подготовленные функции могут быть высокоэффективными, когда задачи согласуются с доменом ImageNet. Пользовательские ограничения CNN: В то время как пользовательские CNN достигли респектабельной производительности по некоторым наборам данных (ущерб на дорогах: 91,18%, Mango: 90,04%), они испытывали трудности при выполнении сложных задач, требующих детального распознавания (разнообразие риса: 52,89%, Авто Рикша: 67,84%). Облегченная архитектура (параметры 3,4M) обеспечивает преимущества размер модели, но не может соответствовать репрезентативности и передаче данных преимущества более глубоких предварительно обученных сетей в обучении. Сравнение архитектур: ResNet-18 и VGG-16 продемонстрировали сопоставимую производительность в большинстве случаев ни одна из них не превосходила другую. ResNet-18 остаточные соединения и более эффективная конструкция (параметры 11,18 М против 134,27 М) предполагают, что это может быть предпочтительнее при ограниченных вычислительных ресурсах.

5.2 Компромиссы: производительность и КПД

Наше исследование выявило несколько важных компромиссов. Размер модели по сравнению с Точностью: Изготовленные на заказ CNN предлагают наименьший размер модели (3,4 м параметры), но жертвуют точностью, особенно при выполнении сложных задач. VGG-16 обеспечивает максимальную производительность, но требует 39 × большего количества параметров, чем пользовательские CNNS, и в 12 раз больше чем ResNet-18. Для сценариев развертывания со строгими ограничениями памяти предпочтительнее использовать пользовательские CNNs или ResNet-18 могут быть предпочтительнее, несмотря на несколько меньшую точность. Соображения по времени обучения: Удивительно, но время обучения было относительно небольшим аналогичные подходы для больших наборов данных (1030-1108 секунд для пешеходной дорожки / автомобиля Рикша), предполагая, что характеристики набора данных влияют на продолжительность обучения. Для Повреждения на дороге BD, более короткое время обучения (403-434 секунды) отражали меньший набор данных размер. Теоретически извлечение объектов должно выполняться быстрее из-за замороженных слоев, но наш результаты демонстрируют незначительные различия, возможно, из-за эффективности пакетной обработки на современных Графических процессорах. Обучаемые параметры: извлечение функций значительно снижает обучаемость параметры (~ 0,00-0,01 М по сравнению с 11-134 М для точной настройки), потенциально позволяющие обучать на менее мощном оборудовании или с ограниченной памятью графического процессора. Такой подход позволил 85-98% точной настройки производительности для наборов данных, что делает ее привлекательной при вычислительных ресурсы ограничены. Соображения, связанные с конкретной задачей: характеристики набора данных сильно влияют на оптимальный подход. Для четко определенных задач с четкими визуальными характеристиками (дорожные повреждения, Mango) даже более простые подходы хорошо работают. Для задач с тонким различением (Paddy Разнообразие), репрезентативная мощь и преимущества обучения передаче данных от крупных предварительно обученных сети становятся незаменимыми.

5.3 Практические рекомендации

На основе наших выводов мы предлагаем следующие рекомендации: Выберите Перенос обучения (Тонкая настройка), когда: основная цель - максимальная точность; доступно достаточное количество памяти графического процессора и вычислительных ресурсов; количество обучающих данных ограничено (10 000 выборок на класс); задача требует детального распознавания; домен частично пересекается с категориями ImageNet. Выберите извлечение объектов, когда: вычислительные ресурсы ограничены; приемлема хорошая производительность (по сравнению с оптимальной); важна быстрая разработка модели; объем памяти графического процессора ограничен; задача относительно проста. Выберите пользовательский CNN, когда: размер модели должен быть минимальным для развертывания (мобильные, периферийные устройства). Задача сильно зависит от предметной области и не пересекается с ImageNetИнтерпретируемость и контроль архитектуры имеют решающее значение доступны большие объемы обучающих данных и скорость вывода в реальном времени имеет решающее значение. Выбор архитектуры: мы рекомендуем выбирать между ResNet-18 и VGG-16. ResNet-18 подходит для большинства приложений благодаря своей превосходной эффективности (в 8,3 раза меньшее количество параметров) при сопоставимой производительности. Используйте VGG-16 только тогда, когда его специфические архитектурные особенности характеристики соответствуют требованиям задачи или когда максимальная производительность оправдывает вычислительные затраты.

5.4 Ограничения и будущая работа

Это исследование имеет несколько ограничений, которые предполагают направления будущих исследований. Объем набора данных: Наша оценка была ограничена пятью наборами данных из Бангладеш. Несмотря на разнообразие приложений, они могут не отражать все возможные задачи компьютерного зрения. Будущая работа должна распространяться на наборы данных из разных доменов и географических регионов. Выбор архитектуры: Мы оценивали только ResNet-18 и VGG-16 как предварительно подготовленные модели. Современные архитектуры, такие как EfficientNet, Vision Transformers (ViT), и варианты MobileNet, могут предлагать различные компромиссы между производительностью и экономичностью. Настройка гиперпараметров: Хотя мы использовали согласованные гиперпараметры во всех всех экспериментах для объективного сравнения, настройка для конкретной задачи может улучшить пользовательские настройки Производительность CNN. В будущей работе можно было бы изучить автоматизированный поиск архитектуры и гиперпараметрическую оптимизацию. Объем обучающих данных: наши наборы данных различались по размеру, но мы не использовали систему на практике изучите, как объем обучающих данных влияет на относительную производительность различных подходов. Понимание того, когда пользовательские CNN становятся конкурентоспособными по сравнению с трансферными обучение по мере увеличения объема данных дало бы ценную информацию. Соображения по развертыванию: Мы не оценивали скорость вывода, энергопотребление потребление или сложность развертывания — важные факторы для реальных приложений. В будущих исследованиях следует оценить эти практические соображения по развертыванию. Методы ансамбля: объединение прогнозов из нескольких моделей может усилить взаимодополняющие преимущества пользовательских и предварительно обученных архитектур.

6. Заключение

В этом всеобъемлющем исследовании сравнивались пользовательские архитектуры CNN с предварительно обученными модели с использованием извлечения признаков и переноса обучения из пяти различных наборов данных в Бангладеш . Наши результаты являются четким доказательством того, что перенос обучения с точной настройкой неизменно обеспечивает превосходную производительность, достижение повышения точности в диапазоне от 3% до 76% по сравнению с обычными CNN, обученными с нуля.
Ключевые выводы включают:
1. Доминирование в процессе передачи знаний: отлаженные предварительно обученные модели (ResNet-18, VGG-16) превзошел пользовательские CNN по всем наборам данных, благодаря особенно радикальным значительным улучшениям в сложных задачах, требующих детального распознавания.
2. Жизнеспособность извлечения объектов: Использование предварительно обученных моделей в качестве средств извлечения фиксированных объектов это практический компромисс, позволяющий достичь 85-98% производительности точной настройки управление с уменьшенными вычислительными требованиями.
3. Эффективность архитектуры: ResNet-18 соответствует или превосходит производительность VGG-16 при использовании в 8,3 раза меньшего количества параметров, предполагая, что это предпочтительный выбор для большинства приложений.
4. Эффективность в зависимости от задачи: преимущества обучения с переводом были наиболее заметны отказывался от сложных задач с ограниченными обучающими данными, когда пользовательские CNN изо всех сил пытались изучить адекватные представления.
5. Практические компромиссы: В то время как изготовленные на заказ CNN имеют преимущества в размере модели (3,4 м параметры) и простоте развертывания, эти преимущества редко оправдывают значительные затраты снижение производительности, за исключением сценариев с серьезными ограничениями ресурсов.
Наши результаты настоятельно рекомендуются специалистам, разрабатывающим системы классификации изображений, рекомендуется использовать переносное обучение в качестве стандартного подхода, особенно при работе с ограниченные учебные данные для конкретной предметной области. Замечательная эффективность предварительно подготовленных моделей для наборов данных для Бангладеш, охватывающих городское планирование, сельское хозяйство, транс- перенос и инфраструктура — демонстрирует, что функции, изученные ImageNet, передаются эффективно даже в специализированные локальные приложения. Поскольку глубокое обучение продолжает развиваться, понимание этих компромиссов между обычными томными архитектурами и трансфертным обучением остается решающим для создания эффективных систем компьютерного зрения. Это исследование предоставляет эмпирические данные и практические рекомендации по выбору этих вариантов в реальных приложениях.

Список литературы

  1. He, K.; Zhang, X.; Ren, S.; Sun, J. Deep residual learning for image recognition / K. He et al. // Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition. – 2016. – P. 770–778.↑ к тексту
  2. Kornblith, S.; Shlens, J.; Le, Q.V. Do better ImageNet models transfer better? / S. Kornblith et al. // Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. – 2019. – P. 2661–2671.↑ к тексту
  3. Raghu, M.; Zhang, C.; Kleinberg, J.; Bengio, S. Transfusion: Understanding transfer learning for medical imaging / M. Raghu et al. // Advances in Neural Information Processing Systems. – 2019. – P. 3347–3357.↑ к тексту
  4. Rawat, W.; Wang, Z. Deep convolutional neural networks for image classification: A comprehensive review / W. Rawat, Z. Wang. // Neural Computation. – 2017. – Vol. 29, No. 9. – P. 2352–2449.↑ к тексту
  5. Sandler, M.; Howard, A.; Zhu, M.; Zhmoginov, A.; Chen, L.C. MobileNetV2: Inverted residuals and linear bottlenecks / M. Sandler et al. // Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition. – 2018. – P. 4510–4520.↑ к тексту
  6. Simonyan, K.; Zisserman, A. Very deep convolutional networks for large-scale image recognition [Электронный ресурс] / K. Simonyan, A. Zisserman. – 2014. – Режим доступа: https://arxiv.org/abs/1409.1556.↑ к тексту
  7. Yosinski, J.; Clune, J.; Bengio, Y.; Lipson, H. How transferable are features in deep neural networks? / J. Yosinski et al. // Advances in Neural Information Processing Systems. – 2014. – P. 3320–3328.↑ к тексту
  8. Lubaina, A.; Pahlowan, M.E.U.; Munni, T.I.; Ibrahim, M. FootpathVision: A Comprehensive Image Dataset and Deep Learning Baselines for Footpath Encroachment Detection [Электронный ресурс] / A. Lubaina et al. – Elsevier, 2025. – P. 1–10. – Режим доступа: https://papers.ssrn.com/sol3/papers.cfm?abstract_id=5577201.↑ к тексту
  9. Das, S.S.; Roy, D.; Shakil, F.; Singha, N.; Asik, A.; Joarder, A.; Fuad, M.M.N.; et al. Detecting Unauthorized Vehicles using Deep Learning for Smart Cities: A Case Study on Bangladesh [Электронный ресурс] / S.S. Das et al. – 2024. – P. 1–16. – Режим доступа: https://arxiv.org/abs/2510.26154.↑ к тексту
  10. Ferdaus, M.H.; Prito, R.H.; Ahmed, M.; Islam, M.M.; Ali, M.S.; Ibrahim, M.; et al. MangoImageBD: An Extensive Mango Image Dataset for Identification and Classification of Various Mango Varieties in Bangladesh [Электронный ресурс] / M.H. Ferdaus et al. // Data in Brief. – 2025. – Статья 111908. – Режим доступа: https://www.sciencedirect.com/science/article/pii/S2352340925006328.↑ к тексту
  11. Tahsin, M.; Ibrahim, M.; Nafisa, A.T.; Nuha, M.B.R.; Arnab, M.I.; Ferdaus, M.H.; et al. PaddyVarietyBD: Classifying paddy variations of Bangladesh with a novel image dataset [Электронный ресурс] / M. Tahsin et al. // Data in Brief. – 2024. – Vol. 60. – Статья 111514. – Режим доступа: https://www.sciencedirect.com/science/article/pii/S235234092500246X.↑ к тексту
  12. Hossen, R.; Mistry, D.; Rahman, M.; Sami, W.A.; Hridoy, A.R.; Saha, S.; Ibrahim, M. Road Damage and Manhole Detection using Deep Learning for Smart Cities: A Polygonal Annotation Approach [Электронный ресурс] / R. Hossen et al. – 2024. – P. 1–13. – Режим доступа: https://arxiv.org/abs/2510.03797.↑ к тексту
← Назад