Реферат по теме выпускной работы
Содержание
- Введение
- 1. Актуальность темы
- 2. Цель и задачи исследования, планируемые результаты
- 3. Обзор исследований и разработок
- 3.1 Обзор международных источников
- 3.2 Обзор национальных источников
- 3.3 Обзор локальных источников
- 4. О предмете искусственного интеллекта
- 5. Создание системы наведения и следования за человеком на основе нейросетевых моделей
- 6. Итоги проделанной работы
- Список литературы
Введение
В современном производстве и повседневной жизни всё чаще применяется умная техника, автоматизирующая рутинные процессы. В основе подобных систем лежат множества алгоритмов, которые призваны решать те или иные задачи на различных уровнях – низком и высоком. Если говорить о низком уровне, то это, например: подсчет одометрии, снятие показаний простейших датчиков, приведение в движение кинематики и тому подобное.
Высокий уровень подразумевает работу со сложными вычислительными процессами, часто связанными с многопоточным запуском программных узлов для обработки и расчета различных данных. Одной из таких задач высокого уровня является применение систем компьютерного зрения для управления автономными электромеханическими объектами. И если ранее существовали только математические алгоритмы, основывающиеся на сегментации форм по границам и цветам или использовании каскадов Хаара (которые тоже по сути своей используют разницу цветовых признаков определенных областей изображения), то на данный момент существуют эффективные методы использования сверточных нейронных сетей для достижения целей, поставленных данной задачей. Данные методы способны дать гораздо большую точность и даже быстродействие при правильной аппаратной и программной конфигурации.
1. Актуальность темы
В настоящие дни в промышленности и робототехнике значительно возросла роль искусственного интеллекта, системы компьютерного зрения получают широкое распространение для задач навигации и обнаружения или отслеживания объектов. При этом задачи управления движением можно разделить на два вида: быстродействующее управление электроприводами и интеллектуальную систему навигации, планирования маршрута и взаимодействия с окружающими предметами и средой.
С учетом высоких требований к вычислительной мощности микроконтроллера со стороны интеллектуальных систем, целесообразным представляется использование отдельных видов простейших контроллеров для низкоуровневого управления движением, а задачи высокого уровня стоит реализовывать на полноценных одноплатных компьютерах. В то же время вычислительные операции для компьютерного зрения, как требующие особенно больших вычислительных мощностей, можно проводить на отдельных нейро-процессорах или даже удаленных серверах с мощными графическими процессорами, поддерживающими аппаратное ускорение. Данные методы помогут увеличить быстродействие, а следовательно – надежность и эффективность электромеханических систем, использующих компьютерное зрение на основе сверточных нейросетей, что является актуальной темой для многих производственных и других процессов. Особенно важным данное исследование может оказаться для применения в образовательной сфере и составления учебных пособий.
2. Цель и задачи исследования, планируемые результаты
Целью исследования является анализ особенностей применения нейросетей для управления автономными электромеханическими объектами при решении задач обнаружения и отслеживания объектов.
Основные задачи исследования:
- Оценка методов распознавания, не использующих искусственный интеллект.
- Анализ существующих нейросетевых архитектур и методов, применяющихся для обнаружения объектов.
- Выбор платформы для развертывания нейро-модели.
- Создание проекта система наведения и следования за человеком для фиксирования точности и быстродействия отслеживания.
Объект исследования: развертывание нейросетей при решении задач управления автономными электромеханическими системами.
Предмет исследования: эффективность работы автономных электромеханических систем при использовании нейросетевой детекции объектов, способы развертывания подобных решений.
Для экспериментальной оценки полученных теоретических результатов и формирования фундамента последующих исследований, в качестве практических результатов планируется разработка проекта наведения и следования за человеком на основе колесной платформы Robomaster EP, в устройство которой входят камера и лазерный дальномер. От проекта ожидаются следующие результаты:
- Должна быть создана быстродействующая система с высокой точностью детекции.
- Отслеживаемая цель обязана детектироваться на протяжении всей работы видеопотока без потери.
3. Обзор исследований и разработок
Нейронные сети и алгоритмы глубокого обучения изучаются и разрабатываются уже достаточно давно. Ранее подобные разработки были нацелены на решение сложных вычислительных процессов и создание систем регуляции определенных процессов, однако в наши дни развитие нейронных сетей стало очень крупным шагом к новому этапу развития электротехнической, развлекательной и других типов индустрий. Разработки и исследования в области нейросетевой детекции способны вывести робототехнику и другие отрасли на совершенно новый уровень, поэтому данная область искусственного интеллекта широко исследуется зарубежными и отечественными учеными и программистами.
3.1 Обзор международных источников
Основополагающие работы в области искусственных нейронных сетей были заложены Ф. Розенблаттом, который в 1958 году предложил модель перцептрона как вероятностную модель для хранения и организации информации в мозге [1]. Значительный прорыв в глубоком обучении произошел благодаря работе Дж. Хинтона и Р. Салахутдинова, которые разработали методы уменьшения размерности данных с помощью нейронных сетей [2].
Важным этапом в развитии сверточных нейронных сетей стала работа Я. Лекуна, в которой градиентные методы обучения были применены к распознаванию документов [3]. Дальнейшее развитие получила архитектура ResNet, предложенная К. Хе, которая реализовала глубокое остаточное обучение для распознавания изображений [4], она заложил своеобразный стандарт для сверточных нейросетей.
Революцию в области детекции объектов в реальном времени совершила архитектура YOLO (You Only Look Once), предложенная Дж. Редмоном, которая обеспечила унифицированный подход к обнаружению объектов [5]. Эффективные масштабируемые архитектуры сверточных нейронных сетей были также описаны М. Таном и К.В. Ле в работе по EfficientNet [6]. Эта архитектура способна соперничать в эффективности с и быстродействии с YOLO.
Применение глубокого обучения в робототехнике было исследовано С. Левиным, который в свою очереди разработал методы сквозного обучения глубоких визомоторных политик [7]. П. Аббель и Э.Й. Нг предложили методы обучения с подкреплением через обратное обучение с подкреплением для робототехнических приложений [8].
В области биомедицинской визуализации значительный вклад внесла архитектура U-Net, предложенная О. Роннебергером, для сегментации биомедицинских изображений [9]. Дальнейшее развитие методов сегментации продолжилось в работе К. Хе по Mask R-CNN [10].
Для мобильных приложений компьютерного зрения были разработаны эффективные архитектуры MobileNets А.Г. Ховардом [11], а также компактная архитектура SqueezeNet Ф.Н. Иандолой, которая достигла точности AlexNet при значительно меньшем количестве параметров [12]. Теоретические основы трансферного обучения были систематизированы С.Дж. Паном и Ц. Яном в их обзоре [13].
3.2 Обзор национальных источников
В Российской Федерации на данный момент проводится множество исследований в областях искусственного интеллекта и компьютерного зрения. Ключевые разработки сосредоточены в ведущих технических вузах и научных центрах.
Значительный вклад в теорию и практику глубокого обучения вносят исследователи из МФТИ, МГУ и Сколтеха. В работе [14] рассматриваются фундаментальные основы глубокого обучения, включая свёрточные и рекуррентные сети, что является теоретической базой для многих прикладных разработок, что примечательно – данная тема развивалась еще в 90-ые годы, благодаря Горбану А.Н.
В статье [15] освящаются аспекты применения компьютерного зрения в медицине, как в России, так и за рубежом, что актуально для развития технологий обследования пациентов. Подобные научные труды всё сильнее приближают нас к автоматизации медицины.
В [16] описывается применение обучения с подкреплением в компьютерных играх, как метод исследования и поиска новых методов машинного обучения.
Содержание статьи [17] описывает практическое применение алгоритмов детекции для обтекания автономным электромеханическим объектом препятствий. Подобные методы для избегания столкновений становятся отличным дополнением к существующим технологиям SLAM и VSLAM навигации.
3.3 Обзор локальных источников
Для демонстрации последних разработок и исследований со стороны студентов и преподавателей ДонНТУ хорошо подойдут материалы последней на данный момент (XI) международной конференции «Инновационные перспективы Донбасса».
В публикациях В.В. Захаровой, Е.В. Подвигиной и К.А. Подвигина [18] исследуются процессы накопления метана и микроклиматические условия с помощью компьютерных симуляций.
А.Р. Будур, С.А. Зори [19] в своей работе исследуют интеллектуальные инструменты систем компьютерного зрения для автоматического анализа и классификации объектов на изображениях. На данный момент это одна из самых популярных тем для исследований.
А.А. Тупицына и М.П. Руденко [20] посвятили свою работу теме интеграции ИИ в работу с веб-дизайном, исследуя возможности генеративных нейросетей при использовании их в разработке сайтов.
4. О предмете искусственного интеллекта
Искусственный интеллект (далее - ИИ), это совокупность программных решений, имитирующих интеллект реального человека. На данный момент наиболее передовые решения в это области реализованы с помощью различных нейросетевых архитектур, которые по сути своей имитируют человеческое зрение, поведение, когнитивные, мыслительные и другие функции. Нейросетевые архитектуры бывают различных типов, однако все они едины в одном: подражание человеческой нейронной системе. Множество слоев соединенных между собой нейронов передают информацию от одного к другому, обрабатывая ее рядом различных функций и передавая в другие нейроны и слои для дальнейшей обработки.
Рисунок 1 – Визуальное представление нейронной сети
Методы с использованием ИИ решений могут оказаться эффективными, однако у всего есть своя цена: для использования подобных методов нужны большие вычислительные ресурсы или специальные процессоры и возможность конвертации моделей ИИ в поддерживаемый этими процессорами формат.
5. Создание системы наведения и следования за человеком на основе нейросетевых моделей
Как говорилось ранее, развертывание ИИ моделей требует больших ресурсов или специализированного оборудования. В рамках проекта для гибкости использования была выбрана нейросетевая модель компьютерного зрения YOLOv11[21]. Модели YOLO, созданные программистами компании Ultralytics[22], имеют очень удобный API (интерфейс разработки), а также поддерживают аппаратное ускорение CUDA[23] (технология NVIDIA) и конвертацию в различные форматы, в том числе, поддерживающие развертывание на NPU (нейро-процессорный ускоритель), однако они не имеют бесплатной коммерческой лицензии.
Почему именно YOLO? Для исследовательских целей проекта можно было бы выбрать любую другую архитектуру, например, RestNet, EfficientDet, MobileNet-SSD, однако они имеют очень высокий порог входа со стороны фреймворка TensorFlow[24], а также показывают более низкую производительность и точность в сравнении с используемой нами архитектурой. Кроме того, есть множество предобученых моделей YOLO в свободном доступе, однако мы воспользуемся стандартной. YOLOv11 имеет несколько типов архитектур: n, s, m, l, x, где n – «нано» модель – однослойная быстродействующая и наименее точная, а «x» - наиболее громоздкая и точная. В нашем распоряжении имеется графический ускоритель NVIDIA RTX 3050, который является достаточно производительным для данной задачи, однако в виду недостаточной мощности системы охлаждения мы вынуждены сделать выбор в сторону более мелких моделей. Остановимся на YOLO11s.
Точность и быстродействие крайне важны для нас, так как в рамках проекта будет использоваться не постоянная детекция объектов на каждом новом изображении, а их трекинг. Отличие трекинга от детекции в том, что по определенным отличительным признакам мы фиксируем объекты, храня информацию о них под индивидуальными индексами, таким на изображении может быть определен обнаруженный ранее объект благодаря анализу присущих ему особенностей. В данном случае мы можем обучить нейросеть обнаруживать и отслеживать не конкретный объект, а группу схожих между собой, например – людей. Уже из этой группы можно выбирать необходимый нам (вручную или по другим отличительным признакам). В рамках данного проекта отслеживаемая цель будет задаваться вручную с помощью API библиотеки компьютерного зрения OpenCV[25].
Реализация выглядит следующим образом: робот с камерой и дальномером на колесном шасси захватывает и отправляет изображение на удаленный сервер, поддерживающий аппаратное ускорение, что решает проблему быстродействия. На удаленном сервере производятся необходимые расчеты в зависимости от положения обнаруженных на экране объектов и показаний дальномера, при этом объект отслеживания выбирается вручную – нажатием компьютерной мыши на соответствующую область на экране. Полученные данные используются для формирования задания на движение робота и отправляются к нему по сети. При большом отклонении от цели по горизонтальной оси изображения робот выравнивается, поворачиваясь к ней на месте благодаря колесам всенаправленного движения. При мелких отклонениях по горизонтальной оси рассчитывается скорость для каждого колеса отдельно, что позволяет маневрировать, входя в повороты при попытке следовать за целью или наоборот отдалиться от нее, если та подошла слишком близко или же робот приблизился к ней по инерции. Благодаря трекингу объектов мы не теряем цель на каждом новом кадре, так как ориентируемся на отличительные черты конкретного человека.
Рисунок 2 – Демонстрация работы
6. Итоги проделанной работы
Мы избежали обучения модели для обнаружения конкретного типа объекта, и охватили множество, благодаря трекингу (стало возможным в любой момент сменить отслеживаемый объект в пределах группы), ведь при использовании обычной детекции нам пришлось бы каждый раз обучать модель для распознавания нужного нам человека. В данном случае одна модель может быть использована многократно при ручном способе задания цели на полученном видеопотоке.
Модель эффективно развернута с помощью средств аппаратного ускорения на GPU с поддержкой CUDA, что дало нам желаемое быстродействие.
Подобрана оптимальная архитектура модели нейросети по следующим критериям:
- простота API
- высокое быстродействие
- высокая точность
- поддержка функции трекинга
Реализована система наведения и слежения за человеком на основе колесного робота с камерой, лазерным дальномером и четырехколесным шасси всенаправленного движения.
Данный исследовательский проект окажется крайне полезным для использования в сфере безопасности и наблюдения – не только за людьми, но и, например, за животными в исследовательских целях. Нельзя исключать также возможность применения в военной сфере для систем авто-наведения, в том числе беспилотных дронов, а также в образовательной сфере для ознакомления обучающихся с возможностями искусственного интеллекта в системах компьютерного зрения.
Список литературы
- Rosenblatt F. The Perceptron: A Probabilistic Model for Information Storage and Organization in the Brain // Psychological Review. – 1958.
- Hinton G.E., Salakhutdinov R.R. Reducing the Dimensionality of Data with Neural Networks // Science. – 2006.
- LeCun Y. et al. Gradient-Based Learning Applied to Document Recognition // Proceedings of the IEEE. – 1998.
- He K. et al. Deep Residual Learning for Image Recognition // CVPR. – 2016.
- Redmon J. et al. You Only Look Once: Unified, Real-Time Object Detection // CVPR. – 2016.
- Tan M., Le Q.V. EfficientNet: Rethinking Model Scaling for Convolutional Neural Networks // ICML. – 2019.
- Levine S. et al. End-to-End Training of Deep Visuomotor Policies // JMLR. – 2016.
- Abbeel P., Ng A.Y. Apprenticeship Learning via Inverse Reinforcement Learning // ICML. – 2004.
- Ronneberger O. et al. U-Net: Convolutional Networks for Biomedical Image Segmentation // MICCAI. – 2015.
- He K. et al. Mask R-CNN // ICCV. – 2017.
- Howard A.G. et al. MobileNets: Efficient Convolutional Neural Networks for Mobile Vision Applications // arXiv. – 2017.
- Iandola F.N. et al. SqueezeNet: AlexNet-level accuracy with 50x fewer parameters and <0.5MB model size // arXiv. – 2016.
- Pan S.J., Yang Q. A Survey on Transfer Learning // IEEE TKDE. – 2010.
- Горбан А.Н., Россиев Д.А. Нейронные сети на персональном компьютере. – Новосибирск: Наука, 1996.
- Абдуллаев А. Ш. Новые тенденции становления искусственного интеллекта в медицине // CardioСоматика. – 2021. – № 12 (4). – С. 227–233. – URL: https://cyberleninka.ru/article/n/novye-tendentsii-stanovleniya-iskusstvennogo-intellekta-v-meditsine (дата обращения: 23.10.2025).
- Абдуллаев А. Ш. Искусственный интеллект и его применение при создании игры Gobblet // Шаг в науку. – 2023. – № 4 – URL: https://cyberleninka.ru/article/n/iskusstvennyy-intellekt-i-ego-primenenie-pri-sozdanii-igry-gobblet (дата обращения: 23.10.2025).
- Колб А. И., Климчикова У. А. Разработка программы распознавания человека и других препятствий на пути малого грузового автономного транспортного средства // Вестник Науки. – 2024. – Т. 3, № 5(74). – URL: https://cyberleninka.ru/article/n/razrabotka-programmy-raspoznavaniya-cheloveka-i-drugih-prepyatstviy-na-puti-malogo-gruzovogo-avtonomnogo-transportnogo-sredstva (дата обращения: 23.10.2024).
- Захарова В.В. и др. Теоретический анализ процесса накопления метана в тупиковых выработках угольных шахт при отсутствии вентиляции // Сборник научных трудов 11-й Международной научно- практической конференции Том 1. Проблемы и перспективы в горном деле и строительстве. – 2025.
- А.Р. Будур, С.А. Зори Исследование интеллектуальных инструментов систем компьютерного зрения для автоматического анализа и классификации объектов на изображениях // Сборник научных трудов 11-й Международной научно- практической конференции Том 7. Проблемы и перспективы в горном деле и строительстве. – 2025.
- А.А. Тупицына, М.П. Руденко Применение систем искусственного интеллекта в веб-дизайне // Сборник научных трудов 11-й Международной научно- практической конференции Том 7. Проблемы и перспективы в горном деле и строительстве. – 2025.
- Документация YOLOv11 [Электронный ресурс]. – Режим доступа: https://docs.ultralytics.com/ru/models/yolo11/
- Ultralytics [Электронный ресурс]. – Режим доступа: https://www.ultralytics.com/
- CUDA Toolkit [Электронный ресурс]. – Режим доступа: https://developer.nvidia.com/cuda/toolkit
- TensorFlow [Электронный ресурс]. – Режим доступа: https://www.tensorflow.org/
- OpenCV - Open Computer Vision Library [Электронный ресурс]. – Режим доступа: https://opencv.org/
