ДонНТУ Портал магистров
← Назад
Источник: Y. Matsuzaka, R. Yashiro. Методы компьютерного зрения на основе искусственного интеллекта и экспертные системы // AI. — 2023. — Т. 4, № 1. — С. 289–302. — DOI: 10.3390/ai4010013.

МЕТОДЫ КОМПЬЮТЕРНОГО ЗРЕНИЯ И ЭКСПЕРТНЫЕ СИСТЕМЫ НА ОСНОВЕ ИИ

Автор перевода: П.К. Стёпушкина

Образец цитирования: Ю. Мацузака; Р. Яширо Компьютерное зрение на основе искусственного интеллекта Методы и экспертные системы. ИИ 2023, 4, 289–302.

Аннотация: Компьютерное зрение - это раздел компьютерных наук, который изучает, как компьютеры могут "видеть". Это область, представляющая значительную ценность для достижений научных кругов и искусственного интеллекта путем обработки изображений, полученных с помощью камеры. Другими словами, назначение компьютерного зрения заключается в наделении компьютеров функциями человеческих глаз и реализации "видения". Глубокое обучение — метод реализации компьютерного зрения с использованием распознавания образов и обнаружения объектов. С момента своего появления компьютерное зрение быстро развивалось вместе с развитием глубокого обучения и значительно повысило точность распознавания изображений. Более того, экспертная система может имитировать и воспроизводить ход рассуждений и принятия решений человека. Машинное обучение, включая глубокое обучение, сделало возможным "получить неявное знание экспертов", чего ранее не удавалось достичь с помощью обычных экспертных систем. Машинное обучение "систематизирует неявные знания" на основе больших данных и измеряет явления с разных точек зрения и в больших количествах. В этом обзоре обсуждаются основанные на знаниях методы компьютерного зрения с использованием глубокого обучения.

Ключевые слова: сверточные нейронные сети; глубокое обучение; экспертная система; компьютер, основанный на знаниях методы компьютерного зрения; моделирование; объектная ориентация

1. Введение

Среди многих областей исследований, связанных с обработкой изображений, "компьютерное зрение" привлекает значительное внимание [1-15]. Это академическая область, которая изучает "реализацию видения с помощью компьютеров", а также область искусственного интеллекта (ИИ), которая позволяет компьютерам и системам извлекать значимую информацию из цифровых изображений, видео и других визуальных данных и действовать и давать рекомендации (позволяя людям делать то же самое) на основе этой информации. Если ИИ позволяет компьютерам мыслить, компьютерное зрение позволяет им видеть, наблюдать и понимать. Это работает аналогично человеческому зрению и, как ожидается, даст людям преимущество. Таким образом, целью компьютерного зрения является наделение компьютеров функциями, эквивалентными человеческому глазу, то есть реализация "компьютерного зрения". В частности, целью является разработка компьютерного программного обеспечения, которое использует неподвижные изображения или видео данные для функционирования, аналогичного человеческому зрению или превосходящего его. На данный момент компьютерная графика (CG) была основной технологией обработки изображений, используемой в компьютерах. Разница между компьютерной графикой и компьютерным зрением заключается в том, что компьютерная графика используется для проецирования и отображения 3D объекты на 2D-дисплее, в то время как компьютерное зрение используется для получения 3D-информации из данных 2D-изображения. Хотя это контрастные технологии, они дополняют друг друга другие и способствующие развитию новых технологий, таких как виртуальная реальность и дополненная реальность (AR). AR отображает 3D-изображения, наложенные на реальные пейзажи, для которых необходимы дополнительные информация добавляется компьютером. Это пример слияния компьютерного зрения, которое воспринимает реальный мир, и компьютерной графики, которая изображает вымышленный мир [16-20]. Видение человека https://www.mdpi.com/journal/ai Искусственный интеллект 2023, 4 290 обладает преимуществом накопления контекстуальных знаний для различения объектов, определите расстояние между объектами, определите, движется ли объект, и выясните, есть ли что-то неправильное с изображением [21-22]. Компьютерное зрение включает обучать машины выполнять эти функции значительно быстрее, чем людей, используя камеры, данные и алгоритмы, а не сетчатку, зрительный нерв и зрительную кору головного мозга. Системы специалисты по проверке продукции и мониторингу производственных активов могут быстро превзойти человеческие возможности, поскольку они могут мгновенно анализировать тысячи продуктов и процессов и выявлять незаметные дефекты и проблемы. Следовательно, компьютерное зрение требует огромного количества данных, которые итеративно анализируются до тех пор, пока компьютер не сможет идентифицировать особенности и, наконец, изображение. Для достижения этой цели используются две ключевые технологии: форма машинное обучение, называемое глубоким обучением, и сверточные нейронные сети (CNN) [23-27]. Они используют алгоритмические модели, которые позволяют компьютерам изучать контекст визуальных данных, то есть "визуализировать" модели машинного или глубокого обучения путем сегментации изображений на помеченные или помеченные пиксели и выполнить свертку, которая представляет собой математическую операцию, которая использует две функции для создания третьей, используя метки для предсказаний относительно того, что компьютер ‘видит’. Если модель предоставляет компьютеру достаточный объем данных, он учится "видеть" данные и отличать одно изображение от другого. Вместо того, чтобы программироваться вручную на распознавание изображений, алгоритмы позволяют машинам обучаться независимо. Нейронная сеть выполняет свертки и проверяет точность прогнозов в серии итераций, пока она не сможет сделать прогноз. Затем он воспринимает или отображает изображения по-человечески. Подобно тому, как люди воспринимают изображения на расстоянии, CNN сначала выявляют жесткие границы и простые формы, а затем выполняют итеративные предсказания для встраивания информации. Хотя CNN используются для идентификации отдельных изображений, аналогичным образом используются рекуррентные нейронные сети для видеоприложений, помогающих компьютерам понимать взаимосвязи между изображениями в серии кадров. Поскольку эта новая область касается всех процессов, в которых компьютеры получая информацию в реальном мире, она широко изучается с точки зрения различных аспектов, от аппаратного обеспечения для распознавания изображений до теории искусственного интеллекта для распознавания информации. Поэтому мы сосредоточили наше внимание на соответствующих новых областях, таких как объединение компьютерной графики и компьютерного зрения с CNNS, которые настраиваются экспертными системами, компьютерным зрением системами и приложениями.

2. Экспертные системы как основа ИИ

2.1. Решение проблем с помощью экспертных систем

Люди постоянно делают выбор на протяжении всей своей жизни, и некоторые решения решения часто требуют сравнения двух вещей. Решение задач на компьютере также аналогичным образом выполняется с помощью сравнений. Сравнение представляет собой условную ветвь, и ответ на входные данные выводится путем выполнения условной ветви. Такие операции можно рассматривать как все, потому что машина выполняет действия, которые люди распознают как интеллект. Очень ранний ИИ состоял из программ, которые выполняли такие задачи условного ветвления, и это было перенесено на текущие реализации искусственного интеллекта. Установка условий, то есть установление правил, необходима для условного ветвления. A система, которая выполняет условное ветвление с использованием правил, называется системой, основанной на правилах, и условное ветвление часто описывается в форме операторов IF-THEN [28-29]. Con- учитывая, что конфигурации их программ и алгоритмов представлены в виде блок-схем, системы, основанные на правилах, совместимы с блок-схемами. При построении системы, основанной на правилах, содержимое условного ветвления оформляется в виде блок-схемы. Правила должны быть предопределены людьми; однако невозможно справиться с неизвестными проблемами, на которые люди не могут правильно ответить на основе правил [30-31]. Устанавливая эти условия, необходимо сосредоточиться на их порядке и приоритете. Разъяснение проблем и их решений в начале этап проектирования таким образом называется формулированием проблемы. Когда составляется блок-схема используя правила, на основе доступной информации строится бинарное дерево. Эта древовидная структура называется деревом решений и часто используется для статистической обработки и анализа данных [32-33]. Выполняется поиск неизвестных правил, и их можно найти с помощью статистической обработки данных. При построении программы, основанной на правилах, условная ветвь, которая становится правилом, может легко поддается жесткому программированию; это называется фиксированной программой, которую нельзя изменить позже, поскольку она использует фиксированную информацию. Даже если настройки изменены, такие изменения не являются проблемой если переписывание программы не требует дополнительных затрат. Если настройки условий легко изменяемые, например, при изменении настроек по вкусу, это может привести к чрезмерные затраты, если программа часто переписывается. Поэтому был разработан метод для решения этой проблемы, при котором основная часть программы, которая обрабатывает и выводит данные были отделены от данных, устанавливающих условия. Отдельный набор данных называется базой знаний [34]. Когда программе требуется условная ветвь, она использует идентификатор который извлекает правило, чтобы прочитать значение настройки и принять решение. База знаний может храниться в виде текстовых файлов в файловой системе или в системе управления базами данных. вышеупомянутая система, основанная на правилах, была разработана в 1960-х годах и используется в крупных системах. В частности, системы, которые могут помогать экспертам или заменять их при выполнении определенных задачи, такие как классификация, называются экспертными системами [35-36]. Это компьютерные системы которые обладают знаниями в специализированных областях и могут рассуждать и оценивать явления связаны с конкретными проблемами способом, аналогичным экспертному. Они были разработаны так что непрофессионал или новичок, не имеющий технических знаний, может использовать их для достижения тех же целей уровень способности решать проблемы в качестве эксперта. Говорят, что при использовании экспертной системы, которая состоит из двух частей, а именно "механизма вывода" и "базы знаний", даже люди без специальных знаний могут решать проблемы и принимать решения наравне с experts [37-38]. Механизм вывода основан на базе знаний, состоящей из различных форм информации, такой как правила, факты и специальные знания, и он делает выводы и делает выводы, используя эту информацию. Правила, с которыми работают люди, могут быть поняты выражая их словами, но для того, чтобы компьютеры могли интерпретировать и обрабатывать их, необходимо преобразовать выражения в более подходящий формат. Дисциплина, связанная с такими представления называются символической логикой [39-40]. Механизм вывода играет ключевую роль как мозг экспертной системы, которая участвует в процессе решения проблем. Самый базовый раздел математической логики, который он использует, называется логикой высказываний, которая включает предложения формальные переменные и операторы предложения (соединители) и указывает, что выражается через значения истинности. Цель состоит в том, чтобы выразить и понять отношения между предложениями связывая их с такими условиями, как "и", ‘или" и "если", не вдаваясь в значение самого предложения. Поэтому, хотя смысл предложения, не может быть анальный ysed, им можно придать значение, используя другие формы логики, расширяющие логику высказываний, такие как логика предикатов [41-42]. Логика определяется количественно путем расширения логики высказываний и является признанным механизмом вывода. Эти механизмы вывода увеличивают количество доступных методов для ответов на ‘вопросы’. В пропозициональной и послеоперационной логике предложения выражаются с помощью символов. В пропозициональной логике логические выражения состоят из пропозициональные переменные, которые являются логическими, атомарными выражениями и операторами предложений [43]. Для например, предположим, что есть два предлож Для (¬𝑃) ∨ 𝑄 и P ⇔ Q Q равно P ⇒ Q) ∧ (Q ⇒ P) Эта таблица называется таблицей истинности. Логические формулы, которые всегда истинны, называются тавтологиями. И наоборот, логические формулы которые всегда ложны, называются противоречиями. Логические формулы имеют отношения эквивалентности, которые являются истинными формулами [44-45], как показано в таблице 2. Правило вывода, которое выглядит как комбинация этих логических выражений, может быть преобразовано в форму предложения. Используя форму предложения, даже сложные логические выражения можно сгруппировать вместе, чтобы упростить их обработку. Конъюнктивные и сколемные нормальные формы включают пропозициональные и формулы сказуемых, соответственно, которые преобразуются в форму предложения. В конъюнктивном в обычной форме предложение представляет собой формулу, состоящую из формул, соединенных дизъюнкциями. Напротив, база знаний - это база данных, отделенная от механизма вывода, в которой ‘IF-THEN’ данные накапливаются.

Таблица истинности в отношении P и Q. Рисунок 1 – Таблица истинности в отношении P и Q.
Таблица основные отношения эквивалентности этических выражений Рисунок 2 – Таблица основные отношения эквивалентности этических выражений

2.2. История экспертных систем

Первая из когда-либо созданных экспертных систем называлась "Dendral" [46]. Она была создана в Стэнфорде Университет в 1965 году, и Эдвард Фейгенбаум, принимавший участие в его разработке, упоминается как ‘отец экспертных систем’. Dendral может оценить химическую структуру вещества, используя его числовое значение и молекулярную массу его пикового положения, для которого последнее получено с помощью масс-спектрометрии. Например, молекула воды (H2O) состоит из атомов водорода (H) и кислорода (O), которые имеют массы 1,01 и 16,00, соответственно; следовательно, молекулярная масса H2O равна 18, а ее масс-спектр имеет пик в 18 единицах. Для этого примера Dendral может рассчитать химические вещества с молекулярной веса 18 с использованием комбинации атомов и определяет возможные ответы. По мере того, как молекулярная масса увеличивается, комбинации атомов становятся более разнообразными. Поскольку вычисление ответа требует времени, необходимо разработать метод, которого можно избежать вычисление комбинаций, которые не требуют оценки этих механизмов. Dendral's система состоит из двух частей: эвристической Dendral, которая выполняет эвристические (эмпирические правила) анализ и метадендральный, который регистрирует наборы молекулярных структур, подлежащих объединению, и их масс-спектры в качестве базы знаний и передает их обратно в эвристический Dendral [47-48]. Следовательно, Meta-Dendral можно рассматривать как обучающую систему. Кроме того, важную роль также играет подход нечеткой логики [49-52]. После этих разработок "Mycin" был разработан в 1972 году, что повысило популярность экспертных систем [53]. Он может диагностировать пациентов и инфекционные заболевания крови и рекомендовать одновременное применение антибиотиков с дозировками, скорректированными с учетом массы тела пациента [54]. Он принимал решения, используя базу знаний, включающую примерно 600 правил, и, основываясь на ответах на вопросы, содержащие форматы ответов, отличные от "ДА" / "НЕТ", он мог отображать несколько бактерий в порядке убывания вероятности и надежности в качестве причины заболевания наряду с причинами. Хотя эффективность Mycin была несопоставима с эффективностью специалистов, она имел большой потенциал для использования в области медицины в качестве системы, способной диагностировать бактериальные инфекции с точностью около 65%. Однако он никогда не использовался в практике из-за нерешительности врачей относительно того, кто должен быть привлечен к ответственности в в случае ‘ошибочного диагноза’ системой. Впоследствии второй бум искусственного интеллекта произошел в 1980-х годов, когда началось использование различных экспертных систем. Однако из-за таких проблем, как необходимость ручного ввода большого количества данных и формулирования правил, а также из-за неспособности справиться со сложным обучением практическое использование экспертных систем было ограничено ограниченным числом систем, и бум прошел. С 2000-х годов медицинский эксперт системы, демонстрирующие такой уровень надежности, подвергались критике как "непригодные", и даже когда подобные системы разрабатывались, их адаптация часто была затруднена. Существовали этические и юридические проблемы, такие как неясная ответственность и сопротивление, касающиеся использования компьютеризированной диагностики, которая могла давать неверные результаты. Диагностика точность, которую часто ожидают от таких систем, составляет 85-90% или более, а количество ложных результатов положительные и отрицательные результаты должны быть как можно ниже (положительное прогностическое значение должно быть высоким). Примерно в 2010 году экспертные системы снова привлекли внимание благодаря достижениям в "машинном обучении", которое снизило стоимость ввода данных и создания правил [55-56]. период с 2010 года по настоящее время можно рассматривать как третий бум искусственного интеллекта. Во время второго Бума искусственного интеллекта экспертные системы столкнулись с различными проблемами, такими как необходимость ручного ввода большого количества данных после создания правил. Сам процесс ввода данных должен был быть выполнен людьми после того, как знания в специализированной области были отформатированы для ввода в систему. Это требовало значительного количества денег и времени. Поскольку знания , необходимые для построения экспертной системы, часто чрезвычайно сложны, их трудно преобразовать такую информацию в данные с помощью простых алгоритмов. Кроме того, поскольку количество увеличились знания и правила, возникли противоречия, и управлять несоответствиями стало сложно. Более того, аппаратное обеспечение во время второго бума искусственного интеллекта не имело обработки мощность, позволяющая системе автоматически извлекать данные, введенные человеком. Однако, в последние годы машинное обучение позволило автоматически изучать большие объемы данных, технический прогресс постепенно уменьшил проблемы, с которыми сталкиваются эксперты системы, тем самым сделав их более практичными.

3. Методы компьютерного зрения

Потребность в разработке методов, позволяющих машинам видеть и понимать визуальные данные данные существуют уже несколько десятилетий. Эксперименты начались в 1959 году, когда нейрофизиологи показали серию изображений кошкам и попытались соотнести эти изображения с их реакциями мозга. Примерно в то же время был разработан первый сканер изображений, который позволило компьютерам получать и оцифровывать изображения. В 1963 году компьютеры стали способны преобразовывать двумерные (2D) изображения в трехмерные модели, и во время в 1960-х годах искусственный интеллект стал заметной областью академических исследований, и, таким образом, начались поиски использования искусственного интеллекта для решения проблем со зрением человека. В 1974 году появилось оптическое распознавание символов (OCR) была внедрена технология, которая могла идентифицировать печатный текст любым шрифтом [57-58]. Аналогичным образом интеллектуальное распознавание символов (ICR) может использовать нейронные сети для расшифровки рукописный текст [59-60]. С момента их появления OCR и ICR использовались в нескольких общих приложениях. В 1982 году нейробиолог Дэвид Марр обнаружил, что зрение работает иерархически, и представил машинный алгоритм для обнаружения краев, углов, кривых и подобных примитивных форм. Примерно в то же время специалист по информатике Кунихико В Фукусиме была разработана сеть, состоящая из нескольких типов ячеек, получившая название "неокогнитрон", это включает сверточные слои в нейронной сети и может идентифицировать паттерны [61-62]. До 2000 года исследования были в основном сосредоточены на распознавании объектов, а к 2001 году было представлено первое приложение для распознавания лиц в реальном времени . Методы пометки и аннотирования визуальные наборы данных были стандартизированы в 2000-х годах. В 2010 году был выпущен набор данных ImageNet, который содержит миллионы помеченных изображений в 1000 классах объектов и предоставляет основа для CNN и моделей глубокого обучения, используемых сегодня [63-70]. В 2012 году команда из Университета Торонто участвовал в проекте "Использование CNN в распознавании изображений" Конкурс. Они представили новаторскую модель под названием AlexNet, которая значительно снизил частоту ошибок распознавания изображений в ImageNet всего до 15,3%. В результате с помощью CNN, даже для наборов данных распознавания изображений масштаба ImageNet возможно автоматическое эффективное извлечение объектов с помощью иерархической свертки с несколькими решениями группа уровней ядра [71-72]. Следовательно, точность AlexNet была значительно выше, чем точность методов сверточного распознавания изображений. Исследование AlexNet можно рассматривать первая успешная платформа CNN-learning для ‘успешного изучения крупномасштабных сетей" на основе крупномасштабных наборов данных с использованием графических процессоров и сбора подсказок ’. Таким образом, AlexNet считается быть оригинальной сетевой структурой современных систем распознавания изображений CNNS, представленных недавно годы. Ключевым фактором, позволившим AlexNet достичь высокой точности, было подавление переобучения глубоких CNN. Высокоскоростное обучение крупномасштабных CNN с использованием графических процессоров, который теперь стал обычным явлением, был достигнут и смоделирован впервые с использованием таких методов, как увеличение данных, отсев, ReLU, нормализация локального отклика, и распараллеливание с несколькими графическими процессорами. Другими словами, ‘сборник советов для успешного обучения" модель CNN на крупномасштабных наборов данных изображения без наименьшее количество переобучение было введен впервые. Поэтому, AlexNet, используя в качестве базовой линии, это было легче для других исследователям проводить исследования телекомпании CNN. Таким образом, введение AlexNet оказали значительное влияние на индустрию компьютерного зрения, приведшее к смене парадигмы, при которой "компьютерная индустрия компьютерного зрения начала быстро переходить на методы распознавания изображений на основе CNN’. AlexNet вызвал очередной бум Al, и многие ведущие исследователи приняли участие в исследованиях по распознаванию изображений CNNS. Однако AlexNet был быстро заменен другими CNNS, такими как VGGNet, InceptionNet и ResNet из-за их высокой производительности. Следовательно, архитектура самой AlexNet долгое время не использовалась [73-86]. Обучение AlexNet показало плохую конвергенцию и было не очень практичным, потому что это был пробный запуск оптимизация. Тем не менее, AlexNet является очень важной разработкой, потому что она первой представила базовую основу своего преемника системы распознавания изображений CNNs. На в то же время, поскольку он показал значительно более высокую точность, чем обычные методы, исследователи перестали комбинировать традиционные методы, включающие функцию изображения ручной работы значения, такие как вектор Фишера, и дискриминационные модели, такие как машины опорных векторов. Более того, AlexNet вызвал переход всей индустрии распознавания образов к глубокому обучение с CNN. Хотя ведущие исследователи положили начало буму искусственного интеллекта, применив глубокое обучение, внедрение AlexNet стало крупнейшим прорывом, особенно в задачах распознавания образов компьютерным зрением. В качестве одного из преимуществ моделей CNN, визуализация объектов обеспечивает уникальный взгляд на то, как функционируют нейронные сети, особенно в отношении распознавания изображений. Учитывая сложность и непрозрачность нейронных сетей, визуализация объектов представляет собой важный шаг для анализа и объяснения нейронных сетей. Благодаря визуализации объектов было обнаружено, что нейронная сеть сначала обнаруживает простые края и текстуры, затем более абстрактно обнаруживает слои и, наконец, выполняет обнаружение объектов. Сетевой анализ расширяет эти представления и делает интерпретируемость сетевых единиц измеримой. Кроме того, концепции могут быть автоматически связаны с единицами, что очень удобно. Кроме того, визуализация объектов - отличный метод для нетехнического объяснения того, как работают нейронные сети. Вместе с сетевым анализом он может обнаруживать концепции разных классов в задачах классификации.

4. Применение основанных на знаниях методов компьютерного зрения

Базы знаний - это специальные базы данных, используемые для управления фактами, общеизвестными смысл, опыт и т.д., относящиеся к предметной области, включенной в экспертную систему, которая предоставляет возможность поиска и организации знаний и объединяет их на компьютерах. Они предназначены для решения проблем, относящихся к конкретным приложениям или областям, посредством рассуждений. Эти систематически упорядоченные наборы фактов, событий, убеждений и правил примерно таковы классифицируются на две категории: машинные и человекочитаемые базы знаний [87-90]. Например, входные изображения с камеры могут обрабатываться компьютером в качестве глаза робота или самоуправляемого автомобиля, в котором установленные камеры играют роль глаз. Изображения, полученные камерой, анализируются с использованием технологии компьютерного зрения и используется для автономного вождения. Например, в случае "Системы предотвращения прямого столкновения ’, когда камера, установленная в передней части транспортного средства, обнаруживает находящийся поблизости автомобиль или человека, для предупреждения водителя раздается звуковой сигнал. Кроме того, при приближении к опасному расстоянию автоматически срабатывают тормоза для предотвращения столкновений. Кроме того, "Полоса движения" Система предупреждения о выезде", которая предупреждает водителя звуковым сигналом, когда автомобиль непреднамеренно съезжает с полосы, на которой он находится, и "Система поддержки парковки", которая были разработаны функции синтеза изображений, снятых передней, задней, левой и правой камерами при парковке и отображения их так, как если бы они были сняты сверху [91-92]. Технологии компьютерного зрения используется также для автоматического обнаружения определенного человека в изображения с камер наблюдения. Система анализа изображений “TB-eye AI Solution” обеспечивает высокопроизводительное распознавание лиц и анализ изображений за счет сочетания глубокого обучения и технологии распознавания объектов на основе компьютерного зрения. Кроме того, система под названием "smart" разработан "поиск", который использует искусственный интеллект для идентификации объектов на изображениях на основе различных условных терминов, таких как "белая машина" и "человек в черной одежде", которые могут существенно изменить сократите время исследования. Технология компьютерного зрения также используется для аутентификации по венам, которая выполняется путем поднесения ладони или пальца к терминалу для идентификации человека. Также ведутся исследования в отношении использования технологии распознавания изображений для обнаружения пораженных участков человеческого тела с использованием изображений, полученных с помощью компьютерной томографии или магнитно-резонансной томографии. Кроме того, было разработано устройство, которое может создавать 3D изображения живых клеток в течение нескольких минут, что привело к изучению действия лекарств на уровне отдельных клеток [93-94]. Среди различных применений технологии компьютерного зрения "matchmove" - это Технология синтеза 3DCG, которая часто используется в фильмах и телевизионных драмах [95-96]. Выступление актера снято в студии blue sheet, и фоновая компьютерная графика, которые синтезируются позже, рассчитываются и создаются на основе изменений точки обзора камеры и 3D-информации, которые затем сопоставляются с изображением актера. Он похож на AR в том, что он синтезирует другое видео или 3D-видео, содержащее ландшафтное изображение; однако AR - это технология реального времени временной процесс, тогда как matchmove - это технология редактирования видео, которая синтезирует видео позже. Кроме того, технология ‘проекционного отображения’ используется для проецирования изображений на 3D-объекты, например, здания, и недавно использовался на различных мероприятиях [97]. В случае обычные проекторы, используемые в офисах, кинотеатрах и т.д., Изображения проецируются вертикально на плоский прямоугольный экран. Напротив, при проекционном отображении считывается 3D-информация о здании, на которое проецируется изображение, и изображение проецируется в соответствии с его формой. Также возможно ограничить проекцию определенным контуром и изменить изображение, проецируемое при каждом переходе поверхности. Его можно настроить таким образом, чтобы оно выглядело естественным, даже при просмотре не спереди, а с других точек обзора. Эта картографическая работа выполняется с помощью программного обеспечения для редактирования видео. Путем калибровки и корректировки позиционного соотношения в 3D с помощью проектора и камеры изображения могут быть отображены в 3D-пространстве с высокой точностью. Кроме того, эта технология получила дальнейшее развитие, что привело к созданию интерактивных проекционное отображение, при котором изображения, проецируемые в комнату или коридор, изменяются в реакции на движения людей в этом пространстве. В последние годы распознавание жестов технология привлекла внимание как пользовательский интерфейс, позволяющий пользователям управлять телевизорами и камерами только жестами и без прикосновений [98-99]. Такие системы оснащены с камерами и датчиками и, следовательно, может управляться жестами и голосом без прикосновений. Впоследствии пакеты разработчика были предложены по низкой цене, которая привело к их применению в различных областях. Одним из примеров является медицинская сфера, где система, позволяющая врачам управлять персональными компьютерами (ПК) во время операции через используется бесконтактное распознавание жестов. С помощью этой системы можно проверять рентгеновские снимки, не прикасаясь к экрану ПК и не инструктируя других сотрудников управлять Компьютер во время операции. Кроме того, даже при разработке систем распознавания изображений основная часть системы зрения, основанной на знаниях, включает процесс подбора целевой модели представление с помощью сигналов в наблюдаемом изображении и модели [100]. Точно так же выбор формата представления знаний важен в системе знаний. тем не менее, представление целевых моделей в системах визуального контроля также является важной проблемой это существенно влияет на процесс сопоставления, который реализуется посредством логического вывода. Многие считают, что системы ventional 3D Vision представляют модели по отдельности, и для их представления были предложены различные методы . Важно создать систему описания для сложных объектов и использовать ее для идентификации объектов. Однако, если модели остаются в противном случае возникло бы суждение об идентичности объекта и модели. При рассмотрении понимания структуры компьютера желательно описать взаимосвязь между каждой моделью в представлении модели. Основанная на этой идее система 3D-зрения с моделью, которая выражает как описание структуры обычной модели, так и описание отношений между моделями на основе концепции объектно-ориентированного класса было разработано [101]. Геометрия представлена моделями поверхностей, и каждая модель соответствует объектно-ориентированному системному классу. В процессе понимания, в отношении к описаниям отношений (отношения is-a), для которых существует отношение has-a, агрегирование и отношение composition aggregation в отношениях, в которых различные виды иерархических используются свойства между классами, сначала выполняется сопоставление с помощью абстрактной модели, а затем получается конкретная модель с более жесткими ограничениями. Особенности этого видения система заключается в следующем:
1. Модельная система с независимыми 3D и 2D моделями;
2. Каждая модель выражает одну концепцию формы, которая выражается с помощью наследования через взаимосвязь ISA между моделями;
3. Представление модели, механизм обоснования и обработка изображений описаны в объектно-ориентированный фреймворк;
4. Реализована функция для понимания чертежей с неполными линиями.
Дополнительно, следующие моменты считаются важными в качестве модельных представлений для понимания изображений в таких системах:
1. Для подавления используется только сущность объекта, который является предметом отдельного понятия как можно меньше различий в отдельных объектах;
2. Хотя представление формы используется для обеспечения возможности представления термина (i), процесс сопоставления с реальным изображением не следует игнорировать;
3. Структура выражена явно с использованием ЧАСТИ отношения;
4. Она структурирована для последовательного углубления понимания путем описания связи- корабли между концепциями используют отношения is-a.
Фреймы часто используются в таком методе представления знаний. В знании представление фреймами, один фрейм соответствует одному понятию, что делает знание представление легко понятным. Функций фреймов достаточно для представления модели одного только представления; однако фреймы часто используются как иерархические базы знаний и имеют сильный пассивный характер. Поскольку понимание изображения требует активного рассуждения во время процесса сопоставления, объектно-ориентированная парадигма, включающая активные процедуры, является более подходящей [102-106]. Однако фреймы и объектная ориентация изначально не являются разными понятиями, и объектную ориентацию можно рассматривать как более широкое понятие, которое включает процедуры в иерархии фреймов. С точки зрения программирования, объект - это совокупность данных структуры и их исключительные процедуры, принимая во внимание, что с точки зрения анализа / проектирования, это совокупность информационных ресурсов и процедур их обработки. Другими словами, объектная ориентация - это способ мышления, который предполагает совместную обработку данных и процессов и использует объекты, которые объединяют оба элемента в качестве базовых, подчеркивая взаимодействие между объекты и сообщения, и пытается сконструировать все программное обеспечение [107-109]. Кроме того, в объектной ориентации существует четкое разделение понятий между классами, которые абстрактные объекты и экземпляры, являющиеся конкретными объектами. Следовательно, абстрактная модель представление может быть связано с классом и сущностью, полученной из подсказок на изображении и сопоставленный с моделью, может быть связан с экземпляром. Как описано выше, способность успешно применять представления модели, процедуры вывода и конкретные объекты из изображений требуются в объектно-ориентированной парадигме.

5. Обсуждение

Технологии компьютерного зрения и искусственного интеллекта являются наиболее быстрорастущими областями с точки зрения рынка размера и внедрения в отрасли. Пространственное компьютерное зрение и edge AI, в частности, используются не только для сложных процессов, но и для улучшения и автоматизации повторяющихся задач [102-110]. Эта новая реальность в сочетании с растущей доступностью аппаратного обеспечения и сложностью глубокое восприятие и машинное обучение позволили разработать практические решения для современного компьютерного зрения и систем искусственного интеллекта. Пространственное компьютерное зрение с edge Искусственный интеллект может развертывать приложения на основе глубины и выполнять обработку изображений внутри устройства. Как оборудование становится более доступным, значительные улучшения происходят также в рабочие процессы программного обеспечения и машинного обучения. Хотя они по-прежнему узкоспециализированы и многие технические проблемы остаются нерешенными, искусственный интеллект и компьютерное зрение стали проще в использовании благодаря предоставлению инструментов, позволяющих им изучать свои собственные модели. Между тем, крупномасштабный edge вычисления и развертывание остаются проблемой для стандартных конвейеров машинного обучения и рабочих процессов [111-113]. Кроме того, одной из самых больших проблем является снижение стоимости и время, необходимое в настоящее время для создания и улучшения моделей машинного обучения для реальных приложений. Проблема заключается в том, как управлять всеми этими устройствами и как создать бесперебойную работу конвейер для непрерывного совершенствования. Существуют также неявные ограничения с точки зрения вычислительной обработки, поэтому окончательная модель, которая будет развернута на устройстве, требует дополнительных соображения, такие как требование к приложению быть легким и производительным.

6. Выводы

Компьютерное зрение - это раздел информатики, который фокусируется на обеспечении возможности работы компьютеров идентифицировать и понимать объекты и людей с помощью изображений и видео. Подобно другим типам искусственного интеллекта, компьютерное зрение направлено на выполнение и автоматизацию задач, имитирующих человеческие возможности. В данном случае он воспроизводит как то, как люди видят, так и то, что понимают они видят. Другими словами, приложения компьютерного зрения используют входные данные от сенсорных устройств, искусственного интеллекта, машинное обучение, и глубокое обучение для имитации функций зрительной системы человека. Кроме того, приложения для компьютерного зрения работают на алгоритмах, обученных огромному количеству визуальных данных и изображений. Эти приложения распознают закономерности в визуальных данных и используют эти закономерности для определения содержания других изображений. Приложения для компьютерного зрения - это отходят от статистических методов, традиционно используемых для анализа изображений, и все больше полагаются на глубокое обучение, которое обеспечивает еще более точный анализ изображений с помощью алгоритмов глубокой нейронной сети. Более того, глубокое обучение сохраняет информацию о каждом изображении; следовательно, чем чаще оно используется, тем точнее оно становится. Компьютер обучение, при котором люди готовят большое количество выборочных и контролируемых данных, которые изучаются компьютерами для самостоятельного поиска знаний и правил, требует большого количество выборочных данных и настроенная обучающая машина. При глубоком обучении компьютер сам находит оптимальное решение; хотя поначалу оно не является точным, точность увеличивается поскольку выборочные данные поступают непрерывно. Это стало возможным благодаря высокой производительности современных компьютеров и большому количеству выборочных данных, генерируемых big data. Однако сложные правила трудно определить в экспертной системе, в которой человек определяет знания и правила и передает их компьютеру. Другими словами, были различные ограничения в прошлом из-за невозможности выйти за рамки человеческого понимания. Однако, поскольку обработка в реальном времени и большие данные получили распространение благодаря усовершенствованиям аппаратного обеспечения спецификации, экспертные системы используются во многих отраслях промышленности. В заключение, компьютерное видение - это мощная способность, которая может сочетаться с широким спектром приложений и сенсорные устройства для поддержки различных практических приложений.

Список литературы

  1. Al-Oraiqat, A.M.; Smirnova, T.; Drieiev, O.; Smirnov, O.; Polishchuk, L.; Khan, S.; Hasan, Y.M.Y.; Amro, A.M.; AlRawashdeh, H.S. Method for Determining Treated Metal Surface Quality Using Computer Vision Technology / A.M. Al-Oraiqat et al. // Sensors. – 2022. – Vol. 22. – P. 6223. – DOI: 10.3390/s22166223.↑ к тексту
  2. Gumbs, A.A.; Grasso, V.; Bourdel, N.; Croner, R.; Spolverato, G.; Frigerio, I.; Illanes, A.; Abu Hilal, M.; Park, A.; Elyan, E. The Advances in Computer Vision That Are Enabling More Autonomous Actions in Surgery: A Systematic Review of the Literature / A.A. Gumbs et al. // Sensors. – 2022. – Vol. 22. – P. 4918. – DOI: 10.3390/s2244918.↑ к тексту
  3. Dudek, P.; Richardson, T.; Bose, L.; Carey, S.; Chen, J.; Greatwood, C.; Liu, Y.; Mayol-Cuevas, W. Sensor-level computer vision with pixel processor arrays for agile robots / P. Dudek et al. // Sci. Robot. – 2022. – Vol. 7. – eabl7755. – DOI: 10.1126/scirobotics.abl7755.↑ к тексту
  4. Abellanas, M.; Elena, M.J.; Keane, P.A.; Balaskas, K.; Grewal, D.S.; Carreño, E. Artificial Intelligence and Imaging Processing in Optical Coherence Tomography and Digital Images in Uveitis / M. Abellanas et al. // Ocul. Immunol. Inflamm. – 2022. – Vol. 30. – P. 675–681. – DOI: 10.1080/09273948.2021.1992073.↑ к тексту
  5. Kitaguchi, D.; Takeshita, N.; Hasegawa, H.; Ito, M. Artificial intelligence-based computer vision in surgery: Recent advances and future perspectives / D. Kitaguchi et al. // Ann. Gastroenterol. Surg. – 2021. – Vol. 6. – P. 29–36. – DOI: 10.1002/ags3.12345.↑ к тексту
  6. Hellsten, T.; Karlsson, J.; Shamsuzzaman, M.; Pulkkis, G. The Potential of Computer Vision-Based Marker-Less Human Motion Analysis for Rehabilitation / T. Hellsten et al. // Rehabil. Process Outcome. – 2021. – Vol. 10. – 11795727211022330. – DOI: 10.1177/11795727211022330.↑ к тексту
  7. Hassan, H.; Ren, Z.; Zhao, H.; Huang, S.; Li, D.; Xiang, S.; Kang, Y.; Chen, S.; Huang, B. Review and classification of AI-enabled COVID-19 CT imaging models based on computer vision tasks / H. Hassan et al. // Comput. Biol. Med. – 2022. – Vol. 141. – 105123. – DOI: 10.1016/j.compbiomed.2022.105123.↑ к тексту
  8. D’Antoni, F.; Russo, F.; Ambrosio, L.; Vollero, L.; Vadalà, G.; Merone, M.; Papalia, R.; Denaro, V. Artificial Intelligence and Computer Vision in Low Back Pain: A Systematic Review / F. D’Antoni et al. // Int. J. Environ. Res. Public Health. – 2021. – Vol. 18. – 10909. – DOI: 10.3390/ijerph182210909.↑ к тексту
  9. Wang, J.; Zhu, H.; Liu, J.; Li, H.; Han, Y.; Zhou, R.; Zhang, Y. The application of computer vision to visual prosthesis / J. Wang et al. // Artif. Organs. – 2021. – Vol. 45. – P. 1141–1154. – DOI: 10.1111/aor.13808.↑ к тексту
  10. Victória Matias, A.; Atkinson Amorim, J.G.; Buschetto Macarini, L.A.; Cerentini, A.; Casimiro Onofre, A.S.; De Miranda Onofre, F.B.; Daltoé, F.P.; Stemmer, M.R.; von Wangenheim, A. What is the state of the art of computer vision-assisted cytology? A Systematic Literature Review / A. Victória Matias et al. // Comput. Med. Imaging Graph. – 2021. – Vol. 91. – 101934. – DOI: 10.1016/j.compmedimag.2021.101934.↑ к тексту
  11. Wu, Z.; Chen, Y.; Zhao, B.; Kang, X.; Ding, Y. Review of Weed Detection Methods Based on Computer Vision / Z. Wu et al. // Sensors. – 2021. – Vol. 21. – 3647. – DOI: 10.3390/s21113647.↑ к тексту
  12. Louis, C.M.; Erwin, A.; Handayani, N.; Polim, A.A.; Boediono, A.; Sini, I. Review of computer vision application in in vitro fertilization: The application of deep learning-based computer vision technology in the world of IVF / C.M. Louis et al. // J. Assist. Reprod. Genet. – 2021. – Vol. 38. – P. 1627–1639. – DOI: 10.1007/s10815-021-02156-5.↑ к тексту
  13. Kang, X.; Zhang, X.D.; Liu, G. A Review: Development of Computer Vision-Based Lameness Detection for Dairy Cows and Discussion of the Practical Applications / X. Kang et al. // Sensors. – 2021. – Vol. 21. – 753. – DOI: 10.3390/s21030753.↑ к тексту
  14. Fernandes, A.F.A.; Dórea, J.R.R.; Rosa, G.J.M. Image Analysis and Computer Vision Applications in Animal Sciences: An Overview / A.F.A. Fernandes et al. // Front. Vet. Sci. – 2020. – Vol. 7. – 551269. – DOI: 10.3389/fvets.2020.551269.↑ к тексту
  15. Patel, K.; Parmar, B. Assistive device using computer vision and image processing for visually impaired; review and current status / K. Patel et al. // Disabil. Rehabil. Assist. Technol. – 2022. – Vol. 17. – P. 290–297. – DOI: 10.1080/17483107.2020.1832603.↑ к тексту
  16. Minaee, S.; Liang, X.; Yan, S. Modern Augmented Reality: Applications, Trends, and Future Directions [Электронный ресурс] / S. Minaee et al. – 2022. – Режим доступа: https://arxiv.org/abs/2202.09450 (дата обращения: 24.02.2022).↑ к тексту
  17. Sutherland, J.; Belec, J.; Sheikh, A.; Chepelev, L.; Althobaity, W.; Chow, B.J.W.; Mitsouras, D.; Christensen, A.; Rybicki, F.J.; La Russa, D.J. Applying Modern Virtual and Augmented Reality Technologies to Medical Images and Models / J. Sutherland et al. // J. Digit. Imaging. – 2019. – Vol. 32. – P. 38–53. – DOI: 10.1007/s10278-018-0120-0.↑ к тексту
  18. Lungu, A.J.; Swinkels, W.; Claesen, L.; Tu, P.; Egger, J.; Chen, X. A review on the applications of virtual reality, augmented reality and mixed reality in surgical simulation: An extension to different kinds of surgery / A.J. Lungu et al. // Expert. Rev. Med. Devices. – 2021. – Vol. 18. – P. 47–62. – DOI: 10.1080/17434440.2021.1863905.↑ к тексту
  19. Lex, J.R.; Koucheki, R.; Toor, J.; Backstein, D.J. Clinical applications of augmented reality in orthopaedic surgery: A comprehensive narrative review / J.R. Lex et al. // Int. Orthop. – 2022. – in press. – DOI: 10.1007/s00264-022-05520-7.↑ к тексту
  20. Tanzer, M.; Laverdière, C.; Barimani, B.; Hart, A. Augmented Reality in Arthroplasty: An Overview of Clinical Applications, Benefits, and Limitations / M. Tanzer et al. // J. Am. Acad. Orthop. Surg. – 2022. – Vol. 30. – e760–e768. – DOI: 10.5435/JAAOS-D-21-00522.↑ к тексту
  21. Maier, M.; Blume, F.; Bideau, P.; Hellwich, O.; Abdel Rahman, R. Knowledge-augmented face perception: Prospects for the Bayesian brain-framework to align AI and human vision / M. Maier et al. // Conscious Cogn. – 2022. – Vol. 101. – 103301. – DOI: 10.1016/j.concog.2022.103301.↑ к тексту
  22. Fooken, J.; Kreyenmeier, P.; Spering, M. The role of eye movements in manual interception: A mini-review / J. Fooken et al. // Vision Res. – 2021. – Vol. 183. – P. 81–90. – DOI: 10.1016/j.visres.2021.07.005.↑ к тексту
  23. Statsenko, Y.; Habuza, T.; Talako, T.; Pazniak, M.; Likhorad, E.; Pazniak, A.; Beliakouski, P.; Gelovani, J.G.; Gorkom, K.N.; Almansoori, T.M.; et al. Deep Learning-Based Automatic Assessment of Lung Impairment in COVID-19 Pneumonia: Predicting Markers of Hypoxia With Computer Vision / Y. Statsenko et al. // Front. Med. – 2022. – Vol. 9. – 882190. – DOI: 10.3389/fmed.2022.882190.↑ к тексту
  24. Balasubramanian, S.B.; Jagadeesh, K.R.; Prabu, P.; Venkatachalam, K.; Trojovský, P. Deep fake detection using cascaded deep sparse auto-encoder for effective feature selection / S.B. Balasubramanian et al. // PeerJ Comput. Sci. – 2022. – Vol. 8. – e1040. – DOI: 10.7717/peerj-cs.1040.↑ к тексту
  25. Zhang, Y.; Zhang, S.; Li, Y.; Zhang, Y. Single- and Cross-Modality Near Duplicate Image Pairs Detection via Spatial Transformer Comparing CNN / Y. Zhang et al. // Sensors. – 2021. – Vol. 21. – 255. – DOI: 10.3390/s21010255.↑ к тексту
  26. Xia, C.; Pan, Z.; Li, Y.; Chen, J.; Li, H. Vision-based melt pool monitoring for wire-arc additive manufacturing using deep learning method / C. Xia et al. // Int. J. Adv. Manuf. Technol. – 2022. – Vol. 120. – P. 551–562. – DOI: 10.1007/s00170-022-08996-0.↑ к тексту
  27. Li, W.; Zhang, L.; Wu, C.; Cui, Z.; Niu, C. A new lightweight deep neural network for surface scratch detection / W. Li et al. // Int. J. Adv. Manuf. Technol. – 2022. – Vol. 123. – P. 1999–2015. – DOI: 10.1007/s00170-022-10247-1.↑ к тексту
  28. Ritter, N.; Straub, J. Implementation of Hardware-Based Expert Systems and Comparison of Their Performance to Software-Based Expert Systems / N. Ritter et al. // Machines. – 2021. – Vol. 9. – 361. – DOI: 10.3390/machines9090361.↑ к тексту
  29. Shah, A.; Zhan, E.; Sun, J.J.; Verma, A.; Yue, Y.; Chaudhuri, S. Learning Differentiable Programs with Admissible Neural Heuristics [Электронный ресурс] / A. Shah et al. – 2020. – Режим доступа: https://arxiv.org/abs/2007.12101 (дата обращения: 28.03.2021).↑ к тексту
  30. Liu, B.; Mei, C. Lifelong Knowledge Learning in Rule-based Dialogue Systems [Электронный ресурс] / B. Liu et al. – 2020. – Режим доступа: https://arxiv.org/abs/2011.09811 (дата обращения: 19.11.2020).↑ к тексту
  31. Hossein, S.; Zander, P.-O.; Kamal, M.; Chowdhury, L. Belief-Rule-Based Expert Systems for Evaluation of E-Government: A Case Study [Электронный ресурс] / S. Hossein et al. – 2014. – Режим доступа: https://arxiv.org/abs/1403.5618 (дата обращения: 09.03.2015).↑ к тексту
  32. Price, C.I.; White, P.; Balami, J.; Bhattarai, N.; Coughlan, D.; Exley, C.; Flynn, D.; Halvorsrud, K.; Lally, J.; McMeekin, P.; et al. Improving emergency treatment for patients with acute stroke: The PEARS research programme, including the PASTA cluster RCT / C.I. Price et al. // Southampt. Natl. Inst. Health Care Res. – 2022. – in press. – DOI: 10.3310/pgfar_2022_14.↑ к тексту
  33. Leong, J.; Shanmuganathan, M.; Zambrano, E.; Tsui, E.; Chua, C.; Black, P.; Weng, S.; Hsu, A.; Lin, K.; Tan, H. A systematic review of deep learning-based medical image segmentation / J. Leong et al. // Comput. Biol. Med. – 2021. – Vol. 134. – 104547. – DOI: 10.1016/j.compbiomed.2021.104547.↑ к тексту
  34. Li, X.; Yao, L.; Chen, Z.; Liu, Z.; Yang, L.; Xing, L. Medical image analysis for COVID-19 diagnosis using deep learning / X. Li et al. // Inf. Fusion. – 2021. – Vol. 65. – P. 223–244. – DOI: 10.1016/j.inffus.2020.10.005.↑ к тексту
  35. Rundo, L.; Militello, C.; Vitabile, S.; Mazzara, G. Medical Imaging: Techniques and Challenges / L. Rundo et al. // Curr. Med. Imaging Rev. – 2020. – Vol. 16. – P. 1–12. – DOI: 10.2174/1573405615666190918143611.↑ к тексту
  36. Shen, D.; Wu, G.; Suk, H.-I. Deep Learning in Medical Image Analysis / D. Shen et al. // Annu. Rev. Biomed. Eng. – 2017. – Vol. 19. – P. 221–248. – DOI: 10.1146/annurev-bioeng-071516-044442.↑ к тексту
  37. Litjens, G.; Kooi, T.; Bejnordi, B.E.; Setio, A.A.A.; Ciompi, F.; Ghafoorian, M.; van der Laak, J.A.W.M.; van Ginneken, B.; Sánchez, C.I. A Survey on Deep Learning in Medical Image Analysis / G. Litjens et al. // Med. Image Anal. – 2017. – Vol. 42. – P. 60–88. – DOI: 10.1016/j.media.2017.07.005.↑ к тексту
  38. Suzuki, K. Overview of Deep Learning in Medical Imaging / K. Suzuki // Radiol. Phys. Technol. – 2017. – Vol. 10. – P. 257–273. – DOI: 10.1007/s12194-017-0407-4.↑ к тексту
  39. Shin, H.-C.; Roth, H.R.; Gao, M.; Lu, L.; Xu, Z.; Nogues, I.; Yao, J.; Mollura, D.; Summers, R.M. Deep Convolutional Neural Networks for Computer-Aided Detection: CNN Architectures, Dataset Characteristics and Transfer Learning / H.-C. Shin et al. // IEEE Trans. Med. Imaging. – 2016. – Vol. 35. – P. 1285–1298. – DOI: 10.1109/TMI.2016.2528162.↑ к тексту
  40. Esteva, A.; Kuprel, B.; Novoa, R.A.; Ko, J.; Swetter, S.M.; Blau, H.M.; Thrun, S. Dermatologist-level classification of skin cancer with deep neural networks / A. Esteva et al. // Nature. – 2017. – Vol. 542. – P. 115–118. – DOI: 10.1038/nature21056.↑ к тексту
  41. Rajpurkar, P.; Irvin, J.; Zhu, K.; Yang, B.; Mehta, H.; Duan, T.; Ding, D.; Bagul, A.; Langlotz, C.; Shpanskaya, K.; et al. CheXNet: Radiologist-level pneumonia detection on chest X-rays with deep learning / P. Rajpurkar et al. // arXiv. – 2017. – arXiv:1711.05225.↑ к тексту
  42. Gulshan, V.; Peng, L.; Coram, M.; Stumpe, M.C.; Wu, D.; Narayanaswamy, A.; Venugopalan, S.; Widner, K.; Madams, T.; Cuadros, J.; et al. Development and validation of a deep learning algorithm for detection of diabetic retinopathy in retinal fundus photographs / V. Gulshan et al. // JAMA. – 2016. – Vol. 316. – P. 2402–2410. – DOI: 10.1001/jama.2016.17216.↑ к тексту
  43. He, K.; Zhang, X.; Ren, S.; Sun, J. Deep Residual Learning for Image Recognition / K. He et al. // CVPR. – 2016. – P. 770–778. – DOI: 10.1109/CVPR.2016.90.↑ к тексту
  44. Long, J.; Shelhamer, E.; Darrell, T. Fully Convolutional Networks for Semantic Segmentation / J. Long et al. // CVPR. – 2015. – P. 3431–3440. – DOI: 10.1109/CVPR.2015.7298965.↑ к тексту
  45. Ronneberger, O.; Fischer, P.; Brox, T. U-Net: Convolutional Networks for Biomedical Image Segmentation / O. Ronneberger et al. // MICCAI. – 2015. – P. 234–241. – DOI: 10.1007/978-3-319-24574-4_28.↑ к тексту
  46. Redmon, J.; Farhadi, A. YOLOv3: An Incremental Improvement / J. Redmon et al. – 2018. – arXiv:1804.02767.↑ к тексту
  47. Dosovitskiy, A.; Beyer, L.; Kolesnikov, A.; Weissenborn, D.; Zhai, X.; Unterthiner, T.; Dehghani, M.; Minderer, M.; Heigold, G.; Gelly, S.; et al. An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale / A. Dosovitskiy et al. // ICLR. – 2021.↑ к тексту
  48. Tan, M.; Le, Q. EfficientNet: Rethinking Model Scaling for Convolutional Neural Networks / M. Tan et al. // ICML. – 2019. – P. 6105–6114.↑ к тексту
  49. Huang, G.; Liu, Z.; Van Der Maaten, L.; Weinberger, K.Q. Densely Connected Convolutional Networks / G. Huang et al. // CVPR. – 2017. – P. 4700–4708. – DOI: 10.1109/CVPR.2017.243.↑ к тексту
  50. Krizhevsky, A.; Sutskever, I.; Hinton, G.E. ImageNet Classification with Deep Convolutional Neural Networks / A. Krizhevsky et al. // NIPS. – 2012. – P. 1097–1105.↑ к тексту
  51. Russakovsky, O.; Deng, J.; Su, H.; Krause, J.; Satheesh, S.; Ma, S.; Huang, Z.; Karpathy, A.; Khosla, A.; Bernstein, M.; et al. ImageNet Large Scale Visual Recognition Challenge / O. Russakovsky et al. // Int. J. Comput. Vis. – 2015. – Vol. 115. – P. 211–252. – DOI: 10.1007/s11263-015-0816-y.↑ к тексту
  52. Simonyan, K.; Zisserman, A. Very Deep Convolutional Networks for Large-Scale Image Recognition / K. Simonyan et al. – 2015. – arXiv:1409.1556.↑ к тексту
  53. Szegedy, C.; Liu, W.; Jia, Y.; Sermanet, P.; Reed, S.; Anguelov, D.; Erhan, D.; Vanhoucke, V.; Rabinovich, A. Going Deeper with Convolutions / C. Szegedy et al. // CVPR. – 2015. – P. 1–9. – DOI: 10.1109/CVPR.2015.7298594.↑ к тексту
  54. He, K.; Gkioxari, G.; Dollár, P.; Girshick, R. Mask R-CNN / K. He et al. // ICCV. – 2017. – P. 2961–2969. – DOI: 10.1109/ICCV.2017.322.↑ к тексту
  55. Ren, S.; He, K.; Girshick, R.; Sun, J. Faster R-CNN: Towards Real-Time Object Detection with Region Proposal Networks / S. Ren et al. // NIPS. – 2015. – P. 91–99.↑ к тексту
  56. Caruana, R. Multitask Learning / R. Caruana // Machine Learning. – 1997. – Vol. 28. – P. 41–75. – DOI: 10.1023/A:1007379606734.↑ к тексту
  57. Goodfellow, I.; Bengio, Y.; Courville, A. Deep Learning / I. Goodfellow et al. – MIT Press, 2016.↑ к тексту
  58. Bishop, C.M. Pattern Recognition and Machine Learning / C.M. Bishop – Springer, 2006.↑ к тексту
  59. Ng, A. Machine Learning Yearning / A. Ng – 2018. – https://www.mlyearning.org.↑ к тексту
  60. LeCun, Y.; Bengio, Y.; Hinton, G. Deep Learning / Y. LeCun et al. // Nature. – 2015. – Vol. 521. – P. 436–444. – DOI: 10.1038/nature14539.↑ к тексту
  61. Zhang, K.; Zuo, W.; Chen, Y.; Meng, D.; Zhang, L. Beyond a Gaussian Denoiser: Residual Learning of Deep CNN for Image Denoising / K. Zhang et al. // IEEE Trans. Image Process. – 2017. – Vol. 26. – P. 3142–3155. – DOI: 10.1109/TIP.2017.2662206.↑ к тексту
  62. Lim, B.; Son, S.; Kim, H.; Nah, S.; Lee, K.M. Enhanced Deep Residual Networks for Single Image Super-Resolution / B. Lim et al. // CVPR Workshops. – 2017. – P. 136–144.↑ к тексту
  63. Johnson, J.; Alahi, A.; Fei-Fei, L. Perceptual Losses for Real-Time Style Transfer and Super-Resolution / J. Johnson et al. // ECCV. – 2016. – P. 694–711. – DOI: 10.1007/978-3-319-46475-6_43.↑ к тексту
  64. Dong, C.; Loy, C.C.; He, K.; Tang, X. Image Super-Resolution Using Deep Convolutional Networks / C. Dong et al. // IEEE Trans. Pattern Anal. Mach. Intell. – 2016. – Vol. 38. – P. 295–307. – DOI: 10.1109/TPAMI.2015.2439281.↑ к тексту
  65. Lim, J.; Son, S.; Kim, H.; Nah, S.; Lee, K.M. Deep Learning for Single Image Super-Resolution: A Brief Review / J. Lim et al. // arXiv. – 2017. – arXiv:1707.02921.↑ к тексту
  66. Wang, X.; Girshick, R.; Gupta, A.; He, K. Non-local Neural Networks / X. Wang et al. // CVPR. – 2018. – P. 7794–7803. – DOI: 10.1109/CVPR.2018.00813.↑ к тексту
  67. Dosovitskiy, A.; et al. An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale / A. Dosovitskiy et al. // ICLR. – 2021.↑ к тексту
  68. Liu, Z.; Lin, Y.; Cao, Y.; Hu, H.; Wei, Y.; Zhang, Z.; Lin, S.; Guo, B. Swin Transformer: Hierarchical Vision Transformer using Shifted Windows / Z. Liu et al. // ICCV. – 2021. – P. 10012–10022. – DOI: 10.1109/ICCV48922.2021.00984.↑ к тексту
  69. Touvron, H.; Cord, M.; Douze, M.; Massa, F.; Sablayrolles, A.; Jégou, H. Training data-efficient image transformers & distillation through attention / H. Touvron et al. // ICML. – 2021. – P. 10347–10357.↑ к тексту
  70. Dosovitskiy, A.; Beyer, L.; Kolesnikov, A.; Weissenborn, D.; Zhai, X.; Unterthiner, T.; Dehghani, M.; Minderer, M.; Heigold, G.; Gelly, S.; et al. An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale / A. Dosovitskiy et al. // ICLR. – 2021.↑ к тексту
  71. Han, K.; Wang, Y.; Tian, Q.; Guo, J.; Xu, C.; Xu, C. A Survey on Vision Transformer / K. Han et al. // IEEE Trans. Pattern Anal. Mach. Intell. – 2022. – P. 1–21. – DOI: 10.1109/TPAMI.2022.3167255.↑ к тексту
  72. Chen, L.; Papandreou, G.; Kokkinos, I.; Murphy, K.; Yuille, A.L. DeepLab: Semantic Image Segmentation with Deep Convolutional Nets, Atrous Convolution, and Fully Connected CRFs / L. Chen et al. // IEEE Trans. Pattern Anal. Mach. Intell. – 2018. – Vol. 40. – P. 834–848. – DOI: 10.1109/TPAMI.2017.2699184.↑ к тексту
  73. Chen, L.; Papandreou, G.; Schroff, F.; Adam, H. Rethinking Atrous Convolution for Semantic Image Segmentation / L. Chen et al. // arXiv. – 2017. – arXiv:1706.05587.↑ к тексту
  74. Zhao, H.; Shi, J.; Qi, X.; Wang, X.; Jia, J. Pyramid Scene Parsing Network / H. Zhao et al. // CVPR. – 2017. – P. 2881–2890. – DOI: 10.1109/CVPR.2017.660.↑ к тексту
  75. Wang, X.; Girshick, R.; Gupta, A.; He, K. Non-local Neural Networks / X. Wang et al. // CVPR. – 2018. – P. 7794–7803. – DOI: 10.1109/CVPR.2018.00813.↑ к тексту
  76. Huang, G.; Liu, Z.; Van Der Maaten, L.; Weinberger, K.Q. Densely Connected Convolutional Networks / G. Huang et al. // CVPR. – 2017. – P. 4700–4708. – DOI: 10.1109/CVPR.2017.243.↑ к тексту
  77. Howard, A.; Sandler, M.; Chu, G.; Chen, L.; Chen, B.; Tan, M.; Wang, W.; Zhu, Y.; Pang, R.; Vasudevan, V.; et al. Searching for MobileNetV3 / A. Howard et al. // ICCV. – 2019. – P. 1314–1324. – DOI: 10.1109/ICCV.2019.00140.↑ к тексту
  78. Sandler, M.; Howard, A.; Zhu, M.; Zhmoginov, A.; Chen, L. MobileNetV2: Inverted Residuals and Linear Bottlenecks / M. Sandler et al. // CVPR. – 2018. – P. 4510–4520. – DOI: 10.1109/CVPR.2018.00474.↑ к тексту
  79. Howard, A.; Zhu, M.; Chen, B.; Kalenichenko, D.; Wang, W.; Weyand, T.; Andreetto, M.; Adam, H. MobileNets: Efficient Convolutional Neural Networks for Mobile Vision Applications / A. Howard et al. – 2017. – arXiv:1704.04861.↑ к тексту
  80. Redmon, J.; Farhadi, A. YOLOv3: An Incremental Improvement / J. Redmon et al. – 2018. – arXiv:1804.02767.↑ к тексту
  81. Tan, M.; Le, Q. EfficientNet: Rethinking Model Scaling for Convolutional Neural Networks / M. Tan et al. // ICML. – 2019. – P. 6105–6114.↑ к тексту
  82. He, K.; Zhang, X.; Ren, S.; Sun, J. Deep Residual Learning for Image Recognition / K. He et al. // CVPR. – 2016. – P. 770–778. – DOI: 10.1109/CVPR.2016.90.↑ к тексту
  83. Huang, G.; Liu, Z.; Van Der Maaten, L.; Weinberger, K.Q. Densely Connected Convolutional Networks / G. Huang et al. // CVPR. – 2017. – P. 4700–4708. – DOI: 10.1109/CVPR.2017.243.↑ к тексту
  84. Krizhevsky, A.; Sutskever, I.; Hinton, G.E. ImageNet Classification with Deep Convolutional Neural Networks / A. Krizhevsky et al. // NIPS. – 2012. – P. 1097–1105.↑ к тексту
  85. Simonyan, K.; Zisserman, A. Very Deep Convolutional Networks for Large-Scale Image Recognition / K. Simonyan et al. – 2015. – arXiv:1409.1556.↑ к тексту
  86. Szegedy, C.; Liu, W.; Jia, Y.; Sermanet, P.; Reed, S.; Anguelov, D.; Erhan, D.; Vanhoucke, V.; Rabinovich, A. Going Deeper with Convolutions / C. Szegedy et al. // CVPR. – 2015. – P. 1–9. – DOI: 10.1109/CVPR.2015.7298594.↑ к тексту
  87. Redmon, J.; Farhadi, A. YOLOv3: An Incremental Improvement / J. Redmon et al. – 2018. – arXiv:1804.02767.↑ к тексту
  88. He, K.; Gkioxari, G.; Dollár, P.; Girshick, R. Mask R-CNN / K. He et al. // ICCV. – 2017. – P. 2961–2969. – DOI: 10.1109/ICCV.2017.322.↑ к тексту
  89. Ren, S.; He, K.; Girshick, R.; Sun, J. Faster R-CNN: Towards Real-Time Object Detection with Region Proposal Networks / S. Ren et al. // NIPS. – 2015. – P. 91–99.↑ к тексту
  90. Caruana, R. Multitask Learning / R. Caruana // Machine Learning. – 1997. – Vol. 28. – P. 41–75. – DOI: 10.1023/A:1007379606734.↑ к тексту
  91. Goodfellow, I.; Bengio, Y.; Courville, A. Deep Learning / I. Goodfellow et al. – MIT Press, 2016.↑ к тексту
  92. Bishop, C.M. Pattern Recognition and Machine Learning / C.M. Bishop – Springer, 2006.↑ к тексту
  93. Ng, A. Machine Learning Yearning / A. Ng – 2018. – https://www.mlyearning.org.↑ к тексту
  94. LeCun, Y.; Bengio, Y.; Hinton, G. Deep Learning / Y. LeCun et al. // Nature. – 2015. – Vol. 521. – P. 436–444. – DOI: 10.1038/nature14539.↑ к тексту
  95. Zhang, K.; Zuo, W.; Chen, Y.; Meng, D.; Zhang, L. Beyond a Gaussian Denoiser: Residual Learning of Deep CNN for Image Denoising / K. Zhang et al. // IEEE Trans. Image Process. – 2017. – Vol. 26. – P. 3142–3155. – DOI: 10.1109/TIP.2017.2662206.↑ к тексту
  96. Lim, B.; Son, S.; Kim, H.; Nah, S.; Lee, K.M. Enhanced Deep Residual Networks for Single Image Super-Resolution / B. Lim et al. // CVPR Workshops. – 2017. – P. 136–144.↑ к тексту
  97. Johnson, J.; Alahi, A.; Fei-Fei, L. Perceptual Losses for Real-Time Style Transfer and Super-Resolution / J. Johnson et al. // ECCV. – 2016. – P. 694–711. – DOI: 10.1007/978-3-319-46475-6_43.↑ к тексту
  98. Dong, C.; Loy, C.C.; He, K.; Tang, X. Image Super-Resolution Using Deep Convolutional Networks / C. Dong et al. // IEEE Trans. Pattern Anal. Mach. Intell. – 2016. – Vol. 38. – P. 295–307. – DOI: 10.1109/TPAMI.2015.2439281.↑ к тексту
  99. Lim, J.; Son, S.; Kim, H.; Nah, S.; Lee, K.M. Deep Learning for Single Image Super-Resolution: A Brief Review / J. Lim et al. // arXiv. – 2017. – arXiv:1707.02921.↑ к тексту
  100. Wang, X.; Girshick, R.; Gupta, A.; He, K. Non-local Neural Networks / X. Wang et al. // CVPR. – 2018. – P. 7794–7803. – DOI: 10.1109/CVPR.2018.00813.↑ к тексту
  101. Liu, Z.; Lin, Y.; Cao, Y.; Hu, H.; Wei, Y.; Zhang, Z.; Lin, S.; Guo, B. Swin Transformer: Hierarchical Vision Transformer using Shifted Windows / Z. Liu et al. // ICCV. – 2021. – P. 10012–10022. – DOI: 10.1109/ICCV48922.2021.00984.↑ к тексту
  102. Touvron, H.; Cord, M.; Douze, M.; Massa, F.; Sablayrolles, A.; Jégou, H. Training data-efficient image transformers & distillation through attention / H. Touvron et al. // ICML. – 2021. – P. 10347–10357.↑ к тексту
  103. Han, K.; Wang, Y.; Tian, Q.; Guo, J.; Xu, C.; Xu, C. A Survey on Vision Transformer / K. Han et al. // IEEE Trans. Pattern Anal. Mach. Intell. – 2022. – P. 1–21. – DOI: 10.1109/TPAMI.2022.3167255.↑ к тексту
  104. Chen, L.; Papandreou, G.; Kokkinos, I.; Murphy, K.; Yuille, A.L. DeepLab: Semantic Image Segmentation with Deep Convolutional Nets, Atrous Convolution, and Fully Connected CRFs / L. Chen et al. // IEEE Trans. Pattern Anal. Mach. Intell. – 2018. – Vol. 40. – P. 834–848. – DOI: 10.1109/TPAMI.2017.2699184.↑ к тексту
  105. Chen, L.; Papandreou, G.; Schroff, F.; Adam, H. Rethinking Atrous Convolution for Semantic Image Segmentation / L. Chen et al. // arXiv. – 2017. – arXiv:1706.05587.↑ к тексту
  106. Zhao, H.; Shi, J.; Qi, X.; Wang, X.; Jia, J. Pyramid Scene Parsing Network / H. Zhao et al. // CVPR. – 2017. – P. 2881–2890. – DOI: 10.1109/CVPR.2017.660.↑ к тексту
  107. Howard, A.; Sandler, M.; Chu, G.; Chen, L.; Chen, B.; Tan, M.; Wang, W.; Zhu, Y.; Pang, R.; Vasudevan, V.; et al. Searching for MobileNetV3 / A. Howard et al. // ICCV. – 2019. – P. 1314–1324. – DOI: 10.1109/ICCV.2019.00140.↑ к тексту
  108. Sandler, M.; Howard, A.; Zhu, M.; Zhmoginov, A.; Chen, L. MobileNetV2: Inverted Residuals and Linear Bottlenecks / M. Sandler et al. // CVPR. – 2018. – P. 4510–4520. – DOI: 10.1109/CVPR.2018.00474.↑ к тексту
  109. Howard, A.; Zhu, M.; Chen, B.; Kalenichenko, D.; Wang, W.; Weyand, T.; Andreetto, M.; Adam, H. MobileNets: Efficient Convolutional Neural Networks for Mobile Vision Applications / A. Howard et al. – 2017. – arXiv:1704.04861.↑ к тексту
  110. Rajpurkar, P.; Irvin, J.; Zhu, K.; Yang, B.; Mehta, H.; Duan, T.; Ding, D.; Bagul, A.; Langlotz, C.; Shpanskaya, K.; et al. CheXNet: Radiologist-level pneumonia detection on chest X-rays with deep learning / P. Rajpurkar et al. // arXiv. – 2017. – arXiv:1711.05225.↑ к тексту
  111. Gulshan, V.; Peng, L.; Coram, M.; Stumpe, M.C.; Wu, D.; Narayanaswamy, A.; Venugopalan, S.; Widner, K.; Madams, T.; Cuadros, J.; et al. Development and validation of a deep learning algorithm for detection of diabetic retinopathy in retinal fundus photographs / V. Gulshan et al. // JAMA. – 2016. – Vol. 316. – P. 2402–2410. – DOI: 10.1001/jama.2016.17216.↑ к тексту
  112. Dosovitskiy, A.; Beyer, L.; Kolesnikov, A.; Weissenborn, D.; Zhai, X.; Unterthiner, T.; Dehghani, M.; Minderer, M.; Heigold, G.; Gelly, S.; et al. An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale / A. Dosovitskiy et al. // ICLR. – 2021.↑ к тексту
  113. Liu, Z.; Lin, Y.; Cao, Y.; Hu, H.; Wei, Y.; Zhang, Z.; Lin, S.; Guo, B. Swin Transformer: Hierarchical Vision Transformer using Shifted Windows / Z. Liu et al. // ICCV. – 2021. – P. 10012–10022. – DOI: 10.1109/ICCV48922.2021.00984.↑ к тексту
← Назад