К научным трудам

Источник: Сборник материалов XVIII международной научно-практической конференции на английском языке «Dialogue of cultures». — 2025. — Т. 2. — С. 183-188.


УДК 004.67

ИСПОЛЬЗОВАНИЕ ТЕХНОЛОГИЙ ИСКУССТВЕННОГО ИНТЕЛЛЕКТА
ПРИ РАСПОЗНАВАНИИ ТЕКСТА

студент Иванов Дмитрий Михайлович

канд. техн. наук, доцент Ремизова Ирина Викторовна,

ст. преподаватель Шарапа Татьяна Станиславовна,

Санкт-Петербургский государственный университет промышленных технологий и дизайна,

Санкт-Петербург, Российская Федерация

Аннотация

В статье рассматриваются принципы работы технологии оптического распознавания символов (OCR). Описана возможность повышения точности распознавания текста посредством добавления моделей на основе методов глубокого обучения. Представлены структуры нейронных сетей, используемые для распознавания текстового изображения.

Ключевые слова: OCR, технология оптического распознавания символов, распознавание текста, методы глубокого обучения, сверточные нейронные сети, рекуррентные нейронные сети.

Одной из необходимых и востребованных возможностей современного развития информационных технологий является автоматическое распознавание текстовой и символьной информации. Развитие технологий искусственного интеллекта, таких как машинное обучение и глубокое обучение, вывело эту область на новый уровень востребованности.

Результат распознавания текста во многом зависит от представления исходных данных. Исходный текст может быть написан на разных языках, разными шрифтами и стилями, представлен машинными, рукописными символами, различными источниками представления текста и т.д. Все эти факторы влияют на процесс распознавания и требуют изучения для выявления недостатков и формирования направлений совершенствования систем распознавания символьной информации.

Автоматизация распознавания текстовых изображений позволит преобразовать исходный текст в удобный и машиночитаемый формат для дальнейшего анализа, поиска, обработки и хранения. При этом время, затрачиваемое человеком на эту операцию, должно быть сведено к минимуму.

На данный момент в распознавании текста широко используется базовая OCR‑технология. OCR (Optical Character Recognition) — это технология оптического распознавания символов, которая преобразует картинку в редактируемый текст. Технология используется для обработки результатов сканирования различных типов документов и основана на использовании множества сохраненных шрифтов и изображений текстовых символов в качестве стандартов при распознавании.

Прежде всего, документ необходимо отсканировать. Затем алгоритм анализирует полученное изображение, разбивает его на символы и посимвольно сравнивает каждый символ на изображении со ссылкой на существующую базу данных символов. В результате получается изменяемый текст.

К преимуществам этой технологии можно отнести сокращение ручного ввода текста, возможность дальнейшего редактирования и использования.

К недостаткам можно отнести низкое качество результата, которое в значительной степени зависит от исходных данных. Если исходный скан документа был нечётким, результат будет нечитаемым. С помощью этой технологии невозможно распознать любые шрифты, которые отличаются от стандартных, редкие или устаревшие языки. На результат могут повлиять изменения в освещении исходного текста или искажение символов во время сканирования.

Благодаря дополнению традиционной технологии распознавания текста новыми методами возможности распознавания растут стремительно.

Развитие методов искусственного интеллекта позволяет усовершенствовать технологию оптического распознавания символов. Развитие моделей машинного и глубокого обучения, использование сверточных и рекуррентных нейронных сетей позволяет получать гораздо лучшие результаты, точно распознавая и получая редактируемую транскрипцию текста из рукописных и фотоисточников.

Методы искусственного интеллекта предлагают альтернативу классическим статистическим методам, обладая следующими преимуществами: способность эффективно обрабатывать большие массивы данных, автоматическое выявление скрытых закономерностей, адаптация к изменениям в исходных данных.

Модель машинного обучения нацелена на решение конкретной задачи, и для решения этой задачи модель учится на основе входных данных. Модель берет изображение с рукописным текстом и идентифицирует определенную букву на основе обучающих данных [1].

Повышение точности распознавания текста должно основываться на качестве и разнообразии обучающей выборки данных. Набор данных должен включать различные шрифты, языки, стили. При составлении выборки следует учитывать культурные и лингвистические особенности, ориентацию текста, искажение формы символов.

Алгоритм машинного обучения изучает паттерны и особенности символов. Для обучения требуется большой объём данных и значительное время. Анализ литературы показывает, что вероятность ошибки при распознавании остаётся достаточно высокой.

Более успешными в области распознавания символов являются сверточные и рекуррентные нейронные сети, относящиеся к методам глубокого обучения. Эти модели могут автоматически определять признаки символов по изображению, выявлять общие черты и закономерности.

Глубокие нейронные сети построены на основе биологических нейронных сетей, представленных в человеческом мозге. Полученные системы не повторяют полностью человеческий мозг, но подчиняются схожему принципу обработки информации. Нейронные сети состоят из множества взаимосвязанных нейронов, работающих одновременно для достижения заданной цели. Эта технология также включает в себя процесс сетевого обучения.

Для реализации методов глубокого обучения создается многослойная нейронная сеть, которая будет использоваться для анализа и понимания сложных данных. Нейронная сеть имеет иерархическую структуру и может адаптироваться к различным типам текстовых данных. Такие модели, основанные на нейронных сетях, позволяют выявлять сложные закономерности в тексте, извлекать определенные атрибуты текстовых данных. Это может быть использовано при анализе текстовой документации, представленной в виде рисунка, используется при автоматической транскрипции и обработке естественного языка.

Классическая конструкция нейронной сети - это сеть, построенная на основе входного, выходного слоев и расположенного между ними набора внутренних скрытых слоев сети. Примерная схема сети показана на рисунке 1.

Структура нейронной сети
Рисунок 1 – Структура нейронной сети

Входной слой берет данные из внешней среды и преобразует их в удобный формат для дальнейшей обработки. Скрытые слои непосредственно обрабатывают данные, находя и выделяя определенные зависимости и атрибуты в данных. Результаты обработки передаются на выходной слой. Нейроны в сети соединены звеньями, каждое звено имеет вес, определяющий степень влияния на следующий нейрон.

Сверточная нейронная сеть — это архитектура нейронных сетей, где сеть также состоит из нескольких слоев, но слои относятся к разным типам (рис. 2). Помимо классических плотных слоев, существуют сверточные и объединяющие слои. Сверточный слой — это слой, для которого выполняется операция свертки, чтобы идентифицировать объекты из исходных данных путем удаления ненужных [2].

За слоем свертки следует слой объединения (Pool), его задача состоит в том, чтобы выбрать основные объекты из объектов, идентифицированных в слое свертки, уменьшая размерность данных. Полностью связанные слои нейронной сети расположены после и выполняют задачу кластеризации. Такая последовательность слоев позволяет сверточной нейронной сети идентифицировать как локальные, так и глобальные закономерности в тексте, обеспечивая точное распознавание, достигая высокого уровня точности.

Конвергентные нейронные сети востребованы при работе с многомерными данными – визуальном анализе изображений, обработке видео и изображений на картинках, распознавании символов и шрифтов, задачах компьютерного зрения.

Структура свёрточной нейронной сети
Рисунок 2 – Структура свёрточной нейронной сети

Рекуррентная нейронная сеть (рис. 3) — это класс нейронных сетей, используемых для работы с последовательностью символов, данными, зависящими от времени. Отличие сетей этого типа от классических сетей заключается в наличии связей с обратной связью. Соединения такого типа в сети, рекуррентные соединения, способны учитывать контекстные данные, используя для этой цели внутреннее состояние «память».

Структура рекуррентной нейронной сети
Рисунок 3 – Структура рекуррентной нейронной сети

В отличие от полносвязных и сверточных слоев, которые обрабатывают каждый элемент входной последовательности отдельно, рекуррентные слои (RNN) используют информацию о предыдущих элементах для обработки текущего. Основная идея рекуррентности заключается в том, что на каждом шаге обработки последовательности слой извлекает текущий элемент и предыдущее внутреннее состояние [3].

Использование рекуррентных сетей позволяет зафиксировать зависимость между символами, что повышает точность распознавания, используется при языковом моделировании, генерации текста, востребовано в различных задачах с обработкой естественного языка.

Для распознавания текста используется комбинация сверточной и рекуррентной нейронных сетей, называемая сверточно-рекуррентной нейронной сетью. Эта сеть позволяет эффективно распознавать и обнаруживать зависимости в текстовых изображениях, учитывая разные размеры букв, расположение в разных позициях. Однако следует учитывать, что для обучения потребуются значительные вычислительные ресурсы и большие объемы исходных данных.

Современное развитие технологий искусственного интеллекта вывело технологию распознавания текста на новый уровень, сделав ее универсальной и более точной [4]. Есть возможности работать с нестандартными шрифтами, сложными форматами документов, эффективно обрабатывать большие объемы текстовых данных, гибкость в обработке различных текстовых изображений, учитывается ориентация исходного документа. Использование нейросетевых моделей в распознавании текста актуально, доступно, востребовано и будет активно развиваться в ближайшее время.

Список литературы

  1. Aqab, Sara; Tariq, Muhammad Usman. Handwriting Recognition using Artificial Intelligence Neural Network and Image Processing // International Journal of Advanced Computer Science and Applications (IJACSA), 11(7), 2020. https://thesai.org/Downloads/Volume11No7/Paper_19-Handwriting_Recognition_using_Artificial_Intelligence.pdf (дата обращения: 15.05.2025).
  2. Сверточная нейронная сеть: как устроена. https://practicum.yandex.ru/blog/svertochnye-neyronnye-seti/ (дата обращения: 15.05.2025).
  3. Как устроена нейронная сеть и зачем ей слои. https://www.arcsinus.ru/blog/neuronet-architecture (дата обращения: 15.05.2025).
  4. Ращупкин Я. Как развиваются технологии ИИ в области распознавания текста. https://tproger.ru/articles/kak-razvivayutsya-tehnologii-ii-v-oblasti-raspoznavaniyateksta-251221 (дата обращения: 15.05.2025).