Сайт ДонНТУ Портал магистров
Магистр ДонНТУ Бабич Иван Викторович

Бабич Иван Викторович

Факультет интеллектуальных систем и программирования

Кафедра прикладной математики и искусственного интеллекта

Направление: 09.04.04 «Программная инженерия»

Профиль: «Технологии программного обеспечения интеллектуальных систем»

Тема выпускной квалификационной работы магистра: «Генерация искусственного текста на естественном языке с использованием трансформеров»

Руководитель ВКР: к.т.н., доцент кафедры ПМИИ Ефименко Константин Николаевич

Реферат по теме выпускной работы

Введение

Современный этап развития искусственного интеллекта характеризуется беспрецедентным прогрессом в области обработки естественного языка (NLP), где генеративные модели на основе архитектуры трансформеров заняли лидирующие позиции. В последние годы наблюдается значительный рост интереса к созданию систем искусственного интеллекта, способных не только понимать, но и генерировать осмысленный, грамматически корректный и контекстуально релевантный текст на естественном языке. Данная тенденция обусловлена как теоретической значимостью решения фундаментальных задач искусственного интеллекта [1], так и высоким практическим спросом на технологии автоматической генерации контента в различных сферах человеческой деятельности – от образования и журналистики до бизнес-коммуникаций и творческого письма.

Особую актуальность приобретает разработка специализированных решений для русского языка, который обладает сложной морфологической структурой, богатой системой падежей и свободным порядком слов [2]. Существующие на рынке коммерческие решения, такие как GPT-4, Claude или Gemini, хотя и демонстрируют впечатляющие результаты для английского языка, зачастую недостаточно адаптированы к лингвистическим особенностям русского языка, что проявляется в грамматических ошибках, стилистической неестественности и недостаточной контекстной глубине генерируемых текстов. В условиях геополитической ситуации и ограничений на использование зарубежных технологий возникает острая необходимость в разработке отечественных решений, основанных на открытых моделях и адаптированных к специфике русскоязычного контента.

Тем не менее, создание высококачественных генеративных моделей с нуля представляет собой ресурсоемкую задачу, требующую доступа к суперкомпьютерным мощностям и большим объемам размеченных данных. В связи с этим особую перспективу приобретают методы параметро-эффективного дообучения (PEFT) [3], такие как LoRA (Low-Rank Adaptation) [4] и QLoRA (Quantized Low-Rank Adaptation) [5, 6], позволяющие адаптировать предварительно обученные модели под специфические задачи при минимальных вычислительных затратах. Данный подход открывает возможность для исследователей и разработчиков с ограниченными ресурсами создавать специализированные генеративные системы, ориентированные на конкретные предметные области или стилистические особенности.

Целью настоящей работы является разработка программного приложения для генерации искусственного текста на русском языке с использованием архитектуры трансформеров [7], адаптированного к лингвистическим особенностям русского языка и функционирующего в условиях ограниченных вычислительных ресурсов. Для достижения поставленной цели определены следующие задачи исследования:

1. Провести анализ современных архитектур трансформеров и методов параметро-эффективного дообучения, применимых для генерации текста на русском языке.

2. Разработать методику подготовки и предобработки русскоязычных текстовых данных на основе корпуса TAIGA (Tatiana's Annotated Interdisciplinary General Corpus of Russian) [8] с учетом морфологических и синтаксических особенностей языка.

3. Реализовать стратегию адаптации предварительно обученной модели с использованием методов LoRA/QLoRA для эффективного дообучения на ограниченных вычислительных ресурсах.

4. Разработать архитектуру программного приложения с графическим интерфейсом пользователя, обеспечивающего интуитивно понятное взаимодействие с моделью генерации текста.

5. Провести комплексную оценку качества генерируемого текста с использованием как автоматических метрик (BLEU, ROUGE, perplexity), так и экспертной оценки лингвистов.

Научная новизна работы заключается в следующем:

– предложена модифицированная стратегия параметро-эффективного дообучения, учитывающая особенности спектра Гессиана целевой функции при адаптации моделей для генерации русскоязычного текста;

– разработан метод интеграции морфологической и синтаксической разметки в процесс генерации текста, что позволяет повышать грамматическую корректность результатов без значительного увеличения вычислительной сложности;

– предложена гибридная методика оценки качества генерации текста, сочетающая автоматические метрики с лингвистическими критериями, адаптированными к особенностям русского языка.

Практическая значимость исследования определяется созданием полнофункционального программного приложения, способного генерировать качественный русскоязычный текст в интерактивном режиме. Результаты работы могут быть использованы для автоматизации создания контента в образовательных учреждениях, средствах массовой информации, корпоративных коммуникациях, а также в качестве основы для дальнейших исследований в области обработки естественного языка [9, 10]. Разработанные методики параметро-эффективного дообучения могут быть применены в других задачах NLP, требующих адаптации больших моделей при ограниченных ресурсах.

Таким образом, представленная работа находится на стыке нескольких актуальных направлений искусственного интеллекта – обработки естественного языка, параметро-эффективного обучения нейронных сетей и лингвистической обработки русского языка. Результаты исследования вносят вклад в развитие методов генерации искусственного текста и создание доступных инструментов для работы с русскоязычным контентом в условиях современных технологических ограничений.

1 Современные подходы к генерации текста на естественном языке

1.1 Архитектура трансформеров и их роль в генерации текста

Современные генеративные модели, лежащие в основе систем создания текста, строятся на архитектуре трансформеров, представленной в 2017 году в работе «Attention is All You Need» [11]. Ключевым инновационным элементом данной архитектуры является механизм самовнимания (self-attention), позволяющий модели оценивать взаимосвязь между всеми элементами последовательности независимо от их позиции. В отличие от рекуррентных сетей, обрабатывающих данные последовательно, трансформеры обрабатывают всю входную последовательность параллельно, что существенно ускоряет вычисления и улучшает способность модели улавливать долгосрочные зависимости [12].

Архитектура трансформера состоит из двух основных компонентов: энкодера и декодера. Энкодер преобразует входной текст в скрытое представление, сохраняющее семантическую и синтаксическую информацию. Декодер, используя это представление, генерирует текст посимвольно или пословно, учитывая как внутренний контекст сгенерированной части, так и входные данные [13]. Для учета порядка слов, который теряется при параллельной обработке, в модель включено позиционное кодирование, представляющее информацию о позиции каждого элемента с помощью тригонометрических функций.

Как видно на рисунке 1, энкодерный блок (слева) состоит из многочисленных слоев, включая multi-head attention и feed-forward, а декодерный блок (справа) содержит дополнительный маскированный multi-head механизм внимания, который предотвращает «просачивание» информации о будущих токенах в процессе генерации. Оба блока включают в себя нормализацию и остаточные соединения, которые улучшают стабильность обучения и помогают избежать проблемы затухающего градиента [14].

В генеративных моделях, таких как GPT, часто используется только декодерная часть архитектуры, что позволяет модели работать в автогрессивном режиме – каждый следующий токен генерируется с учетом всех предыдущих [15]. Механизм маскированного внимания предотвращает «просачивание» информации о будущих токенах, обеспечивая корректность генерации. Такая структура обеспечивает параллельную обработку данных, что значительно ускоряет вычисления по сравнению с рекуррентными архитектурами.

Детализированная архитектура трансформера: структура энкодерного и декодерного блоков
Рисунок 1 – Детализированная архитектура трансформера: структура энкодерного и декодерного блоков [11]

1.2 Параметро-эффективные методы адаптации языковых моделей

Дообучение современных больших языковых моделей (LLM) требует значительных вычислительных ресурсов, что делает полное переобучение практически нереализуемым для исследователей с ограниченными возможностями. В этом контексте параметро-эффективные методы, такие как LoRA (Low-Rank Adaptation) и QLoRA (Quantized Low-Rank Adaptation), становятся ключевыми инструментами для адаптации моделей под специфические задачи.

LoRA предполагает введение небольших матриц низкого ранга, которые модифицируют веса модели без изменения исходных параметров. Это позволяет сохранить целостность предобученной модели, одновременно адаптируя её к новым данным с минимальным увеличением количества обучаемых параметров. Метод QLoRA дополняет LoRA квантизацией исходной модели до 4 бит, что позволяет разместить её даже на потребительских видеокартах, а затем добавляет адаптеры с повышенной точностью для компенсации потерь качества. Такой подход снижает требования к памяти на порядок, сохраняя при этом высокую точность генерации [16].

Преимущество этих методов заключается в том, что они позволяют дообучать модели на небольших наборах данных, не теряя обобщающей способности. Это особенно важно для задач генерации текста на русском языке, где доступные корпуса данных часто ограничены. На рисунке 2 показано сравнение схем дообучения: стандартный подход требует хранения полного состояния оптимизатора, тогда как LoRA и QLoRA используют компактные адаптеры, что делает их пригодными для реализации на персональных компьютерах.

Сравнение схем дообучения LLM: Standard, LoRA и QLoRA
Рисунок 2 – Сравнение схем дообучения LLM: Standard, LoRA и QLoRA

2 Подготовка данных и адаптация модели для русского языка

2.1 Анализ корпуса TAIGA как основы для обучения

Одним из ключевых аспектов успешной генерации высококачественного русскоязычного текста является использование качественных и масштабных обучающих данных. В данном исследовании в качестве основного источника текстовых данных выбран открытый корпус TAIGA (Tatiana's Annotated Interdisciplinary General Corpus of Russian), разработанный Т.О. Шавриной [8]. Этот корпус представляет собой уникальный ресурс, содержащий более 1,5 миллиарда слов из различных источников: новостных статей, научных публикаций, художественной литературы и веб-контента.

Преимуществом корпуса TAIGA перед другими источниками является наличие полной лингвистической аннотации. Каждое предложение в корпусе прошло этапы токенизации, морфологического тегирования и синтаксического разбора в соответствии со стандартом Universal Dependencies (UD). Такая детальная разметка позволяет не только обучить модель генерировать грамматически корректный текст, но и контролировать синтаксическую структуру генерируемых предложений.

Важной характеристикой корпуса TAIGA является его сбалансированность по жанрам и тематикам, что снижает риск смещения генеративной модели в сторону узкоспециализированного или стилистически однородного контента. Такое разнообразие данных способствует формированию у модели более универсальных паттернов генерации, применимых к различным контекстам и задачам.

2.2 Особенности предобработки русскоязычных текстов

Русский язык с его богатой морфологией, системой падежей и свободным порядком слов создает дополнительные сложности для автоматической обработки и генерации текста. В отличие от английского языка, где грамматические отношения часто выражаются порядком слов и служебными словами, в русском языке эти отношения кодируются через изменение форм слов, что требует специальных подходов к предобработке данных [17].

Ключевым этапом предобработки является токенизация – разбиение текста на лингвистические единицы. Для русского языка стандартные алгоритмы токенизации часто оказываются недостаточными из-за особенностей пунктуации и словообразования [18].

После токенизации выполняется морфологический анализ. Каждому токену присваивается часть речи и набор грамматических признаков в соответствии со стандартом Universal Dependencies. Например, слово «специалистов» маркируется как NOUN (существительное) с признаками Animacy=Anim (одушевленность), Case=Gen (родительный падеж), Gender=Masc (мужской род), Number=Plur (множественное число). Такая детальная разметка позволяет генеративной модели учитывать грамматические согласования при создании текста.

Дополнительным этапом предобработки является синтаксический анализ с помощью парсера UDPipe. Для каждого предложения строится дерево зависимостей, где вершины представляют слова, а дуги – грамматические отношения между ними. Например, в предложении «Число ИТ-специалистов растет» глагол «растет» будет являться корнем, а существительное «число» – субъектом действия. Синтаксическая разметка встраивается в обучающие данные и позволяет модели генерировать структурно корректные предложения.

Особое внимание в предобработке русскоязычных данных уделяется обработке иноязычных вкраплений и технических терминов, которые широко распространены в современных русских текстах. Вместо удаления таких элементов, они помечаются специальными тегами и интегрируются в обучающий процесс, что позволяет генерировать тексты с естественным смешением языков, характерным для реальной коммуникации.

Важной частью предобработки является также статистический анализ корпуса для определения оптимальных параметров обучения модели: длины контекста, частоты слов, баланса классов. Для русского языка с его богатой системой словообразования требуется особый подход к ограничению словаря – вместо жесткого обрезания по частоте применяется комбинированная стратегия, учитывающая как частоту, так и семантическую значимость редких терминов и словоформ.

Заключение

Проведённое исследование в области генерации искусственного текста на естественном языке с использованием архитектуры трансформеров [19, 20] позволило получить ряд теоретических и практических результатов, имеющих как научную, так и прикладную ценность.

Теоретический анализ современных подходов к генерации текста продемонстрировал ключевые преимущества трансформерной архитектуры перед традиционными методами обработки последовательных данных [21]. Механизм самовнимания (self-attention) обеспечивает возможность моделирования долгосрочных зависимостей в тексте без потери контекстной информации, что особенно важно для морфологически богатых языков, таких как русский. Исследование параметро-эффективных методов адаптации больших языковых моделей, в частности LoRA и QLoRA, показало их высокую эффективность при минимальных вычислительных затратах, что открывает возможности для практической реализации генеративных систем на ограниченных аппаратных ресурсах [22, 23].

Анализ корпуса TAIGA и методов предобработки русскоязычных текстов выявил критическую важность лингвистической аннотации для обеспечения грамматической корректности генерируемых текстов. Предложенная методика интеграции морфологической и синтаксической информации в процесс обучения позволяет значительно повысить качество генерации, особенно в аспектах согласования падежных форм, времён глаголов и синтаксической структуры предложений. Экспериментальные результаты подтвердили, что использование лингвистически обогащённых данных в сочетании с параметро-эффективными методами дообучения обеспечивает оптимальный баланс между качеством генерации и ресурсоёмкостью системы [24, 25].

Практическая значимость проведённого исследования заключается в разработке методических рекомендаций по созданию систем генерации русскоязычного текста в условиях ограниченных вычислительных ресурсов. Предложенные подходы могут быть использованы в образовательных учреждениях для автоматизации создания учебных материалов, в средствах массовой информации для генерации черновых вариантов статей и новостей, а также в корпоративной среде для автоматизации создания отчётов и деловой переписки. Кроме того, разработанные методы предобработки данных и параметро-эффективного дообучения могут быть применены в смежных задачах обработки естественного языка, таких как машинный перевод, анализ тональности и извлечение информации.

Перспективы дальнейших исследований в данной области включают:

1. Разработку гибридных методов генерации, комбинирующих правила лингвистики и нейронные подходы для повышения контролируемости генерируемого текста.

2. Исследование методов адаптации моделей под узкоспециализированные предметные области с использованием минимального количества примеров (few-shot learning).

3. Создание механизмов контроля качества и безопасности генерируемого контента для предотвращения распространения ложной информации и токсичных высказываний.

4. Разработку эффективных методов оценки качества генерации с учётом не только грамматической корректности, но и семантической насыщенности и стилистической целостности.

5. Исследование возможностей интеграции генеративных моделей с системами компьютерного зрения для создания мультимодальных приложений.

Таким образом, представленная работа вносит существенный вклад в развитие методов генерации искусственного текста на русском языке, предлагая комплексный подход, объединяющий современные достижения в области нейронных сетей, лингвистической обработки данных и оптимизации вычислительных ресурсов. Результаты исследования подтверждают возможность создания доступных и эффективных систем генерации текста, способных работать в условиях ограниченных вычислительных мощностей и обеспечивать высокое качество генерируемых материалов, соответствующих лингвистическим нормам русского языка. Это открывает новые возможности для широкого внедрения технологий искусственного интеллекта в различные сферы деятельности, требующие автоматической обработки и генерации естественного языка.

Список источников

  1. Бекназаров, С. Б. Нейронная сеть [Электронный ресурс] / С. Б. Бекназаров // Символ науки. — 2023. — № 4-2. — Режим доступа: https://cyberleninka.ru/article/n/neyronnaya-set.
  2. Ашыралыева, М. А. Технологический прорыв в обработке естественного языка: архитектура трансформеров и роль междисциплинарного синтеза [Электронный ресурс] / М. А. Ашыралыева, Д. Р. Аннабаева // Наука и мировоззрение. — 2025. — № 59. — Режим доступа: https://cyberleninka.ru/article/n/tehnologicheskiy-proryv-v-obrabotke-estestvennogo-yazyka-arhitektura-transformerov-i-rol-mezhdistsiplinarnogo-sinteza.
  3. Ram, D. Learning to Focus: Focal Attention for Selective and Scalable Transformers [Электронный ресурс] / D. Ram, W. Xia, S. Soatto // arXiv. — 2025. — Режим доступа: https://arxiv.org/abs/2511.06818.
  4. Text generation inference, LoRA (Low-Rank Adaptation) [Электронный ресурс] / HuggingFace // HuggingFace Documentation. — Режим доступа: https://huggingface.co/docs/text-generation-inference/conceptual/lora.
  5. Making LLMs even more accessible with bitsandbytes, 4-bit quantization and QLoRA [Электронный ресурс] / HuggingFace // HuggingFace Blog. — Режим доступа: https://huggingface.co/blog/4bit-transformers-bitsandbytes.
  6. What is QLoRA (Quantized Low-Rank Adapter)? [Электронный ресурс] / GeeksforGeeks // GeeksforGeeks. — Режим доступа: https://www.geeksforgeeks.org/what-is-qlora-quantized-low-rank-adapter/.
  7. Объясняем простым языком, что такое трансформеры [Электронный ресурс] / Habr // Habr. — Режим доступа: https://habr.com/ru/companies/mws/articles/770202/.
  8. Шаврина, Т. О. Pipeline (конвейер) корпуса TAIGA [Электронный ресурс] / Т. О. Шаврина // TAIGA Corpus. — 2025. — Режим доступа: https://tatianashavrina.github.io/taiga_site/pipeline.
  9. Бурнашев, Р. Ф. Применение нейронных сетей в автоматическом переводе и обработке естественного языка [Электронный ресурс] / Р. Ф. Бурнашев, Л. А. Анварова // Universum: технические науки. — 2024. — № 4(121). — Режим доступа: https://cyberleninka.ru/article/n/primenenie-neyronnyh-setey-v-avtomaticheskom-perevode-i-obrabotke-estestvennogo-yazyka.
  10. Оганесян, С. А. Применение искусственного интеллекта в компьютерной лингвистике и обработке естественного языка [Электронный ресурс] / С. А. Оганесян // Вестник науки. — 2024. — № 7(76). — Режим доступа: https://cyberleninka.ru/article/n/primenenie-iskusstvennogo-intellekta-v-kompyuternoy-lingvistike-i-obrabotke-estestvennogo-yazyka.
  11. Vaswani, A. Attention Is All You Need [Электронный ресурс] / A. Vaswani, N. Shazeer, N. Parmar, J. Uszkoreit, L. Jones, A. N. Gomez, Ł. Kaiser, I. Polosukhin // arXiv. — 2017. — Режим доступа: https://arxiv.org/abs/1706.03762.
  12. 'Attention is all you need' простым языком [Электронный ресурс] / Habr // Habr. — Режим доступа: https://habr.com/ru/articles/781770/.
  13. Знакомство с трансформерами. Часть 1 [Электронный ресурс] / Habr // Habr. — Режим доступа: https://habr.com/ru/companies/wunderfund/articles/592231/.
  14. Как трансформеры имитируют работу мозга [Электронный ресурс] / Newochem.io // Newochem.io. — Режим доступа: https://newochem.io/transformerah/.
  15. Жусип, М. Н. Сравнение чат-ботов с использованием трансформеров и нейросетей: исследование применения архитектур GPT и BERT [Электронный ресурс] / М. Н. Жусип, Д. О. Жаксыбаев // Вестник науки. — 2024. — № 9(78). — Режим доступа: https://cyberleninka.ru/article/n/sravnenie-chat-botov-s-ispolzovaniem-transformerov-i-neyrosetey-issledovanie-primeneniya-arhitektur-gpt-i-bert.
  16. Dettmers, T. QLoRA: Efficient Finetuning of Quantized LLMs [Электронный ресурс] / T. Dettmers, A. Pagnoni, A. Holtzman, L. Zettlemoyer // arXiv. — 2023. — Режим доступа: https://arxiv.org/abs/2305.14314.
  17. Кожевников, В. А. Research of text pre-processing methods for preparing data in Russian for machine learning [Электронный ресурс] / В. А. Кожевников, Е. С. Панкратова // ResearchGate. — Режим доступа: https://www.researchgate.net/publication/341128985_RESEARCH_OF_TEXT_PRE-PROCESSING_METHODS_FOR_PREPARING_DATA_IN_RUSSIAN_FOR_MACHINE_LEARNING.
  18. Узких, Г. Ю. Применение трансформеров в обработке естественного языка [Электронный ресурс] / Г. Ю. Узких // Вестник науки. — 2024. — № 8(77). — Режим доступа: https://cyberleninka.ru/article/n/primenenie-transformerov-v-obrabotke-estestvennogo-yazyka.
  19. Трансформеры [Электронный ресурс] / Яндекс Образование // Яндекс Образование. — Режим доступа: https://education.yandex.ru/handbook/ml/article/transformery.
  20. Transformer (deep learning) [Электронный ресурс] / Wikipedia // Wikipedia. — Режим доступа: https://en.wikipedia.org/wiki/Transformer_(deep_learning_architecture).
  21. Митина, О. А. Генерация текста с помощью нейронных сетей [Электронный ресурс] / О. А. Митина, В. В. Жаров // НАУ. — 2023. — № 90-2. — Режим доступа: https://cyberleninka.ru/article/n/generatsiya-teksta-s-pomoschyu-neyronnyh-setey.
  22. Сущеня, Р. В. Нейронные сети и их классификация. Основные виды нейронных сетей [Электронный ресурс] / Р. В. Сущеня, А. Э. Кокаев // Вестник науки. — 2023. — № 8(65). — Режим доступа: https://cyberleninka.ru/article/n/neyronnye-seti-i-ih-klassifikatsiya-osnovnye-vidy-neyronnyh-setey.
  23. Как работают трансформеры? [Электронный ресурс] / HuggingFace LLM Course // HuggingFace. — Режим доступа: https://huggingface.co/learn/llm-course/ru/chapter1/4#как-работают-трансформеры.
  24. Орловский, К. А. Сравнительный анализ алгоритмов классификации текстов: от классических моделей к трансформерам [Электронный ресурс] / К. А. Орловский // Вестник науки. — 2025. — № 5(86). — Режим доступа: https://cyberleninka.ru/article/n/sravnitelnyy-analiz-algoritmov-klassifikatsii-tekstov-ot-klassicheskih-modeley-k-transformeram.
  25. Нежников, Р. И. Сравнительный анализ моделей трансформера для классификации неструктурированной текстовой информации [Электронный ресурс] / Р. И. Нежников, А. Н. Марьенков // Прикаспийский журнал: управление и высокие технологии. — 2024. — № 2(66). — Режим доступа: https://cyberleninka.ru/article/n/sravnitelnyy-analiz-modeley-transformera-dlya-klassifikatsii-nestrukturirovannoy-tekstovoy-informatsii.