Сайт ДонНТУ Портал магистров
Магистр ДонНТУ Бабич Иван Викторович

Бабич Иван Викторович

Факультет интеллектуальных систем и программирования

Кафедра прикладной математики и искусственного интеллекта

Направление: 09.04.04 «Программная инженерия»

Профиль: «Технологии программного обеспечения интеллектуальных систем»

Тема выпускной квалификационной работы магистра: «Генерация искусственного текста на естественном языке с использованием трансформеров»

Руководитель ВКР: к.т.н., доцент кафедры ПМИИ Ефименко Константин Николаевич

Библиотека материалов по теме выпускной работы

Собственные публикации и доклады

1.
Авторы: И.В. Бабич, К.Н. Ефименко
Описание: выполнен краткий обзор современных подходов к предобработке русскоязычных текстов, включающий этапы очистки данных, токенизации, морфологического анализа и синтаксической разметки. Показано влияние качества предварительной обработки на результаты генерации текста трансформерными моделями. Приведён сравнительный анализ существующих инструментов и типичных ошибок, возникающих при построении конвейеров обработки данных.
2.
Авторы: И.В. Бабич, К.Н. Ефименко
Описание: в статье приведён обзор теоретической основы parameter-efficient fine-tuning (PEFT) для больших языковых моделей (LLM). Рассмотрены ключевые методы низкоранговых адаптаций (LoRA) и их комбинация с низкобитной квантизацией (QLoRA). Дополнительно приведены рекомендации по выбору ранга адаптации и уровня квантизации на основе спектра Гессиана и эффективной размерности задачи.
3.
Авторы: И.В. Бабич, К.Н. Ефименко
Описание: рассмотрена архитектура трансформеров, реализующих современный подход в нейронных сетях для обработки последовательных данных. Описаны ключевые элементы модели: механизм самовнимания, энкодеры и декодеры. Рассмотрено применение данной архитектуры при обработке естественного языка, компьютерном зрении и биоинформатике.
4.
Авторы: И.В. Бабич, К.Н. Ефименко
Описание: рассмотрены методы интеграции данных от Лидара и нейронных сетей в контексте управления транспортными средствами. Обсуждаются алгоритмы обработки данных Лидара, принципы работы нейронных сетей и их взаимодействие для обеспечения безопасности и эффективности управления движением. Исследование указывает на перспективы использования данной интеграции в развитии автономных транспортных систем.
5.
Авторы: И.В. Бабич, К.Н. Ефименко
Описание: рассмотрены основные концепции, подходы и архитектуры нейронных сетей в контексте управления транспортом. Описаны задачи, которые могут быть решены с помощью нейронных сетей, такие как распознавание образов и прогнозирование движения. Исследование указывает на перспективы использования нейронных сетей в развитии интеллектуальных систем управления транспортом.
6.
Авторы: К.Н. Ефименко, И.В. Бабич
Описание: выполнено описание и анализ программного продукта: Нейронная сеть предназначена для автоматизации процесса управления транспортным средством. Обоснован выбор подхода к машинному обучению, а также входные и выходные данные.

Публикации и доклады других авторов

7.
Автор: Г.Ю. Узких
Описание: в данной статье рассматриваются основные концепции и принципы работы трансформеров, включая механизм самовнимания и позиционное кодирование. Особое внимание уделяется моделям, основанным на трансформерах, таким как BERT, GPT и T5, а также их применению в различных задачах NLP и перспективам дальнейшего развития.
8.
Авторы: А.М. Ашыралыева, Д.Р. Аннабаева
Описание: данная статья фокусируется на технологической стороне развития систем обработки естественного языка (NLP), рассматривая их как ключевой двигатель современного искусственного интеллекта (ИИ). Основное внимание уделено архитектуре Трансформеров (Transformer), которая обеспечила качественный скачок в создании больших языковых моделей (LLM).
9.
Авторы: М.Н. Жусип, Д.О. Жаксыбаев
Описание: в данной статье рассматривается сравнение двух популярных архитектур, используемых для создания чат-ботов, — GPT (Generative Pre-trained Transformer) и BERT (Bidirectional Encoder Representations from Transformers). Оба подхода основаны на трансформерах, но применяются по-разному: GPT фокусируется на генерации текста, а BERT — на глубоком понимании контекста и классификации.
10.
Авторы: Р.Ф. Бурнашев, Л.А. Анварова
Описание: научная статья исследует различные аспекты использования нейронных сетей в современных системах автоматического перевода и обработки естественного языка, обзор существующих методов и технологий, а также новые подходы и разработки.
11.
Автор: С.А. Оганесян
Описание: в статье исследуется применение искусственного интеллекта (ИИ) в компьютерной лингвистике и обработке естественного языка (ОЕЯ). Рассматриваются основные направления, включая автоматический перевод, виртуальных ассистентов, анализ текста и распознавание речи. Описаны ключевые технологии и методы, такие как нейронные сети, трансформеры и обучение на больших данных.
12.
Автор: К.А. Орловский
Описание: представлен обзор методов машинного обучения для автоматической классификации текстовых документов – от традиционных алгоритмов до современных глубинных нейросетевых моделей. Обсуждаются наивный Байес, метод опорных векторов, случайный лес и модель BERT, отражающая последние достижения в обработке естественного языка.
13.
Автор: С.Б. Бекназаров
Описание: в статье рассматривается нейронная сеть и анализируются ее особенности.
14.
Авторы: И.О. Кузнецова, Д.А. Малютов
Описание: в статье рассмотрены понятие нейронных сетей, история их появление, суть устроения и принципа работы нейросетей, классификация нейронных сетей, архитектура нейросетей, обучаемость нейронных сетей.

Переводы статей

16.
Авторы: Го Чжэньюй, Чэнь Вэньгуан
Автор перевода: И.В. Бабич
Описание: в статье представлена новая модульная архитектура трансформера, которая явно разделяет знания и рассуждения с помощью механизма обобщённого кросс-внимания к глобально разделяемой базе знаний со слоеспецифическими преобразованиями. Авторы математически доказывают, что полносвязные сети (FFN) в стандартных трансформерах являются частным случаем этого механизма, раскрывая их роль в неявном извлечении знаний.
17.
Автор: Яннис Ю. Хэ
Автор перевода: И.В. Бабич
Описание: в статье предлагается TART (Token-based Architecture Transformer) — новый подход к прогнозированию производительности нейронных сетей без необходимости их фактического обучения. Автор преобразует архитектуры нейронных сетей в токены с использованием метода собственных векторов лапласиана (LAP), после чего применяют трансформер для предсказания метрик производительности. TART демонстрирует передовые результаты на наборе данных DeepNets-1M даже без использования информации о связях в графе, подтверждая потенциал токенизации для более глубокого понимания архитектур нейронных сетей. Этот подход закладывает основу для будущих исследований по генерации новых высокопроизводительных нейронных архитектур с помощью трансформеров.
18.
Авторы: Лэй Ша, Юхан Сун, Йордан Йорданов, Томмазо Сальватори, Томас Лукасевич
Автор перевода: И.В. Бабич
Описание: в статье авторы выявляют серьезное ограничение стандартных трансформеров: при предсказании следующего токена механизм самовнимания уделяет чрезмерное внимание текущему токену, игнорируя важную историческую информацию, особенно «высокоуровневые» токены, влияющие на отдаленные позиции в последовательности. Для решения этой проблемы предлагается архитектура обзорного трансформера (BET) с двумя вариантами — с синтаксическими подсказками (BET-SG) и без них (BET-SF) — которая перераспределяет веса внимания в пользу информативных исторических токенов. Эксперименты на пяти наборах данных (машинный перевод и языковое моделирование) показывают, что предложенный подход значительно превосходит базовые трансформеры и существующие методы улучшения самовнимания, особенно в задачах с длинными зависимостями.
19.
Авторы: Чонг Цзен, Юэ Донг, Питер Пирс, Хонгчи У, Син Тонг
Автор перевода: И.В. Бабич
Описание: в статье представлена RenderFormer — новая нейронная система рендеринга на базе трансформеров, способная напрямую генерировать изображения из треугольных сеток с полноценным глобальным освещением без необходимости обучения под каждую конкретную сцену. Архитектура использует двухэтапный подход: независимый от точки обзора этап для моделирования переноса света между треугольниками и зависимый от точки обзора этап для преобразования лучей в пиксельные значения, применяя относительное 3D пространственное кодирование вместо традиционных позиционных эмбеддингов. RenderFormer демонстрирует впечатляющую производительность, рендеря сцены в 50-150 раз быстрее, чем традиционные методы трассировки путей при сохранении высокого качества изображений с эффектами многократных отражений и сложных теней. Архитектура полностью дифференцируема и потенциально применима для решения задач как прямого, так и обратного рендеринга, открывая новые возможности для интеграции физически корректного рендеринга в нейронные конвейеры.
20.
Автор: Чайтанья К. Джоши
Автор перевода: И.В. Бабич
Описание: статья исследует фундаментальную связь между архитектурой трансформеров и графовыми нейронными сетями (GNNs), демонстрируя, что трансформеры по сути представляют собой GNN, работающие на полносвязных графах токенов. Автор показывает, как механизм самовнимания в трансформерах математически эквивалентен передаче сообщений в графовых сетях внимания (GATs), где каждый токен взаимодействует со всеми остальными через вычисление относительной важности. Несмотря на эту математическую эквивалентность, трансформеры получили большее распространение из-за их реализации через плотные матричные операции, которые значительно эффективнее на современном оборудовании по сравнению с разреженной передачей сообщений в традиционных GNN. Это приводит к выводу, что трансформеры по сути являются графовыми нейронными сетями, которым «посчастливилось выиграть в аппаратной лотерее», что объясняет их доминирование в современных архитектурах глубокого обучения.