Слипенко Максим Константинович

Факультет интеллектуальных систем и программирования

Кафедра программной инженерии им. Л. П. Фельдмана

Направление: 09.04.04 «Программная инженерия»

Профиль: «Методы и средства разработки программного обеспечения»

Тема выпускной квалификационной работы магистра: «Повышение точности ответов чат-ботов на базе больших языковых моделей»

Руководитель ВКР: кандидат технических наук, доцент кафедры программной инженерии им. Л. П. Фельдмана Рычка Ольга Валентиновна

О себе Реферат Научные труды Индивидуальный раздел

Реферат по теме выпускной работы

Содержание

Введение

В условиях стремительного развития технологий искусственного интеллекта чат-боты на базе больших языковых моделей (LLM) становятся ключевым инструментом для автоматизации взаимодействия с пользователями в таких сферах, как клиентская поддержка, образование и электронная коммерция. Современные LLM, основанные на архитектуре трансформеров, демонстрируют высокую способность генерировать связные и грамматически корректные ответы. Однако их применение сопряжено с рядом проблем, включая генерацию недостоверной информации (галлюцинации), ограничения в учете актуальных данных и сложности в поддержании связности при длительных диалогах. Эти факторы снижают доверие пользователей и ограничивают эффективность чат-ботов в критически важных сценариях. Теоретический анализ особенностей функционирования чат-ботов на базе LLM, включая их архитектуру, механизмы работы и проблемы точности, является актуальным направлением, способствующим выявлению путей их оптимизации и повышению качества диалоговых систем.

Задачи исследования:

1 История и развитие технологий чат-ботов

Чат-боты представляют собой программные системы, которые имитируют человеческий диалог, взаимодействуя с пользователями через текстовый или голосовой интерфейс. Первые чат-боты появились ещё в 1960-х годах: одним из самых известных ранних примеров является программа Элиза (1966), разработанная Джозефом Вейценбаумом в MIT. Элиза имитировала работу психотерапевта, анализируя ключевые слова в репликах пользователя и подставляя их в шаблонные фразы.

В 1990-х и начале 2000-х годов развитие чат-ботов шло в русле скриптовых систем с фиксированными правилами. Эти боты применялись в основном для автоматизации клиентской поддержки и ответов на часто задаваемые вопросы. С развитием технологий машинного обучения и обработкой естественного языка (NLP) появились чат-боты, которые могли использовать статистические методы и простые модели для распознавания намерений пользователей.

Настоящий прорыв в развитии чат-ботов произошёл с появлением глубокого обучения и больших языковых моделей (LLM). Появление архитектуры трансформеров, предложенной в работе «Attention Is All You Need» [1], стало ключевым этапом, позволившим обрабатывать большие объёмы текста и генерировать осмысленные и последовательные ответы. Сегодня чат-боты на базе LLM, такие как GPT (Generative Pre-trained Transformer), используются в различных сферах: от персональных ассистентов до корпоративных решений и образовательных платформ.

2 Принципы работы LLM в генерации ответов

Большие языковые модели (LLM) — это модели машинного обучения, обученные на огромных корпусах текстов для предсказания следующего слова в последовательности. Основой их функционирования является архитектура трансформеров, которая позволяет обрабатывать последовательности слов параллельно, учитывая контекст всего текста.

Генерация ответов происходит в несколько этапов:

  1. Токенизация: исходный текст разбивается на токены (слова, части слов).
  2. Векторизация: токены преобразуются в числовые представления (эмбеддинги).
  3. Обработка: трансформер с помощью механизмов внимания (attention) взвешивает влияние каждого токена на другие.
  4. Декодирование: модель предсказывает вероятностное распределение для следующего токена и выбирает наиболее вероятный вариант или вариант с учётом заданной температуры и других параметров генерации.

LLM работают по принципу автодополнения: на каждом шаге они выбирают наиболее вероятное продолжение текста. Это позволяет им генерировать связные и грамматически корректные ответы, но создаёт и риски генерации неточных или неуместных данных, так как модель опирается на вероятностные связи в обучающих данных.

3 Архитектуры больших языковых моделей

Современные большие языковые модели основаны на архитектуре трансформера, предложенной Vaswani и соавт. в 2017 году в работе «Attention Is All You Need». Ключевая особенность трансформера заключается в том, что он полностью отказался от рекуррентных и сверточных структур, заменив их механизмом многоголового внимания (Multi-Head Attention). Диаграмма Transformer модели представлена на рисунке 1.

Рисунок 1 — Диаграмма Transformer модели
Рисунок 1 — Диаграмма Transformer модели

Кодировщик, расположенный в левой части схемы, отвечает за обработку входного предложения (Source Sentence). Он состоит из стека из N идентичных слоёв, каждый из которых включает механизм многоголового внимания (Multi-Head Attention) и полносвязную нейронную сеть (Feed Forward). Для сохранения информации о порядке слов к входным эмбеддингам добавляется позиционное кодирование.

Декодировщик, представленный в правой части диаграммы, генерирует выходное предложение (Output Sentence). Как и кодировщик, он состоит из стека из N слоёв, но имеет дополнительную особенность — механизм маскированного многоголового внимания (Masked Multi-Head Attention), который предотвращает использование информации о будущих токенах при генерации текущего. Кроме того, в декодировщике используется обычный механизм многоголового внимания для взаимодействия с выходными данными кодировщика.

Механизм Attention (Scaled Dot-Product Attention) — это основа, на которой построен Transformer. Он позволяет модели определять, какие слова во входной последовательности важны для каждого конкретного слова при обработке текста. Механизм Attention представлен на рисунке 2.

Рисунок 2 — Механизм Attention
Рисунок 2 — Механизм Attention

Принцип работы можно описать так: каждое слово сначала преобразуется в три вектора — запрос (Query), ключ (Key) и значение (Value). Для вычисления внимания используется скалярное произведение запросов и ключей, чтобы определить, насколько слова взаимосвязаны. Итоговый результат — взвешенная сумма значений.

http://www.w3.org/1998/Math/MathML" display="block">Attention(Q,K,V)=softmax(QKT(dk))V\begin{equation} Attention(Q,K,V) = softmax (\frac{QK^T}{\sqrt{(d_k)}})V \end{equation}

где:

Механизм Multi-Head Attention — это расширение обычного внимания. Его ключевая идея в том, что модель может параллельно «смотреть» на текст под разными углами. Вместо одного набора Q,K,V используются несколько, и каждая голова внимания изучает свои шаблоны взаимосвязей между словами.

http://www.w3.org/1998/Math/MathML" display="block">MultiHead(Q,K,V)=Concat(head1,...headn)WO\begin{equation} MultiHead(Q,K,V) = Concat(head_1,...head_n)W^O \end{equation}

http://www.w3.org/1998/Math/MathML" display="block">headi=Attention(QWiQ,KWiK,VWiV)\begin{equation} head_i=Attention(QW_i^Q,KW_i^K,VW_i^V) \end{equation}

где:

4 Проблемы точности и качества ответов

Несмотря на впечатляющие возможности больших языковых моделей, при их использовании возникают серьёзные проблемы, связанные с точностью и качеством генерируемых ответов. Во-первых, модели могут порождать «галлюцинации» — правдоподобно звучащую, но фактически неверную информацию [2]. Во-вторых, модели склонны повторять или искажать контекст, что особенно критично при длительных диалогах. Ещё одна проблема — отсутствие актуальности знаний: LLM не имеют прямого доступа к реальному времени и не всегда учитывают новые данные после момента своего обучения. Эти проблемы требуют разработки механизмов фильтрации и постобработки.

5 Метрики оценки качества и точности

Для объективной оценки качества и точности ответов чат-ботов применяются различные метрики. Наиболее распространёнными являются автоматические лексические метрики, такие как BLEU [3], ROUGE [4] и METEOR [5], которые измеряют степень совпадения сгенерированного текста с эталонным по количеству общих слов и фраз. Однако такие метрики не всегда способны точно отражать смысловую близость, особенно если текст содержит переформулированные или синонимичные выражения. Для более глубокой семантической оценки используется BERTScore [6, 7], основанный на сравнении контекстных эмбеддингов предложений с помощью предобученной модели BERT. В отличие от лексических метрик, BERTScore учитывает смысловую близость слов и фраз, что делает его полезным дополнением к BLEU и ROUGE.

Для оценки связности и осмысленности текста также применяется метрика perplexity, показывающая уверенность модели в собственных предсказаниях [8, 9, 10, 11]. Помимо автоматических методов, важную роль играют человеко-ориентированные подходы — экспертная разметка и опросы пользователей, которые оценивают такие параметры, как релевантность, полнота, связность и стиль. Совмещение лексических, семантических и экспертных метрик позволяет наиболее объективно измерить качество работы чат-бота и выявить направления для улучшения.

В последние годы в исследовательской практике активно развивается подход LLM-as-a-Judge (“большая языковая модель в роли судьи”) [12, 13, 14, 15]. Он заключается в использовании современных больших языковых моделей, таких как GPT-4, Claude, Gemini или Llama 3, в качестве автоматизированных экспертов, которые оценивают качество ответов других моделей. Этот метод призван сократить зависимость от человеческих аннотаторов, повысить воспроизводимость и обеспечить масштабируемость оценки. В его основе лежит идея о том, что сама языковая модель может выполнять роль судьи, если ей предоставить детальные инструкции по критериям анализа. Модель получает промпт с описанием аспектов, подлежащих оценке, например релевантности, точности, логической связности или стилистической адекватности, и на его основе выносит суждение о качестве текста. Такая оценка может быть как сравнительной, когда модель сопоставляет два ответа на один запрос и выбирает лучший (pairwise comparison), так и абсолютной, когда каждому ответу присваивается числовая оценка по определённой шкале (absolute scoring). В более продвинутых вариантах, например при использовании chain-of-thought judging, модель не только выносит вердикт, но и объясняет ход своего рассуждения, что повышает прозрачность процесса и доверие к результату.

Преимущество подхода LLM-as-a-Judge заключается в высокой корреляции его результатов с человеческими оценками. Исследования OpenAI, Anthropic и Stanford HELM показывают, что современные крупные языковые модели способны демонстрировать близкие к экспертным уровни согласованности при анализе релевантности, глубины и логичности ответов. При этом модели учитывают не только лексическое совпадение, но и смысловую связность, аргументационную структуру и общий контекст диалога, что делает этот метод более гибким и адаптивным по сравнению с традиционными метриками. Он также обеспечивает масштабируемость: одна модель может последовательно оценить тысячи примеров, сохраняя единообразие критериев и устраняя фактор человеческой усталости или субъективности [16, 17, 18, 19, 20].

Тем не менее подход LLM-as-a-Judge имеет и свои ограничения. Главным риском является возможность предвзятости, особенно если оценку выполняет модель того же семейства, что и оцениваемый чат-бот. Кроме того, результаты могут зависеть от формулировки инструкции, а незначительные изменения промпта иногда приводят к изменению оценок. Поэтому современные исследования рекомендуют комбинировать данный метод с человеческой валидацией или перекрёстным судейством, при котором несколько разных LLM оценивают одни и те же ответы, а результаты усредняются для снижения смещения. Таким образом, использование LLM-as-a-Judge не заменяет, а дополняет существующие подходы, создавая более надёжную и сбалансированную систему оценки [21, 22, 23, 24, 25].

В совокупности с лексическими, семантическими и экспертными метриками подход LLM-as-a-Judge формирует основу гибридной стратегии оценки качества чат-ботов. Он объединяет аналитическую точность автоматических методов с контекстной чувствительностью и интерпретативной гибкостью человеческих оценок, что позволяет получить более комплексное и объективное представление о работе современных языковых моделей.

Заключение

В рамках данной работы проведён теоретический анализ особенностей функционирования чат-ботов на базе больших языковых моделей, что позволило выявить ключевые аспекты, влияющие на точность и качество их ответов. Исследование включает обзор истории развития чат-ботов, анализ принципов работы больших языковых моделей, основанных на архитектуре трансформеров, а также изучение проблем, связанных с точностью ответов, таких как галлюцинации, ограничения актуальности данных и поддержание связности диалогов.

На основе проведённого анализа установлено, что большие языковые модели, благодаря архитектуре трансформеров и механизмам внимания, обеспечивают высокую связность, логичность и грамматическую корректность генерируемых текстов. Однако их эффективность остаётся ограниченной проблемами генерации недостоверной информации, отсутствием доступа к данным в реальном времени и трудностями в поддержании контекста при длительных взаимодействиях.

Рассмотренные метрики оценки качества, включая BLEU, ROUGE, METEOR и BERTScore, позволяют объективно измерять лексическую и семантическую точность ответов, однако не всегда адекватно отражают смысловую глубину и прагматическую релевантность высказываний. В связи с этим особое значение приобретают человеко-ориентированные подходы и современные методы автоматизированной экспертной оценки, в частности концепция LLM-as-a-Judge, предполагающая использование больших языковых моделей в роли независимых судей. Этот подход обеспечивает более контекстно-чувствительную и интерпретативную оценку качества, а также демонстрирует высокую корреляцию с результатами экспертной разметки. Совмещение традиционных метрик с оценками, полученными с помощью LLM-as-a-Judge, формирует гибридную систему анализа, способную учитывать как формальные, так и содержательные характеристики ответов моделей.

Результаты проведённого исследования создают основу для дальнейших работ, направленных на повышение точности и надёжности чат-ботов. Перспективные направления включают разработку методов минимизации галлюцинаций, интеграцию актуальных данных через подключение к внешним источникам информации, а также совершенствование алгоритмов удержания контекста в длительных диалогах. Отдельного внимания заслуживает дальнейшее развитие систем автоматической оценки, основанных на LLM-as-a-Judge, и их комбинация с человеко-ориентированными методами, что позволит выработать более объективные, масштабируемые и интерпретируемые подходы к оценке качества генеративных моделей.

Список литературы

О себе Реферат Научные труды Индивидуальный раздел