Реферат по теме выпускной работы
Содержание
Введение
В условиях стремительного развития технологий искусственного интеллекта чат-боты на базе больших языковых моделей (LLM) становятся ключевым инструментом для автоматизации взаимодействия с пользователями в таких сферах, как клиентская поддержка, образование и электронная коммерция. Современные LLM, основанные на архитектуре трансформеров, демонстрируют высокую способность генерировать связные и грамматически корректные ответы. Однако их применение сопряжено с рядом проблем, включая генерацию недостоверной информации (галлюцинации), ограничения в учете актуальных данных и сложности в поддержании связности при длительных диалогах. Эти факторы снижают доверие пользователей и ограничивают эффективность чат-ботов в критически важных сценариях. Теоретический анализ особенностей функционирования чат-ботов на базе LLM, включая их архитектуру, механизмы работы и проблемы точности, является актуальным направлением, способствующим выявлению путей их оптимизации и повышению качества диалоговых систем.
Задачи исследования:
- изучение теоретических основ функционирования чат-ботов на базе больших языковых моделей, включая историю их развития и архитектуру трансформеров;
- анализ принципов работы LLM, включая этапы генерации ответов и механизмы внимания;
- исследование проблем точности и качества ответов, таких как галлюцинации, ограничения актуальности данных и связность диалогов;
- обзор метрик оценки качества ответов, таких как BLEU, ROUGE, METEOR и BERTScore, и их применимости к чат-ботам.
1 История и развитие технологий чат-ботов
Чат-боты представляют собой программные системы, которые имитируют человеческий диалог, взаимодействуя с пользователями через текстовый или голосовой интерфейс. Первые чат-боты появились ещё в 1960-х годах: одним из самых известных ранних примеров является программа Элиза (1966), разработанная Джозефом Вейценбаумом в MIT. Элиза имитировала работу психотерапевта, анализируя ключевые слова в репликах пользователя и подставляя их в шаблонные фразы.
В 1990-х и начале 2000-х годов развитие чат-ботов шло в русле скриптовых систем с фиксированными правилами. Эти боты применялись в основном для автоматизации клиентской поддержки и ответов на часто задаваемые вопросы. С развитием технологий машинного обучения и обработкой естественного языка (NLP) появились чат-боты, которые могли использовать статистические методы и простые модели для распознавания намерений пользователей.
Настоящий прорыв в развитии чат-ботов произошёл с появлением глубокого обучения и больших языковых моделей (LLM). Появление архитектуры трансформеров, предложенной в работе «Attention Is All You Need» [1], стало ключевым этапом, позволившим обрабатывать большие объёмы текста и генерировать осмысленные и последовательные ответы. Сегодня чат-боты на базе LLM, такие как GPT (Generative Pre-trained Transformer), используются в различных сферах: от персональных ассистентов до корпоративных решений и образовательных платформ.
2 Принципы работы LLM в генерации ответов
Большие языковые модели (LLM) — это модели машинного обучения, обученные на огромных корпусах текстов для предсказания следующего слова в последовательности. Основой их функционирования является архитектура трансформеров, которая позволяет обрабатывать последовательности слов параллельно, учитывая контекст всего текста.
Генерация ответов происходит в несколько этапов:
- Токенизация: исходный текст разбивается на токены (слова, части слов).
- Векторизация: токены преобразуются в числовые представления (эмбеддинги).
- Обработка: трансформер с помощью механизмов внимания (attention) взвешивает влияние каждого токена на другие.
- Декодирование: модель предсказывает вероятностное распределение для следующего токена и выбирает наиболее вероятный вариант или вариант с учётом заданной температуры и других параметров генерации.
LLM работают по принципу автодополнения: на каждом шаге они выбирают наиболее вероятное продолжение текста. Это позволяет им генерировать связные и грамматически корректные ответы, но создаёт и риски генерации неточных или неуместных данных, так как модель опирается на вероятностные связи в обучающих данных.
3 Архитектуры больших языковых моделей
Современные большие языковые модели основаны на архитектуре трансформера, предложенной Vaswani и соавт. в 2017 году в работе «Attention Is All You Need». Ключевая особенность трансформера заключается в том, что он полностью отказался от рекуррентных и сверточных структур, заменив их механизмом многоголового внимания (Multi-Head Attention). Диаграмма Transformer модели представлена на рисунке 1.
Кодировщик, расположенный в левой части схемы, отвечает за обработку входного предложения (Source Sentence). Он состоит из стека из N идентичных слоёв, каждый из которых включает механизм многоголового внимания (Multi-Head Attention) и полносвязную нейронную сеть (Feed Forward). Для сохранения информации о порядке слов к входным эмбеддингам добавляется позиционное кодирование.
Декодировщик, представленный в правой части диаграммы, генерирует выходное предложение (Output Sentence). Как и кодировщик, он состоит из стека из N слоёв, но имеет дополнительную особенность — механизм маскированного многоголового внимания (Masked Multi-Head Attention), который предотвращает использование информации о будущих токенах при генерации текущего. Кроме того, в декодировщике используется обычный механизм многоголового внимания для взаимодействия с выходными данными кодировщика.
Механизм Attention (Scaled Dot-Product Attention) — это основа, на которой построен Transformer. Он позволяет модели определять, какие слова во входной последовательности важны для каждого конкретного слова при обработке текста. Механизм Attention представлен на рисунке 2.
Принцип работы можно описать так: каждое слово сначала преобразуется в три вектора — запрос (Query), ключ (Key) и значение (Value). Для вычисления внимания используется скалярное произведение запросов и ключей, чтобы определить, насколько слова взаимосвязаны. Итоговый результат — взвешенная сумма значений.
где:
- Q — матрица запросов;
- K — матрица ключей;
- V — матрица значений;
- dk — размерность ключей (нужна для масштабирования, чтобы значения не становились слишком большими);
- softmax применяется построчно, чтобы получить веса, суммирующиеся в 1.
Механизм Multi-Head Attention — это расширение обычного внимания. Его ключевая идея в том, что модель может параллельно «смотреть» на текст под разными углами. Вместо одного набора Q,K,V используются несколько, и каждая голова внимания изучает свои шаблоны взаимосвязей между словами.
где:
- h — число голов внимания;
- обучаемые матрицы проекций для каждой головы;
- матрица, объединяющая выходы всех голов в единый вектор. Multi-Head Attention позволяет эффективно учитывать разные аспекты взаимосвязей слов в предложении. Благодаря этому Transformer может глубже анализировать структуру языка и учитывать сложный контекст.
4 Проблемы точности и качества ответов
Несмотря на впечатляющие возможности больших языковых моделей, при их использовании возникают серьёзные проблемы, связанные с точностью и качеством генерируемых ответов. Во-первых, модели могут порождать «галлюцинации» — правдоподобно звучащую, но фактически неверную информацию [2]. Во-вторых, модели склонны повторять или искажать контекст, что особенно критично при длительных диалогах. Ещё одна проблема — отсутствие актуальности знаний: LLM не имеют прямого доступа к реальному времени и не всегда учитывают новые данные после момента своего обучения. Эти проблемы требуют разработки механизмов фильтрации и постобработки.
5 Метрики оценки качества и точности
Для объективной оценки качества и точности ответов чат-ботов применяются различные метрики. Наиболее распространёнными являются автоматические лексические метрики, такие как BLEU [3], ROUGE [4] и METEOR [5], которые измеряют степень совпадения сгенерированного текста с эталонным по количеству общих слов и фраз. Однако такие метрики не всегда способны точно отражать смысловую близость, особенно если текст содержит переформулированные или синонимичные выражения. Для более глубокой семантической оценки используется BERTScore [6, 7], основанный на сравнении контекстных эмбеддингов предложений с помощью предобученной модели BERT. В отличие от лексических метрик, BERTScore учитывает смысловую близость слов и фраз, что делает его полезным дополнением к BLEU и ROUGE.
Для оценки связности и осмысленности текста также применяется метрика perplexity, показывающая уверенность модели в собственных предсказаниях [8, 9, 10, 11]. Помимо автоматических методов, важную роль играют человеко-ориентированные подходы — экспертная разметка и опросы пользователей, которые оценивают такие параметры, как релевантность, полнота, связность и стиль. Совмещение лексических, семантических и экспертных метрик позволяет наиболее объективно измерить качество работы чат-бота и выявить направления для улучшения.
В последние годы в исследовательской практике активно развивается подход LLM-as-a-Judge (“большая языковая модель в роли судьи”) [12, 13, 14, 15]. Он заключается в использовании современных больших языковых моделей, таких как GPT-4, Claude, Gemini или Llama 3, в качестве автоматизированных экспертов, которые оценивают качество ответов других моделей. Этот метод призван сократить зависимость от человеческих аннотаторов, повысить воспроизводимость и обеспечить масштабируемость оценки. В его основе лежит идея о том, что сама языковая модель может выполнять роль судьи, если ей предоставить детальные инструкции по критериям анализа. Модель получает промпт с описанием аспектов, подлежащих оценке, например релевантности, точности, логической связности или стилистической адекватности, и на его основе выносит суждение о качестве текста. Такая оценка может быть как сравнительной, когда модель сопоставляет два ответа на один запрос и выбирает лучший (pairwise comparison), так и абсолютной, когда каждому ответу присваивается числовая оценка по определённой шкале (absolute scoring). В более продвинутых вариантах, например при использовании chain-of-thought judging, модель не только выносит вердикт, но и объясняет ход своего рассуждения, что повышает прозрачность процесса и доверие к результату.
Преимущество подхода LLM-as-a-Judge заключается в высокой корреляции его результатов с человеческими оценками. Исследования OpenAI, Anthropic и Stanford HELM показывают, что современные крупные языковые модели способны демонстрировать близкие к экспертным уровни согласованности при анализе релевантности, глубины и логичности ответов. При этом модели учитывают не только лексическое совпадение, но и смысловую связность, аргументационную структуру и общий контекст диалога, что делает этот метод более гибким и адаптивным по сравнению с традиционными метриками. Он также обеспечивает масштабируемость: одна модель может последовательно оценить тысячи примеров, сохраняя единообразие критериев и устраняя фактор человеческой усталости или субъективности [16, 17, 18, 19, 20].
Тем не менее подход LLM-as-a-Judge имеет и свои ограничения. Главным риском является возможность предвзятости, особенно если оценку выполняет модель того же семейства, что и оцениваемый чат-бот. Кроме того, результаты могут зависеть от формулировки инструкции, а незначительные изменения промпта иногда приводят к изменению оценок. Поэтому современные исследования рекомендуют комбинировать данный метод с человеческой валидацией или перекрёстным судейством, при котором несколько разных LLM оценивают одни и те же ответы, а результаты усредняются для снижения смещения. Таким образом, использование LLM-as-a-Judge не заменяет, а дополняет существующие подходы, создавая более надёжную и сбалансированную систему оценки [21, 22, 23, 24, 25].
В совокупности с лексическими, семантическими и экспертными метриками подход LLM-as-a-Judge формирует основу гибридной стратегии оценки качества чат-ботов. Он объединяет аналитическую точность автоматических методов с контекстной чувствительностью и интерпретативной гибкостью человеческих оценок, что позволяет получить более комплексное и объективное представление о работе современных языковых моделей.
Заключение
В рамках данной работы проведён теоретический анализ особенностей функционирования чат-ботов на базе больших языковых моделей, что позволило выявить ключевые аспекты, влияющие на точность и качество их ответов. Исследование включает обзор истории развития чат-ботов, анализ принципов работы больших языковых моделей, основанных на архитектуре трансформеров, а также изучение проблем, связанных с точностью ответов, таких как галлюцинации, ограничения актуальности данных и поддержание связности диалогов.
На основе проведённого анализа установлено, что большие языковые модели, благодаря архитектуре трансформеров и механизмам внимания, обеспечивают высокую связность, логичность и грамматическую корректность генерируемых текстов. Однако их эффективность остаётся ограниченной проблемами генерации недостоверной информации, отсутствием доступа к данным в реальном времени и трудностями в поддержании контекста при длительных взаимодействиях.
Рассмотренные метрики оценки качества, включая BLEU, ROUGE, METEOR и BERTScore, позволяют объективно измерять лексическую и семантическую точность ответов, однако не всегда адекватно отражают смысловую глубину и прагматическую релевантность высказываний. В связи с этим особое значение приобретают человеко-ориентированные подходы и современные методы автоматизированной экспертной оценки, в частности концепция LLM-as-a-Judge, предполагающая использование больших языковых моделей в роли независимых судей. Этот подход обеспечивает более контекстно-чувствительную и интерпретативную оценку качества, а также демонстрирует высокую корреляцию с результатами экспертной разметки. Совмещение традиционных метрик с оценками, полученными с помощью LLM-as-a-Judge, формирует гибридную систему анализа, способную учитывать как формальные, так и содержательные характеристики ответов моделей.
Результаты проведённого исследования создают основу для дальнейших работ, направленных на повышение точности и надёжности чат-ботов. Перспективные направления включают разработку методов минимизации галлюцинаций, интеграцию актуальных данных через подключение к внешним источникам информации, а также совершенствование алгоритмов удержания контекста в длительных диалогах. Отдельного внимания заслуживает дальнейшее развитие систем автоматической оценки, основанных на LLM-as-a-Judge, и их комбинация с человеко-ориентированными методами, что позволит выработать более объективные, масштабируемые и интерпретируемые подходы к оценке качества генеративных моделей.
Список литературы
- Vaswani A., Shazeer N., Parmar N., Uszkoreit J., Jones L., Gomez A. N., Kaiser Ł., Polosukhin I. Attention Is All You Need // Advances in Neural Information Processing Systems : Proc. of the 31st Conf. on Neural Information Processing Systems (NeurIPS 2017), 4–9 Dec. 2017, Long Beach, USA. – Red Hook, NY : Curran Associates, Inc., 2017. – Vol. 30. – Pp. 5998–6008. – URL: https://arxiv.org/abs/1706.03762 (дата обращения: 04.07.2025).
- Ji Z., Lee N., Frieske R., Yu T., Su D., Xu Y., Ishii E., Bang Y., Madotto A., Fung P. A Survey of Hallucination in Natural Language Generation // ACM Computing Surveys. – 2023. – Vol. 55, No. 12. – P. 1–38. – DOI: 10.1145/3571730.
- Papineni K., Roukos S., Ward T., Zhu W. J. BLEU: a Method for Automatic Evaluation of Machine Translation // Proceedings of the 40th Annual Meeting of the Association for Computational Linguistics (ACL 2002), 6–12 July 2002, Philadelphia, USA. – Stroudsburg, PA : Association for Computational Linguistics, 2002. – Pp. 311–318.
- Lin Ch. ROUGE: A Package for Automatic Evaluation of Summaries. Text Summarization Branches Out, 2004, pp. 74–81.
- Banerjee S., Lavie Al. METEOR: An Automatic Metric for MT Evaluation with Improved Correlation with Human Judgments. Proceedings of the ACL Workshop on Intrinsic and Extrinsic Evaluation Measures for Machine Translation and/or Summarization, 2005, pp. 65–72.
- Бручес Е.П., Батурова Д.Т., Бондаренко И.Ю. BERTScore для русского языка. Труды ИСП РАН, том 37, вып. 3, 2025 г., стр. 147–158. DOI: 10.15514/ISPRAS–2025–37(3)–10.
- Tang, G. Improving BERTScore for Machine Translation Evaluation Through Contrastive Learning / G. Tang, O. Yousuf, Z. Jin // IEEE Access. – 2024. – Vol. 12. – P. 77739-77749. – DOI 10.1109/access.2024.3406993. – EDN RZEXPR.
- Ivry D. LLM Evaluation Frameworks, Metrics & Methods Explained [Электронный ресурс] // Qualifire. – Режим доступа: https://qualifire.ai/posts/llm-evaluation-frameworks-metrics-methods-explained. – Дата обращения: 09.10.2025.
- MacDonald J. LLM Evaluation: Frameworks, Metrics, and Best Practices [Электронный ресурс] // SuperAnnotate. – Режим доступа: https://www.superannotate.com/blog/llm-evaluation-guide. – Дата обращения: 09.10.2025.
- LLM Evaluation Metrics: Benchmarks, Protocols & Best Practices [Электронный ресурс] // DagsHub. – Режим доступа: https://dagshub.com/blog/llm-evaluation-metrics/. – Дата обращения: 09.10.2025.
- Bansal R. Perplexity Metric for LLM Evaluation [Электронный ресурс] // Analytics Vidhya. – Режим доступа: https://www.analyticsvidhya.com/blog/2025/04/perplexity-metric-for-llm-evaluation/. – Дата обращения: 09.10.2025.
- Jiang D., Li Y., Zhang G., Huang W., Lin B., Chen W. (2023) TIGERScore: Towards Building Explainable Metric for All Text Generation Tasks (online). Available at: https://arxiv.org/abs/2310.00752, accessed 28.10.2024
- Kim S., Shin J., Cho Y., Jang J., Longpre Sh., Lee H., Yun S., Shin S., Kim S., Thorne J., Seo M. (2023) Prometheus: Inducing Fine-grained Evaluation Capability in Language Models (online). Available at: https://arxiv.org/abs/2310.08491, 28.10.2024.
- Kim S., Suk J., Longpre Sh., Lin B., Shin J., Welleck S., Neubig G., Lee M., Lee K., Seo M. (2024) Prometheus 2: An Open Source Language Model Specialized in Evaluating Other Language Models (online). Available at: https://arxiv.org/abs/2405.01535, accessed 28.10.2024
- Xu W., Wang D., Pan L., Song Zh., Freitag M., Wang W., Li L. INSTRUCTSCORE: Towards Explainable Text Generation Evaluation with Automatic Feedback. Proceedings of the 2023 Conference on Empirical Methods in Natural Language Processing, 2023, pp. 5967–5994
- J. Gu, X. Jiang, Z. Shi, H. Tan, X. Zhai, C. Xu, W. Li, Y. Shen, S. Ma, H. Liu, et al., A survey on llm-as-a-judge, arXiv preprint arXiv:2411.15594 (2024)
- Kaiyom, F.; Ahmed, A.; Mai, Y.; Klyman, K.; Bommasani, R.; and Liang, P. 2024. HELM Safety: Towards Standardized Safety Evaluations of Language Models. Stanford Center for Research on Foundation Models.
- Lianmin Zheng, Wei-Lin Chiang, Ying Sheng, Siyuan Zhuang, Zhanghao Wu, Yonghao Zhuang, Zi Lin, Zhuohan Li, and others. Judging LLM-as-a-judge with MT-Bench and Chatbot Arena. 2023. arXiv:2306.05685.
- Yusuke Yamauchi, Taro Yano, and Masafumi Oyamada. An empirical study of llm-as-a-judge: How design choices impact evaluation reliability. arXiv preprint arXiv:2506.13639, 2025.
- LLMs-as-Judges: A Comprehensive Survey on LLM-based Evaluation Systems // arXiv preprint. — 2024. — arXiv:2412.05579v2. LLM-as-a-Judge vs Human Evaluation / Galileo AI // Technical Report. — San Francisco: Galileo AI, 2024. — 12 с.
- Limitations of the LLM-as-a-Judge Approach for Evaluating LLM Outputs in High-Stakes Domains // Proceedings of the ACM. — 2024. — Vol. 1, № 1. — DOI: 10.1145/3708359.3712091.
- Humans or LLMs as the Judge? A Study on Judgement Bias // Proceedings of the 2024 Conference on Empirical Methods in Natural Language Processing. — 2024. — P. 474–489.
- LLM Judges Are Unreliable / Center for an Informed Public // Technical Report. — Seattle: University of Washington, 2024. — 10 с.
- Wolfe, C. R. Using LLMs for Evaluation // AI Research Notes. — 2024. — № 3. — P. 1–8.
- Li, Junlong, et al. "Generative judge for evaluating alignment." arXiv preprint arXiv:2310.05470 (2023).