IRSTI 28.23.11

Модели генерации текста для перефразирования на казахском языке

А.М. Кассенхан*1, Н.К. Муказанов*2, С. Нуралыкизы*3, З.Б. Калпеева*4

*1 доцент, Сатбаевский университет, a.kassenkhan@satbayev.university

*2 доцент, Сатбаевский университет, n.mukazhanov@satbayev.university

*3 старший преподаватель, магистр технических наук, Сатбаевский университет, s.nuralykyzy@satbayev.university

*4 доцент, Сатбаевский университет, z.kalpeyeva@satbayev.university

Кассенхан А.М., Муказанов Н.К., Нуралыкизы С., Калпеева З.Б. Модели генерации текста для перефразирования на казахском языке. В статье анализируется эффективность диффузионных моделей и трансформеров в генерации текста, в частности перефразов, для казахского языка. Исследование комплексно охватывает адаптацию моделей к контексту казахского языка, создание специализированных инструментов токенизации, перевод и подготовку наборов данных для эффективного обучения. Выявлены сильные и слабые стороны каждого типа модели, определены направления будущих исследований для повышения беглости и точности автоматизированной генерации текста на казахском языке.

Ключевые слова: модели диффузии, модели трансформеров, машинное обучение, НЛП, перефразирование, казахский язык.

Введение

Традиционно фреймворки машинного обучения для задач на естественном языке были ориентированы на языки с обширными ресурсами, такие как английский. Тем не менее, необходимость адаптировать эти сложные фреймворки под языки с меньшими ресурсами становится всё более важной для расширения охватов технологий NLP. Хотя были предприняты инициативы по модификации генеративных предварительно обученных моделей для языков с ограниченными ресурсами, исследования по адаптации этих моделей для казахского языка, особенно для генерации текста, остаются скудными. Применение унифицированной модели для оценки качества машинного перевода в различных языковых парах привело к продемонстрировала масштабируемость этого подхода [1]. Тем не менее, её практическая эффективность и гибкость адаптации к новым языковым контекстам, особенно для языка с такими ограниченными ресурсами, как казахский, продолжают вызывать значительные вопросы.

Данное исследование применяет диффузионные модели и трансформеры для задачи генерации и перефразирования текста на казахском языке, в отличие от другого исследования [2], которое использует онтологии и деревья разбора для классификации предложений. Оба направления сосредоточены на расширении ресурсов НЛП для казахского языка. Однако различие заключается в подходах: поскольку исследования ориентированы на создание нового текста, а сравнительное исследование - на анализе и понимании существующих предложений.

В данной статье цель - преодолеть этот разрыв, исследуя адаптацию двух современных генеративных моделей - диффузионные модели и трансформеры - для генерации текста на казахском языке. Диффузионные модели, такие как Denoise Diffusion Probabilistic Models, показали многообещающие результаты в генерации высококачественного и разнообразного текста для английского языка [2]. Исследование вносит ценный вклад в область обработки естественного языка для казахского и турецкого языков, предлагая инструменты для определения грамматических категорий. Его сильные стороны заключаются в использовании алгоритмов машинного обучения и обширных наборов данных, которые уравновешиваются сложностью обработки языка и потенциальными ограничениями в применимости алгоритмов [3].

Аналогично, предварительно обученные трансформаторы, тонко настроенные на задачах на последующих этапах, доминировали в таблицах лидеров по различным бенчмаркам NLP [4]. Хотя некоторые работы по перефразированию наборов данных были выполнены [5]. Исследование сосредоточено на фундаментальном аспекте машинного перевода на основе выборок: выявлении степени сходства между предложениями. Это включает выравнивание входного предложения с соответствующим примером из базы данных, выбор сегментов этого предложения и последующее их корректирование или перефразирование для получения нужного перевода [6].

Рассматриваемые статьи представляют разработку новых лингвистических и алгоритмических решений для технологий информационного поиска в поисковых системах с учётом синтаксиса и элементов семантики, включая тюркские тексты [7]. Документ содержит подробное описание метода резюмирования казахских текстов [8], однако эти исследования не решают проблему, которую мы рассматриваем. Кроме того, ведутся попытки определить семантически близкие слова в казахском языке [9], а также некоторые первоначальные работы по генерации казахского текста с использованием генеративных заранее обученных трансформаторов, а также эмпирическую оценку моделей генерации текста для казахского языка, характеризующихся ограниченными ресурсами и сложной морфологией [10]. В исследовании рассматривались грамматические особенности казахского языка [11]. Однако ни одна из этих работ не решает всесторонне проблемы генерации текста на казахском языке - мало ресурсном, морфологически богатом тюркском языке.

Мы подробно описываем техники кастомизации, такие как разработка специализированных токенайзеров и перевод наборов данных для согласования этих моделей с лингвистическими тонкостями казахского языка. С помощью тщательных экспериментов мы сравниваем преимущества и ограничения диффузионных моделей по сравнению с трансформерами для устойчивой эволюции поколения казахского текста. Наш основной вклад - продвижение передовых генеративных архитектур с конкретными потребностями казахского языка. Результаты станут ориентиром для будущих достижений в области НЛП в аналогичных условиях с ограниченными ресурсами. Более широкие последствия включают развитие возможностей генерации текста для малоизученных языков и выделение аспектов для разработки многоязычных моделей.

Материалы и методы

Учитывая отсутствие существующих моделей и предыдущие работы по теме перефразирования текста, мы решили заняться этим проектом как молодые исследователи в этой области [2]. Наша цель заключалась в изучении технологий и оценке осуществимости их внедрения, с целью создания модели, способной решать задачи, связанные с текстовым перефразированием. Это решение было мотивировано признанием исследовательского пробела и потенциалом внести новые инсайты и достижения в области моделей перефразирования текста. Наши исследования стали пионерами в согласовании передовых технологий с конкретными потребностями казахского языка, способствуя дискурсу машинного обучения на менее изученных языках.

Использование диффузионных моделей и трансформаторов имеет решающее значение для оценки эффективности методов в взаимодействии с наиболее выгодным подходом. Наши выбранные модели, Shark-NLP/DiffuSeq и chatgpt_paraphraser_on_T5_base, выходят за рамки простого перефразирования, демонстрируя полезность в суммировании текста и более точном переводе на различные языки, особенно используя T5. Многогранные преимущества использования перефразирования включают улучшение понимания, ясность, упрощение, включение различных стилей, адаптацию к разным аудиториям, улучшение языка, резюме, предотвращение повторения и бесшовную интеграцию цитат.

DIFFUSEQ модель

DIFFUSEQ, адаптированный для SEQ2SEQ задач, использует диффузию для повышения качества и разнообразия генерации. Обладая алгоритмом декодирования минимального риска Байеса, он превосходит своих аналогов по качеству генерации текста и разнообразие. Теоретические связи с моделями AR и NAR делают DIFFUSEQ надёжным расширением итеративных моделей NAR. Эмпирические результаты подчёркивают его эффективность, отмечая значительный прогресс в SEQ2SEQ обучении.

В частности, наши результаты показывают стабильное улучшение производительности с более крупными моделями, что соответствует тенденции более доступного и мощного оборудования. Однако существуют ситуации, такие как вывод со стороны клиента или федеративное обучение, где меньшие модели оказываются выгодными. Трансферное обучение становится ценным инструментом для достижения оптимальной производительности в задачах с ограниченными ресурсами, выступая за исследования методов обеспечения надёжной производительности с использованием экономичных моделей [14].

Проблемы токенизации

Последующее исследование по английским наборам данных подняло критический вопрос об эффективности. Shark-NLP/DiffuSeq, QPP с всего лишь 144 000 текстовых строк для перефразирования [14], и chatgpt_paraphraser_on_T5_base, имеющий более 6 миллионов строк для одной задачи [15], продемонстрировали компетентность. Важно, что диффузионные модели демонстрировали оптимизацию, требуя меньше данных для эффективной работы. Переходя к оценке на казахстанском наборе данных, обе модели дали неудовлетворительные результаты. Проблемы токенизации, специфичные для казахского языка, привели к потере эффективности и семантического значения исходных предложений.

Генерируемый результат проявил неточности не только из-за неправильно выбранного токенайзера, но и из-за лингвистических особенностей, включая следующие факторы:

  • Морфологические характеристики: сложная структура слова. Казахский язык характеризуется богатой морфологией, включающей аффиксы (префиксы, суффиксы) и флексионные изменения.
  • Склонение и спряжение: Казахский язык использует систему склонения и спряжения, что усложняет извлечение корневых форм и их соответствующих форм в предложении.
  • Словообразование: Трудности при определении границ слов. Некоторые казахские слова могут быть сложными и содержать множество лексем.
  • Лексические характеристики: Синонимия и омонимия: Казахский может содержать слова с богатыми семантическими нюансами, синонимией или омонимией.
  • Этнические и культурные особенности: Казахский язык может включать термины и выражения, уникальные для культуры и истории Казахстана.
  • Семантические изменения: Некоторые казахские слова могут иметь несколько значений в зависимости от контекста.
  • Грамматические характеристики: порядок слов в казахском языке может быть свободным, и крайне важно сохранять синтаксическую структуру при перефразировании.

Разработка пользовательского токенайзера

Осознав недостатки существующих токенизаторов для казахского языка, мы начали создавать индивидуальный токенайзер. Дизайн нашего токенайзера был вдохновлён базовыми принципами токенайзера Sentencepiece [6], известного своим мастерством работы с широким спектром языков. Опираясь на базовые концепции Sentencepiece и включая специфические адаптации для казахского, мы создали токенайзер, который является одновременно эффективным и лингвистически подкованным.

Понимая более широкие последствия нашей работы, мы сделали наш индивидуальный казахский токенайзер доступным для широкой публики через Hugging Face model hub.

Обучение моделей

Наше предварительное обучение проходило на Google Colab Pro, используя вычислительные возможности видеокарты V100 с 16 видеопамятью. Для этого этапа, который использовал 140k строковый набор данных, выбранные параметры были следующими: размер партии (bsz): 22, эпохи: 3, продолжительность обучения: примерно 2 часа.

Потери в обучении модели rut5-multitask

Рисунок 1 — Потери в обучении модели «rut5-multitask»

С приобретением более крупного набора данных из 6 миллионов строк возникла очевидная необходимость в расширенных вычислительных ресурсах. Поэтому мы перенесли наш тренировочный режим на сервер, оснащённый двумя GPU, каждая из которых имеет 24 видеопамять. Параметры, скорректированные для этого обширного набора данных, были следующими: размер партии (bsz): 64, эпохи: 2 (прогнозируемые), продолжительность обучения: оценивается около 30 часов.

Метрики оценки

Для количественной оценки эффективности нашей модели мы использовали три различных метрики сходства: сходство по косинусу, сходство по Жаккару и сходство по ФаззиВуззи. Каждая метрика была выбрана для обеспечения многогранного понимания того, как перефразированный контент соответствует оригиналу.

Косинусное сходство между исходными предложениями и ответами

Рисунок 2 — Косинусное сходство между исходными предложениями и ответами, сгенерированными моделью

Сходство Жаккара между исходными предложениями и ответами

Рисунок 3 — Сходство Жаккара между исходными предложениями и ответами, сгенерированными моделью

Сходство FuzzyWuzzy между исходными предложениями и ответами

Рисунок 4 — Сходство FuzzyWuzzy между исходными предложениями и ответами, сгенерированными моделью

Результаты и обсуждение

Для нашей модели перефразирования несколько гиперпараметров были тщательно настроены для оптимизации качества выхода:

  • num_beams (5) - поиск по лучу для исследования нескольких возможных выходных последовательностей
  • num_beam_groups (5) - разделение балок на группы для диверсификации результатов
  • num_return_sequences (5) - количество возвращаемых последовательностей для каждого входа
  • repetition_penalty (10.0) - штраф за повторяющиеся слова в генерируемом выходе
  • diversity_penalty (3.0) - стимулирование производства разнообразных токенов
  • no_repeat_ngram_size (2) - предотвращение повторения биграмм в выходе
  • температура (0.7) - коэффициент масштабирования для корректировки распределения токенов
  • max_length (128) - максимальное количество токенов в выходной последовательности

В стремлении к дальнейшему совершенствованию наших навыков перефразирования мы обратили внимание на модель «rut5 - многозадачность». Во время обучения мы подвергли модель оценке с использованием различных казахских предложений, чтобы определить её способность генерировать подходящие перефразы.

Таблица 1 — Сравнительный анализ оригинальных предложений, референсных перефраз и результатов моделей

Источник Цель Ответ
Консервативные коммунисты В блоке было 239 мест; Демократический блок, ставший национальным советом, имел 125 депутатов. Консервативная коммунистическая партия Группа имела 239 мест, а Национальный совет, ранее известный как Демократический блок, - 125 представителей. Консервативная коммунистическая партия Маг Блок выиграл Индию с 239 местами; Национальные солдаты смогут победить зеркало сицилийских демократий в 2011 году - 125 депутатов в мировой команде Order o Methods.
Это история грузинской политики Многие пришли к выводу, что независимость лучше, чем продолжение советского режима. В этом случае Грегори... Политика Зизии радикализирована, и многие считают, что независимость - лучший вариант, чем оставаться у власти в советскую эпоху. Это происходит в мире Джорджии... Справедливости ради, большинство членов совета вместе с аборигенным советом могут предложить концепцию независимости как единой цели.

Вершина наших результатов проявилась благодаря использованию конечного токенайзера, как подробно описано в повествовании этого исследования. Внутренняя согласованность, наблюдаемая в результатах моделей с одинаковыми наборами данных, дополнительно подчёркивает воспроизводимость и стабильность наших результатов.

Заключение

В заключение, наши исследовательские усилия были сосредоточены на разработке и адаптации моделей машинного обучения для перефразирования на казахском языке. Благодаря тщательному изучению различных моделей и наборов данных мы достигли нашей основной цели - создать модель, умеющую перефразировать предложения. Наши результаты подчёркивают адаптивность таких моделей к менее популярным языкам, что здесь иллюстрирует казахский, а также потенциальную демократизацию передовых методов обработки естественного языка.

Это исследование, проведённое группой студентов последнего курса бакалавриата, демонстрирует возможность выполнения сложных задач по НЛП с ограниченными ресурсами. Достигнутые успехи в адаптации моделей к казахскому языку подчеркивают потенциальное влияние аналогичных усилий в лингвистически разнообразных контекстах.

Наше исследование погрузилось в область машинного обучения для перефразирования на казахском языке, используя два полуавтоматических алгоритма перевода - QPP и chat_gpt_paraphraser_T5. Обе модели продемонстрировали достойные результаты в задаче перефразирования, что открыло путь к эффективной адаптации к различным языкам, выходящим за рамки английского.

Литература

  1. Томпсон Б., Пост М. Автоматическая оценка машинного перевода на многих языках с помощью нулевого перефразирования // Конференция по эмпирическим методам обработки естественного языка. - 2020. - С. 90-121.
  2. Елибаева Г. и др. Прикладная онтология для автоматической классификации простых предложений казахского языка // Международная конференция по компьютерным наукам и инженерии. - 2020. - С. 13-18.
  3. Еримбетова А. и др. Определение грамматических категорий для турецкого и казахского языков на основе алгоритмов машинного обучения // Восточно-европейский журнал предпринимательских технологий. - 2021. - Т. 5(2). - С. 113.
  4. Лу X.-Q. и др. Модель сходства предложений и наиболее похожий алгоритм поиска предложений // Журнал Северо-Восточного университета. - 2003. - Т. 24(6). - С. 531-534.
  5. Лейппольд М. Взгляд на настроения: Атака финансовых настроений с помощью GPT-3 // Финансовые исследовательские письма. - 2023. - Т. 55. - Статья 103957.
  6. Каманур У. и др. Исследование и использование методов определения сходства предложений казахского языка // Международная симпозиум по обработке естественного языка. - 2016. - С. 14-17.
  7. Еримбетова А.С. и др. Создание инструментов и алгоритмов для оценки релевантности документов // Российско-Тихоокеанская конференция по компьютерным технологиям. - 2018.
  8. Жабаев Т., Тукеев У. Разработка технологий суммирования казахского текста // Международный журнал продвинутых компьютерных наук и приложений. - 2021. - Т. 12(9). - С. 111-116.
  9. Аязбаев Д. и др. Определение семантически близких слов казахского языка с помощью распределённой системы Apache Spark // Большие данные и когнитивные вычисления. - 2023. - Т. 7(4). - С. 2-13.
  10. Tolegen G. et al. Generative Pre-Trained Transformer для задач по генерации текста на казахском языке // Международный азиатский семинар по задачам оптимизации сложных систем. - 2023. - С. 1-5.
  11. Зура Д., Дойл У. Дж. Грамматика казахского. Дарем: Университет Дьюка. - 2018. - 69 стр.
  12. Касекеева А. Б. и др. Связывайте грамматику и формальный анализ перефразированных предложений на естественном языке // Журнал теоретических и прикладных информационных технологий. - 2020. - Т. 98(10). - С. 1724-1736.
  13. Сизых О. В. и др. Проблемы и литературные персонажи в мировой прозе XX-XXI веков // Индийский журнал науки и технологий. - 2016. - Т. 9(20). - С. 1-7.
  14. Гонг С. и др. DiffuSeq-v2: Мосты дискретных и непрерывных текстовых пространств для ускоренных моделей диффузии Seq2Seq // Сингапур. - 2023. - С. 9868-9875.
  15. Сюэ Л. и др. mT5: Массово-многоязычный предварительно обученный преобразователь текста в текст. - 2021. - С. 483-498.

Кассенхан А.М., Муказанов Н.К., Нуралыкизы С., Калпеева З.Б. Модели генерации текста для перефразирования на казахском языке. В статье анализируется эффективность диффузионных моделей и трансформеров в генерации текста, в частности перефразов, для казахского языка. Исследование комплексно охватывает адаптацию моделей к контексту казахского языка, создание специализированных инструментов токенизации, перевод и подготовку наборов данных для эффективного обучения. Выявлены сильные и слабые стороны каждого типа модели, определены направления будущих исследований для повышения беглости и точности автоматизированной генерации текста на казахском языке.

Ключевые слова: модели диффузии, модели трансформеров, машинное обучение, НЛП, перефразирование, казахский язык.