РАЗРАБОТКА МОДИФИКАЦИИ АЛГОРИТМА СИНТЕЗА РЕЧИ ПРИ ПОСТРОЕНИИ АВТОМАТИЗИРОВАННЫХ СИСТЕМ РАСПОЗНАВАНИЯ ЯЗЫКА ЖЕСТОВ

Авторы: Коптев С. А.1, Мартыненко Т. В.1, Стрельникова В. В.2
1Донецкий национальный технический университет, кафедра автоматизированных систем управления;
2ФГАОУ ВО «Севастопольский государственный университет»
E-mail: lectiem@gmail.com

Аннотация

Коптев С. А, Мартыненко Т. В., Стрельникова В.В. Разработка модификации алгоритма синтеза речи при построении автоматизированных систем распознавания языка жестов. Рассмотрены и проанализированы методы распознавания текста и синтеза в человекоподобную речь. Проведены эксперименты с современными архитектурами нейронных сетей Tacotron2 и Flowtron. Для оценки качества синтезируемой речи используется рейтинговая шкала MOS.

Annotation

Koptev S. A., Martynenko T. V., Strelnikova V. V. Development of a modification of the speech synthesis algorithm when building automated sign language recognition systems. Methods of text recognition and synthesis into human-like speech are considered and analyzed. Experiments have been carried out with modern neural network architectures Tacotron2 and Flowtron. The MOS rating scale is used to assess the quality of synthesized speech.

Введение

Современное общество максимально нацелено на продолжение развития и усиления аспектов психологической, правовой, информационной и технологической помощи людям с ограниченными возможностями. По данным всемирной организации здравоохранения (ВОЗ), более 5 % населения мира – 466 миллионов человек (432 миллиона взрослых людей и 34 миллиона детей) – страдают от инвалидизирующей потери слуха. В настоящее время существует большое количество специализированных учебных заведений и других объединений, позволяющих слабослышащим людям адаптироваться и полноценно социализироваться в окружающем мире. Одним из основных способов передачи информации для слабослышащих людей, является язык жестов.

Разработка автоматизированной системы для распознавания жестов - «перчатка» (АСУ «Перчатка»), является более удобным решением для распознавания жестов. Эксплуатация «перчатки» изначально интуитивно понятна человеку и проста в использовании, а полученный сигнал можно свободно передать на другое устройство для распознавания и интерпретации конкретного жеста. Для полноценного удобства пользователя, в результате работы АСУ «Перчатка» должны как генерироваться текст перевода с жестового языка, так и синтезироваться полноценный звуковой речевой сигнал.

Задача синтеза человеческой речи является одной из самых сложных и актуальных в области разработки автоматизированных и интеллектуальных систем. Следует отметить, что звук, который создают такие системы TTS (text–to–speech), не всегда приятен для слуха человека. На сегодняшний день только самые инновационные подходы вместе с современным аппаратным обеспечением, смогут позволить синтезировать речь, качество которой сможет конкурировать с живой человеческой.

Математическая постановка задачи синтеза речи

Синтезаторы речи позволяют учитывать введённый текст или некоторую последовательность лингвистических единиц Y, целевая речь X может быть получена: \[X = \text{argmax} P(X|Y, \theta);\] (1) где \(\hat{\theta}\) – параметр модели.

Чаще всего текст наперво передаётся в генератор акустических характеристик, а после уже в акустические характеристики передаются в нейронный вокодер. Для генератора акустических характеристик функция потерь обычно составляют потери L1 или L2. Эта функция накладывает ограничение на то, что входные данные должны быть гауссовскими или лапласовскими. Поскольку диапазон человеческого голоса составляет +300–3400 Гц, функция будет рассчитана на этот диапазон, данный диапазон используется в автоматизированных системах: \[\log s = a \log s_{птичок} + (1 - \alpha) \log s_{\text{сегнер}};\] (2) где \(\log s_{птичок}\) – это потеря диапазона человеческого голоса и \(\alpha\) – это скаляр, обычно он составляет около 0,5. Сама же акустическая характеристика чаще всего представляет собой спектрограмму. Эти функции фиксируют частотно-временную зависимость речевого сигнала, таким образом, достаточно генерировать интеллектуальные выходные данные с этими акустическими характеристиками. Функция стремится к уменьшению потери [3].

Для того чтобы определить, насколько хорошо звучит синтезируемая речь используется средняя оценка мнений (MOS) – это используемая мера для оценки качества видео, аудио и аудиовизуальных изображений. MOS выражается в виде единственного рационального числа, обычно используется диапазон от 1–5, где 1– самое низкое воспринимаемое качество, а 5– самое высокое. Так же присутствуют другие диапазоны, в зависимости от шкалы оценок, которая используется в тесте [7]. MOS рассчитывается как среднеарифметическое по отдельным оценкам, выполненным людьми для данного стимула в тесте субъектной оценки качества: \[MOS = \frac{\sum_{i=1}^{N} R_i}{N};\] (3) где R индивидуальные оценки данного стимула по N предмету.

Обычно для MOS определяют рейтинговую шкалу. В этом случае ранжирование элементов шкалы известно, а интервал – нет. Из этого получается, что математически неверно рассчитывать среднее значения по индивидуальным рейтингам, чтобы получить центральную тенденцию. Но на практике MOS считается приемлемой вычислительной системой. Непосредственное сравнение значения MOS, полученных в результате отдельных экспериментов, не имеет смысла, если только эти эксперименты не были специально разработаны для сравнения, и даже в этом случае данные следует подвергать статистическому анализу, чтобы гарантировать, что такое сравнение является достоверным [6, 7].

Разработка обобщенного алгоритма синтеза речи

Для того, чтобы текст был воспроизведён в звук, требуется провести множество операций над ним, а именно:

  1. Изначально на вход поступает текст без каких–либо обработок, но синтезатор должен понимать его.
  2. Для начала текст следует нормализовать, в тексте могут присутствовать специальные символы, различные формы и так далее. Изначально следует определить границы слов, знаки препинания, разделить текст на абзацы. Так же в этом блоке добавляем склонения предложения. Язык жестов не рассчитан работать со склонением, поэтому добавляется возможность склонения текста по времени и падежах. Развернутый блок лингвистической обработки представлен на рис. 2.
  3. Далее следует выставить правильно ударения в словах, это нужно для того, чтобы избежать проблемы с одинаковыми словами, но разными по смыслу, где смысл меняет от ударения.
  4. Для того, чтобы определить место паузы, не всегда могут помочь знаки препинания. Есть несколько способов решения этой проблемы: определить место паузы по правилам, определение места паузы при помощи полного синтаксического анализа предложений, определение места паузы при помощи статистических моделей, статистические методы, дополненные и ограниченные правилами.
  5. На текущем шаге производится определение интонационного типа синтаги и места фразового ударения.
  6. Выполнение построения сегментной транскрипции текстовых фрагментов.
  7. Задание физических параметров звуковых элементов.
  8. Выбор звуковых элементов из речевой базы синтезатора.
  9. Модификация речевого сигнала, если это необходимо.
Рисунок 1. Последовательность обработки текста

Рисунок 1. Последовательность обработки текста

Входной текст Нормализация текста Лингвистический анализ Снятие биографии Выделение синтагии и места паузы Определение типов интонации Транскрипции Вычисление параметров интонации Подбор звуковых элементов Модификация и звуковые эффекты Звук
Рисунок 2. Блок лингвистической обработки

Рисунок 2. Блок лингвистической обработки

Так же присутствует так называемая генеративная модель на основе потоков–flow–based. Эта модель используется в машинном обучении, она моделирует распределение вероятностей с помощью нормализующего потока. Поток представляет собой статистический метод, использующий закон вероятностей замены переменной для преобразования простого распределения в сложное.

Аналитический обзор методов синтеза речи

Методы преобразования текста в речь делятся на несколько типов: конкатенативная, параметрическая, на базе правил и нейронная. Параметрический метод синтеза требует щепетильный отбор исходных образцов. Конкатенативный метод требует хорошую базу данных коротких аудио–фрагментов. Технологии синтеза речи, основанные на нейронных сетях, позволяют подражать человеческому голосу, этот метод позволяет обучиться на данных, которые можно взять из открытых источников. Работа синтеза речи состоит из нескольких этапов: преобразования текста в слова, разбор фонетической транскрипции, преобразования текста в речь [5].

На текущем этапе мы будем использовать нейронные сети, это позволит подбирать слова, правильно их склонять, улучшить восприятия человека, за счёт добавления эмоционального окраски и ударений, что даст более правильно передать смысл предложения.

Синтез с помощью Tacotron2

Данная модель синтеза речи считается одной из лучших и имеет высокую оценку в MOS (Mean Opinion Score). Она позволяет синтезировать текст в почти неотличимый от человеческой речи. Данная архитектура объединяет в себе сразу две сети: Feature prediction net и NN–vocoder WaveNet [1].

Эта архитектура является представителем seq2seq. А значит в ней присутствует кодировщик, который создаёт внутреннее представление о входном сигнале, а также декатировщик, который позволяет нам превратить представление в спектрограмму. Так же есть элемент под названием PostNet, призванный улучшить качество спектрограммы, сгенерированную декодером.

Данная сеть следует структуре типа кодер–декодер, данная модель зарекомендовала себя в моделировании от последовательности к последовательности. Сам кодировщик состоит из трёх частей. Изначально проходит процесс изучения поступающего текста. После этого наступает этап прохода текста через свёрточную сеть. По окончанию этих этапов, результаты поглощаются двунаправленной рекуррентной нейронной сетью [1].

Декодер состоит из рекуррентной архитектуры, это значит, что на каждом шаге используются данные с предыдущих шагов. В текущей ситуации это будет один фрейм спектрограммы.

На каждом шаге декодер для формирования контекстного вектора и обновления веса использует: проекции предыдущих скрытых состояний, проекцию входных данных, аддитивные веса.

Алгоритм работы Tacotron2 заключается в несколько шагов:

  1. Входные данные декодера с предыдущего шага поступают в модуль PreNet, он представлен в виде двух слоёв по 256 нейронов. Выходные данные, которые получены в ходе работы подаются на вход в однонаправленную двухслойную LSMT–сеть, в который 1024 нейрона.
  2. Выходные данные LSMT–слоёв с контекстными векторами переходят в слой с 80 нейронами. Это является финальным слоем декодера и формирует спектрограмму фрейма за фреймом.
Рисунок 3. Архитектура сети Tacotron2.

Рисунок 3. Архитектура сети Tacotron2

Данный вариант спектров называет спектрограммой (рис. 4). По оси x расположена временная шкала в секундах, по оси y–чистота в герцах. Амплитуда спектра выделяется цветом, чем ярче точка, тем больше амплитуда. Амплитудный спектр, который взят с шкалы с определенным шагом и окном. Мел–спектрограммы вычисляются с помощью Фурье, размер кадра 50мс, скачка кадра в 12,5 мс и оконных функций. Проще говоря – это представление звуковой информации в виде спектрограмм. Этот подход позволят избавится от подробного анализа и может использоваться одной нейросетью, что позволяет нам извлечь представление, а затем преобразовать в плотную акустическую характеристику, которая после может быть преобразована в аудио [1].

Рисунок 4. Спектрограмма сети Tacotron2

Рисунок 4. Спектрограмма сети Tacotron2

Синтез с помощью модернизации Flowtron

Данная разработка является одной из новейших на текущее время по использованию Flow-based моделей, которые позволяют синтезировать TTS. Данная система основана на Tacotron2, своего рода обновление, но имеет большую вариативность работы с интонациями [1, 4].

Представляет собой авторсервисную генеративную модель, которая генерирует последовательность кадров мел–спектрограммы путем создания каждого кадра мел–спектрограммы на основе предыдущих кадров мел–спектрограммы. Это позволяет использовать нейронную сеть в качестве генеративной модели путем выборки из распределений. После обучения данной модели, она максимизирует правдоподобие данных.

Благодаря таким действиям у нас есть возможность менять спикера легко и просто, или делать вариации внутри какого–то спикера. Текущая модель принимает на вход последовательность кадров, потом выдаёт следующую спектрограмму, которая основывается только на предыдущей спектрограмме.

Шагом flow является affine coupling layer, который является типичным для построения обратимых нейронных сетей. Во время инференса процесс происходит наоборот — берётся случайный вектор из Z и протяжется через модель в обратном режиме [4].

Рисунок 5. Сеть Flowtron. Вложения текста и динамика соединяются по
        каналам

Рисунок 5. Сеть Flowtron. Вложения текста и динамика соединяются по каналам

Так же, как и в сети Tacotron2 используется библиотека librosa для выведения спектрограммы. Амплитуда спектра выделяется цветом, чем ярче точка, тем больше амплитуда.

Рисунок 6. Спектрограмма сети Flowtron

Рисунок 6. Спектрограмма сети Flowtron

Выводы

Рассмотрены и проанализированы существующие методы синтеза речи из текста. Приведены архитектуры современных нейронных сетей, генерирующих речь. Сеть Tacotron2 имеет естественно плавное звучание, широкий спектр интонаций, но требует больших вычислительных мощностей. Поскольку метод Flowtron взял за основу сеть Tacotron2, тоже присутствует вычислительная сложность, но перекрывает более яркий спектр эмоциональной окраске.

По уровню оценивания звукового качества синтезаторов обе сети стоят в верхней части между 3–4, где 3– восприятие речи с умеренным усилием, и наличием дефектов, а 4– свободное восприятие речи без усилий. Но всё же по оценке MOS Flowtron занимает позицию выше.

На данном этапе выполнена разработки системы выполнена эмуляция работы датчиков, проведён сравнительный анализ систем синтеза речи, выполнена преобразования текста в речь.

Литература

  1. Jonathan Shen, Ruoming Pang, Ron J. Weiss, Mike Schuster, Navdeep Jaitly, Zongheng Yang, Zhifeng Chen, Yu Zhang, Yuxuan Wang, RJ Skerry-Ryan, Rif A. Saurous, Yannis Agiomyrgiannakis, Yonghui Wu. Natural TTS Synthesis by Conditioning WaveNet on Mel Spectrogram Predictions. 2017 [Электронный ресурс] URL: https://arxiv.org/abs/1712.05884
  2. Рыбин С. В. СИНТЕЗ РЕЧИ Учебное пособие по дисциплине «Синтез речи». – СПб: Университет ИТМО, 2014. – 92 с.
  3. Remez, Robert E., et al. «Speech Perception without Traditional Speech Cues.» Science, vol. 212, no. 4497, 1981, pp. 947–950. JSTOR [Электронный ресурс] URL: www.jstor.org/stable/1685714
  4. Rafael Valle, Kevin Shih, Ryan Prenger, Bryan Catanzaro. Flowtron: an Autoregressive Flow-based Generative Network for Text-to-Speech Synthesis. 2020 [Электронный ресурс] URL: https://arxiv.org/abs/2005.05957
  5. Пугач, А. С. Сравнительный анализ методов синтеза речи / А. С. Пугач. — Текст: непосредственный // Молодой ученый. — 2016. — № 26 (130). — С. 154–156. — URL: https://moluch.ru/archive/130/36203/
  6. Сергеенко В.С., Баринов В.В., Сжатие данных, речи, звука и изображений в телекоммуникационных системах, 2009, ИП «РадиоСофт».
  7. Mean opinion score (MOS) revisited: methods and applications, limitations and alternatives [Электронный ресурс] URL: https://www.researchgate.net/publication/298090737