Назад в библиотеку

Разработка интеллектуального модуля по распознаванию мошеннических звонков на базе звуковых волн

Рыбка Н.С., Анохина И.Ю.

Донецкий национальный технический университет

Источник: Рыбка Н.С. Разработка интеллектуального модуля по распознаванию мошеннических звонков на базе звуковых волн / Н.С. Рыбка, И.Ю. Анохина // Материалы IX Всероссийской научно-технической конференции. — Донецк, ДонНТУ — 2024.

Введение

Качество итоговой системы напрямую зависит от объема размеченных данных, вычислительных мощностей для обработки аудио в реальном времени и детальной аналитики [1]. Человеческий фактор, усталость и необходимость параллельно отслеживать множество call-кампаний часто ведут к пропуску новых угроз и принятию субоптимальных решений при обновлении сигнатур.

Сфера телефонного мошенничества развивается стремительно, появляются новые технологии синтеза речи (Deepfake), методы маскировки голоса и автоматизации звонков. Это многократно увеличивает сложность и изощренность атак, требуя от защитных систем постоянной адаптации.

Эти вызовы создают устойчивую потребность в роботизированных, автоматизированных и масштабируемых системах для анализа звука, основанных на методах глубокого обучения. Подходы, использующие нейронные сети – это мощный инструмент, вдохновляемые принципами иерархического представления признаков.

Для достижения поставленной цели необходимо произвести обзор предметной области.

В работе были поставлены следующие задачи:

  1. Рассмотреть выборку слов и словосочетаний мошеннических фраз;
  2. Рассмотреть преобразование текстовой выборки в звуковую;
  3. Рассмотреть структуру выборки данных;
  4. Описать распознавание текста в аудио-сигналах.


Выборка слов и словосочетаний мошеннических фраз

Для распознавания мошеннических звонков была собрана выборка слов и словосочетаний, часто используемых мошенниками, в которой хранится от 1000 записей.

Выборка представляет собой корпус текстовых единиц, собранных и нормализованных для исследования речевых приёмов телефонного мошенничества; в её основе лежат как явно зафиксированные фразы, встречающиеся в официальных предупреждениях и разъяснениях ведомств (банковских служб, Центробанка, МВД, ФСБ, Следственного комитета и проч.), так и систематически сгенерированные вариации на основе характерных шаблонов социальной инженерии. Каждый элемент корпуса – это отдельное слово или словосочетание, отражающее конкретную коммуникативную стратегию злоумышленника: апелляцию к авторитету, создание искусственной срочности, просьбу назвать одноразовый код или реквизиты, инструкцию по установке приложения или переходу по ссылке, сигнал о блокировке или подозрительной операции, а также побуждение к переводу средств или передаче физического предмета курьеру [2]. Источники при сборе были использованы опосредованно: официальные публикации и предупреждения правоохранительных и финансовых учреждений служили основанием для выделения «ядра» фраз, после чего это ядро было дополнено продуктивными морфологических и синтаксическими вариациями с целью охвата типичных формулировок, которые мошенники применяют в реальных телефонных сценариях; при этом сохранены реальные формулировки вроде «сообщите код из СМС», «ваша карта заблокирована», «представитель службы безопасности банка», «переведите на защищённый счёт» и т.п., чтобы выборка отражала практические кейсы и позволяла изучать действительные паттерны.

Преобразование текстовой выборки и звуковую

Для реализации преобразования текстовой выборки в звуковую была использована платформа SteosVoice.

SteosVoice представляет собой систему синтеза речи, созданную на основе методов глубокого обучения и ориентированную на преобразование текстовой информации в акустический сигнал. Архитектура данного решения опирается на современные модели генеративного типа, что обеспечивает высокую степень естественности звучания и позволяет моделировать интонационные характеристики, близкие к живой человеческой речи. В отличие от традиционных алгоритмов преобразования текста в речь, ограниченных заранее заданными параметрическими правилами, SteosVoice использует вероятностные модели и нейросетевые прогнозы для получения акустических признаков, что способствует более плавному и экспрессивному воспроизведению речи.

Практическая реализация в SteosVoice характеризуется следующими особенностями [3]:

Система поддерживает широкий спектр голосов, варьирующихся по тембру, возрастным и эмоциональным характеристикам, а также предоставляет возможность регулировки параметров речи – скорости воспроизведения, высоты тона, длительности пауз. Это позволяет моделировать различные коммуникативные стратегии, включая нейтральное чтение, эмоциональное повествование или акцентированное дикторское изложение.

Выходные данные формируются в формате WAV с частотой дискретизации 44,1 кГц, что делает их совместимыми с профессиональными системами обработки звука. Доступ к сервису обеспечивается через веб-интерфейс, прикладные API и Telegram-бот, а для пользователей реализованы различные тарифные планы – от ограниченного бесплатного доступа до корпоративных лицензий.

В целом, SteosVoice может рассматриваться как пример современной архитектуры TTS-систем, основанной на последовательном применении моделей для лингвистической предобработки, спектрального кодирования и вокодирования, что отражает общий вектор развития технологий искусственного интеллекта в области синтеза речи.

Структура выборки данных

Первым шагом необходимо организовать файловую систему для хранения данных. Рекомендуется создать основную директорию data в корне проекта. Внутри нее создаются две поддиректории с четкими названиями: legitimate для легитимных звонков и fraud для мошеннических. На рисунке 1 представлена иерархия директорий и файлов выборки.

Иерархия структуры выборки данных

Рисунок 1 – Иерархия структуры выборки данных

Распознавание текста в аудио-сигналах

Был разработан скрипт, который представляет собой реализацию класса для преобразования аудиозаписей в текст с использованием моделей распознавания речи Whisper. Код написан на Python и использует несколько специализированных библиотек для работы с аудио и машинным обучением [4].

В начале кода происходит импорт необходимых библиотек. Модуль os предоставляет функции для работы с файловой системой, pandas используется для работы с табличными данными, whisper и faster_whisper – это библиотеки для распознавания речи от OpenAI, torch является фреймворком для машинного обучения, а tqdm обеспечивает визуализацию прогресса обработки.

Основой кода является класс AudioToTextConverter, который инкапсулирует всю функциональность по преобразованию аудио в текст. При инициализации класса принимаются два параметра: размер модели и флаг выбора реализации Whisper. Размер модели определяет баланс между скоростью работы и качеством распознавания - от наименьшей модели "tiny" до наиболее точной "large". Флаг use_faster_whisper позволяет выбрать между оригинальной реализацией Whisper и оптимизированной версией, которая использует CTranslate2 для ускорения вычислений.

В конструкторе класса происходит загрузка выбранной модели распознавания речи. Если выбран режим faster_whisper, модель инициализируется с указанием использования CPU и вычислений в формате int8 для оптимизации производительности. В противном случае загружается стандартная модель Whisper. Процесс загрузки сопровождается информационным сообщением в консоли.

Класс содержит метод transcribe_audio, который выполняет непосредственное преобразование аудиофайла в текст [5]. Метод принимает путь к аудиофайлу и возвращает распознанный текст. Внутри метода используется блок try-except для обработки возможных ошибок при обработке аудио. В зависимости от выбранной реализации Whisper, процесс транскрибации немного отличается: в версии faster_whisper результат возвращается в виде сегментов, которые затем объединяются в единый текст, тогда как стандартная версия возвращает готовый текст напрямую. Важной особенностью является указание языка "ru" для распознавания русской речи. В случае возникновения ошибки метод возвращает пустую строку и выводит сообщение об ошибке.

Метод process_directory обеспечивает пакетную обработку всех WAV-файлов в указанной директории. Сначала он собирает список всех файлов с расширением .wav в заданной папке. Затем для каждого файла последовательно вызывается метод transcribe_audio. Процесс обработки визуализируется с помощью прогресс-бара из библиотеки tqdm, что позволяет отслеживать ход выполнения операции. Для каждого обработанного файла сохраняется информация о имени файла, распознанном тексте и пути к аудиофайлу.

После обработки всех файлов результаты сохраняются в CSV-файл с использованием pandas DataFrame. Сохранение происходит в формате UTF-8 для корректного отображения русского текста. Метод возвращает DataFrame с результатами и выводит сообщение о завершении процесса и месте сохранения файла.

В секции использования кода демонстрируется практическое применение класса. Создается экземпляр конвертера с моделью размера "base" и включенным режимом ускоренной обработки. Затем вызывается метод обработки директории, в который необходимо передать путь к папке с WAV-файлами. Результат работы сохраняется в переменную transcriptions_df.

Выводы

В ходе работы была собрана выборка мошеннических слов и словосочетаний, а также рассмотрена современная система синтеза речи SteosVoice, основанная на методах глубокого обучения и нейросетевых архитектурах. Анализ показал, что подобные решения не только обеспечивают высокое качество воспроизведения речи, но и формируют новые подходы к работе с акустическими данными, ориентированные на вероятностное моделирование и гибкую настройку параметров звучания. SteosVoice может служить ярким примером того, как современные технологии искусственного интеллекта находят практическое применение в задачах автоматизации коммуникаций и анализа речевых сигналов.

Практическая часть работы была связана с организацией и подготовкой выборки аудиоданных для последующего анализа. Были изучены этапы формирования структурированной файловой системы, стандартизации аудиозаписей и преобразования сигналов к единому формату. Особое внимание уделялось извлечению информативных признаков на основе метода Mel-кепстральных коэффициентов (MFCC), который позволяет описывать акустические характеристики речи с учётом особенностей человеческого слухового восприятия. Итоговые векторы признаков представляют собой компактное и универсальное числовое описание аудиосигнала, пригодное для задач классификации и распознавания речевых паттернов.

Литература

  1. Хант, Э. Искусственный интеллект / Э. Хант. – М.: Мир, 2018. – 560 c.
  2. Васильев, А.Н. Принципы и техника нейросетевого моделирования / А.Н. Васильев, Д.А. Тархов. – Москва: Наука, 2018. – 999 c.
  3. Галушкин, А. И. Нейрокомпьютеры. Учебное пособие / А.И. Галушкин. – М.: Альянс, 2018. – 528 c.
  4. Гелиг, А.Х. Введение в математическую теорию обучаемых распознающих систем и нейронных сетей. Учебное пособие / А.Х. Гелиг. – М.: Издательство СПбГУ, 2018. – 224 c.
  5. Ясницкий, Л. Н. Введение в искусственный интеллект / Л.Н. Ясницкий. – М.: Академия, 2018. – 176 c.