Разработка интеллектуального модуля по распознаванию мошеннических звонков на базе звуковых волн
Рыбка Н.С., Анохина И.Ю.
Донецкий национальный технический университет
Введение
Качество итоговой системы напрямую зависит от объема размеченных данных, вычислительных мощностей для обработки аудио в реальном времени и детальной аналитики [1]. Человеческий фактор, усталость и необходимость параллельно отслеживать множество call-кампаний часто ведут к пропуску новых угроз и принятию субоптимальных решений при обновлении сигнатур.
Сфера телефонного мошенничества развивается стремительно, появляются новые технологии синтеза речи (Deepfake), методы маскировки голоса и автоматизации звонков. Это многократно увеличивает сложность и изощренность атак, требуя от защитных систем постоянной адаптации.
Эти вызовы создают устойчивую потребность в роботизированных, автоматизированных и масштабируемых системах для анализа звука, основанных на методах глубокого обучения. Подходы, использующие нейронные сети – это мощный инструмент, вдохновляемые принципами иерархического представления признаков.
Для достижения поставленной цели необходимо произвести обзор предметной области.
В работе были поставлены следующие задачи:
- Рассмотреть выборку слов и словосочетаний мошеннических фраз;
- Рассмотреть преобразование текстовой выборки в звуковую;
- Рассмотреть структуру выборки данных;
- Описать распознавание текста в аудио-сигналах.
Выборка слов и словосочетаний мошеннических фраз
Для распознавания мошеннических звонков была собрана выборка слов и словосочетаний, часто используемых мошенниками, в которой хранится от 1000 записей.
Выборка представляет собой корпус текстовых единиц, собранных и нормализованных для исследования речевых приёмов телефонного мошенничества; в её основе лежат как явно зафиксированные фразы, встречающиеся в официальных предупреждениях и разъяснениях ведомств (банковских служб, Центробанка, МВД, ФСБ, Следственного комитета и проч.), так и систематически сгенерированные вариации на основе характерных шаблонов социальной инженерии. Каждый элемент корпуса – это отдельное слово или словосочетание, отражающее конкретную коммуникативную стратегию злоумышленника: апелляцию к авторитету, создание искусственной срочности, просьбу назвать одноразовый код или реквизиты, инструкцию по установке приложения или переходу по ссылке, сигнал о блокировке или подозрительной операции, а также побуждение к переводу средств или передаче физического предмета курьеру [2]. Источники при сборе были использованы опосредованно: официальные публикации и предупреждения правоохранительных и финансовых учреждений служили основанием для выделения «ядра» фраз, после чего это ядро было дополнено продуктивными морфологических и синтаксическими вариациями с целью охвата типичных формулировок, которые мошенники применяют в реальных телефонных сценариях; при этом сохранены реальные формулировки вроде «сообщите код из СМС», «ваша карта заблокирована», «представитель службы безопасности банка», «переведите на защищённый счёт» и т.п., чтобы выборка отражала практические кейсы и позволяла изучать действительные паттерны.
Преобразование текстовой выборки и звуковую
Для реализации преобразования текстовой выборки в звуковую была использована платформа SteosVoice.
SteosVoice представляет собой систему синтеза речи, созданную на основе методов глубокого обучения и ориентированную на преобразование текстовой информации в акустический сигнал. Архитектура данного решения опирается на современные модели генеративного типа, что обеспечивает высокую степень естественности звучания и позволяет моделировать интонационные характеристики, близкие к живой человеческой речи. В отличие от традиционных алгоритмов преобразования текста в речь, ограниченных заранее заданными параметрическими правилами, SteosVoice использует вероятностные модели и нейросетевые прогнозы для получения акустических признаков, что способствует более плавному и экспрессивному воспроизведению речи.
Практическая реализация в SteosVoice характеризуется следующими особенностями [3]:
- использование обученных нейросетевых моделей для фонетической нормализации текста и расстановки ударений;
- прогнозирование мел-спектрограммы с учётом контекстных зависимостей, что обеспечивает правильную просодику и интонацию;
- применение вокодеров с вероятностной аппроксимацией распределения аудиосэмплов, позволяющих получать сигнал высокого качества.
Система поддерживает широкий спектр голосов, варьирующихся по тембру, возрастным и эмоциональным характеристикам, а также предоставляет возможность регулировки параметров речи – скорости воспроизведения, высоты тона, длительности пауз. Это позволяет моделировать различные коммуникативные стратегии, включая нейтральное чтение, эмоциональное повествование или акцентированное дикторское изложение.
Выходные данные формируются в формате WAV с частотой дискретизации 44,1 кГц, что делает их совместимыми с профессиональными системами обработки звука. Доступ к сервису обеспечивается через веб-интерфейс, прикладные API и Telegram-бот, а для пользователей реализованы различные тарифные планы – от ограниченного бесплатного доступа до корпоративных лицензий.
В целом, SteosVoice может рассматриваться как пример современной архитектуры TTS-систем, основанной на последовательном применении моделей для лингвистической предобработки, спектрального кодирования и вокодирования, что отражает общий вектор развития технологий искусственного интеллекта в области синтеза речи.
Структура выборки данных
Первым шагом необходимо организовать файловую систему для хранения данных. Рекомендуется создать основную директорию data в корне проекта. Внутри нее создаются две поддиректории с четкими названиями: legitimate для легитимных звонков и fraud для мошеннических. На рисунке 1 представлена иерархия директорий и файлов выборки.
Рисунок 1 – Иерархия структуры выборки данных
Распознавание текста в аудио-сигналах
Был разработан скрипт, который представляет собой реализацию класса для преобразования аудиозаписей в текст с использованием моделей распознавания речи Whisper. Код написан на Python и использует несколько специализированных библиотек для работы с аудио и машинным обучением [4].
В начале кода происходит импорт необходимых библиотек. Модуль os предоставляет функции для работы с файловой системой, pandas используется для работы с табличными данными, whisper и faster_whisper – это библиотеки для распознавания речи от OpenAI, torch является фреймворком для машинного обучения, а tqdm обеспечивает визуализацию прогресса обработки.
Основой кода является класс AudioToTextConverter, который инкапсулирует всю функциональность по преобразованию аудио в текст. При инициализации класса принимаются два параметра: размер модели и флаг выбора реализации Whisper. Размер модели определяет баланс между скоростью работы и качеством распознавания - от наименьшей модели "tiny" до наиболее точной "large". Флаг use_faster_whisper позволяет выбрать между оригинальной реализацией Whisper и оптимизированной версией, которая использует CTranslate2 для ускорения вычислений.
В конструкторе класса происходит загрузка выбранной модели распознавания речи. Если выбран режим faster_whisper, модель инициализируется с указанием использования CPU и вычислений в формате int8 для оптимизации производительности. В противном случае загружается стандартная модель Whisper. Процесс загрузки сопровождается информационным сообщением в консоли.
Класс содержит метод transcribe_audio, который выполняет непосредственное преобразование аудиофайла в текст [5]. Метод принимает путь к аудиофайлу и возвращает распознанный текст. Внутри метода используется блок try-except для обработки возможных ошибок при обработке аудио. В зависимости от выбранной реализации Whisper, процесс транскрибации немного отличается: в версии faster_whisper результат возвращается в виде сегментов, которые затем объединяются в единый текст, тогда как стандартная версия возвращает готовый текст напрямую. Важной особенностью является указание языка "ru" для распознавания русской речи. В случае возникновения ошибки метод возвращает пустую строку и выводит сообщение об ошибке.
Метод process_directory обеспечивает пакетную обработку всех WAV-файлов в указанной директории. Сначала он собирает список всех файлов с расширением .wav в заданной папке. Затем для каждого файла последовательно вызывается метод transcribe_audio. Процесс обработки визуализируется с помощью прогресс-бара из библиотеки tqdm, что позволяет отслеживать ход выполнения операции. Для каждого обработанного файла сохраняется информация о имени файла, распознанном тексте и пути к аудиофайлу.
После обработки всех файлов результаты сохраняются в CSV-файл с использованием pandas DataFrame. Сохранение происходит в формате UTF-8 для корректного отображения русского текста. Метод возвращает DataFrame с результатами и выводит сообщение о завершении процесса и месте сохранения файла.
В секции использования кода демонстрируется практическое применение класса. Создается экземпляр конвертера с моделью размера "base" и включенным режимом ускоренной обработки. Затем вызывается метод обработки директории, в который необходимо передать путь к папке с WAV-файлами. Результат работы сохраняется в переменную transcriptions_df.
Выводы
В ходе работы была собрана выборка мошеннических слов и словосочетаний, а также рассмотрена современная система синтеза речи SteosVoice, основанная на методах глубокого обучения и нейросетевых архитектурах. Анализ показал, что подобные решения не только обеспечивают высокое качество воспроизведения речи, но и формируют новые подходы к работе с акустическими данными, ориентированные на вероятностное моделирование и гибкую настройку параметров звучания. SteosVoice может служить ярким примером того, как современные технологии искусственного интеллекта находят практическое применение в задачах автоматизации коммуникаций и анализа речевых сигналов.
Практическая часть работы была связана с организацией и подготовкой выборки аудиоданных для последующего анализа. Были изучены этапы формирования структурированной файловой системы, стандартизации аудиозаписей и преобразования сигналов к единому формату. Особое внимание уделялось извлечению информативных признаков на основе метода Mel-кепстральных коэффициентов (MFCC), который позволяет описывать акустические характеристики речи с учётом особенностей человеческого слухового восприятия. Итоговые векторы признаков представляют собой компактное и универсальное числовое описание аудиосигнала, пригодное для задач классификации и распознавания речевых паттернов.
Литература
- Хант, Э. Искусственный интеллект / Э. Хант. – М.: Мир, 2018. – 560 c.
- Васильев, А.Н. Принципы и техника нейросетевого моделирования / А.Н. Васильев, Д.А. Тархов. – Москва: Наука, 2018. – 999 c.
- Галушкин, А. И. Нейрокомпьютеры. Учебное пособие / А.И. Галушкин. – М.: Альянс, 2018. – 528 c.
- Гелиг, А.Х. Введение в математическую теорию обучаемых распознающих систем и нейронных сетей. Учебное пособие / А.Х. Гелиг. – М.: Издательство СПбГУ, 2018. – 224 c.
- Ясницкий, Л. Н. Введение в искусственный интеллект / Л.Н. Ясницкий. – М.: Академия, 2018. – 176 c.