Определение метода ИИ для выявления мошеннических звонков на базе звуковых волн
Рыбка Н.С., Анохина И.Ю.
Донецкий национальный технический университет
Введение
Эффективность систем обнаружения мошеннических звонков критически зависит от корректного проектирования и извлечения информативных признаков из аудиопотока. Ключевыми задачами являются выделение уникальных речевых паттернов, эмоциональной окраски голоса, фоновых шумов, а также анализ речевого содержимого [1]. Ручной анализ и создание экспертных правил для постоянно эволюционирующих схем мошенничества требуют больших трудозатрат и высокой квалификации лингвистов и звукоинженеров, что делает такой подход малопригодным для оперативного противодействия.
Основой для создания надежной системы часто является экспертный опыт и интуиция специалистов по кибербезопасности и обработке сигналов, которые нарабатываются годами практики. Однако этот процесс трудно формализуем, субъективен и не гарантирует устойчивого результата перед лицом новых тактик социальной инженерии. В частности, для новых сценариев мошенничества или специфических акцентов даже эксперты оказываются в ситуации, когда пространство для анализа неструктурировано, и его исчерпывающая проверка невозможна.
Для достижения поставленной цели необходимо произвести обзор предметной области.
В работе были поставлены следующие задачи:
- Рассмотреть методы на основе анализа звуковых волн;
- Рассмотреть методы на основе классических методов машинного обучения;
- Рассмотреть методы на основе глубоких нейронных сетей;
- Обосновать выбор метода.
Методы на основе анализа признаков звуковых волн
Методы, использующие анализ признаков звуковых волн, применяются для классификации аудиоданных с помощью предварительного извлечения информативных характеристик. Ключевыми признаками, используемыми в этом подходе, являются спектрограммы, коэффициенты MFCC (Mel-Frequency Cepstral Coefficients), а также другие акустические параметры, такие как амплитудные и частотные характеристики звуковых сигналов. Эти признаки позволяют представить исходный аудиосигнал в структурированной форме, удобной для последующего анализа с помощью алгоритмов машинного обучения [2]. После извлечения признаков для классификации звонков могут применяться наивный байесовский классификатор (NB) или логистическая регрессия (Logistic Regression). Эти алгоритмы эффективно обрабатывают числовые данные и позволяют с высокой скоростью определять категорию звонка.
Для классификации входящих звонков на основе их акустических характеристик, таких как частотные компоненты, общий уровень громкости и высокочастотные колебания, можно применить методы логистической регрессии. Логистическая регрессия строит линейную модель зависимости между признаками и вероятностью принадлежности звонка к одной из категорий («мошенничество», «реклама», «нормальный вызов»). Этот метод позволяет эффективно классифицировать звонки, анализируя акустические особенности, которые могут служить индикаторами определенных типов звонков.
К преимуществам методов на основе классических алгоритмов машинного обучения можно отнести:
- спектрограммы и MFCC хорошо отражают особенности голосовых сигналов, позволяя точно классифицировать звонки;
- работают быстро, что важно для оперативного выявления мошеннических вызовов;
- данные методы имеют низкую вычислительную сложность по сравнению с нейросетевыми моделями.
К недостаткам методов на основе классических алгоритмов машинного обучения можно отнести:
- качество классификации может снижаться в условиях плохой связи или фонового шума;
- в реальности признаки звуковых сигналов могут быть зависимыми, что может снижать точность классификации;
- не всегда может корректно учитывать сложные нелинейные зависимости в звуковых данных.
Методы на основе классических алгоритмов машинного обучения
Методы включают использование хорошо известных техник, таких как метод опорных векторов (SVM), случайный лес (Random Forest), метод ближайших соседей (KNN) и другие, для анализа и классификации данных. В контексте распознавания мошеннических звонков эти методы применяются к признакам, извлеченным из звуковых волн. Классические алгоритмы машинного обучения требуют предварительного этапа обработки данных, который включает извлечение признаков из исходных звуковых волн. Преобразованные данные представляют собой структурированные числовые значения, которые затем подаются на вход алгоритму для обучения и классификации. Метод опорных векторов и случайный лес используют эти признаки для построения модели, которая на основе ранее обученных данных предсказывает, является ли звонок мошенническим или нет.
К преимуществам методов на основе классических алгоритмов машинного обучения можно отнести [3]:
- требование относительно небольших вычислительных мощностей для обучения и предсказания, что делает данные методы привлекательными для систем с ограниченными ресурсами;
- методы демонстрируют отличные результаты на данных, которые уже были предварительно обработаны и преобразованы в форму, подходящую для машинного обучения;
- модели предоставляют важную информацию о значимости признаков, что позволяет лучше понять, какие характеристики звука играют ключевую роль в идентификации мошеннических звонков.
К недостаткам методов на основе классических алгоритмов машинного обучения можно отнести:
- требование о преобразовании данных в четкую структуру перед их подачей в модель (звуковые волны, будучи неструктурированными данными, требуют сложной предварительной обработки, что усложняет задачу);
- необходимо извлечь значимые признаки из звуковых сигналов, такие как частотные компоненты, амплитудные характеристики и другие параметры, что требует дополнительных вычислительных затрат на этапе подготовки данных;
- не всегда способны выявлять сложные, многомерные или временные зависимости в данных, такие как особенности речи, интонации или паттерны поведения мошеннических звонков, без использования дополнительных методов.
Методы на основе глубоких нейронных сетей
Методы применяют сложные архитектуры, такие как сверточные нейронные сети (CNN) или рекуррентные нейронные сети (RNN или улучшенная версия LSTM), для обработки и анализа звуковых данных в задаче распознавания мошеннических звонков. Эти модели могут работать напрямую с необработанными аудиофайлами, извлекая скрытые закономерности в данных, что делает их особенно эффективными для анализа сложных и многомерных акустических признаков, таких как спектрограммы или временные ряды [4].
Сверточные нейронные сети (CNN) применяются для обработки спектрограмм звуковых волн. С помощью сверток CNN способны извлекать из спектрограмм ключевые признаки, такие как частотные компоненты, которые представляют собой важные характеристики звуков, потенциально указывающие на наличие мошенничества, рекламы или нормальных звонков. Это позволяет избежать необходимости предварительного извлечения признаков, так как нейронная сеть сама выявляет важные особенности, что значительно упрощает процесс подготовки данных.
Рекуррентные нейронные сети (RNN), в свою очередь, эффективны для работы с последовательными данными, что особенно актуально для звуковых сигналов, имеющих временную структуру. RNN учитывают временные зависимости в аудиофайлах, такие как интонация и ритм, что помогает выявлять паттерны, характерные для мошеннических или рекламных звонков. Особое внимание уделяется изменению звуковых характеристик во времени, таким как длительность пауз, изменение громкости или тембра, что может быть полезно для классификации звонков.
К преимуществам методов можно отнести [5]:
- эффективный анализ первичных аудиофайлы или их преобразования без необходимости предварительного извлечения признаков, что позволяет значительно упростить подготовку данных и уменьшить количество этапов в процессе разработки модели;
- модели способны выявлять скрытые, многомерные зависимости в данных, которые могут быть трудными для других методов, таких как классические алгоритмы машинного обучения;
- способность автоматически извлекать значимые особенности, такие как специфические частотные и временные компоненты, которые могут быть характерны для мошеннических звонков.
К недостаткам можно отнести:
- требуется значительное количество вычислительных ресурсов (модели требуют мощных процессоров и GPU для ускоренной обработки данных, что может быть ограничивающим фактором на ранних этапах разработки или в случае недостаточного доступа к вычислительным мощностям);
- требуется большой объем данных для обучения, что является важным условием для предотвращения переобучения и обеспечения высококачественной классификации (недостаток обучающих данных может снизить точность модели);
- несмотря на высокую точность классификации, нейронные сети не всегда дают возможность понять, какие именно признаки или особенности данных были решающими для принятия определенного решения.
Обоснование выбора метода
При выборе метода для классификации звонков, основанных на звуковых волнах, необходимо учитывать ключевые факторы, которые должны быть сбалансированы с учетом специфики задачи распознавания мошеннических звонков. В таблице 1 приведено сравнение различных методов машинного обучения, которые могут быть использованы для классификации звонков.
Таблица 1 – Сравнение методов для классификации звонков
Выбор метода классификации звонков зависит от приоритетных требований к системе. Если требуется высокая точность и возможность работы с различными типами, предпочтение следует отдать методам глубоких нейронных сетей, таким как CNN или LSTM. В случае ограниченных вычислительных мощностей и менее строгих требований к точности, можно использовать классические методы, такие как SVM или Random Forest, которые обеспечивают меньшую вычислительную сложность и более быструю обработку данных, но с несколько сниженной точностью.
В контексте задачи классификации звонков, основанных на акустических признаках, оптимальными методами являются CNN и LSTM, так как они обеспечивают высокую точность распознавания и гибкость в обработке различных типов данных.
Выводы
Современные методы детекции мошеннических звонков, использующие искусственный интеллект, значительно повышают эффективность распознавания мошеннических схем. Применение алгоритмов машинного обучения, таких как деревья решений, градиентный бустинг, а также нейросетевых технологий, включая LSTM и трансформеры, позволяет учитывать, как лексические и паралингвистические особенности речи, так и временные зависимости в аудиофайлах. Это способствует точному выявлению мошенничества, даже когда оно адаптируется к изменяющимся условиям.
Особое внимание уделено способности ИИ-систем адаптироваться к новым данным и изменениям в методах мошенников, что является существенным преимуществом перед традиционными подходами. Однако, несмотря на высокую эффективность и адаптивность таких систем, их внедрение сопряжено с определёнными вызовами, такими как потребность в большом объёме аннотированных данных и высокой вычислительной мощности. Важно учитывать эти аспекты при разработке и эксплуатации ИИ-систем, чтобы они могли эффективно работать в реальном времени, минимизируя ложные срабатывания и повышая точность детекции мошеннических звонков.
Литература
- Нейронные сети. Statistica Neural Networks. Методология и технологии современного анализа данных. – М.: Горячая линия – Телеком, 2008. – 392 c.
- Плас, Джейк Вандер Python для сложных задач. Наука о данных и машинное обучение. Руководство / Плас Джейк Вандер. – М.: Питер, 2018. – 527 c.
- Себастьян, Рашка Python и машинное обучение / Рашка Себастьян. – М.: ДМК Пресс, 2017. – 809 c.
- Татузов, А. Л. Нейронные сети в задачах радиолокации / А.Л. Татузов. – М.: Радиотехника, 2009. – 432 c.
- Шибзухов, З.М. Конструктивные методы обучения сигма-пи нейронных сетей / З.М. Шибзухов. – М.: Наука, 2006. – 297 c.