Материалы конференции
УДК 004.8

ИДЕНТИФИКАЦИЯ ФЕЙКОВЫХ НОВОСТЕЙ В СОЦИАЛЬНЫХ СЕТЯХ С ИСПОЛЬЗОВАНИЕМ НЕЙРОСЕТЕВЫХ МОДЕЛЕЙ

Токарчуков М.С., студент
Андриевская Н.К.
Донецкий национальный технический университет
кафедра автоматизированных систем управления
Аннотация

Токарчуков М.С., Андриевская Н.К. Идентификация фейковых новостей в социальных сетях с использованием нейросетевых моделей. В статье рассматривается задача автоматической классификации новостной информации в социальных сетях с целью выявления фейковых публикаций. Предлагается использование методов машинного обучения и нейросетевых моделей для анализа текстового контента, метаинформации и эмоциональной окраски сообщений. Приведена архитектура системы, способной проводить классификацию новостей и объяснять результаты. Использование нейросетевых подходов позволяет повысить точность распознавания фейковой информации и усилить защиту пользователей от дезинформации.

Ключевые слова: фейковые новости, нейросети, социальные сети, классификация текста, обработка естественного языка, информационная безопасность.

Введение

Распространение фейковых новостей в социальных сетях представляет серьёзную угрозу информационной безопасности, влияя на общественное мнение и политические процессы [1], [2]. Высокая скорость передачи информации в таких платформах, как Twitter, Facebook и ВКонтакте, делает невозможным эффективное применение ручных методов верификации, таких как фактчекинг [3].

В условиях большого объёма данных особую актуальность приобретает автоматизация процессов выявления недостоверной информации с использованием методов искусственного интеллекта. Нейросетевые модели, включая RNN, CNN, а также трансформеры (BERT, GPT), зарекомендовали себя как эффективные инструменты для обработки естественного языка и анализа текстов в контексте [4], [5]. Эти модели способны выявлять лексические, семантические и эмоциональные признаки фейковых новостей, а также учитывать репутацию источников и контекст распространения [6].

Целью данной работы является разработка системы автоматической идентификации фейковых новостей в социальных сетях на основе нейросетевых моделей. Такая система позволит повысить точность выявления фейков, снизить распространение дезинформации и укрепить доверие пользователей к проверенным источникам [2], [7].

Постановка задачи

Для решения задачи автоматической классификации новостей как достоверных или фейковых широко применяются методы машинного обучения и обработки естественного языка (NLP), которые позволяют систематизировать процесс анализа текстов и учитывать наиболее значимые признаки, влияющие на достоверность информации. Использование нейросетевых моделей дает возможность выявлять скрытые лексические, семантические и эмоциональные паттерны, характерные для фейковых сообщений, и проводить оценку новостей с учетом контекста публикации. Такой подход позволяет не только обнаруживать ложные сведения, но и объяснять пользователю, почему та или иная новость вызывает подозрения.

Таким образом, цель данной работы — исследовать возможности применения современных нейросетевых архитектур для задачи выявления фейковых новостей в социальных сетях, определить ключевые признаки, влияющие на результат классификации, и разработать математическую модель, описывающую процесс принятия решений на основе текстовой и метаинформации.

Основной целью задачи является построение системы, способной с высокой точностью классифицировать входящие новостные сообщения, автоматически обучаться на новых данных и адаптироваться к изменениям в языке и тематике публикаций. Такая система должна учитывать как содержательные особенности текста, так и дополнительные параметры — источник публикации, время появления, распространенность новости. Это требует комплексного подхода с использованием глубоких нейросетей, способных интегрировать данные различной природы и эффективно распознавать паттерны дезинформации [4].

Основные группы признаков, используемых в задаче классификации фейковых новостей:

  1. Лексико-семантические характеристики. Один из ключевых факторов — анализ словаря сообщения: использование кликбейтных выражений, сенсационных слов, повторяющихся шаблонов и эмоционально окрашенных конструкций. Эти признаки позволяют выделять тексты, предназначенные для манипуляции восприятием аудитории.
  2. Тональность и эмоциональная насыщенность. Фейковые новости часто используют негативные или провокационные высказывания, вызывая сильную эмоциональную реакцию у читателя. Определение общего эмоционального фона текста помогает выявлять потенциально недостоверные публикации.
  3. Репутация источника. Учет надежности источника — один из важных компонентов. Новости, публикуемые анонимными или непроверенными аккаунтами, без указания авторов или ссылок на первоисточники, с высокой вероятностью могут оказаться фейковыми.
  4. Структурные особенности текста. Длина текста, его форматирование, плотность ключевых слов, использование заголовков и подзаголовков также влияют на достоверность восприятия. Модели анализируют такие параметры для выявления нестандартных или подозрительных структур.
  5. Показатели распространения. Важную роль играет скорость и масштаб распространения новости. Быстрый рост количества репостов и комментариев при отсутствии подтверждений из официальных источников может служить дополнительным индикатором фейковости.

Эти признаки используются для построения вектора признаков, на основе которого нейросеть обучается классифицировать новости. Интеграция этих факторов в единую модель позволяет системе анализировать сообщения всесторонне и формировать обоснованные предсказания.

Выбор метода решения задачи

Идентификация фейковых новостей в социальных сетях требует применения таких методов, которые позволяют учитывать множество признаков и факторов одновременно. Это делает задачу многокритериальной по своей природе. Система анализа должна учитывать как текстовое содержание сообщений, так и метаинформацию, эмоциональный фон, поведенческие признаки распространения и надежность источника. Методы машинного обучения и нейросетевых моделей хорошо подходят для автоматизации анализа и классификации новостей на основе совокупности этих признаков [4].

Для построения эффективной системы детекции фейков необходимо выбрать метод обработки входных данных, который способен обобщать информацию из различных источников и распознавать паттерны, характерные для недостоверных сообщений. В качестве основы могут использоваться как классические алгоритмы машинного обучения, так и глубокие нейронные сети, в зависимости от сложности модели и доступного объема данных.

1. Логистическая регрессия

Логистическая регрессия является базовым методом бинарной классификации, который позволяет оценивать вероятность принадлежности новости к категории «фейковая» или «достоверная». Метод отличается простотой, интерпретируемостью и высокой скоростью обучения. Однако он слабо справляется с нелинейными зависимостями и требует ручной подготовки признаков [5].

2. Метод опорных векторов (SVM)

Метод опорных векторов используется для эффективного разделения классов в пространстве признаков. Он особенно эффективен в задачах, где важно добиться высокого качества классификации при ограниченном объеме обучающих данных. Однако его производительность может снижаться при работе с большими и шумными текстовыми корпусами [6].

3. Классификация на основе деревьев решений

Деревья решений позволяют построить интерпретируемую модель, в которой каждая вершина соответствует определенному признаку (например, наличию сенсационной лексики), а конечные листья — классу. Такой подход прост в реализации, но подвержен переобучению и чувствителен к изменению структуры данных [7].

4. Глубокие нейронные сети (DNN)

Глубокие полносвязные сети позволяют учитывать сложные взаимосвязи между признаками текста и метаинформацией. Они хорошо работают с большим объемом данных, но требуют значительных вычислительных ресурсов и времени на обучение. Нейросети автоматически извлекают признаки, снижая зависимость от ручной подготовки данных [8].

5. Трансформеры (например, BERT)

Модели трансформерной архитектуры, такие как BERT и его модификации, в настоящее время являются одним из самых мощных инструментов обработки естественного языка. Они учитывают контекст слов в предложении и позволяют проводить высокоточный семантический анализ текста. BERT способен выявлять скрытые паттерны в фейковых новостях, распознавая манипуляции даже при внешне нейтральной подаче информации [9].

Каждый из представленных методов имеет свои преимущества и ограничения. Выбор подхода зависит от цели системы, доступных вычислительных ресурсов и особенностей данных. Для начальных этапов исследования может быть использована логистическая регрессия или SVM, тогда как для построения высокоточной модели, способной работать с живым потоком новостей, наилучшим выбором станут трансформеры и глубокие нейронные сети.

Применение современных нейросетевых моделей позволяет не только классифицировать сообщения, но и проводить интерпретацию решений, объясняя пользователю, какие признаки повлияли на результат. Такой подход обеспечивает более высокий уровень доверия и позволяет формировать объективную картину информационного пространства. Таким образом, использование нейросетевых алгоритмов в задаче детекции фейковых новостей обеспечивает масштабируемое, адаптивное и точное решение, способное работать в реальных условиях социальных сетей.

Результаты исследований

В рамках эксперимента была построена нейросетевая модель для классификации новостей как достоверных или фейковых. Для интерпретации результатов классификации применен метод взвешенного суммирования признаков, позволяющий наглядно представить вклад каждого параметра в итоговую оценку фейковости сообщения. Такой подход позволяет количественно оценить, насколько каждый признак влияет на вывод модели.

Основная формула метода взвешенных сумм

Расчет итоговой оценки 𝑆𝑖 для каждой новости 𝑖 выполняется по формуле (1):

𝑆𝑖 = Σ𝑗=1𝑛 𝑤𝑗 ⋅ 𝑥𝑖𝑗;    (1)

где:

Перед расчетом веса 𝑤𝑗 были нормализованы, чтобы их сумма равнялась 1, что обеспечивает корректность итоговой оценки. Веса определялись в процессе обучения модели, исходя из значимости признаков на обучающем наборе данных.

Для оценки модели были выбраны три примера новостей с разным содержанием. Анализ проводился по следующим ключевым признакам:

Весовые коэффициенты признаков были установлены моделью как 0.5, 0.3 и 0.2 соответственно.

Данные приведены в таблице 1:

Таблица 1 – Оценка альтернативных местоположений по критериям
КритерийВесНовость AНовость BНовость C
Эмоциональная окраска текста0.5956
Надежность источника0.3397
Признаки манипуляции (кликбейт)0.2845

В результате расчёта итоговой оценки 𝑆𝑖 для каждой новости по формуле (1), мы получили следующий результат:

S𝐴 = 7.0
S𝐵 = 6.0
S𝐶 = 6.1

Согласно полученным результатам, новость A имеет наивысшую вероятность быть фейковой (7.0 из 10), что связано с высокой эмоциональной окраской текста и наличием выраженной манипулятивной подачи. В то время как новость B, несмотря на надежный источник, набирает более низкий общий балл за счет меньшего количества эмоциональных и манипулятивных признаков. Таким образом, модель демонстрирует способность дифференцировать тексты на основе комбинации содержательных и контекстуальных факторов.

Заключение

Идентификация фейковых новостей в социальных сетях — сложная и актуальная задача, требующая анализа множества признаков: текстового содержания, эмоциональной окраски, источника, структуры публикации и контекста распространения. Применение нейросетевых моделей позволяет автоматизировать этот процесс, обеспечивая высокую точность классификации и возможность объяснения результатов.

Разработка и внедрение подобных систем способствует снижению уровня дезинформации, повышает информационную безопасность пользователей и доверие к проверенным источникам. Интеллектуальные модели анализа новостей в социальных сетях представляют собой перспективный инструмент для эффективного мониторинга и защиты информационного пространства.

Литература

1. Shu K., Sliva A., Wang S., Tang J., Liu H. Fake News Detection on Social Media: A Data Mining Perspective. // ACM SIGKDD Explorations, Vol. 19, No. 1, 2017.DOI: 10.1145/3137597.3137600
2. Wang W.Y. "Liar, Liar Pants on Fire": A New Benchmark Dataset for Fake News Detection. // Proceedings of ACL 2017. URL: https://aclanthology.org/P17-2067
3. Devlin J., Chang M.-W., Lee K., Toutanova K. BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding. // arXiv:1810.04805, 2018. URL: https://arxiv.org/abs/1810.04805
4. Zhou X., Zafarani R. Fake News: A Survey of Research, Detection Methods, and Opportunities. // arXiv:1812.00315, 2018. URL: https://arxiv.org/abs/1812.00315
5. Ahmed H., Traore I., Saad S. Detection of Online Fake News Using N-Gram Analysis and Machine Learning Techniques. // Proceedings of the International Conference on Intelligent, Secure and Dependable Systems in Distributed and Cloud Environments (ISDDC), 2017. DOI: 10.1007/978-3-319-69155-8_3
6. Vosoughi S., Roy D., Aral S. The spread of true and false news online. // Science, Vol. 359, Issue 6380, 2018. DOI: 10.1126/science.aap9559

Статья подготовлена для публикации