ДонНТУ   Портал магистров

Реферат по теме выпускной работы

Содержание

Введение

Актуальность проблемы. Современный цифровой ландшафт немыслим без социальных сетей, которые трансформировались из инструмента для общения в основной канал распространения новостей для миллиардов пользователей по всему миру [1]. Однако парадокс этого явления заключается в том, что высокая скорость, доступность и виральный характер распространения информации создали идеальную среду для эпидемии фейковых новостей [2]. Целенаправленная дезинформация стала мощным инструментом гибридных войн, манипуляции общественным сознанием, влияющим на исход выборов, подрывающим доверие к государственным институтам, провоцирующим социальную рознь и наносящим ощутимый экономический ущерб [3].

Масштаб проблемы невозможно переоценить. Ежедневно в социальных сетях публикуются миллионы постов, среди которых значительная часть содержит преднамеренно искаженную информацию. Особую опасность представляют фейковые новости в кризисных ситуациях: во время пандемий, природных катастроф, политических потрясений. В такие периоды скорость принятия решений напрямую зависит от достоверности поступающей информации, а дезинформация может приводить к панике, неадекватным действиям населения и существенным экономическим потерям.

Традиционные методы ручной верификации (фактчекинг) оказались неэффективными и экономически нецелесообразными в условиях лавинообразного потока данных, исчисляемого миллионами постов в сутки [4]. Эксперты-фактчекеры физически не могут обрабатывать такой объем информации, а скорость распространения фейковых новостей зачастую превышает скорость их опровержения. Это создает «окно уязвимости», в течение которого ложная информация успевает достичь критической массы аудитории и оказать свое воздействие.

Данный вызов обуславливает острую необходимость в разработке автоматизированных, интеллектуальных и масштабируемых систем анализа контента, способных работать в реальном времени. Наиболее перспективным и эффективным направлением для решения этой задачи является применение методов искусственного интеллекта, машинного обучения и, в частности, глубоких нейронных сетей [5]. Современные нейросетевые архитектуры демонстрируют беспрецедентные результаты в задачах обработки естественного языка, анализа изображений и выявления сложных паттернов в данных.

Цель и задачи работы. Главной целью данной работы является комплексное исследование возможностей и разработка архитектуры высокоточной системы для автоматической идентификации фейковых новостей в социальных сетях с применением современных нейросетевых моделей. Для достижения этой цели были поставлены следующие задачи:

Научная новизна исследования заключается в разработке гибридного подхода, который объединяет преимущества систем, основанных на экспертных правилах, и современных глубоких нейросетевых моделей. Такой подход позволяет не только достичь высокой точности классификации, но и обеспечить интерпретируемость результатов, что критически важно для практического внедрения подобных систем.

1. Постановка задачи и ключевые признаки классификации

Формализация задачи. Задача автоматической детекции фейковых новостей формализуется как задача бинарной классификации текста, где каждое новостное сообщение должно быть отнесено к одному из двух классов: «достоверное» или «фейковое» [6]. Однако в отличие от многих других задач NLP (обработки естественного языка), данная проблема характеризуется исключительной сложностью и требует комплексного, мультидисциплинарного подхода [7].

Особенность задачи заключается в том, что создатели фейковых новостей постоянно совершенствуют свои методы, адаптируясь к алгоритмам детекции. Они используют сложные лингвистические конструкции, избегают очевидных маркеров ложной информации, имитируют стиль авторитетных источников. Более того, многие фейковые новости содержат смесь истинной и ложной информации, что еще более усложняет их идентификацию. Некоторые дезинформационные кампании используют технику «газлайтинга» — постепенного внедрения ложных утверждений, которые со временем начинают восприниматься как правдоподобные.

В работе проведена детальная систематизация и выделение пяти ключевых групп признаков, которые формируют векторное пространство для обучения и работы модели. Эти признаки были отобраны на основе анализа сотен примеров фейковых и достоверных новостей из различных категорий: политических, экономических, социальных, псевдонаучных и рекламных.

Интеграция этих разнородных признаков в единый вектор данных позволяет нейросетевой модели проводить всесторонний, многомерный анализ и делать более обоснованные, точные и устойчивые к маскировке прогнозы. Каждый из признаков в отдельности может быть недостаточно информативным, но их комбинация создает надежную основу для классификации. (см. рис. 1)

Общий NLP-pipeline
Рисунок 1 — Общий NLP-pipeline
Источник: vedu.ru/Почему важно знать русский язык, чтобы овладеть профессией в сфере машинного обучения.

2. Выбор метода решения: от классических алгоритмов к современным нейросетям

В работе проведен последовательный и сравнительный анализ применимости широкого спектра методов машинного обучения для решения поставленной задачи [13]. Каждый из методов имеет свои преимущества и ограничения, которые необходимо учитывать при проектировании системы детекции фейковых новостей.

Вывод по выбору метода. На основе проведенного анализа делается вывод, что именно глубокие нейросети и архитектуры трансформеров (например, BERT) являются наиболее подходящим инструментом для построения высокоточных, устойчивых и масштабируемых систем детекции дезинформации [19]. Их способность к автоматическому обучению на сырых данных, контекстуальному анализу и адаптации к эволюции языка делает их предпочтительным выбором. (см. рис. 2)

Упрощённая диаграмма одного слоя BERT
Рисунок 2 — Упрощённая диаграмма одного слоя BERT
Источник: dishcuss/Machine Learning For Sequential Data.

Однако следует отметить, что нейросетевые модели, особенно трансформеры, требуют значительных вычислительных ресурсов для обучения и инференса. Это создает определенные сложности для их развертывания в условиях ограниченных ресурсов. Кроме того, эти модели часто работают как «черные ящики», что затрудняет интерпретацию их решений. Для преодоления этого ограничения в работе предлагается гибридный подход, сочетающий нейросетевую модель с системой экспертных правил.

3. Практическая реализация: гибридная система анализа новостного контента

На основе проведенного анализа методов и признаков была разработана инновационная гибридная архитектура системы, которая объединяет два взаимодополняющих компонента: систему экспертных правил и глубокую нейросетевую модель. Такой подход позволяет преодолеть ограничения каждого из методов в отдельности и создать более надежное и адаптивное решение.

Система правил на основе экспертного знания. Этот компонент реализует детальный лингвистический и стилистический анализ текстового контента, основанный на глубоком понимании характерных признаков фейковой информации. Система включает несколько модулей:

Данный компонент обеспечивает исключительную точность на очевидных случаях фейкового контента и гарантирует полную интерпретируемость принимаемых решений. Каждое правило сопровождается объяснением, которое позволяет понять, почему конкретная новость была классифицирована как фейковая. Это критически важно для построения доверительных отношений с пользователями и обеспечения прозрачности работы системы.

Глубокая нейросетевая модель. Для обработки сложных и неочевидных случаев разработан второй компонент — многоуровневая нейросетевая архитектура, обладающая значительной вычислительной мощностью для выявления скрытых паттернов и сложных зависимостей в данных. Архитектура модели включает следующие ключевые элементы:

Архитектура взаимодействия компонентов. Гибридная система работает по следующему принципу: сначала новость анализируется системой экспертных правил. Если правила однозначно классифицируют новость как фейковую или достоверную с высокой степенью уверенности, то результат возвращается пользователю с детальным объяснением. Если же система правил не может принять однозначное решение (например, из-за противоречивых признаков или недостаточной информации), то текст передается на анализ нейросетевой модели.

Нейросетевая модель обрабатывает сложные случаи, используя свою способность выявлять неочевидные паттерны. Результат ее работы также сопровождается объяснением, основанным на важности различных признаков, выявленных в процессе анализа. Такая архитектура позволяет сочетать преимущества обоих подходов: скорость и интерпретируемость системы правил с мощностью и адаптивностью нейросетевой модели.

4. Результаты исследований и их интерпретация

Для демонстрации принципа работы системы и обеспечения прозрачности принятия решений (XAI — Explainable AI) в работе представлена упрощенная, но наглядная математическая модель, основанная на методе взвешенного суммирования признаков [20]. Итоговая оценка фейковости новости (S_i) рассчитывалась по формуле:

S_i = Σ (w_j * x_ij) для j от 1 до n,

где w_j — весовой коэффициент j-го признака, полученный в процессе обучения модели и отражающий его важность; x_ij — нормализованное значение j-го признака для i-й новости (например, по шкале от 0 до 10); n — общее количество признаков.

Эта модель позволяет не только классифицировать новости, но и понимать, какой вклад каждый признак внес в итоговое решение. Например, если новость получила высокий балл фейковости в основном из-за эмоциональной окраски текста, система может указать на это в объяснении результата. Такой подход значительно повышает доверие пользователей к системе и облегчает ее интеграцию в реальные процессы модерации контента.

Вычислительный эксперимент. Был проведен эксперимент с тремя тестовыми новостями и тремя ключевыми признаками: Эмоциональная окраска текста (вес w1=0.5), Надежность источника (вес w2=0.3), Наличие признаков манипуляции (кликбейт) (вес w3=0.2). Расчет итоговой оценки (S_i) производился по формуле взвешенной суммы, а результаты представлены в Таблице 1.

Таблица 1 – Оценка новостей по взвешенным критериям

Критерий Вес Новость A Новость B Новость C
Эмоциональная окраска текста 0.5 9 5 6
Надежность источника 0.3 3 9 7
Признаки манипуляции (кликбейт) 0.2 8 4 5
Итоговая оценка (S_i) 7.0 6.0 6.1

Анализ результатов:

Данный эксперимент наглядно демонстрирует, как система принимает взвешенное решение на основе комплексного анализа нескольких разнородных критериев. Важно отметить, что в реальной системе используется значительно больше признаков (десятки и сотни), что позволяет делать более точные и нюансированные оценки.

Оценка гибридной системы. Экспериментальная оценка разработанной гибридной системы проводилась на разнообразном наборе тестовых примеров, включающем 32 новости из различных категорий. Система продемонстрировала общую точность 87.5%, правильно классифицировав 28 из 32 примеров. Уверенность предсказаний составила 0.929 для фейков и 0.886 для достоверных новостей.

Были выявлены сильные стороны построенной модели: идеальная точность на явных фейках (кликбейт, сенсации), высокая надежность на официальных новостях, эффективное распознавание финансовых и рекламных фейков. Особенно показательным было успешное распознавание сложных случаев, где фейковые новости были искусно замаскированы под достоверные.

Однако, модели все еще испытывают трудности с классификацией социальных фейков и новостей с умеренной эмоциональной окраской, что указывает на необходимость доработки соответствующих правил и расширения обучающей выборки. Эти направления определены как приоритетные для дальнейшего развития системы.

5. Заключение

Проведенное исследование подтверждает, что задача борьбы с фейковыми новостями является сложной, многогранной и требует комплексного междисциплинарного подхода, основанного на передовых технологиях искусственного интеллекта [21]. Нейросетевые модели, в особенности современные архитектуры трансформеров, показывают наивысшую эффективность в анализе текстового контента, метаданных и контекста распространения информации.

Разрабатываемая система автоматической идентификации призвана не только классифицировать новости с высокой точностью, но и обеспечивать интерпретируемость результатов (XAI), что крайне важно для формирования доверия пользователей. Объяснение решения, основанное на вкладе отдельных факторов, позволяет пользователю сделать осознанный вывод и понять логику работы системы.

Гибридный подход, сочетающий систему экспертных правил и глубокую нейросетевую модель, показал свою эффективность, достигнув точности 87.5% на разнообразном тестовом наборе. Такой подход позволяет объединить преимущества обоих методов: скорость, прозрачность и надежность правил с мощностью, адаптивностью и способностью выявлять сложные паттерны нейросетевой модели.

Перспективы дальнейших исследований и развития системы:

Внедрение подобных интеллектуальных систем в модули модерации социальных платформ, в качестве плагинов для браузеров или самостоятельных инструментов позволит значительно снизить масштабы распространения дезинформации, повысить медиаграмотность населения и укрепить информационную безопасность цифрового общества [25].

Практическая значимость работы заключается в разработке моделей для создания эффективного инструмента мониторинга информационного пространства, способствующего снижению распространения дезинформации и повышению медиаграмотности пользователей. Предложенные подходы могут быть использованы как в коммерческих системах модерации контента, так и в образовательных целях для обучения пользователей критическому восприятию информации.

В долгосрочной перспективе развитие систем автоматической детекции фейковых новостей должно идти рука об руку с развитием правового регулирования, образовательных программ и этических стандартов в области информационной безопасности. Только комплексный подход, объединяющий технологические, правовые и образовательные меры, может эффективно противостоять вызовам, связанным с распространением дезинформации в цифровую эпоху.

Список источников

  1. Allcott H., Gentzkow M. Social Media and Fake News in the 2016 Election // Journal of Economic Perspectives. – 2017. – Vol. 31, No. 2. – P. 211–236.
  2. Vosoughi S., Roy D., Aral S. The spread of true and false news online // Science. – 2018. – Vol. 359, Issue 6380. – P. 1146–1151.
  3. Lazer D. M. J. et al. The science of fake news // Science. – 2018. – Vol. 359, Issue 6380. – P. 1094–1096.
  4. Shu K., Wang S., Liu H. Beyond News Contents: The Role of Social Context for Fake News Detection // WSDM. – 2019. – P. 312–320.
  5. Oshikawa R., Qian J., Wang W. Y. A Survey on Natural Language Processing for Fake News Detection // LREC. – 2020. – P. 6086–6093.
  6. Wang W. Y. "Liar, Liar Pants on Fire": A New Benchmark Dataset for Fake News Detection // ACL. – 2017. – P. 422–426.
  7. Zhou X., Zafarani R. A Survey of Fake News // ACM Computing Surveys. – 2020. – Vol. 53, No. 5. – P. 1–40.
  8. Perez-Rosas V. et al. Automatic Detection of Fake News // COLING. – 2018. – P. 3391–3401.
  9. Rashkin H. et al. Truth of Varying Shades // EMNLP. – 2017. – P. 2931–2937.
  10. Shu K. et al. FakeNewsNet // Big Data. – 2020. – Vol. 8, No. 3. – P. 171–188.
  11. Jin Z. et al. Novel Visual and Statistical Image Features // IEEE Transactions on Multimedia. – 2017. – Vol. 19, No. 3. – P. 598–608.
  12. Friggeri A. et al. Rumor Cascades // ICWSM. – 2014. – Vol. 8, No. 1. – P. 101–110.
  13. Shu K., Silva A., Wang S., Tang J., Liu H. Fake News Detection on Social Media // ACM SIGKDD Explorations. – 2017. – Vol. 19, No. 1. – P. 22–36.
  14. Cortes C., Vapnik V. Support-Vector Networks // Machine Learning. – 1995. – Vol. 20, No. 3. – P. 273–297.
  15. Chen T., Guestrin C. XGBoost // KDD. – 2016. – P. 785–794.
  16. Kim Y. CNN for Sentence Classification // EMNLP. – 2014. – P. 1746–1751.
  17. Hochreiter S., Schmidhuber J. LSTM // Neural Computation. – 1997. – Vol. 9, No. 8. – P. 1735–1780.
  18. Devlin J. et al. BERT // NAACL. – 2019. – P. 4171–4186.
  19. Vaswani A. et al. Attention is All You Need // NeurIPS. – 2017. – P. 5998–6008.
  20. Gunning D. et al. XAI // Science Robotics. – 2019. – Vol. 4, No. 37.
  21. Zhang X., Ghorbani A. A. Online Fake News Overview // Information Processing & Management. – 2020. – Vol. 57, No. 2.
  22. Jin Z. et al. Multimodal Fusion for Rumor Detection // ACM Multimedia. – 2017. – P. 795–816.
  23. Yang S. et al. Unsupervised Fake News Detection // AAAI. – 2019. – Vol. 33. – P. 5644–5651.
  24. Zugner D., Akbarnejad A., Gunnemann S. Adversarial Attacks on Neural Networks for Graph Data // KDD. – 2018. – P. 2847–2856.
  25. Bovet A., Makse H. A. Influence of Fake News in Twitter // Nature Communications. – 2019. – Vol. 10, No. 1.