Введение
Распространение фейковых новостей в социальных сетях представляет серьёзную угрозу информационной безопасности, оказывая существенное влияние на формирование общественного мнения и политические процессы [1,2]. Высокая скорость распространения информации в таких платформах, как Twitter, Facebook и ВКонтакте, делает традиционные методы верификации, такие как ручной фактчекинг, неэффективными в условиях реального времени [3].
В современных условиях информационной перегрузки особую актуальность приобретает разработка автоматизированных систем выявления недостоверной информации с применением методов искусственного интеллекта. Современные нейросетевые архитектуры, включая глубокие нейронные сети и гибридные подходы, демонстрируют высокую эффективность в задачах обработки естественного языка и анализа текстовых данных [4,5,6]. Задача разработки моделей, способных выявлять сложные лингвистические паттерны, эмоциональные маркеры и стилистические особенности, характерные для фейкового контента, по-прежнему является актуальной.
Целью данной работы является разработка моделей для реализации гибридной системы автоматической идентификации фейковых новостей, сочетающей правила на основе экспертных знаний и глубокую нейросетевую модель. Полученные модели должны обеспечивать не только высокую точность классификации, но и интерпретируемость результатов, что особенно важно для построения доверительных отношений с пользователями.
Постановка задачи
Задача автоматической классификации новостного контента на достоверный и фейковый представляет собой сложную проблему машинного обучения, требующую комплексного анализа множества взаимосвязанных факторов. В условиях современного информационного пространства, характеризующегося высокой скоростью распространения контента и разнообразием форм манипулятивного воздействия, традиционные подходы к верификации информации демонстрируют ограниченную эффективность.
Основной методологический акцент в работе сделан на создании гибридной архитектуры системы, органично сочетающей преимущества двух подходов: системы правил, основанных на экспертных знаниях о характерных признаках фейкового контента, и способности глубоких нейросетевых моделей к выявлению сложных нелинейных зависимостей и скрытых паттернов в данных [7]. Такая комбинация позволяет достичь баланса между точностью классификации, интерпретируемостью результатов и устойчивостью к новым формам информационных манипуляций.
Разрабатываемая система должна не только обеспечивать высокую точность распознавания фейковых новостей, но и обладать способностью к адаптации в условиях постоянно эволюционирующих стратегий распространения дезинформации, что представляет особую практическую ценность для обеспечения информационной безопасности в социальных сетях.
Методы решения задачи
Для решения задачи идентификации фейковых новостей была разработана инновационная гибридная архитектура, объединяющая два взаимодополняющих компонента: систему экспертных правил и глубокую нейросетевую модель, что позволяет преодолеть ограничения традиционных подходов и обеспечить высокую эффективность системы в условиях разнородного новостного контента.
Система правил на основе экспертного знания
Данный компонент реализует детальный лингвистический и стилистический анализ текстового контента, основанный на глубоком понимании характерных признаков фейковой информации. Система включает:
- Детектирование кликбейтных конструкций - идентификация характерных маркеров, таких как сенсационные заголовки, призывы к немедленному действию, использование заглавных букв и множественных восклицательных знаков.
- Анализ эмоциональной насыщенности текста - оценка плотности эмоционально окрашенной лексики, определение тональности высказываний и выявление манипулятивных языковых паттернов.
- Выявление финансовых и конспирологических маркеров - распознавание характерных фраз и терминов, ассоциированных с финансовыми паниками, теориями заговора и псевдонаучными утверждениями.
- Структурный анализ текста - оценка композиционных особенностей, включая распределение ключевых сообщений, использование риторических приемов и стилистических конструкций.
Данный компонент обеспечивает исключительную точность на очевидных случаях фейкового контента и гарантирует полную интерпретируемость принимаемых решений, что критически важно для построения доверительных отношений с пользователями.
Нейросетевая модель
Для обработки сложных и неочевидных случаев разработан второй компонент - многоуровневая нейросетевая архитектура, обладающая значительной вычислительной мощностью для выявления скрытых паттернов и сложных зависимостей в данных.
Нейросетевая модель характеризуется следующими ключевыми особенностями:
- Многослойная архитектура с последовательностью 512-256-128-64-2 нейронов, обеспечивающая постепенное абстрагирование и извлечение высокоуровневых признаков из исходных данных.
- Объединенный вектор признаков, включающий TF-IDF представление текстового контента и комплекс мета-признаков, что позволяет модели анализировать как семантические, так и статистические характеристики контента.
- Слои BatchNormalization для стабилизации процесса обучения и ускорения сходимости модели, обеспечивающие устойчивость к изменению распределения входных данных.
- Dropout слои с коэффициентами от 0.4 до 0.2 для эффективного предотвращения переобучения и повышения обобщающей способности модели.
- Функция активации ReLU в скрытых слоях, обеспечивающая эффективное обучение глубокой архитектуры и предотвращающая проблему затухающих градиентов.
- Softmax - активация в выходном слое, предоставляющая вероятностную интерпретацию результатов классификации.
Результаты исследований
Экспериментальная оценка разработанной системы проводилась на разнообразном наборе тестовых примеров, включающем 32 новости из различных категорий.
Примеры успешной классификации:
- "ШОКИРУЮЩЕЕ ОТКРЫТИЕ! Вода из-под крана превращается в venom!" → ФЕЙК (0.998).
- "Центробанк сохранил ключевую ставку на уровне 16%" → ДОСТОВЕРНО (0.920).
- "УСПЕЙ! Только сегодня акция - iPhone за 1000 рублей!" → ФЕЙК (0.950).
Система продемонстрировала общую точность 87.5%, правильно классифицировав 28 из 32 примеров (см. табл. 1).
| Категория | Точность | Количество примеров |
|---|---|---|
| Явные фейки | 100% | 4/4 |
| Явные достоверные | 100% | 4/4 |
| Псевдонаучные фейки | 100% | 3/3 |
| Политические фейки | 100% | 2/2 |
| Экономические фейки | 100% | 2/2 |
| Социальные фейки | 50% | 1/2 |
| Сложные случаи | 100% | 4/4 |
| Новости без эмоций | 66.7% | 2/3 |
| Новости с умеренными эмоциями | 50% | 1/2 |
| Рекламные фейки | 100% | 2/2 |
| Дополнительные примеры | 75% | 3/4 |
Были выявлены сильные стороны построенной модели: идеальная точность на явных фейках (кликбейт, сенсации), высокая надежность на официальных новостях, эффективное распознавание финансовых и рекламных фейков. Уверенность предсказаний составила 0.929 для фейков и 0.886 для достоверных новостей.
Однако, модели все еще испытывают трудности с классификацией социальных фейков и новостей с умеренной эмоциональной окраской, что указывает на необходимость доработки соответствующих правил и расширения обучающей выборки.
Заключение
Разработанная гибридная система идентификации фейковых новостей продемонстрировала высокую эффективность, достигнув точности 87.5% на разнообразном тестовом наборе. Комбинация экспертных правил и глубокой нейросетевой модели позволила создать решение, сочетающее точность классификации с интерпретируемостью результатов.
Среди перспективных будущих исследований можно выделить:
- Расширение лингвистического анализа - включение синтаксических и семантических признаков.
- Интеграция контекстуальной информации - анализ источника, времени публикации, истории распространения.
- Обучение на расширенных датасетах - включение большего количества примеров проблемных категорий.
- Разработка адаптивных механизмов - способность к онлайн-обучению на новых типах фейков.
- Мультимодальный анализ - интеграция анализа изображений и видео контента.
Практическая значимость работы заключается в разработке моделей для создания эффективного инструмента мониторинга информационного пространства, способствующего снижению распространения дезинформации и повышению медиаграмотности пользователей.
Литература
Материалы XVI Международной научно-технической конференции
"Информатика, управляющие системы, математическое и компьютерное моделирование"
(ИУСМКМ-2025 – студенческая секция)