Библиотека материалов по теме выпускной работы
-
Идентификация фейковых новостей в социальных сетях с использованием нейросетевых моделей
Авторы: М.С. Токарчуков, Н.К. Андриевская
Описание: Рассматривается актуальная задача автоматической детекции фейковых новостей в социальных сетях. В работе предложен подход на основе нейросетевых моделей, анализирующих лингвистические и контекстные признаки для классификации новостей и объяснения результатов, что повышает точность и доверие к системе.
-
Нейросетевые методы анализа достоверности новостного контента в социальных сетях
Авторы: М.С. Токарчуков, Н.К. Андриевская
Описание: Статья посвящена разработке гибридной системы для выявления фейковых новостей, сочетающей систему экспертных правил и глубокую нейросеть. Предложенная архитектура обеспечивает не только высокую точность классификации (87.5%), но и интерпретируемость решений, успешно справляясь с различными типами дезинформации, от кликбейта до псевдонаучных публикаций.
-
Гибридная интеллектуальная мера оценки семантической близости
Авторы: Н.К. Андриевская
Описание: В статье рассматривается задача определения оценки семантической близости между двумя объектами на базе гибридной меры. В результате исследований была разработана гибридная интеллектуальная мера оценки семантической близости между двумя объектами по семантическому трехмерному тензору графа знаний. Полученная мера включает вычисление семантической близости по онтологии, по семантике, по частотным характеристикам терминов и косинусному сходству контекстных векторов.
-
Применение статистических методов, кластерного анализа и нейро-сетевых технологий при прогнозировании закупочных цен лекарств
Авторы: Н.К. Андриевская, Т.В. Мартыненко 2, Т.А. Васяева
Описание: В статье рассмотрена проблема планирования закупок лекарственных средств аптечной сети. При определении оптимальной закупочной цены возникает необходимость в прогнозировании цен по историческому массиву данных прайс-листов. Проанализированы традиционные статистические подходы к прогнозированию, а также методы на основе нейронной сети. Реализованы четыре метода: метод скользящего среднего; метод случайного леса; метод K-ближайших соседей; нейронная сеть с архитектурой LSTM. На основании ряда метрик произведена оценка качества прогноза тестируемых методов. Проведенные эксперименты показали высокую точность прогнозирования.
-
Разработка алгоритмов предобработки информации для прогнозных моделей ИСППР управлениязакупками
Авторы: Н.К. Андриевская, Т.В. Мартыненко
Описание: Статья посвящена разработке алгоритмов предварительной обработки данных и решению таких задач, как устранение неполноты данных и преобразование необработанной информации в удобный для анализа вид. При получении реальных данных временных рядов мы сталкиваемся с тем, что они лишь изредка бывают в необходимом формате. Существенная часть необработанных наборов данных слабо структурирована или содержит большое количество отсутствующих значений. Это делает невозможным последующую обработку данных некоторыми методами. В связи с этим реализованы основные этапы предварительной обработки данных, такие как, очистка данных, заполнение недостающих значений, сглаживание временного ряда, нормализация переменных. Таким образом, получен набор данных для дальнейших исследований, реализации и тестирования прогнозных моделей ИСППР управления закупками.
-
Онтологический подход в системах обработки данных научных и научно-образовательных организаций
Авторы: Н.К. Андриевская
Описание: В статье исследуется применение онтологического подхода для решения различных задач системы обработки данных научных и научно-образовательных организаций. Предложен комбинированный подход к созданию онтологии, когда для верхнего уровня используются уже существующие онтологии «top-level» и экспертные знания, а для других - автоматическое формирование на базе корпусов документов и широких междоменных онтологий, которые хорошо поддерживаются благодаря усилиям открытого сообщества. Проведен анализ основных моделей представления данных в онтологиях, сделан выбор языков описания онтологий и инструментальных средств для создания прикладной онтологии.
-
Разработка прикладной онтологии в системах обработки данных научных и научно - оброазовательных организаций
Авторы: Н.К. Андриевская
Описание: Описана разработка онтологии для научно-методической деятельности на основе комбинированного подхода. Верхний уровень построен с использованием онтологий Dublin Core и FOAF, нижние уровни планируется формировать автоматически. Представлена реализация «базовой» онтологии в Prot?g?, успешно прошедшая проверку резонерами. Вопросы автоматизации и расширения модели оставлены для дальнейшей работы.
-
Разработка архитектурной модели системы управления информационными ресурсами организаций
Авторы: Н.К. Андриевская, А.И. Секирин, О.В. Ченгарь
Описание: Статья рассматривает вопросы архитектурного анализа и создания структурных архитектурных моделей при проектировании информационных систем (ИС). С помощью аппарата формализации была описана архитектура инструментального комплекса на базе известной архитектурной модели “4+1”. В ходе проектирования системы управления информационными ресурсами (СУИР) научно-образовательных организаций были реализованы следующие диаграммы архитектурной модели с использованием нотации UML: функциональная модель ИС (use case diagram), структурная модель системы (package diagram), обобщенная компонентная модель системы (component diagram), модель размещения компонентов системы (deployment diagram), а также формализована обобщенная структурно-функциональная модель системы и ее программных модулей (structural diagram).
-
Анализ возможностей использования существующих словарей для пополнения онтологии
Авторы: Н.К. Андриевская, А.И. Секирин, С.В. Канатуш
Описание: Статья посвящена актуальной проблематике автоматического и полуавтоматического пополнения предметных онтологий новыми понятиями. Предложен подход для формирования нижних уровней онтологии на основе знаний, полученных из словарных определений готовых словарей. Проанализированы источники онтологических описаний предметных областей, в частности, словарь WordNet и его русский аналог RussNet, а также ресурсы Semantic MediaWiki: семантическая Википедия (Wikipedia) и Викисловарь (Wiktionary). Разработан программный модуль, используемый для поиска словарных определений и проверена его работа на тестовых примерах.
-
Экстраполяционные методы прогнозирования закупочных цен лекарств в условиях аптечной сети
Авторы: Н.К. Андриевская, В.А. Светличная
Описание: Одной из постоянных задач менеджера по закупкам является проведение ежедневного анализа закупочных цен поставщика. При решении задачи определения базовой эффективной цены, наиболее подходящей в данный момент для закупки, возникает необходимость прогнозирования данных по историческому массиву цен из прайс-листов. Были проанализированы подходы к прогнозированию и приведено описание методов скользящей средней и экспоненциального сглаживания. Был выполнен краткосрочный прогноз методами экспоненциального сглаживания и методом скользящего среднего и анализ полученных результатов. Проведенные эксперименты показали высокую точность прогнозирования.
-
Основные принципы и подходы при разработке системы управления профессиональными знаниями сотрудников вуза
Авторы: Н.К. Андриевская
Описание: В статье проведен анализ основных подходов и принципов при разработке систем управления знаниями на примере организации – высшего учебного заведения. Приведена и описана функциональная модель системы управления профессиональными знаниями сотрудников вуза в виде Use Case диаграммы, а также выделены основные пользователи информационной системы и разработана их иерархия. Разработана укрупненная метамодель системы управления знаниями сотрудников вуза, ядром которой является онтология. Предложена абстрактная архитектура программного комплекса, базирующегося на разработанной метамодели. В дальнейшем планируется продолжить исследования в заданном направлении.
-
Обобщенная модифицированная модель представления текстовых информационных ресурсов
Авторы: Н.К. Андриевская
Описание: Данная статья посвящена разработке новых эффективных подходов к формированию представлений текстовой информации при реализации задач информационного поиска в различных информационных системах (ИС). Общей проблемой является разреженность и большие объёмы входных данных, что приводит к необходимости уменьшить вычислительную сложность и повысить производительность методов основных процедур обработки данных. Для решения проблемы авторами предлагается использовать обобщенную модифицированную модель представления текста, а также предварительно выполнить редукцию по тематическим векторам, что одновременно уменьшает размерность и увеличивает семантику представления текста. Кроме этого, для усиления семантики предлагается использовать предметную онтологию системы. Это дает возможность многократно использовать ранее обработанные документы в структурированном виде и использовать уже существующие контекстные вектора в процедурах обработки.
-
Использование имитационного моделирования в компьютеризированной системе управления транспортными потоками в условиях большого города
Авторы: Н.К. Андриевская, В.А. Светличная
Описание: В статье рассмотрены вопросы использования имитационного моделирования при регулировании транспортных потоков в крупных городах и динамически изменяющихся условиях. Приведены способы определения рациональных параметров работы светофора и регулирования скорости движения.
-
NoFake на CheckThat! 2021 обнаружение фейковых новостей с помощью BERT
Авторы: Сушма Кумари
Автор перевода: М.С.Токарчуков
Описание: Было проведено много исследований по разоблачению и анализу фейковых новостей. Многие исследователи изучают обнаружение фейковых новостей в последний год, но многие ограничиваются данными социальных сетей. В настоящее время несколько фактчекеров публикуют свои результаты в различных форматах. Кроме того, несколько фактчекеров используют разные метки для фейковых новостей, что затрудняет создание обобщаемого классификатора. С помощью классов слияния можно повысить производительность машинной модели. Эта категоризация домена поможет сгруппировать статью, что поможет сэкономить ручную работу по назначению проверки утверждений. В этой статье мы представили модель классификации на основе BERT для прогнозирования домена и классификации. Мы также использовали дополнительные данные из проверенных фактами статей. Мы достигли макросной оценки F1 в 83,76% для задачи 3A и 85,55% для задачи 3B, используя дополнительные обучающие данные.
-
Гибридное обнаружение фейковых новостей с использованием машинного и глубокого обучения
Авторы: Хеманта Гош, Дипанджан Сен, Сагар Бхарат Шах, Олувафеми Олорунтоба, Чоудари Маниканта Ярраманени, Мохит Киран Манга, Приянк Агарвал
Автор перевода: М.С.Токарчуков
Описание: Стремительное развитие цифровых коммуникационных платформ изменило способы распространения информации по всему миру. Наряду с этим, рост количества ложного или вводящего в заблуждение контента стал серьёзной проблемой для современного общества. Под фейковыми новостями понимают намеренно сфабрикованную или искаженную информацию, которая выдаётся за фактическую, чтобы ввести аудиторию в заблуждение. С развитием систем искусственного интеллекта генерация и распространение фейкового контента стали происходить чаще и сложнее поддаваться обнаружению. В данном исследовании представлена гибридная модель, объединяющая методы машинного и глубокого обучения для эффективного обнаружения фейковых новостей. Гибридная структура сочетает в себе интерпретируемость и возможности извлечения признаков традиционного машинного обучения с контекстной и семантической мощью глубокого обучения. В частности, модель использует частоту терминов – обратную частоту документов (TF IDF) и лингвистические признаки, извлеченные с помощью классических моделей машинного обучения, и интегрирует их с точно настроенной архитектурой BERT для глубокого контекстного анализа.
-
Обнаружение фейковых новостей в социальных сетях с использованием машинного и глубокого обучения
Авторы: Доктор Рамакришнан Раман, Доктор Бабасахеб Джадхав, Доктор Сайед Салман
Автор перевода: М.С.Токарчуков
Описание: Распространение фейковых новостей в социальных сетях (ОСН) представляет серьёзную угрозу общественному дискурсу, демократическим процессам и социальной гармонии. Выявление и сдерживание распространения дезинформации стало критически важной областью исследований, особенно в связи с растущей зависимостью ОСН от потребления новостей. В данном исследовании изучается эффективность методов машинного обучения для выявления фейковых новостей на таких платформах, как Twitter и Facebook. Использованный набор данных включает в себя реальные новостные статьи с маркировкой, полученные из набора данных Kaggle «Fake News Detection», включающего такие текстовые характеристики, как заголовки, основной текст и метаданные
-
Обнаружение фейковых новостей в социальных сетях: Перспектива интеллектуального анализа данных
Авторы: Кай Шу, Эми Слива, Суханг Ван, Цзилианг Тан, Хуан Лю
Автор перевода: М.С.Токарчуков
Описание: Социальные сети для потребления новостей – палка о двух концах. С одной стороны, их низкая стоимость, лёгкий доступ и быстрое распространение информации побуждают людей искать и потреблять новости именно в социальных сетях. С другой стороны, они способствуют широкому распространению «фейковых новостей», то есть новостей низкого качества с заведомо ложной информацией. Широкое распространение фейковых новостей может иметь крайне негативные последствия для отдельных лиц и общества. Поэтому обнаружение фейковых новостей в социальных сетях в последнее время стало новым направлением исследований, привлекающим огромное внимание. Обнаружение фейковых новостей в социальных сетях обладает уникальными характеристиками и сложностями, которые делают существующие алгоритмы обнаружения, применяемые в традиционных новостных СМИ, неэффективными или неприменимыми. Во-первых, фейковые новости намеренно пишутся таким образом, чтобы вводить читателей в заблуждение и заставлять их верить ложной информации, что затрудняет и усложняет их обнаружение на основе новостного контента; поэтому для принятия решения необходимо включать вспомогательную информацию, такую как активность пользователей в социальных сетях. Во-вторых, использование этой вспомогательной информации само по себе сложно, поскольку данные, полученные в результате взаимодействия пользователей с фейковыми новостями, являются объёмными, неполными, неструктурированными и зашумлёнными. Поскольку проблема обнаружения фейковых новостей в социальных сетях является сложной и актуальной, мы провели данный опрос для дальнейшего изучения этой проблемы. В этом опросе мы представляем всесторонний обзор обнаружения фейковых новостей в социальных сетях, включая характеристики фейковых новостей с точки зрения психологии и социальных теорий, существующие алгоритмы с точки зрения интеллектуального анализа данных, оценочные показатели и репрезентативные наборы данных. Мы также обсуждаем смежные области исследований, открытые проблемы и будущие направления исследований в области обнаружения фейковых новостей в социальных сетях.
-
"Лжец, лжец, штаны горят" Новый эталонный набор данных для обнаружения фейковых новостей
Авторы: Уильям Ян Ван
Автор перевода: М.С.Токарчуков
Описание: Автоматическое обнаружение фейковых новостей является сложной проблемой в обнаружении обмана и оказывает огромное влияние на реальную политическую и социальную жизнь. Однако статистические подходы к борьбе с фейковыми новостями были значительно ограничены отсутствием размеченных эталонных наборов данных. В этой статье мы представляем LIAR: новый общедоступный набор данных для обнаружения фейковых новостей. Мы собрали десятилетние, 12,8 тысяч вручную размеченных коротких утверждений в различных контекстах с POLITIFACT.COM, который предоставляет подробный аналитический отчет и ссылки на исходные документы по каждому случаю. Этот набор данных также может использоваться для исследований по проверке фактов. Примечательно, что этот новый набор данных на порядок больше, чем предыдущие крупнейшие общедоступные наборы данных о фейковых новостях подобного типа. Эмпирически мы исследуем автоматическое обнаружение фейковых новостей на основе поверхностных лингвистических паттернов. Мы разработали новую гибридную сверточную нейронную сеть для интеграции метаданных с текстом. Мы показываем, что этот гибридный подход может улучшить модель глубокого обучения, работающую только с текстом.
-
Обнаружение фейковых новостей в социальных сетях с помощью Геометрического глубокого обучения
Авторы: Федерико Монти, Фабрицио Фраска, Давиде Эйнард, Дэймон Мэннион, Майкл М. Бронштейн
Автор перевода: М.С.Токарчуков
Описание: Социальные сети в настоящее время являются одним из основных источников новостей для миллионов людей по всему миру благодаря своей низкой стоимости, лёгкому доступу и быстрому распространению. Однако это достигается за счёт сомнительной надёжности и значительного риска подвергнуться воздействию «фейковых новостей», намеренно написанных для введения читателей в заблуждение. Автоматическое обнаружение фейковых новостей создаёт трудности, которые бросают вызов существующим подходам контент-анализа. Одна из основных причин заключается в том, что интерпретация новостей часто требует знания политического или социального контекста или «здравого смысла», чего до сих пор не хватает современным алгоритмам обработки естественного языка. Недавние исследования эмпирически показали, что фейковые и реальные новости распространяются в социальных сетях поразному, формируя закономерности распространения, которые можно использовать для автоматического обнаружения фейковых новостей. Подходы, основанные на распространении, обладают множеством преимуществ по сравнению с их аналогами, основанными на контенте, среди которых — независимость от языка и повышенная устойчивость к атакам противника. В данной статье мы демонстрируем новую модель автоматического обнаружения фейковых новостей, основанную на геометрическом глубоком обучении. Базовые алгоритмы представляют собой обобщение классических сверточных нейронных сетей на графы, что позволяет объединять разнородные данные, такие как контент, профиль и активность пользователя, социальный граф и распространение новостей. Наша модель была обучена и протестирована на новостных историях, распространяемых в Twitter, проверенных профессиональными организациями по проверке фактов. Наши эксперименты показывают, что структура социальных сетей и распространение являются важными характеристиками, позволяющими с высокой точностью (92,7% ROC AUC) обнаруживать фейковые новости. Во-вторых, мы наблюдаем, что фейковые новости можно надежно обнаруживать на ранней стадии, всего через несколько часов распространения. В-третьих, мы тестируем старение нашей модели на тренировочных и тестовых данных, разделенных во времени. Наши результаты указывают на перспективность подходов, основанных на распространении, для обнаружения фейковых новостей в качестве альтернативы или дополнения к подходам, основанным на контенте.
-
Обнаружение фейковых новостей с использованием машинного обучения и модели BERT
Авторы: Пранали Л. Какад, Пуджа С. Джагтап, Sanskruti S. Mokashi, Rutuja V. Sakat
Автор перевода: М.С.Токарчуков
Описание: В современную компьютерную эпоху экосистема новостей трансформировалась из старых традиционных печатных СМИ в социальные сети. Платформы социальных сетей позволяют нам потреблять новости гораздо быстрее, а менее ограниченное редактирование приводит к распространению фейковых новостей с невероятной скоростью и масштабом. В недавних исследованиях многие полезные методы обнаружения фейковых новостей используют последовательные нейронные сети для кодирования новостного контента и информации на уровне социального контекста, где последовательность текста анализировалась однонаправленным образом. Представлены два новых набора данных фейковых новостей: один, полученный с помощью краудсорсинга и охватывающий шесть новостных доменов, и другой, полученный из интернета, охватывающий знаменитостей. Наши наиболее эффективные модели достигли точности, сопоставимой с человеческой способностью обнаруживать фейковый контент. Двунаправленный подход к обучению является приоритетом для моделирования релевантной информации фейковых новостей, способной улучшить эффективность классификации благодаря возможности улавливать семантические и дистанционные зависимости в предложениях. В данной статье мы предлагаем подход глубокого обучения на основе BERT (FakeBERT) путем объединения различных параллельных блоков однослойной глубокой сверточной нейронной сети (CNN), имеющей различные размеры ядра и фильтры, с BERT
