Пустовой В.А., Ефименко К.Н., Павлыш Э.В. Исследование проблемы злонамеренного использования генеративных нейронных сетей и способы защиты. Рассмотрена проблема злонамеренного использования генеративных нейронных сетей. Определены зловредные действия. Приведены примеры реального использования, а также способы защиты и предотвращения подобных атак в будущем.
Ключевые слова: искусственный интеллект, генеративный ИИ, злонамеренное использование, имперсонификация, способы защиты.
Общая постановка проблемы
Возможности искусственного интеллекта (ИИ) и машинного обучения растут невиданными темпами. Эти технологии находят множество полезных применений, начиная от генерации изображений, аудио и видео, заканчивая анализом медицинских изображений. Множество подобных приложений разрабатывается и улучшается в данный момент [1]. На рисунках 1-2 приведено развитие генеративного ИИ Midjourney за последние 4 года.
Рисунок 1 – Генеративный ИИ Midjourney, версии с 1 по 6
Рисунок 2 – Генеративный ИИ Midjourney V7, выпущенный 3 Апреля 2025 года
Злонамеренное использование генеративного искусственного интеллекта, включая большие языковые модели, представляет собой преднамеренное применение этих технологий с целью причинения вреда людям, организациям или обществу. Такое использование может угрожать цифровой, физической и политической безопасности.
С одной стороны, ИИ способен значительно усилить уже известные типы атак. К ним относятся: фишинговые письма, которые могут стать более персонализированными и убедительными; разработка вредоносного программного обеспечения с помощью ИИ-инструментов, способных автоматизировать поиск уязвимостей; взлом систем и проведение атак социальной инженерии на уровне, превосходящем человеческие способности. Кроме того, уже применяемые средства физического воздействия, например, беспилотники, могут быть модернизированы и вооружены с участием ИИ.
С другой стороны, ИИ открывает путь к новым видам атак, ранее невозможных без этих технологий. К ним относятся автоматизированные и масштабируемые кампании по распространению дезинформации, которые могут быть точно таргетированы и адаптированы под конкретную аудиторию. Создание дипфейков и фальсифицированных мультимедийных материалов, способных подрывать доверие к информации и манипулировать общественным мнением. А также применение ИИ в системах массового наблюдения, тотального профилирования и политических репрессий. Такие угрозы становятся особенно опасными благодаря способности ИИ действовать быстро, скрытно и с высокой степенью адаптивности, затрудняя обнаружение и нейтрализацию подобных атак [2].
Целью данной работы является исследование проблемы использования генеративного ИИ и больших языковых моделей для причинения вреда людям, организациям или обществу. Особое внимание будет уделено примерам реального злонамеренного использования генеративных нейронных сетей, а также способам защиты и предотвращения подобных атак в будущем.
Примеры злонамеренного использования
Активно развиваются инициативы, направленные на документирование и систематизацию инцидентов, связанных с применением ИИ. К таким инициативам относятся AI Incident Database, AI, Algorithmic, and Automation Incidents and Controversies (AIAAIC), а также AI Incidents Monitor, запущенный под эгидой ОЭСР. Эти платформы собирают и классифицируют реальные случаи использования ИИ, сопровождающиеся негативными последствиями, независимо от сферы применения – от медицины и транспорта до информационной безопасности. Они помогают исследователям, политикам и разработчикам технологий лучше понимать, как именно ИИ может быть использован во вред, и вырабатывать подходы к минимизации рисков.
Согласно классификации, представленной в исследовании Generative AI Misuse: A Taxonomy of Tactics and Insights from Real-World Data, все инциденты злонамеренного использования генеративного ИИ можно условно разделить на две основные категории: использование возможностей систем для нанесения вреда (табл. 1), и атаки направленные непосредственно на целостность и поведение модели (табл. 2) [3].
Таблица 1. Виды атак с использованием генеративного ИИ
| Действия | Определение |
|---|---|
| Имперсонификация | Присваивать себе личность реального человека и совершать действия от его имени. |
| Подобие | Использовать или изменять изображение человека или другие его отличительные признаки |
| Sock puppet | Искусственные аккаунты для обмана или манипулирования |
| Фальсификации | Ложное представление фактов, включая отчеты, удостоверения личности, документы |
| Авторское право | Использовать интеллектуальную собственность человека без его разрешения |
| Подделка | Воспроизводить или имитировать оригинальную работу, бренд или стиль и выдавать их за настоящие |
| Масштабирование и усиление | Автоматизация, усовершенствование или масштабирование рабочих процессов |
| Таргетинг и персонализация | Атаки, направленные на конкретный людей |
Таблица 2. Виды атак, направленные на модели
| Действия | Определение |
|---|---|
| Промпт инъекции | Манипуляция запросами к модели для получения нестандартных или запрещённых результатов. |
| Состязательный ввод | Добавление небольших помех на ввод модели для получения искаженных или вредоносных результатов. |
| Jailbreak | Обход фильтров модели для генерации запрещённых результатов. |
| Отклонение модели | Изменение предварительно обученной модели с целью отклонения от ее прямого назначения. |
| Извлечение модели | Получение параметров модели, архитектуры или обучающих данных. |
| Стенография | Скрывать текст в выходных данных модели, чтобы избежать обнаружения. |
| Отравление | Манипуляции с обучающими данными для изменения поведения. |
| Нарушение конфиденциальности | Нарушение конфиденциальности обучающих данных. |
| Нарушение данных | Нарушение безопасности обучающих данных. |
Качественный анализ 200 новостных статей о вредоносном использовании и злоупотреблением генеративного ИИ, опубликованных с января 2023 по март 2024, показал, что 9 из 10 случаев использовали возможности генеративного ИИ для нанесения вреда, а не атаковали модель. Из них большая часть была направлена на имперсонификацию и подобие (22% и 18% соответственно), следующими были масштабирование и усиление с 17%, а также фальсификации с 13%.
Малое количество атак на модели может быть объяснено источником данных – новостные заголовки не могут покрыть случаи, о которых не сообщалось публично. В то время как Jailbreak, промпт инъекции и стенографию тяжело или почти невозможно обнаружить. Таким образом, реальное количество атак может быть значительно больше задокументированных случаев.
На сегодняшний день масштабные и технически сложные атаки на генеративные ИИ-системы, как правило, встречаются лишь в рамках академических исследований и лабораторных экспериментов. Отдельно стоит отметить отравление данных, как используемое не с целью навредить модели, а как инструмент защиты персональных данных и авторского права от обучения.
Выводы
Анализ показал, что значительная часть случаев злоупотребления генеративным ИИ не связана со сложными техническими атаками на сами системы. Напротив, злоумышленники преимущественно используют легко доступные функции моделей, не требующие глубоких знаний или специализированной подготовки. Большинство случаев, такие как мошенничество с имперсонификацией, подделки и искусственные личности, появились ещё до изобретения ИИ и давно использовались для влияния на информационную экосистему и манипулирования другими людьми. Тем не менее, придав этим тактикам новую форму и облегчив доступ к ним, ИИ изменил затраты и стимулы, связанные с манипулированием информацией, что привело к появлению широкого спектра вариантов использования и вовлечения в эту деятельность широкого круга людей.
Для решения этих проблем можно обратиться к опыту смежных областей – в первую очередь к кибербезопасности, где уже выработаны подходы к оценке рисков, реагированию на инциденты и защите данных. Многие из применяемых там принципов – такие как многоуровневая защита, принцип минимальных привилегий, мониторинг активности и аудит действий – могут быть адаптированы к контексту генеративного ИИ.
Социальные сети в настоящее время выступают основными каналами распространения дезинформации и инструментами воздействия на общественное мнение. Видеохостинги, поисковые системы и другие цифровые платформы усиливают эффект воздействия, становясь катализаторами масштабного распространения сгенерированного контента. В условиях широкого применения генеративного ИИ необходимо внедрение механизмов, обеспечивающих прозрачность происхождения цифрового материала, включая обязательную маркировку сгенерированного контента. Наряду с этим, платформы, обрабатывающие и хранящие персональные данные пользователей, должны разработать и внедрить инструменты, препятствующие их несанкционированному использованию в обучении ИИ-моделей. Такие меры представляются ключевыми для предотвращения фальсификаций, защиты цифровой идентичности и обеспечения доверия к информации в условиях стремительной автоматизации медиасреды.
В ответ на меняющийся характер угроз, дадим четыре общие рекомендации:
1. Политики должны тесно сотрудничать с техническими исследователями для изучения, предотвращения и смягчения последствий потенциально вредоносного использования ИИ.
2. Исследователи и инженеры в области искусственного интеллекта должны серьезно относиться к двойному назначению своих работ, позволяя соображениям, связанным с нецелевым использованием, влиять на приоритеты и нормы исследований, а также заблаговременно связываться с соответствующим субъектам, когда можно предвидеть вредоносное применение.
3. Активно стремиться к расширению круга заинтересованных сторон и экспертов в данной области, участвующих в обсуждении этих проблем.
4. Разработка технологических и политических решений, которые помогут в борьбе с злонамеренным использованием ИИ. Развитие систем, определяющих источник происхождения фотографий и видео, защищающих пользовательские данные и авторское право. Их внедрение в популярные видеохостинги и социальные сети.
Предлагаемые меры требуют внимания и действий не только со стороны исследователей ИИ и корпораций, но и со стороны законодателей, государственных служащих, исследователей в области безопасности и регулирующих органов.
Литература
Brundage M., Avin S., Clark J., Toner H., Eckersley P., Garfinkel B., Dafoe A., Scharre P., Zeitzoff T., Filar B., Anderson H., Roff H., Allen G.C., Steinhardt J., Flynn C., Ó hÉigeartaigh S., Beard S.J., Belfield H., Farquhar S., Lyle C., Crootof R., Evans O., Page M., Bryson J., Yampolskiy R., Amodei D. The Malicious Use of Artificial Intelligence: Forecasting, Prevention, and Mitigation / arXiv.org. 2018. [Electronic resourse] / Интернет-ресурс. Режим доступа : URL: https://arxiv.org/abs/1802.07228. - Загл. с экрана.
PowerDMARC. Cybersecurity Risks of Generative AI [Electronic resourse] / Интернет-ресурс. Режим доступа : URL: https://powerdmarc.com/cybersecurity-risks-of-generative-ai/. - Загл. с экрана.
Marchal N., Xu R., Elasmar R., Gabriel I., Goldberg B., Isaac W. Generative AI Misuse: A Taxonomy of Tactics and Insights from Real-World Data / arXiv.org. 2024. [Electronic resourse] / Интернет-ресурс. Режим доступа : URL: https://arxiv.org/abs/2406.13843. - Загл. с экрана.
Пустовой В.А., Ефименко К.Н., Павлыш Э. В. Исследование проблемы злонамеренного использования генеративных нейронных сетей и способы защиты. Рассмотрена проблема злонамеренного использования генеративных нейронных сетей. Определены зловредные действия. Приведены примеры реального использования, а также способы защиты и предотвращения подобных атак в будущем.
Ключевые слова: искусственный интеллект, генеративный ИИ, злонамеренное использование, имперсонификация, способы защиты.
Pustovoi V.A., Efimenko K.N., Pavlish E. V. Research on the malicious use of generative neural networks and protective methods. The problem of malicious use of generative neural networks is considered. Malicious actions are defined. Examples of real use are given, as well as ways to protect and prevent such attacks in the future.
Keywords: artificial intelligence, generative AI, malicious use, impersonification, security methods.