Аннотация
Недавний прогресс в области искусственного интеллекта (ИИ), в частности в сфере больших языковых моделей (Large Language Models, LLM), привёл к появлению мощных и универсальных систем двойного назначения. Этот интеллект может быть направлен на решение широкого круга полезных задач, однако он также может использоваться для причинения вреда. В настоящем исследовании рассматривается один из таких видов вреда — использование LLM для целевого фишинга (spear phishing), формы киберпреступности, основанной на манипулировании жертвами с целью вынудить их раскрыть конфиденциальную информацию. Сначала я анализирую способность LLM содействовать этапам разведки и генерации сообщений в рамках атаки целевого фишинга и показываю, что LLM действительно способны эффективно помогать на этапе создания электронных писем. Затем, чтобы изучить, каким образом LLM потенциально могут быть использованы для масштабирования фишинговых кампаний, я создаю уникальные фишинговые сообщения для более чем 600 членов парламента Великобритании с использованием моделей GPT-3.5 и GPT-4 компании OpenAI. Полученные результаты свидетельствуют о том, что такие сообщения не только выглядят реалистично, но и являются экономически эффективными: стоимость генерации одного письма составляет лишь доли цента. Далее я демонстрирую, как базовые методы prompt engineering позволяют обходить встроенные в LLM защитные механизмы, что подчёркивает необходимость дальнейших исследований, направленных на разработку устойчивых мер предотвращения злоупотреблений моделями. Для реагирования на эти развивающиеся риски я рассматриваю два возможных решения: схемы структурированного доступа, такие как интерфейсы прикладного программирования (API), а также защитные системы на основе LLM.
Ключевые слова: искусственный интеллект · политика ИИ · кибербезопасность · целевой фишинг · крупные языковые модели
1 Введение
Недавний прогресс в области искусственного интеллекта (ИИ) привёл к созданию больших языковых моделей (LLM), способных генерировать человекоподобный текст. Хотя LLM демонстрируют впечатляющие технологические возможности, которые могут быть использованы для широкого спектра полезных целей, их двойственное назначение означает, что они также могут применяться в злонамеренных целях [8].
Одним из заметных рисков, связанных со способностью LLM генерировать связный текст, является возможность использования этих систем для проведения кибератак [2]. Цель данной работы — проанализировать последствия интеграции LLM в ряд компонентов «цепочки кибератаки» (cyber kill chain) — концептуальной модели, описывающей этапы, которые должны пройти киберпреступники для успешной реализации атаки [28]. В частности, внимание сосредоточено на целевом фишинге — виде кибератаки, при котором используется персонализированная информация для манипулирования жертвами с целью получения конфиденциальных данных [12].
Сначала я демонстрирую, каким образом LLM могут помогать на этапе разведки целевой фишинговой атаки, когда злоумышленники собирают персональные данные о целях для создания эффективных сообщений. Затем я показываю, как базовые методы prompt engineering [32] позволяют обходить меры безопасности, реализованные в LLM, побуждая их предоставлять инструкции по осуществлению фишинговых атак. Эти рекомендации включают примеры создания простейших форм вредоносного программного обеспечения («вредоносного ПО») и указания по ключевым принципам, которым должно следовать убедительное фишинговое письмо. В завершение обсуждаются последствия полученных результатов для более широкой области кибербезопасности, а также возможные меры регулирования, которые могут быть оправданы в ответ на данную потенциальную угрозу.
2 Социальная инженерия в киберпреступности
Социальная инженерия представляет собой использование обмана и манипуляции с целью склонить людей к раскрытию конфиденциальной информации либо предоставлению несанкционированного доступа к системам, содержащим такие данные [25]. Манипулирование жертвами с помощью социальной инженерии часто является критически важным этапом успешных кибератак, поскольку киберпреступники способны эксплуатировать как технические, так и социальные уязвимости. Действительно, эффективность социальной инженерии во многом обусловлена тем, что люди зачастую являются наиболее уязвимым элементом систем кибербезопасности [35]. Отчасти по этим причинам атаки, использующие социальную инженерию, являются наиболее распространённой формой интернет-преступности [16]. Успешные атаки социальной инженерии могут приводить к значительным финансовым потерям: по одной из оценок, утечки данных, возникшие в результате подобных атак, в среднем причиняют ущерб более чем на 4 млн долларов США [23].
Популярным методом атак, основанных на социальной инженерии, является фишинг, при котором киберпреступники выдают себя за легитимную сторону, чтобы вызвать доверие и убедить людей раскрыть пароли, перейти по вредоносным ссылкам или вложениям либо перевести денежные средства [12]. Успешная фишинговая атака может иметь катастрофические последствия. Так, в 2014 году хакеры, связанные с правительством Северной Кореи, получили доступ к конфиденциальным данным путём целевого фишинга руководителей компании Sony [4], что привело к ущербу, оцениваемому в диапазоне от 70 до 100 млн долларов США [34]. Другим примечательным примером стал взлом личного электронного почтового ящика руководителя избирательной кампании Хиллари Клинтон на президентских выборах 2016 года, осуществлённый в результате фишинговой атаки, проведённой российскими хакерами [27].
3 Обзор больших языковых моделей
Успех больших нейронных сетей в последние годы привёл к значительным достижениям в области обработки естественного языка. Современные LLM, такие как GPT-3 [7], PaLM [13] и GPT-4 [31], способны генерировать связные абзацы текста, отвечать на детализированные вопросы, рассуждать над сложными задачами и писать программный код, а также выполнять множество других задач, связанных с естественным языком. Огромный успех LLM во многом обусловлен использованием определённой архитектуры нейронных сетей в сочетании с масштабированием, что привело к существенному росту производительности. Как правило, такие модели используют архитектуру трансформеров, применяющую механизмы внимания для понимания взаимосвязей между словами в предложениях [40]. Модели на основе трансформеров способны усваивать сложные закономерности языка в ходе самонаблюдаемого обучения на больших наборах данных. В процессе обучения эти модели преобразуют входной текст в осмысленные векторные представления и генерируют выходной текст, предсказывая следующий токен в последовательности. Примечательно, что кажущаяся простой задача предсказания следующего токена оказалась эффективной основой для создания мощных и универсальных систем ИИ, демонстрирующих всё более сложные способности в широком спектре задач.
В последние годы исследователи обучали всё более крупные модели на всё больших объёмах данных с использованием значительно возросших вычислительных ресурсов — процесс, известный как «масштабирование» [26]. Именно эта стратегия обеспечила значительную часть прогресса в области ИИ за данный период [36]. Благодаря масштабированию LLM смогли решать более широкий круг задач с большей эффективностью даже без существенных изменений базовой архитектуры или методов обучения.
Масштабирование LLM может приводить к возникновению эмерджентных способностей, при которых крупные модели демонстрируют непредсказуемые улучшения производительности по сравнению с меньшими моделями при выполнении определённых задач [43]. Такие эмерджентные явления могут порождать новые риски, с которыми существующие системы защиты не приспособлены справляться [5]. В частности, GPT-4 компании OpenAI продемонстрировала потенциальные риски для кибербезопасности, включая улучшенную способность помогать в социальной инженерии по сравнению с более ранними LLM [30].
Языковые модели, ставшие общедоступными в конце 2022 года, такие как GPT-3.5, открыли качественно новую эпоху для киберпреступников. Относительно примитивные ИИ-системы прошлого часто не обладали возможностями, необходимыми для существенного повышения способности хакеров масштабно создавать убедительный текст. Эти системы требовали значительных знаний, времени и ресурсов для настройки, не обладали достаточными языковыми навыками для реалистичного звучания и не были легко применимы к различным сценариям. Однако вследствие широкого распространения мощных LLM использование ИИ для написания целевых фишинговых писем стало как осуществимым, так и дешёвым.
4 Предыдущие исследования ИИ и социальной инженерии
Хотя различные специалисты по безопасности предупреждали о возможности кибератак, усиленных ИИ [19, 9], подобные обсуждения часто велись на высоком уровне абстракции. Одним из примеров таких предупреждений является широко цитируемый доклад о вредоносном ИИ, опубликованный в 2018 году, в котором утверждалось, что всё более мощные ИИ-системы будут способствовать появлению новых форм автоматизированных атак социальной инженерии [8]. По мнению авторов, по мере роста способности ИИ моделировать подлинное человеческое взаимодействие такие системы смогут осуществлять социальную мимикрию, которую будет трудно распознать даже экспертам.
В докладе также отмечалось, что злоумышленники могут использовать ИИ для увеличения как масштаба, так и степени индивидуализации массовых кампаний социальной инженерии. ИИ может применяться для генерации адаптированного контента — электронных писем, ссылок или вложений — для каждого отдельного адресата в масштабах, недостижимых для людей. Сообщения могут имитировать стиль друзей, коллег, избирателей или контактов получателя, что повышает вероятность взаимодействия с обманным контентом.
Прогресс в области языкового моделирования с 2018 года подтвердил обоснованность этих прогнозов. Современные наиболее производительные LLM способны помогать в таких задачах, как идентификация целей и сбор справочной информации о них, создание персонализированных сообщений и даже разработка базовых форм вредоносного ПО.
Всего пять лет назад создание ИИ-систем, способных осуществлять целевой фишинг, требовало значительных технических навыков и обеспечивало лишь ограниченное улучшение по сравнению с традиционными методами. Например, система SNAP_R — ИИ, использовавший алгоритм кластеризации и рекуррентную нейронную сеть LSTM для генерации целевых фишинговых твитов [37], — требовала существенных усилий для разработки. Хотя она могла генерировать лишь простые твиты, небольшой эксперимент показал, что SNAP_R создавал фишинговые сообщения в шесть раз быстрее человека при сопоставимом уровне кликабельности. Эти результаты, хотя и скромные и, вероятно, немасштабируемые, тем не менее продемонстрировали потенциал ИИ для усиления фишинговых кампаний. Однако последующие достижения в области языкового моделирования привели к появлению широко доступных ИИ-систем, которые могут приближаться к человеческому уровню выполнения (а зачастую и превосходить его) во многих задачах обработки естественного языка, особенно с учётом масштаба. Эти достижения сделали автоматизированные атаки социальной инженерии, обсуждавшиеся в докладе 2018 года, всё более осуществимыми.
Более того, подобные атаки, по-видимому, уже реализуются на практике. В аналитическом отчёте, опубликованном в апреле 2023 года, исследователи компании Darktrace зафиксировали рост числа новых атак социальной инженерии на 135 % среди тысяч активных клиентов в период с января по февраль 2023 года [14]. Авторы связали этот рост с широким распространением чат-ботов на базе LLM, таких как ChatGPT, которые упростили для киберпреступников проведение сложных и убедительных кампаний социальной инженерии в масштабах.
5 Как LLM могут использоваться для кибератак
Современные LLM способны генерировать человекоподобный язык, который может быть использован для создания персонализированных целевых фишинговых сообщений всего за несколько центов. В приложении A показано, как новейшие модели OpenAI и Anthropic превосходят более ранние и менее мощные модели по уровню сложности. Передовые LLM, такие как GPT-4 и GPT-3.5, демонстрируют явные преимущества по сравнению с GPT-3 в генерации убедительных, персонализированных и человекоподобных фишинговых атак. Кроме того, стоимость генерации таких писем была минимальной для всех моделей, а время, необходимое для создания каждого письма, — пренебрежимо малым. Используя Claude — наиболее мощную модель компании Anthropic, — злоумышленник может сгенерировать пакет из 1000 целевых фишинговых писем всего за 10 долларов США менее чем за 2 часа.
5.1 Процесс и примеры создания сообщений
В данном разделе я иллюстрирую процесс генерации персонализированных писем для массовой фишинговой кампании путём передачи общедоступных данных о членах парламента Великобритании в языковые модели OpenAI, доступные через API. Эта демонстрация показывает, каким образом LLM могут улучшить три ключевых этапа успешной фишинговой кампании: сбор (collect), контакт (contact) и компрометацию (compromise) [6].
5.2 Сбор
Эффективность целевого фишинга во многом обусловлена его персонализированным характером, поскольку адаптация сообщений существенно повышает вероятность того, что получатели откроют письмо и предпримут необходимые действия [11]. Соответственно, первый этап фишинговой кампании заключается в сборе информации о цели для повышения вероятности успеха атаки. Этот процесс трудоёмок, поскольку проведение фонового исследования требует больше усилий, чем рассылка одинаковых сообщений большому числу адресатов. Однако вследствие относительно низкой предельной стоимости использования генеративных ИИ-моделей для составления целевых писем разница в трудозатратах между фишингом и целевым фишингом существенно сократилась.
Снижение предельной стоимости генерации целевых фишинговых писем может иметь значительные последствия для глобального ландшафта кибербезопасности. Например, существует тактическое различие между злоумышленниками, использующими масштабируемые атаки, и теми, кто применяет немасштабируемые подходы [20]. Хакер, выбирающий немасштабируемую кампанию — при которой персонализация влечёт расходы на каждого пользователя, — вынужден тщательно отбирать цели. Поскольку распределения власти, ценности и богатства, как правило, подчиняются степенному закону, злоумышленник сосредотачивает усилия на наиболее ценных индивидах — тех, кто находится в верхней части распределения. Несмотря на форму этих распределений, LLM могут радикально снизить стоимость атаки на одного пользователя, делая экономически целесообразным нацеливание на более широкий сегмент пользователей с индивидуализированными атаками, а не только на наиболее привлекательные цели.
LLM могут помогать на этапе сбора, создавая внешне правдоподобные сообщения на основе неструктурированного биографического текста о цели. В данном примере я использовал GPT-4 для написания простого Python-скрипта, который извлекал данные со страниц Википедии всех британских парламентариев, избранных в 2019 году. Затем я передал эти неструктурированные данные в GPT-3.5, попросив его сгенерировать биографии каждого депутата. Создавая персонализированные письма со ссылками на регион, политическую партию, личные интересы и другие детали, языковые модели фактически реализуют этап контакта в рамках фишинговой кампании.
5.3 Контакт
После проведения фоновой разведки следующим этапом является генерация атаки и установление контакта с целью. И здесь генеративные модели могут помогать киберпреступникам. Многие современные LLM, такие как GPT-4, обучены отказываться от вредоносных запросов (например, «сгенерируй целевое фишинговое письмо») в результате процесса обучения с подкреплением на основе обратной связи от людей (Reinforcement Learning from Human Feedback, RLHF) [30].
Одним из обходных путей является просьба к модели предложить характеристики, определяющие успешное фишинговое письмо, а затем включение этих характеристик в начало запроса в виде набора принципов. Для оценки знаний GPT-4 я попросил модель сформулировать качественные характеристики эффективного целевого фишингового письма. После этого я сопоставил наиболее перспективные принципы с существующей научной литературой по фишингу и пришёл к выводу, что модель корректно описала ряд желательных характеристик, включая:
Персонализация. Включение в письма персональной информации о получателе — имени, должности, личных интересов, прошлых проектов — повышает вероятность открытия письма и перехода по ссылкам или вложениям [10, 15].
Контекстуальная релевантность. Соответствие содержания письма текущему контексту деятельности получателя повышает вероятность отклика. Например, упоминание корпоративного объявления или проекта, в котором участвовал адресат, помогает создать ощущение достоверности отправителя. Выдавание себя за знакомого или коллегу значительно увеличивает вероятность того, что цель станет жертвой целевого фишинга [25].
Психология. Человеческая психология может быть использована в интересах злоумышленника путём манипулирования такими эмоциями, как страх, жадность, любопытство и чувство срочности [1, 21].
Авторитет. Имитация фигуры, перед которой адресат несёт ответственность, может усилить ощущение давления и побудить к действию [29].
Определив ключевые элементы успешного фишингового письма и собрав персональную информацию о предполагаемой цели, следующей задачей стала генерация писем в масштабе. Для этого я объединил выявленные принципы и биографические данные цели в одном запросе.
Приведённые ниже примеры содержат образцы писем, сгенерированных GPT-4, GPT-3.5 и GPT-3 для одного из членов парламента Великобритании. В то время как GPT-3.5 оказался довольно расплывчатым, GPT-4 продемонстрировал более глубокое знание личных деталей министра, включая его предыдущий профессиональный опыт и происхождение из семьи, связанной с профсоюзным движением. Язык письма, созданного GPT-4, также явно апеллирует к ценностям депутата и его прогрессивным политическим взглядам как члена Лейбористской партии, включая стремление к сокращению неравенства.
Отдельные фрагменты этих писем, безусловно, можно охарактеризовать как преувеличенные или искусственные, однако приведённые примеры всё же демонстрируют способность моделей генерировать человекоподобный текст, учитывающий личные данные, приоритеты и мотивацию цели. Разница в качестве между GPT-3 и GPT-4 наглядно иллюстрирует поразительные темпы прогресса генеративных ИИ-моделей всего за последний год.
5.3.1 Модели с открытым исходным кодом
После анализа различий в качестве между GPT-3 и GPT-4 я также исследовал производительность LLM с открытым исходным кодом. На момент написания данной статьи в начале 2023 года одной из наиболее мощных доступных моделей с открытым исходным кодом являлась oasst-sft-6-llama-30b — дообученная версия модели LLaMA компании Meta с 30 млрд параметров [39]. Эта модель была доступна через платформу HuggingChat, созданную компанией Hugging Face для размещения чат-ботов с открытым исходным кодом [22].
При поверхностном анализе письмо, сгенерированное этой моделью, демонстрирует уровень качества, сопоставимый с GPT-3.5. Однако следует отметить, что модель характеризовалась большей вариативностью ответов: некоторые из них были слабыми, некоторые — относительно убедительными, а другие не имели явной релевантности. Хотя она не достигала уровня сложности, продемонстрированного GPT-4, тем не менее данная модель может рассматриваться как инструмент, потенциально пригодный для эксплуатации киберпреступниками в рамках фишинговых кампаний.
5.4 Компрометация
Как было показано выше, LLM могут использоваться для проведения исследований целей и генерации персонализированных фишинговых атак. Однако они также могут применяться для разработки вредоносного программного обеспечения — большая часть которого на практике распространяется через вредоносные вложения в электронных письмах [41], — способного компрометировать конфиденциальную информацию жертв.
Для дальнейшей оценки рисков для кибербезопасности, связанных с LLM, я исследовал способность GPT-4 генерировать код макросов VBA, предназначенный для злонамеренного использования. Офисные документы, такие как файлы Microsoft Word, могут содержать встроенные макросы, которые автоматически выполняют код при открытии документа. После выполнения вредоносного кода злоумышленник может скомпрометировать систему жертвы. Представившись «исследователем в области кибербезопасности», проводящим «учебный» эксперимент, я смог успешно побудить GPT-4 сгенерировать базовый макрос VBA, который при выполнении загружает вредоносную нагрузку с внешнего URL и затем запускает файл на компьютере жертвы. Хотя этот пример не доказывает, что LLM способны разрабатывать сложное вредоносное ПО, радикально меняющее ландшафт кибербезопасности, он подчёркивает сложность предотвращения «взлома» моделей с целью злонамеренного использования.
Киберпреступники, по-видимому, обратили внимание на эти возможности. Уже через несколько месяцев после выхода ChatGPT появилось множество примеров обсуждений среди хакеров способности модели помогать в генерации вредоносного ПО [24]. Хотя большая часть такого кода примитивна и почти наверняка уступает вредоносным программам, уже доступным в интернете, LLM, тем не менее, правдоподобно снизили порог входа для менее квалифицированных злоумышленников, желающих запускать целевые фишинговые кампании.
6 Обсуждение
На данном этапе я продемонстрировал, каким образом LLM могут быть интегрированы на протяжении всей цепочки кибератаки для эффективного масштабирования целевых фишинговых кампаний. В частности, LLM помогают смягчить три ключевые проблемы, с которыми сталкиваются киберпреступники:
Когнитивная нагрузка. Написание персонализированных фишинговых писем требует значительных усилий, и передача этой задачи LLM позволяет получать письма, выглядящие как написанные человеком, при минимальном участии злоумышленника. Кроме того, LLM, как правило, не допускают орфографических ошибок, могут работать круглосуточно без признаков усталости и легко обрабатывают большие объёмы неструктурированных данных на этапе разведки.
Финансовые издержки. Использование LLM для генерации фишинговых писем существенно снижает предельную стоимость каждой попытки атаки с точки зрения финансовых ресурсов. Письмо может быть сгенерировано менее чем за один цент с помощью GPT-3.5 и за несколько центов — с использованием более продвинутых моделей, таких как GPT-4. По мере дальнейшего удешевления «интеллекта» эти затраты будут становиться всё менее значимыми.
Требования к навыкам. Злоумышленники с относительно низким уровнем подготовки могут извлечь выгоду из использования LLM для масштабной генерации убедительных фишинговых писем. LLM берут на себя трудоёмкие элементы фишинговых кампаний, позволяя атакующим сосредоточиться на более высокоуровневом планировании.
6.1 Проблемы управления LLM
Политикам, стремящимся снизить риск злоупотреблений, следует учитывать многочисленные сложности, связанные с управлением ИИ-системами. Управление ИИ затруднено тем, что современные передовые системы имеют двойственное назначение. В частности, из-за доминирующей парадигмы обучения LLM на больших объёмах данных с использованием неконтролируемого обучения сложно создавать системы, чьи возможности были бы направлены исключительно на позитивное применение. Как было показано выше, интеллект является ценным ресурсом для различных этапов цепочки кибератаки: он помогает в разведке, создании персонализированных фишинговых атак и разработке примитивных форм вредоносного ПО. По мере совершенствования моделей, вероятно, будут возникать и новые риски.
Акторы, ответственные за предотвращение злоупотреблений LLM, оказываются в сложном положении, поскольку для модели запрос на генерацию письма для фишинговой кампании трудно отличим от запроса, используемого в маркетинговых целях. Прямое вмешательство на уровне модели, вероятно, будет неэффективным, поскольку механизмы «добросовестности», внедрённые в процессе RLHF, зачастую легко обходятся с помощью изощрённого prompt engineering.
Предотвращение фишинга путём фильтрации данных, используемых для предварительного обучения моделей, также сопряжено с серьёзными проблемами. Например, каким образом можно гарантировать, что удаление определённых частей обучающих наборов данных приведёт к созданию моделей, неспособных писать фишинговые письма, но при этом компетентных в написании безвредных сообщений? В силу этих практических ограничений меры регулирования, сосредоточенные исключительно на уровне модели, вряд ли обеспечивают благоприятный баланс между предотвращением злоупотреблений и сохранением полезности (Misuse–Use Tradeoff) [2]. Иными словами, такие грубые меры регулирования с высокой вероятностью будут чрезмерно подавлять как полезное использование, так и злоупотребления, с неприемлемой степенью неточности.
Кроме того, полное прекращение всех фишинговых атак является крайне амбициозной, если не невозможной, целью. Киберпространство огромно, а преступники постоянно адаптируют свои стратегии, что делает полное искоренение фишинга и других форм киберпреступности практически недостижимым. Более реалистичной целью является снижение вреда. В разделе 7 рассматриваются два возможных решения, которые могут способствовать достижению этой цели.
6.2 ИИ-атаки в будущем
Важно подчеркнуть, что электронная почта — не единственный канал коммуникации, через который киберпреступники могут эксплуатировать жертв. Уже имеются свидетельства того, что мошенники начали использовать ИИ для создания убедительных голосовых клонов людей, с помощью которых они вводят цели в заблуждение, заставляя поверить, что их родственники находятся в опасности [42]. По мере того как генеративные ИИ-системы становятся всё более мощными в различных каналах коммуникации, будущие исследования будут необходимы для выявления, оценки и смягчения потенциальных рисков и новых векторов атак, которые могут возникнуть в этих областях.
В перспективе киберпреступники получат возможность автоматизировать всё более сложные кампании взлома и обмана с минимальным или нулевым участием человека. Уже сейчас экспериментальные системы, такие как Auto-GPT, демонстрируют потенциал ИИ-моделей связывать запросы в цепочки и преследовать цели с открытым концом [33]. Например, агентным системам могут ставиться задачи общего характера, такие как «взломать эту систему» или «отправить целевое фишинговое письмо каждому члену Конгресса США». Используя более сложные тактики, включая ведение диалога с жертвами на естественном языке, ИИ-агенты могут усыплять бдительность жертв, формируя ложное чувство доверия и знакомства перед началом атаки. В дальнейшем использование LLM для масштабирования фишинговых кампаний может оказаться лишь началом тех видов киберпреступлений, которые станет возможным осуществлять с помощью ИИ.
7 Потенциальные решения
7.1 Схемы структурированного доступа
Ответственное предоставление LLM может предполагать использование схем структурированного доступа [38], таких как интерфейсы прикладного программирования (API). Эти методы обеспечивают контролируемое взаимодействие между ИИ-системами и пользователями, снижая вероятность причинения вреда или обхода условий использования. API также могут способствовать реализации стратегий управления, направленных на блокировку или санкционирование злоумышленников. Например, поставщики LLM могут сотрудничать с правоохранительными органами для отслеживания контента, используемого в преступных целях, путём анализа пользовательских запросов и последующего связывания их с конкретными нарушителями.
Схемы структурированного доступа также позволяют реализовывать более тонкие меры вмешательства, такие как использование нескольких уровней LLM для оценки входных запросов на предмет потенциального вреда. Один из подходов заключается в применении меньшей LLM, специально дообученной для классификации пользовательских запросов по уровням риска. Запросы с высоким уровнем риска, например подозреваемые в использовании для фишинговых атак, могут затем подвергаться дополнительной проверке более продвинутыми моделями. Эти модели способны анализировать ввод пользователя на предмет злонамеренной активности и помечать пользователей, подозреваемых в нарушении условий использования.
Однако следует подчеркнуть, что выпуск мощных LLM с открытым исходным кодом может поставить под угрозу реализуемость стратегий управления, в значительной степени опирающихся на структурированный доступ. Если пользователи получают неограниченный и неконтролируемый доступ к продвинутым ИИ-моделям, поставщики теряют значительную часть возможностей по вмешательству в способы использования таких моделей. Более того, пользователи могут модифицировать модели с открытым исходным кодом для повышения их эффективности в злонамеренных сценариях, дообучая их на тщательно подобранных наборах данных с примерами вредоносного поведения. Таким образом, сама открытость, обеспечивающая позитивные применения LLM с открытым исходным кодом, одновременно позволяет злоумышленникам использовать эти системы более скрытно.
Это, однако, не означает, что от схем структурированного доступа следует отказаться как от стратегии управления. Пока разрыв между моделями с открытым и закрытым исходным кодом на переднем крае остаётся существенным, использование структурированного доступа для предотвращения причинения вреда наиболее производительными моделями сохраняет свою ценность. Тем не менее политикам не следует поспешно регулировать модели с открытым исходным кодом без более чёткого понимания их потенциала для злоупотреблений и возможных мер защиты от соответствующих рисков. На момент написания данной статьи не существует значительных доказательств того, что открытые языковые модели способны причинять существенный вред, облегчая киберпреступность в масштабе, однако быстрые темпы прогресса ИИ требуют постоянного мониторинга и стратегического предвидения. Крайне важно, чтобы стратегии управления могли проактивно учитывать возникающие риски по мере роста возможностей и распространения передовых моделей с открытым исходным кодом, прежде чем значительный ущерб станет реальностью.
7.2 Защитные системы на основе LLM
Усиление защиты электронной почты с помощью ИИ является устоявшейся практикой. Например, исследователи безопасности Google разработали алгоритм, который помечает потенциально вредоносные сообщения и задерживает их доставку для проведения дополнительных проверок [17]. LLM могут усилить такие системы, предоставляя новые возможности для проактивной защиты от тех угроз, которые эти же модели способны создавать. Защитные системы, использующие LLM, могут анализировать входящие письма и выявлять фишинговые атаки или другие формы вредоносного контента [2]. В качестве простейшего примера такие системы могут обнаруживать использование обманных URL (например, «gooogle.com» вместо «google.com») — тактики, часто применяемой киберпреступниками [3].
Кроме того, LLM способны анализировать входящие сообщения и сопоставлять их с предыдущей перепиской от известных контактов. Это позволяет выявлять несоответствия в стиле письма или отмечать подозрительные адреса отправителей, облегчая пользователям обнаружение потенциальных угроз. Дополнительное дообучение LLM на примерах фишинговых писем может ещё больше повысить точность выявления подобных атак. По сути, LLM могут быть спроектированы так, чтобы проверять каждое входящее письмо более тщательно, чем это практически возможно для человека. Киберпреступники часто рассчитывают на ограниченное внимание и когнитивные ресурсы получателей, однако LLM, систематически анализирующие письма на наличие вредоносных признаков, могут помочь преодолеть эти ограничения. При дальнейшем развитии системы на основе LLM могут стать весьма эффективными в выявлении даже самых изощрённых фишинговых атак. Уже сейчас наблюдается внедрение подобных технологий в защитных целях. Так, в 2023 году Google объявила о запуске Sec-PaLM — LLM, специально дообученной для задач, связанных с кибербезопасностью [18].
8 Заключение
В данной работе рассмотрены последствия интеграции LLM в различные этапы цепочки кибератаки, включая сбор, контакт и компрометацию. Проверяя эффективность использования LLM для написания целевых фишинговых писем, я прихожу к выводу, что передача задачи генерации персонализированных и внешне человекоподобных писем LLM может повысить эффективность киберпреступников.
Реалистичные фишинговые письма могут генерироваться быстро и с минимальными затратами. Инфраструктура, необходимая для создания значительных объёмов целевых фишинговых писем, теперь может быть разработана и развернута с относительной лёгкостью даже акторами с ограниченными техническими знаниями и финансовыми ресурсами. Несмотря на отсутствие формального образования в области кибербезопасности, я смог выполнить ключевые этапы массовой фишинговой кампании всего за несколько часов, включая разработку запроса, сбор фоновой информации о целях и генерацию сотен писем. После создания первоначальной инфраструктуры её можно адаптировать и повторно использовать для последующих кампаний с минимальными дополнительными усилиями. По мере масштабирования кампаний средняя стоимость одного письма быстро приближается к затратам на инференс LLM — затратам, которые будут и дальше снижаться по мере повышения эффективности алгоритмов и удешевления вычислительных ресурсов.
Проблемы управления, связанные с реагированием на эти возникающие риски, потенциально весьма значительны. В силу двойственного назначения LLM сложно создать модели, которые направляли бы свои интеллектуальные возможности исключительно на позитивные применения. Вмешательства на уровне модели могут оказаться недостаточными для предотвращения злонамеренного использования этих систем, что демонстрируется лёгкостью, с которой удалось обойти встроенные защитные механизмы с помощью базового prompt engineering. Вместо этого разработчикам ИИ и специалистам по безопасности следует стремиться к созданию эмпирически обоснованных мер безопасности, обеспечивающих баланс между поощрением полезных применений LLM и предотвращением злоупотреблений.
Одной из возможных систем управления, успешно балансирующей между этими целями, является регулирование на уровне доступа и взаимодействия. Внедрение схем структурированного доступа позволяет организациям тщательно контролировать способы взаимодействия пользователей с ИИ-системами, обеспечивая соблюдение правил и содействие правоохранительным органам в отслеживании проблемного пользовательского контента, при этом не препятствуя легитимному использованию LLM добросовестными пользователями. Кроме того, специалистам по безопасности следует изучать возможности применения LLM в защитных целях, например для фильтрации электронной почты на наличие вредоносного содержимого.
Благодарности
Я выражаю благодарность Леннарту Хайму, Джеффри Лэдишу и Ди Кук за полезные комментарии и обсуждения. Также я благодарю Claude, ChatGPT и GPT-4 за вклад в подготовку данной статьи.
Литература
[1] Ahmed Aleroud and Lina Zhou. Phishing environments, techniques, and countermeasures: A survey. Computers & Security, 68:160–196, July 2017.
[2] Markus Anderljung and Julian Hazell. Protecting society from ai misuse: when are restrictions on capabilities warranted?, March 2023.
[3] A. Banerjee, D. Barman, M. Faloutsos, and L. N. Bhuyan. Cyber-Fraud is One Typo Away. In IEEE INFOCOM 2008 - The 27th Conference on Computer Communications, pages 1939–1947, April 2008.
[4] David Bisson. Sony Hackers Used Phishing Emails to Breach Company Networks \textbar Tripwire, April 2015.
[5] Rishi Bommasani, Drew A. Hudson, Ehsan Adeli, Russ Altman, Simran Arora, Sydney von Arx, Michael S.Bernstein, Jeannette Bohg, Antoine Bosselut, Emma Brunskill, Erik Brynjolfsson, Shyamal Buch, Dallas Card, Rodrigo Castellon, Niladri Chatterji, Annie Chen, Kathleen Creel, Jared Quincy Davis, Dora Demszky, Chris Donahue, Moussa Doumbouya, Esin Durmus, Stefano Ermon, John Etchemendy, Kawin Ethayarajh, Li Fei-Fei, Chelsea Finn, Trevor Gale, Lauren Gillespie, Karan Goel, Noah Goodman, Shelby Grossman, Neel Guha, Tatsunori Hashimoto, Peter Henderson, John Hewitt, Daniel E. Ho, Jenny Hong, Kyle Hsu, Jing Huang, Thomas Icard, Saahil Jain, Dan Jurafsky, Pratyusha Kalluri, Siddharth Karamcheti, Geoff Keeling, Fereshte Khani, Omar Khattab, Pang Wei Koh, Mark Krass, Ranjay Krishna, Rohith Kuditipudi, Ananya Kumar, Faisal Ladhak, Mina Lee, Tony Lee, Jure Leskovec, Isabelle Levent, Xiang Lisa Li, Xuechen Li, Tengyu Ma, Ali Malik, Christopher D. Manning, Suvir Mirchandani, Eric Mitchell, Zanele Munyikwa, Suraj Nair, Avanika Narayan, Deepak Narayanan, Ben Newman, Allen Nie, Juan Carlos Niebles, Hamed Nilforoshan, Julian Nyarko, Giray Ogut, Laurel Orr, Isabel Papadimitriou, Joon Sung Park, Chris Piech, Eva Portelance, Christopher Potts, Aditi Raghunathan, Rob Reich, Hongyu Ren, Frieda Rong, Yusuf Roohani, Camilo Ruiz, Jack Ryan, Christopher Ré, Dorsa Sadigh, Shiori Sagawa, Keshav Santhanam, Andy Shih, Krishnan Srinivasan, Alex Tamkin, Rohan Taori, Armin W. Thomas, Florian Tramèr, Rose E. Wang, William Wang, Bohan Wu, Jiajun Wu, Yuhuai Wu, Sang Michael Xie, Michihiro Yasunaga, Jiaxuan You, Matei Zaharia, Michael Zhang, Tianyi Zhang, Xikun Zhang, Yuhui Zhang, Lucia Zheng, Kaitlyn Zhou, and Percy Liang. On the opportunities and risks of foundation models, July 2022.
[6] Michael Bossetta. The weaponization of social media: spear phishing and cyberattacks on democracy. Technical report, Journal of International Affairs, September 2018.
[7] Tom B. Brown, Benjamin Mann, Nick Ryder, Melanie Subbiah, Jared Kaplan, Prafulla Dhariwal, Arvind Neelakantan, Pranav Shyam, Girish Sastry, Amanda Askell, Sandhini Agarwal, Ariel Herbert-Voss, Gretchen Krueger, Tom Henighan, Rewon Child, Aditya Ramesh, Daniel M. Ziegler, Jeffrey Wu, Clemens Winter, Christopher Hesse, Mark Chen, Eric Sigler, Mateusz Litwin, Scott Gray, Benjamin Chess, Jack Clark, Christopher Berner, Sam McCandlish, Alec Radford, Ilya Sutskever, and Dario Amodei. Language models are few-shot learners, July 2020.
[8] Miles Brundage, Shahar Avin, Jack Clark, Helen Toner, Peter Eckersley, Ben Garfinkel, Allan Dafoe, Paul Scharre, Thomas Zeitzoff, Bobby Filar, Hyrum Anderson, Heather Roff, Gregory C. Allen, Jacob Steinhardt, Carrick Flynn, Seán Ó hÉigeartaigh, Simon Beard, Haydn Belfield, Sebastian Farquhar, Clare Lyle, Rebecca Crootof, Owain Evans, Michael Page, Joanna Bryson, Roman Yampolskiy, and Dario Amodei. The malicious use of artificial intelligence: forecasting, prevention, and mitigation, February 2018.
[9] Ben Buchanan, John Bansemer, Dakota Cary, Jack Lucas, and Micah Musser. Automating cyber attacks. Technical report, Center for Security and Emerging Technology, 2020.
[10] Jan-Willem Bullee, Lorena Montoya, Marianne Junger, and Pieter Hartel. Spear phishing in organisations explained. Information & Computer Security, 25(5):593–613, January 2017.
[11] A. J. Burns, M. Eric Johnson, and Deanna D. Caputo. Spear phishing in a barrel: Insights from a targeted phishing campaign. Journal of Organizational Computing and Electronic Commerce, 29(1):24–39, January 2019.
[12] Deanna D. Caputo, Shari Lawrence Pfleeger, Jesse D. Freeman, and M. Eric Johnson. Going spear phishing: exploring embedded training and awareness. IEEE Security & Privacy, 12(1):28–38, January 2014. [13] Aakanksha Chowdhery, Sharan Narang, Jacob Devlin, Maarten Bosma, Gaurav Mishra, Adam Roberts, Paul Barham, Hyung Won Chung, Charles Sutton, Sebastian Gehrmann, Parker Schuh, Kensen Shi, Sasha Tsvyashchenko, Joshua Maynez, Abhishek Rao, Parker Barnes, Yi Tay, Noam Shazeer, Vinodkumar Prabhakaran, Emily Reif, Nan Du, Ben Hutchinson, Reiner Pope, James Bradbury, Jacob Austin, Michael Isard, Guy Gur-Ari, Pengcheng Yin, Toju Duke, Anselm Levskaya, Sanjay Ghemawat, Sunipa Dev, Henryk Michalewski, Xavier Garcia, Vedant Misra, Kevin Robinson, Liam Fedus, Denny Zhou, Daphne Ippolito, David Luan, Hyeontaek Lim, Barret Zoph, Alexander Spiridonov, Ryan Sepassi, David Dohan, Shivani Agrawal, Mark Omernick, Andrew M. Dai, Thanumalayan Sankaranarayana Pillai, Marie Pellat, Aitor Lewkowycz, Erica Moreira, Rewon Child, Oleksandr Polozov, Katherine Lee, Zongwei Zhou, Xuezhi Wang, Brennan Saeta, Mark Diaz, Orhan Firat, Michele Catasta, Jason Wei, Kathy Meier-Hellstern, Douglas Eck, Jeff Dean, Slav Petrov, and Noah Fiedel. Palm: scaling language modeling with pathways, October 2022.
[14] Darktrace. Generative AI: Impact on Email Cyber-Attacks.
[15] FBI. Fbi warns public that cyber criminals continue to use spear-phishing attacks to compromise computer networks, July 2013.
[16] FBI. Internet crime report 2020. Technical report, 2020.
[17] Google. A new Gmail security feature that improves the early detection of phishing attempts for G Suite users, May 2017. Publication Title: Google Workspace Updates.
[18] Google. How Google Cloud plans to supercharge security with generative AI, April 2023. Publication Title: Google Cloud Blog.
[19] Blessing Guembe, Ambrose Azeta, Sanjay Misra, Victor Chukwudi Osamor, Luis Fernandez-Sanz, and Vera Pospelova. The emerging threat of ai-driven cyber attacks: a review. Applied Artificial Intelligence, 36(1):2037254, December 2022.
[20] Cormac Herley. The plight of the targeted attacker in a world of scale. 2010.
[21] Jason Hong. The state of phishing attacks. Communications of the ACM, 55(1):74–81, January 2012.
[22] Hugging Face. HuggingChat.
[23] IBM Security. Cost of a data breach report 2020. Technical report, 2020.
[24] Insikt Group. I, chatbot. Technical report, Recorded Future, January 2023.
[25] Tom N. Jagatic, Nathaniel A. Johnson, Markus Jakobsson, and Filippo Menczer. Social phishing. Communications of the ACM, 50(10):94–100, October 2007.
[26] Jared Kaplan, Sam McCandlish, Tom Henighan, Tom B. Brown, Benjamin Chess, Rewon Child, Scott Gray, Alec Radford, Jeffrey Wu, and Dario Amodei. Scaling laws for neural language models, January 2020.
[27] Eric Lipton, David E. Sanger, and Scott Shane. The perfect weapon: how russian cyberpower invaded the u. S. The New York Times, December 2016. Section: U.S.
[28] Lockheed Martin. Cyber kill chain®. Publication Title: Lockheed Martin.
[29] National Cyber Security Center. Phishing attacks: defending your organisation, February 2018.
[30] OpenAI. Gpt-4 system card. Technical report, March 2023.
[31] OpenAI. Gpt-4 technical report, March 2023.
[32] Laria Reynolds and Kyle McDonell. Prompt programming for large language models: beyond the few-shot paradigm, February 2021.
[33] Toran Bruce Richards. Auto-GPT: An Autonomous GPT-4 Experiment, May 2023.
[34] Lisa Richwine. Cyber attack could cost Sony studio as much as $100 million. Reuters, December 2014. Section: Media Industry.
[35] Fatima Salahdine and Naima Kaabouch. Social Engineering Attacks: A Survey. Future Internet, 11(4):89, April 2019. Number: 4 Publisher: Multidisciplinary Digital Publishing Institute.
[36] Jaime Sevilla, Lennart Heim, Anson Ho, Tamay Besiroglu, Marius Hobbhahn, and Pablo Villalobos. Compute trends across three eras of machine learning, March 2022.
[37] John Seymour and Philip Tully. Generative models for spear phishing posts on social media, February 2018.
[38] Toby Shevlane. Structured access: an emerging paradigm for safe AI deployment, April 2022.
[39] Hugo Touvron, Thibaut Lavril, Gautier Izacard, Xavier Martinet, Marie-Anne Lachaux, Timothée Lacroix, Baptiste Rozière, Naman Goyal, Eric Hambro, Faisal Azhar, Aurelien Rodriguez, Armand Joulin, Edouard Grave, and Guillaume Lample. LLaMA: Open and Efficient Foundation Language Models, February 2023.
[40] Ashish Vaswani, Noam Shazeer, Niki Parmar, Jakob Uszkoreit, Llion Jones, Aidan N. Gomez, Lukasz Kaiser, and Illia Polosukhin. Attention is all you need, December 2017.
[41] Verizon. 2017 data breach investigations report. Technical report, 2017.
[42] Pranshu Verma. They thought loved ones were calling for help. It was an AI scam. Washington Post, March 2023.
[43] Jason Wei, Yi Tay, Rishi Bommasani, Colin Raffel, Barret Zoph, Sebastian Borgeaud, Dani Yogatama, Maarten Bosma, Denny Zhou, Donald Metzler, Ed H. Chi, Tatsunori Hashimoto, Oriol Vinyals, Percy Liang, Jeff Dean, and William Fedus. Emergent abilities of large language models, October 2022.