Реферат по теме выпускной работы
Содержание
- Введение
- 1. Анализ проблематики автоматизации современных операционных систем
- 1.1. Проблемы эффективности пользовательского взаимодействия с интерфейсом
- 1.2. Ограничения традиционных методов автоматизации
- 2. Обзор эволюции методов интеллектуального управления
- 2.1. Классификация этапов развития языковых моделей
- 2.2. Принципы построения агентных рабочих процессов
- 3. Архитектурные особенности интеграции ИИ в операционные системы
- 3.1. Абстракция ядра LLM и системные вызовы
- 3.2. Методы управления контекстом и памятью агентов
- 3.3. Подсистемы виртуализации и изоляции среды выполнения
- 4. Классификация и методы оркестрации специализированных агентов
- 4.1. Функциональная типология агентов в операционной среде
- 4.2. Модели организации меж-агентного взаимодействия
- 5. Технические методы взаимодействия с графическим интерфейсом и данными
- 5.1. Визуальные методы анализа интерфейса
- 5.2. Структурные методы на основе деревьев доступности
- 5.3. Протоколы стандартизации обмена данными (MCP)
- Выводы
- Список источников
Введение
Актуальность темы. Современные операционные системы (ОС) эволюционировали из инструментов управления ресурсами в сложные цифровые экосистемы, объединяющие локальные вычисления, облачные сервисы и коммуникационные интерфейсы. Параллельно с этим развитие искусственного интеллекта и больших языковых моделей (LLM) открывает новые возможности для трансформации взаимодействия между пользователем и программной средой, предлагая переход от прямых команд к интенциональному управлению. Однако постоянный рост функциональности ОС приводит к увеличению когнитивной нагрузки на оператора, а традиционные методы автоматизации, такие как скриптинг и RPA, оказываются недостаточно эффективными в условиях динамически меняющихся интерфейсов и неструктурированных задач.
Цель работы. Целью исследования является анализ методов построения многоагентных систем (MAS – Multi-Agent Systems) для интеллектуализации задач управления операционной системой.
Задачи исследования:
- анализ проблематики автоматизации современных операционных систем и ограничений традиционных методов;
- исследование эволюции методов интеллектуального управления на базе больших языковых моделей;
- изучение архитектурных принципов интеграции ИИ-агентов в среду операционной системы;
- классификация специализированных агентов и моделей их оркестрации в MAS;
- анализ технических методов взаимодействия агентов с графическим интерфейсом;
- исследование протокола MCP для стандартизации обмена данными между агентами и источниками данных.
Объект исследования. MAS для управления операционной системой на базе больших языковых моделей и специализированных ИИ-агентов.
Предмет исследования. Архитектурные решения для интеграции агентов в операционные системы, методы оркестрации MAS и технологии восприятия графических интерфейсов.
Методы исследований. Решение поставленных задач базировалось на применении методов системного анализа, классификации существующих решений, сравнительного анализа архитектурных подходов и бенчмаркинга производительности агентов на тестовых задачах.
1. Анализ проблематики автоматизации современных операционных систем
1.1. Проблемы эффективности пользовательского взаимодействия с интерфейсом
Эволюция операционных систем (ОС), таких как Windows, Linux и macOS, за последние десятилетия следовала по пути экспоненциального усложнения функциональности. Современная ОС представляет собой не просто загрузчик приложений, а сложную экосистему, интегрирующую облачные сервисы, локальные вычисления и коммуникационные хабы. Однако пользовательский интерфейс (UI – User Interface), основанный на метафоре «рабочего стола», разработанной в 1980-х годах, достиг предела своей когнитивной эффективности.
Пользователь, выполняющий роль «интегратора», вынужден непрерывно переключаться между десятками окон, вкладок браузера и специализированных утилит. Это явление, известное как «переключение контекста», создает колоссальную когнитивную нагрузку. Исследования показывают, что фрагментация внимания снижает производительность труда интеллектуальных работников, превращая их в операторов по копированию данных из одного изолированного окна в другое. Проблема усугубляется тем, что современные рабочие процессы редко ограничиваются одним приложением; они требуют оркестрации действий между браузером, файловой системой, терминалом и корпоративными мессенджерами.
1.2. Ограничения традиционных методов автоматизации
До наступления эры генеративного искусственного интеллекта (Generative AI) основным ответом индустрии на проблему рутины была роботизированная автоматизация процессов (RPA – Robotic Process Automation) и традиционный скриптинг (PowerShell, Bash, Python).
Технологии RPA (такие как UiPath, Blue Prism) функционируют на основе жестко заданных правил. Они эмулируют действия пользователя, полагаясь на статические селекторы интерфейса или фиксированные координаты на экране. Фундаментальным недостатком этого подхода является его «хрупкость». Любое, даже незначительное изменение в пользовательском интерфейсе целевого приложения – сдвиг кнопки на несколько пикселей, изменение ID элемента в DOM-дереве веб-страницы или обновление цветовой схемы – приводит к сбою автоматизации [1].
Кроме того, RPA обладает нулевой толерантностью к неструктурированным данным. Традиционные боты не способны интерпретировать смысл содержимого. Если бизнес-процесс требует извлечения ключевых фактов из электронного письма, написанного в свободной форме, или принятия решения на основе визуального контекста, RPA оказывается бессильным без подключения сложных и дорогостоящих внешних модулей [2]. Исследования показывают, что RPA часто становится «узким местом» при масштабировании, так как требует постоянной ручной перенастройки правил под каждое обновление ПО.
Индустрия испытывает острую потребность в переходе от императивной автоматизации, где прописан каждый шаг действий, к декларативной или интенциональной, где задается только цель. Это требует внедрения интеллектуального слоя, способного воспринимать динамическую среду ОС так, как это делает человек [3].
2. Обзор эволюции методов интеллектуального управления
2.1. Классификация этапов развития языковых моделей
Развитие больших языковых моделей (LLM – Large Language Models) прошло несколько фаз, каждая из которых приближала к концепции автономного управления операционными системами.
Первые итерации, такие как ранний ChatGPT в веб-интерфейсе, представляли собой изолированные системы взаимодействия по принципу вопрос-ответ. Модель генерировала текст, код или советы, но была полностью отрезана от локальной среды пользователя. Пользователь должен был вручную копировать сгенерированный скрипт в терминал, брать на себя риски и возвращать результат выполнения обратно в чат. Это создавало разрыв в контуре управления.
Следующим шагом стала интеграция моделей непосредственно в рабочие приложения, таких как Microsoft 365 Copilot и GitHub Copilot. Эти системы обладают контекстной осведомленностью – они получают доступ к открытому документу или коду. Однако их роль остается пассивной, так как они предлагают дополнения или отвечают на вопросы по контексту, но инициатива и исполнение остаются за человеком. Права таких систем ограничены песочницей приложения [4].
Текущий этап развития представляет собой переход к автономным агентам. Агентный ИИ – это система, способная самостоятельно выполнять сложные, многоступенчатые задачи с минимальным вмешательством человека или без него. Deloitte определяет агентный ИИ как программные решения, которые не просто генерируют контент, а действуют для достижения целей [4].
Согласно прогнозам Gartner, к 2028 году 33% корпоративного программного обеспечения будет включать элементы агентного ИИ, что является взрывным ростом по сравнению с менее чем 1% в 2024 году [5]. McKinsey отмечает, что агенты позволяют преодолеть парадокс генеративного ИИ, когда широкое внедрение чат-ботов дает лишь размытый эффект продуктивности, в то время как агенты способны трансформировать целые вертикальные процессы [6].
2.2. Принципы построения агентных рабочих процессов
Ключевым отличием агента от чат-бота является способность реализовывать агентный рабочий процесс. В этой парадигме LLM используется не просто как база знаний, а как когнитивное ядро, отвечающее за рассуждение и планирование [7].
Агент получает высокоуровневую инструкцию и разбивает задачу на последовательность подшагов. Например, при получении инструкции очистить диск от временных файлов старше недели, агент определяет необходимость найти соответствующую папку, проанализировать даты создания файлов, выбрать нужные объекты и выполнить удаление [8].
Критическим аспектом для работы в ОС является способность агента вызывать системные API, выполнять команды терминала или эмулировать события мыши и клавиатуры. Если агент попытается удалить файл и получит ошибку доступа, он должен проанализировать проблему, попробовать запустить команду с правами администратора или пропустить файл и продолжить работу. IBM подчеркивает, что эволюция идет от генераторов контента к автономным решателям проблем, что требует внедрения механизмов отката действий и строгих аудиторских логов для обеспечения безопасности в корпоративных средах [9].
Глубокое понимание архитектуры планирования и механизмов памяти является фундаментом для создания эффективных автономных агентов [10]. Архитектура типового LLM-агента включает несколько ключевых компонентов: ядро LLM для обработки запросов, модуль планирования задач, систему управления памятью (краткосрочной и долговременной), интерфейс доступа к инструментам и механизм взаимодействия с пользователем [10]. Структура такой архитектуры представлена на рисунке 1.
Рисунок 1 – Архитектура LLM-агента [10]
Для реализации таких сценариев применяется парадигма ReAct (Reasoning + Acting), где агент циклически чередует этапы рассуждения, выполнения действий и анализа результатов, обеспечивая адаптивное взаимодействие со средой [10]. Структура этого цикла представлена на рисунке 2.
Рисунок 2 – Цикл работы агента по парадигме ReAct [10]
3. Архитектурные особенности интеграции ИИ в операционные системы
Интеграция агентов в ОС требует пересмотра архитектуры самой операционной системы. Простого запуска агента как обычного приложения недостаточно для эффективного управления ресурсами и контекстом. В ответ на это научное сообщество выдвигает концепцию AIOS – операционной системы для LLM-агентов.
3.1. Абстракция ядра LLM и системные вызовы
Традиционные ОС управляют процессами, памятью и устройствами ввода-вывода. AIOS предлагает ввести уровень абстракции над аппаратным обеспечением и базовой ОС, специально предназначенный для обслуживания агентов [11][12].
Центральным элементом этой архитектуры является ядро LLM. Оно обеспечивает независимость агентов от конкретного провайдера моделей путем предоставления унифицированного интерфейса системных вызовов для инференса, аналогично тому как POSIX предоставляет стандарты для файловых операций [11].
В условиях, когда множество агентов работают параллельно, возникает конкуренция за вычислительные ресурсы GPU и пропускную способность контекстного окна LLM. Планировщик агентов реализует алгоритмы оптимизации использования токенов и минимизации задержек. Исследования показывают, что специализированное планирование может ускорить выполнение задач в 2.1 раза по сравнению с последовательным исполнением [11].
Централизованный реестр доступных инструментов обеспечивает безопасный доступ и регистрацию новых возможностей без пересборки агентов [13].
3.2. Методы управления контекстом и памятью агентов
Одной из сложнейших технических проблем является управление контекстом. LLM имеют ограниченное окно внимания. Если агент работает долго, история его действий переполняет это окно.
AIOS внедряет менеджер контекста, который отвечает за сохранение и восстановление состояния мыслительного процесса агента при переключении между задачами. Это аналогично сохранению регистров процессора при смене потоков в CPU, но оперирует огромными массивами данных трансформеров [11].
Система управления памятью разделяет память на кратковременную для текущего сеанса и долговременную на основе векторных баз данных. Это позволяет агентам сохранять предпочтения пользователя и прошлые решения спустя дни или недели [11][14].
3.3. Подсистемы виртуализации и изоляции среды выполнения
Для задач непосредственного управления компьютером архитектура AIOS расширяется модулями виртуализации. Для безопасного выполнения действий создается песочница, включающая контроллер виртуальных машин и сервер протокола контекста, что позволяет агенту взаимодействовать с ОС без риска для основной системы [13][15]. Также исследуются подходы, такие как KAOS, где вводятся специализированные агенты-менеджеры с базами знаний о GUI и инструментах для повышения эффективности планирования [16].
4. Классификация и методы оркестрации специализированных агентов
Почему индустрия движется от создания одного «супер-агента» к MAS? Главная причина кроется в ограниченности контекста и эффективности специализации. Универсальная модель, перегруженная инструкциями для всех возможных доменов (от написания кода на C++ до управления календарем), склонна к потере фокуса, галлюцинациям и снижению качества решений. Специализация позволяет использовать более компактные, быстрые и точные модели (или промпты) для конкретных задач.
4.1. Функциональная типология агентов в операционной среде
В экосистеме современной ОС формируются четкие ролевые кластеры агентов, образуя MAS.
Существуют различные типы специализированных агентов, каждый из которых выполняет определенный класс задач в операционной системе [17].
Одним из ярких примеров агента-кодера является Cursor – это не просто редактор, а интегрированная среда с агентным ядром. Cursor индексирует локальную кодовую базу, создавая векторные представления для функций и классов. Это позволяет агенту понимать зависимости между файлами, которые не открыты в данный момент [18]. Новый режим Agent Mode (на базе модели Composer) позволяет агенту автономно планировать и выполнять рефакторинг в десятках файлов, запускать тесты в терминале и исправлять ошибки.
Другим примером выступает Open Interpreter – инструмент командной строки, который предоставляет LLM прямой доступ к локальному терминалу (Python, Bash). Он позволяет выполнять системные задачи (конвертация видео, анализ данных, управление системными настройками) через естественный язык. Его архитектура включает цикл «Code Generator -> Code Executor -> Loop Back», что обеспечивает итеративное исправление ошибок [19].
Второй тип – агенты-навигаторы веб-пространства (Browser Agents), которые специализируются на взаимодействии с веб-интерфейсами. В отличие от кодеров, работающих с текстом, навигаторы должны понимать визуальную структуру (DOM) и динамику веб-страниц. Их задачи варьируются от сбора информации до выполнения транзакций. Современные подходы включают использование мультимодальных моделей для «взгляда» на веб-страницу как на скриншот [20].
Третий тип – агенты-администраторы (SysAdmin Agents), которые фокусируются на конфигурации ОС, управлении пакетами, мониторинге ресурсов и безопасности [21]. В архитектуре KAOS, например, выделяется «Management Role Agent», который использует базу знаний о рабочем столе для принятия решений [16].
4.2. Модели организации меж-агентного взаимодействия
Эффективность MAS зависит от того, как организовано взаимодействие между агентами. Для формализации сложных бизнес-процессов с участием агентов применяется нотация BPMN (Business Process Model and Notation) – стандарт графического представления потоков работы с поддержкой условной логики, параллельных ветвлений и обработки ошибок [22][23]. Существует несколько ключевых моделей оркестрации, определяющих архитектуру коллаборации [22][23]. Сравнительная характеристика основных моделей приведена в таблице 4.1.
Таблица 4.1 – Модели организации меж-агентного взаимодействия
| Модель | Описание | Применение в ОС |
|---|---|---|
| Иерархическая | Центральный агент-оркестратор декомпозирует задачу и распределяет подзадачи между специализированными агентами. | Microsoft Copilot Studio использует оркестратор для маршрутизации интентов (запросов) к нужному агенту (HR, IT, Sales) [24]. В научных работах описывается использование менеджера для декомпозиции сложных инструкций [25]. |
| Последовательная | Агенты передают контекст друг другу по цепочке. Выход одного агента становится входом другого. | Агент-OCR извлекает текст. Агент-Аналитик классифицирует. Агент-Почтальон отправляет уведомление. |
| Совместная | Агенты общаются в общем чате, обсуждая задачу. Могут использоваться роли «Критика» и «Исполнителя». | Платформа AutoGen от Microsoft позволяет создавать такие групповые чаты для решения задач, требующих разносторонней экспертизы [26]. |
| Параллельная | Оркестратор запускает несколько агентов одновременно для независимого выполнения подзадач, затем агрегирует результаты. | Сбор информации из множества источников (веб-поиск, внутренняя база, логи) одновременно для составления отчета [27]. |
На практике BPMN-схемы реализуются через специализированные движки оркестрации, такие как Camunda с протоколом обмена Zeebe, который обеспечивает асинхронную передачу сообщений между агентами [22]. Пример комплексной BPMN-схемы для обработки заявки на утерянный багаж, включающей условные переходы, таймауты и процессы компенсации, приведен на рисунке 3.
Рисунок 3 – Пример BPMN-схемы обработки заявки на утерянный багаж с использованием ИИ-агентов [22]
Упрощенная схема параллельной оркестрации демонстрирует одновременный запуск специализированных агентов (Vision, Video) для обработки различных модальностей данных с последующей агрегацией результатов. Структура такой оркестрации показана на рисунке 4.
Рисунок 4 – BPMN-схема параллельного вызова агентов через протокол Zeebe [22]
Индустрия движется к созданию платформ, облегчающих эту оркестрацию, таких как Semantic Kernel и Azure AI Agent Service, которые предоставляют инфраструктуру для декларативного описания взаимодействий между агентами.
5. Технические методы взаимодействия с графическим интерфейсом и данными
Одной из самых сложных проблем для интеллектуализации управления ОС является задача восприятия и заземления. Как агент должен понимать, что происходит на экране и куда именно нужно кликнуть, чтобы выполнить действие? Существует два фундаментально различных подхода к решению этой проблемы.
5.1. Визуальные методы анализа интерфейса
С появлением мощных мультимодальных моделей (VLM – Vision Language Models), таких как GPT-4o, Claude 3.5 Sonnet и специализированной модели UI-TARS, визуальный подход стал доминирующим трендом в индустрии. Технологии VLM позволяют моделям связывать визуальные образы интерфейса с семантическим пониманием задач [28].
Агент делает скриншот экрана (или получает видеопоток) и подает его на вход нейросети. Модель анализирует пиксели и выдает либо координаты для клика, либо текстовое описание происходящего [29].
Метод работает с любым приложением, которое видно на экране, включая игры, удаленные рабочие столы и устаревший софт без программных API. Агент видит интерфейс точно так же, как человек [30]. Однако обработка изображений высокого разрешения требует значительных ресурсов GPU и времени. Исследования показывают, что агенты тратят в разы больше времени на задачу, чем человек [20]. Модели могут ошибаться в пространственной привязке, выдавая координаты, слегка смещенные относительно кнопки.
Использование методов Set-of-Marks (наложение цифровых меток на интерактивные элементы перед подачей скриншота в модель) и специализированных моделей типа UI-TARS, которые обучаются непосредственно на задачах GUI-управления, значительно повышает точность [29].
5.2. Структурные методы на основе деревьев доступности
Этот подход использует метаданные, предоставляемые операционной системой для инструментов доступности. Агент запрашивает у ОС иерархическое дерево объектов (Accessibility Tree в ОС или DOM в браузере). Каждый узел дерева содержит роль элемента (кнопка, ссылка), его название, состояние и точные координаты [30].
Агент получает точные координаты и текст без необходимости распознавания образов. Обработка текста вычислительно намного дешевле и быстрее, чем обработка изображений [31]. Многие современные приложения, созданные на базе фреймворков типа Flutter или Canvas, а также приложения Electron, часто не отрисовывают корректное дерево доступности. Исследование 112 приложений macOS показало, что только 33% из них обеспечивают полную поддержку API доступности [32]. Деревья могут содержать тысячи узлов, многие из которых не важны для задачи, что переполняет контекстное окно LLM [33].
Бенчмаркинг выявляет серьезные проблемы текущих решений. OSWorld – ведущий бенчмарк для оценки мультимодальных агентов в реальных средах (Ubuntu, Windows) – показывает, что даже лучшие модели достигают успеха лишь в 22–42% задач, в то время как человек справляется с 72–74% [20][34]. Сравнительный анализ эффективности различных подходов приведен в таблице 5.1.
Таблица 5.1 – Сравнительный анализ эффективности подходов к восприятию интерфейса
| Подход / Модель | Успешность в OSWorld | Особенности |
|---|---|---|
| Человек | ~72.4% | Эталонный показатель. |
| UI-TARS 1.5 | ~42.5% | Лучший результат на 2025 год. Использует визуальное восприятие и обучение с подкреплением [35]. |
| Agent S2 на базе Gemini 2.5 | ~41.4% | Мультимодальный агент общего назначения [20]. |
| Claude 3.7 | ~22–30% | Сильная базовая модель, но уступает специализированным решениям в сложных сценариях [29]. |
Модель UI-TARS демонстрирует устойчивое превосходство над предыдущими решениями на широком спектре специализированных бенчмарков, включая задачи навигации по веб-страницам, управления мобильными приложениями и взаимодействия с десктопными интерфейсами. Сравнительные результаты представлены на рисунке 5.
Рисунок 5 – Сравнительные результаты UI-TARS на различных бенчмарках [29]
Визуальные подходы в последних исследованиях часто превосходят подходы, основанные только на дереве доступности, из-за низкого качества последнего в реальных приложениях. Гибридные системы (OS-Atlas, UGround, Screen2AX), которые объединяют визуальное восприятие with извлечением структуры, показывают перспективные результаты, пытаясь нивелировать недостатки обоих методов [33]. Бенчмарк ScreenSuite подтверждает необходимость тестирования агентов именно в режиме чистого зрения для гарантии их надежности в неидеальных средах [36].
5.3. Протоколы стандартизации обмена данными (MCP)
Если агент успешно увидел интерфейс, ему необходимо взаимодействовать с данными и инструментами. Попытка управлять каждым приложением через GUI ненадежна и медленна. Агентам необходим программный доступ к данным. Однако существует проблема зоопарка API – каждый сервис (Google Drive, Slack, локальная SQL база, CRM) имеет свой уникальный интерфейс. Создание интеграций для каждого инструмента не масштабируемо.
В ответ на эту фрагментацию был разработан и представлен в конце 2024 года Model Context Protocol (MCP) – открытый стандарт для подключения ИИ-систем к источникам данных и инструментам [37]. MCP предлагает универсальный протокол, который стандартизирует взаимодействие между хостами (приложениями с ИИ, например, Claude Desktop, Cursor) и серверами (источниками данных).
Архитектура MCP включает три ключевых компонента [38]. Хост – это приложение-оркестратор, которое инициирует соединение (например, IDE или ОС-агент). Клиент – компонент внутри хоста, поддерживающий протокол. Сервер – легковесное приложение, которое предоставляет доступ к конкретному ресурсу. Сервер декларирует свои возможности через стандартизированный JSON-RPC 2.0 интерфейс. Структура возможностей серверов MCP представлена в таблице 5.2.
Таблица 5.2 – Возможности серверов MCP
| Тип возможности | Назначение | Примеры использования |
|---|---|---|
| Resources | Данные для чтения | Файлы, логи, записи базы данных |
| Tools | Исполняемые функции | Выполнение SQL-запросов, отправка сообщений |
| Prompts | Шаблоны взаимодействий | Предустановленные сценарии работы с данными |
MCP решает проблему множественных интеграций. Разработчику базы данных достаточно написать один MCP-сервер, и любой MCP-совместимый агент (будь то Claude, IDE или корпоративный ассистент) сможет безопасно работать с этой базой данных. Это создает экосистему модульных, подключаемых инструментов, критически важную для масштабирования MAS в ОС.
Выводы
В ходе анализа установлено, что разработка многоагентных систем для управления операционными системами является одним из наиболее динамично развивающихся направлений в области искусственного интеллекта.
Проведенное исследование выявило, что сложность современных ОС делает традиционные методы управления и автоматизации недостаточными. Агентный ИИ становится необходимым слоем абстракции между пользователем и сложностью системы. Рассмотрена концепция AIOS, в которой LLM выполняет роль управляющего ядра, а приложения функционируют как инструменты для агентов.
Рассмотрены два основных подхода к восприятию интерфейса. Установлено, что визуальные методы обеспечивают универсальность работы с любыми приложениями, в то время как структурные методы на основе деревьев доступности предоставляют более высокую точность и скорость обработки. Выявлено, что гибридные модели, объединяющие оба подхода, демонстрируют наиболее перспективные результаты при тестировании на бенчмарках типа OSWorld.
Проанализирована проблема фрагментации API в гетерогенных средах. Выявлено, что протокол MCP является перспективным стандартом для решения задачи интероперабельности, обеспечивая унифицированный интерфейс взаимодействия между агентами и источниками данных. Данный подход позволяет создавать масштабируемые экосистемы модульных инструментов для многоагентных систем.
Список источников
- Robotic Process Automation VS AI Agents [Электронный ресурс] // Turian Blog. – 2025. – URL: https://www.turian.ai/blog/robotic-process-automation-vs-ai-agents (дата обращения: 16.12.2025). – Текст : электронный.
- Agentic AI vs RPA – Comparing AI Agents and RPA Bots [Электронный ресурс] // SS&C Blue Prism. – 2025. – URL: https://www.blueprism.com/resources/blog/agentic-ai-vs-rpa-vs-ai-agents-comparing/ (дата обращения: 16.12.2025). – Текст : электронный.
- Тельнов, Ю. Ф. Разработка моделей производственных и бизнес-процессов сетевых предприятий на основе многоагентных систем / Ю. Ф. Тельнов, В. А. Казаков // Программные продукты и системы. – 2023. – № 4. – С. 632–643. – URL: https://elibrary.ru/item.asp?id=60033815 (дата обращения: 16.12.2025).
- Autonomous generative AI agents: Under development [Электронный ресурс] // Deloitte. – 2025. – URL: https://www.deloitte.com/us/en/insights/industry/technology/technology-media-and-telecom-predictions/2025/autonomous-generative-ai-agents-still-under-development.html (дата обращения: 16.12.2025). – Текст : электронный.
- Intelligent Agents in AI Really Can Work Alone. Here's How [Электронный ресурс] // Gartner. – 2025. – URL: https://www.gartner.com/en/articles/intelligent-agent-in-ai (дата обращения: 16.12.2025). – Текст : электронный.
- Seizing the agentic AI advantage [Электронный ресурс] // McKinsey. – 2025. – URL: https://www.mckinsey.com/capabilities/quantumblack/our-insights/seizing-the-agentic-ai-advantage (дата обращения: 16.12.2025). – Текст : электронный.
- Акопов, А. С. Моделирование и оптимизация стратегий принятия индивидуальных решений в многоагентных системх с использованием машинного обучения / А. С. Акопов // Бизнес-информатика. – 2023. – Т. 17, № 2. – С. 7–19. – URL: https://elibrary.ru/item.asp?id=54071694 (дата обращения: 16.12.2025).
- AI Agents are disrupting automation: Current approaches, market solutions and recommendations [Электронный ресурс] // Insight Partners. – 2025. – URL: https://www.insightpartners.com/ideas/ai-agents-disrupting-automation/ (дата обращения: 16.12.2025). – Текст : электронный.
- AI Agents in 2025: Expectations vs. Reality [Электронный ресурс] // IBM. – 2025. – URL: https://www.ibm.com/think/insights/ai-agents-2025-expectations-vs-reality (дата обращения: 16.12.2025). – Текст : электронный.
- Как устроены LLM-агенты: архитектура, планирование и инструменты [Электронный ресурс] // Блог Selectel на Habr. – 2025. – URL: https://habr.com/ru/companies/selectel/articles/916798/ (дата обращения: 17.12.2025). – Текст : электронный.
- Mei, K. AIOS: LLM Agent Operating System / K. Mei, Z. Li, S. Xu [et al.] // arXiv preprint. – 2024. – arXiv:2403.16971. – URL: https://arxiv.org/abs/2403.16971 (дата обращения: 16.12.2025).
- Листопад, С. В. Архитектуры интеллектуальных агентов сплоченных гибридных интеллектуальных многоагентных систем / С. В. Листопад, И. А. Кириков // Системы и средства информатики. – 2022. – Т. 32, № 2. – С. 81–91. – URL: https://elibrary.ru/item.asp?id=48649634 (дата обращения: 16.12.2025).
- AIOS: AI Agent Operating System [Электронный ресурс] // GitHub. – 2025. – URL: https://github.com/agiresearch/AIOS (дата обращения: 16.12.2025). – Текст : электронный.
- Парыгин, Д. С. Моделирование поведения интеллектуальных агентов на основе методов машинного обучения в моделях конкуренции / Д. С. Парыгин, А. О. Анохин, Н. П. Садовникова [и др.] // Программные продукты и системы. – 2023. – № 1. – С. 46–59. – URL: https://elibrary.ru/item.asp?id=54261858 (дата обращения: 16.12.2025).
- Язов, Ю. К. Проблемные вопросы управления защитой информации от утечки по техническим каналам с применением многоагентных систем / Ю. К. Язов, А. О. Авсентьев // Вопросы кибербезопасности. – 2024. – № 6 (64). – С. 85–97. – URL: https://elibrary.ru/item.asp?id=77839640 (дата обращения: 16.12.2025).
- Liu, B. KAOS: Large Model Multi-Agent Operating System / B. Liu, Y. Wang, F. Qian [et al.] // arXiv preprint. – 2024. – arXiv:2406.11342. – URL: https://arxiv.org/abs/2406.11342 (дата обращения: 16.12.2025).
- Александров, Л. В. Многоагентная система анализа защищенности вычислительной системы / Л. В. Александров, Н. А. Ефимова // Молодая инновационная Чувашия : сборник трудов конференции. – 2023. – С. 361–362. – URL: https://elibrary.ru/item.asp?id=79518756 (дата обращения: 16.12.2025).
- Overview [Электронный ресурс] // Cursor Docs. – 2025. – URL: https://cursor.com/docs/agent/overview (дата обращения: 16.12.2025). – Текст : электронный.
- Lynch, S. How It's Built: Open Interpreter [Электронный ресурс] / S. Lynch. – 2024. – URL: https://sean.lyn.ch/how-its-built-open-interpreter/ (дата обращения: 16.12.2025). – Текст : электронный.
- Niu, Y. OSWorld-Human: Benchmarking the Efficiency of Computer-Use Agents / Y. Niu, T. Xie, Z. Wang [et al.] // arXiv preprint. – 2025. – arXiv:2506.16042. – URL: https://arxiv.org/abs/2506.16042 (дата обращения: 16.12.2025).
- Рыкшин, М. С. Подходы к разработке алгоритма взаимного информационного согласования интеллектуальных агентов в распределенной многоагентной системе / М. С. Рыкшин // Моделирование, оптимизация и информационные технологии. – 2023. – Т. 11, № 3. – С. 16–17. – URL: https://elibrary.ru/item.asp?id=54676390 (дата обращения: 16.12.2025).
- Оркестрация в мультиагентных системах [Электронный ресурс] // Domclick / Habr. – 2025. – URL: https://habr.com/ru/companies/domclick/articles/966066/ (дата обращения: 17.12.2025). – Текст : электронный.
- AI Agent Orchestration Patterns [Электронный ресурс] // Azure Architecture Center, Microsoft Learn. – 2025. – URL: https://learn.microsoft.com/en-us/azure/architecture/ai-ml/guide/ai-agent-design-patterns (дата обращения: 16.12.2025). – Текст : электронный.
- Designing Multi-Agent Intelligence [Электронный ресурс] // Microsoft for Developers. – 2025. – URL: https://developer.microsoft.com/blog/designing-multi-agent-intelligence (дата обращения: 16.12.2025). – Текст : электронный.
- Chen, Z. A Hierarchical Multi-Agent Collaboration Framework for Complex Task Automation on PC / Z. Chen, Y. Li, X. Wang [et al.] // arXiv preprint. – 2025. – arXiv:2502.14282. – URL: https://arxiv.org/abs/2502.14282 (дата обращения: 16.12.2025).
- Examples [Электронный ресурс] // AutoGen 0.2, Microsoft Open Source. – 2025. – URL: https://microsoft.github.io/autogen/0.2/docs/Examples/ (дата обращения: 16.12.2025). – Текст : электронный.
- AI Agent Orchestration Patterns [Электронный ресурс] // Azure Architecture Center, Microsoft Learn. – 2025. – URL: https://learn.microsoft.com/en-us/azure/architecture/ai-ml/guide/ai-agent-design-patterns (дата обращения: 16.12.2025). – Текст : электронный.
- Что такое VLM — визуально-языковые модели и зачем они нужны [Электронный ресурс] // Yandex Cloud Blog. – 2025. – URL: https://yandex.cloud/ru-kz/blog/vlm-visual-language-models (дата обращения: 17.12.2025). – Текст : электронный.
- Qin, Y. UI-TARS: Pioneering Automated GUI Interaction with Native Agents / Y. Qin, Y. Chen, Z. Li [et al.] // arXiv preprint. – 2025. – arXiv:2501.12326. – URL: https://arxiv.org/abs/2501.12326 (дата обращения: 16.12.2025).
- Wu, Z. PAL-UI: Planning with Active Look-back for Vision-Based GUI Agents / Z. Wu, X. Liu, Y. Wang [et al.] // arXiv preprint. – 2025. – arXiv:2510.00413. – URL: https://arxiv.org/abs/2510.00413 (дата обращения: 16.12.2025).
- Zheng, B. Navigating the Digital World as Humans Do: Universal Visual Grounding for GUI Agents / B. Zheng, Y. Li, X. Chen [et al.] // OpenReview. – 2025. – URL: https://openreview.net/forum?id=kxnoqaisCT (дата обращения: 16.12.2025).
- Zhang, Y. Screen2AX: Vision-Based Approach for Automatic macOS Accessibility Generation / Y. Zhang, X. Liu, W. Chen [et al.] // arXiv preprint. – 2025. – arXiv:2507.16704. – URL: https://arxiv.org/abs/2507.16704 (дата обращения: 16.12.2025).
- Wang, X. GUI Agents: A Survey / X. Wang, Z. Li, Y. Chen [et al.] // Findings of the Association for Computational Linguistics: ACL 2025. – 2025. – P. 1158. – URL: https://aclanthology.org/2025.findings-acl.1158.pdf (дата обращения: 16.12.2025).
- OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments [Электронный ресурс]. – 2025. – URL: https://os-world.github.io/ (дата обращения: 16.12.2025). – Текст : электронный.
- UI-TARS [Электронный ресурс] // ByteDance / GitHub. – 2025. – URL: https://github.com/bytedance/UI-TARS (дата обращения: 16.12.2025). – Текст : электронный.
- ScreenSuite – The most comprehensive evaluation suite for GUI Agents! [Электронный ресурс] // Hugging Face Blog. – 2025. – URL: https://huggingface.co/blog/screensuite (дата обращения: 16.12.2025). – Текст : электронный.
- Model Context Protocol (MCP) Documentation [Электронный ресурс]. – 2025. – URL: https://modelcontextprotocol.info/docs/ (дата обращения: 16.12.2025). – Текст : электронный.
- Xie, T. OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments / T. Xie, D. Zhang, J. Chen [et al.] // arXiv preprint. – 2024. – arXiv:2404.07972. – URL: https://arxiv.org/abs/2404.07972 (дата обращения: 16.12.2025).
