ДонНТУ Портал магистров

Сидорика Максим Денисович

Факультет интеллектуальных систем и программирования

Кафедра прикладной математики и искусственного интеллекта

Направление: 09.04.04 «Программная инженерия»

Профиль: «Технологии программного обеспечения интеллектуальных систем»

Тема выпускной квалификационной работы магистра: «Разработка автономного голосового ассистента для управления Windows на основе VOSK и Hugging Face Transformers»

Руководитель ВКР: ктн, доцент Лазебная Людмила Александровна

Разработка автономного голосового ассистента для управления Windows на основе VOSK и Hugging Face Transformers

ВВЕДЕНИЕ

В последние годы голосовые ассистенты перестали быть экспериментальной технологией и превратились в массовый инструмент взаимодействия пользователей с цифровой средой. Аналитические отчёты международных исследовательских агентств показывают устойчивый рост мирового рынка голосовых ассистентов и связанных с ними сервисов: прогнозируется дальнейшее расширение сегмента до начала 2030-х годов, причём рост обеспечивается не только бытовыми колонками и мобильными устройствами, но и рабочими местами пользователей, автомобильными системами и специализированными терминалами. Одновременно развивается отдельный рынок специализированных систем-на-кристалле (SoC) для локальных голосовых интерфейсов, ориентированных на работу без постоянного обращения к облачной инфраструктуре [15].

Большинство распространённых голосовых ассистентов (Google Assistant, Amazon Alexa, Apple Siri и др.) опираются на облачные сервисы обработки речи и естественного языка. Такой подход обеспечивает высокое качество распознавания за счёт крупных серверных моделей, но приводит к ряду ограничений: повышенная задержка отклика, зависимость от качества интернет-соединения, риски утечки конфиденциальных данных, а также невозможность использования в изолированных или защищённых сетях. Исследования и экспертные оценки подчёркивают, что будущее принадлежит офлайн-ассистентам, способным работать непосредственно на пользовательских устройствах при разумных требованиях к ресурсам [6, 7].

Отдельную значимую группу проблем составляют вопросы безопасности и приватности. Обзор современных атак на голосовые интерфейсы демонстрирует уязвимость ассистентов к поддельным звуковым командам, возможным каналам утечки голосовых данных и злоупотреблению собранной информацией со стороны сервисов [8]. В корпоративных и государственных информационных системах подобные риски неприемлемы, поэтому всё большее внимание уделяется архитектурам, в которых аудио и текстовые данные обрабатываются локально, а доступ к внешним сервисам минимизируется.

Важным мотивационным фактором развития голосовых интерфейсов является их роль в обеспечении доступности цифровой среды. Исследования показывают, что для пользователей с нарушениями зрения, опорно-двигательного аппарата и другими ограничениями способность управлять компьютером голосом существенно повышает автономность и качество взаимодействия с информационными системами [10]. При этом существующие массовые ассистенты, как правило, оптимизированы под бытовые сценарии и ограничены набором команд, не охватывающим полноценное управление рабочей станцией.

С технологической точки зрения создание автономного голосового ассистента требует сочетания нескольких классов методов. В области автоматического распознавания речи накоплен значительный опыт построения акустических и языковых моделей, в том числе на основе скрытых марковских моделей, нейронных сетей и гибридных архитектур [11]. Одним из практических инструментов, позволяющих реализовать офлайн-распознавание для русского языка на широком спектре устройств, является платформа VOSK, предоставляющая готовые модели и API для интеграции в прикладные системы [12]. На этапе понимания смысла команд ключевую роль играют трансформер-модели, архитектура которых, основанная на механизме внимания, стала де-факто стандартом для задач классификации интентов, извлечения сущностей и других компонентов NLU [13].

Несмотря на существенный прогресс в области облачных голосовых ассистентов, задача разработки автономного голосового ассистента для управления операционной системой Windows на русском языке остаётся актуальной. Необходимо обеспечить сочетание нескольких требований: офлайн-обработка аудиоданных, приемлемое качество распознавания русской речи, поддержка широкого набора команд управления рабочим столом и приложениями, удобство использования для различных категорий пользователей, а также соответствие требованиям информационной безопасности.

Объектом исследования в выполняемой выпускной квалификационной работе является голосовой интерфейс управления рабочей станцией пользователя. Предмет исследования составляют методы распознавания речи, естественно-языкового понимания и исполнения команд в условиях автономной (офлайн) работы ассистента на базе операционной системы Windows.

Целью работы является разработка архитектуры и прототипа автономного голосового ассистента для управления Windows на основе системы распознавания речи VOSK и трансформер-моделей библиотеки Hugging Face обеспечивающих понимание пользовательских команд.

Для достижения поставленной цели предполагается решать следующие основные задачи:

  1. Проанализировать современные тенденции развития рынка голосовых ассистентов и локальных голосовых решений, а также их ограничения с точки зрения приватности, безопасности и доступности [18, 10].
  2. Изучить существующие методы автоматического распознавания речи и выбрать технологическую основу для реализации офлайн-ASR, обосновав применение платформы VOSK для русскоязычного ассистента [11, 12].
  3. Проанализировать архитектуру трансформер-моделей и подходы к построению модулей NLU для голосовых ассистентов, определить требования к языковой модели для задачи понимания команд управления Windows [13].
  4. Сформировать перечень функциональных и нефункциональных требований к автономному голосовому ассистенту, в том числе с учётом сценариев использования пользователями с ограниченными возможностями [10].
  5. Спроектировать модульную архитектуру ассистента, включающую подсистемы распознавания речи, естественно-языкового понимания, маршрутизации интентов и исполнения команд в среде Windows.
  6. Определить направления оптимизации и адаптации выбранных моделей и компонентов под ограниченные вычислительные ресурсы пользовательских устройств.

Настоящий реферат посвящён обзору теоретических и прикладных аспектов разработки автономного голосового ассистента для управления Windows, анализу существующих решений и технологий, а также описанию концептуальной архитектуры разрабатываемой системы.

1 АНАЛИЗ РЫНКА И СОВРЕМЕННЫХ РЕШЕНИЙ В ОБЛАСТИ ГОЛОСОВЫХ АССИСТЕНТОВ

1.1 Рынок голосовых ассистентов и ключевые тенденции

За последние годы голосовые ассистенты прошли путь от экспериментальной функции в мобильных устройствах до полноценного элемента цифровой экосистемы. Аналитические отчёты международных исследовательских компаний фиксируют устойчивый рост рынка голосовых ассистентов и связанных с ними сервисов. Согласно прогнозам, совокупный объём рынка голосовых ассистентов и платформ голосового взаимодействия будет продолжать увеличиваться как минимум до 2033 года (рис. 1), при этом рост обеспечивается сразу несколькими сегментами: потребительские устройства, автомобильные системы, корпоративные решения, встраиваемые платформы и локальные SoC.

Особое внимание в этих исследованиях уделяется изменению структуры спроса. Если ранее основными драйверами выступали умные колонки и смартфоны, то в последние годы растёт доля рабочих мест пользователей и специализированных терминалов (кассы самообслуживания, киоски, информационные панели), где голос используется как удобный и естественный интерфейс. Для таких сценариев особенно важны надёжность, малая задержка отклика и возможность работы в условиях ограниченного или отсутствующего доступа к сети [1–5].

Прогноз роста мирового рынка голосовых ассистентов в 2023–2033 гг. по данным отчёта Consa Insights
Рисунок 1 – Прогноз роста мирового рынка голосовых ассистентов в 2023–2033 гг. по данным отчёта Consa Insights [1]
Источник графика: Voice Assistant Landscape Market Size, Share, Industry Trends and Forecast to 2033 [Электронный ресурс] // Consa Insights. – 2025. – Режим доступа: https://www.consainsights.com/reports/voice-assistant-landscape-market.

Параллельно формируется отдельный сегмент рынка специализированных систем-на-кристалле (SoC), ориентированных на локальную голосовую обработку. Эти решения предназначены для размещения моделей распознавания речи и ключевых компонентов NLU непосредственно на устройстве, без постоянного обращения к облаку. Аналитики отмечают, что локальные голосовые SoC становятся важным элементом edge-инфраструктуры и используются как в бытовой технике, так и в промышленных и автомобильных системах [4].

На фоне общего роста рынка выделяется тренд на переход от «облачных» голосовых ассистентов к гибридным и полностью автономным решениям. Обзоры и экспертные статьи подчёркивают, что ключевыми аргументами в пользу офлайн-ассистентов являются: уменьшение задержки, повышение надёжности в условиях нестабильной сети, снижение рисков утечки персональных данных и возможность работы в изолированных средах [6, 7]. При этом ожидается, что значительная часть традиционно облачных сценариев (распознавание речевых команд, базовое NLU, диалоговые шаблоны) будет постепенно переноситься на устройства пользователя, а облако сохранит роль источника обновлений моделей и сложной аналитики [6–8].

1.2 Безопасность, приватность и распределённые архитектуры

Широкое распространение голосовых ассистентов обострило вопросы безопасности и приватности. Современные обзоры показывают, что голосовые интерфейсы подвержены целому классу специфических угроз: атаки с использованием поддельных звуковых команд (в том числе ультразвуковых), подмена голосовых записей, перехват и несанкционированная обработка аудиоданных, злоупотребление правами сторонних навыков и приложений, а также утечки конфиденциальной информации при передаче данных в облако [8].

Облачная архитектура традиционных ассистентов подразумевает централизованный сбор и хранение значительных объёмов голосовых данных. Это создаёт дополнительные риски нарушения конфиденциальности и усложняет соответствие требованиям регуляторов, особенно в корпоративном и государственном секторах. В результате формируется запрос на архитектуры, в которых существенная часть обработки переносится на устройства пользователя и пограничные узлы сети, а в облако передаются либо агрегированные данные, либо обезличенные статистики [7–9]. Сводная классификация атак на голосовые ассистенты и соответствующих угроз приватности представлена в таблице 1.

Таблица 1 – Таксономия атак на голосовые ассистенты [8]
Тип атаки Целевой компонент системы Краткое описание Типичные цели / каналы
Backdoor-атака ASR, SI Встраивание скрытого «триггера» в обучающие данные или аудиосигнал; при наличии триггера модель выдаёт нужный злоумышленнику результат. Модифицированные музыкальные файлы, голосовые сообщения, подменённые датасеты.
Voice squatting / Voice masquerading ASR (уровень навыков и сервисов) Регистрация сторонних навыков/приложений с именами, похожими на легитимные, для перехвата голосовых команд пользователя. Магазины skills (Alexa, Google Assistant и др.), каталоги сторонних приложений.
Adversarial-атака ASR, SI Добавление малых, специально оптимизированных искажений к аудио так, чтобы модель распознавания или идентификации ошибалась или выдавала заданный результат. Специально сгенерированные аудиозаписи, потоковое воспроизведение «ядовитого» сигнала.
Hidden command attack ASR, SI Скрытые команды, встраиваемые в музыку/шум или маскируемые психоакустическими приёмами; человек слышит «обычный» звук, а модель распознаёт команду. Музыкальные треки, аудио-реклама, телефонные и VoIP-каналы со специально обработанным сигналом.
DolphinAttack ASR, SI Передача команд в ультразвуковом диапазоне или с ультразвуковой модуляцией; пользователи их не слышат, но микрофон и последующая обработка воспринимают как обычную речь. Ультразвуковые излучатели, модифицированные динамики мобильных устройств и IoT-устройств.
Spoofing-атака SI Имитация голоса легитимного пользователя с помощью записи или синтеза для обхода системы идентификации/верификации говорящего. Воспроизведение записанного голоса, синтезированная речь, повторное проигрывание через колонки.
Источник: Li J., Chen C., Pan L., Azghadi M. R., Ghodosi H., Zhang J. Security and Privacy Problems in Voice Assistant Applications: A Survey [Электронный ресурс] // arXiv preprint arXiv:2304.09486. – 2023. – Режим доступа: https://arxiv.org/abs/2304.09486.

Одним из направлений, позволяющих совместить требования приватности с необходимостью улучшения моделей, является федеративное обучение. Схематично архитектура традиционного и иерархического федеративного обучения показана на рис. 2. В такой архитектуре обучение параметров моделей происходит непосредственно на устройствах пользователей или на пограничных узлах, а в центр передаются лишь обновления параметров (градиенты), не содержащие исходных данных [9]. Обзоры федеративных архитектур для задач приватного ИИ подчёркивают роль трёхуровневой модели (cloud–edge–end), где голосовой ассистент может выполнять базовую обработку на конечном устройстве, а распределённое обучение и агрегирование параметров – на уровне edge и cloud [9].

Архитектура традиционного федеративного обучения и иерархическое федеративное обучение
Рисунок 2 – Архитектура традиционного федеративного обучения и иерархическое федеративное обучение.
Источник: Zhan, S.; Huang, L.; Luo, G.; Zheng, S.; Gao, Z.; Chao, H.-C. A Review on Federated Learning Architectures for Privacy-Preserving AI: Lightweight and Secure Cloud–Edge–End Collaboration. Electronics 2025, 14, 2512. https://doi.org/10.3390/electronics14132512.

Для задач автономного голосового ассистента на рабочей станции пользователя федеративное обучение представляет интерес, прежде всего, как направление дальнейшего развития. Базовый вариант архитектуры может функционировать полностью локально, без обмена данными с внешними сервисами, а федеративные механизмы использоваться для периодического обновления моделей при наличии безопасного канала связи и доверенной инфраструктуры.

1.3 Доступность и инклюзивность голосовых интерфейсов

Одним из значимых аргументов в пользу развития голосовых интерфейсов является повышение доступности информационных систем для пользователей с ограниченными возможностями здоровья. Исследования, выполненные на смешанных выборках пользователей с различными нарушениями (зрения, моторики, когнитивных функций) показывают, что голосовые ассистенты способны снизить барьеры при работе с цифровыми сервисами, облегчить выполнение рутинных операций и частично компенсировать ограничения традиционных графических интерфейсов [10].

В то же время проведённые опросы и эксперименты фиксируют ряд проблем: ограниченный набор поддерживаемых команд, сложность формулировки запросов на естественном языке, отсутствие адаптации под специфические потребности отдельных групп пользователей, а также зависимость от качества сети и стабильности облачных сервисов [3, 10].

С точки зрения проектирования автономного голосового ассистента для Windows это означает необходимость:

  • поддерживать простые, однозначно интерпретируемые голосовые команды для управления окнами, приложениями и системными функциями;
  • обеспечивать предсказуемую и настраиваемую обратную связь (звуковую, текстовую, визуальную);
  • предусматривать возможность кастомизации набора команд под конкретные потребности пользователя (например, создание голосовых «макросов» для часто повторяющихся действий);
  • минимизировать зависимость интерфейса от факторов, не контролируемых пользователем, таких как качество интернет-соединения.

Таким образом, анализ рынка, угроз безопасности и аспектов доступности показывает, что автономные голосовые ассистенты работающие непосредственно на рабочей станции пользователя представляют собой перспективное направление развития голосовых интерфейсов. Они позволяют одновременно учитывать требования приватности и доступности, а также расширять функциональность за счёт глубокой интеграции с операционной системой и прикладным программным обеспечением. Именно к этому классу решений относится разрабатываемый в рамках ВКР автономный голосовой ассистент для управления Windows на основе VOSK и трансформер-моделей библиотеки Hugging Face.

2 ТЕХНОЛОГИЧЕСКАЯ ОСНОВА АВТОНОМНОГО АССИСТЕНТА

2.1 Автоматическое распознавание речи и платформа VOSK

Автоматическое распознавание речи (Automatic Speech Recognition, ASR) является первым и ключевым этапом конвейера голосового ассистента. Классическая архитектура систем ASR включает несколько основных компонентов: модуль акустического анализа, языковую модель и декодер, который находит наиболее вероятную последовательность слов по входному акустическому сигналу [11]. Обобщённая структура такой системы приведена на рис. 3. Исторически основу таких систем составляли гибриды скрытых марковских моделей и гауссовых смесей, однако на современном этапе доминируют нейросетевые архитектуры, использующие глубокие свёрточные и рекуррентные сети, а также модели с механизмом внимания и CTC-декодированием [11].

Обобщённая структура системы автоматического распознавания речи
Рисунок 3 – Обобщённая структура системы автоматического распознавания речи

Для реализации автономного ассистента необходимо, чтобы модуль ASR удовлетворял ряду требований:

  • работал в офлайн-режиме без обращения к облачным сервисам;
  • поддерживал русский язык и диалоговый стиль речи;
  • обеспечивал приемлемое качество распознавания на бытовых микрофонах;
  • функционировал на типичной аппаратной конфигурации пользовательского ПК без специализированного GPU.

Этим требованиям в значительной степени соответствует платформа VOSK, являющаяся набором открытых моделей и API для офлайн-распознавания речи на основе технологий Kaldi [12]. VOSK предоставляет готовые акустические модели для различных языков, включая несколько вариантов для русского языка, отличающихся размером и качеством распознавания. API библиотеки позволяет выполнять как потоковое распознавание (on-line recognition), так и обработку заранее записанных файлов, поддерживает ограничение словаря и использование грамматик для командных интерфейсов [12].

В контексте управления рабочим столом Windows важным является не только точность распознавания, но и способность системы корректно выделять короткие, структурированные команды («открой проводник», «переключись на следующий рабочий стол», «закрой окно» и т.д.). Практика показывает, что для командных интерфейсов особенно эффективной оказывается комбинация полнофункциональной языковой модели с дополнительными ограничениями словаря и грамматик на уровне приложения [11, 12]. Это позволяет снизить вероятность ошибок распознавания за счёт уменьшения пространства возможных гипотез и лучше адаптировать систему к специфике домена.

В рамках проводимых исследований VOSK используется как базовый компонент для построения автономного голосового интерфейса управления рабочим столом. Описаны результаты интеграции VOSK с модулем захвата аудио, системой настройки профилей качества (Desktop-HiQ / Mobile-LoQ) и подсистемой постобработки команд. Показано, что при правильном выборе модели и параметров декодера VOSK обеспечивает приемлемое качество распознавания при работе в условиях комнатного шума и использовании недорогих USB-микрофонов, что делает его подходящей основой для автономного ассистента на пользовательском ПК.

2.2 Естественно-языковое понимание и трансформеры Hugging Face

Результатом работы модуля ASR является строка текста, которая может содержать опечатки, грамматические неточности и вариативность формулировок. Задача модуля естественно-языкового понимания (Natural Language Understanding, NLU) – преобразовать этот текст в структурированное представление, пригодное для последующего исполнения: определить интент (тип команды) и выделить сущности (параметры, аргументы, значения настроек и т.п.).

На сегодняшний день де-факто стандартом для решения задач NLU являются трансформер-модели, архитектура которых была предложена в работе «Attention Is All You Need» (рис. 4) [13]. Основная идея трансформера заключается в использовании механизма многоголовочного самовнимания (multi-head self-attention), позволяющего модели учитывать взаимосвязи между всеми позициями входной последовательности без рекуррентных связей и свёрток. Это обеспечивает высокую эффективность при обучении на больших корпусах текста и хорошую переносимость на разнообразные downstream-задачи, включая классификацию текстов, извлечение сущностей и моделирование вопросов-ответов [13, 22].

Архитектура модели Transformer
Рисунок 4 – Архитектура модели Transformer [13]
Источник: Vaswani A., Shazeer N., Parmar N., Uszkoreit J., Jones L., Gomez A. N., Kaiser Ł., Polosukhin I. Attention Is All You Need // Advances in Neural Information Processing Systems. – 2017. – Vol. 30. – P. 5998–6008.

Практическая работа с трансформерами в прикладных проектах существенно упрощается благодаря экосистеме Hugging Face, предоставляющей реализованные модели (в том числе русскоязычные, такие как RuBERT), предобученные веса и инструменты для дообучения на специализированных датасетах. Для задач голосового управления рабочей станцией естественным выбором является использование трансформер-модели энкодерного типа (например, семейства BERT), дообученной на корпусе команд управления и типичных пользовательских запросов [19, 20, 23, 24, 25].

В рамках работы реализован NLU-конвейер, включающий:

  • предобработку текста (нормализация, приведение числительных к числам, фильтрация служебных слов);
  • токенизацию в соответствии со словарём выбранной трансформер-модели;
  • применение дообученной модели RuBERT для получения контекстных представлений;
  • специализированный классификатор интентов и, при необходимости, модуль извлечения аргументов команды [19, 20].

Такой подход позволяет обрабатывать как простые команды («открой браузер», «сверни все окна»), так и более сложные выражения с параметрами («установи громкость на тридцать процентов», «переключись на второй рабочий стол»), сохраняя при этом возможность дальнейшего расширения набора интентов без принципиальной перестройки архитектуры.

2.3 Квантование и оптимизация трансформерных моделей NLU

Использование трансформерных моделей в автономном голосовом ассистенте на рабочей станции накладывает ограничения по вычислительным ресурсам. Даже «базовые» модели BERT-семейства содержат сотни миллионов параметров и требуют существенных объёмов оперативной памяти и вычислений при обработке каждой команды. Для обеспечения комфортного времени отклика и возможности работы на устройствах без дискретного GPU необходимы методы оптимизации моделей, уменьшающие их размер и повышающие скорость работы без критического ухудшения качества [22].

Одним из ключевых направлений такой оптимизации является квантование нейросетевых моделей, заключающееся в представлении весов и/или активаций в формате с меньшим числом бит по сравнению с исходным (например, INT8 вместо FP32). Обзорные работы выделяют два основных подхода: постобучающее квантование (Post-Training Quantization, PTQ) и квантование с учётом обучения (Quantization-Aware Training, QAT) [14–16]. Обобщённая схема этих подходов показана на рисунке 5: слева представлено квантование с учётом обучения, при котором операция квантования явно моделируется в процессе дообучения модели на обучающих данных, справа — постобучающее квантование, где предварительно обученная модель не изменяется, а параметры квантизаторов подстраиваются по калибровочному набору данных.

При PTQ исходная модель сначала обучается в стандартной плавающей арифметике, после чего выполняется статическое или динамическое преобразование весов и, при необходимости, активаций в более компактное представление. Такой подход прост в применении, но может приводить к заметному снижению качества, особенно для сложных архитектур, к которым относятся трансформеры [14, 15]. QAT, наоборот, предполагает моделирование эффектов квантования непосредственно в процессе обучения (например, эмуляция округления и ограничения диапазона), что позволяет частично компенсировать ухудшение точности и добиться лучшего компромисса между качеством и производительностью [15, 16].

Исследования, посвящённые квантованию трансформерных моделей, демонстрируют возможность существенного сокращения размера и ускорения инференса при использовании схем INT8 и даже FP8 при условии корректной настройки квантизаторов и возможной донастройки отдельных слоёв [15, 16]. В частности, в работе FP8-BERT представлены результаты успешного применения постобучающего квантования для BERT-подобных моделей с минимальной потерей качества при значительном выигрыше по скорости [16].

В собственной работе был сделан акцент на оптимизации трансформерного модуля NLU на основе RuBERT для использования в офлайн-ассистенте. В статье [20] и сопутствующих отчётах описан pipeline, включающий:

  • дообучение базовой RuBERT-модели на корпусе команд управления рабочим столом;
  • применение QAT-методики для учёта квантования в процессе дообучения;
  • экспорт модели в формат ONNX и последующее динамическое квантование до INT8;
  • интеграцию квантованной модели в прототип ассистента с использованием CPU-инференса.
Сравнение схем квантования с учётом обучения и постобучающего квантования для трансформерной модели
Рисунок 5 – Сравнение схем квантования с учётом обучения (QAT, слева) и постобучающего квантования (PTQ, справа) для трансформерной модели [21]
Источник: What is quantization aware training? [Электронный ресурс] // IBM Think. – Режим доступа: https://www.ibm.com/think/topics/quantization-aware-training

Эксперименты показали, что в условиях ограниченных вычислительных ресурсов квантованная NLU-модель обеспечивает существенное снижение времени обработки одной команды и уменьшение объёма занимаемой памяти при сохранении приемлемой точности классификации интентов [20]. Это делает возможным работу ассистента на типичных пользовательских компьютерах без выделенного графического ускорителя и закладывает базу для дальнейшего масштабирования числа поддерживаемых команд.

2.4 Edge AI и офлайн-развёртывание ассистента на рабочей станции

Концепция Edge AI предполагает перенос вычислительно затратных компонентов искусственного интеллекта с централизованных облачных серверов на пограничные и конечные устройства: шлюзы, встраиваемые контроллеры, персональные компьютеры и мобильные устройства [7]. Для голосовых ассистентов это означает возможность выполнения распознавания речи и основных компонентов NLU непосредственно на рабочей станции пользователя, без постоянного обращения к удалённым сервисам.

Технологически такой подход опирается на сочетание нескольких факторов:

  • наличие компактных и оптимизированных моделей ASR и NLU (VOSK, квантованные трансформеры);
  • поддержку стандартов аппаратного ускорения (AVX-инструкции CPU, встроенные графические ядра и т.п.);
  • эффективные библиотеки инференса (ONNX Runtime, специализированные движки для INT8/FP8);
  • архитектурные решения, позволяющие разделять нагрузку между потоками ввода/вывода, распознаванием и исполнением команд [6, 7, 12, 20].

Для сценария управления Windows на рабочей станции модель Edge AI является естественным выбором:

  • все операции с аудиоданными и текстом выполняются локально, что повышает уровень конфиденциальности и снижает риски утечки;
  • задержка выполнения команды определяется только скоростью локального инференса и не зависит от состояния сети;
  • возможно использование ассистента в изолированных или частично изолированных сетях (например, в учебных классах, на производственных рабочих местах, в административных учреждениях).

Использование VOSK в качестве офлайн-ASR, трансформеров Hugging Face в роли NLU-модуля и методов квантования для их оптимизации формирует технологическую основу разрабатываемого автономного голосового ассистента. В следующих разделах на этой основе строится модульная архитектура системы и описываются собственные наработки, направленные на создание прототипа ассистента для управления Windows.

3 АНАЛИЗ СУЩЕСТВУЮЩИХ АРХИТЕКТУР АВТОНОМНЫХ АССИСТЕНТОВ

3.1 Облачные и гибридные архитектуры настольных голосовых ассистентов

Большинство распространённых голосовых ассистентов (Google Assistant, Amazon Alexa, Apple Siri и др.) исторически строятся по облачной или гибридной архитектуре. Даже в настольных вариантах («desktop voice assistant») типовая схема выглядит следующим образом: захват аудиосигнала на ПК, предварительная обработка, передача данных (сырого звука или закодированного аудио/фич) в облачный сервис, где выполняются распознавание речи и основные операции NLU, после чего готовый текст или команда возвращается на клиентское устройство для исполнения [6–8, 18].

Подобный подход упрощает разработку клиента и позволяет использовать мощные серверные модели, однако приводит к уже отмеченным ограничениям:

  • зависимость от стабильного интернет-соединения и качества канала;
  • необходимость передачи аудио- и текстовых данных на сторонние серверы с соответствующими рисками приватности и безопасности [8];
  • невозможность использования в изолированных или ограниченных сетевых контурах;
  • ограниченная интеграция с прикладным ПО на рабочем месте, если ассистент не спроектирован специально под задачи управления ОС.

В ряде работ, посвящённых «AI-based Desktop Voice Assistant», рассматриваются архитектуры, где клиентская часть развернута на ПК пользователя, но ключевые операции по распознаванию и пониманию выполняются через сторонние API (например, коммерческие STT-сервисы и облачные NLU-платформы) [18]. Такие системы обеспечивают базовый функционал (поиск информации, запуск приложений, открытие веб-страниц), но по своей сути остаются облачно-зависимыми и не решают задачи автономной работы и строгой приватности.

Для корпоративных и чувствительных к безопасности сценариев (внутренние АС, рабочие станции в защищённых сегментах) подобная архитектура неприемлема. Здесь требуются решения, в которых критические операции, такие как распознавание речи и хотя бы базовое NLU, переносятся непосредственно на рабочую станцию или, в более общем случае, на узел edge-инфраструктуры [7–9].

3.2 Системы голосового управления на основе открытого словаря и правил

Отдельный класс решений составляют системы голосового управления, ориентированные не на свободный диалог, а на фиксированный набор команд. Для таких систем характерно использование открытого словаря и правил, описывающих допустимые фразы и их соответствие действиям.

В работе Михайловой и Аникеева рассматривается подход к голосовому управлению на основе открытого словаря, где ключевую роль играет словарно-правилевой механизм сопоставления распознанных слов с командами управления [17]. Авторы показывают, что при грамотной организации словаря и правил возможно построение достаточно надёжного голосового интерфейса для конкретной предметной области, не прибегая к сложным NLU-моделям.

Типичная архитектура подобной системы включает:

  • модуль распознавания речи (как правило, основанный на специализированной или общедоступной ASR-модели);
  • словарь терминов и ключевых фраз, относящихся к управляющим командам;
  • набор правил/шаблонов (грамматик), описывающих допустимые конструкции команд;
  • модуль интерпретации, сопоставляющий распознанную последовательность токенов с конкретным действием.

Преимущества таких архитектур:

  • относительная простота реализации и интерпретации;
  • предсказуемость поведения за счёт жёстко заданного набора команд;
  • возможность расширения словаря без серьёзной перестройки кода (добавление новых терминов и шаблонов).

Однако при попытке применить этот подход к управлению полноценной операционной системой и произвольным набором приложений возникают серьёзные ограничения:

  • взрыв числа шаблонов и сложность их поддержки по мере увеличения количества команд и вариантов формулировок;
  • ограниченная устойчивость к спонтанной речи и вариативности естественного языка;
  • сложности с интерпретацией составных команд («открой проводник и перейди в папку Документы», «сделай окно браузера на пол экрана слева» и т.п.).

В рамках рассматриваемой ВКР этот опыт важен тем, что демонстрирует ценность открытых словарей и конфигурируемых команд, но одновременно подчёркивает необходимость более мощных механизмов понимания, основанных на трансформер-моделях и NLU-пайплайнах [13, 17, 19, 20].

3.3 Архитектуры с локальным ASR и упрощённым NLU: переход к автономным решениям

Промежуточный класс между полностью облачными ассистентами и строго словарно-правилевыми системами составляют архитектуры, в которых:

  • модуль распознавания речи (ASR) реализуется локально (на ПК или edge-устройстве);
  • модуль NLU имеет упрощённый характер (например, классический классификатор поверх TF-IDF или простых эмбеддингов, либо компактная нейросеть без сложной языковой модели);
  • команды управления определяются как набор интентов и ограниченного числа параметров, но без полноценной диалоговой логики.

Такие архитектуры часто описываются в прикладных работах по построению «desktop voice assistant», где авторы стремятся избавиться от зависимости от облачных STT-сервисов, но либо продолжают использовать внешние NLU-компоненты, либо применяют собственные облегчённые классификаторы [18].

Подобные архитектуры позволяют:

  • добиться автономности по отношению к распознаванию речи за счёт локального ASR;
  • уменьшить риски, связанные с передачей аудиоданных;
  • лучше интегрировать ассистента с ОС и приложениями (упор на управление рабочей станцией, а не только на информационные запросы).

Однако при использовании упрощённого NLU остаются следующие проблемы:

  • ограниченная гибкость в обработке вариативных формулировок;
  • необходимость ручного конструирования признаков или сценариев;
  • сложности с масштабированием числа интентов и параметров без переработки алгоритмической части.

Для задач уровня «полноценное управление рабочим столом Windows» этого оказывается недостаточно: необходимо сочетание локального ASR с полноценным трансформерным NLU, оптимизированным под работу на клиентском устройстве [13, 19, 20].

3.4 Ограничения существующих архитектур и требования к разрабатываемому ассистенту

Сравнительный анализ описанных архитектур позволяет выделить ключевые недостатки существующих решений с точки зрения поставленной в ВКР задачи – разработки автономного голосового ассистента для управления Windows:

Облачные и гибридные архитектуры обеспечивают высокое качество распознавания и понимания, но:

  • зависят от интернет-соединения;
  • создают риски утечки данных и усложняют соблюдение требований по безопасности [6–8];
  • плохо сочетаются с изолированными и защищёнными сетями.

Системы на основе открытого словаря и правил позволяют строить предсказуемые и конфигурируемые интерфейсы, но:

  • масштабируются с большим трудом при росте числа команд;
  • слабо устойчивы к естественной вариативности русской речи;
  • требуют значительных усилий по сопровождению шаблонов и правил [17].

Архитектуры с локальным ASR и упрощённым NLU делают шаг в сторону автономности, но:

  • ограничены по качеству понимания при сложных или слабо формализуемых командах;
  • не используют потенциал современных трансформерных моделей;
  • при расширении функциональности требуют существенной переработки классификаторов и логики [18].

На основе этого анализа формулируются ключевые требования к архитектуре разрабатываемого автономного ассистента:

  • Полная автономность по отношению к распознаванию и пониманию речи: все критические компоненты (ASR и NLU) должны функционировать локально на рабочей станции пользователя, без зависимости от внешних сервисов.
  • Использование современного NLU на основе трансформеров при одновременной оптимизации моделей (квантование, ONNX, edge-ориентированные методы) для работы на обычных ПК [13–16, 20].
  • Поддержка расширяемого набора интентов и конфигурируемых команд, сочетающая гибкость методов NLU с преимуществами открытого словаря и настраиваемых сценариев [17, 19–20].
  • Глубокая интеграция с операционной системой Windows и прикладным ПО, ориентированная не только на информационные запросы, но и на полноценное управление рабочим столом и приложениями.
  • Учёт требований безопасности, приватности и доступности уже на уровне архитектурных решений, а не как внешних «надстроек» [8–10].

Эти требования определяют место разрабатываемого в рамках ВКР ассистента в ландшафте существующих решений и служат основанием для построения его модульной архитектуры, подробно рассматриваемой в следующем разделе.

4 СОБСТВЕННЫЕ НАРАБОТКИ И ПРОЕКТИРУЕМАЯ АРХИТЕКТУРА АССИСТЕНТА

4.1 Эволюция исследований и формирование требований

Работа над автономным голосовым ассистентом для управления Windows выполнялась поэтапно в рамках учебной практики, научно-исследовательских работ (НИР) и публикаций. Такой подход позволил последовательно сформировать концепцию ассистента и реализовать ключевые компоненты прототипа.

На этапе учебной практики была выполнена постановка задачи и проведён анализ сценариев использования голосового интерфейса для управления рабочим столом. По итогам практики сформулированы функциональные и нефункциональные требования к системе, определены целевые профили эксплуатации (стационарные и мобильные ПК), выбран базовый технологический стек (VOSK для ASR, трансформерные модели Hugging Face для NLU), а также спроектирован архитектурный каркас ассистента с разделением на подсистемы захвата аудио, распознавания речи, естественно-языкового понимания и исполнения команд.

В рамках первой и второй НИР основной акцент был сделан на анализе методов и алгоритмов реализации автономного голосового ассистента: сравнивались открытые решения ASR и NLU, изучались подходы к квантованию моделей, анализировались варианты интеграции с операционной системой Windows. На основе проведённого анализа уточнена архитектура ассистента, определены требования к качеству распознавания, латентности и потреблению ресурсов, а также намечены направления оптимизации NLU-модулей.

В третьей НИР начато непосредственное проектирование и реализация модулей прототипа: разработаны подсистема захвата и буферизации аудио, интеграция с VOSK, базовый NLU-модуль (в том числе облегчённый MockNLU для ранних тестов), маршрутизация интентов и исполнитель команд для Windows. Результаты этих этапов изложены в публикациях, посвящённых архитектуре автономного голосового интерфейса и оптимизации NLU-моделей в условиях ограниченных вычислительных ресурсов [19, 20].

4.2 Требования к системе и профили эксплуатации (Desktop-HiQ и Mobile-LoQ)

На основе анализа рынка, технологических ограничений и проведённых экспериментов выделены два основных профиля эксплуатации ассистента:

Desktop-HiQ – стационарные рабочие станции и производительные ноутбуки, где допустим повышенный расход ресурсов ради улучшения качества распознавания и понимания;

Mobile-LoQ – мобильные и энергоограниченные устройства (тонкие ноутбуки, мини-ПК), где приоритетом является снижение латентности и экономия памяти даже ценой некоторого ухудшения качества.

Для профиля Desktop-HiQ предполагается использование более крупных моделей ASR и NLU, более сложные алгоритмы шумоподавления, развёрнутая система логирования и расширенный набор поддерживаемых интентов. Для профиля Mobile-LoQ акцент делается на компактные модели, квантованные трансформеры, снижение частоты вызовов ресурсоёмких процедур и ограничение числа одновременно активных подсистем.

Таблица 2 – Профили эксплуатации Desktop-HiQ и Mobile-LoQ
Параметр Desktop-HiQ Mobile-LoQ
Целевые устройства Стационарные рабочие станции, производительные ноутбуки Тонкие и энергоограниченные ноутбуки, мини-ПК, мобильные конфигурации
Основной приоритет Максимальное качество распознавания и понимания речи Минимизация латентности и экономия вычислительных ресурсов (CPU, RAM, энергия)
Модель ASR Полноразмерная модель ASR с более высоким качеством, возможна продвинутая фильтрация шума Облегчённая модель ASR, ориентированная на скорость работы и низкое потребление ресурсов
Модель NLU Квантованный, но более крупный трансформерный NLU-модуль (повышенная точность понимания) Компактный квантованный NLU-модуль, оптимизированный по размеру и скорости
Набор интентов Расширенный набор интентов: системные, сервисные, мультимедийные, контекстные команды Ограниченный набор критически важных команд для управления системой и базовыми сценариями
Логирование Подробное логирование: трассировка работы модулей, метрики качества, профили ресурсов Упрощённое логирование: только ключевые события, ошибки и минимально необходимые диагностические сообщения
Работа ресурсоёмких подсистем Разрешены более тяжёлые алгоритмы шумоподавления и аналитики Снижение частоты вызовов ресурсоёмких процедур, отключение необязательных подсистем
Архитектура и конфигурация модулей Единая архитектура ассистента; модули сконфигурированы в «полном» режиме под Desktop-HiQ Та же архитектура; используются те же модули, но в «облегчённой» конфигурации, адаптированной под Mobile-LoQ

Выделение профилей привело к формированию архитектурного принципа: все ключевые компоненты ассистента должны быть реализованы так, чтобы их замена или переконфигурация (например, переключение между большими и компактными моделями) не требовала модификации остальной части системы. Этот принцип реализуется в модульной архитектуре, описанной далее.

4.3 Модульная архитектура автономного голосового ассистента

Архитектура ассистента строится как конвейер «речь → семантика → действие», реализованный набором слабо связанных модулей с чётко определёнными интерфейсами. На верхнем уровне выделяются следующие подсистемы:

  • управление профилями и конфигурацией;
  • захват и предварительная обработка аудио;
  • распознавание речи (ASR) на основе VOSK;
  • естественно-языковое понимание (NLU) на основе трансформерных моделей;
  • маршрутизация интентов и управление сценариями;
  • исполнитель команд в среде Windows;
  • подсистема обратной связи и логирования.

Общая архитектура автономного голосового ассистента представлена на рис. 6.

Общая архитектура автономного голосового ассистента для управления Windows
Рисунок 6 – Общая архитектура автономного голосового ассистента для управления Windows [19]

4.3.1 Подсистема захвата и предварительной обработки аудио

Подсистема захвата аудио отвечает за получение аудиопотока с микрофона, его буферизацию и передачу в подсистему ASR. Реализованы следующие функции:

  • выбор активного устройства ввода;
  • настройка частоты дискретизации и размера буфера;
  • базовое шумоподавление и обрезка тишины (VAD);
  • корректное завершение и перезапуск сессий распознавания.

В разных профилях эксплуатации используются различные конфигурации: в профиле Desktop-HiQ возможно применение более сложных фильтров и увеличенных буферов, тогда как в профиле Mobile-LoQ предпочтительны облегчённые настройки для снижения задержки.

4.3.2 Подсистема распознавания речи (SpeechRecognizer на основе VOSK)

Подсистема SpeechRecognizer инкапсулирует работу с VOSK: загрузку акустической модели, инициализацию декодера, приём аудиофреймов и выдачу текстовых гипотез. Предусмотрены:

  • выбор конкретной модели VOSK в зависимости от профиля и настроек (полноразмерная или облегчённая);
  • настройка параметров декодера (чувствительность, максимальная длина результата, использование грамматик для командных фраз);
  • выдача промежуточных и финальных результатов распознавания.

4.3.3 Подсистема естественно-языкового понимания (NLU)

Подсистема NLU получает на вход строку распознанного текста и возвращает структурированное представление команды (интент и слоты). В текущей архитектуре предусмотрены два уровня реализации:

  • MockNLU – упрощённый модуль, основанный на регулярных выражениях и словарях, используемый на ранних этапах для быстрой отладки конвейера;
  • трансформерный NLU-модуль – дообученная на корпусе команд модель RuBERT (или аналог), квантованная и экспортированная в формат ONNX для автономного использования [19, 20].

NLU-подсистема включает:

  • модуль предобработки текста (нормализация, токенизация, преобразование числительных);
  • трансформерную модель для получения контекстных представлений;
  • классификатор интентов;
  • модуль извлечения параметров команды (например, числовых значений, номеров рабочих столов и т.п.).

4.3.4 Маршрутизация интентов и исполнитель команд Windows

Модуль маршрутизации интентов (IntentRouter) сопоставляет объект ParsedCommand с конкретным сценарием выполнения в системе. Сценарии описываются в конфигурационных файлах (например, в формате YAML или JSON) и включают:

  • идентификатор интента;
  • перечень необходимых сущностей (параметров);
  • тип действия (запуск приложения, отправка сочетаний клавиш, управление окнами, изменение системных настроек и т.п.);
  • дополнительные условия (ограничения, проверки контекста).

Исполнитель команд (WindowsCommandExecutor) реализует низкоуровневые действия с использованием WinAPI и других системных механизмов: запуск процессов, переключение окон, отправка клавиатурных и мышиных событий, управление громкостью и питанием, взаимодействие с системными диалогами и др.

4.3.5 Конфигурация и расширение ассистента

Значительная часть логики ассистента вынесена в конфигурационные файлы. В них задаются:

  • активный профиль (Desktop-HiQ или Mobile-LoQ);
  • выбор конкретных моделей ASR и NLU;
  • набор интентов, поддерживаемых ассистентом;
  • словари синонимов и вариантов формулировок;
  • привязки интентов к сценариям исполнения.

Такой подход позволяет расширять функциональность без перекомпиляции кода: достаточно добавить новый интент, определить его фразы и связанный сценарий в конфигурации. Тем самым объединяются преимущества «открытого словаря» и современных методов NLU, что снижает трудоёмкость сопровождения системы [17, 19–20].

4.4 Оптимизация и профилирование NLU-модуля

С учётом требований профиля Mobile-LoQ особое внимание уделяется оптимизации NLU-модуля. На основе проведённых исследований [20] реализован технологический конвейер, включающий:

  • дообучение базовой трансформерной модели (RuBERT или аналог) на корпусе команд управления Windows;
  • применение приёма Quantization-Aware Training для учёта эффектов квантования в процессе дообучения;
  • экспорт обученной модели в формат ONNX;
  • динамическое квантование весов и, при необходимости, активаций до формата INT8;
  • интеграцию квантованной модели в прототип ассистента и профили Desktop-HiQ / Mobile-LoQ с использованием ONNX Runtime.

Профилирование, описанное в работе [20], показывает, что квантованная NLU-модель обеспечивает существенное снижение времени инференса и объёма используемой памяти при умеренном влиянии на точность классификации интентов. Это делает возможной работу ассистента на более широком спектре устройств и соответствует концепции Edge AI [7, 20].

4.5 Обеспечение безопасности, приватности и доступности на уровне архитектуры

Вопросы безопасности и приватности рассматриваются как часть архитектуры ассистента, а не внешнее дополнение. Основные решения включают:

  • полностью локальную обработку аудио- и текстовых данных: все операции ASR и NLU выполняются на рабочей станции, сеть для их работы не используется, что исключает передачу голосовых данных на внешние сервисы;
  • изолированность модулей: взаимодействие между подсистемами осуществляется через чётко определённые интерфейсы, что облегчает аудит и ограничение прав;
  • настраиваемое логирование: журналы работы могут вести подробную отладочную информацию, ограниченный набор служебных записей либо быть полностью отключены в чувствительных средах;
  • учёт требований доступности: архитектура предусматривает возможность настройки голосовой обратной связи, скорости отклика, уровня детализации сообщений и набора команд, что важно для пользователей с различными типами ограничений [3, 10, 19–20].

В совокупности описанная архитектура формирует технологический фундамент автономного голосового ассистента для управления Windows: локальное распознавание речи на основе VOSK, трансформерное NLU с квантованием, модульная конфигурация интентов и сценариев, а также встроенные механизмы обеспечения безопасности, приватности и доступности. Такой подход соответствует требованиям, сформулированным в аналитических разделах реферата, и задаёт направление дальнейшей реализации и развития системы.

ЗАКЛЮЧЕНИЕ

Проведённый обзор показал, что голосовые ассистенты занимают устойчиво растущую нишу в глобальном ИТ-рынке и превращаются в один из ключевых интерфейсов взаимодействия пользователя с цифровой средой [15]. При этом наряду с расширением потребительского сегмента (мобильные устройства, умные колонки) активно развиваются сценарии использования на рабочих местах, в промышленных системах и специализированных терминалах, а также формируется самостоятельный рынок локальных голосовых SoC [14]. В таких условиях особую актуальность приобретают решения, обеспечивающие автономную работу ассистента, низкую задержку отклика и соответствие требованиям информационной безопасности.

Анализ публикаций по безопасности и приватности голосовых интерфейсов подтверждает, что традиционная облачная архитектура создаёт широкий спектр угроз: от атак с поддельными аудиокомандами до рисков утечки персональных данных при централизованном хранении голосовой информации [68]. Рассматриваемые в литературе подходы к федеративному обучению и распределённым cloud–edge–end-архитектурам демонстрируют возможности совмещения приватности и качества моделей, но требуют существенной инфраструктурной поддержки [9]. Для настольных ассистентов, работающих в корпоративных и изолированных средах, более естественным является подход, в котором все критические операции — такие как распознавание и понимание речи — выполняются локально на рабочей станции.

Отдельное внимание было уделено вопросам доступности и инклюзивности голосовых интерфейсов. Исследования показывают, что наличие удобного голосового управления заметно снижает барьеры для пользователей с нарушениями зрения, моторики и другими ограничениями, однако массовые ассистенты ориентированы преимущественно на бытовые сценарии и не покрывают полноценное управление рабочей станцией [3, 10]. Таким образом, создание автономного голосового ассистента, интегрированного с операционной системой Windows и ориентированного на широкие сценарии управления рабочим столом, представляется востребованным направлением как с точки зрения доступности, так и с точки зрения повышения общей эффективности работы пользователя.

С технологической стороны рассмотрены основные компоненты, лежащие в основе автономного ассистента. В области автоматического распознавания речи ключевая роль отводится нейросетевым моделям и гибридным архитектурам, реализующим современные подходы к обработке акустических и языковых данных [11]. Показано, что платформа VOSK позволяет обеспечить офлайн-распознавание русского языка на типичных пользовательских ПК, поддерживает потоковую обработку и интеграцию с приложениями, что делает её удобной основой для построения настольного ассистента [12].

Для решения задач естественно-языкового понимания целесообразно использовать трансформерные модели, продемонстрировавшие высокую эффективность в задачах классификации интентов и извлечения сущностей [13]. Экосистема Hugging Face предоставляет необходимые инструменты для дообучения русскоязычных моделей (например, семейства RuBERT) под специфику команд управления Windows, а также для интеграции таких моделей в прикладные системы [13, 19, 20]. Вместе с тем прямое использование полноразмерных трансформерных моделей на клиентских устройствах сопряжено с существенными вычислительными затратами, что делает актуальными методы оптимизации.

Обзор работ по квантованию нейросетевых моделей показывает, что использование постобучающего квантования и Quantization-Aware Training позволяет существенно уменьшить размер моделей и ускорить инференс при умеренном снижении качества, в том числе для трансформеров [1416]. Это открывает возможность применения квантованных NLU-модулей в условиях ограниченных вычислительных ресурсов и соответствует концепции Edge AI [7, 1416, 20]. В реферате рассмотрен технологический конвейер оптимизации NLU-модуля на основе RuBERT с использованием квантования и экспорта в формат ONNX, ориентированный на работу на обычных пользовательских ПК [20, 22, 23].

Анализ существующих архитектур голосовых ассистентов показал, что классические облачные решения обеспечивают высокое качество распознавания и понимания, но не удовлетворяют требованиям автономности и приватности [68, 18]. Системы на основе открытого словаря и правил демонстрируют простоту и предсказуемость поведения, однако плохо масштабируются при росте числа команд и слабо адаптируются к вариативности естественной речи [17]. Промежуточные архитектуры с локальным ASR и упрощённым NLU частично решают проблему зависимости от сети, но ограничены по функциональности и гибкости [18]. На этом фоне обоснована необходимость архитектуры, в которой локальное распознавание речи на основе VOSK сочетается с трансформерным NLU, оптимизированным методами квантования, а логика ассистента реализуется как модульная система с конфигурируемым набором интентов и сценариев [1213, 1920].

Сформированный в результате проведённого исследования подход задаёт технологическую основу для разработки автономного голосового ассистента управления Windows, ориентированного на локальную обработку данных, расширяемый набор команд и учёт требований безопасности и доступности. Дальнейшее развитие работы связано с углублённой реализацией и экспериментальной оценкой прототипа, расширением репертуара интентов и детальным исследованием производительности и надёжности ассистента в реальных сценариях эксплуатации.

СПИСОК ИСТОЧНИКОВ

  1. Voice Assistant Landscape Market Size, Share, Industry Trends and Forecast to 2033 [Электронный ресурс] // Consa Insights. – 2025. – URL: https://www.consainsights.com/reports/voice-assistant-landscape-market .
  2. Voice Assistant Market Size, Trends, Share, Growth and Forecast 2024–2032 [Электронный ресурс] // Market Intelo. – 2024. – URL: https://marketintelo.com/report/voice-assistant-market .
  3. Global Voice Assistant Market Is Anticipated To Reach Around USD 65.46 Billion by 2032 [Электронный ресурс] // Zion Market Research. – 2024. – URL: https://www.zionmarketresearch.com/news/voice-assistant-market .
  4. Local Voice Assistant SoC Market: Global Industry Analysis, Growth, Share, Size, Trends, and Forecast 2025–2033 [Электронный ресурс] // DataIntelo. – 2024. – URL: https://dataintelo.com/report/local-voice-assistant-soc-market .
  5. Voices. 2024 Voice Assistant Report: Talking Technology: The Voice Assistant Said What? [Электронный ресурс]. – 2024. – 10 с. – URL: https://static.voices.com/wp-mainsite/uploads/20240326135125/Voices-TalkingTechnology-VoiceAssistantsReport.pdf .
  6. Chen, M. Why Offline AI Voice Assistant is the Future [Электронный ресурс] // Medium. – 2023. – URL: https://mychen76.medium.com/why-offline-ai-voice-assistant-is-the-future-1d071b1b6422 .
  7. Edge AI: The Next Frontier in Artificial Intelligence [Электронный ресурс] // T Cognition Blog. – 2025. – URL: https://tcognition.com/blogs/edge-ai-the-next-frontier/ .
  8. Li, J. Security and Privacy Problems in Voice Assistant Applications: A Survey [Электронный ресурс] / J. Li, C. Chen, L. Pan, M. R. Azghadi, H. Ghodosi, J. Zhang // arXiv. – 2023. – arXiv:2304.09486. – DOI: 10.48550/arXiv.2304.09486. – URL: https://arxiv.org/abs/2304.09486 .
  9. Zhan, S. A Review on Federated Learning Architectures for Privacy-Preserving AI: Lightweight and Secure Cloud–Edge–End Collaboration [Электронный ресурс] / S. Zhan, L. Huang, G. Luo, S. Zheng, Z. Gao, H.-C. Chao // Electronics. – 2025. – Vol. 14, No. 13. – Art. 2512. – DOI: 10.3390/electronics14132512. – URL: https://doi.org/10.3390/electronics14132512 .
  10. Masina, F. Investigating the Accessibility of Voice Assistants With Impaired Users: Mixed Methods Study [Электронный ресурс] / F. Masina, V. Orso, P. Pluchino [et al.] // Journal of Medical Internet Research. – 2020. – Vol. 22, No. 9. – e18431. – DOI: 10.2196/18431. – URL: https://doi.org/10.2196/18431 .
  11. Тампель, И. Б. Автоматическое распознавание речи : учеб. пособие / И. Б. Тампель, А. А. Карпов. – СПб. : Университет ИТМО, 2016. – 138 с.
  12. VOSK Offline Speech Recognition API [Электронный ресурс] / Alpha Cephei. – URL: https://alphacephei.com/vosk/index.ru .
  13. Vaswani, A. Attention Is All You Need / A. Vaswani, N. Shazeer, N. Parmar, J. Uszkoreit, L. Jones, A. N. Gomez, Ł. Kaiser, I. Polosukhin // Advances in Neural Information Processing Systems. – 2017. – Vol. 30. – Pp. 5998–6008. – DOI: 10.48550/arXiv.1706.03762. – URL: https://arxiv.org/abs/1706.03762 .
  14. Иванов, Е. А. Методы квантования нейросетевых моделей [Электронный ресурс] / Е. А. Иванов, Т. Е. Мамонова // Интеллектуальная энергетика : сб. трудов I Всерос. науч.-практ. конф., Томск, 21–23 нояб. 2023 г. – Томск : Томский политехнический университет, 2023. – С. 225–229. – URL: https://earchive.tpu.ru/bitstream/11683/80450/1/conference_tpu-2023-C136_p225-229.pdf .
  15. Татарникова, Т. М. Анализ эффективности постобучающего квантования для оптимизации нейронных сетей / Т. М. Татарникова, А. С. Раскопина // Наукоёмкие технологии в космических исследованиях Земли. – 2025. – Т. 17, № 2. – С. 4–10. – DOI: 10.36724/2409-5419-2025-17-2-4-10 .
  16. Li, J. FP8-BERT: Post-Training Quantization for Transformer [Электронный ресурс] / J. Li, T. Zhang, I. E.-H. Yen, D. Xu // arXiv. – 2023. – arXiv:2312.05725. – DOI: 10.48550/arXiv.2312.05725. – URL: https://arxiv.org/abs/2312.05725 .
  17. Михайлова, С. А. Применение технологий обработки естественного языка для голосового управления на основе открытого словаря / С. А. Михайлова, К. Г. Аникеев // Интеллектуальные технологии на транспорте. – 2023. – № 4 (36). – С. 19–27. – DOI: 10.24412/2072-6396-2023-4-19-27. – URL: https://cyberleninka.ru/article/n/primenenie-tehnologiy-obrabotki-estestvennogo-yazyka-dlya-golosovogo-upravleniya-na-osnove-otkrytogo-slovarya .
  18. AI-based Desktop Voice Assistant [Электронный ресурс] // Scribd. – URL: https://ru.scribd.com/document/912946140/AI-based-Desktop-Voice-Assistant .
  19. Сидорика, М. Д. Разработка автономного голосового интерфейса для управления рабочим столом: от распознавания до семантического анализа / М. Д. Сидорика, Л. А. Лазебная // Информатика, управляющие системы, математическое и компьютерное моделирование (ИУСМКМ-2025 – студенческая секция) : сб. материалов XVI Междунар. науч.-техн. конф. в рамках XI Междунар. науч. форума ДНР (Донецк, 28 мая 2025 г.). – Донецк : ДонНТУ, 2025. – С. 265–271. – URL: https://drive.google.com/file/d/1Q7m59Yw45mHtSX8Tl3hbPz8TdMBb_naA/view .
  20. Сидорика, М. Д. Оптимизация нейросетевых моделей естественно-языкового понимания (NLU) в условиях ограниченных вычислительных ресурсов / М. Д. Сидорика, Л. А. Лазебная // Программа IX Всероссийской научно-технической конференции с международным участием «Современные информационные технологии в образовании и научных исследованиях (СИТОНИ-2025)» [Электронный ресурс]. – Донецк : ДонНТУ, 2025. – URL: https://amai.fisp.donntu.ru/sites/default/files/programma_sitoni-2025_20_noyabrya_2025g.pdf .
  21. IBM. What is quantization aware training? [Электронный ресурс] // IBM Think. – URL: https://www.ibm.com/think/topics/quantization-aware-training .
  22. Devlin, J. BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding [Электронный ресурс] / J. Devlin, M.-W. Chang, K. Lee, K. Toutanova // arXiv. – 2018. – arXiv:1810.04805. – DOI: 10.48550/arXiv.1810.04805. – URL: https://arxiv.org/pdf/1810.04805 .
  23. Kuratov, Yu. Adaptation of Deep Bidirectional Multilingual Transformers for Russian Language [Электронный ресурс] / Yu. Kuratov, M. Arkhipov // arXiv. – 2019. – arXiv:1905.07213. – DOI: 10.48550/arXiv.1905.07213. – URL: https://arxiv.org/pdf/1905.07213 .
  24. Burtsev, M. DeepPavlov: An Open Source Library for Conversational AI [Электронный ресурс] / M. Burtsev, A. Seliverstov, R. Airapetyan [et al.]. – 2018. – URL: https://openreview.net/pdf?id=Byl7Y79w97 .
  25. Hugging Face. Transformers: библиотека трансформерных моделей [Электронный ресурс]. – URL: https://github.com/huggingface/transformers/blob/main/i18n/README_ru.md .