ДонНТУ Портал магистров

Сидорика Максим Денисович

Факультет интеллектуальных систем и программирования

Кафедра прикладной математики и искусственного интеллекта

Направление: 09.04.04 «Программная инженерия»

Профиль: «Технологии программного обеспечения интеллектуальных систем»

Тема выпускной квалификационной работы магистра: «Разработка автономного голосового ассистента для управления Windows на основе VOSK и Hugging Face Transformers»

Руководитель ВКР: ктн, доцент Лазебная Людмила Александровна

Собственные публикации и доклады

  1. Авторы: М. Д. Сидорика, Л. А. Лазебная
    Описание: Рассматривается методика Quantization-Aware Training (QAT) для русскоязычной модели DeepPavlov/rubert-base-cased с последующим экспортом в ONNX и динамическим квантованием в INT8. На собственном датасете команд показано, что предложенный pipeline позволяет в 4 раза уменьшить размер модели и почти втрое ускорить инференс при сохранении точности на уровне 97 %, что делает решение пригодным для локальных голосовых ассистентов и edge-устройств.
  2. Авторы: М. Д. Сидорика, Л. А. Лазебная
    Описание: Предложена архитектура полностью офлайн-работающего голосового ассистента для Windows, реализующего сквозной конвейер «речь → семантика → действие». Используются VOSK для ASR и квантованная модель RuBERT-ONNX для NLU. Поддерживаются два аппаратных профиля (Desktop-HiQ и Mobile-LoQ) с автоматическим выбором по ресурсам. Система ориентирована на приватность, модульность и задержку отклика 0,5–0,7 с.
  3. Авторы: М. Д. Сидорика, Е. В. Радевич
    Описание: Представлен дизайн и архитектура образовательного программного модуля на базе Windows Forms и C#, интегрированного с IDE Espruino для контроллера Amperka Iskra JS. Интерфейс включает систему авторизации, учебные уроки, редактор кода и тестовые задания, ориентирован на интуитивное обучение основам робототехники.
  4. Авторы: М. Д. Сидорика, Е. В. Радевич
    Описание: Рассмотрены возможности применения рекуррентных (RNN) и свёрточных (CNN) нейронных сетей для краткосрочного прогнозирования метеорологических параметров. Проанализированы требования к данным, методы повышения точности, а также ограничения: зависимость от объёма обучающей выборки, вычислительная сложность и проблема интерпретации.

Публикации научного руководителя

  1. Автор: Л. А. Лазебная
    Описание: Представлены детерминированные математические модели процесса гидравлического воздействия на угольный пласт, основанные на уравнениях нелинейно-упругой фильтрации жидкости в сплошной среде. Рассматриваются одномерная и двумерная постановки задачи, разностные схемы для численного решения и влияние вариаций проницаемости на распределение давления и прирост влажности в обрабатываемом массиве.
  2. Авторы: Л. А. Лазебная, Е. Н. Едемская, Д. В. Бельков
    Описание: Предложен метод динамического размещения файлов по узлам компьютерной сети с оптимизацией периодичности мониторинга уровней локальных запросов. На основе метода фазового укрупнения сложных систем рассчитывается оптимальный интервал между мониторингами, минимизирующий дополнительную задержку обработки запросов.

Тематические статьи

  1. Авторы: С. А. Михайлова, К. Г. Аникеев
    Описание: Рассматривается использование технологий NLP и библиотек распознавания речи (Vosk и др.) для организации голосового управления на основе открытого словаря. Предлагается структура системы, где команды задаются не жёстким списком фраз, а классами семантически близких выражений, что позволяет динамически расширять словарь.
  2. Авторы: В. В. Чаругин, В. В. Чаругин, А. Н. Чесалин, Н. Н. Ушкова
    Описание: Описан визуальный конструктор пайплайнов обработки текста на основе современных трансформерных моделей (BERT, DistilBERT и др.) и показано его применение для автоматического структурирования логов ИБ из разных источников в единый формат, пригодный для последующего анализа и интеграции с SIEM.
  3. Автор: М. О. Муравьев
    Описание: Рассматриваются два основных подхода к автоматическому распознаванию речи в голосовых помощниках: традиционный модульный ASR и комплексный end-to-end-подход на основе интеллектуальных алгоритмов. Описаны их архитектурные особенности, области применения, преимущества и недостатки, включая требования к вычислительным ресурсам и обучающим корпусам. Приведены результаты экспериментального сравнения Vosk-Browser Demo и RealSpeaker Transcriber при распознавании фрагмента аудиозаписи судебного заседания с оценкой точности и полноты.
  4. Авторы: Т. М. Татарникова, А. С. Раскопина
    Описание: Проанализированы современные подходы к оптимизации глубоких нейронных сетей (прунинг, квантование, дистилляция знаний) в условиях ограниченных вычислительных ресурсов. Особое внимание уделено постобучающему квантованию (PTQ) и его влиянию на размер модели, скорость инференса и точность для архитектур компьютерного зрения и трансформеров. Показано, что 8-битное PTQ позволяет существенно сократить требования к памяти и времени работы при умеренном снижении качества.
  5. Авторы: Р. И. Нежников, А. Н. Маренков
    Описание: Рассматривается подход к классификации неструктурированного текста с использованием трансформерных моделей. Описаны базовые компоненты архитектуры (self-attention, multi-head attention, positional encoding), этапы подготовки данных и файн-тюнинга, а также метрики оценки качества (Accuracy, Precision, Recall, F1). В экспериментальной части приведено сравнение BERT и RoBERTa на задаче бинарной классификации отзывов.
  6. Автор: С. А. Оганесян
    Описание: Обзор практического применения методов искусственного интеллекта и современных моделей ОЕЯ (нейронные сети, трансформеры, глубокое обучение) в задачах автоматического перевода, виртуальных ассистентов, анализа текстов и распознавания речи. Отмечаются преимущества ИИ-подходов (качество, автоматизация, персонализация) и обсуждаются ограничения, связанные с объяснимостью моделей, потреблением ресурсов и этическими аспектами.
  7. Автор: Г. Ю. Узких
    Описание: Обзор трансформерной архитектуры и её применения в задачах обработки естественного языка: механизм внимания и self-attention, принципы обучения и переноса, а также примеры использования трансформеров в ключевых NLP-задачах (классификация, извлечение сущностей, ответы на вопросы, машинный перевод, генерация текста). Отмечаются преимущества трансформеров по сравнению с рекуррентными архитектурами и основные ограничения (ресурсоёмкость, требования к данным и вычислениям).
  8. Автор: С. М. Маслюхин
    Описание: Рассматривается задачно-ориентированная диалоговая система, способная отвечать на запросы, выходящие за рамки API, за счёт доступа к неструктурированной базе знаний (FAQ). Описаны этапы: обнаружение запросов, требующих внешних знаний (SVM/CNN/BERT/GPT-2 и комбинирование), выбор релевантного фрагмента из базы знаний (BiEncoder/DPR), а также генерация ответа (BART) и подход Retrieval Augmented Generation (RAG). Предложены методы аугментации текста, имитирующие ошибки ASR, и приведены результаты апробации на данных DSTC10.
  9. Авторы: Б. Ю. Салып, А. А. Смирнов
    Описание: Рассматривается задача оценки смысловой близости предложений естественного языка и анализируется языковая модель BERT как инструмент вычисления семантической схожести. Кратко описаны основы трансформерной архитектуры, особенности предобучения BERT (двунаправленный контекст, маскирование токенов), преимущества (контекстуальные эмбеддинги, скорость и эффективность обучения) и ограничения модели. Приведена схема преобразования входного предложения в эмбеддинги и последующего дообучения под целевую задачу.

Переводы статей

  1. Авторы оригинала: Shivani Gupta, Mohd Haider, Md Shabbir
    Автор перевода: М. Д. Сидорика
    Описание: Перевод статьи, в которой рассматривается архитектура голосового ассистента на основе методов искусственного интеллекта. Описаны этапы обработки речи (предобработка аудио, распознавание речи, естественно-языковой анализ, генерация ответа), особенности реализации и экспериментальные результаты по улучшению точности распознавания и удобства взаимодействия пользователя с системой.
  2. Авторы оригинала: Binghui Peng, Srini Narayanan, Christos Papadimitriou
    Автор перевода: М. Д. Сидорика
    Описание: Перевод препринта, в котором с использованием аппарата коммуникационной сложности формулируется фундаментальное ограничение Transformer-слоя: трудности с вычислением композиции функций (на примере задач вроде «найти дедушку/бабушку» в генеалогии) при достаточно больших доменах. Также обсуждаются последствия для «композиционных» математических задач и возможная связь с феноменом галлюцинаций в больших языковых моделях.
  3. Авторы оригинала: James Lee-Thorp, Joshua Ainslie, Ilya Eckstein, Santiago Ontañón
    Автор перевода: М. Д. Сидорика
    Описание: Перевод препринта, в котором предлагается архитектура FNet — замена self-attention в Transformer-энкодере на слой «смешивания токенов» на основе преобразования Фурье (FFT). Рассмотрены компромиссы «скорость–точность», результаты на GLUE и Long-Range Arena (LRA), а также гибридные конфигурации (часть слоёв внимания + слои Фурье).
  4. Авторы оригинала: Victor Sanh, Lysandre Debut, Julien Chaumond, Thomas Wolf
    Автор перевода: М. Д. Сидорика
    Описание: Перевод статьи, в которой предлагается DistilBERT — компактная версия BERT, полученная с помощью дистилляции знаний. Модель сохраняет большую часть качества BERT при меньшем числе параметров и более быстром инференсе; описаны постановка, «тройная» функция потерь (MLM + distillation + cosine), а также результаты на GLUE, IMDb и SQuAD и анализ скорости/размера для сценариев on-device.
  5. Авторы оригинала: Mingchen Li, Zaifu Zhan, Han Yang, Yongkang Xiao, Huixue Zhou, Jiatan Huang, Rui Zhang
    Автор перевода: М. Д. Сидорика
    Описание: Перевод статьи из Science Advances, в которой предлагается бенчмарк BioRAB для комплексной оценки retrieval-augmented LLM (RAL) в биомедицинских NLP-задачах. Авторы сравнивают модели на пяти задачах и 11 датасетах и анализируют устойчивость (unlabeled/counterfactual/diverse) и (self-/negative) awareness, а также предлагают стратегии detect-and-correct и контрастивное обучение для повышения надёжности.