Научные труды

Источник: Сборник материалов журнала «Современные тенденции развития и перспективы внедрения инновационных технологий в машиностроении, образовании и экономике». — 2025. — Т. 7. — № 1. — С. 78-81.


УДК 004.032.26

РАЗРАБОТКА ТУРИСТИЧЕСКОЙ РЕКОМЕНДАТЕЛЬНОЙ СИСТЕМЫ НА ОСНОВЕ НЕЙРОСЕТЕВОГО МОДЕЛИРОВАНИЯ

Гафиятуллин Шамиль Халилович, Емалетдинова Лилия Юнеровна
Казанский национальный исследовательский технический университет КАИ им. А.Н. Туполева, Казань, Россия


Аннотация

В данной статье представлено описание туристической рекомендательной системы на основе нейросетевого моделирования, способной выдавать персонализированные рекомендации. Ключевые слова: нейросетевое моделирование, искусственный интеллект в сфере туризма, большие языковые модели.

Введение

Современные технологии находят применение в самых разных сферах, в том числе и в области туризма. С развитием цифровых сервисов туристы получают доступ к интеллектуальным системам, способным подбирать персонализированные рекомендации с учетом их индивидуальных предпочтений. Такие системы способны предложить маршруты, порекомендовать к посещению интересные достопримечательности и заведения или предложить разнообразные и увлекательные активности в соответствии с предпочтениями туриста.

Одной из ключевых задач разработки рекомендательных туристических систем является задача обработки запросов пользователей о предпочтениях в текстовой форме, сопоставления их с имеющимися текстовыми данными о туристических объектах, хранящихся в базе данных и вывод наиболее подходящих объектов. Решение данной задачи требует использования методов обработки естественного языка (NLP), позволяющих эффективно работать с текстовыми данными. Одним из наиболее перспективных подходов к построению таких систем является использование больших языковых моделей (Large Language Models, LLM).

В современных рекомендательных системах, работающих с текстовыми данными, ключевой задачей является понимание семантики запросов пользователей для дальнейшего выявления туристических объектов, соответствующих им. Наиболее часто используемые традиционные методы, такие как TF-IDF и Word2Vec, обладают рядом ограничений [3]:

  1. TF-IDF учитывает частоту терминов, но игнорирует контекст и семантические связи между словами.
  2. Word2Vec создаёт статические векторные представления слов, не учитывая многозначность и зависимость от контекста.

Языковая модель BERT и его модификации лишены этих недостатков и обладают следующими особенностями [2]:

  1. Контекстное понимание текста. Модели семейства BERT используют механизм внимания, который анализирует слова в двустороннем контексте [1]. Это позволяет модели корректно интерпретировать многозначные слова.
  2. Генерация семантических векторных представлений. Модель преобразует текстовые описания (как запросы пользователей, так и описания туристических объектов) в векторные представления, где близкие по смыслу тексты имеют схожие координаты в векторном пространстве. Это позволяет эффективно сравнивать запросы с объектами через косинусное сходство.
  3. Предварительное обучение. Модели семейства BERT предварительно обучены на больших объемах текстов, что позволяет применять их для разнообразных текстовых задач.
  4. Обработка длинных текстов. Для задач выработки системой туристических рекомендаций важно уметь анализировать развернутые описания объектов и запросы пользователей. Модели семейства BERT способны учитывать зависимости между всеми словами в таких описаниях и запросах.
  5. Поддержка многоязычности. Многие BERT-модели поддерживают несколько языков, что актуально для запросов иностранных туристов и описаний туристических объектов на языках, соответствующих запросам.

В данной работе предлагается подход к разработке рекомендательной системы на основе модели из семейства BERT (Bidirectional Encoder Representations from Transformers), которая состоит из следующих этапов:

  1. Формирование набора описаний туристических объектов из открытых источников данных: туристические порталы, социальные сети и онлайн-карты.
  2. Создание базы данных, включающей две таблицы: таблица с информацией о пользователях и таблица с информацией о туристических объектах. Атрибуты первой таблицы содержат: идентификатор пользователя, идентификатор действия пользователя, предпочтения пользователя. Атрибуты второй таблицы содержат: идентификатор туристического объекта, название туристического объекта, адрес туристического объекта, оценку туристического объекта, описание туристического объекта, векторное представление описания туристического объекта.
  3. Выбор и применение модели BERT для генерации и сохранения векторных представлений описаний туристических объектов в базе данных.
  4. Разработка чат-бота, предоставляющего удобный интерфейс для пользователей.
  5. Разработка логики обработки запросов от пользователей, которая реализует генерацию векторных представлений самих запросов с помощью выбранной модели BERT, их сравнение с векторными представлениями описаний туристических объектов, хранящимися в базе данных и выдачу релевантных рекомендаций.

На рисунке 1 представлена структура разработанной системы, реализованной в Telegram-боте с использованием языка программирования Python и базы данных PostgreSQL.

Для апробации разработанной системы была сформирована база данных, содержащая 10 различных туристических объектов города Казани. Например, текстовое описание одного из объектов имеет следующий вид: «Главная мечеть Казани и всего Татарстана – Кул-Шариф, расположенная на территории Казанского Кремля. Она построена в 2005 году на месте разрушенной в XVI веке исторической мечети Казанского ханства. Кул-Шариф названа в честь имама, погибшего при осаде Кремля. Внешние стены Кул-Шариф облицованы белым мрамором, эффектно сочетающимся с бирюзовыми куполами шести минаретов – 4 больших и 2 малых. Отделка интерьеров поражает роскошью – потолочной лепниной, калейдоскопом цветных оконных витражей, изяществом ажурных деревянных деталей. Внутри здания есть балконы для размещения экскурсионных групп.

Структура разработанной системы
Рисунок 1 - Структура разработанной рекомендательной системы

Для оценки работоспособности системы были имитированы разнообразные ответы пользователя на запросы системы о предпочтениях и антипатиях. Рассмотрим пример. Ответ пользователя на вопрос системы о его предпочтениях: «Мне нравятся места, где можно развлекаться. Люблю аттракционы.” Ответ пользователя на вопрос об антипатиях: «Не люблю закрытые пространства.” В соответствии с этими ответами пользователя разработанная система выдала рекомендацию, проиллюстрированную на рисунке 2.

Пример рекомендации системы
Рисунок 2 - Пример рекомендации системы

Результаты апробации: количество запросов – 20; количество ответов, соответствующих запросам – 17 (85%); количество ответов, не соответствующих запросам – 3 (15%).

Разработанная туристическая система продемонстрировала эффективность использования модели семейства BERT для анализа текстовых запросов туристов и выдачи соответствующих рекомендаций. В будущем планируется пополнение базы данных информацией туристических объектов. Данный подход может быть интегрирован в туристические сервисы и платформы, повышая соответствие рекомендаций запросам туристов.

Литература

  1. Ashish Vaswani, Noam Shazeer, Niki Parmar, Jakob Uszkoreit, Llion Jones, Aidan N. Gomez, Lukasz Kaiser, Illia Polosukhin. Attention Is All You Need [Электронный ресурс]. – Режим доступа: https://arxiv.org/abs/1706.03762, свободный. – (дата обращения: 18.04.2025).
  2. Jacob Devlin, Ming-Wei Chang, Kenton Lee, Kristina Toutanova. BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding [Электронный ресурс]. – Режим доступа: https://arxiv.org/abs/1810.04805, свободный. – (дата обращения: 18.04.2025).
  3. Tomas Mikolov, Kai Chen, Greg Corrado, Jeffrey Dean. Efficient Estimation of Word Representations in Vector Space [Электронный ресурс]. – Режим доступа: https://arxiv.org/abs/1301.3781, свободный. – (дата обращения: 18.04.2025).