УДК 004.032.26
РАЗРАБОТКА ТУРИСТИЧЕСКОЙ РЕКОМЕНДАТЕЛЬНОЙ СИСТЕМЫ НА ОСНОВЕ НЕЙРОСЕТЕВОГО МОДЕЛИРОВАНИЯ
Аннотация
В данной статье представлено описание туристической рекомендательной системы на основе нейросетевого моделирования, способной выдавать персонализированные рекомендации. Ключевые слова: нейросетевое моделирование, искусственный интеллект в сфере туризма, большие языковые модели.
Введение
Современные технологии находят применение в самых разных сферах, в том числе и в области туризма. С развитием цифровых сервисов туристы получают доступ к интеллектуальным системам, способным подбирать персонализированные рекомендации с учетом их индивидуальных предпочтений. Такие системы способны предложить маршруты, порекомендовать к посещению интересные достопримечательности и заведения или предложить разнообразные и увлекательные активности в соответствии с предпочтениями туриста.
Одной из ключевых задач разработки рекомендательных туристических систем является задача обработки запросов пользователей о предпочтениях в текстовой форме, сопоставления их с имеющимися текстовыми данными о туристических объектах, хранящихся в базе данных и вывод наиболее подходящих объектов. Решение данной задачи требует использования методов обработки естественного языка (NLP), позволяющих эффективно работать с текстовыми данными. Одним из наиболее перспективных подходов к построению таких систем является использование больших языковых моделей (Large Language Models, LLM).
В современных рекомендательных системах, работающих с текстовыми данными, ключевой задачей является понимание семантики запросов пользователей для дальнейшего выявления туристических объектов, соответствующих им. Наиболее часто используемые традиционные методы, такие как TF-IDF и Word2Vec, обладают рядом ограничений [3]:
- TF-IDF учитывает частоту терминов, но игнорирует контекст и семантические связи между словами.
- Word2Vec создаёт статические векторные представления слов, не учитывая многозначность и зависимость от контекста.
Языковая модель BERT и его модификации лишены этих недостатков и обладают следующими особенностями [2]:
- Контекстное понимание текста. Модели семейства BERT используют механизм внимания, который анализирует слова в двустороннем контексте [1]. Это позволяет модели корректно интерпретировать многозначные слова.
- Генерация семантических векторных представлений. Модель преобразует текстовые описания (как запросы пользователей, так и описания туристических объектов) в векторные представления, где близкие по смыслу тексты имеют схожие координаты в векторном пространстве. Это позволяет эффективно сравнивать запросы с объектами через косинусное сходство.
- Предварительное обучение. Модели семейства BERT предварительно обучены на больших объемах текстов, что позволяет применять их для разнообразных текстовых задач.
- Обработка длинных текстов. Для задач выработки системой туристических рекомендаций важно уметь анализировать развернутые описания объектов и запросы пользователей. Модели семейства BERT способны учитывать зависимости между всеми словами в таких описаниях и запросах.
- Поддержка многоязычности. Многие BERT-модели поддерживают несколько языков, что актуально для запросов иностранных туристов и описаний туристических объектов на языках, соответствующих запросам.
В данной работе предлагается подход к разработке рекомендательной системы на основе модели из семейства BERT (Bidirectional Encoder Representations from Transformers), которая состоит из следующих этапов:
- Формирование набора описаний туристических объектов из открытых источников данных: туристические порталы, социальные сети и онлайн-карты.
- Создание базы данных, включающей две таблицы: таблица с информацией о пользователях и таблица с информацией о туристических объектах. Атрибуты первой таблицы содержат: идентификатор пользователя, идентификатор действия пользователя, предпочтения пользователя. Атрибуты второй таблицы содержат: идентификатор туристического объекта, название туристического объекта, адрес туристического объекта, оценку туристического объекта, описание туристического объекта, векторное представление описания туристического объекта.
- Выбор и применение модели BERT для генерации и сохранения векторных представлений описаний туристических объектов в базе данных.
- Разработка чат-бота, предоставляющего удобный интерфейс для пользователей.
- Разработка логики обработки запросов от пользователей, которая реализует генерацию векторных представлений самих запросов с помощью выбранной модели BERT, их сравнение с векторными представлениями описаний туристических объектов, хранящимися в базе данных и выдачу релевантных рекомендаций.
На рисунке 1 представлена структура разработанной системы, реализованной в Telegram-боте с использованием языка программирования Python и базы данных PostgreSQL.
Для апробации разработанной системы была сформирована база данных, содержащая 10 различных туристических объектов города Казани. Например, текстовое описание одного из объектов имеет следующий вид: «Главная мечеть Казани и всего Татарстана – Кул-Шариф, расположенная на территории Казанского Кремля. Она построена в 2005 году на месте разрушенной в XVI веке исторической мечети Казанского ханства. Кул-Шариф названа в честь имама, погибшего при осаде Кремля. Внешние стены Кул-Шариф облицованы белым мрамором, эффектно сочетающимся с бирюзовыми куполами шести минаретов – 4 больших и 2 малых. Отделка интерьеров поражает роскошью – потолочной лепниной, калейдоскопом цветных оконных витражей, изяществом ажурных деревянных деталей. Внутри здания есть балконы для размещения экскурсионных групп.
Для оценки работоспособности системы были имитированы разнообразные ответы пользователя на запросы системы о предпочтениях и антипатиях. Рассмотрим пример. Ответ пользователя на вопрос системы о его предпочтениях: «Мне нравятся места, где можно развлекаться. Люблю аттракционы.” Ответ пользователя на вопрос об антипатиях: «Не люблю закрытые пространства.” В соответствии с этими ответами пользователя разработанная система выдала рекомендацию, проиллюстрированную на рисунке 2.
Результаты апробации: количество запросов – 20; количество ответов, соответствующих запросам – 17 (85%); количество ответов, не соответствующих запросам – 3 (15%).
Разработанная туристическая система продемонстрировала эффективность использования модели семейства BERT для анализа текстовых запросов туристов и выдачи соответствующих рекомендаций. В будущем планируется пополнение базы данных информацией туристических объектов. Данный подход может быть интегрирован в туристические сервисы и платформы, повышая соответствие рекомендаций запросам туристов.
Литература
- Ashish Vaswani, Noam Shazeer, Niki Parmar, Jakob Uszkoreit, Llion Jones, Aidan N. Gomez, Lukasz Kaiser, Illia Polosukhin. Attention Is All You Need [Электронный ресурс]. – Режим доступа: https://arxiv.org/abs/1706.03762, свободный. – (дата обращения: 18.04.2025).
- Jacob Devlin, Ming-Wei Chang, Kenton Lee, Kristina Toutanova. BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding [Электронный ресурс]. – Режим доступа: https://arxiv.org/abs/1810.04805, свободный. – (дата обращения: 18.04.2025).
- Tomas Mikolov, Kai Chen, Greg Corrado, Jeffrey Dean. Efficient Estimation of Word Representations in Vector Space [Электронный ресурс]. – Режим доступа: https://arxiv.org/abs/1301.3781, свободный. – (дата обращения: 18.04.2025).