Ключевые слова: LLM, оценка регионов, цифровая экономика, NLP, миграционные тренды, инвестиционная привлекательность.
Введение
В настоящее время человечество создало 149 зеттабайт данных [1]. Чем больше объём данных, тем сложнее становится человеку обрабатывать такой объём. Сейчас информационный поток проходит через все сферы человеческой жизни, начиная от научной деятельности и заканчивая финансовой диагностикой и пользовательской активностью в социальных сетях. Становится очевидным, что такой объём данных становится самым ценным ресурсом. Для людей, которые занимаются аналитикой этих данных, становится очевидным, что выполнять их работу традиционными методами вручную становится практически невозможным. В настоящее время проблема анализа данных особенно обострилась из-за резкого увеличения формата самих данных. Данные теперь различаются на три глобальные группы — структурированные (csv, Excel-таблицы, полноценные базы данных), полуструктурированные (JSON, XML) и полностью неструктурированные (видео и аудио форматы). И, как не трудно догадаться, для каждого типа данных нужно использовать отдельный подход при их анализе. В этих условиях особенно актуальной становится задача по автоматизации аналитики данных. На данный момент наиболее перспективным решением этой задачи стали нейросети. Особое место среди них заслужили большие языковые модели (Large Language Models), которые способны принимать и анализировать огромные объёмы текстов, составленных на естественном языке. Помимо естественного языка, современные модели способны обрабатывать изображения, видео и аудио форматы, что выводит их на новый уровень универсальности как инструмента анализа данных. На глобальном рынке, на данный момент, лучшими решениями в сфере больших языковых моделей являются OpenAI (ChatGPT), Google (Gemini), DeepSeek. Но отечественный рынок не отстаёт и в последние годы также активно продвигает собственные модели. Наиболее известные и широко используемые среди них — GigaChat (разработан Сбером), ЯндексGPT (разработка компании Яндекс) и RuGPT (проект компании SberDevices и других участников экосистемы Сбера) [2]. Данное исследование направлено на демонстрацию эффективности использования такого мощного инструмента анализа данных, как большие языковые модели. Кроме того, будут оценены потенциальные ограничения и риски, связанные с использованием таких технологий. Современные тенденции развития всей цифровой отрасли усиливают необходимость применения автоматизированных систем обработки и анализа информации. При современных условиях использование больших языковых моделей выглядит не как дополнительное преимущество перед конкурентами, но становится производственной необходимостью. Их применение позволяет в короткие сроки анализировать пользовательскую активность, создавать объёмные аналитические отчёты и проводить более развёрнутый и глубокий анализ рынка, что является ключевым аспектом как для бизнеса, так и для государства.
Основная часть
Оценка социально-экономических показателей регионов России основывается на экспертной оценке, которая заключается в анализе статистических показателей, предоставленных открытыми источниками (РАЭКС, Росстат). Чтобы выявить, что регион является привлекательным, необходимо анализировать огромные объёмы данных, которые, как правило, разнятся в зависимости от источника. Когда речь заходит о таком субъективном показателе, как привлекательность, нужно учитывать множество параметров. В случае, если за основу взяты данные из открытых источников, таких как социальные сети, потенциальный аналитик/эксперт должен учитывать множество факторов, которые могут повлиять на итоговую статистику. Если речь заходит о привлекательности регионов, то имеют место не только цифры (уровень ВРП и другие показатели), но и тональность обсуждения в социальных сетях, упоминания в региональных СМИ, миграционные настроения и так далее. Такой комплексный анализ должен быть сделан точно, быстро и эффективно. Традиционно подобная оценка проводится аналитиком/экспертом, который должен учитывать все вышеперечисленные факты. Такой подход к оценке имеет несколько недостатков. Первый — скорость. Ручной сбор и анализ данных, в зависимости от поставленной задачи, может занимать от нескольких недель до нескольких месяцев. Фактор скорости обработки данных имеет ключевое значение, так как анализ должен быть актуальным. Второй недостаток — стоимость экспертного анализа. Привлечение квалифицированных кадров всегда требует значительных затрат. Использование LLM позволит оптимизировать эти расходы. Третий недостаток — субъективность оценки. Разные аналитики могут по-разному интерпретировать одни и те же данные, что порождает дивергенцию оценок. Это может повлечь за собой каскад негативных последствий. Субъективность оценки может создать искажение инвестиционных потоков внутри страны. Также возможно полное игнорирование «мягких» факторов, подразумевающих оценку неформальных бизнес-связей между территориями. Четвёртый недостаток — разрозненность данных. Для составления подробной и корректной оценки данные собираются из разных источников, и крайне маловероятно, что все они будут непротиворечивыми. Пятый недостаток — проблема масштабируемости. Модель, в отличие от человека, в кризисной ситуации, требующей моментальной оценки, мгновенно предоставит всю необходимую аналитику. Как было заявлено ранее, сейчас подобным анализом может заниматься как эксперт/аналитик, но в последнее время в данном направлении набирает популярность оценка при помощи больших языковых моделей [5]. Как следует из статьи [3], LLM обрабатывают большие объёмы данных в разы быстрее человека, но помимо скорости должна быть и точность результатов. Стоит также отметить, что корректность результатов модели будет напрямую зависеть от данных, на которых она была обучена. Очевидно, что для достижения наилучшего результата по оценке регионов России лучше выбирать отечественные модели. Однако даже при таком варианте всё не так очевидно. Несмотря на тот факт, что в LLM загружаются все необходимые данные, крайне важен формат поставляемых данных. Как оказалось, для эффективного использования языковых моделей необходимо передавать им не только «сырые» данные [4], но и релевантные фрагменты информации на основе пользовательского запроса. То есть нужно дать модели некоторое обобщённое представление о том, какую информацию надо извлекать. Кроме того, важным аспектом является структурированность и аннотация данных. В качестве преимуществ в анализе данных языковые модели могут похвастаться более глубоким пониманием анализируемого текста, что позволяет выявлять скрытые связи и паттерны. Кроме того, анализ на основе LLM будет обладать большей объективностью, чем анализ эксперта.
Вывод
На данный момент большие языковые модели можно назвать мощным инструментом для анализа данных практически любого объёма. LLM способны находить и выявлять скрытые закономерности, создавать отчёты и даже предлагать конкретные шаги по решению проблемы, беря за основу входные данные. В перспективе взаимодействие языковых моделей с другими достижениями человечества в области искусственного интеллекта, например, обработкой естественного языка или компьютерным зрением, сделает этот инструмент ещё более гибким в области аналитики данных. При таком исходе событий LLM смогут не только описывать текущее состояние экономики конкретного региона, но и делать прогнозы различных вариантов развития событий. Однако, как было отмечено ранее, важно учитывать, что для получения корректного ответа от модели необходимо убедиться в качестве поставляемых для неё данных, корректности постановки задачи и контекста. Без соблюдения всех этих условий даже самые продвинутые модели могут давать искажённые или вовсе некорректные выводы. Также стоит учитывать и этическую сторону вопроса. В частности, необходимо однозначно регламентировать, кто будет нести ответственность за решения, принятые на основе анализа, выполненного LLM. В связи с этим возникает необходимость постоянного контроля за качеством алгоритмов. Кроме того, модель может воспроизвести и предвзятость, которую обнаружит в данных, что также может исказить итоговый результат. Но, учитывая всё вышеперечисленное, при правильной настройке, чётком отборе данных и понимании ограничений, большие языковые модели станут незаменимым инструментом для аналитики. Их дальнейшая интеграция, особенно в контексте отечественного рынка, может поспособствовать повышению эффективности аналитического процесса и, в перспективе, открыть новые области для использования искусственного интеллекта.
Список литературы
- Statista. (2024). Volume of data/information created, captured, copied, and consumed worldwide from 2010 to 2024. URL: https://www.statista.com/statistics/871513/worldwide-data-created.
- Korus Consulting на Хабр. (2024). Обзор отечественных LLM: GigaChat, ЯндексGPT, RuGPT и другие. URL: https://habr.com/ru/companies/korus_consulting/articles/888568.
- Lean Center. (2023). ChatGPT против человеческого интеллекта: кто лучше анализирует данные? URL: https://lean-center.ru/chatgpt-protiv-chelovecheskogo-intellekta-kto-luchshe-analiziruet-dannye.
- Aiall.ru. (2023). Исследование Стэнфордского университета: большой контекст не означает лучшего понимания. URL: https://aiall.ru/2023/07/22/issledovanie-stenfordskogo-universiteta-vyzyvaet-somneniya-v-predpolozheniyah-o-yazykovyh-modelyah-bolshij-kontekst-ne-oznachaet-luchshego-ponimaniya.
- Dataversity. (2023). 3 Examples of LLM Use in Business Intelligence. URL: https://www.dataversity.net/3-examples-of-llm-use-in-business-intelligence.