УДК: 004.8 EDN: HLJTIH
От двунаправленных кодировщиков до новейших достижений: обзор BERT и его преобразующего влияния на обработку естественного языка
Раджеш Гупта*1
*1 Хайдарабадский университет, Хайдарабад, Индия
Аннотация: Технология двунаправленного кодирования от трансформеров (BERT), впервые разработанная исследователями Google в 2018 году, представляет собой прорыв в области обработки естественного языка (НЛП). BERT достиг самых современных результатов в ряде задач НЛП, используя архитектуру нейронной сети на основе одного трансформера. В этой работе рассматривается технический подход BERT, производительность на момент публикации и значительное влияние на исследования с момента выпуска. Мы предоставляем информацию об основах BERT, таких как преобразовательные кодеры и перенос обучения на основе универсальных языковых моделей. Основные технические инновации включают в себя глубокую двунаправленную обработку с целью моделирования языка в масках на этапе предварительной подготовки без использования BERT. Для оценки BERT был доработан и протестирован на одиннадцати задачах НЛП, начиная от ответов на вопросы и заканчивая анализом настроений с помощью теста GLUE, что позволило добиться новых самых современных результатов. Кроме того, в работе анализируется огромное исследовательское влияние BERT как доступного метода, превосходящего специализированные модели. BERT стал катализатором внедрения предварительного обучения и нейросетевой архитектуры трансформеров обучения для НЛП. В количественном отношении более 10 000 статей расширили BERT, и он широко интегрирован в отраслевые приложения. Будущие направления на основе шкалы BERT ориентированы в сторону миллиардов параметров и многоязычных представлений. Таким образом, в этой работе рассматриваются: метод, производительность, влияние и перспективы BERT как основополагающего метода НЛП.
Ключевые слова: BERT, машинное обучение, обработка естественного языка, трансформеры, нейронная сеть.
Введение
Двунаправленные представления кодеров из трансформаторов (BERT) впервые были представлены в статье 2018 года исследователей из Google. BERT представляет собой важную технику в обработке естественного языка (NLP), достигая передовых результатов по различным задачам NLP при использовании единой базовой архитектуры модели. Эта вводная глава предоставляет предысторию и обзор BERT [1-5].
Сначала мы представляем краткую историю обработки естественного языка для контекста, обсуждая ключевые техники, предшествовавшие BERT, такие как рекуррентные нейронные сети, такие как LSTM, механизмы внимания, используемые в трансформаторах, и ограничения направленных, а не двунаправленных моделей. Мы вводим распространённые задачи по НЛП, такие как ответы на вопросы, анализ настроений и текстовое последствие, которые BERT нацеливается [6-10].
Далее мы мотивируем необходимость в предварительно обученных языковых представлениях, которые можно доработать под конкретные задачи, вместо разработки специализированных моделей, что снижает дублирование усилие. Мы обсуждаем ключевые технические инновации BERT на высоком уровне, включая использование трансформерных энкодеров, двунаправленное обучение и цели моделирования маскированных языков во время предварительного обучения. Кроме того, мы подводим итоги впечатляющих улучшений производительности BERT по сравнению с предыдущими подходами NLP, достигая новых передовых результатов по одиннадцати задачам NLP с одной архитектурой модели [11-20].
В последнем разделе первой главы мы предлагаем план остальной части этой статьи. Глава 2 предоставит всестороннюю техническую информацию. Глава 3 подробно расскажет методологию развития и предварительного обучения BERT. Главы 4 и 5 будут обсуждать значительное влияние BERT на исследования и ключевые области, на которые он повлиял.
Технический фон
В качестве предыстории перед обсуждением методологии и исследовательского влияния BERT, эта глава предоставляет всесторонний обзор фундаментальных архитектур нейронных сетей, которые позволили разработать методы представления языка, такие как BERT [1, 21-24].
Мы начинаем с подробной истории рекуррентных нейронных сетей (RNN), предшественников BERT. Десятилетиями RNN были передовыми для последовательного моделирования данных. Мы предоставляем техническую информацию о RNN, начиная с простых сетей Элмана и ведя к более сложным закрытым сетях, таким как LSTM и GRU. Уравнения и диаграммы объясняют, как они обрабатывают входные последовательности, поддерживая внутренние состояния памяти. Мы обсуждаем фундаментальные статьи, использующие эти архитектуры для языковых задач, включая машинный перевод, распознавание речи и генерацию текста.
Однако RNN испытывали трудности с захватом долгосрочных зависимостей из-за зависимости от скрытых состояний одного вектора. Были введены механизмы внимания для дополнения RNN, позволяя последующим этапам обработки возвращаться к предыдущим скрытым состояниям. Структура декодер-энкодер, используемая в нейронном машинном переводе, установила методологию однонаправленного условного предсказания, повлиявшую на BERT.
В последнее время трансформаторы заменили RNN, получив преимущества в параллелизируемости и доступе к памяти. Мы уделяем несколько разделов детальному объяснению трансформаторов как основу для BERT. Опираясь на достижения распознавания изображений CNN, трансформаторы используют многоголовое самовнимание и подают прямые слои для отображения входных вложений в закодированное латентное пространство. С помощью матричных точечных произведений, сравнивающих каждый токен с любым другим токеном в последовательности, трансформаторы определяют релевантный контекст с меньшей зависимостью от близости, чем RNN. Мы предоставляем полную спецификацию тензорных операций, лежащих в основе многоголовых расчётов внимания, отображения входных и выходных размерностей [25].
Кроме того, мы обсуждаем дизайнерские решения, сделанные в оригинальной архитектуре трансформаторов из статьи «Attention is All You Need» от исследователей Google. К ним относятся использование позиционных кодировок в входные вложения, остаточные связи между слоями и методы регуляризации, такие как dropout. Мы сравниваем сильные и слабые стороны трансформаторов с предыдущими повторяющимися сетями на основе экспериментальных результатов задач машинного перевода, которые показали значительное повышение производительности и эффективности.
К концу этого обширного технического опыта читатели должны были сформировать интуицию относительно траектории развития от RNN до трансформаторов, что позволило бы добиться прорывов, таких как BERT, преодолевая ограничения в эффективном моделировании лингвистического контекста и зависимостей. В следующей главе мы используем эту основу, чтобы погрузиться в конкретные решения, принятые при адаптации трансформаторов в BERT.
Развитие BERT
В этой главе описывается разработка метода BERT исследователями Google, начавшаяся в конце 2017 года, мотивированная желанием улучшить общее понимание языка за пределами конкретных моделей. Сначала мы обсуждаем архитектурные улучшения BERT по сравнению с прежними методами трансферного обучения для поддержки действительно двунаправленного обучение. Далее мы подробно описываем данные и процедуры предварительного обучения. Наконец, мы подводим итоги 11 задач по NLP, включённых в первоначальную статью BERT за ноябрь 2018 года для оценки эффективности [13-15].
С архитектурной точки зрения BERT адаптировал стек трансформаторных энкодеров, впервые разработанный в 2017 году бумага «Внимание — всё, что нужно», которая ввела трансформеры. В базовой конфигурации, используемой для предварительного обучения, BERT использует энкодер с 12 слоями, 12 головками самовнимания и 768-мерными скрытыми состояниями. Мы предоставляем схемы потока информации через блоки трансформаторов BERT. Эмпирически это обеспечивало оптимальные результаты с разумными вычислительными требованиями для предварительного обучения.
Важно, что BERT обучает представления в двунаправленном направлении, позволяя каждому слову включать контекст из всех токенов предложения, а не только из предыдущих токенов. Это лучше соответствует человеческому пониманию. Двунаправленное обусловливание обеспечивалось заменой выходного слоя трансформатора на тот, который подходит для задач предварительного обучения, например, заполнения маскированных токенов. Мы представляем специфику процедуры маскировки токенов BERT и оптимизации функции потерь целей Cloze.
Для данных предварительного обучения BERT использовал BookCorpus — коллекцию из 11 000 неопубликованных книг и полный текст английской Википедии. Это сочетание предоставило широкий спектр доменов общей сложностью более 3 миллиардов слов. Мы объясняем токенизацию подслов WordPiece и предварительную обработку, используемые для обработки этого большого корпуса. BERT был предварительно обучен более 1 миллиона шагов обновления с размером пакета 256 последовательностей в течение часа, выполняя маскированное предсказание LM и следующее предложение для каждой пары последовательностей.
Наконец, в этой главе рассматривается, как предварительно обученная модель BERT была доработана и оценена на GLUE — бенчмарке, включающем 11 задач по NLP, от ответов на вопросы до анализа настроений и текстового последовательности. С минимальными адаптациями BERT достиг передового уровня во всех задачах, используя единую архитектуру модели, просто регулируя выходной слой softMAX, используемый для классификации. Мы приводим таблицы точности из статьи для каждой подзадачи [26-27].
Подробно описывая инновации в архитектуре, процедуре предварительного обучения и тестировании на различных задачах, эта глава предоставляет читателям сведения о внедрении, чтобы воссоздать BERT и показать, что позволило ему превзойти предыдущие передовые результаты.
Влияние на исследования
В этой главе рассматривается значительное влияние BERT на исследования с момента открытия исходного кода Google в ноябре 2018 года. Сначала мы анализируем, как BERT стал катализатором в сообществе NLP, продвигая трансферное обучение как альтернативу специализированным моделям. Далее мы представляем репрезентативную выборку исследований, расширяющих или модифицирующих BERT для новых методов и применений. Наконец, мы рассматриваем широкое внедрение BERT в отрасли, который служит стандартной моделлю языка производства.
Публикация, подробно описывающая BERT, способствовала фундаментальному философскому сдвигу в области в сторону универсального предварительного обучения языковых моделей, а не сложной инженерии моделей для конкретных задач, что привело к взрывному росту последующих статей. Теперь исследователи регулярно предварительно обучают модели, похожие на BERT, на своих немаркированных наборах данных, прежде чем специализировать выходные слои для заданных приложений [28-29].
В качестве доказательства процветающей исследовательской экосистемы более 10 000 статей в той или иной форме расширили BERT, отслеживаемые ссылками на Google Scholar. Примеры включают BioBERT и SciBERT, которые предварительно обучаются на научных текстах для лучшего понимания технического языка, ERNIE, добавляющий непрерывные механизмы предобучения на китайском, и видеоBERT с поддержкой мультимодального языка понимание. Аналогично, Роберта показала, что производительность можно улучшить просто за счёт более длительных тренировок с увеличенными мини-партиями и размером наборов данных.
При сжатии модели DistilBERT сократил размер BERT на 40%, сохранив при этом более 97% возможностей понимания языка, улучшив развертывание за счёт снижения затрат на память и задержку. В целом, BERT зарекомендовал себя как фундаментальная техника для развития, а не необходимость проектировать архитектуры с нуля.
В промышленности BERT интегрирован в основные производственные системы ИИ, такие как поисковые системы, сервисы ответов на вопросы и конвейеры генерации текста, что значительно улучшило возможности работы на естественном языке. Почти все современные стартапы, работающие над языкоориентированными продуктами, используют BERT для достижения передовых результатов производительности. Благодаря доступности вычислительной сети через облачные платформы как крупные, так и малые организации могут использовать возможности BERT.
В заключение, как академические исследовательские группы, так и технологические компании активно используют BERT как поддерживающий слой для последующих приложений, демонстрируя статус BERT как основополагающего метода NLP спустя пять лет после первоначальной публикации.
Заключение и перспективы на будущее
В этой заключительной главе мы обобщаем ключевые направления, которые пошла область с момента введения BERT, чтобы дать представление о будущих направлениях инноваций в обучении языкового представления. Хотя сама BERT стала важной вехой в имитации человеческого понимания языка, для прогресса ещё достаточно простора.
Одно из активных исследовательских направлений было сосредоточено на дальнейшем увеличении масштаба модели, превышающего 110 миллионов параметров BERT. Поздние GPT-модели, созданные OpenAI, такие как GPT-3, продемонстрировали возможности генерации языков, отсутствующих в BERT, масштабировавшись до миллиардов параметров. Аналогично, архитектура Switch Transformer от Google снизила учебные вычислительные нагрузки для создания ещё более крупных моделей. Однако это остаётся предметом споров относительно того, насколько знания по сравнению с исходным размером модели повышают производительность.
Кроме того, многоязычные и межязычные расширения BERT, такие как mBERT, InfoXLM и XLM-R, показали способность передавать представления между сотнями языков. По мере того как цифровой контент становится всё более глобализированным, разработка моделей, работающих на разных языках без необходимости переобучения. Методы репрезентации, преодолевающие лингвистические барьеры, приносят коммерческие и социальные выгоды [30-31].
Наконец, исследователи только начали изучать дальнейший перенос — возможность применять языковые представления, такие как BERT, к совершенно новым задачам, помимо области NLP, Развился в. Недавние исследования, предлагающие использовать BERT для задач математического рассуждения и понимания программного обеспечения, демонстрируют интригующий потенциал. В конечном итоге разблокированная передача знаний может стать самым долговременным вкладом BERT.
В заключение, в этой статье изложены технические инновации BERT, которые стали катализатором новой парадигмы трансферного обучения в NLP, эмпирических демонастраций эффективности по 11 задачам по пониманию языка и значительному научному влиянию. По мере развития базовых методов, таких как BERT, машины приближаются к овладению тонкими коммуникативными способностями, которые раньше считались однозначно человеческими. Однако сложные открытые задачи, связанные с интерпретируемостью моделей, теоретическим анализом для развития и потенциальными негативными общественными последствиями остаются активными областями исследований наряду с постоянным прогрессом в современных технологиях.
Литература
- Вапник В. Природа статистической теории обучения. Springer Science & Business Media, 2013.
- Фаркуад М.А.Х., Рави В. и Бозе И. Прогнозирование оттока с использованием понятной опорной векторной машины: аналитическое CRM-приложение. Прикладные мягкие вычисления. 2014; 19: 31-40. https://doi.org/10.1016/j.asoc.2014.01.031
- Лю Й., Отт М., Гоял Н., Ду Дж., Джоши М., Чен Д., Леви О., Льюис М., Зеттлмойер Л. и Стоянов В. Роберта: Надёжно оптимизированный подход к предварительному обучению BERT. 2019; arXiv препринт arXiv:1907.11692.
- Ван С., Чен Б. Уток кредитных карт: обзор методов машинного обучения и глубокого обучения. Информатика. Экономика. Управление. 2023; 2(4): 0134–0144. https://doi.org/10.47813/2782-5280-2023-2-4-0134-0144
- Мехротра А. и Шарма Р. Многослойный подход на основе перцептрона для прогнозирования оттока клиентов. Procedia Computer Science. 2020; 167: 599-606. https://doi.org/10.1016/j.procs.2020.03.326
- Александру А.А., Раду Л.Е., Бекси В., Фабиан С., Чиока Д. и Ратиу Л. Роль предиктивной аналитики в профилактической медицине. Сельское и удалёное здравоохранение, 2021; 21: 6618.
- Анте Л. Прогнозирование текучести клиентов в портфелях кредитных карт. IEEE Transactions on Engineering Management. 2021; 68(4): 1039-1048.
- Чен Б. Динамический анализ поведения и ансамблевое обучение для прогнозирования утраты кредитных карт. Современные инновации, системы и технологии. 2023; 3(4): 0109–0118. https://doi.org/10.47813/2782-2818-2023-3-4-0109-0118
- Кэрролл Дж. и Мэйн, К.К. Прогнозирование оттока на основе машинного обучения с несбалансированными распределениями классов. Open Journal of Business and Management. 2020; 8(3): 1323-1337.
- С. Ван. Аналитика временных рядов для предиктивного мониторинга рисков в уходе за диабетом. Международный журнал расширенных исследований в области науки, технологий и инженерии. 2024; 13(2): 39-43.
- Qiu X., Sun T., Xu Y., Shao Y., Dai N. и Huang X. Предварительно обученные модели для обработки естественного языка: обзор. Наука: Китай: Технологические науки. 2020; 63(10): 1872- 1897. https://doi.org/10.1007/s11431-020-1647-3
- Ван С. и Чэнь Б. TopoDimRed: новый метод уменьшения размерности для топологического анализа данных. Информатика, экономика, менеджмент. 2023; 2(2): 201-213. https://doi.org/10.47813/2782-5280-2023-2-2-0201-0213
- Амор Н. Б., Бенферхат С. и Элуэди З. Качественная классификация с возможностями деревьев решений. Современная обработка информации. 2006: 159–169. https://doi.org/10.1016/B978-044452075-3/50014-5
- Вонг А., Янг А.Т., Лян А.С., Гонсалес Р., Дуглас В.С., Хэдли Д. Введение в машинное обучение в клинической поддержке принятия решений для радиологических отчетов. Акад Радиол. 2018; 25(8): 1097-1107.
- Ванг А., Сингх А., Майкл Дж., Хилл Ф., Леви О. и Боуман С. Эйприл. Glue: многозадачная платформа для анализа и анализа для понимания естественного языка. Материалы семинара EMNLP 2018 BlackboxNLP: анализ и интерпретация нейронных сетей для NLP 2018; 353-355. https://doi.org/10.18653/v1/W18-5446
- Вапник В. Н. Обзор статистической теории обучения. IEEE Transactions on Neural Networks. 1999; 10(5): 988–999. https://doi.org/10.1109/72.788640
- Бастос И. и Прегейро Т. Метод глубокого обучения для прогнозирования оттока кредитных карт в условиях сильно дисбалансированной ситуации. Иберийская конференция по распознаванию образов и анализу изображений. 2019; стр. 346-354.
- Амин А., Аль-Обейдат Ф., Шах Б., Аднан А., Лу Дж. и Анвар С. Прогнозирование оттока клиентов в телекоммуникационной отрасли с использованием достоверности данных. Journal of Business Research, 2019; 94: 290-301. https://doi.org/10.1016/j.jbusres.2018.03.003
- Роджерс А., Ковалева О. и Румшиски А. Введение в BERTology: что мы знаем о том, как работает BERT. Транзакции Ассоциации вычислительной лингвистики. 2020; 8: 842-866. https://doi.org/10.1162/tacl_a_00349
- Wu Y., Gao T., Wang S. и Xiong Z. TADO: Временное внимание с использованием модели двойного оптимизатора. Международная конференция IEEE по анализу данных 2020 года (ICDM 2020). IEEE, 2020, Сорренто, Италия. 2020; 1340-1345. https://doi.org/10.1109/ICDM50108.2020.00174
- Свамидасон И. Т. ДЖ. Обзор алгоритмов анализа данных для интеллектуальных вычислительных систем. Журнал тенденций в информатике и умных технологиях. 2019; 01: 14–23. https://doi.org/10.36548/jtcsst.2019.1.002
- Ван С., Чэнь Б. Глубокий подход к классификации диабета с использованием нейронной сети, основанной на внимании, и генеративной состязательной сети. Современные исследования: актуальные вопросы теории и практики. 2023; 5: 37-41.
- Радж Дж., Ананти В. Рекуррентные нейронные сети и нелинейное предсказание в опорных векторных машинах. Журнал парадигмы мягких вычислений. 2019; 2019: 33–40. https://doi.org/10.36548/jscp.2019.1.004
- Девлин Дж., Чанг М.В., Ли К. и Тутанова К. БЕРТ: Предварительное обучение глубоких двунаправленных трансформаторов для понимания языка. 2018; arXiv препринт arXiv:1810.04805.
- Song H., Rajan D., Thiagarajan J.J. и Spanias A. Тенденции и прогнозирование медицинских данных временных рядов с использованием глубокого обучения. Smart Health. 2018; 9: 192-211.
- О'Ханлон Т.., Райдер Л.Г., Ган Л., Фаннин Р., Поп Р.М., Берлингейм Р.В. и др. Классификация васкулитических периферических невропатий. Arthritis Care Res. 2011; 63(10):1508- 1519.
- Говард Дж. и Рудер С. Универсальная языковая настройка для классификации текста. Материалы 56-го ежегодного собрания Ассоциации вычислительной лингвистики. 2018; 1: 328-339. https://doi.org/10.18653/v1/P18-1031
- Васвани А., Шазир Н., Пармар Н., Ушкорайт Дж., Джонс Л., Гомес А.Н., Кайзер Л. и Полосухин И. Внимание — это всё, что нужно. Достижения в системах обработки нейронной информации. 2017; 30.
- Циглер Р., Хайдтманн Б., Хилгард Д., Хофер С., Розенбауэр Дж., Холл Р. DPV-Wiss-Инициатива. Частота SMBG коррелирует с HbA1c и острыми осложнениями у детей и подростков с диабетом 1 типа. Детский диабет. 2011; 12(1): 11-7. https://doi.org/10.1111/j.1399-5448.2010.00650.x
- Тан И. Глубокое обучение с использованием линейных опорных векторных машин. 2013; arXiv препринт arXiv:1306.0239.
- Ван С., Чен Б. Анализ эмоций клиента с использованием глубокого обучения: достижения, вызовы и будущие направления. 3-я Международная конференция по современным научным исследованиям, 2023: 21-24.
Гупта Р. От двунаправленных кодировщиков до новейших достижений: обзор BERT и его преобразующего влияния на обработку естественного языка. Технология двунаправленного кодирования от трансформеров (BERT), впервые разработанная исследователями Google в 2018 году, представляет собой прорыв в области обработки естественного языка (НЛП). BERT достиг самых современных результатов в ряде задач НЛП, используя архитектуру нейронной сети на основе одного трансформера. В этой работе рассматривается технический подход BERT, производительность на момент публикации и значительное влияние на исследования с момента выпуска.
Ключевые слова: BERT, машинное обучение, обработка естественного языка, трансформеры, нейронная сеть.
Gupta R. From Bidirectional Encoders to Latest Breakthroughs: A Review of BERT and Its Transformative Impact on Natural Language Processing. Bidirectional Encoder Representations from Transformers (BERT), first developed by Google researchers in 2018, represents a breakthrough in the field of Natural Language Processing (NLP). BERT has achieved state-of-the-art results in a number of NLP tasks using a single transformer-based neural network architecture. This paper examines BERT's technical approach, performance at the time of publication, and significant impact on research since its release.
Keywords: BERT, machine learning, natural language processing, transformers, neural network.