Назад в библиотеку

Разделение знаний и рассуждений в трансформерах: модульная архитектура с обобщённым кросс-вниманием

Авторы: Го Чжэньюй, Чэнь Вэньгуан

Источник: Zhenyu Guo, Wenguang Chen. Decoupling Knowledge and Reasoning in Transformers: A Modular Architecture with Generalized Cross-Attention [Электронный ресурс] – Режим доступа: https://arxiv.org/abs/2501.00823 – Загл. с экрана.

Аннотация: Трансформеры добились выдающихся результатов в самых разных областях, однако их монолитная архитектура создаёт проблемы с интерпретируемостью, адаптивностью и масштабируемостью. В данной работе представлена новая модульная архитектура трансформера, которая явно разделяет знание и рассуждение через механизм обобщённого кросс-внимания к глобально разделяемой базе знаний со слое-специфичными преобразованиями, специально разработанными для эффективного извлечения знаний. Ключевой вклад — строгое математическое обоснование, демонстрирующее, что сеть прямого распространения (FFN) в стандартном трансформере является частным случаем (замыканием) этого обобщённого кросс-внимания, что раскрывает её роль в неявном извлечении знаний и подтверждает нашу конструкцию. Предложенная теоретическая основа даёт новый взгляд на понимание FFN и закладывает фундамент для будущих исследований в области улучшения интерпретируемости, адаптивности и масштабируемости, обеспечивая более глубокое взаимодействие с внешними базами знаний и другими системами.

1 Введение

Большие языковые модели (БЯМ), основанные на архитектуре трансформеров, достигли выдающихся результатов [17, 7, 14, 3]. Однако ключевым ограничением их монолитной архитектуры является глубокая взаимосвязанность знаний и рассуждений в параметрах модели, что создает серьезные проблемы для практических приложений, требующих прозрачности, адаптивности и непрерывного обучения.

В частности, современные трансформеры сталкиваются с ограничениями в следующих аспектах:

• Интерпретируемость. Распределенная природа представления знаний, особенно в сетях прямого распространения (FFN), затрудняет определение конкретной информации, используемой для прогнозов [5, 18], что ограничивает их применение в критически важных областях, таких как здравоохранение и юридические рассуждения.

• Адаптивность. Адаптация предобученных моделей к новым знаниям или их интеграция с внешними системами является неэффективной и сложной. Современные методы, такие как RAG [12], которые просто объединяют извлеченный контекст со входными данными, страдают от разбавления контекста и извлечения информации только на входном уровне, не обеспечивая динамического, зависящего от контекста доступа к знаниям во время обработки. Это препятствует непрерывному обучению и возможности интеграции быстро меняющейся информации, такой как новости в реальном времени или научные открытия.

• Масштабируемость. Тесная связь знаний и рассуждений в монолитных трансформерах препятствует модульному масштабированию, в отличие от человеческого познания, которое эффективно переносит существующие способности к рассуждению на новые знания благодаря модульному обучению. Этот «взрыв параметров» ограничивает доступность более крупных моделей, замедляя прогресс на пути к созданию по-настоящему комплексных систем искусственного интеллекта, управляемых знаниями.

Для решения этих ограничений, хотя интерпретация FFN как неявной памяти типа «ключ-значение» [8] предоставила ценные идеи, новая проблема возникает, когда мы стремимся явно разделить знания и рассуждения: как сохранить глобальную согласованность знаний, обеспечивая при этом контекстуализированный доступ на каждом уровне. Современные подходы, включая те, что основаны на перспективе «ключ-значение», часто не могут примирить эти два противоречащих требования. Для устранения этого пробела мы предлагаем новую модульную архитектуру трансформеров, которая явно разделяет знания и рассуждения через механизм обобщенного кросс-внимания к глобально разделяемой базе знаний со слое-специфичными преобразованиями. Наша основная цель — обеспечить бесшовное взаимодействие с внешними базами знаний, способствуя непрерывному обучению, обмену знаниями и независимому масштабированию емкости знаний.

Ключевой вклад данной работы — строгий теоретический анализ, демонстрирующий, что FFN в стандартном трансформере может быть представлен как специализированный случай (замыкание) нашего обобщенного кросс-внимания. Это раскрывает роль FFN в неявном извлечении знаний и обеспечивает критическую валидацию предложенного нами механизма. Установив эту функциональную эквивалентность при совместном обучении (где база знаний обучается внутри модели), мы создаем прочную теоретическую основу для будущих исследований по интеграции внешних баз знаний. Благодаря доказанной эквивалентности, мы ожидаем идентичную функциональную производительность в этом режиме совместного обучения. Эта теоретическая основа необходима для последующего исследования интеграции внешних знаний, что является основным направлением будущих работ.

В данной статье представлены следующие ключевые вклады:

• Новая модульная архитектура. Мы предлагаем модульную архитектуру трансформеров, которая явно разделяет знания и рассуждения через обобщенное кросс-внимание к разделяемой базе знаний со слое-специфичными преобразованиями.

• Обобщенное кросс-внимание для извлечения знаний. Мы вводим механизм обобщенного кросс-внимания, специально разработанный для эффективного извлечения знаний, включающий специфические для знаний смещения.

• Новая интерпретация FFN и валидация фреймворка. Мы предоставляем строгий математический вывод, демонстрирующий, что FFN в стандартном трансформере является специализированным случаем нашего обобщенного кросс-внимания, раскрывая их роль в неявном извлечении знаний и подтверждая нашу конструкцию.

• Основа для расширенных возможностей. Этот теоретический фреймворк закладывает основу для будущих исследований в области улучшенной интерпретируемости, адаптивности и масштабируемости, обеспечивая более богатое взаимодействие с внешними базами знаний и другими системами.

Данная статья фокусируется на теоретическом фреймворке и случае, когда разделяемая база знаний обучается совместно внутри модели, закладывая основу для будущих исследований внешних, подключаемых баз знаний и связанных с ними эмпирических оценок.

Структура статьи следующая: раздел 2 подробно описывает проблемы монолитных трансформеров. Раздел 3 представляет предложенную нами модульную архитектуру. Раздел 4 описывает наше обобщенное кросс-внимание. Раздел 5 представляет теоретический анализ, связывающий FFN с нашим обобщенным кросс-вниманием. Раздел 6 обсуждает последствия и направления будущих исследований. Раздел 7 рассматривает смежные работы, а раздел 8 завершает статью.

2 Проблемы монолитных трансформеров

В данном разделе рассматриваются ограничения стандартной архитектуры трансформеров, с акцентом на концептуальные проблемы, возникающие из-за монолитной природы этих моделей, особенно в контексте взаимосвязи знаний и рассуждений.

2.1 Базовая архитектура трансформера только с декодером

Мы фокусируем наш анализ на архитектуре трансформера только с декодером [17, 14, 3], которая стала доминирующей архитектурой для больших языковых моделей. Трансформер только с декодером, как показано на Рисунке 1(a), состоит из стека блоков декодера, каждый из которых содержит два основных подслоя:

• Маскированное мультиголовое самовнимание. Этот слой позволяет каждому токену во входной последовательности обращать внимание на все предшествующие токены (включая сам себя), захватывая контекстные взаимосвязи внутри последовательности. «Маскированный» аспект предотвращает обращение модели к будущим токенам во время обучения, обеспечивая авторегрессивное поведение.

• Сеть прямого распространения (FFN). Этот слой состоит из двух линейных преобразований с нелинейной функцией активации (обычно GeLU или ReLU) между ними. Он обрабатывает представление каждого токена независимо.

Выход каждого подслоя добавляется к входу (остаточное соединение) и нормализуется (нормализация по слоям).

Архитектуры (a) стандартного трансформера только с декодером и (b) предложенного модульного трансформера с обобщенным кросс-вниманием и общей базой знаний
Рисунок 1 – Архитектуры (a) стандартного трансформера только с декодером и (b) предложенного модульного трансформера с обобщенным кросс-вниманием и общей базой знаний

2.2 Ограничения монолитной архитектуры

Монолитная архитектура стандартных трансформеров, в которой знания и рассуждения глубоко взаимосвязаны в параметрах модели, создает несколько ключевых концептуальных проблем:

• Взаимосвязанные знания и рассуждения. В стандартных трансформерах знания неявно закодированы в весах матриц внимания и сетей FFN. Эта взаимосвязанность затрудняет изоляцию, анализ или обновление конкретной информации без непреднамеренных последствий. Отсутствие прозрачности затрудняет определение того, возникают ли ошибки из-за недостатка знаний, ошибочных рассуждений или сложного взаимодействия между ними, что препятствует целенаправленным улучшениям. Например, FFN для слова «банк» может кодировать как концепцию финансового учреждения, так и берег реки, что затрудняет разрешение многозначности в разных контекстах.

• Адаптивность и не модульность. Адаптация предобученных моделей к новым знаниям или их интеграция с внешними системами является неэффективной и сложной. Современные методы с расширенным поиском, такие как RAG, пытаются улучшить адаптивность, извлекая релевантный контекст и конкатенируя его с входным запросом. Однако такой подход имеет несколько врожденных ограничений. Во-первых, простое добавление большего количества текста через конкатенацию может привести к «разбавлению контекста», когда фактические знания и вопрос пользователя смешиваются, что вводит большую языковую модель в замешательство. Во-вторых, поскольку поиск и рассуждение остаются взаимосвязанными внутри модели, становится сложно понять, как именно используются извлеченные знания. Наконец, из-за однократного первоначального поиска в RAG и ограниченного входного окна больших языковых моделей извлеченная информация часто бывает недостаточной или избыточной. В отличие от этого, без какого-либо механизма поиска, подобного RAG, включение новой информации становится еще более сложным, требуя значительных ресурсов и рискуя нарушить существующие знания.

• Проблемы масштабирования. Монолитная структура трансформеров создает значительные проблемы масштабирования. Поскольку знания и рассуждения глубоко взаимосвязаны в параметрах модели, увеличение одной емкости требует значительной корректировки другой, что препятствует независимому масштабированию и приводит к диспропорциональному росту параметров и существенным вычислительным и затратам памяти. Этот «взрыв параметров» делает обучение и развертывание более крупных моделей все более сложным. Хотя тонкая настройка предлагает более эффективную альтернативу полному переобучению для включения новых знаний, она все еще страдает от таких ограничений, как катастрофическое забывание и отсутствие эффективного, аддитивного масштабирования. В отличие от людей, которые могут эффективно интегрировать новые знания с минимальными корректировками своих основных способностей к рассуждению (достигая формы аддитивного масштабирования), монолитные трансформеры, будь то через переобучение или тонкую настройку, требуют существенных обновлений параметров, что препятствует непрерывному обучению и способствует снижению отдачи: после определенного момента простое увеличение размера модели или проведение дальнейшей тонкой настройки дает прогрессивно меньшие приросты производительности, указывая на неэффективный подход к масштабированию знаний и рассуждений.

3 Модульная архитектура с явным разделением знаний

Для преодоления ограничений монолитных трансформеров, в частности переплетения знаний и рассуждений (как обсуждалось в разделе 2), мы предлагаем новую модульную архитектуру. Эта архитектура предназначена для явного разделения знаний и рассуждений путём введения специализированного механизма доступа к знаниям.

3.1 Требования к явной базе знаний

Для эффективной интеграции знаний в архитектуры трансформеров мы считаем, что корректная база знаний (БЗ) должна удовлетворять двум ключевым требованиям:

Глобальное разделение. Глобально разделяемая БЗ обеспечивает параметрическую эффективность за счёт избежания избыточного хранения одинаковых знаний в разных слоях. Если бы каждый слой имел собственную БЗ, количество параметров значительно возросло бы, что привело бы к созданию более крупных и вычислительно затратных моделей. Во-вторых, разделяемая БЗ повышает согласованность знаний, гарантируя, что все компоненты модели используют одинаковую информацию, предотвращая противоречия. Наконец, централизованная БЗ упрощает управление знаниями, поскольку обновление и обслуживание одной БЗ проще, чем множества распределённых, что критично для непрерывного обучения и интеграции новой информации.

Слоеспецифические представления. Разные слои трансформера обрабатывают информацию на различных уровнях абстракции. Следовательно, каждому слою требуется доступ к специфическому представлению БЗ, релевантному текущему контексту. Аналогично тому, как разные области мозга используют различные перспективы одних и тех же знаний, слоям трансформера необходимы разные представления общей БЗ.

3.2 Предлагаемая архитектура

Для удовлетворения вышеуказанных требований наша модульная архитектура вводит глобально разделяемую базу знаний $E \in \mathbb{R}^{|E|\times d_E}$ во всех слоях со слоеспецифическими преобразованиями, где $|E|$ — количество записей знаний, а $d_E$ — размерность каждой записи. Доступ к $E$ осуществляется через специализированные механизмы кросс-внимания (показано на Рисунке 1(b)). Это эффективно декомпозирует неявные знания, закодированные во внутренних связях нейронных сетей (FFN), обеспечивая значительные преимущества в интерпретируемости, адаптивности и масштабируемости при работе с внешними базами знаний в будущих исследованиях. Важно отметить, что в данной работе мы фокусируемся на теоретических основах и сценарии, где $E$ обучается совместно с моделью. Исследование внешних подключаемых баз знаний оставлено для будущих работ.

Конкретно, аналогично слою многоголового самовнимания в стандартном трансформере, каждая голова внимания в наших модульных блоках обучает различные матрицы проекций ($W^l_Q$, $W^l_K$, $W^l_V$), эффективно фокусируясь на разных аспектах или подмножествах информации в $E$. Этот механизм обеспечивает динамическое извлечение знаний в контексте, позволяя модели получать доступ к релевантной информации из $E$ на каждом слое обработки.

Формально, пусть $H_l \in \mathbb{R}^{N\times d}$ — выход слоя многоголового самовнимания в $l$-м блоке, где $N$ — длина последовательности, $d$ — скрытая размерность. Процесс извлечения знаний в этом блоке определяется как (детали многоголовых механизмов опущены для ясности):

$$Q_l = H_l W^l_Q$$ (1)
$$K_l = E W^l_K$$ (2)
$$V_l = E W^l_V$$ (3)
$$C_l = \text{GeneralizedAttention}(Q_l, K_l, V_l)$$ (4)

где $W^l_Q \in \mathbb{R}^{d\times d_k}$, $W^l_K \in \mathbb{R}^{d_E\times d_k}$ и $W^l_V \in \mathbb{R}^{d_E\times d}$ — матрицы проекций запросов, ключей и значений, специфичные для $l$-го блока. $E \in \mathbb{R}^{|E|\times d_E}$ представляет базу знаний. Функция $\text{GeneralizedAttention}$ и её выход $C_l \in \mathbb{R}^{N\times d}$ детально описаны в разделе 4. Выход $l$-го модульного блока определяется как:

$$H'_l = H_l + C_l$$ (5)

Этот модульный дизайн даже в режиме совместного обучения (рассмотренном в данной работе) предоставляет ценную концептуальную основу для понимания извлечения знаний в трансформерах и имеет важные последствия для будущих исследований с внешними базами знаний:

Явное представление знаний (совместное обучение). Знания теперь представлены в отдельном явно доступном модуле ($E$), даже при совместном обучении. Это даёт более чёткую концептуальную основу для понимания используемой информации при прогнозировании.

Основа для динамического извлечения знаний в контексте. Использование кросс-внимания к $E$ обеспечивает механизм динамического контекстно-зависимого извлечения релевантных знаний на каждом слое сети. В отличие от методов вроде RAG, где знания извлекаются единожды в начале, такое динамическое извлечение является ключевым аспектом нашей архитектуры и мотивирует обобщённый механизм кросс-внимания, описанный в следующем разделе.

Основа для независимого управления базой знаний. Эта архитектура закладывает основу для будущего независимого управления базой знаний. При использовании внешних БЗ обновления $E$ (добавление новых фактов или исправление существующих) не потребуют переобучения матриц проекций или механизма самовнимания.

Основа для независимого масштабирования. Хотя в данной работе это не проверялось эмпирически, модульный дизайн создаёт предпосылки для независимого масштабирования ёмкости знаний и рассуждений в будущих работах с внешними базами знаний.

4 Обобщённое кросс-внимание для извлечения знаний

В этом разделе представлен механизм обобщённого кросс-внимания, разработанный для извлечения знаний из базы знаний $E \in \mathbb{R}^{|E|\times d_E}$, где $|E|$ — количество записей знаний, а $d_E$ — размерность каждой записи. Стандартные механизмы внимания, эффективные для самовнимания, субоптимальны для извлечения знаний из-за необходимости выборочного доступа и соединения различных пространств эмбеддингов. Эффективное извлечение знаний требует: (1) определения релевантности записей знаний заданному контексту (Релевантность/Выбор) и (2) определения способа интеграции выбранных знаний в представление модели (Интеграция/Преобразование). Мы последовательно модифицируем стандартный механизм внимания для решения этих задач.

Пусть $H_l \in \mathbb{R}^{N\times d}$ — входные данные из предыдущего слоя, где $N$ — длина последовательности, $d$ — скрытая размерность. Пусть $Q_l \in \mathbb{R}^{N\times d_k}$, $K_l \in \mathbb{R}^{|E|\times d_k}$ и $V_l \in \mathbb{R}^{|E|\times d}$ — матрицы запросов, ключей и значений соответственно.

4.1 Фаза 1: Выборочное извлечение с разрежённой активацией

Стандартное внимания вычисляет взвешенное среднее значений на основе softmax от сходства запросов и ключей:

$$\text{Attention}(Q_l, K_l, V_l) = \text{softmax}\left(\frac{Q_l K_l^T}{\sqrt{d_k}}\right) V_l$$ (6)

Однако softmax присваивает ненулевые веса всем записям знаний, затрудняя выборочное извлечение. Для обеспечения разрежённости мы заменяем softmax на разрежённую функцию активации, например ReLU:

$$\text{ReLU}\left(\frac{Q_l K_l^T}{\sqrt{d_k}}\right)$$

Побочный элемент применения ReLU к матрице сходства устанавливает пороговые значения, обеспечивая разрежённость в матрице внимания. Также могут использоваться другие разрежённые активации (например, Leaky ReLU, Sparsemax).

4.2 Фаза 2: Пороговая фильтрация, специфичная для знаний ("Условие ЕСЛИ")

Хотя ReLU вводит разрежённость, он применяет единый порог нуля ко всем записям знаний. Это субоптимально, поскольку разные записи имеют различную степень релевантности. Мы вводим функцию пороговой фильтрации $B^l_1(E) \in \mathbb{R}^{N\times |E|}$, специфичную для знаний. Это можно интерпретировать как условие «ЕСЛИ»: ЕСЛИ оценка релевантности (из $Q_l K_l^T$) для конкретной записи знаний превышает соответствующий порог из $B^l_1(E)$, ТО запись учитывается; в противном случае она отфильтровывается. В текущей реализации $B^l_1(E)$ вычисляется с помощью многослойного персептрона (MLP), применяемого к каждому эмбеддингу записи знаний.

$$\text{Attention}_{\text{ReLU+Threshold}}(Q_l, K_l, V_l) = \text{ReLU}\left(\frac{Q_l K_l^T}{\sqrt{d_k}} + B^l_1(E)\right) V_l$$ (8)

4.3 Фаза 3: Вектор смещения преобразования для семантического сопряжения

Матрица значений $V_l$ представляет преобразованное представление записей знаний, выступая как часть «ТО ЗНАЧЕНИЕ» в логике «ЕСЛИ-ТО». Это преобразование уже выполняется матрицей $W^l_V$ в выражении $V_l = E W^l_V$, которая извлекает релевантные признаки из записей знаний. Более того, в отличие от самовнимания, где запросы и значения принадлежат одному пространству эмбеддингов, наше обобщённое кросс-внимание соединяет различные пространства: одно для $H_l$ и другое для $E$. Для дальнейшего сопряжения семантического разрыва путём выравнивания преобразованного представления знаний с контекстным представлением мы вводим вектор смещения преобразования $b^l_2 \in \mathbb{R}^d$, добавляемый к взвешенным значениям после пороговой фильтрации.

$$\text{GeneralizedAttention}(Q_l, K_l, V_l) = \text{ReLU}\left(\frac{Q_l K_l^T}{\sqrt{d_k}} + B^l_1(E)\right) V_l + b^l_2$$ (9)

Таким образом, наш механизм обобщённого кросс-внимания решает задачи извлечения знаний за счёт: (1) ReLU для выборочного извлечения, (2) пороговой фильтрации $B^l_1(E)$, специфичной для знаний, как условия «ЕСЛИ», и (3) вектора смещения преобразования $b^l_2$ для семантического сопряжения. Такой дизайн обеспечивает более интерпретируемое, эффективное и целенаправленное извлечение знаний по сравнению со стандартным вниманием.

5 FFN как замыкание обобщённого кросс-внимания

В данном разделе устанавливается важная теоретическая связь между предлагаемой модульной архитектурой и стандартной архитектурой трансформера. Мы демонстрируем, что сеть прямого распространения (Feed-Forward Network, FFN) в блоке трансформера может быть интерпретирована как частный случай нашего механизма обобщённого кросс-внимания.

Рассмотрим обобщённое кросс-внимание как функцию с двумя аргументами: запросом $H_l$ и базой знаний $E$:

$$\text{Cross-Attention}(H_l, E)$$ (10)

Наш ключевой вывод заключается в том, что FFN может быть выражена как замыкание этой функции:

$$\text{FFN}(H_l) = \text{Cross-Attention}(H_l, \text{Implicit } E)$$ (11)

где «Неявная $E$» представляет знания, закодированные в параметрах трансформера. Эту «Неявную $E$» можно рассматривать как высоко сжатое представление знаний, полученных в ходе предобучения и закодированных во весах FFN всех слоёв декодера. Данное представление подчёркивает, что FFN выполняет неявное извлечение знаний из встроенной базы знаний. Эта связь даёт сильное теоретическое обоснование эффективности FFN и одновременно валидирует дизайн нашего механизма обобщённого кросс-внимания. Критически важно, что данная формализация предоставляет строгую основу для интерпретации FFN как памяти ключ-значение, предложенной Geva et al. [8].

Далее мы приведём математическое обоснование, демонстрирующее это эквивалентность.

5.1 Вывод FFN из обобщённого кросс-внимания

Для установления связи со стандартной формулировкой FFN, работающей с фиксированными весами, рассмотрим сценарий, где $E$ статична во время инференса (и, в случае совместного обучения, рассматриваемого в данной работе, статична также во время обучения). В этом случае механизм обобщённого кросс-внимания значительно упрощается. Вспомним уравнение 9:

$$C_l = \text{ReLU}\left(\frac{Q_l K_l^T}{\sqrt{d_k}} + B^l_1(E)\right) V_l + b^l_2$$ (12)

где:

$$Q_l = H_l W^l_Q$$ (13)
$$K_l = E W^l_K$$ (14)
$$V_l = E W^l_V$$ (15)

Поскольку $E$ статична, мы можем предвычислить следующие матрицы, эффективно «сворачивая» неявную базу знаний во веса:

$$W^{(K,E)}_l = E W^l_K$$ (16)
$$W^{(V,E)}_l = E W^l_V$$ (17)
$$B^{(E)}_l = B^l_1(E)$$ (18)

Этот процесс «свёртки» и создаёт замыкание, заставляя функцию кросс-внимания работать только с явным аргументом $H_l$. Подставляя предвычисленные компоненты в уравнение 12, получаем:

$$C_l = \text{ReLU}\left(H_l W^l_Q \frac{(W^{(K,E)}_l)^T}{\sqrt{d_k}} + B^{(E)}_l \right) W^{(V,E)}_l + b^l_2$$

Мы можем дополнительно свернуть проекцию запроса и предвычисленную матрицу ключей в одну матрицу:

$$W^{(Q,K,E)}_l = W^l_Q \frac{(W^{(K,E)}_l)^T}{\sqrt{d_k}}$$ (20)

Это приводит к:

$$C_l = \text{ReLU}\left(H_l W^{(Q,K,E)}_l + B^{(E)}_l \right) W^{(V,E)}_l + b^l_2$$ (21)

5.2 Связь со стандартной FFN

Стандартная FFN в блоке трансформера определяется как:

$$\text{FFN}(H_l) = \text{ReLU}(H_l W^l_1 + b^l_1) W^l_2 + b^l_2$$ (22)

Сравнивая это с полученным уравнением для $C_l$ (уравнение 21), мы подтверждаем функциональную эквивалентность $\text{FFN}(H_l) = \text{Cross-Attention}(H_l, \text{Implicit } E)$ при условии статичной базы знаний $E$. Устанавливая:

$$W^l_1 = W^{(Q,K,E)}_l$$ (23)
$$b^l_1 = B^{(E)}_l$$ (24)
$$W^l_2 = W^{(V,E)}_l$$ (25)
$$b^l_2 = b^l_2$$ (26)

мы видим, что FFN становится частным случаем нашего механизма обобщённого кросс-внимания, применённого к статической базе знаний $E$, устанавливая функциональную эквивалентность между ними. Эта эквивалентность напрямую означает, что при совместном обучении $E$ с моделью наша модульная архитектура функционально эквивалентна стандартному трансформеру. Следовательно, мы ожидаем идентичную производительность на любых задачах в режиме совместного обучения. Данная эквивалентность служит сильной теоретической валидацией нашего механизма обобщённого кросс-внимания и предлагаемой модульной архитектуры в режиме совместного обучения. Поскольку это подразумевает, что эмпирические результаты при совместном обучении просто подтвердят эту эквивалентность, мы откладываем экспериментальную валидацию на будущие работы, фокусирующиеся на внешних базах знаний, как обсуждается в разделе 6.

5.3 Следствия эквивалентности

Математически доказанная эквивалентность $\text{FFN}(H_l) = \text{Cross-Attention}(H_l, \text{Implicit } E)$ формально устанавливает связь между FFN и фреймворком памяти ключ-значение [8], предоставляя конкретный механизм доступа и использования этой памяти. Кроме того, это согласуется с эмпирическими наблюдениями, такими как слоеспецифическое кодирование информации, обнаруженное Haider et al. [9]. Эта эквивалентность имеет несколько важных теоретических следствий.

Теоретическое обоснование и новая интерпретация FFN. Эта эквивалентность даёт сильную теоретическую базу для эффективности и интерпретируемости FFN в трансформерах. Она показывает, что FFN не просто произвольные нелинейные преобразования, а выполняют специфическую форму контекстно-зависимого извлечения знаний из высоко сжатого, распределённого представления, полученного при предобучении. Этот процесс извлечения включает пороговую фильтрацию, специфичную для знаний, и преобразование, включающее как специфические для знаний, так и межпространственные корректировки. Эта связь также предоставляет новый взгляд на интерпретацию свёрнутых весов (уравнения 23-26), которые теперь представляют более интерпретируемую комбинацию информации о запросах, ключах и базе знаний.

Особые требования кросс-внимания. Данный анализ подчёркивает ключевые различия между самовниманием и кросс-вниманием, особенно в контексте извлечения знаний. В то время как самовнимание фокусируется на обмене информацией внутри одного источника, кросс-внимание для извлечения знаний требует механизмов выборочного извлечения и контролируемого преобразования информации из внешнего источника.

Таблица 1 – Сравнение сквозных и модульных архитектур с разделённой общей базой знаний
Характеристика Сквозная (монолитная) Разделённая (модульная)
Производительность модели Прямая оптимизация Эквивалентна (при совместном обучении)
Потенциально ниже при внешних БЗ
Интерпретируемость Ограничена Повышена
Адаптивность Низкая, требуется дообучение/финетюнинг Высокая, модульные обновления
Масштабируемость Ограничена, переплетение компонентов Повышена, независимое масштабирование
Эффективность инференса Часто высокая Потенциально ниже
Представление знаний Неявное, распределённое Явное, централизованное (в БЗ)

Следствия для размера модели. Неявное кодирование $E$ внутри замыкания $\text{FFN}(H_l) = \text{Cross-Attention}(H_l, \text{Implicit } E)$ напрямую объясняет значительные требования к количеству параметров трансформеров. Кодирование знаний распределённым, сжатым способом во весах FFN требует большой ёмкости. Наша модульная архитектура в будущих работах с внешними базами знаний предлагает потенциальное решение этой проблемы за счёт вынесения базы знаний во внешнее хранилище, позволяя более эффективно масштабировать ёмкость знаний.

Слоеспецифические представления общей базы знаний. Поскольку процесс свёртки весов включает слоеспецифические матрицы проекций ($W^l_Q$, $W^l_K$, $W^l_V$) и другие параметры, специфичные для слоя, каждый слой в стандартном трансформере эффективно получает доступ к разным представлениям одной и той же, неявно закодированной, общей базы знаний.

6 Обсуждение и направления будущих исследований

В данном разделе обсуждаются ограничения, намечаются направления будущих исследований и рассматриваются практические аспекты, связанные с вычислительными и памятевыми компромиссами.

6.1 Сквозные vs. разделённые архитектуры

Центральным аспектом при проектировании архитектур является компромисс между сквозными и разделёнными (модульными) подходами. Сквозное обучение монолитных трансформеров показало высокую эффективность во многих задачах, предоставляя преимущество прямой оптимизации под конечную целевую задачу и неявного обучения признаков. Однако это достигается ценой ограниченной интерпретируемости, адаптивности и масштабируемости, как обсуждалось в разделе 2. Предлагаемая нами модульная архитектура теоретически эквивалентна стандартным трансформерам в режиме совместного обучения, исследуемом в данной работе (как продемонстрировано в разделе 5), и поэтому мы ожидаем сопоставимой производительности в этой конфигурации. Однако её основная мотивация — решение долгосрочных задач интерпретируемости, адаптивности и масштабируемости, особенно в сценариях, требующих непрерывного обучения и интеграции быстро меняющихся знаний. Мы признаём, что переход к внешним базам знаний может привести к снижению производительности, особенно если представление знаний и механизмы извлечения не оптимизированы. Тем не менее, мы утверждаем, что потенциальные преимущества разделения знаний и рассуждений — включая повышенную интерпретируемость, адаптивность к новой информации, независимое масштабирование ёмкости знаний и рассуждений, а также более богатое взаимодействие с внешними системами — перевешивают этот возможный компромисс.

6.2 Ограничения и направления будущих исследований

Хотя данная работа демонстрирует функциональную эквивалентность существующим трансформерам в режиме совместного обучения, эта новая перспектива предоставляет несколько ключевых преимуществ, мотивирующих значительные будущие исследования. Она даёт строгую теоретическую основу для понимания FFN как механизмов неявного извлечения знаний, выходя за рамки эмпирических наблюдений. Критически важно, что это открывает новые направления исследований, сфокусированные на внешних БЗ и явном разделении знаний и рассуждений, позволяя более богатое взаимодействие между БОМ и внешними системами за пределами простых методов усиления извлечением. Эта направленность призвана повысить адаптивность, масштабируемость и интеграцию знаний.

Тем не менее, работа имеет несколько ограничений. Наш теоретический анализ фокусируется на совместном обучении и не затрагивает напрямую проблемы внешних, предсуществующих БЗ. Поэтому основное направление будущих исследований — практическая реализация и эмпирическая оценка нашей модульной архитектуры с внешними, подключаемыми БЗ. Это исследование порождает несколько ключевых направлений, включая следующие аспекты:

Реализация и управление внешними базами знаний. Эта ключевая область будущих исследований фокусируется на практической реализации и управлении внешними БЗ в рамках нашей модульной архитектуры. Она включает следующие исследования:

Совместное обучение и извлечение. Мы исследуем сквозное совместное обучение БОМ и специализированной модели эмбеддингов БЗ $X$ (которая генерирует $E$), где БОМ создаёт эмбеддинги запросов для извлечения релевантных записей БЗ с использованием дифференцируемой аппроксимации Top-K (например, сглаженного softmax или straight-through estimator). Это направлено на оптимизацию совместимости эмбеддингов и интеграции информации.

Хранение и управление БЗ. Мы внедрим внешнее хранилище эмбеддингов для управления эмбеддингами, генерируемыми $X$ (т.е. $E$). Это позволит эффективно обновлять БЗ (переэмбеддинг, вставки и удаления) во время инференса. Данный подход предполагает достаточную представительность обучающих данных для обобщения на новые записи БЗ, что мы будем оценивать. Также будут исследованы методы мониторинга качества и согласованности БЗ.

Представление знаний и структура. На протяжении всей работы мы рассматривали упрощённый сценарий, где знания представлены как отдельные записи в БЗ. Однако наш анализ предполагает, что FFN могут кодировать знания в сложных, высокоразмерных представлениях. Поэтому мы исследуем, как эффективно представлять знания во внешних БЗ, изучая различные структуры и их влияние на извлечение, рассуждения и управление БЗ. Это исследование может дополнительно усложнить процедуры совместного обучения и управления БЗ, описанные выше.

Таблица 2 – Доминирующие вычислительные и памятевые сложности для стандартного слоя FFN трансформера и его эквивалентных реализаций с использованием обобщённого кросс-внимания. $N$ — длина последовательности, $d$ — скрытая размерность для $H_l$, $d_{ff}$ — внутренняя размерность FFN, $|E|$ — размер полной базы знаний, $|E'|$ — размер извлекаемого подмножества БЗ, $R$ представляет стоимость извлечения.
Реализация Стандартный FFN Кросс-внимание + Свёртка + Свёртка + Извлечение
Вычислительная сложность $O(N d d_{ff})$ $O((N + d) d |E|)$ $O(N d |E|)$ $O(N d |E'|) + R$
Памятевая сложность $O(d d_{ff})$ $O(d |E|)$ $O(d |E|)$ $O(d |E'|)$

Масштабирование и эффективность. Вынесение базы знаний во внешнее хранилище даёт возможность независимого масштабирования ёмкости знаний и рассуждений. Будущие исследования должны эмпирически изучить вычислительные и памятевые компромиссы, связанные с различными размерами БЗ, методами извлечения и размерами моделей рассуждений. Ключевой исследовательский вопрос: как оптимизировать методы извлечения, представление знаний и размер модели рассуждений для достижения эффективных и масштабируемых БОМ, управляемых знаниями?

Интерпретируемость извлекаемых знаний. Понимание того, почему извлекаются конкретные записи знаний и как они влияют на выход модели, критично для интерпретируемости и доверия. Будущие исследования должны изучить методы объяснения процесса извлечения, такие как визуализация весов внимания по извлеченным записям, предоставление текстовых объяснений на основе содержания записей или разработка формальных методов трассировки потока информации от базы знаний к предсказаниям модели.

6.3 Вычислительные и памятевые компромиссы

Вычислительная эффективность крайне важна. Мы анализируем потенциальные вычислительные и памятевые компромиссы, фокусируясь на последствиях для стандартных трансформеров с учётом продемонстрированной нами эквивалентности в режиме совместного обучения. Для простоты мы устанавливаем размерность записей знаний $d_E$ равной размерности запроса $d$. Анализируем компромиссы для различных реализаций слоя FFN в трансформере, как показано в Таблице 2:

Стандартный FFN. Вычислительная сложность $O(N d d_{ff})$. В типичных настройках, где $d_{ff} = 4d$ (как в GPT-3), это создаёт значительную вычислительную нагрузку. Памятевая сложность $O(d d_{ff})$.

Кросс-внимание. Наивная реализация нашего обобщённого кросс-внимания включает проекции и вычисление внимания. Вычислительные сложности этих операций:

$$\begin{array}{l} \text{Query Projection} : O(N d d_k) \\ \text{Key Projection} : O(|E| d d_k) \\ \text{Value Projection} : O(|E| d d) \\ \text{Scaled Dot-Product Attention} : O(N d_k |E|) \\ \text{Multiplication by V} : O(N d |E|) \end{array}$$

где $d_k$ — размерность ключей и запросов, обычно значительно меньшая $d$ (например, 128 против 12288 в GPT-3). Следовательно, доминирующими являются проекция значений и умножение на $V$, что даёт общую сложность $O((N + d) d |E|)$, существенно превышающую сложность FFN при $|E| \gg d_{ff}$. Памятевая сложность $O(d |E|)$.

Кросс-внимание со свёрткой (для полной БЗ). Вычислительная сложность снижается до $O(N d |E|)$ благодаря предвычислениям. Памятевая сложность остаётся $O(d |E|)$.

Кросс-внимание со свёрткой и извлечением (для подмножества $E'$). Вычислительная сложность становится $O(N d |E'|) + R$, где $R$ — стоимость извлечения. Если $|E'| \ll |E|$ (например, извлечение нескольких сотен или тысяч записей из большой БЗ), это может обеспечить существенную экономию вычислительных ресурсов. Памятевая сложность снижается до $O(d |E'|)$.

Это сравнение подчёркивает фундаментальный компромисс между размером базы знаний $|E|$ и вычислительной стоимостью кросс-внимания, которая линейно масштабируется с $|E|$. Наблюдение, что даже при $|E| = d_{ff}$ (49152 в модели GPT-3) количество записей оказывается удивительно малым по сравнению с объёмом мировых знаний, сильно поддерживает нашу гипотезу о существенном сжатии знаний внутри FFN (раздел 6.2). Однако ключевое различие заключается в том, что в предлагаемой нами архитектуре база знаний $E$ разделяется между всеми слоями, тогда как в стандартном трансформере соответствующие веса внутри FFN (неявно кодирующие сжатые знания) не разделяются. Это разделение $E$ имеет важные последствия для параметрической эффективности и согласованности знаний. Оно подчёркивает критическую роль эффективного представления знаний (раздел 6.2) для минимизации $|E|$ и обеспечения вычислительной целесообразности внешнего хранения. Использование извлекаемого подмножества $E'$ дополнительно снижает вычислительные затраты за счёт фокусировки на релевантных знаниях. Хотя внешнее хранение вводит стоимость извлечения $R$, оно даёт значительные преимущества: независимое масштабирование ёмкости знаний и рассуждений, повышенную адаптивность и улучшенную интерпретируемость. Будущие исследования изучат эти компромиссы, включая методы сжатия знаний, влияние методов извлечения на $R$ и оптимальный размер $|E'|$.

7 Смежные исследования

Наша работа опирается на и вносит вклад в несколько областей исследований, включая архитектуры трансформеров, извлечение знаний, связь между символическим и нейросетевым ИИ, модульные нейронные сети, интерпретируемость и обобщённые механизмы внимания.

Трансформеры, FFN и знания. Центральная проблема интеграции знаний в трансформеры — удовлетворение двух ключевых требований к корректной базе знаний (БЗ), обсуждаемых в разделе 3.1: глобальное разделение и слоеспецифические представления. Существующие подходы сталкиваются с трудностями в согласовании этих конкурирующих требований. Geva et al. [8] предположили, что FFN функционируют как неявные памяти ключ-значение, но эти знания по своей природе локальны для слоя, нарушая требование глобального разделения и приводя к избыточности и несогласованностям. Несколько последующих подходов пытаются решить проблемы масштабирования и управления знаниями, но в конечном итоге не могут одновременно удовлетворить обоим требованиям к корректной БЗ. PlugLM [4] вводит разделяемую базу знаний, удовлетворяя требованию глобального разделения, но использует идентичные ключи и значения для всех слоёв, не обеспечивая слоеспецифические представления. TokenFormer [13] токенизирует слоеспецифические веса как форму сжатых знаний, снова нарушая требование глобального разделения.

В отличие от этого, наша работа напрямую решает это противоречие путём введения глобально разделяемой базы знаний со слоеспецифическими преобразованиями, достигаемыми с помощью нового механизма обобщённого кросс-внимания, специально разработанного для извлечения знаний. Эта архитектура уникально удовлетворяет обоим ключевым требованиям: одна явно доступная база знаний разделяется между всеми слоями (обеспечивая параметрическую эффективность, согласованность знаний и эффективное управление), а слоеспецифические преобразования, реализованные через различные матрицы проекций и зависящие от знаний смещения в нашем механизме обобщённого кросс-внимания, гарантируют, что каждый слой получает доступ к уникальному, контекстно-релевантному представлению знаний (позволяя более тонкое использование знаний).

Модульные нейронные сети. Модульность в нейронных сетях демонстрирует улучшение обучения, обобщения и интерпретируемости [11]. Предыдущие работы исследовали модульность для конкретных задач [1, 10] и параметризованные трансформеры [19], внедряя модульность на более высоком уровне (например, разные модули для разных задач). Наша работа фокусируется на модульности внутри архитектуры трансформера, формализуя FFN как модуль, посвящённый неявному извлечению знаний через кросс-внимание. Эта формализация закладывает основу для явного разделения знаний в отдельный модуль (глобально разделяемую БЗ), отличая наш подход от предыдущих конструкций модульных нейронных сетей.

Интерпретируемость нейронных сетей. Различные методики, такие как визуализация внимания [2], карты значимости [16] и пробные задачи [6], направлены на улучшение интерпретируемости нейронных сетей. Хотя эти методы дают представление о важности входных данных, наша работа предлагает теоретическую основу для понимания внутренних вычислений FFN, раскрывая их роль как памяти ключ-значение [8]. Это понимание в сочетании с эмпирическими анализами, подобными работе Haider et al. [9], может информировать более целенаправленные методы интерпретируемости, такие как анализ свёрнутых весов в нашей выведенной формулировке, а также предоставляет основу для более интерпретируемых архитектур за счёт явного разделения извлечения знаний.

Обобщённое внимание и смещения. Наша работа использует обобщённое кросс-внимание со смещениями, специфичными для знаний. Предыдущие исследования изучали различные механизмы внимания [2] и смещённое внимание [15]. Мы развиваем эти идеи, выводя FFN как специфический механизм смещённого кросс-внимания, демонстрируя критическую роль этих смещений в извлечении знаний. Использование смещений, специфичных для знаний (в отличие от общих смещений), обеспечивает более тонкий контроль над извлечением и способствует будущим исследованиям с внешними базами знаний.

8 Заключение

Мы предложили новую модульную архитектуру трансформера с механизмом обобщённого кросс-внимания для доступа к общей базе знаний, решая проблему переплетения знаний и рассуждений в монолитных трансформерах. Наш вклад двояк: проектирование этого механизма кросс-внимания для эффективного извлечения знаний и теоретический анализ, интерпретирующий FFN как частный случай. Эта интерпретация раскрывает, что FFN выполняют неявное извлечение знаний, и мотивирует будущие исследования по изучению внешних баз знаний для повышения адаптивности, масштабируемости и более богатого взаимодействия между БОМ и внешними системами за пределами простого усиления извлечением. Эта модульная архитектура предлагает перспективное направление для создания более интерпретируемых и масштабируемых систем ИИ, управляемых знаниями.

Благодарности

Авторы выражают благодарность Сию Го (Xiyou Guo) за его ценную помощь в выявлении и опровержении первоначальных гипотез посредством математического анализа.

Список литературы

  1. Jacob Andreas, Marcus Rohrbach, Trevor Darrell, and Dan Klein. Neural module networks. In Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, pages 39–48, 2016.
  2. Dzmitry Bahdanau, Kyunghyun Cho, and Yoshua Bengio. Neural machine translation by jointly learning to align and translate. arXiv Preprint arXiv:1409.0473, 2014.
  3. Tom B Brown, Benjamin Mann, Nick Ryder, Melanie Subbiah, Jared Kaplan, Prafulla Dhariwal, Arvind Neelakantan, Pranav Shyam, Girish Sastry, Amanda Askell, et al. Language models are few-shot learners. Advances in Neural Information Processing Systems, 33:1877–1901, 2020.
  4. Xin Cheng, Yankai Lin, Xiuying Chen, Dongyan Zhao, and Rui Yan. Decouple knowledge from parameters for plug-and-play language modeling. In Findings of the Association for Computational Linguistics: ACL 2023, pages 1188–1200, 2023.
  5. Kevin Clark, Urvashi Khandelwal, Omer Joshi, and Christopher D Manning. What does bert look at? an analysis of bert’s attention. In Proceedings of the 2019 ACL Workshop on BERT Interpretability, pages 1–12, 2019.
  6. Alexis Conneau, German Kruszewski, Guillaume Lample, Loïc Barrault, and Marco Baroni. What you can cram into a single vector: Probing sentence embeddings for linguistic properties. In Proceedings of the 6th International Conference on Learning Representations, ICLR 2018, Vancouver, BC, Canada, April 30 - May 3, 2018. OpenReview.net, 2018.
  7. Jacob Devlin, Ming-Wei Chang, Kenton Lee, and Kristina Toutanova. Bert: Pre-training of deep bidirectional transformers for language understanding. arXiv Preprint arXiv:1810.04805, 2018.
  8. Mor Geva, Lior Caciularu, and Yoav Goldberg. Transformer feed-forward layers are key-value memories. arXiv preprint arXiv:2012.14913, 2020.
  9. Muhammad Umair Haider, Umar Farooq, A.B. Siddique, and Mark Marron. Looking into black box code language models. arXiv preprint arXiv:2407.04868, 2024.
  10. Kazuma Hashimoto, Caiming Xiong, Yoshimasa Tsuruoka, and Richard Socher. A joint many-task model: Growing a neural network for multiple nlp tasks. In Proceedings of the 2018 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies, Volume 1 (Long Papers), pages 798–807, 2018.
  11. Robert A Jacobs, Michael I Jordan, Steven J Nowlan, and Geoffrey E Hinton. Adaptive mixtures of local experts. Neural Computation, 3(1):79–87, 1991.
  12. Patrick Lewis, Ethan Perez, Aleksandra Piktus, Fabio Petroni, Vladimir Karpukhin, Naman Goyal, Heinrich Kuchenbecker, Kelvin Guu, Myle Ott, et al. Retrieval-augmented generation for knowledge-intensive nlp tasks. Advances in Neural Information Processing Systems, 33:9459–9474, 2020.
  13. Ning Liu, Bowen Li, Zhuoran Wang, Tianyi Zhang, Jian Wang, and Changyou Chen. Tokenformer: Rethinking transformer scaling with tokenized model parameters. arXiv preprint arXiv:2410.23168, 2024.
  14. Alec Radford, Karthik Narasimhan, Tim Salimans, and Ilya Sutskever. Improving language understanding by generative pre-training. arXiv preprint arXiv:1801.06146, 2018.
  15. Peter Shaw, Jakob Uszkoreit, and Ashish Vaswani. Self-attention with relative position representations. In Proceedings of the 2018 Conference of the North American Chapter of the Association of Computational Linguistics: Human Language Technologies, Volume 2 (Short Papers), pages 418–422, 2018.
  16. Karen Simonyan, Andrea Vedaldi, and Andrew Zisserman. Deep inside convolutional networks: Visualising image classification models and saliency maps. In International Conference on Learning Representations Workshop Track, 2013.
  17. Ashish Vaswani, Noam Shazeer, Niki Parmar, Jakob Uszkoreit, Llion Jones, Aidan N Gomez, Łukasz Kaiser, and Illia Polosukhin. Attention is all you need. In Advances in Neural Information Processing Systems, pages 5998–6008, 2017.
  18. Jesse Vig, Sebastian Gehrmann, Belinda Kim, and Sascha Rush. Multiscale visualization of attention in the transformer model. In Proceedings of the 57th Annual Meeting of the Association for Computational Linguistics, pages 797–806, 2019.
  19. Han Yu, Haoyu Huang, Yuqing Lin, Ning Yang, Weinan Wang, and Jun Zhou. Parameterized transformers. In International Conference on Learning Representations, 2021.