Назад в библиотеку

Трансформеры являются графовыми нейронными сетями

Автор: Чайтанья К. Джоши

Источник: Chaitanya K. Joshi. Transformers are Graph Neural Networks [Электронный ресурс] – Режим доступа: https://arxiv.org/abs/2506.22084 – Загл. с экрана.

Аннотация

Мы устанавливаем связи между архитектурой трансформеров, изначально разработанной для обработки естественного языка, и графовыми нейронными сетями (GNNs) для обучения представлений на графах. Мы показываем, как трансформеры могут рассматриваться как GNNs с передачей сообщений, работающие на полностью связанных графах токенов, где механизм самовнимания определяет относительную важность всех токенов друг относительно друга, а позиционные кодировки дают подсказки о последовательном порядке или структуре. Таким образом, трансформеры представляют собой выразительные сети для обработки множеств, которые учатся выявлять взаимосвязи между входными элементами без ограничений заранее заданных графов. Несмотря на эту математическую связь с GNNs, трансформеры реализуются с помощью операций с плотными матрицами, которые значительно более эффективны на современном оборудовании, чем разреженная передача сообщений. Это приводит к перспективе, согласно которой трансформеры являются GNNs, которым посчастливилось выиграть в аппаратной лотерее.

1 Трансформеры для обработки естественного языка

Наше обсуждение фокусируется на обучении представлений, которое является основой для любой задачи машинного обучения, будь то прогностическое или генеративное моделирование [Olah, 2014].

На высоком уровне глубокие нейронные сети сжимают статистическую и семантическую информацию о данных в список чисел, называемый латентным представлением или эмбеддингом. Модели обучаются путем оптимизации функции потерь, которая измеряет, насколько хорошо представления модели справляются с интересующей задачей, такой как прогнозирование некоторых свойств входных данных. Например, если мы дадим модели набор данных предложений и обучим её предсказывать следующее слово в каждом предложении, она научится создавать представления каждого слова, которые захватывают его значение и контекст в предложении [Graves, 2013].

При обучении на разнообразных, но взаимосвязанных источниках данных модели учатся создавать универсальные представления, которые захватывают лежащую в основе структуру данных. Хорошие представления позволяют обобщать на новые задачи через передачу знаний между смежными областями [Radford et al., 2019, Raffel et al., 2020]. Например, обучение модели на математических задачах также может улучшить её для задач, связанных с программированием, поскольку обе области требуют абстрактного решения проблем.

Ключевой ингредиент для создания хороших представлений — это высоко выразительная и масштабируемая архитектура модели. Это можно понять, изучая трансформацию архитектур в контексте обработки естественного языка (NLP).

От RNN к трансформерам

Рекуррентные нейронные сети (RNN) были классом широко используемых архитектур глубокого обучения для NLP [Hochreiter and Schmidhuber, 1997, Sutskever et al., 2014]. RNN создают представления каждого слова в предложении последовательным образом, то есть одно слово за раз. Интуитивно, мы можем представить слой RNN как конвейер, где слова обрабатываются на нём автогрессивно слева направо. В конце мы получаем латентное представление для каждого слова в предложении, которое мы передаем следующему слою RNN или используем для выбранных задач.

Однако последовательная природа RNN означает, что они испытывают трудности с длинными входными контекстами, поскольку они сжимают всё предложение в одно представление фиксированной длины в конце конвейера. Это привело к разработке механизма внимания [Bahdanau et al., 2015], который позволяет RNN фокусироваться на разных частях входного предложения при создании представлений на каждом шаге, а не только на представлении последнего обработанного слова.

Обучение представлений для NLP
Рисунок 1 – Обучение представлений для NLP. RNN создают представления по одному токену за раз, что отражает последовательную природу языка. Трансформеры создают представления параллельно через механизмы внимания, которые захватывают относительную важность слов относительно друг друга

Сети-трансформеры [Vaswani et al., 2017], построенные на основе механизма внимания, развивают эту идею дальше, позволяя модели создавать представления каждого слова параллельно, а не последовательно. Это достигается путем вычисления важности каждого слова в предложении относительно друг друга, а затем обновления представления каждого слова на основе этой важности. Это позволяет модели захватывать зависимости на больших расстояниях и взаимосвязи между словами, что приводит к более выразительным представлениям.

Изначально представленные для машинного перевода1, трансформеры заменили RNN как предпочтительную архитектуру в NLP [Achiam et al., 2023] и более широких приложениях глубокого обучения [Dosovitskiy et al., 2021, Radford et al., 2023] благодаря своей выразительности и масштабируемости.

Механизм внимания

Центральным компонентом трансформера является механизм внимания, который позволяет представлениям слов в предложениях захватывать их относительную важность друг относительно друга; см. Weng [2018] для интуитивного введения.

Формально, нам дано предложение S, состоящее из упорядоченного набора n слов (или токенов, в более общем смысле). Для каждого токена i мы инициализируем его представление $h^{\ell=0}_i \in \mathbb{R}^d$ как начальный токеновый эмбеддинг [Mikolov et al., 2013]. Представления токенов для каждого токена i затем обновляются через механизм внимания из любого произвольного слоя $\ell$ в слой $\ell + 1$ следующим образом:

$$h^{\ell+1}_i = \text{Attention}\left(Q = W^\ell_Q h^\ell_i, K = \{W^\ell_K h^\ell_j, \forall j \in S\}, V = \{W^\ell_V h^\ell_j, \forall j \in S\}\right),$$ (1)
$$= \sum_{j\in S} w_{ij} \cdot W^\ell_V h^\ell_j,$$ (2)

где $j \in S$ обозначает множество всех токенов в предложении (включая сам токен $i$), а $W^\ell_Q, W^\ell_K, W^\ell_V \in \mathbb{R}^{d\times d}$ — обучаемые линейные преобразования, обозначающие Запрос (Query), Ключ (Key) и Значение (Value) для вычисления внимания соответственно. Веса внимания $w_{ij} \in \mathbb{R}$, которые отражают относительную важность между каждой парой токенов $(i, j)$, вычисляются через скалярное произведение линейно преобразованных представлений, за которым следует нормализация softmax по всем токенам $j \in S$:

$$w_{ij} = \text{softmax}_{j\in S}\left(W^\ell_Q h^\ell_i \cdot W^\ell_K h^\ell_j\right),$$ (3)
$$= \frac{\exp\left(W^\ell_Q h^\ell_i \cdot W^\ell_K h^\ell_j\right)}{\sum_{j'\in S} \exp\left(W^\ell_Q h^\ell_i \cdot W^\ell_K h^\ell_{j'}\right)}.$$ (4)
Простой механизм внимания
Рисунок 2 – Простой механизм внимания. Принимая на вход представления токена $h^\ell_i$ и множества других токенов в предложении $\{h^\ell_j \forall j \in S\}$, мы вычисляем веса внимания $w_{ij}$, обозначающие относительную важность для каждой пары $(i, j)$ через скалярное произведение с последующей нормализацией softmax. Наконец, мы получаем обновленное представление токена $h^{\ell+1}_i$, суммируя представления токенов $\{h^\ell_j\}$, взвешенные соответствующими $w_{ij}$. Каждый токен параллельно проходит через один и тот же конвейер для обновления своего представления.

Рисунок 2 иллюстрирует описанный механизм внимания, который является немного упрощенной версией того, который используется в трансформерах. Вычисление внимания в уравнении 1 выполняется параллельно для каждого токена в предложении для получения обновленных представлений за один проход. Это ключевое преимущество трансформеров перед RNN, которые обновляют представления по одному токену за раз.

Многоголовое внимание

На практике использование одной головы внимания может быть ограничивающим, так как это заставляет модель обучаться только одному набору весов, которые захватывают взаимосвязи между токенами. Однако токены могут взаимодействовать множеством способов, и мы можем захотеть одновременно захватывать разные аспекты их отношений, такие как синтаксические и семантические зависимости, а также контекстные связи.

Чтобы повысить выразительность механизма внимания, в трансформерах было введено многоголовое внимание, которое вычисляет несколько весов внимания параллельно. Каждая голова внимания обучает свой собственный набор преобразований запросов, ключей и значений, позволяя модели одновременно обращать внимание на разные типы отношений и «делать ставку» на наиболее релевантные представления для каждого токена.

Формально, мы можем определить K голов внимания, где каждая голова k вычисляет свой собственный набор преобразований запросов, ключей и значений при обновлении представления токена i на слое ℓ:

$$Q^k = W^{\ell,k}_Q h^\ell_i, \quad K^k = \{W^{\ell,k}_K h^\ell_j, \forall j \in S\}, \quad V^k = \{W^{\ell,k}_V h^\ell_j, \forall j \in S\},$$ (5)

где $W^{\ell,k}_Q, W^{\ell,k}_K, W^{\ell,k}_V \in \mathbb{R}^{d \times \frac{d}{k}}$ — обучаемые линейные преобразования для k-й головы внимания на слое ℓ. Выход каждой головы внимания затем вычисляется как:

$$\text{head}^k_i = \sum_{j\in S} w^k_{ij} \cdot W^{\ell,k}_V h^\ell_j,$$ (6)

и

$$w^k_{ij} = \text{softmax}_{j\in S}\left(W^{\ell,k}_Q h^\ell_i \cdot W^{\ell,k}_K h^\ell_j\right),$$ (7)

где $w^k_{ij} \in \mathbb{R}$ — веса внимания для k-й головы, вычисляемые так же, как и ранее в уравнении 3, но с использованием преобразований запросов и ключей, специфичных для этой головы. Выходы всех голов внимания конкатенируются и проецируются для получения обновленного представления токена i:

$$\tilde{h}^\ell_i = \text{Concat}\left(\text{head}^1_i, \ldots, \text{head}^K_i\right) O^\ell,$$ (8)

где $O^\ell \in \mathbb{R}^{d \times d}$ — обучаемое линейное преобразование, которое проецирует конкатенированные выходы обратно к исходной размерности представления $d$. На практике вычисления для всех голов выполняются параллельно с помощью пакетного матричного умножения.

После операции многоголового внимания каждый токен проходит через независимую операцию на уровне токена. Обновленное представление $\tilde{h}^\ell_i$ для токена $i$ добавляется к исходному представлению $h^\ell_i$ для формирования остаточного соединения [He et al., 2016], за которым следует нормализация по слоям [Ba et al., 2016], и дальнейшая обработка с помощью многослойного персептрона (MLP) на уровне токена:

$$h^{\ell+1}_i = \text{MLP}\left(\text{LayerNorm}\left(h^\ell_i + \tilde{h}^\ell_i\right)\right),$$ (9)

где MLP проецирует представление каждого токена в более высокую размерность (обычно $4 \times d$), применяет нелинейную функцию активации, а затем проецирует обратно к исходной размерности $d$. Стоит отметить, что этот MLP на уровне токена содержит значительно больше обучаемых параметров, чем механизм внимания.

Все эти операции (MLP-подсети, остаточные соединения, нормализация по слоям) теперь являются стандартными компонентами и лучшими практиками архитектур глубокого обучения. Они позволяют стекировать несколько слоев трансформеров для создания очень глубоких сетей, что было ключевым для развития фундаментальных моделей, обучающихся сложным взаимосвязям на больших наборах данных [Bommasani et al., 2021].

Окончательная картина слоя трансформера изображена на Рисунке 3.

Слой трансформера
Рисунок 3 – Слой трансформера. Подслой многоголового внимания вычисляет относительную важность каждого токена в предложении относительно друг друга и соответствующим образом обновляет их представления. Обновленные представления затем обрабатываются подслоем многослойного персептрона (MLP) на уровне токена. Современные варианты трансформера используют SwiGLU [Shazeer, 2020] вместо ReLU [Glorot et al., 2011] в качестве функции активации MLP и применяют операции LayerNorm перед подслоями многоголового внимания и прямого распространения, а не после [Xiong et al., 2020].

2 Графовые нейронные сети для обучения представлений на графах

Теперь обратим наше внимание на множества с реляционной структурой, то есть графы.

Графы используются для моделирования сложных взаимосвязанных систем в реальном мире, начиная от баз знаний и социальных сетей и заканчивая молекулярными структурами. Формально, атрибутивный граф $G = (A, H)$ представляет собой множество $V$ из $n$ узлов, соединённых рёбрами. $A$ обозначает матрицу смежности размером $n \times n$, где каждый элемент $a_{ij} \in \{0, 1\}$ указывает на наличие или отсутствие ребра, соединяющего узлы $i$ и $j$. Кроме того, мы можем определить $N_i$ как множество соседей узла $i$, то есть узлов, соединённых с $i$ ребром: $N_i = \{j \in V | a_{ij} = 1\}$. Матрица начальных представлений $H \in \mathbb{R}^{n \times d}$ хранит атрибуты $h_i \in \mathbb{R}^d$, связанные с каждым узлом $i$. Например, в молекулярных графах каждый узел содержит информацию о типе атома, а рёбра могут представлять взаимодействия между атомами.

Как правило, узлы в графе не имеют канонического или фиксированного порядка и могут быть произвольно переставлены, что приводит к эквивалентной перестановке строк и столбцов матрицы смежности $A$. Таким образом, учёт перестановочной симметрии является критически важным соображением при проектировании моделей машинного обучения для графов [Bronstein et al., 2021]. Формально, перестановка $\sigma$ узлов действует на граф $G$, переставляя строки и столбцы матрицы смежности $A$ и представлений $H$:

$$P_\sigma G = (P_\sigma A P_\sigma^\top, P_\sigma H),$$ (10)

где $P_\sigma$ — матрица перестановки, соответствующая $\sigma$, и $P_\sigma \in \mathbb{R}^{n \times n}$ имеет ровно одну единицу в каждой строке и столбце, а в остальных местах — нули.

Графовые нейронные сети с передачей сообщений

Графовые нейронные сети (GNN) представляют собой класс архитектур глубокого обучения, предназначенных для работы с данными, имеющими структуру графа. GNN используют топологию графа для распространения и агрегации информации между соединёнными узлами. Они стали предпочтительной архитектурой для обучения представлений на графовых данных в различных областях — от молекулярного моделирования [Stokes et al., 2020, Batzner et al., 2022] до рекомендательных систем [Ying et al., 2018] и транспортных сетей [Derrow-Pinion et al., 2021].

GNN основаны на принципе передачи сообщений, при котором каждый узел итеративно обновляет свои представления, агрегируя информацию от своих локальных соседей [Battaglia et al., 2018]. Формально, представления узлов $h_i$ для каждого узла $i \in V$ обновляются с уровня $\ell$ на уровень $\ell + 1$ через трёхэтапный процесс:

1. Построение сообщения: Для каждого узла $i$ и его соседей $j \in N_i$ строится сообщение $m^\ell_{ij}$, отражающее взаимосвязь между представлениями узлов $i$ и $j$.

$$m^\ell_{ij} = \psi\left(h^\ell_i, h^\ell_j\right), \quad \forall j \in N_i,$$ (11)

где $\psi: \mathbb{R}^{2 \times d} \rightarrow \mathbb{R}^d$ — многослойный персептрон (MLP), который обучается строить сообщение на основе представлений узлов $i$ и $j$.

2. Агрегация: Объединяются все сообщения от соседей узла $i$ для получения единого агрегированного сообщения $m^\ell_i$.

$$m^\ell_i = \bigoplus_{j \in N_i} m^\ell_{ij},$$ (12)

где $\bigoplus$ — перестановочно-инвариантный оператор (например, сумма, среднее, максимум), который агрегирует сообщения от всех соседей $j \in N_i$. Таким образом, изменение порядка соседей не влияет на агрегированное сообщение, сохраняя симметрию графа (уравнение 10).

3. Обновление: Обновляются представления узла $i$ с использованием агрегированного сообщения $m^\ell_i$ и его предыдущих представлений $h^\ell_i$.

$$h^{\ell+1}_i = \phi\left(h^\ell_i, m^\ell_i\right),$$ (13)

где $\phi: \mathbb{R}^d \rightarrow \mathbb{R}^d$ — ещё один MLP.

Эта общая формулировка охватывает большинство распространённых архитектур GNN, включая графовые свёрточные сети [Kipf and Welling, 2017], графовые сети изоморфизма [Xu et al., 2019] и нейронные сети передачи сообщений [Gilmer et al., 2017]. Наслаивая несколько слоёв передачи сообщений, GNN могут распространять информацию за пределы непосредственных соседей и захватывать сложные многошаговые взаимосвязи в структуре графа (Рисунок 4).

Обучение представлений на графах с помощью передачи сообщений
Рисунок 4 – Обучение представлений на графах с помощью передачи сообщений. (слева) Графы моделируют сложные системы через множество узлов, соединённых рёбрами. (в центре) GNN строят латентные представления графовых данных через передачу сообщений, где каждый узел учится агрегировать представления из своего локального окружения. (справа) Наслаивание $L$ слоёв передачи сообщений позволяет GNN отправлять и агрегировать информацию из $L$-шаговых подграфов вокруг каждого узла.

Графовые сети внимания

Особенно интересный класс GNN использует механизмы внимания для взвешивания важности различных соседей во время агрегации [Veličković et al., 2018]. В графовых сетях внимания (GAT) сообщение от соседа $j$ к узлу $i$ вычисляется как:

$$\psi\left(h^\ell_i, h^\ell_j\right) = \text{LocalAttention}\left(W^\ell_Q h^\ell_i, \{W^\ell_K h^\ell_j, \forall j \in N_i\}, \{W^\ell_V h^\ell_j, \forall j \in N_i\}\right),$$ (14)
$$= \frac{\exp(W^\ell_Q h^\ell_i \cdot W^\ell_K h^\ell_j)}{\sum_{j' \in N_i} \exp(W^\ell_Q h^\ell_i \cdot W^\ell_K h^\ell_{j'})} \cdot W^\ell_V h^\ell_j,$$ (15)

где $W^\ell_Q, W^\ell_K, W^\ell_V \in \mathbb{R}^{d \times d}$. Механизм локального внимания позволяет GAT обучаться определять, какие соседи более важны для каждого узла во время шага агрегации. Обновлённое представление для узла $i$ вычисляется путём агрегирования сообщений от всех его соседей:

$$h^{\ell+1}_i = h^\ell_i + \sum_{j \in N_i} \psi\left(h^\ell_i, h^\ell_j\right),$$ (16)

На практике GAT также используют многоголовое внимание для параллельного вычисления нескольких наборов весов внимания, что позволяет модели изучать различные аспекты взаимосвязей между узлами.

Эти уравнения должны выглядеть очень знакомо!

На самом деле, они практически идентичны механизму внимания трансформера для вычисления относительной важности слов в предложении.

3 Трансформеры являются GNN на полностью связанных графах

На данном этапе установим формальную эквивалентность между многоголовым вниманием в трансформерах и передачей сообщений в графовых сетях внимания (GATs).

Трансформеры можно рассматривать как GNN, работающие на полных графах, где самовнимание моделирует взаимосвязи между всеми входными токенами в предложении $S$. Многоголовое внимание в уравнении 8 может быть непосредственно реализовано в рамках передачи сообщений следующим образом (для каждой головы):

$$\psi\left(h^\ell_i, h^\ell_j\right) = \text{GlobalAttention}\left(W^\ell_Q h^\ell_i, \{W^\ell_K h^\ell_j, \forall j \in S\}, \{W^\ell_V h^\ell_j, \forall j \in S\}\right),$$ (17)
$$= \frac{\exp(W^\ell_Q h^\ell_i \cdot W^\ell_K h^\ell_j)}{\sum_{j' \in S} \exp(W^\ell_Q h^\ell_i \cdot W^\ell_K h^\ell_{j'})} \cdot W^\ell_V h^\ell_j.$$ (18)

Здесь $\psi\left(h^\ell_i, h^\ell_j\right)$ вычисляет сообщение от токена $j$ к токену $i$, где относительная важность каждого токена определяется через механизм внимания. Далее, взвешенные сообщения от всех токенов предложения агрегируются через суммирование, и представление токена $i$ обновляется как в уравнении 9 с использованием многослойного персептрона $\phi$:

$$h^{\ell+1}_i = \phi\left(h^\ell_i, m^\ell_i\right) = \text{MLP}\left(\text{LayerNorm}\left(h^\ell_i + \sum_{j \in S} \psi\left(h^\ell_i, h^\ell_j\right)\right)\right).$$ (19)

Мы пришли к точно такому же набору уравнений обновления, как и в разделе 1.

Таким образом, трансформеры являются высоко выразительными сетями для обработки множеств. Они могут обучаться захватывать как локальный, так и глобальный контекст в данных через многоголовое внимание, не будучи ограниченными патологиями заранее заданных разреженных графовых структур, как в случае GNN [Di Giovanni et al., 2023]. Это особенно полезно для задач, где у нас нет априорной графовой структуры, например, при моделировании молекулярных структур. Например, белки сворачиваются в стабильные 3D-структуры через взаимодействия между отдалёнными остатками, поэтому захват глобальных взаимосвязей важен для обеспечения физической корректности при прогнозировании структур белков [Jumper et al., 2021].

И наоборот, GATs можно рассматривать как трансформеры с вниманием, ограниченным локальными окрестностями, где графовая структура используется для реализации разреженного или замаскированного внимания [Dong et al., 2024].

Эта связь вдохновила на новое развитие в обучении представлений графов. Трансформеры используют позиционные кодировки как начальный признак для добавления информации о последовательном порядке токенов в предложении, не строго навязывая последовательную структуру. Эту идею можно распространить на графы, где позиционные кодировки могут использоваться для мягкого внедрения информации о графовой структуре в блоки трансформеров [Dwivedi and Bresson, 2020]. Это привело к новому классу графовых трансформеров [Rampášek et al., 2022], которые стремятся сочетать как локальную передачу сообщений, так и глобальное многоголовое внимание. Эти архитектуры преодолевают ограничения выразительности GNN с передачей сообщений, сохраняя при этом индуктивное смещение графовой структуры.

4 Трансформеры — это GNN, выигравшие в аппаратной лотерее

Мы заключим обсуждением аппаратной лотереи [Hooker, 2021], союза архитектур и аппаратного обеспечения, который определяет, какие исследовательские идеи приобретают популярность, и её связи с «горьким уроком» в исследованиях ИИ [Sutton, 2019].

Хотя мы установили, что трансформеры являются GNN, работающими на полностью связанных графах, между этими двумя классами архитектур существует важное практическое различие.

Трансформеры реализуют глобальное многоголовое внимание через высоко оптимизированные операции с плотными матрицами, которые используют возможности параллельной обработки современных GPU и TPU. Данная матрица начальных представлений $H \in \mathbb{R}^{n \times d}$, механизм самовнимания для всех токенов в предложении $S$ может быть вычислен параллельным образом следующим образом:

$$\tilde{H}^\ell = \text{softmax}\left(\left(H^\ell W^\ell_Q \left(H^\ell W^\ell_K\right)^\top\right)\right) \left(H^\ell W^\ell_V\right),$$ (20)

Механизм многоголового внимания также можно параллелизовать аналогичным образом, выполняя одно линейное преобразование для всех голов параллельно, а затем преобразуя запросы, ключи и значения для каждой головы в тензоры размерности $n \times k \times d/k$. Операции на уровне токенов, следующие за многоголовым вниманием, не зависят от других токенов и тривиально параллелизуемы.

Напротив, GNN обычно выполняют разреженную передачу сообщений по локально связанным структурам, что значительно менее эффективно на текущих GPU для типичных масштабов задач (за исключением очень разреженных или миллиардных графов). Это требует поддержания индекса соседей для каждого узла и выполнения операций сбора и рассеивания для распространения сообщений [Fey and Lenssen, 2019]. В результате, GNN на порядки медленнее обучать и сложно масштабировать по сравнению со стандартными трансформерами на текущем оборудовании.

Кроме того, с растущим акцентом на масштабирование моделей и наборов данных, существуют эмпирические доказательства того, что трансформеры могут обучаться индуктивным смещениям, заложенным в GNN, таким как локальность, при обучении в достаточном масштабе. Это особенно эффективно, когда моделям предоставляются соответствующие позиционные кодировки в качестве «подсказок» о лежащей в основе структуре входных данных, не навязывая их как жёсткие ограничения в архитектуре [Jaegle et al., 2021]. Выразительность и гибкость трансформеров делает их предпочтительной архитектурой для обучения представлений на структурированных данных в различных прикладных областях, включая графы.

Таким образом, трансформеры — это графовые нейронные сети, которым в данный момент посчастливилось выиграть в аппаратной лотерее.

Благодарности. Я благодарен многочисленным коллегам за отзывы по этой статье на протяжении многих лет, которые помогли сформировать моё понимание трансформеров и GNN. Я также хотел бы поблагодарить The Gradient за предоставление платформы для публикации первоначальной версии этой работы.

Список литературы

  1. J. Achiam, S. Adler, S. Agarwal, L. Ahmad, I. Akkaya, F. L. Aleman, D. Almeida, J. Altenschmidt, et al. Gpt-4 technical report. arXiv preprint arXiv:2303.08774, 2023. (Cited on page 2)
  2. J. L. Ba, J. R. Kiros, and G. E. Hinton. Layer normalization. arXiv preprint arXiv:1607.06450, 2016. (Cited on page 4)
  3. D. Bahdanau, K. Cho, and Y. Bengio. Neural machine translation by jointly learning to align and translate. In ICLR, 2015. (Cited on page 1)
  4. P. W. Battaglia, J. B. Hamrick, V. Bapst, A. Sanchez-Gonzalez, V. Zambaldi, et al. Relational inductive biases, deep learning, and graph networks. arXiv preprint, 2018. (Cited on page 5)
  5. S. Batzner, A. Musaelian, L. Sun, M. Geiger, J. P. Mailoa, M. Kornbluth, N. Molinari, T. E. Smidt, and B. Kozinsky. E (3)-equivariant graph neural networks for data-efficient and accurate interatomic potentials. Nature communications, 2022. (Cited on page 5)
  6. R. Bommasani, D. A. Hudson, E. Adeli, R. Altman, S. Arora, S. von Arx, M. S. Bernstein, J. Bohg, A. Bosselut, E. Brunskill, E. Brynjolfsson, et al. On the opportunities and risks of foundation models. ArXiv, 2021. (Cited on page 4)
  7. M. M. Bronstein, J. Bruna, T. Cohen, and P. Veličković. Geometric deep learning: Grids, groups, graphs, geodesics, and gauges. arXiv preprint, 2021. (Cited on page 5)
  8. A. Derrow-Pinion, J. She, D. Wong, O. Lange, T. Hester, L. Perez, M. Nunkesser, S. Lee, X. Guo, B. Wiltshire, et al. Eta prediction with graph neural networks in google maps. In Proceedings of the 30th ACM international conference on information & knowledge management, 2021. (Cited on page 5)
  9. F. Di Giovanni, L. Giusti, F. Barbero, G. Luise, P. Lio, and M. M. Bronstein. On over-squashing in message passing neural networks: The impact of width, depth, and topology. In International Conference on Machine Learning. PMLR, 2023. (Cited on page 7)
  10. J. Dong, B. Feng, D. Guessous, Y. Liang, and H. He. Flex attention: A programming model for generating optimized attention kernels. arXiv preprint arXiv:2412.05496, 2024. (Cited on page 7)
  11. A. Dosovitskiy, L. Beyer, A. Kolesnikov, D. Weissenborn, X. Zhai, T. Unterthiner, M. Dehghani, M. Minderer, G. Heigold, S. Gelly, et al. An image is worth 16x16 words: Transformers for image recognition at scale. In International Conference on Learning Representations, ICLR, 2021. (Cited on page 2)
  12. V. P. Dwivedi and X. Bresson. A generalization of transformer networks to graphs. arXiv preprint arXiv:2012.09699, 2020. (Cited on page 7)
  13. M. Fey and J. E. Lenssen. Fast graph representation learning with PyTorch Geometric. In ICLR Workshop on Representation Learning on Graphs and Manifolds, 2019. (Cited on page 7)
  14. J. Gilmer, S. S. Schoenholz, P. F. Riley, O. Vinyals, and G. E. Dahl. Neural message passing for quantum chemistry. In ICML, 2017. (Cited on page 5)
  15. X. Glorot, A. Bordes, and Y. Bengio. Deep sparse rectifier neural networks. In Proceedings of the fourteenth international conference on artificial intelligence and statistics, 2011. (Cited on page 4)
  16. A. Graves. Generating sequences with recurrent neural networks. arXiv preprint arXiv:1308.0850, 2013. (Cited on page 1)
  17. K. He, X. Zhang, S. Ren, and J. Sun. Deep residual learning for image recognition. In Proceedings of the IEEE conference on computer vision and pattern recognition, pages 770–778, 2016. (Cited on page 4)
  18. S. Hochreiter and J. Schmidhuber. Long short-term memory. Neural computation, 1997. (Cited on page 1)
  19. S. Hooker. The hardware lottery. Communications of the ACM, 2021. (Cited on page 7)
  20. A. Jaegle, S. Borgeaud, J.-B. Alayrac, C. Doersch, C. Ionescu, D. Ding, S. Koppula, D. Zoran, A. Brock, E. Shelhamer, et al. Perceiver io: A general architecture for structured inputs & outputs. arXiv preprint arXiv:2107.14795, 2021. (Cited on page 7)
  21. C. Joshi. Transformers are graph neural networks. The Gradient, 2020. URL https://thegradi ent.pub/transformers-are-gaph-neural-networks/. (Cited on page 1)
  22. J. Jumper, R. Evans, A. Pritzel, T. Green, M. Figurnov, O. Ronneberger, et al. Highly accurate protein structure prediction with alphafold. Nature, 2021. (Cited on page 7)
  23. T. N. Kipf and M. Welling. Semi-supervised classification with graph convolutional networks. In ICLR, 2017. (Cited on page 5)
  24. T. Mikolov, I. Sutskever, K. Chen, G. S. Corrado, and J. Dean. Distributed representations of words and phrases and their compositionality. Advances in neural information processing systems, 2013. (Cited on page 2)
  25. C. Olah. Deep learning, NLP, and representations. Christopher Olah's Blog, 2014. URL https: //colah.github.io/posts/2014-07-NLP-RNNs-Representations/. (Cited on page 1)
  26. A. Radford, J. Wu, R. Child, D. Luan, D. Amodei, and I. Sutskever. Language models are unsupervised multitask learners. OpenAI, 2019. (Cited on page 1)
  27. A. Radford, J. W. Kim, T. Xu, G. Brockman, C. Mcleavey, and I. Sutskever. Robust speech recognition via large-scale weak supervision. In International Conference on Machine Learning, 2023. (Cited on page 2)
  28. C. Raffel, N. Shazeer, A. Roberts, K. Lee, S. Narang, M. Matena, Y. Zhou, W. Li, and P. J. Liu. Exploring the limits of transfer learning with a unified text-to-text transformer. Journal of machine learning research, 2020. (Cited on page 1)
  29. L. Rampášek, M. Galkin, V. P. Dwivedi, A. T. Luu, G. Wolf, and D. Beaini. Recipe for a general, powerful, scalable graph transformer. Advances in Neural Information Processing Systems, 2022. (Cited on page 7)
  30. N. Shazeer. Glu variants improve transformer. arXiv preprint arXiv:2002.05202, 2020. (Cited on page 4)
  31. J. M. Stokes, K. Yang, K. Swanson, W. Jin, A. Cubillos-Ruiz, N. M. Donghia, C. R. MacNair, S. French, L. A. Carfrae, Z. Bloom-Ackermann, et al. A deep learning approach to antibiotic discovery. Cell, 2020. (Cited on page 5)
  32. I. Sutskever, O. Vinyals, and Q. V. Le. Sequence to sequence learning with neural networks. In Advances in neural information processing systems, 2014. (Cited on page 1)
  33. R. Sutton. The bitter lesson. Incomplete Ideas (blog), 2019. (Cited on page 7)
  34. A. Vaswani, N. Shazeer, N. Parmar, J. Uszkoreit, L. Jones, A. N. Gomez, L. Kaiser, and I. Polosukhin. Attention is all you need. In Advances in neural information processing systems, 2017. (Cited on page 2)
  35. P. Veličković, G. Cucurull, A. Casanova, A. Romero, P. Liò, and Y. Bengio. Graph Attention Networks. ICLR, 2018. (Cited on page 6)
  36. L. Weng. Attention? attention! Lil'Log, 2018. URL http://lilianweng.github.io/lil-log /2018/06/24/attention-attention.html. (Cited on page 2)
  37. R. Xiong, Y. Yang, D. He, K. Zheng, S. Zheng, C. Xing, H. Zhang, Y. Lan, L. Wang, and T. Liu. On layer normalization in the transformer architecture. In International conference on machine learning, 2020. (Cited on page 4)
  38. K. Xu, W. Hu, J. Leskovec, and S. Jegelka. How powerful are graph neural networks? In ICLR, 2019. (Cited on page 5)
  39. R. Ying, R. He, K. Chen, P. Eksombatchai, W. L. Hamilton, and J. Leskovec. Graph convolutional neural networks for web-scale recommender systems. In Proceedings of the 24th ACM SIGKDD international conference on knowledge discovery & data mining, 2018. (Cited on page 5)