Назад в библиотеку

TART: Токен-ориентированный архитектурный трансформер для прогнозирования производительности нейронных сетей

Автор: Яннис Ю. Хэ

Источник: Yannis Y. He. TART: Token-based Architecture Transformer for Neural Network Performance Prediction [Электронный ресурс] – Режим доступа: https://arxiv.org/abs/2501.02007 – Загл. с экрана.

Аннотация:

В области проектирования нейронных архитектур достижение высокой производительности в значительной степени зависит от ручного опыта исследователей. Несмотря на появление поиска нейронных архитектур (Neural Architecture Search, NAS) как перспективной техники для автоматизации этого процесса, современные методы NAS по-прежнему требуют вмешательства человека для расширения пространства поиска и не могут генерировать новые архитектуры. В данной статье изучается потенциал трансформеров в понимании нейронных архитектур и их производительности с целью заложить основу для использования трансформеров для генерации новых сетей. Мы предлагаем токен-ориентированный архитектурный трансформер (Token-based Architecture Transformer, TART), который прогнозирует производительность нейронных сетей без необходимости обучения кандидатных сетей. TART достигает передовых результатов на наборе данных DeepNets-1M для задач прогнозирования производительности без информации о ребрах, что указывает на потенциал трансформеров в содействии открытию новых и высокопроизводительных нейронных архитектур.

1 Введение

Ручной опыт исследователей часто является ключом к достижению высокой производительности при проектировании нейронных архитектур, включая такие метрики, как точность, справедливость, устойчивость, калибровка, интерпретируемость, задержка и потребление памяти [1]. Однако этот подход ограничен предыдущим опытом исследователя и предполагает ручной метод проб и ошибок.

Поиск нейронных архитектур (Neural Architecture Search, NAS) направлен на автоматизацию обнаружения высокопроизводительных нейронных архитектур при минимальном вмешательстве человека [2]. Традиционные методы NAS часто используют ориентированные ациклические графы (DAG) [3] или последовательность операторов [4] для представления нейронной архитектуры. Однако сильные возможности обработки токенов у трансформеров [5] дают основание представлять нейронные архитектуры в виде токенов. Более того, трансформеры показали многообещающие результаты в обучении на графах [6], а также в понимании контента на основе токенов, такого как тексты [7] и музыкальные ноты [8]. Хотя предыдущие исследования показали, что токен-ориентированное представление графов может достичь передовых результатов в генерации структур химических соединений [9], насколько нам известно, комплексных исследований по применению трансформеров для понимания токен-ориентированного представления нейронных архитектур не проводилось.

Большинство алгоритмов NAS следуют типичному процессу поиска (Рисунок 1). Шаг 1) Определение пространства поиска: для заданной задачи исследователи вручную выбирают кандидатные сети из всех существующих архитектур для формирования пула моделей, также известного как область поиска. Сюда могут входить тип и количество слоев, тип функций активации, количество нейронов в каждом слое и другие гиперпараметры архитектуры. Шаг 2) Выбор кандидатной сети: существуют различные стратегии исследования области поиска, такие как случайный поиск, эволюционные алгоритмы, обучение с подкреплением и методы оптимизации на основе градиентов. Шаг 3) Обучение и оценка кандидатных архитектур: каждая архитектура обучается на подмножестве обучающих данных и оценивается на валидационном наборе. Метрикой оценки могут быть точность, функция потерь, F1-мера или любая другая метрика, измеряющая производительность модели для конкретной задачи. Шаг 4) Обновление стратегии поиска: на основе производительности кандидатных архитектур стратегия поиска обновляется для изучения более перспективных областей пространства поиска. Шаг 5) Повторение шагов 2-4: процесс поиска, обучения, оценки и обновления стратегии поиска повторяется до тех пор, пока не будет найдена лучшая архитектура или не будет достигнуто условие остановки.

Текущий процесс поиска нейронных архитектур
Рисунок 1 – Текущий процесс поиска нейронных архитектур

Мотивация. У текущего процесса NAS есть два основных недостатка: 1) высокая стоимость поиска и 2) субоптимальные результаты поиска. Несмотря на улучшения по сравнению с традиционным методом проб и ошибок, обучение огромного количества возможных архитектур в области поиска перед оценкой производительности требует значительных временных и вычислительных ресурсов. Более того, подбор существующей модели, разработанной для другой задачи или набора данных, может оказаться неподходящим для новой задачи. Современные подходы NAS по-прежнему полагаются на ручную работу для расширения области поиска и не обладают возможностью генерировать совершенно новые архитектуры.

Данное исследование направлено на снижение вычислительной стоимости поиска нейронных архитектур с помощью прогностической модели, которая оценивает производительность новых, невидимых ранее кандидатных архитектур без фактического их обучения; тем самым устраняя трудоемкий процесс обучения и оценки, который обычно является узким местом в процессе поиска. Дополнительно мы исследуем потенциал трансформеров [5] в изучении производительности модели, закладывая тем самым основу для использования трансформеров для создания новых сетей.

Вклад. Наш вклад можно резюмировать следующим образом:

• Мы предлагаем новый подход к прогнозированию производительности нейронных сетей, называемый TART (Token-based Architecture Transformer). Насколько нам известно, наша исследовательская группа первой изучает потенциал трансформеров в понимании производительности архитектур путём преобразования нейронных сетей из вычислительных графов в токены.

• Мы достигаем передовых результатов на наборе данных DeepNets-1M [10] для задач прогнозирования производительности без использования информации о рёбрах.

• Наши результаты демонстрируют, что токенизация нейронных архитектур повышает способность трансформеров глубже понимать производительность модели, что закладывает основу для будущих исследований по использованию трансформеров для генерации новых нейронных архитектур для ещё не возникших задач.

2 Предыстория

В данном разделе мы кратко рассматриваем исследования в области поиска нейронных архитектур (NAS) и предсказания параметров. Также обсуждаем представление нейронных архитектур в виде графов и представление графов в виде токенов, которые являются ключевыми промежуточными этапами нашей работы. Хотя фокус данного исследования не охватывает этап генерации архитектур, краткий обзор генеративных моделей на основе трансформеров включён для контекстуализации мотивов нашего исследования трансформеров.

2.1 Поиск нейронных архитектур

NAS направлен на создание нейронной архитектуры, максимизирующей производительность при минимальном участии человека в автоматическом режиме. Многие алгоритмы поиска архитектур вычислительно затратны из-за большого количества оценок архитектур. Вherentная причина неэффективности этих подходов заключается в том, что поиск архитектур рассматривается как задача чёрного ящика над дискретной областью. DARTS [11] был создан для смягчения пространства поиска до непрерывного, что позволяет оптимизировать архитектуру относительно её производительности на валидационном наборе с помощью градиентного спуска. Эффективность данных при градиентной оптимизации, в отличие от неэффективного поиска чёрного ящика, позволяет DARTS достигать конкурентоспособной производительности с использованием вычислительных ресурсов на несколько порядков меньше. NAO [12] использует аналогичный подход, преобразуя нейронные сети в непрерывные эмбеддинги. После того как энкодер отображает дискретную нейронную архитектуру в непрерывное представление, предиктор производительности становится целью оптимизации градиентного подъёма. Непрерывное представление лучшей нейронной архитектуры может быть получено путём максимизации выхода предиктора производительности. Наконец, декодер применяется для преобразования непрерывного представления обратно в конечную дискретную архитектуру. Хотя было проведено множество исследований для улучшения процесса поиска архитектур, вычислительным узким местом NAS остаётся обучение каждой кандидатной архитектуры до сходимости. Вместо того чтобы отбрасывать веса дочерней модели после каждого измерения производительности, ENAS [13] заставляет все дочерние модели разделять веса, чтобы избежать обучения каждой дочерней модели с нуля. Хотя стратегия разделения весов быстро получила признание многих исследователей [14, 15, 16] из-за своей эффективности, согласно недавним исследованиям [17], эта стратегия может привести к некорректной оценке кандидатных архитектур и сложностям в оптимизации.

2.2 Предсказание параметров и производительности

Альтернативный подход для избежания обучения каждой кандидатной архитектуры — использование предсказания параметров. Knyazev et al. [10] предложили фреймворк, способный предсказывать параметры для разнообразных и масштабных архитектур за один проход вперёд за доли секунды с помощью гиперсетей на графах. Наряду с предсказанием параметров, другой подход для обхода узкого места в обучении — использование предсказания производительности. White et al. [18] проанализировали 31 предиктор производительности, варьирующихся от экстраполяции кривых обучения до разделения весов, обучения с учителем и прокси-методов с нулевой стоимостью в четырёх различных пространствах поиска. Хотя большинство предикторов специфичны для предметной области, исследование даёт рекомендации по выбору предикторов производительности при различных временных ограничениях. Wei et al. [19] предложили фреймворк Neural Predictor, способный предсказывать такие свойства, как точность, скорость инференса и скорость сходимости, для невидимой архитектуры и набора данных. Эти подходы имеют потенциал значительно снизить вычислительную стоимость NAS и позволить применять более креативные методы поиска.

2.3 Графовое представление нейронных архитектур

Граф является широко используемой структурой данных в различных областях. По мере развития глубокого обучения было проведено множество исследований по представлению нейронных сетей с использованием графовых структур. Thost et al. [20] подтвердили эффективность представления нейронных сетей в виде ориентированных ациклических графов, которые широко применялись во многих фреймворках NAS [10, 11, 21]. В NAS существует два типа графового представления: узлово-ориентированное представление [10, 13, 21] и рёберно-ориентированное представление [22, 11]. В узлово-ориентированном представлении узлы обозначают операции (такие как свёртка, пулинг), а рёбра представляют соединения между операциями, то есть поток прямого распространения; тогда как в рёберно-ориентированном представлении каждый узел является латентным представлением (например, картой признаков в свёрточных сетях), а каждое направленное ребро связано с некоторыми операциями.

Мы следуем узлово-ориентированному представлению из [21] и определяем направленный ациклический вычислительный граф как $A = (V, E)$, где каждый узел $v \in V$ имеет связанный вычислительный оператор $f_v$, параметризованный $w_v$, который производит тензор активации выхода $x_v$. Рёбра $e_{u \to v} = (u, v) \in E$ представляют поток тензоров активации от узла $u$ к узлу $v$. $x_v$ вычисляется путём применения связанного вычислительного оператора к каждому из его входов с последующим суммированием:

$$x_v = \sum_{e_{u \to v} \in E} f_v(x_u; w_v), \quad \forall v \in V$$ (1)

Графовое представление позволяет моделям, таким как GNN [23], изучать графовые структуры для различных наборов данных. Кроме того, графовое представление нейронных сетей предоставляет возможности для использования графовых токенизаторов с целью представления нейронной архитектуры в виде токенов.

2.4 Токенное представление графов

Для использования преимуществ трансформеров, включая их прогностические и генеративные возможности, а также потенциал понимания связей между компонентами, мы изучили концепцию представления графа в виде последовательности токенов. Krenn et al. [24] предложили представление SELF-referencing embedded strings (SELFIES) для химических молекулярных структур с использованием глубокого обучения, таких как VAE [25] и GAN [26], и продемонстрировали надёжность токен-ориентированного представления. Кроме того, Kim et al. [27] предложили токенизированный графовый трансформер (TokenGT), который изучает химические структуры как графы в токенном представлении с помощью стандартных трансформеров без модификаций, специфичных для графов. В их исследованиях узлы и рёбра графа рассматриваются как независимые токены. Чтобы избежать потери информации о связности графа, они дополняют токены ортонормальными идентификаторами узлов и обучаемыми типовыми идентификаторами и доказывают, что их подход как минимум так же выразителен, как инвариантная графовая сеть [28], что лучше, чем графовые нейронные сети (GNN) [23]. В TokenGT обсуждаются два конкретных метода токенизации: ортогональные случайные признаки (ORF) и собственные векторы лапласиана (LAP). ORF инициализирует случайную ортогональную матрицу через QR-разложение случайной гауссовой матрицы. Этот подход требует от трансформера распознавания графовой структуры из информации о связности, предоставляемой идентификаторами узлов, что было доказано в TokenGT как достижимое. LAP использует собственные векторы лапласиана, выполняя собственное разложение матрицы смежности.

Наше исследование использует токенизацию LAP, представленную в TokenGT. Наше решение основано на двух основных соображениях. Во-первых, LAP показала превосходную производительность по сравнению с токенизацией ORF в экспериментальном анализе TokenGT. Во-вторых, процесс инициализации ORF, следующий нормальному распределению, сталкивается с проблемами при работе с разреженными матрицами, так как множество признаков могут быть инициализированы нулями. Следовательно, сходимость сложнее достичь при использовании ORF по сравнению с LAP.

2.5 Генеративные модели на основе трансформеров

Трансформер [5] известен своими генеративными возможностями [29] в различных областях [30, 31, 32]. В области генерации графов, помимо исследований, упомянутых в разделе 2.4, Khajenezhad et al. разработали Gransformer [33], который расширяет базовый автогрессивный энкодер трансформера для использования структурной информации заданного графа. Механизм внимания модифицирован для учёта существования или отсутствия соединений между каждой парой узлов. В области генерации токенов Zeng et al. [34] предложили подход к синтезу изображений, рассматривая его как задачу генерации визуальных токенов, и представили TokenGAN, способный контролировать синтез изображений путём присвоения стилей контент-токенам через механизм внимания с помощью трансформера.

3 Метод

Предлагаемая нами архитектура TART (Рисунок 2) состоит из трёх основных этапов: 1) токенизация, 2) обучение трансформера и 3) прогнозирование. Наша основная цель при формировании этой структуры — не оптимизация прогностической способности, а демонстрация двух ключевых задач: 1) что трансформеры могут эффективно изучать производительность модели и 2) что токенизаторы могут улучшать обучающие возможности трансформеров. Поэтому мы намеренно сохранили дизайн каждого модуля согласованным с соответствующими работами без каких-либо модификаций для задачи прогнозирования, чтобы обеспечить справедливое сравнение.

Архитектура TART
Рисунок 2 – TART является сквозным нейронным предиктором и включает три основных этапа: 1) этап токенизации, 2) этап обучения трансформера и 3) этап прогнозирования.

Как обсуждалось в предыдущем разделе, мы создаём наш токенизатор с использованием метода LAP из TokenGT [27] для преобразования нейронной архитектуры из графового представления в лапласианов токен. Токен представляет собой матрицу размером $(N + M) \times (d_f + 2d_p + 4)$, где $N$ — максимальное количество узлов, $M$ — максимальное количество рёбер, $d_f$ — размерность признаков, а $d_p$ — размерность собственных векторов лапласиана по нашему выбору. Вместо представления признаков узла с использованием однократного кодирования (one-hot encoding), как в наборе данных DeepNets-1M (который будет представлен в разделе 4.1), мы выбираем $d_f = 1$ и представляем различные признаки с помощью одного числа для уменьшения размера токена. Мы также выбираем $d_p = 3$ для согласования с TokenGT. Для построения токена нам необходима информация об узлах и рёбрах. Матрица смежности предоставляется для определения соединений, а также предоставляется матрица признаков узлов размером $N \times 15$ с однократным кодированием, где 15 — размер каждого представления признаков узла в наборе данных DeepNets-1M. Конкретно в наборе данных DeepNets-1M наш токенизатор эффективно сокращает размер входных данных с примерно 370 тыс. параметров до около 39 тыс.

В лапласиановом токене каждая строка может быть описана в трёх частях: первые $d_f$ элементов — это признаки узла или ребра. В нашем случае и узлы, и рёбра имеют $d_f = 1$. После признаков вторая часть токена — две строки из $P$, соединённые горизонтально, где $P \in \mathbb{R}^{N \times d_p}$ получается путём вычисления собственных векторов лапласиана из матрицы смежности графа. $d_p$ — размерность собственных значений по нашему выбору, мы задаём $d_p = 3$. Для каждого ребра $(u, v)$ $P[u]$ соединяется с $P[v]$; для каждого узла $n$ $P[n]$ соединяется с самим собой для соответствия размеру $P[v]$. Наконец, последние 4 элемента — это идентификатор узла/ребра. Первые 2 элемента из этих 4 — однократное кодирование того, представляет ли строка ребро или узел, где $[0, 1]$ обозначает узел, а $[1, 0]$ — ребро; последние 2 элемента в основном используются для идентификации ребра, где $[-1, -1]$ используется для всех узлов как заполнители, а $[u, v]$ — для каждого ребра $(u, v)$.

Мы выбираем дизайн нашего модуля трансформера таким же, как у энкодера трансформера в работе Kim et al. [27]. Конкретно мы используем исключительно энкодерную часть трансформера, поскольку наше исследование направлено не на генерацию сетей, в отличие от классической структуры энкодер-декодер, предложенной Vaswani et al. [5]. Чтобы продемонстрировать потенциал трансформера в изучении нейронных архитектур, мы просто добавили полносвязный слой после энкодера, который отображает размерности выхода трансформера в одно числовое значение, представляющее прогноз производительности.

4 Эксперименты и результаты

4.1 Наборы данных: DeepNets-1M

Предлагаемый предиктор оценивается на наборе данных DeepNets-1M [10] для сравнения с базовым методом [19]. Набор данных DeepNets-1M (рисунок 3) состоит из архитектур нейронных сетей, представленных в виде графов, где узлы – это операции (свёртка, пулинг и т.д.), а рёбра соответствуют потоку данных прямого распространения через сеть. Хотя набор данных включает 1 миллион нейронных архитектур, только 1000 из них имеют метки производительности. Следовательно, мы ограничили наши обучающие и тестовые выборки этими 1000 архитектурами, используя 500 для обучения и оставшиеся 500 для тестирования. Метки производительности для каждой из 1000 сетей были получены путём их обучения и оценки на наборе данных CIFAR-10 [35]. Конкретно, Knyazev et al. [10] измерили точность каждой сети на чистых и зашумлённых изображениях, а также время инференса и время сходимости.

Примеры вычислительных графов
Рисунок 3 – Примеры вычислительных графов (визуализировано с использованием NetworkX [36]). В визуализированных графах узел представляет одну из 15 примитивных операций, закодированных маркерами, показанными внизу, отсортированных по частоте в обучающем наборе.
Таблица 1 – Корреляция Кендалла-Тау между предсказанной и измеренной производительностью на CIFAR-10. Каждое измерение рассчитано как среднее по 5 испытаниям с разными случайными инициализациями. Из-за ограничений вычислительных ресурсов мы не смогли обучить TART более 30 эпох. Поэтому мы также обучили чистый трансформер на 30 эпох для сравнения эффекта токенизатора.
Метод n_layer Кол-во эпох Использовать признаки рёбер Корреляция Кендалла-Тау
Точность на чистых изображениях Точность на зашумлённых изображениях Скорость инференса Скорость сходимости
Neural Predictor N/A 300 True 0.482 0.451 0.695 0.395
pure-Transformer 6 150 False 0.494 0.458 0.911 0.494
pure-Transformer 6 300 False 0.515 0.471 0.912 0.515
pure-Transformer 12 300 False 0.544 0.463 0.913 0.544
pure-Transformer 6 30 False 0.210 0.137 0.893 0.210
Tokenized Architecture Transformer (TART) 6 30 True 0.266 0.307 0.885 0.266

4.2 Дизайн эксперимента

Экспериментальный процесс включает следующие шаги: Во-первых, предиктор обучается на 500 образцах обучающей выборки из набора данных DeepNets-1M, чтобы изучить взаимосвязь между нейронными архитектурами и их производительностью. Во-вторых, обученный предиктор принимает 500 невидимых и необученных архитектур из тестовой выборки и прогнозирует их производительность. Затем прогнозируемая производительность сравнивается с истинной производительностью, которая оценивается непосредственно после обучения архитектуры на наборе данных CIFAR-10. Корреляция Кендалла-Тау [37] используется в качестве метрики для оценки эффективности предиктора.

С учётом нашей цели мы разработали два набора экспериментов, описанных в разделах 4.3 и 4.4. Все результаты представлены в таблице 1.

4.3 Эксперимент 1: Предиктор на основе чистого трансформера

Чтобы исследовать, могут ли трансформеры изучать производительность нейронных архитектур, мы провели эксперимент, в котором обучали базовый энкодер трансформера. Поскольку нет очевидного способа объединить и закодировать признаки узлов и рёбер без использования токенизаторов, трансформер был разработан для приёма только признаков узлов без использования информации из матрицы смежности.

Корреляция предсказанной и истинной производительности
Рисунок 4 – Измерение корреляции между предсказанной и истинной производительностью моделей на CIFAR-10
Анализ переобучения
Рисунок 5 – Несмотря на то что мы были вынуждены прекратить обучение из-за ограниченных вычислительных ресурсов, наш анализ линейной регрессии роста производительности показывает, что предиктор ещё не переобучился на данные.

Результаты предикторов на основе чистого трансформера (рисунок 4) демонстрируют эффективность трансформеров. Несмотря на использование только признаков узлов и отсутствие информации из матрицы смежности, все трансформеры показали более высокую прогностическую способность, чем базовый метод Neural Predictor [19], который использует как признаки рёбер, так и узлов.

Хотя мы были вынуждены прекратить дальнейшее обучение чистого трансформера из-за ограниченных вычислительных ресурсов, мы также заметили, что трансформер ещё не переобучился (рисунок 5). Это предполагает, что мы можем достичь более высокой производительности даже без внесения каких-либо модификаций в трансформер, специально предназначенных для этой задачи прогнозирования.

4.4 Эксперимент 2: Предиктор на основе токенизированного трансформера

Чтобы исследовать, могут ли токенизаторы улучшить производительность трансформера, мы обучили полную архитектуру TART и сравнили её производительность с чистым трансформером. Наш эмпирический анализ (рисунок 6) демонстрирует эффективность включения токенизатора в обучение предикторов на основе трансформеров. Учитывая ограниченные вычислительные ресурсы, мы смогли обучить модель TART только на 30 эпохах. Для обеспечения справедливого сравнения мы оценивали её производительность по сравнению с чистым трансформером, также обученным на 30 эпохах.

Сравнение производительности с/без токенизатора
Рисунок 6 – Прогнозирование производительности трансформера с/без токенизатора. Оценка проводилась на 30 эпохах.

Сравнивая производительность нашей архитектуры TART с моделью чистого трансформера, мы подтверждаем положительное влияние токенизации на улучшение способности трансформера захватывать взаимосвязь между нейронными архитектурами и их соответствующей производительностью. Это в некоторой степени ожидаемо, поскольку процесс токенизации кодирует соединения, которые можно рассматривать как обобщение синусоидальных позиционных эмбеддингов трансформеров.

5 Заключение и направления будущих исследований

В данной статье мы предлагаем TART (Token-based Architecture Transformer) — новый подход к прогнозированию производительности нейронных сетей. Насколько нам известно, мы первыми исследуем потенциал трансформеров в изучении производительности архитектур путём преобразования нейронных сетей в токены. Наш подход достигает передовых результатов на наборе данных DeepNets-1M для задач прогнозирования производительности без использования информации о рёбрах.

Наши результаты демонстрируют, что токенизация нейронных архитектур повышает способность трансформеров глубже понимать производительность моделей. Это закладывает основу для будущих исследований, использующих трансформеры для генерации новых нейронных архитектур для задач, которые ещё предстоит решить. Наш подход предлагает альтернативу традиционным методам прогнозирования производительности нейронных сетей и открывает новые направления для будущих исследований.

В будущем мы планируем изучить несколько направлений для улучшения нашего подхода TART. • Во-первых, мы исследуем способы ускорения процесса обучения TART. Узкое место находится в процессе токенизации. Преобразование признаков рёбер из матрицы смежности в настоящее время выполняется с помощью однопоточного цикла for. Одним из возможных решений является предварительная обработка входных данных и векторизация процесса токенизации, что в данный момент не реализовано. Дополнительно мы планируем изучить использование многопоточных токенизаторов и увеличение времени обучения как для токенизатора, так и для трансформера.

• Во-вторых, мы планируем выполнить тонкую настройку трансформера и токенизатора, экспериментируя с различными гиперпараметрами и архитектурами для дальнейшего повышения производительности нашего предиктора.

• В-третьих, мы также исследуем, как наш подход может быть применён к задаче генерации нейронных сетей. Обучая трансформер понимать взаимосвязь между архитектурой и производительностью, мы сможем генерировать новые нейронные архитектуры, демонстрирующие лучшую производительность для конкретных задач.

В целом, наша работа демонстрирует потенциал использования трансформеров и методов токенизации в области поиска нейронных архитектур и прогнозирования производительности. Мы считаем, что дальнейшие исследования в этой области могут привести к значительным достижениям в разработке более эффективных и производительных нейронных сетей для различных приложений.

Список литературы

  1. Frank Hutter. Automl: Towards deep learning 2.0.
  2. Pengzhen Ren, Yun Xiao, Xiaojun Chang, Po-Yao Huang, Zhihui Li, Xiaojiang Chen, and Xin Wang. A comprehensive survey of neural architecture search: Challenges and solutions, Mar 2021.
  3. Hanxiao Liu, Karen Simonyan, and Yiming Yang. Darts: Differentiable architecture search, Apr 2019.
  4. Renqian Luo, Fei Tian, Tao Qin, Enhong Chen, and Tie-Yan Liu. Neural architecture optimization, Sep 2019.
  5. Ashish Vaswani, Noam Shazeer, Niki Parmar, Jakob Uszkoreit, Llion Jones, Aidan N. Gomez, Lukasz Kaiser, and Illia Polosukhin. Attention is all you need, Dec 2017.
  6. Jinwoo Kim, Tien Dat Nguyen, Seonwoo Min, Sungjun Cho, Moontae Lee, Honglak Lee, and Seunghoon Hong. Pure transformers are powerful graph learners, Oct 2022.
  7. Hanqing Zhang, Haolin Song, Shaoyu Li, Ming Zhou, and Dawei Song. A survey of controllable text generation using transformer-based pre-trained language models, Jan 2022.
  8. Cheng-Zhi Anna Huang, Ashish Vaswani, Jakob Uszkoreit, Noam Shazeer, Ian Simon, Curtis Hawthorne, Andrew M. Dai, Matthew D. Hoffman, Monica Dinculescu, Douglas Eck, and et al. Music transformer, Dec 2018.
  9. Mario Krenn, Florian Häse, AkshatKumar Nigam, Pascal Friederich, and Alán Aspuru-Guzik. Self-referencing embedded strings (selfies): A 100% robust molecular string representation, Mar 2020.
  10. Boris Knyazev, Michal Drozdzal, Graham W. Taylor, and Adriana Romero-Soriano. Parameter prediction for unseen deep architectures, Oct 2021.
  11. Hanxiao Liu, Karen Simonyan, and Yiming Yang. Darts: Differentiable architecture search, 2018.
  12. Renqian Luo, Fei Tian, Tao Qin, Enhong Chen, and Tie-Yan Liu. Neural architecture optimization, 2018.
  13. Hieu Pham, Melody Y. Guan, Barret Zoph, Quoc V. Le, and Jeff Dean. Efficient neural architecture search via parameter sharing, 2018.
  14. Andrew Brock, Theodore Lim, J. M. Ritchie, and Nick Weston. Smash: One-shot model architecture search through hypernetworks, 2017.
  15. Xinyu Gong, Shiyu Chang, Yifan Jiang, and Zhangyang Wang. Autogan: Neural architecture search for generative adversarial networks, 2019.
  16. Ramakanth Pasunuru and Mohit Bansal. Continual and multi-task architecture search, 2019.
  17. Kaicheng Yu, Christian Sciuto, Martin Jaggi, Claudiu Musat, and Mathieu Salzmann. Evaluating the search phase of neural architecture search, 2019.
  18. Colin White, Arber Zela, Binxin Ru, Yang Liu, and Frank Hutter. How powerful are performance predictors in neural architecture search?, 2021.
  19. Wei Wen, Hanxiao Liu, Hai Li, Yiran Chen, Gabriel Bender, and Pieter-Jan Kindermans. Neural predictor for neural architecture search, 2019.
  20. Veronika Thost and Jie Chen. Directed acyclic graph neural networks, 2021.
  21. Chris Zhang, Mengye Ren, and Raquel Urtasun. Graph hypernetworks for neural architecture search, 2018.
  22. Yijian Qin, Ziwei Zhang, Xin Wang, Zeyang Zhang, and Wenwu Zhu. Nas-bench-graph: Benchmarking graph neural architecture search, 2022.
  23. Jie Zhou, Ganqu Cui, Shengding Hu, Zhengyan Zhang, Cheng Yang, Zhiyuan Liu, Lifeng Wang, Changcheng Li, and Maosong Sun. Graph neural networks: A review of methods and applications, 2018.
  24. Mario Krenn, Florian Häse, AkshatKumar Nigam, Pascal Friederich, and Alan Aspuru-Guzik. Self-referencing embedded strings (SELFIES): A 100% robust molecular string representation. Machine Learning: Science and Technology, 1(4):045024, oct 2020.
  25. Diederik P Kingma and Max Welling. Auto-encoding variational bayes, 2013.
  26. Ian J. Goodfellow, Jean Pouget-Abadie, Mehdi Mirza, Bing Xu, David Warde-Farley, Sherjil Ozair, Aaron Courville, and Yoshua Bengio. Generative adversarial networks, 2014.
  27. Jinwoo Kim, Tien Dat Nguyen, Seonwoo Min, Sungjun Cho, Moontae Lee, Honglak Lee, and Seunghoon Hong. Pure transformers are powerful graph learners, 2022.
  28. Haggai Maron, Heli Ben-Hamu, Nadav Shamir, and Yaron Lipman. Invariant and equivariant graph networks, 2018.
  29. Drew A. Hudson and C. Lawrence Zitnick. Generative adversarial transformers, 2021.
  30. Yifan Jiang, Shiyu Chang, and Zhangyang Wang. Transgan: Two pure transformers can make one strong gan, and that can scale up, 2021.
  31. Rui Xu, Xiangyu Xu, Kai Chen, Bolei Zhou, and Chen Change Loy. Stransgan: An empirical study on transformer in gans, October 2021.
  32. Bowen Zhang, Shuyang Gu, Bo Zhang, Jianmin Bao, Dong Chen, Fang Wen, Yong Wang, and Baining Guo. Styleswin: Transformer-based gan for high-resolution image generation, 2021.
  33. Ahmad Khajenezhad, Seyed Ali Osia, Mahmood Karimian, and Hamid Beigy. Gransformer: Transformer-based graph generation, 2022.
  34. Yanhong Zeng, Huan Yang, Hongyang Chao, Jianbo Wang, and Jianlong Fu. Improving visual quality of image synthesis by a token-based generator with transformers, 2021.
  35. Alex Krizhevsky. Learning multiple layers of features from tiny images. Technical report, University of Toronto, 2009.
  36. Aric Hagberg, Pieter Swart, and Daniel S Chult. Exploring network structure, dynamics, and function using networkx, 1 2008.
  37. M. G. Kendall. A new measure of rank correlation. The Annals of Mathematical Statistics, 9(3):122–127, 1938.