УДК 004.8
Анализ моделей диффузии
Аннотация: В данной статье рассматривается анализ различных моделей диффузии, сосредотачиваясь на их использовании текстово-условной выборки и оценки с использованием балла контрастивного языка-образа предобучения (CLIP) в качестве метрики. Используя двунаправленные трансформаторы (BERT) и визуальные трансформеры (ViT) в рамках модели CLIP, он ключевым образом сравнивает модели, включающие блоки трансформаторов, с теми, которые этого не делают. В частности, изучается структура моделей латентной диффузии и моделей диффузионных трансформаторов, делая акцент на использовании блок-декодеров Unet и Transformer соответственно. Кроме того, исследование исследует различные запросы для создания похожих изображений, с целью оптимизировать тренировки по обусловлению для генерации текста в изображение. Кроме того, в статье исследуется эффективность модели латентной диффузии (LDM) и модели DiT в генерации объектов, анализируя их взаимодействие с текстовыми эмбеддингами и структурами запросов. Результаты подчёркивают важность структур подсказок для производительности моделей, что имеет последствия для будущих исследований мультимодальных моделей и оптимизации подсказок.
Ключевые слова: модели диффузии, интеграция трансформеров, оптимизация запросов, генерация текста в изображение.
Введение
Генеративные модели — это модели, направленные на создание распределения, похожего на распределение обучающих данных или истинное распределение. Идея генеративных моделей возникла в 1980-х годах, и её основной целью было обучение моделей без надзора, что снижает затраты на сбор данных для обучения под надзором [1]. С тех пор генеративные модели были разработаны и добиваются исключительных результатов в создании высокого разрешения, они добились выдающихся результатов в различных областях обработки изображений. Эти достижения включают синтез изображений, модификацию и даже классификацию изображений [2]. Достижение таких успехов зависит от получения репрезентативных признаков из данных, особенно в латентных диффузионных моделях, что включает извлечение скрытой информации из данных с высокой размерностью в пространствах меньшей размерности.
До появления диффузионных моделей наиболее популярными были генеративные состязательные сети (GAN) и вариационный автоэнкодер (VAE), эти два типа моделей генерации изображений уже обладали заметной производительностью при создании реалистичных изображений [3]. Внедрение диффузионной модели — генеративной модели, возникшей из вероятностной диффузии, — обладает расширенной способностью создавать более детализированные и качественные изображения [3]. Позднее более развитые модели, например модель латентной диффузии, включали автоэнкодеры и условную дискретизацию методы. Это позволяло моделям быть менее затратными на вычисления, а при этом выводы генерации стали более редактируемыми. Цель данной статьи — оценить различные модели диффузии и проанализировать их результаты [4].
С появлением трансформеров (Васвани, 2017) область машинного обучения — от обработки естественного языка до компьютерного зрения и даже подкрепляющего обучения — была революционизирована. Модель трансформатора дополнительно расширила возможности извлечения признаков [5]. В 2023 году Пибельс и Се создали новую модель диффузии, включив весь блок трансформатора в качестве основы, заменив конструкцию Unet [6]. Этот основой создаёт основу для дальнейшего развития диффузионной модели и обеспечивает лучшую способность к масштабированию. В этом исследовании автор также сравнивает эту модель DiT с LDM, на которой основан DiT. Модель предварительного обучения по контрастивному языку и образу (CLIP) — это мультимодально заранее обученная модель контрастивного обучения, которая объединяет языковой обучающий сигнал, или текстовый сигнал, и сигнал зрения для получения признаков изображения [7]. Оценка CLIP — это метрика оценки, основанная на модели CLIP. Этот балл получается сначала путем получения вложения 512-D из изображения и подсказки, генерирующего изображение, а затем, используя эти вложения для вычисления косинусного сходства, это значение сходства является баллом CLIP [8]. Эта оценка направлена на точное отображение связи между изображением и фразой, описывающей его; чем выше сходство косинуса, тем ближе связь между соответствующими парами вложения.
В данной статье рассматривается анализ различных моделей диффузии с использованием текстово-условной выборки с использованием балла CLIP в качестве метрики. Модель CLIP использует двусторонние трансформаторы (BERT) и визуальные трансформеры (ViT) для извлечения текстовых и вложенных элементов изображений из подписей к изображениям и самих изображений [9][10]. Поскольку модель CLIP тесно связана с архитектурой трансформаторов, крайне важно сравнивать диффузионные модели, включающие блоки трансформаторов, с теми, которые не используют трансформаторы в качестве декодеров. В данном исследовании сосредоточено на сравнении структур моделей латентной диффузии и моделей диффузионных трансформаторов. Первый использует декодер Unet, а второй интегрирует блок трансформатора в качестве декодера. Кроме того, в исследовании рассматриваются различные подсказки, направленные на создание похожих изображений, с поиском подходящих форм текстовых подсказок для обучения диффузионных моделей с возможностями генерации текста в изображение и для информирования будущих исследований.
Методология
Набор данных и предварительная обработка
Это исследование было сосредоточено на четырёх наборах данных изображений: Cifar10, Cifar100 и ImageNet [11][12]. Cifar10 и Cifar100 оба созданы Алексом Крижевским и др. Каждый набор данных Cifar10 и Cifar100 содержит 60 000 маркированных цветных изображений размером 32×32. Cifar10 и Cifar100, как следует из их названий, состоят соответственно из 10 категорий фотографий и 100 категорий фотографий. ImageNet был представлен Цзя Дэном и соавторами в 2009 году. Существуют разные типы наборов данных ImageNet, все они предназначены для некоммерческого использования. Наиболее часто используемый набор данных ImageNet — ImageNet10K, набор данных с 1000 классами, содержащий более 1,2 миллиона цветных изображений различных размеров. MNIST был представлен в 1998 году Яном Лекуном — это набор данных, содержащий 70000 рукописных изображений для 10 цифр, 60000 для обучения и 10000 для тестирования. Все они выполнены в оттенках серого и имеют размер 28×28. Эти наборы данных имеют простые метки для каждого изображения, в этой работе используются метки классов изображений в качестве базовых подсказок для генерации изображений. Кроме того, это исследование постепенно добавляет различные уровни деталей в метку класса для генерации изображений с целью сравнения баллов CLIP.
Архитектура
В этой статье рассматривается точность CLIP-оценки при использовании моделей DiT и латентной диффузии для генерации изображений. Поскольку модель DiT не имеет предварительно обученной модели обусловленного текста, автор использовал имена классов из набора данных ImageNet в качестве подсказок для изображений. В ходе исследования было собрано всего 500 изображений, по 5 на каждый класс для одновременного обучения от 10 до 100 занятий. Для управления огромным количеством классов ImageNet автор случайным образом выбрал 100 классов для генерации изображений. После генерации изображений с использованием моделей латентной диффузии и DiT, они стандартизировали размеры изображений до 224 × 224 пикселей. Впоследствии как изображения, так и соответствующие им тексты описания проходили обработку через ViT и текстовые трансформеры для получения вложения. Эти вложения были нормализованы и использованы для вычисления усреднённого косинусного сходства для последующего анализа. Трубопровод показан на рисунке 1. Текстовый запрос — это ввод текста в модель генерации изображений, или это название класса изображения (в DiT). Затем он проходит через текстовый трансформатор, чтобы получить встраивание. Сгенерированное изображение проходит через ViT/14 для вложения. В конце вложения нормализуются, и вложения одного класса используются для получения среднего косинусного сходства.
Рисунок 1 — Конвейер для оценки, LDM и DiT
Вариационный автоэнкодер (VAE)
VAE является первым шагом как для модели латентной диффузии, так и для модели диффузионного трансформатора. Эта модель VAE предполагает, что набор данных изображений X состоит из n-множества i.i.d данных xi, i = 1, . . . , n. Кодировщик E(xi) из VAE пытается получить латентное представление zi для каждого xi, докодер D(z) — предсказать изображение из заданного латентного z. В частности, в латентной диффузионной модели вход x — это изображение размером H × W × 3, а z — латент изображения z с размерностью h × w × c, меньше изображения x на коэффициент уменьшения дискретизации f = H = W, здесь f = 2m для некоторого m ∈ N . В сравнение с одномерным латентным элементом в некоторых работах авторов статьи LDM, этот z имеет двумерную структуру, это попытка сохранить больше информации из исходного изображения [4]. Модель диффузии использует VAE с KL-регуляризацией, после извлечения латентного z с помощью VAE представление z переходит в процесс диффузии.
Пробайлистические модели с обезвлеканием диффузии (DDPM)
Процесс диффузии состоит из двух этапов: процесса с добавлением шума вперед и обратного процесса для обезшумления. Оба этих процесса являются марковскими цепями. Прямой процесс постепенно рассеивает гауссовский шум в входное изображение, а обратный процесс удаляет шум для получения изображения. В процессе Forward DDPM берёт данные изображения x0 из данного набора данных. Предположим, что в движущемся процессе есть T много временных шагов в определённом шаге t, так что 1 ≤ t ≤ T, данные шумового изображения XT получаются как показано в следующей формуле:
xt = (α̅𝑡)1/2x0 + (1 − α̅tε)1/2 (1)
где ε — гауссовый шум с той же размерностью, что и x, αt — коэффициент масштабирования, указывающий на заданном шаге времени t, какая часть сэмплированного гауссового шума добавляется к исходному изображению x.αt ∶= 1 − βt , где βt — график дисперсии, который увеличивается по мере увеличения t от 1 до T. На шаге времени T исходное изображение x0 полностью преобразуется в гауссов шум xT.
Обратный процесс авторегрессивен, он постепенно уменьшает шум от гауссовского шума xT для восстановления исходного изображения. Процесс дискретизации сосредоточен на обратном процессе: он использует предсказанный шум εθ , шум z, взятый из N (0,1); для задания временного шага t более чёткое изображение в следующем обратном шаге t − 1 задаётся как:
xt−1 = (α̅t)-1/2 (xt − (1 − α̅tε)1/2 εθ(xt, t)) + σtz (2)
где σtI = Σθ(xt, t) — ковариационная матрица условного распределения вероятностей pθ(xt−1|xt) ∶= N (xt−1; μθ(xt, t), Σθ(xt, t))
Блок DiT
Блок диффузионного трансформатора (DiT) заменяет структуру Унет для улучшения масштабируемости модели латентной диффузии. Этот блок основан на архитектуре ViT, он использует патчи для извлечения информации из скрытого изображения слоя patchify, который также является первым слоем модели DiT. В этом слое он превращает латентное изображение шума размером I × I × C в входной токен длиной T и размерностью d. Где T = (I/p)2, а p — длина одного участка, каждое изображение можно разбить на множество патчей. После патчизации входной токен и обусловленная обработка передаются блоку DiT. Существует четыре типа DiT-блоков: лучший производитель FID-50K — это блок, называемый adaLN-Zero. Такой тип DiT-блока сочетает в себе адаптивный слой нормализации и нулевую инициализацию в конечном сверточном слое блока DiT, после чего блок DiT переходит в процесс остаточного соединения.
Оценка CLIP
CLIP Score использовал модель CLIP. В этой статье модель ViT используется для получения вложений изображений, а трансфомрер текста — для получения текстовых вложений в модели CLIP. Из одного класса генерируются 5 или 10 изображений, и общая сумма вложений нормализуется до интервала [0, 1], эти вложения затем оцениваются с помощью всех текстовых подсказок, используемых для генерации изображений или тех, что описывают изображения, используя косинусное сходство. Значения сходства усредняются между всеми изображениями одного класса. Например, если в каждом классе 5 изображений, среднее значение из 5 значений сходства будет итоговым средним баллом для этого класса. Сравнения баллов CLIP. В этой статье LDM предварительно обучается с использованием LAION5B набора данных, а модель DiT — с помощью набора данных ImageNet.
В этой статье сравниваются CLIP-оценки для сгенерированных изображений и изображений из исходного набора данных с использованием этих двух моделей.
Рисунок 2 — Сравнение CLIP-оценок между сгенерированными изображениями и изображениями из оригинального набора данных
Результаты и обсуждение
Для оценки поведения балла CLIP в отношении описания в данном исследовании автор находит оценки CLIP с использованием различных типов подсказок. Сначала автор оценивает CLIP Scores между изображениями наборов данных с метками классов. Кроме того, автор сохранил стандартную настройку модели CLIP, добавив фразу «This is» перед меткой класса. Например, в наборе данных Cifar100 подсказки выглядят так: «Это водный млекопитающий бобр», в наборе данных Cifar10 — «Это самолёт». Во-вторых, балл CLIP формируется путем вычисления сгенерированного графика диффузионной модели и текста сгенерированного изображения, или названия соответствующей категории.
Как показано на рисунке 2, набор данных Cifar10 и набор данных ImageNet имеют схожие оценки CLIP с сгенерированными изображениями. Однако существует большая разница между CLIP-скорами набора данных Cifar100 и сгенерированными изображениями. Возможной причиной этого является то, что классификаторные запросы для Cifar100 формируются путем объединения меток суперклассов и конкретных меток классов. Как уже упоминалось, метки набора данных Cifar100 выглядят как «водный млекопитающий бобр», а классовые метки в наборе Cifar10 — как «самолет». Это показано на рисунке 3: с удалением меток суперкласса в Cifar100 CLIP Score снижается на 13% от исходного Score. К такому результату могут привести две причины. Во-первых, разница между подсказками, которые генерировали изображение, и теми, что убрали имена суперклассов, теперь разная. Во-вторых, запросы без названий суперклассов теперь имеют меньше релевантной информации по сравнению с исходным запросом. Сравнение CLIP Scores между подсказками, использовавшими суперкласс, и теми, которые не были добавлены суперклассами.
Рисунок 3 — Сравнение CLIP Scores между подсказками с суперклассом и без
Заключение
В данном исследовании оценивается эффективность LDM и модели DiT, а также изучено влияние структуры запросов на CLIP Score. Учитывая, что LDM использует текстовые эмбеддинги на основе модели CLIP, исследование взаимодействия генеративных моделей с этими вложениями даёт представление о улучшении процесса обучения обусловлению. Сравниваются оценки CLIP между оригинальными изображениями набора данных и моделями, полученными диффузионными моделями. Изначально оценки CLIP рассчитываются по названиям классов изображений во всех наборах данных. Впоследствии имена суперклассов исключаются из подсказок в наборе данных Cifar100 для дальнейших расчётов баллов CLIP. Результаты показывают более высокие CLIP-оценки для сгенерированных изображений во всех наборах данных, что особенно заметно при сравнении изображений Cifar100 с теми, что генерируются с использованием названий классов Cifar100 в качестве подсказок. Дальнейший анализ показывает снижение баллов CLIP после удаления суперклассовых подсказок. Хотя временные ограничения ограничивали дополнительные сравнения, будущие исследования будут изучать производительность мультимодальной модели DiT, сочетая CLIP и DiT, а также оценивать оценки CLIP для различных структур подсказок в текстовых моделях DiT. Кроме того, планируется исследование различий в оценках CLIP для моделей LDM в набора данных Cifar100.
Список источников
- Ли А. С., Прабхудесай, М., Дуггал, С., Браун, Э., и Патхак, Д. (2023). Ваша диффузионная модель тайно является классификатором с нулевой выстрелом. В материалах Международной конференции IEEE/CVF по компьютерному зрению (стр. 2206-2217).
- Бонд-Тейлор С., Лич А., Лонг И., и Уилкокс К. Г. (2021). Глубокое генеративное моделирование: сравнительный обзор ваес, ганов, нормализующих потоков, энергетических и авторегрессивных моделей. Транзакции IEEE по анализу паттернов и машинному интеллекту, 44(11), 7327-7347.
- Хо Дж., Джайн А., и Аббил. (2020). Вероятностные модели диффузии для снятия шума. Достижения в системах обработки нейронной информации, 33, 6840-6851.
- Ромбах Р., Блаттманн А., Лоренц Д., Эссер., и Оммер Б. (2022). Синтез изображений высокого разрешения с использованием моделей латентной диффузии. В сборнике материалов конференции IEEE/CVF по компьютерному зрению и распознаванию образов (стр. 10684-10695).
- Васвани А, Шазир Н, Пармар Н, Ушкорайт Дж, Джонс Л, Гомес А. Н, ... и Полосухин I (2017). Внимание — это всё, что вам нужно. Достижения в системах обработки нейронной информации, 30.
- Пиблс В. и Се С (2023). Масштабируемые диффузионные модели с трансформаторами. В материалах Международной конференции IEEE/CVF по компьютерному зрению (стр. 4195-4205).
- Рэдфорд А, Ким Дж. В, Халласи С, Рамеш А, Го Г, Агарвал С, ... и Сутскевер И. (июль 2021). Изучение переносимых визуальных моделей с помощью надзора за естественным языком. В Международной конференции по машинному обучению (стр. 8748-8763). PMLR.
- Хессел Дж., Хольцман А., Форбс М., Брас Р.Л., и Чой И (2021). Clipscore: Безссылочная метрика оценки для субтитров к изображениям. arXiv препринт arXiv:2104.08718.
- Девлин Дж., Чанг М.В., Ли К., и Тутанова К. (2018). Берт: Предварительное обучение глубоким двунаправленным трансформаторам для понимания языка. arXiv препринт arXiv:1810.04805.
- Досовицкий А, Бейер Л, Колесников А, Вайсенборн Д, Жай Х, Унтертинер Т, ... и Хоулсби, Н (2020). Изображение стоит 16x16 слов: Трансформеры для распознавания изображений в масштабе. arXiv препринт arXiv:2010.11929.
- Крижевский, А., и Хинтон Г. (2009). Изучение нескольких слоёв признаков с крошечных изображений.
- Дэн Дж, Донг В, Сочер Р, Ли Л. Дж, Ли К, и Ли Ф (июнь 2009). Imagenet: крупномасштабная иерархическая база изображений. В 2009 году конференция IEEE по компьютерному зрению и распознаванию образов (стр. 248-255). IEEE.
Цянь Тан. Анализ моделей диффузии. В данной статье рассматривается анализ различных моделей диффузии, сосредотачиваясь на их использовании текстово-условной выборки и оценки с использованием балла контрастивного языка-образа предобучения (CLIP) в качестве метрики. Используя двунаправленные трансформаторы (BERT) и визуальные трансформеры (ViT) в рамках модели CLIP, он ключевым образом сравнивает модели, включающие блоки трансформаторов, с теми, которые этого не делают. В частности, изучается структура моделей латентной диффузии и моделей диффузионных трансформаторов, делая акцент на использовании блок-декодеров Unet и Transformer соответственно. Кроме того, исследование исследует различные запросы для создания похожих изображений, с целью оптимизировать тренировки по обусловлению для генерации текста в изображение. Кроме того, в статье исследуется эффективность модели латентной диффузии (LDM) и модели DiT в генерации объектов, анализируя их взаимодействие с текстовыми эмбеддингами и структурами запросов. Результаты подчёркивают важность структур подсказок для производительности моделей, что имеет последствия для будущих исследований мультимодальных моделей и оптимизации подсказок.
Ключевые слова: модели диффузии, интеграция трансформеров, оптимизация запросов, генерация текста в изображение.