*,**Кафедра электронной инженерии, Национальный институт технологий Сардара Валлаббхаи, Сурат, Индия
{vishalchudasama2188, kishorupla}@gmail.com
В области машинного обучения традиционные модели глубокого обучения в основном являются дискриминативными, где их цель - обнаружить отображение из входных слоев в выходные. Также эти модели требуют большого количества размеченных данных для обучения. С другой стороны, глубокие генеративные модели (DGMs) предоставляют новый способ эффективного изучения признаков из выборочных данных, которые не требуют размеченных данных. Среди многих DGMs генеративные состязательные сети (GANs) являются перспективными моделями как для полуобучения с учителем, так и для обучения без учителя. GANs используют пару сетей дискриминатора и генератора, которые используются в состязательном процессе для изучения эффективных признаков. Однако реализация GANs сталкивается с сложной проблемой стабильности обучения. В этой статье обсуждается обзор и проблемы реализации GANs. Мы рассматриваем различные модели GAN, такие как глубокая сверточная GAN (DCGAN), Wasserstein GAN (WGAN), WGAN с градиентным штрафом (WGAN-GP) и GAN граничного равновесия (BEGAN), которые улучшают стабильность их обучения. Улучшение в плане стабильности этих GANs оценивается путем проведения различных экспериментов на общей базе данных Fashion-MNIST. Дополнительно, проблема коллапса мод в GAN решается с использованием развернутой GAN (Unrolled GAN), которая также рассматривается и обсуждается.
Ключевые слова: GAN, DCGAN, WGAN, WGAN-GP, BEGAN, Unrolled GAN, Fashion-MNIST.
В машинном обучении модели глубокого обучения извлекают признаки из выборок данных эффективно, используя глубокую архитектуру, которая разработана на основе нелинейных преобразований. Эти модели глубокого обучения в основном являются дискриминативными по своей природе, где основная цель - обнаружить отображение из входов в выходы. Однако эти модели имеют несколько ограничений: i) они требуют огромных количеств размеченных данных; ii) они резко терпят неудачу, когда заданные входы не похожи на входы обучающего набора. Среди многих типов глубоких моделей, глубокие генеративные модели (DGMs) являются мощными для обучения без учителя и с частичным привлечением учителя, в которых вместо различения входов они пытаются воспроизвести (скрытый) статистический процесс внутри данных без reliance на внешние метки. Они начинают с генерации "галлюцинаций", которые становятся более реалистичными и правдоподобными по мере развития процесса обучения. DGMs изучают абстрактные представления из неразмеченных данных и выполняют широкий спектр задач, включая оценку плотности, генерацию данных и оценку пропущенных значений. Наиболее распространенными генеративными моделями на основе глубоких нейронных сетей являются вариационные автоэнкодеры (VAEs) [1] и генеративные состязательные сети (GANs) [2, 3]. Обучение этих моделей основано на байесовском глубоком обучении [4], вариационных приближениях [5], оценке Монте-Карло Марковской цепи (MCMC) [6] или старой доброй оценке стохастического градиента (SGD) [7].
Литература показывает, что GANs являются одной из самых перспективных областей исследований в обучении без учителя. Многие модели на основе GAN были предложены исследователями для улучшения их производительности [8, 9, 10, 11, 12, 13, 14, 15]. В то же время, по мере того как глубокое обучение стало популярным, возросла потребность в огромных количествах данных. GANs стремятся заполнить эти пробелы, поскольку они предлагают генеративную модель для натуральных изображений, которая эволюционирует, чтобы генерировать все более и более реалистично выглядящие данные, благодаря связи с состязательной сетью.
На практике обучение в GAN является очень сложной задачей. Относительные емкости моделей генератора и дискриминатора должны быть тщательно сбалансированы для того, чтобы генератор эффективно обучался. В этой статье мы обсуждаем обзор и проблемы реализации GANs. Мы рассматриваем различные модели GAN, такие как глубокая сверточная GAN (DCGAN) [8], Wasserstein GAN (WGAN) [12], WGAN с градиентным штрафом (WGAN-GP) [13] и GAN граничного равновесия (BEGAN) [15], которые улучшают стабильность обучения GANs. Эти модели реализованы на общей базе данных Fashion-MNIST и оценены на основе критериев стабильности. В дополнение к этому, проблема коллапса мод в GAN уменьшается с использованием развернутой GAN (Unrolled GAN) [10], которая также рассматривается и обсуждается.
GAN была предложена Яном Гудфеллоу в университете Монреаля в 2014 году. Основная идея behind GANs состоит в том, чтобы иметь две конкурирующие модели нейронных сетей. Гудфеллоу и др. [2] используют простые многослойные перцептроны (MLP) для обеих сетей. В этих двух сетях одна принимает шум как вход и генерирует выборки данных (называется сеть генератора (G))
и другая сеть (называемая дискриминатором (D)) получает выборки как от генератора, так и от обучающих данных, и ее задача состоит в том, чтобы различить два источника данных.
Пусть \(p_{data}\) - целевое распределение, которое требуется модели генератора \(G\) изучить путем аппроксимации его моделью распределения \(p_{model}\). \(G\) связана с априорным распределением шума \(p_{z}\), из которого \(G\) извлекает выборки \(z\) и создает фейковую выборку \(G(z;\,\theta_{{}_{G}})\). Здесь \(\theta_{{}_{G}}\) - параметры модели. Дискриминатор \(D(z;\,\theta_{{}_{D}})\) принимает \(x\) и \(G(z)\) как вход и возвращает бинарное суждение о том, является ли данный вход из \(p_{data}\) или \(p_{model}\). \(\theta_{{}_{D}}\) - параметры модели сети дискриминатора \(D\). Цель GANs - обучить сеть генератора \(G(z;\,\theta_{{}_{G}})\), которая производит выборки из распределения модели \(p_{model}(x)\), преобразуя векторы шума \(z\) как \(x=G(z;\,\theta_{{}_{G}})\). Обучающий сигнал для \(G\) предоставляется сетью дискриминатора \(D(z;\,\theta_{{}_{D}})\), которая обучена различать выборки из распределения генератора \(p_{model}(x)\) и реальные данные. Другими словами, сеть генератора \(G(z;\,\theta_{{}_{G}})\) обучена обманывать дискриминатор, чтобы он принимал ее выходы как реальные. Эти две сети играют в непрерывную игру, где генератор учится производить все более и более реалистичные выборки, а дискриминатор учится все лучше и лучше различать сгенерированные данные и реальные данные. Эти две сети обучаются одновременно, и надежда состоит в том, что конкуренция приведет к тому, что сгенерированные выборки станут неотличимы от реальных данных.
Проблема обучения GAN состоит в том, чтобы найти оптимальные параметры \(\theta^{*}_{{}_{G}}\) для функции генератора \(G(z;\,\theta_{{}_{G}})\) в минимаксной цели как [2], [3],
где минимаксная функция потерь \(f\) обычно выбирается как,
Здесь \(x\in X\) - переменная данных, \(z\in Z\) - латентная переменная, дискриминатор \(D(\cdot;\theta_{{}_{D}})\colon X\to[0,1]\) выводит estimated вероятность того, что выборка x comes from распределения данных, \(G(\cdot;\theta_{{}_{G}})\colon Z\to X\) преобразует выборку в латентном пространстве в выборку в пространстве данных. Здесь функция \(D\) состоит в том, чтобы минимизировать значение \(D(G(z))\), так как это сгенерированная выборка, и в то же время она также функционирует, чтобы увеличить значение \(D(x)\), чтобы указать его как реальные данные. Для оптимизации уравнения (1) Гудфеллоу и др. [2] предлагают алгоритм, в котором градиентный спуск на \(\theta_{{}_{G}}\) и подъем на \(\theta_{{}_{D}}\) используются поочередно. Этот процесс продолжается до тех пор, пока \(p_{model}\) не приблизится к \(p_{data}\) и в конечном итоге не достигнет точки равновесия, где \(D\) больше не может классифицировать выборки как реальные или сгенерированные (т.е. \(D(x)=D(G(z))=1/2\)). Наконец, оптимальное решение \(\theta^{*}=(\theta^{*}_{{}_{G}},\,\theta^{*}_{{}_{D}})\) является неподвижной точкой этих итеративных динамик обучения.
Одной из проблем в стандартной GAN [2] является несходимость между двумя сетями. Это из-за термина \(\log(1-D(G(z))\) в уравнении (3), который быстро насыщается на ранней стадии обучения, где \(D\) легко отвергает \(G(z)\), потому что \(G\) генерирует фейковые данные плохого качества, и они непрерывно отличаются от реальных данных. Поэтому, вместо оценки того, насколько плохи фейковые данные, оцените, насколько они хороши, установив цель \(G\) на максимизацию \(\log(D(G(z))\).
Другой наиболее важной проблемой стандартной GAN [2] является ее стабильность в обучении. Несмотря на теоретическое существование уникальных решений, обучение GANs является сложным и часто нестабильным по многим причинам [8], [9]. Один из способов улучшить стабильность обучения - оценить эмпирические "симптомы", которые наблюдаются во время обучения GANs. Эти симптомы включают:
В литературе предложены различные методы для преодоления проблем стабильности GANs. В этом разделе мы обсудим несколько важных методов, которые могут улучшить стабильность GANs, а также решить трудности обучения GAN.
Радфорд и др. [8] предложили модель DCGAN, которая была первым крупным улучшением в обучении GANs для генерации изображений. DCGAN использует стандартные компоненты сверточной нейронной сети (CNN), такие как деконволюционные слои, полностью
связанные слои и т.д. Авторы предлагают набор руководящих принципов, которые используются в построении и обучении модели. Ниже приведены руководящие принципы для стабилизации обучения DCGAN [8]:
Используя вышеуказанные руководящие принципы, Редфорд и др. [8] получили точность до 82.8% с частотой ошибок 22.48% на наборе данных CIFAR10 в классификации изображений. Производительность DCGAN все еще poor по сравнению с моделью на основе CNN [17], и также авторы обнаружили, что генератор иногда коллапсирует из-за его большой скорости обучения. Чтобы улучшить стабильность, требуется более низкая скорость обучения.
Чтобы улучшить стабильность обучения GAN, Салиманс и др. [9] предлагают эвристические подходы. Они предлагают некоторые небольшие изменения в схеме обучения GANs, которые приводят к визуально улучшенным результатам. Первая техника касается сопоставления признаков, которое слегка изменяет цель генератора, чтобы увеличить количество доступной информации. Новая цель записывается как,
где \(f\) - некоторый промежуточный слой в D. Дискриминатор все еще обучен различать реальные и фейковые выборки, но теперь генератор обучен сопоставлять ожидаемые промежуточные активации (признаки) дискриминатора для фейковых выборок с ожидаемыми промежуточными активациями для реальных выборок.
Второй трюк предназначен для предотвращения проблемы коллапса мод в GANs, которая производит одинаковые выборки для разных входов. Авторы используют мини-батчевую дискриминацию, чтобы преодолеть проблему коллапса мод, в которой дополнительный вход добавляется к дискриминатору. Этот дополнительный вход ведет себя как признак, который кодирует расстояние между данной выборкой в мини-батче и другими выборками. Используя эту концепцию, дискриминатор может легко сказать, производит ли генератор одинаковые выходы.
Третий подход - эвристическое усреднение, которое добавляет штрафной термин к параметрам сети, если они отклоняются от исторических средних значений. Это может помочь сойтись к условию равновесия, которое может быть невозможным с нормальным градиентным спуском. Четвертая техника - виртуальная пакетная нормализация. Здесь авторы нормализуют каждый пример относительно примеров в референсном батче, который был выбран один раз в начале обучения. Это уменьшает зависимость одного образца от других образцов в мини-батче и улучшает оптимизацию нейронной сети.
Наконец, техника одностороннего сглаживания меток делает цель для дискриминатора 0.9 вместо 1 и сглаживает классификационную границу дискриминаторов. Эта техника предотвращает дискриминатор от being более мощным, чем генератор, так что генератор будет обучаться более эффективно.
Все вышеуказанные техники включены Салимансом и др. [9] в их работу и проводят эксперименты с использованием полуобучения с учителем. Они сгенерировали выборки из разных баз данных, таких как MNIST, CIFAR-10 и ImageNet, и получили частоту ошибок 14.87% на базе данных CIFAR10 для заданного числа размеченных выборок. Это значение частоты ошибок ниже, чем при использовании стандартных GANs. Дополнительно, авторы также сравнивают выборки, сгенерированные генератором во время полуобучения с учителем, полученные с использованием техник сопоставления признаков и мини-батчевой дискриминации. Авторы достигают улучшения в визуальном качестве сгенерированных выборок с использованием мини-батчевой дискриминации. Более того, авторы также утверждают, что, используя их эвристические подходы, стабильность, а также качество изображения улучшаются по сравнению с обычной GAN.
В [10] Мец и др. демонстрируют проблему, связанную с коллапсом мод, и также обсуждают, как улучшить стабильность GANs. Авторы предлагают метод, который развертывает дискриминатор на несколько шагов, т.е. дискриминатор обновляется на текущем генераторе на несколько шагов, а затем использует "развернутые" дискриминаторы для обновления генератора с использованием нормальной минимаксной цели. По сравнению с GAN, в функции потерь (уравнение (3)), Мец и др. [10] вводят суррогатную целевую функцию \(f_{\text{K}}({\theta}_{\text{G}};{\theta}_{\text{D}})\) для обучения генератора, которая более closely напоминает истинную цель генератора \(f({\theta}_{\text{G}};\,{\theta}_{\text{D}}^{\star}({\theta}_{\text{G}}))\). В развернутой GAN локальный оптимум параметров дискриминатора \({\theta}_{\text{D}}^{\star}\) может быть выражен как неподвижная точка итерационной процедуры оптимизации,
где \(\eta^{k}\) - расписание скорости обучения. Развертывая на K шагов, авторы создают суррогатную цель для обновления генератора как,
Этот суррогатный член потерь захватывает, как дискриминатор отреагирует на изменение в генераторе. Это уменьшает тенденцию генератора вступать в коллапс мод. Однако недостатки этого подхода - увеличенное время обучения, которое увеличивается линейно с количеством шагов развертывания, и более сложный расчет градиента.
В своих экспериментах Мец и др. используют сверточную нейронную сеть как дискриминатор и рекуррентную нейронную сеть как генератор. Из-за этого результирующая модель имеет более сложный баланс мощности. Авторы также наблюдают, что без развертывания модель быстро коллапсирует к единственной моде и вращается вокруг распределения данных. При запуске с шагами развертывания генератор рассеивается и, кажется, покрывает все распределение данных.
Стандартная GAN [2] использует дивергенцию Йенсена-Шеннона (JS) для оптимизации функции потерь. Однако дивергенция JS не предоставляет достаточно информации, когда расхождение слишком велико, и также она не дифференцируема в каждой точке пространства, что делает градиенты в GANs исчезающими большую часть времени. Чтобы решить вышеуказанные проблемы, Аржовски и др. [12] предлагают использовать расстояние Вассерштейна (также известное как расстояние землекопа), которое дифференцируемо почти везде в пространстве. Они предлагают Wasserstein GAN (WGAN), которая использует альтернативную функцию потерь, выведенную из приближения расстояния Вассерштейна. Интуиция расстояния Вассерштейна заключается в том, что вероятностные распределения определяются тем, какую массу они могут положить на каждую точку. WGAN использует это расстояние в функции потерь. Однако вычисление расстояния Вассерштейна точно неразрешимо. Следовательно, авторы попытались вычислить его приблизительно, используя форму двойственности Канторовича-Рубинштейна. Результат из двойственности Канторовича-Рубинштейна эквивалентен
где супремум берется по всем 1-липшицевым функциям.
В отличие от функции стоимости стандартной GAN [2], WGAN с большей вероятностью предоставляет градиенты, которые полезны для обновления генератора. Функция стоимости, выведенная для WGAN, опирается на дискриминатор, который называется "критиком"; практически это может быть реализовано простым обрезанием параметров дискриминатора.
В стандартной GAN [2] градиенты исчезают по большей части пространства, в то время как в WGAN, обрезание весов дает достаточно хороший градиент по всему пространству. Выборки WGAN более детализированы, и поэтому они не так сильно подвержены коллапсу мод, как стандартная GAN [2]. Метод WGAN [12] испытан для генерации изображений. Целевое распределение изучено для набора данных LSUN-Bedrooms [18], который является коллекцией натуральных изображений внутренних спален. Авторы продемонстрировали производительность подхода WGAN с разными архитектурами генераторов и наблюдают, что оценка Вассерштейна хорошо коррелирует с визуальным качеством сгенерированных выборок. Авторы также сообщили, что обучение WGAN становится нестабильным временами, когда используется оптимизатор на основе момента, такой как оптимизатор Adam, на критике.
В основном, WGAN предназначена для стабилизации процесса обучения GANs. Однако она генерирует низкокачественные выборки, а также чаще не сходится из-за использования обрезания весов, которое возникает из-за ограничения Липшица в дискриминаторе. Это обрезание весов неблагоприятно уменьшает емкость модели дискриминатора и заставляет его изучать более простые функции. Гулраджани и др. [13] предлагают улучшенный метод для обучения дискриминатора WGAN путем штрафования нормы градиентов дискриминатора относительно выборок данных во время обучения, а не выполнения обрезания параметров. Чтобы обойти проблемы разрешимости, авторы применяют мягкую версию ограничения с штрафом на норму градиента для случайных выборок \(\hat{\textbf{x}}\sim p_{\hat{\textbf{z}}}\). Новая целевая функция потерь
Одно преимущество перед обрезанием весов заключается в улучшении, достигнутом в скорости обучения и качестве выборки, сгенерированной генератором. Адаптируя штрафной термин к целевой функции стандартной GAN [2], это может стабилизировать обучение и побуждать дискриминатор изучать более гладкие границы решений. Он работает лучше, чем стандартный WGAN, и позволяет стабильное обучение широкого разнообразия архитектур GAN с почти без настройки гиперпараметров, таких как 101-слойные ResNets.
Чтобы продемонстрировать стабильность процесса обучения, Гулраджани и др. [13] обучили предложенную GAN с разными архитектурами на наборе данных LSUN bedrooms. На основе результатов авторы заключают, что критики, обученные с обрезанием весов, не могут захватить высшие моменты распределения данных, в то время как WGAN с градиентным штрафом может захватить то же самое эффективным способом. Также они обнаружили, что их метод улучшает скорость обучения и качество выборки по сравнению с WGAN с обрезанием весов [12]. Однако скорость сходимости медленная по сравнению с DCGAN, но производительность более стабильна в точке сходимости по сравнению с DCGAN.
Многие трюки были применены для улучшения обучения GANs [8, 9]. Однако все еще есть много трудностей, которые не решены для практической реализации GANs. К ним относятся выбор правильных гиперпараметров,
контроль разнообразия изображений сгенерированных выборок, поскольку дискриминатор выигрывает слишком легко в начале обучения [3], балансирование сходимости дискриминатора и генератора. Чтобы преодолеть эти проблемы, Дэвид и др. [15] предлагают новую модель на основе равновесия, называемую GAN граничного равновесия (BEGAN), которая работает в паре с потерей, выведенной из расстояния Вассерштейна для обучения GANs на основе автоэнкодера. Этот метод балансирует мощность дискриминатора против генератора во время обучения.
В рамках BEGAN дискриминатор является автоэнкодером. Основная идея BEGAN состоит в том, чтобы сопоставить распределения потерь реконструкции сгенерированного распределения выборок с распределениями данных. Реальная потеря затем выводится из расстояния Вассерштейна между потерями реконструкции реальных и сгенерированных данных. При обучении \(D\) реконструирует реальные изображения лучше, и веса \(D\) обновляются так, что потеря реконструкции реальных изображений минимизируется. Дополнительно, \(D\) одновременно увеличивает потерю реконструкции сгенерированных изображений, и \(G\) работает состязательно к этому, минимизируя потерю реконструкции сгенерированных изображений. Дэвид и др. также вводят меру сходимости \(M\), которая является индикатором для измерения производительности сети. Она также используется для контроля скорости обучения. Эта мера может быть использована для определения, когда сеть достигла своего конечного состояния или если модель коллапсировала.
BEGAN [15] обучена на наборе данных CelebA [19] с использованием оптимизатора Adam с начальной скоростью обучения 0.0001 с коэффициентом затухания 2. Авторы сравнивают эффект варьирования параметра gamma Y на генерацию выборок. Здесь авторы наблюдают, что для низкого значения gamma Y лица выглядят чрезмерно однородными, и разнообразие увеличивается с разными значениями Y. Мера сходимости \(M_{global}\) модели BEGAN хорошо коррелирует с верностью изображения. Здесь модель сходится быстро. Чтобы проверить устойчивость техники балансировки равновесия, автор выполняет эксперимент, предоставляя преимущество дискриминатору над генератором, и наоборот, и они наблюдают, что, поддерживая равновесие, модель оставалась стабильной и сходилась к значимым результатам.
В этом разделе мы обсуждаем экспериментальные результаты, полученные с использованием реализации различных GANs. Как обсуждалось ранее, стабильность GANs улучшается с разными моделями GAN, такими как WGAN [12], WGAN-GP [13] и BEGAN [15], лучше, чем модели GAN, предложенные в DCGAN [8] и метод, предложенный в [9]. Из-за этого здесь мы включили экспериментальные результаты, полученные с использованием только WGAN [12], WGAN-GP [13] и BEGAN [15]. В дополнение к этому, мы также получаем экспериментальные результаты с использованием развернутой GAN [10], которая эффективно предотвращает проблему коллапса мод в стандартной GAN [2], и то же самое обсуждается. Все эти эксперименты были выполнены на машине с процессором Intel i7 6850k, 64GB RAM и видеокартой NVIDIA GeForce Titan X Pascal. Мы обучили все архитектуры на наборе данных Fashion-MNIST [20], который является новым набором данных, состоящим из 28 × 28 полутоновых изображений 70 000 модных продуктов из 10 различных категорий и по 7 000 изображений на категорию. В наших экспериментах мы используем оптимизатор Adam со скоростью обучения 0.0002, которая затухает с коэффициентом 2. Мы устанавливаем размер батча 64 и итерируем до 25 эпох, где 1 эпоха равна 1093 итерациям.
Это из-за использования оптимизатора Adam в критике, как упомянуто авторами. Интересно наблюдать, что изображения, сгенерированные с WGAN-GP [13] и BEGAN [15], лучше по сравнению с теми же с GAN [2] и WGAN [12]. Однако можно наблюдать, что сходимость BEGAN [15] быстрее, чем у WGAN-GP [13]. Из-за этого лучшие образцы изображений генерируются с BEGAN [15] по сравнению с теми же с WGAN-GP [13] (см. Рис. 1).
Кроме того, мы также обучили развернутую GAN [10] на 2D смеси 8 гауссовых со стандартным отклонением 0.02 и средними, расположенными равномерно в круге, чтобы понять проблему коллапса мод. Обе сети, дискриминатор, а также генератор, оптимизированы с использованием оптимизатора Adam со скоростью обучения 1e-4 и 1e-3, соответственно. Результаты сравниваются со стандартной GAN [2] (шаг развертки = 0), которые отображены в первой строке Рис. 3. Здесь показана тепловая карта распределений генератора после увеличения числа шагов обучения. Зеленые точки, расположенные вокруг круга, указывают целевое распределение данных. Глядя на результаты верхней строки (т.е. стандартная GAN [2]), можно видеть, что генератор никогда не сходится к фиксированному распределению, и он присваивает массу вероятности только нескольким фиксированным точкам. Однако в случае шага развертки 5 (т.е. развернутая GAN [10]) генератор быстро распространяется и сходится к целевому распределению. Это приводит к минимизации проблемы коллапса мод.
GANs совершили прорывы в обучении без учителя и с частичным привлечением учителя в области глубокого обучения. Практическая реализация GANs становится очень сложной в основном из-за проблемы стабильности в фазе обучения. Мы обсудили стандартную GAN и ее проблемы. Чтобы решить эти проблемы, мы обсудили другие известные модели GAN, которые могут смягчить проблему стабильности, чтобы улучшить обучение в некоторой степени.
DCGAN была первой моделью, которая использовала концепции CNN, которые улучшают обучение GAN. Салиманс и др. [9] предлагают несколько техник для архитектур GANs, которые улучшают стабильность обучения. Поскольку коллапс мод является основной проблемой, которая возникает из-за нестабильности GANs. Люк и др. [10] представили развернутую GAN, которая устраняет эту проблему коллапса мод, но этот метод требует больше времени обучения и сложных расчетов градиента. В то время как в WGAN, Аржовски и др. [12] утверждают, что их модель никогда не сталкивается с коллапсом мод. Используя функцию потерь расстояния Вассерштейна, модель WGAN улучшает стабильность своей модели. Однако она все еще генерирует низкокачественные выборки из-за использования обрезания весов. Гулраджани и др. [13]
предлагают новую модель, называемую WGAN с градиентным штрафом, которая преодолевает проблемы WGAN. В предыдущих моделях GAN контроль качества изображения и балансировка сходимости между генератором и дискриминатором затруднительны. Дэвид и др. [15] предлагают модель BEGAN, используя термин равновесия, который может балансировать мощность дискриминатора против генератора, и поэтому модель остается стабильной и достигает значимых результатов.
Мы реализовали вышеуказанные модели GAN и наблюдаем, что модели WGAN [12], WGAN-GP [13] и BEGAN [15] лучше для стабилизации обучения GANs. Мы экспериментируем на этих трех моделях на общем наборе данных и сравниваем результаты. Здесь мы обнаружили, что результаты, полученные с использованием WGAN-GP, лучше, чем GANs и WGAN. Однако из-за терминов равновесия в BEGAN, это может привести к улучшенному качеству выборки с быстрой сходимостью. Кроме того, наши эксперименты на развернутой GAN [10] заключают, что основная проблема коллапса мод может быть уменьшена путем добавления шагов развертки к дискриминатору для обновления весов генератора.
Авторы с благодарностью признают поддержку корпорации NVIDIA с пожертвованием Titan Xp GPU, использованного для этого исследования.