← Назад

Семь способов оценки полезности синтетических данных

Seven Ways to Evaluate the Utility of Synthetic Data / Khaled El Emam // IEEE Security & Privacy. – 2020. – Vol. 18, № 4. – P. 56–59. – DOI: 10.1109/MSEC.2020.2992821.

Исследовательский институт Детской больницы Восточного Онтарио

Аннотация: Доступ к данным о здоровье на индивидуальном уровне будет критически важен для управления пандемией COVID-19 и обеспечения возвращения общества к некоторой форме (нового) нормального функционирования. Более широкий доступ к данным уже начинает реализовываться. В то же время сообщество специалистов по приватности выражает всё большую обеспокоенность масштабами и способами обмена столь чувствительной информацией. В Южной Корее широкий обмен данными уже привёл к повторной идентификации некоторых пациентов и их осуждению и насмешкам, а некоторые правительства начали сокращать объём информации, публикуемой о случаях COVID-19. Синтез данных может предложить решение, позволяя получать доступ к полезной информации при обеспечении разумной защиты приватности.

Ключевые слова (IEEE): модели данных, обмен информацией, конфиденциальность данных, COVID-19, вирусы (медицинские), общественное здравоохранение, анализ стабильности.

Дополнительные термины: использование данных, полезность синтетических данных, национальные институты здравоохранения (NIH), медицинские данные, случаи COVID-19, синтез данных, индивидуальные данные, Public Health England, обмен данными, статистическое машинное обучение, масштаб уровня, субъективная оценка, репликация исследований, эксперты в предметной области, риски раскрытия информации, общие метрики.

Доступ к данным о здоровье на индивидуальном уровне будет критически важен для управления пандемией COVID-19 и обеспечения возвращения общества к некоторой форме (нового) нормального функционирования. Более широкий доступ к данным уже начинает реализовываться. В то же время сообщество специалистов по приватности выражает всё большую обеспокоенность масштабами и способами обмена столь чувствительной информацией. В Южной Корее широкий обмен данными уже привёл к повторной идентификации некоторых пациентов и их осуждению и насмешкам [1], [2], а некоторые правительства начали сокращать объём информации, публикуемой о случаях COVID-19 [3–8]. Синтез данных может предложить решение, позволяя получать доступ к полезной информации при обеспечении разумной защиты приватности.

Уже существуют масштабные инициативы по обмену данными с использованием синтетических данных. Например, сводные таблицы переписи населения США 2020 года будут основаны на синтетических данных. Public Health England сделала крупный онкологический регистр (Simulacrum) общедоступным для аналитиков. Дополнительные проекты по синтезу данных находятся в разработке Национальными институтами здравоохранения США (NIH) и финансируемыми NIH проектами.

Синтетические медицинские данные генерируются на основе модели, обученной на реальном наборе данных, как показано на рисунке 1. Для обучения этой модели обычно применяются методы статистического машинного обучения и глубокого обучения. Для генерации полезных синтетических данных не требуется заранее знать, как именно они будут использоваться или анализироваться. После обучения модель используется для создания новых данных. Генерация является стохастической; поэтому каждый раз из модели формируется новый набор данных.

Базовый рабочий процесс синтеза данных

Рисунок 1. Базовый рабочий процесс синтеза данных.

Чтобы специалисты по данным чувствовали себя уверенно при использовании синтетических данных, особенно для построения моделей, влияющих на общественное здоровье и клинические решения, необходимо наличие доказательств полезности этих данных. В этой статье мы суммируем семь способов, которыми полезность синтетических данных оценивалась до настоящего времени, и завершаем некоторыми рекомендациями по их применению.

Методы оценки полезности

Ниже приведены семь методов оценки полезности синтетических данных. В этих описаниях реальные данные будут обозначаться как источник, а синтетические данные — как созданный набор. Предполагается, что цель заключается в обеспечении широкого доступа к индивидуальным данным пациентов, а не, например, в публикации агрегированных статистик или сводных таблиц.

Оценка полезности выполняется организацией, осуществляющей синтез данных, до того как данные становятся доступными более широкому кругу пользователей. Обычно результаты оценки полезности документируются и предоставляются пользователям данных.

Репликация исследований

Базовый подход к оценке полезности заключается в том, чтобы провести анализ на реальных данных, а затем воспроизвести его на синтетических данных. Если из двух различных анализов делаются одинаковые выводы, то синтетические данные считаются обладающими высокой полезностью. Выбранный анализ должен быть значимым для предполагаемых приложений синтетических данных. Например, если набор данных будет использоваться для прогнозирования времени выживания, то сравниваются модели выживания на реальных и синтетических данных.

Другой способ реализации этого подхода — найти уже опубликованное исследование с использованием того же набора данных и затем воспроизвести результаты этого исследования на синтетических данных. Если репликация успешна, это демонстрирует полезность синтетического набора данных.

На практике это весьма убедительный способ показать полезность. Основным недостатком данного подхода является необходимость привлечения экспертов в предметной области для проведения содержательного анализа репликации и интерпретации результатов. Например, биостатистик обычно выполняет такие репликации медицинских исследований. Кроме того, воспроизведение одного анализа, каким бы значимым оно ни было, даёт лишь частичное представление о других возможных анализах данных.

Субъективная оценка экспертами

Хорошим тестом полезности данных является проверка того, могут ли эксперты в предметной области отличить реальные записи от синтетических. Это можно оценить, например, попросив клиницистов изучить подмножество записей и классифицировать их как реальные или синтетические на основе того, насколько данные выглядят правдоподобными и реалистичными. Для оценки их работы можно использовать стандартные метрики точности классификации (такие как F-мера или площадь под кривой характеристик приёмника — ROC). Низкая точность классификации означает, что они не могут отличить реальные данные от синтетических.

Подобно репликации, субъективные оценки требуют участия специалистов, обладающих знаниями в данной области, например клиницистов. Им необходимо классифицировать нетривиальное количество записей, чтобы результаты были стабильными (например, 100 записей). Такая классификация может быть более сложной, если записи относятся к сложному клиническому процессу.

Общие метрики полезности

Наиболее распространённый подход к оценке синтетических данных — использование общих метрик. Например, можно вычислить расстояние между распределениями реальных переменных и синтетических, либо сравнить корреляции между переменными в синтетических и реальных данных. Эти типы метрик не учитывают конкретные анализы, которые в дальнейшем будут выполняться с данными. Вместо этого они оценивают общие статистические параметры и результаты оценки моделей для правдоподобных классов анализов, которые могли бы быть проведены на данных.

Также возможно оценить различимость синтетических данных. Для этого строится классификационная модель, способная отличать реальные данные от синтетических. Если модель не может их различить, то полезность считается высокой. Это автоматизированная версия субъективной оценки, упомянутой в разделе «Субъективная оценка экспертами».

Общие метрики имеют преимущество в том, что они в значительной степени автоматизированы и могут дать хорошее представление о полезности данных. Если набор данных не считается адекватным по общим метрикам, то, скорее всего, он не покажет хорошие результаты ни в одном из других тестов.

Оценка смещений и стабильности

Поскольку синтез данных является стохастическим процессом, при каждом создании синтетического набора данных на основе обученной модели формируется различный набор значений. Один из подходов, применяемых для определения смещений синтетических данных, заключается в генерации большого числа синтетических наборов и последующем вычислении средних значений общих метрик полезности. Вариация этих параметров также оценивается для определения стабильности синтетических данных.

При репликации исследований смещения и стабильность также могут оцениваться на основе повторов. Это ещё один способ определить надёжность результатов репликации. Такой тип оценки полезности интересен с общей статистической точки зрения. Если метрики, вычисленные на синтетических данных, систематически смещены или имеют нетривиальную вариативность, то на поведение обученной генеративной модели нельзя полагаться.

Структурное сходство

Хотя это может показаться незначительной деталью, на практике это очень важный способ оценки полезности синтетических данных, учитывая распространённые способы их применения. Структурное сходство означает, что синтетические данные должны проходить проверки редактирования и иметь те же типы и форматы переменных, имена переменных, метаданные и форматы файлов, а также названия и структуру таблиц. Это позволяет аналитикам использовать один и тот же код анализа как для синтетических, так и для реальных данных.

Распространённый сценарий использования синтетических данных — тестирование статистических программ; возможность запускать один и тот же код делает синтетические данные очень полезными с практической точки зрения. Другой сценарий — валидация результатов синтетических данных на реальных данных с использованием сервера проверки, как показано на рисунке 2. Это позволяет аналитикам запускать свой код на реальных данных без прямого доступа к ним. Возвращённые результаты вручную проверяются на риски раскрытия информации, и поэтому валидация на реальных данных выполняется один раз в конце анализа. Чтобы это работало, код должен выполняться без изменений на обоих типах данных.

Настройка сервера проверки

Рисунок 2. Настройка сервера проверки.

Сравнение с публичными агрегированными данными

Всё больше агрегированных данных о случаях COVID-19, смертности, сопутствующих заболеваниях и сопутствующих лекарствах публикуется в открытом доступе. Оценка синтетических данных может включать сравнение вычисленных на их основе статистик с публичными результатами, чтобы проверить их согласованность. Полезность набора синтетических данных будет считаться выше, если он «рассказывает ту же историю», что и публичные данные.

Сравнение с другими технологиями повышения приватности

Для обеспечения широкого аналитического доступа к данным о COVID-19 можно использовать различные подходы, каждый из которых имеет свои сильные и слабые стороны, такие как псевдонимизация, деидентификация, федеративный анализ и протоколы на основе гомоморфного шифрования. Все методы оценки могут быть применены и к этим подходам, а затем сопоставлены с синтетическими данными.

Такой тип оценки может лишь показать относительную полезность синтеза данных по сравнению с другими применимыми методами. Аргументированно, это может быть одним из факторов при выборе подхода для предоставления доступа к данным.

Семь подходов, описанных в этой статье, применялись как на практике, так и в литературе для оценки полезности синтетических данных. Чтобы обеспечить широкий доступ к данным о здоровье на индивидуальном уровне, важно не только защитить приватность пациентов, но и гарантировать, что полезность этих данных после любых преобразований остаётся достаточно высокой для содержательного анализа.

Таблица 1. Применимость различных методов оценки полезности синтетических данных.

Метод оценки полезности Пояснения Применимость
Структурное сходствоЭто критично. Если данные не структурно схожи, аналитикам будет сложнее их использоватьПрименять для каждого набора данных
Общие метрики полезностиЭто критично. Каждый набор данных должен пройти минимальный набор метрик полезности. Это относительно просто, так как процесс можно автоматизировать.Применять для каждого набора данных
Репликация исследованийРепликация — убедительный способ показать надёжность метода синтеза данных. Это трудоёмкий процесс, требующий экспертных знаний в предметной области.Оценка методологии
Субъективная оценка экспертамиТакой тип оценки методологии синтеза также может быть весьма убедительным. Однако он более сложен в выполнении.Оценка методологии
Оценка смещений и стабильностиПолезный тип оценки для каждого выпуска синтетических данных. Однако вес доказательств, который он добавляет к полезности набора данных, меньше, чем у других подходов.Каждый набор данных
Сравнение с публичными агрегированными даннымиКогда доступно, сравнение с публичными данными повышает доверие к методологии синтеза.Оценка методологии
Сравнение с другими PETТакой тип оценки полезно провести, чтобы помочь принимающим решения понять относительные сильные и слабые стороны конкретных технологий повышения приватности при предоставлении доступа к данным.Оценка методологии

Заметим, что мы не обсуждали аспект приватности синтеза данных. Мы предполагаем, что модели синтеза не были переобучены и что риски раскрытия личности из синтетических данных крайне малы. Мы ограничили повествование только полезностью. Конечно, эти методы оценки полезности применимы и к другим подходам, которые могут использоваться для защиты приватности индивидов, обеспечивая доступ к неперсонализированным данным на индивидуальном уровне.

Список литературы

1. «Конфиденциальность коронавируса: слишком ли откровенны предупреждения Южной Кореи?» BBC, Лондон, 5 марта 2020 г. [Онлайн]. Доступно по адресу: https://bbc.in/2Z7IPCL

2. Н. Ким, «Более страшно, чем коронавирус»: медицинские предупреждения Южной Кореи раскрывают частную жизнь,» The Guardian, 6 марта 2020 г. [Онлайн]. Доступно по адресу: https://bit.ly/3fWFM6D

3. Р. Роча, «Пандемия, управляемая данными: обмен информацией о COVID‑19 является “беспрецедентным”,» CBC News, Канада, 17 марта 2020 г. [Онлайн]. Доступно по адресу: https://bit.ly/3bDxhtu

4. К. Рэкли, «DHEC и власти штата рассматривают вопросы конфиденциальности и информацию о конкретных случаях коронавируса,» Aiken Standard, Айкен, Южная Каролина, 4 апреля 2020 г. [Онлайн]. Доступно по адресу: https://bit.ly/2Tbm8Kp

5. Дж. Хинкл, «Фрамингем — один из нескольких городов и поселков, которым DPH рекомендовало ограничить информацию о жителях, получивших положительный результат на коронавирус,» Wicked Local, 28 марта 2020 г. [Онлайн]. Доступно по адресу: https://bit.ly/2WZtXny

6. А. Маккалум, «Чиновники Джейнсвилла и округа Рок спорят по поводу обмена информацией о COVID‑19,» GazetteXtra, Джейнсвилл, Висконсин, 5 апреля 2020 г. [Онлайн]. Доступно по адресу: https://bit.ly/3fXmjCw

7. Л. Хэнкок, «Директор здравоохранения Огайо ссылается на проблемы конфиденциальности, поскольку местные департаменты здравоохранения скрывают детали о коронавирусе,» Cleveland, Огайо, 3 апреля 2020 г. [Онлайн]. Доступно по адресу: https://bit.ly/2z5RkDV

8. К. Хилл, «Чиновники здравоохранения Спокана предоставляют больше информации о пациентах с COVID‑19, но остаётся неясным, где они проходят лечение,» The Spokesman-Review, Спокан, Вашингтон, 6 апреля 2020 г. [Онлайн]. Доступно по адресу: https://bit.ly/2WCuFrV

Халед Эль Эмам — старший научный сотрудник Исследовательского института Детской больницы Восточного Онтарио, профессор медицинского факультета Университета Оттавы, а также сооснователь и директор компании Replica Analytics Ltd. Контакт: kelemam@uottawa.ca.