Применение платформы DEDUCTOR STUDIO для обработки и восстановления результатов измерения данных

Прокопенко Е.В., Букша Д.Р.
Донецкий национальный технический университет, г. Донецк, кафедра прикладной математики и искусственного интеллекта
prokopenko1515@rambler.ru

Аннотация

Рассмотрены возможности анализа данных, которые не соответствуют определенным критериям качества. Предварительная обработка таких данных становится необходимым шагом для обеспечения удовлетворительного результата анализа. Необходимость в предварительной обработке возникает независимо от того, какие алгоритмы и технологии используются. В данной статье для обработки таких данных применяется платформа DEDUCTOR STUDIO.

Общая постановка проблемы

Если анализируемые данные не соответствуют определенным критериям качества, то их предварительная обработка становится необходимым шагом для обеспечения удовлетворительного результата анализа. Необходимость в предварительной обработке возникает независимо от того, какие алгоритмы и технологии используются. Также эта задача может представлять самостоятельную ценность в областях, не имеющих непосредственное отношение к анализу данных. Очевидно, что исходные данные чаще всего нуждаются в очистке.

Основные задачи очистки данных:
  • Аномалии – выявление и обработка выбросов в данных
  • Пропуски – восстановление отсутствующих значений
  • Шумы – фильтрация случайных помех в измерениях
  • Некорректные форматы – приведение данных к единому стандарту
  • Дублирование – устранение повторяющихся записей

В процессе парциальной обработки восстанавливаются пропущенные данные, редактируются аномальные значения, проводится спектральная обработка. В Deductor Studio при этом используются алгоритмы, в которых каждое поле анализируемого набора обрабатывается независимо от остальных полей, то есть данные обрабатываются по частям. По этой причине такая предобработка получила название парциальной. В числе процедур предобработки данных, реализованных в Deductor Studio, входят сглаживание, удаление шумов, редактирование аномальных значений, заполнение пропусков в рядах данных.

1. Аппроксимация – пропущенные данные восстанавливаются методом аппроксимации.

2. Максимальное правдоподобие – алгоритм подставляет наиболее вероятные значения вместо пропущенных данных.

Постановка задачи

Рассмотрим применение парциальной обработки данных на примере восстановления массива значений измерений, полученных при построении функции Y = Cos(x) на отрезке от 0 до 3,14. Шаг изменения аргумента x – 0,1.

Исходные данные (фрагмент):
x      | y = Cos(x)
--------------------
0.0    | 1.0000
0.1    | 0.9950
0.2    | 0.9801
0.3    | 0.9553
0.4    | ??? (пропуск)
0.5    | 0.8776
0.6    | 0.8253
0.7    | ??? (пропуск)
0.8    | 0.6967
...    | ...
                    

В исходном файле данных удалили 5-6 значений функции Y. Например, для x = 0,4; 0,7; 1,3; 2,0; 2,4; 3,0. Полученные измененные данные вставили в область блокнота в виде таблицы.

Процесс обработки в Deductor Studio

1
Импорт данных

Используя платформу Deductor Studio с помощью Мастера импорта импортируем файл с данными. После импорта файла с пропущенными данными строится диаграмма для визуализации проблемы.

2
Спектральная обработка

Для восстановления данных используем спектральную обработку данных, которая находится в мастере обработки платформы Deductor Studio. Парциальная обработка обеспечивает сглаживание путем удаления шумов из исходного набора данных.

3
Восстановление данных

После обработки спектральным анализом полностью восстанавливаются исходные данные и перестраивается диаграмма построения данных. Визуально можно наблюдать заполнение пропусков и сглаживание функции.

Виды спектральной обработки в Deductor Studio:

Сглаживание данных

Путем указания полосы пропускания. Позволяет устранить высокочастотные шумы и выбросы в данных.

Вычитание шума

Путем указания степени его вычитания. Алгоритм выделяет и удаляет шумовые компоненты из сигнала.

Вейвлет преобразование

Путем указания глубины разложения и порядка вейвлета. Позволяет анализировать данные на разных уровнях детализации.

О вейвлет-преобразовании:

Вейвлеты (от англ. wavelet) — это математические функции, позволяющие анализировать различные частотные компоненты данных. Вейвлет-коэффициенты определяются интегральным преобразованием сигнала. Полученные вейвлет-спектрограммы дают четкую привязку спектра различных особенностей сигналов ко времени.

Вейвлет-преобразование — интегральное преобразование, которое представляет собой свертку вейвлет-функции с сигналом. Это способ преобразования функции (или сигнала) в форму, которая или делает некоторые величины исходного сигнала более поддающимися изучению или позволяет сжать исходный набор данных. Вейвлетное преобразование сигналов является обобщением спектрального анализа.

Визуализация процесса обработки

Сравнение исходных и восстановленных данных

📊
Диаграмма восстановления функции Cos(x)
(В оригинальной статье: график с пропущенными значениями и восстановленной функцией)

На левом графике показаны исходные данные с пропусками, на правом — результат обработки в Deductor Studio после применения спектрального анализа. Визуально можно наблюдать, как восстановилась непрерывная функция Cos(x) без разрывов.

# Пример алгоритма обработки пропусков в Deductor Studio
# 1. Импорт данных с пропусками
data = import_csv("cos_data_with_gaps.csv")

# 2. Применение спектральной обработки
processed_data = spectral_processing(
    data,
    method="wavelet",
    depth=5,
    wavelet_order=3
)

# 3. Восстановление пропущенных значений
restored_data = fill_gaps(
    processed_data,
    method="approximation"
)

Методы восстановления данных в Deductor Studio

Платформа Deductor Studio предлагает несколько методов для обработки и восстановления данных:

Линейная интерполяция Полиномиальная аппроксимация Сплайны Метод скользящего среднего Экспоненциальное сглаживание Вейвлет-преобразование Метод максимального правдоподобия

Каждый из этих методов имеет свои преимущества и область применения:

  • Линейная интерполяция — простой и быстрый метод для данных с линейной зависимостью
  • Полиномиальная аппроксимация — подходит для нелинейных зависимостей различной сложности
  • Вейвлет-преобразование — наиболее эффективно для обработки сигналов с различными частотными компонентами
  • Метод максимального правдоподобия — статистически обоснованный метод, учитывающий распределение данных

Выводы

В данной статье рассмотрен один из способов восстановления пропущенных данных, а именно парциальная обработка данных. Данный способ используется при большом объеме данных и является наиболее эффективным не только в математике, но и в других областях знаний.

Платформа Deductor Studio предоставляет комплексный инструментарий для предобработки данных, включая:

  • Эффективные алгоритмы восстановления пропущенных значений
  • Мощные методы спектральной обработки и фильтрации шумов
  • Гибкие настройки параметров обработки под конкретные задачи
  • Визуализацию результатов до и после обработки

Применение таких инструментов позволяет значительно повысить качество исходных данных перед дальнейшим анализом, что в конечном итоге приводит к более точным и надежным результатам исследований.

Литература

  1. Курносов М.Г. Анализ и организация функционирования вычислительных систем / Курносов М.Г., Берлизов Д.М. — Новосибирск : Автограф, 2020. — 54 с.
  2. Александровская Ю.П. Многомерный статистический анализ в экономике : учебное пособие / Александровская Ю.П. — Казань : Казанский национальный исследовательский технологический университет, 2017. — 96 с.
  3. Михальчук А.А. Многомерный статистический анализ эколого-геохимических измерений. Часть II. Компьютерный практикум : учебное пособие / Михальчук А.А., Язиков Е.Г. — Томск : Томский политехнический университет, 2015. — 152 с.