Аннотация
Рассмотрены возможности анализа данных, которые не соответствуют определенным критериям качества. Предварительная обработка таких данных становится необходимым шагом для обеспечения удовлетворительного результата анализа. Необходимость в предварительной обработке возникает независимо от того, какие алгоритмы и технологии используются. В данной статье для обработки таких данных применяется платформа DEDUCTOR STUDIO.
Общая постановка проблемы
Если анализируемые данные не соответствуют определенным критериям качества, то их предварительная обработка становится необходимым шагом для обеспечения удовлетворительного результата анализа. Необходимость в предварительной обработке возникает независимо от того, какие алгоритмы и технологии используются. Также эта задача может представлять самостоятельную ценность в областях, не имеющих непосредственное отношение к анализу данных. Очевидно, что исходные данные чаще всего нуждаются в очистке.
- Аномалии – выявление и обработка выбросов в данных
- Пропуски – восстановление отсутствующих значений
- Шумы – фильтрация случайных помех в измерениях
- Некорректные форматы – приведение данных к единому стандарту
- Дублирование – устранение повторяющихся записей
В процессе парциальной обработки восстанавливаются пропущенные данные, редактируются аномальные значения, проводится спектральная обработка. В Deductor Studio при этом используются алгоритмы, в которых каждое поле анализируемого набора обрабатывается независимо от остальных полей, то есть данные обрабатываются по частям. По этой причине такая предобработка получила название парциальной. В числе процедур предобработки данных, реализованных в Deductor Studio, входят сглаживание, удаление шумов, редактирование аномальных значений, заполнение пропусков в рядах данных.
1. Аппроксимация – пропущенные данные восстанавливаются методом аппроксимации.
2. Максимальное правдоподобие – алгоритм подставляет наиболее вероятные значения вместо пропущенных данных.
Постановка задачи
Рассмотрим применение парциальной обработки данных на примере восстановления массива значений измерений, полученных при построении функции Y = Cos(x) на отрезке от 0 до 3,14. Шаг изменения аргумента x – 0,1.
x | y = Cos(x)
--------------------
0.0 | 1.0000
0.1 | 0.9950
0.2 | 0.9801
0.3 | 0.9553
0.4 | ??? (пропуск)
0.5 | 0.8776
0.6 | 0.8253
0.7 | ??? (пропуск)
0.8 | 0.6967
... | ...
В исходном файле данных удалили 5-6 значений функции Y. Например, для x = 0,4; 0,7; 1,3; 2,0; 2,4; 3,0. Полученные измененные данные вставили в область блокнота в виде таблицы.
Процесс обработки в Deductor Studio
Используя платформу Deductor Studio с помощью Мастера импорта импортируем файл с данными. После импорта файла с пропущенными данными строится диаграмма для визуализации проблемы.
Для восстановления данных используем спектральную обработку данных, которая находится в мастере обработки платформы Deductor Studio. Парциальная обработка обеспечивает сглаживание путем удаления шумов из исходного набора данных.
После обработки спектральным анализом полностью восстанавливаются исходные данные и перестраивается диаграмма построения данных. Визуально можно наблюдать заполнение пропусков и сглаживание функции.
Виды спектральной обработки в Deductor Studio:
Путем указания полосы пропускания. Позволяет устранить высокочастотные шумы и выбросы в данных.
Путем указания степени его вычитания. Алгоритм выделяет и удаляет шумовые компоненты из сигнала.
Путем указания глубины разложения и порядка вейвлета. Позволяет анализировать данные на разных уровнях детализации.
О вейвлет-преобразовании:
Вейвлеты (от англ. wavelet) — это математические функции, позволяющие анализировать различные частотные компоненты данных. Вейвлет-коэффициенты определяются интегральным преобразованием сигнала. Полученные вейвлет-спектрограммы дают четкую привязку спектра различных особенностей сигналов ко времени.
Вейвлет-преобразование — интегральное преобразование, которое представляет собой свертку вейвлет-функции с сигналом. Это способ преобразования функции (или сигнала) в форму, которая или делает некоторые величины исходного сигнала более поддающимися изучению или позволяет сжать исходный набор данных. Вейвлетное преобразование сигналов является обобщением спектрального анализа.
Визуализация процесса обработки
Сравнение исходных и восстановленных данных
На левом графике показаны исходные данные с пропусками, на правом — результат обработки в Deductor Studio после применения спектрального анализа. Визуально можно наблюдать, как восстановилась непрерывная функция Cos(x) без разрывов.
# 1. Импорт данных с пропусками
data = import_csv("cos_data_with_gaps.csv")
# 2. Применение спектральной обработки
processed_data = spectral_processing(
data,
method="wavelet",
depth=5,
wavelet_order=3
)
# 3. Восстановление пропущенных значений
restored_data = fill_gaps(
processed_data,
method="approximation"
)
Методы восстановления данных в Deductor Studio
Платформа Deductor Studio предлагает несколько методов для обработки и восстановления данных:
Каждый из этих методов имеет свои преимущества и область применения:
- Линейная интерполяция — простой и быстрый метод для данных с линейной зависимостью
- Полиномиальная аппроксимация — подходит для нелинейных зависимостей различной сложности
- Вейвлет-преобразование — наиболее эффективно для обработки сигналов с различными частотными компонентами
- Метод максимального правдоподобия — статистически обоснованный метод, учитывающий распределение данных
Выводы
В данной статье рассмотрен один из способов восстановления пропущенных данных, а именно парциальная обработка данных. Данный способ используется при большом объеме данных и является наиболее эффективным не только в математике, но и в других областях знаний.
Платформа Deductor Studio предоставляет комплексный инструментарий для предобработки данных, включая:
- Эффективные алгоритмы восстановления пропущенных значений
- Мощные методы спектральной обработки и фильтрации шумов
- Гибкие настройки параметров обработки под конкретные задачи
- Визуализацию результатов до и после обработки
Применение таких инструментов позволяет значительно повысить качество исходных данных перед дальнейшим анализом, что в конечном итоге приводит к более точным и надежным результатам исследований.
Литература
- Курносов М.Г. Анализ и организация функционирования вычислительных систем / Курносов М.Г., Берлизов Д.М. — Новосибирск : Автограф, 2020. — 54 с.
- Александровская Ю.П. Многомерный статистический анализ в экономике : учебное пособие / Александровская Ю.П. — Казань : Казанский национальный исследовательский технологический университет, 2017. — 96 с.
- Михальчук А.А. Многомерный статистический анализ эколого-геохимических измерений. Часть II. Компьютерный практикум : учебное пособие / Михальчук А.А., Язиков Е.Г. — Томск : Томский политехнический университет, 2015. — 152 с.