Excel Cleaning

Clean missing values, whitespace and duplicate rows from an .xlsx workbook.

Overview

Excel exports frequently contain missing values, duplicated records and inconsistent text spacing. This example applies the v1.0 controlled cleaning pipeline and writes a clean workbook.

Dataset

sales_q3.xlsx12 rows × 8 columns
order_idcustomerregionamountdatecurrencydiscountstatus

Synthetic formatted workbook with missing amounts, whitespace and a duplicate row.

Python code

excel-cleaning.py
import eazydatafix as edf

config = edf.FixConfig(
    missing_markers=("", "N/A"),
)
result = edf.fix("sales_q3.xlsx", config)
result.dataset.to_excel(
    "sales_q3.clean.xlsx", index=False
)

print(result.dataset.shape)
print(result.applied_fixes)

Expected output

Python 3.11
>>> result = edf.fix("sales_q3.xlsx", config)
(11, 8)
['Trimmed leading/trailing whitespaces.', 'Removed 1 duplicate row(s).', "Filled numeric column 'amount' using median."]