Excel Cleaning
Clean missing values, whitespace and duplicate rows from an .xlsx workbook.
Overview
Excel exports frequently contain missing values, duplicated records and inconsistent text spacing. This example applies the v1.0 controlled cleaning pipeline and writes a clean workbook.
Dataset
sales_q3.xlsx12 rows × 8 columnsorder_idcustomerregionamountdatecurrencydiscountstatus
Synthetic formatted workbook with missing amounts, whitespace and a duplicate row.
Python code
excel-cleaning.py
python
import eazydatafix as edf
config = edf.FixConfig(
missing_markers=("", "N/A"),
)
result = edf.fix("sales_q3.xlsx", config)
result.dataset.to_excel(
"sales_q3.clean.xlsx", index=False
)
print(result.dataset.shape)
print(result.applied_fixes)Expected output
Python 3.11
>>> result = edf.fix("sales_q3.xlsx", config)(11, 8)['Trimmed leading/trailing whitespaces.', 'Removed 1 duplicate row(s).', "Filled numeric column 'amount' using median."]