An end-to-end data processing, exploratory data analysis (EDA), and customer profiling pipeline applied to a real-world transnational dataset containing 541,909 raw transaction records.
Modern e-commerce enterprises require granular insights into customer purchasing behaviors to optimize target marketing and minimize churn. This project builds a robust data engineering and analytics pipeline that:
- Cleans and transforms noisy operational transaction data (handling cancellations, unit pricing anomalies, and missing identities).
- Engineers temporal and financial metrics (RFM readiness, transaction totals, time features).
- Extracts high-value business insights across 3,665 product SKUs, 4,338 unique customers, and 37 countries.
- Data Quality & Retention: Processed and cleaned 541,909 raw entries down to 392,692 high-fidelity records (72.46% retention rate) after removing 149,217 noisy rows (cancellations, negative/zero prices, missing
CustomerID, exact duplicates). - Total Revenue Analyzed: £8,887,208.89 generated across 18,532 unique invoices.
- Core Metrics Summary:
- Basket Quantity: Mean = 9.55 units (Median = 3.0 units).
- Unit Price: Mean = £4.61 (Median = £2.08).
- Order Value: Mean = £22.63 (Median = £9.90).
ecommerce-customer-analytics-pipeline/
├── notebooks/
│ └── customer_segmentation_eda.ipynb # Complete ETL, Cleaning & Visualization Pipeline
├── docs/
│ └── project_report.pdf # Executive Summary & Technical Presentation
├── .gitignore # Python gitignore configuration
├── LICENSE # MIT License
└── README.md # Technical Project Overview