Loading and exploring the dataset.
Identifying and handling missing values.
Replacing invalid entries such as "Unknown" with NaN.
Imputing missing numerical values using the mean strategy.
Imputing missing categorical values using the most frequent strategy.
Converting columns to appropriate data types.
Performing descriptive statistical analysis.
Visualizing data distributions using boxplots and distribution plots.
Measuring data skewness and applying transformations such as:
Square Root Transformation
Log Transformation
Detecting outliers using:
Z-Score Method
Interquartile Range (IQR) Method
Removing outliers to improve data quality.
Producing a clean and reliable dataset ready for further analysis, visualization, and machine learning model development.
Outcome:
The final dataset is cleaned, standardized, and optimized for building accurate predictive models and conducting meaningful data analysis.