في هذا العمل قمت بتنظيف ومعالجة بيانات مبيعات مكونة من 1338صفًاو 7 أعمدة، باستخدام لغة Python ومكتبة Pandas. الهدف من العملية كان تحويل ملف بيانات خام مليء بالتفاصيل غير المنظمة إلى ملف منظم ونظيف جاهز للاستخدام في التحليل أو بناء نماذج تعلم الآلة (Machine Learning)
معالجة القيم المفقودة (Missing Values):
القيم المفقوده كانت في bmi - region - charges
تم استخدام طرق مثل forward fill و backward fill و filling using median لضمان عدم وجود فراغات أو قيم ناقصة.
النتيجة: جميع الأعمدة أصبحت مكتملة 100% بدون أي بيانات ناقصة
التعامل مع القيم الشاذة (Outliers):
طبقت قاعدة IQR (Interquartile Range) لاكتشاف القيم الغريبة وغير المنطقية.
تم تعديل هذه القيم للحفاظ على دقة البيانات.
تحويل الأعمدة النصية إلى أكواد عددية (Encoding):
الاعمده النصيه مثل ( sex , smoker , region )
باستخدام One-Hot Encoding → فتم إنشاء أعمدة إضافية منطقية (True/False) لكل فئة
كل الأعمدة (bool) الناتجة من One-Hot Encoding تم تحويلها إلى النوع int8 لتوفير الذاكرة
(Data Types Optimization):
تحويل بعض الأعمدة إلى أنواع بيانات أصغر حجمًا مثل int16 لتقليل استهلاك الذاكرة.
النتيجة: حجم الملف انخفض وأصبح أكثر كفاءة
إنشاء أعمدة جديدة للتحليل (Feature Engineering)
أضفت bmi_category (مفيد جدًا في التحليل الصحي).
أضفت ischild لتوضيح الفئة العمرية.
bmi category :
تم تقسيم (BMI) إلى فئات باستخدام pd.cut:
Underweight إذا كان الـ BMI أقل من 18.5.
Normal إذا كان بين 18.5 و25.
Overweight إذا كان بين 25 و30.
Obese إذا تجاوز 30