نموذج تصنيف يتنبأ بما إذا كان دخل الشخص السنوي يتجاوز 50 ألف دولار أم لا، بناءً على البيانات (العمر، التعليم، ساعات العمل، الحالة الاجتماعية، وغيرها).
المشروع يغطي دورة عمل كاملة لمشروع Machine Learning تقليدي بدءاً من تنظيف البيانات وحتى تقييم النموذج.
أبرز ما يميز المشروع:
- Data Cleaning للتعامل مع القيم المفقودة والمكررة
- Exploratory Data Analysis (EDA) لفهم توزيع البيانات والعلاقة بين الخصائص والدخل
- Feature Encoding للخصائص الفئوية وFeature Scaling للخصائص الرقمية
- تدريب نموذج Random Forest مع ضبط ال parametars (300 شجرة، أقصى عمق 15)
- تقييم شامل باستخدام Accuracy، Confusion Matrix، Classification Report، وتحليل أهمية الخصائص (Feature Importance)
- اختبار النموذج على بيانات جديدة للتأكد من جاهزيته للاستخدام الفعلي
الأدوات المستخدمة: Python, scikit-learn, pandas, matplotlib, seaborn