يركز هذا المشروع على بناء نموذج تصنيفي (Classification Model) للتنبؤ بما إذا كان الشخص مصابًا بمرض السكري أم لا، اعتمادًا على مجموعة من الخصائص الصحية الأساسية.
يتضمن مجموعة البيانات (Dataset) الخصائص التالية:
الجنس: النوع البيولوجي للفرد
العمر: عمر الشخص بالسنوات
ارتفاع ضغط الدم (hypertension): هل يعاني الفرد من ضغط دم مرتفع (0 = لا، 1 = نعم)
أمراض القلب (heart_disease): وجود مرض في القلب (0 = لا، 1 = نعم)
تاريخ التدخين (smoking_history): حالة التدخين (لم يدخن، مدخن سابق، مدخن حالي)
مؤشر كتلة الجسم (BMI): مقياس لوزن الجسم بالنسبة للطول
مستوى HbA1c: متوسط مستوى السكر في الدم خلال آخر 2–3 أشهر
مستوى الجلوكوز في الدم: مستوى السكر الحالي في الدم
السكري (diabetes): المتغير المستهدف الذي يشير إلى حالة السكري (0 = لا، 1 = نعم)
الهدف من المشروع هو استخدام خوارزميات تعلم الآلة (Machine Learning) لتصنيف الأفراد إلى فئتين: مصابين وغير مصابين بالسكري، وذلك لدعم الاكتشاف المبكر والتدخل الوقائي
لخوارزميات المستخدمة:
تمت تجربة عدة خوارزميات لتحديد النموذج الأكثر دقة، من بينها:
Logistic Regression
Random Forest Classifier
Support Vector Machine (SVM)
K-Nearest Neighbors (KNN)
النتائج:
بعد معالجة البيانات وتحسين اختيار الخصائص، حقق النموذج دقة مرتفعة في التنبؤ بحالات السكري. أظهرت خوارزمية Random Forest أداءً متميزًا من حيث التوازن بين الدقة والاستدعاء، مما يجعلها الأنسب للتطبيق في هذا السيناريو.
الأدوات المستخدمة:
Python – Pandas – NumPy – Scikit-learn – Matplotlib – Seaborn