مشروع متكامل لتحليل البيانات وضبط نموذج تعلم آلي (Machine Learning) للتنبؤ بفرص نجاة الركاب من كارثة سفينة تايتانيك. يعتمد المشروع على تحليل الخصائص الديموغرافية للركاب مثل (السن، الجنس، والدرجة السياحية/الوظيفية) لبناء شجرة قرار (Decision Tree) قادرة على اتخاذ تصنيف دقيق للمسافرين.
الأدوات والبرامج المستخدمة:
Orange Data Mining: بيئة برمجية مرئية متقدمة لتعدين البيانات والتعلم الآلي.
المكتبات والتقنيات المدعومة خلف الكواليس: Python (NumPy, Pandas, Scikit-Learn) لمعالجة وتحليل البيانات إحصائياً
مراحل تنفيذ وتدفق العمل (Workflow Steps):
استيراد وتجهيز البيانات (File & Data Table): استدعاء وقراءة ملف بيانات تايتانيك الذي يحتوي على خصائص الركاب (مثل: Sex, Age, Status) وتحديد المتغير المستهدف للتنبؤ به وهو النجاة (Survived)
التحليل الاستكشافي والتوزيع الإحصائي (Distributions): فحص وتحليل توزيع البيانات إحصائياً لمعرفة نسب النجاة والهلاك بناءً على نوع الراكب وفئته
تدريب النموذج الذكي (Tree Learner): بناء خوارزمية شجرة القرار (Decision Tree) وتدريبها على البيانات لمعرفة القواعد والشروط التي أدت إلى نجاة الركاب
تقييم الأداء واختبار النموذج (Test and Score): إخضاع النموذج لاختبارات تقييم صارمة باستخدام عينات فحص لقياس دقة التنبؤ وحساب مقاييس الأداء مثل (Precision, Recall, F1-Score, AUC) لضمان جودة وتوازن النموذج قبل اعتماده
المحاكاة المرئية لشجرة القرار (Tree Viewer): استخراج المخطط الهيكلي التفاعلي لشجرة القرار لعرض تسلسل القواعد البرمجية التي يتبعها النموذج في اتخاذ قراره بشكل مرئي ومفهوم للمستخدم النهائي.
النتائج المستخلصة:
الوصول إلى نموذج تصنيف ذكي ومستقر قادر على التنبؤ بنجاة أي راكب جديد بدقة عالية مع تقديم تقرير تفاعلي يوضح العوامل الأكثر تأثيراً في النجاة (مثل دور الجنس والسن في فرص البقاء)