تفاصيل العمل

تم تنفيذ هذا المشروع بهدف إجراء تحليل شامل لمجموعة بيانات سفينة تيتانيك باستخدام لغة البرمجة بايثون. تضمن المشروع عدة مراحل أساسية:

1. تحميل البيانات واستكشافها:

تحميل البيانات: تم تحميل مجموعة البيانات من مصدرها الأصلي وتخزينها في إطار بيانات (DataFrame) باستخدام مكتبة Pandas.

استكشاف البيانات: تم استخدام الوظائف الإحصائية والمرئية في Pandas وNumPy لدراسة توزيع البيانات، وتحديد القيم المفقودة، وتحديد أنواع البيانات المختلفة (رقمية، فئوية).

التحليل الإحصائي الأساسي: تم حساب الإحصائيات الوصفية مثل الوسط الحسابي، الوسيط، الانحراف المعياري لوصف السمات الرقمية في البيانات.

ثانيا: تنظيف البيانات وتحويلها (Data Cleaning):

التعامل مع القيم المفقودة: تم التعامل مع القيم المفقودة في عمود العمر باستخدام الاستبدال بالوسط الحسابي، بينما تم التعامل مع القيم المفقودة في عمود الكابينة من خلال إنشاء متغير جديد يشير إلى وجود قيمة مفقودة.

ترميز المتغيرات الفئوية: تم تحويل المتغيرات الفئوية إلى تمثيل رقمي باستخدام تقنية One-Hot Encoding لتسهيل استخدامها في نماذج التعلم الآلي.

هندسة الميزات: تم إنشاء ميزات جديدة مثل "اللقب" و"حجم الأسرة" من خلال استخراج المعلومات من الأعمدة الموجودة، مما ساعد في تحسين أداء النموذج.

ثالثا: تحليل البيانات الاستكشافي (EDA):

التصور: تم استخدام مكتبات مثل Matplotlib وSeaborn لإنشاء رسوم بيانية توضيحية مثل المخططات الشريطية، المخططات الدائرية، ومخططات التوزيع لدراسة العلاقة بين المتغيرات المختلفة وتحديد الأنماط.

تحليل العوامل المؤثرة على البقاء: تم تحليل العلاقة بين المتغيرات مثل الجنس، الفئة العمرية، وفئة الركاب ومعدل البقاء على قيد الحياة باستخدام اختبارات إحصائية مناسبة.

رابعا: معالجة البيانات (Data Processing):

تقسيم البيانات: تم تقسيم مجموعة البيانات إلى مجموعتي تدريب واختبار بنسبة 80% و 20% على التوالي باستخدام تقنية العينة الطبقية للحفاظ على التوزيع الأصلي للبيانات في كل مجموعة.

معايرة البيانات: تم تطبيق معايرة على الميزات الرقمية لضمان أن تكون جميع الميزات لها نفس التأثير على النموذج.