تفاصيل العمل

قمت بتحميل مجموعة بيانات Netflix باستخدام مكتبة kagglehub من منصة Kaggle، ثم استخدمت مكتبة pandas لقراءة البيانات وتحليلها. في البداية، استعرضت البيانات الأولية باستخدام أوامر مثل head() لعرض أول خمس صفوف، describe() للحصول على الإحصاءات الوصفية، وinfo() للتعرف على أنواع البيانات وعدد القيم غير المفقودة.

بعد ذلك، تحققت من القيم المفقودة باستخدام دالة isnull().sum()، ولاحظت وجود الكثير من القيم الناقصة، خاصة في عمود "Release Year". لمعالجة ذلك، ملأت القيم المفقودة بأكثر القيم تكرارًا باستخدام mode()، وإذا لم يكن هناك قيمة مناسبة، استخدمت 0 كقيمة بديلة.

كما قمت بالكشف عن البيانات المكررة باستخدام دالة duplicated().sum() لتنظيف البيانات بشكل جيد وضمان جودتها. في النهاية، كانت هذه الخطوات تهدف إلى تحضير البيانات لتحليل أعمق أو استخدامها في بناء نماذج تحليلية وتنبؤية مستقبلًا.

إلى جانب تحليل البيانات وتنظيفها، قمت بإنشاء عدة لوحات معلومات (Dashboards) ورسوم بيانية باستخدام مكتبة Matplotlib لاستكشاف البيانات بشكل مرئي. إليك ملخصًا عن هذه اللوحات:

توزيع الأنواع الرئيسية (Main Genre Distribution):

تم إنشاء رسم بياني شريطي (Bar Plot) لعرض عدد الأفلام في كل نوع رئيسي. يساعد هذا في فهم الأنواع الأكثر شيوعًا في البيانات.

توزيع تصنيف النضج العمري (Maturity Rating):

تم إنشاء رسم دائري (Pie Chart) لعرض نسبة كل تصنيف عمري في البيانات. يساعد في معرفة توزيع المحتوى بناءً على التصنيفات العمرية.

توزيع سنوات الإصدار (Year of Release Distribution):

تم إنشاء رسم بياني شريطي لعدد الأفلام التي تم إصدارها منذ عام 2000. يوضح هذا الرسم الاتجاهات الزمنية في إنتاج الأفلام.

توزيع الصوت الأصلي (Original Audio Distribution):

تم إنشاء رسم دائري آخر لتحليل نسبة الأفلام التي تحتوي على الصوت الأصلي مقارنة بغيرها

ملفات مرفقة

بطاقة العمل

اسم المستقل
عدد الإعجابات
0
تاريخ الإضافة
تاريخ الإنجاز
المهارات