تفاصيل العمل

المشكلة:

توقع متوسط درجة الحرارة اليومية لـ 321 مدينة حول العالم، اعتمادًا على بيانات ضخمة (~2.9 مليون صف) تمتد من 1995 لـ 2020 — مع تحدي إضافي إن الداتاسيت كان بيستخدم القيمة -99 كرمز للبيانات الناقصة بدل الفراغ العادي، وده لو اتعامل معاه غلط بيتحسب كأنه درجة حرارة حقيقية شديدة البرودة ويخرب النموذج بالكامل.

الحل:

عملت تنظيف شامل للبيانات (التعامل مع القيم الشاذة -99، الـ IQR-based outlier treatment، فلترة السنين والأيام غير المنطقية)، وحللت الأنماط الموسمية والزمنية للحرارة، بعدين درّبت وقارنت موديلين: Decision Tree وRandom Forest.

النتيجة:

Decision Tree حقق دقة R² تبلغ 90.87% (MAE: 3.96، RMSE: 5.63)، متفوقًا على Random Forest اللي حقق 85.90% — نتيجة لافتة لأنها عكس التوقع الشائع بإن الـ Random Forest دايمًا بيفوق الموديل المنفرد، وده بيوضح أهمية اختبار الموديلات فعليًا بدل الاعتماد على القواعد العامة.

بطاقة العمل

اسم المستقل
عدد الإعجابات
0
تاريخ الإضافة
تاريخ الإنجاز
المهارات