المشكلة:
توقع متوسط درجة الحرارة اليومية لـ 321 مدينة حول العالم، اعتمادًا على بيانات ضخمة (~2.9 مليون صف) تمتد من 1995 لـ 2020 — مع تحدي إضافي إن الداتاسيت كان بيستخدم القيمة -99 كرمز للبيانات الناقصة بدل الفراغ العادي، وده لو اتعامل معاه غلط بيتحسب كأنه درجة حرارة حقيقية شديدة البرودة ويخرب النموذج بالكامل.
الحل:
عملت تنظيف شامل للبيانات (التعامل مع القيم الشاذة -99، الـ IQR-based outlier treatment، فلترة السنين والأيام غير المنطقية)، وحللت الأنماط الموسمية والزمنية للحرارة، بعدين درّبت وقارنت موديلين: Decision Tree وRandom Forest.
النتيجة:
Decision Tree حقق دقة R² تبلغ 90.87% (MAE: 3.96، RMSE: 5.63)، متفوقًا على Random Forest اللي حقق 85.90% — نتيجة لافتة لأنها عكس التوقع الشائع بإن الـ Random Forest دايمًا بيفوق الموديل المنفرد، وده بيوضح أهمية اختبار الموديلات فعليًا بدل الاعتماد على القواعد العامة.