مشروع بايثون يطبق مفهوم خطوط معالجة البيانات (ETL) لاستخراج وتجهيز بيانات وظائف مهندسي البيانات من موقع Wuzzuf، بهدف تحويل البيانات الخام إلى مجموعة بيانات نظيفة وقابلة للتحليل.
يقوم المشروع بجمع إعلانات الوظائف باستخدام تقنيات Web Scraping عبر مكتبات Requests و BeautifulSoup، مع دعم التنقل التلقائي بين الصفحات لضمان استخراج عدد كبير من النتائج. بعد ذلك، يتم تحليل البيانات واستخراج الحقول الأساسية مثل: المسمى الوظيفي، اسم الشركة، الموقع، نوع الوظيفة، مستوى الخبرة، وتاريخ النشر.
تشمل مرحلة التحويل (Transformation) معالجة التواريخ النسبية وتحويلها إلى تواريخ فعلية بصيغة قياسية، بالإضافة إلى تنظيف البيانات باستخدام Pandas من خلال إزالة القيم المفقودة والتكرارات، مما يضمن جودة ودقة البيانات النهائية.
في مرحلة التحميل (Load)، يتم تصدير البيانات إلى ملفات بصيغة CSV:
Raw.csv: البيانات الخام قبل المعالجة
cleaned.csv: بيانات نظيفة ومهيكلة جاهزة للتحليل
يعتمد المشروع على مجموعة تقنيات أساسية تشمل: Python، BeautifulSoup، Requests، Pandas، وCSV، ويعكس سير عمل حقيقي يُستخدم في هندسة البيانات لجمع بيانات سوق العمل وتحضيرها للتحليل أو الاستخدام في تطبيقات أخرى.
تم تنفيذ المشروع داخل بيئة Jupyter Notebook، لذا يُنصح بتشغيل جميع الخلايا بالترتيب لضمان عمل خط المعالجة بشكل صحيح.
الهدف من المشروع:
محاكاة سيناريو واقعي لخطوط ETL في مجال هندسة البيانات، مع التركيز على جمع البيانات من مصادر خارجية، معالجتها، وتحويلها إلى صيغة منظمة تدعم اتخاذ القرار والتحليل.