قمت بتصميم وتنفيذ منصة بيانات متكاملة End-to-End لمعالجة وتحليل البيانات بداية من جمع البيانات الخام وحتى توفيرها للاستخدام التحليلي. المشروع يحاكي البنية المستخدمة في أنظمة Modern Data Platforms داخل الشركات.
معمارية النظام
1. Data Ingestion
تم جمع البيانات من مصادر مختلفة مثل:
REST APIs
ملفات CSV
قواعد بيانات تشغيلية
تم إدخال البيانات إلى Data Lake بشكل أولي باستخدام Python ingestion scripts.
2. Data Lake Storage
تم تخزين البيانات الخام داخل Data Lake مع تقسيمها إلى طبقات:
Raw Layer: البيانات كما تم جمعها
Processed Layer: بيانات بعد التنظيف
Analytics Layer: بيانات جاهزة للتحليل
3. Data Processing
تم استخدام Apache Spark لمعالجة البيانات الضخمة وتنفيذ عمليات:
Data Cleaning
Data Transformation
Aggregations
Feature Engineering
4. Workflow Orchestration
تم استخدام Apache Airflow لإدارة وتشغيل الـ pipelines حيث يقوم Airflow بـ:
جدولة عمليات ETL
إدارة dependencies بين المهام
مراقبة تنفيذ المهام
5. Data Warehouse Layer
تم تحميل البيانات النهائية إلى PostgreSQL Data Warehouse بحيث يمكن استخدامها في التحليل أو التقارير.
ميزات المشروع
منصة بيانات End-to-End Data Platform
بنية Data Lake Architecture متعددة الطبقات
أتمتة كاملة للـ pipelines باستخدام Airflow
معالجة بيانات كبيرة باستخدام Apache Spark
تصميم قابل للتوسع يشبه الأنظمة المستخدمة في الشركات التقنية
المهارات المستخدمة
Python
Apache Spark
Apache Airflow
Data Engineering
ETL / ELT Pipelines
Data Lake Architecture
PostgreSQL
Distributed Data Processing
تاريخ الإنجاز
2026