كاشط الويب الذكي متعدد الخيوط (Intelligent Multi-threaded Web Scraper)

تفاصيل العمل

هذا المشروع عبارة عن أداة متقدمة لكشط الويب (Web Scraping) باستخدام Python، مصممة لاستخراج بيانات مستهدفة (مثل البريد الإلكتروني، روابط التواصل الاجتماعي، والرموز البريدية) من قائمة مواقع يتم إدخالها عبر ملف CSV، مع توفير واجهة رسومية سهلة الاستخدام وتحكم كامل في العملية.

التقنيات المستخدمة

Python كلغة أساسية.

Tkinter لإنشاء واجهة رسومية (GUI).

ThreadPoolExecutor لتشغيل مهام الكشط بالتوازي (Multi-threading).

BeautifulSoup لتحليل صفحات HTML.

Requests لجلب محتوى الصفحات.

CSV للتعامل مع إدخال وحفظ البيانات.

JSON لتخزين إعدادات الاستثناءات القابلة للتخصيص.

آلية العمل

1. الإعداد والتحكم عبر الواجهة الرسومية

تحديد ملف CSV يحتوي على روابط المواقع المستهدفة.

اختيار مجلد الإخراج لحفظ النتائج.

تحديد عدد الخيوط (Threads) للعمل بالتوازي.

بدء، إيقاف مؤقت، استئناف، أو إيقاف نهائي للعملية دون تجميد الواجهة.

2. الكشط والمعالجة لكل موقع.

تحليل الصفحة الرئيسية للموقع:

التحقق من محتوى البالغين وتجاهل المواقع غير المناسبة.

استخراج البيانات الأساسية.

البحث الذكي عن صفحات مثل "اتصل بنا" أو "من نحن" وزيارتها لاستخراج بيانات إضافية.

فلترة البيانات:

إزالة المكرر.

تحديد حد أقصى لعدد البيانات.

استبعاد الأنواع غير المرغوبة عبر ملف إعدادات خارجي (scraper_exclusions.json).

تسجيل حالة إعادة التوجيه إذا وُجدت.

كتابة النتائج في CSV مع قفل كتابة لضمان سلامة البيانات.

3. التقرير والانتهاء

عرض تقدم العملية في سجل الحالة على الواجهة بشكل لحظي.

تسجيل جميع الأخطاء في ملف Log للمراجعة.

تنبيه المستخدم عند اكتمال العملية.

بطاقة العمل

اسم المستقل
عدد الإعجابات
0
تاريخ الإضافة
تاريخ الإنجاز
المهارات