طورت نظامًا ذكيًا لاستخراج البيانات المنظمة من ملفات PDF الطبية باللغة الإيطالية، بما في ذلك الملفات النصية والممسوحة ضوئيًا (Scanned PDFs). يهدف المشروع إلى تحويل المستندات الطبية غير المنظمة إلى بيانات قابلة للبحث والتخزين داخل قاعدة بيانات، مما يسهل إدارتها وتحليلها.
المهام التي قمت بتنفيذها
استخراج النصوص من ملفات PDF.
معالجة الملفات الممسوحة ضوئيًا باستخدام OCR.
استخراج الجداول والبيانات الطبية.
استخدام تقنيات معالجة اللغات الطبيعية (NLP) لفهم محتوى المستندات.
تنظيم البيانات واستخراج المعلومات المهمة مثل بيانات المرضى، نتائج التحاليل، وتقارير الفحوصات.
حفظ البيانات المستخرجة داخل قاعدة بيانات SQLite.
التعامل مع أنواع متعددة من التقارير الطبية مع تحسين دقة الاستخراج.