من هنا بدأت رحلة بناء نظام يساعد على البحث داخل المكتبات الإسلامية بشكل ذكي، سريع، وموثوق… بدون الوقوع في مشكلة الـ Hallucinations المنتشرة في كثير من أنظمة الـ LLMs.
لكن مع الوقت، المشروع لم يعد مجرد Chatbot، بل تحول إلى Advanced Arabic RAG System مصمم خصيصًا للتعامل مع النصوص الشرعية وفهم السياق العربي بشكل دقيق.
🛠️ ماذا يوجد خلف "تبيان AI"؟
معالجة أكثر من 14,000 صوره من:
شروحات الشيخ ابن عثيمين
تفسير السعدي
مع تصميم Dual Vector Store Architecture بحيث يكون لكل مصدر قاعدة استرجاع مستقلة لمنع
اختلاط السياقات والحفاظ على دقة الإجابة.
استخدام Hybrid Search بدلًا من Semantic Search فقط:
النظام يجمع بين:
Dense Retrieval باستخدام BGE-M3 Embeddings
Sparse / Keyword-based Retrieval
ثم دمج النتائج للحصول على أفضل Context ممكن قبل توليد الإجابة.
وده حسن بشكل واضح جودة الاسترجاع خصوصًا مع المصطلحات الشرعية والأسئلة الطويلة.
إضافة مرحلة Reranking باستخدام BGE-Reranker (Cross-Encoder)
بحيث يتم إعادة ترتيب الـ Chunks المسترجعة وفهم علاقتها بالسؤال بشكل أعمق قبل إرسالها للـ LLM.
النتيجة:
تقليل الـ Noise وتحسين دقة الإجابات بشكل ملحوظ.
دعم البحث الصوتي اللحظي:
تم تشغيل Faster-Whisper على CUDA محليًا بالكامل (Local Inference)، مما وفر:
سرعة استجابة عالية
دقة ممتازة في تحويل الصوت لنص
تجربة استخدام طبيعية بدون الاعتماد على APIs خارجية
التفاعل الصوتي (TTS):
تم دمج Edge-TTS مع معالجة مخصصة للنصوص العربية لإضافة:
pauses طبيعية
سرعة نطق متزنة
إخراج صوتي أكثر هدوءًا ووضوحًا
من أكثر التحديات الهندسية التي واجهتني:
بناء Pipeline مستقرة للتعامل مع:
STT → Retrieval → Reranking → Generation → TTS
إدارة الـ Mode Switching بين الكتابة والصوت بدون التأثير على الأداء.
تحسين استهلاك الـ GPU وتشغيل مكونات الـ RAG والـ Whisper بالتوازي مع الحفاظ على Stability
الهدف من "تبيان AI":
ليس فقط الإجابة على الأسئلة…
بل تحويل التراث الإسلامي إلى تجربة بحث ذكية وتفاعلية تساعد أي شخص يصل للمعلومة الموثقة بسرعة وبطريقة منظمة.
الفيديو المرفق يعرض تجربة فعلية للنظام:
البحث الصوتي
الـ Hybrid Search
الـ Reranking
الردود الصوتية الذكية
الاستجابة الفعلية