SHADA
🧠 التركيز البحثي:
SHADA (خوارزمية هجينة تكيفية هرمية ذاتية الإشراف للتعلم العميق) وهي عبارة عن إطار عمل لتدريب التعلم العميق بـ مراحل متعددة يجمع بين التعلم ذاتي الإشراف والهندسة الهجينة الهرمية والتحسين متعدد المهام والتعلم المعزز لمعالجة اللغات الطبيعية والرؤية الحاسوبية.
🏗️ المعمارية:
• مشفر هرمي من 4 مراحل (ConvNeXt CNN stem ← مراحل Transformer S1–S4) مع FPN neck
• نموذج لغوي كبير (LLM) لفك التشفير فقط للنصوص؛ رأس كشف بنمط DETR
• انتباه متعدد الرؤوس مع ترميز موضعي RoPE، وتكامل FlashAttention-2، وانتباه الاستعلام المجمع (GQA)، ودعم ذاكرة التخزين المؤقت KV
📈 خط التدريب:
1. التدريب المسبق ذاتي الإشراف (MAE + Contrastive + DINO)
2. ضبط دقيق متوسط متعدد المهام (GradNorm + تعلم المنهج)
3. ضبط دقيق تحت الإشراف (LLRD, R-Drop, GMP pruning)
4. تحسين النشر (كمية QAT/PTQ، GQA)
🎯 الميزات الرئيسية:
• حقن LoRA (الرتبة 16) في جميع مصفوفات إسقاط الانتباه؛ أقل من 1% من المعلمات التي تم تدريبها
• PPO (RLHF مع GAE، التحكم في KL) و DPO (تحسين التفضيل المباشر)
• تقليم الحجم التدريجي (GMP)، تكميم AWQ INT4 / INT8، QAT
💻 التقنيات:
PyTorch 2.2+, FSDP + DeepSpeed ZeRO-3, FlashAttention-2, AutoAWQ, bitsandbytes, LoRA, RoPE
التقنيات المستخدمة
SHADA
Neural Core System