خوارزميات الذكاء الاصطناعي

SHADA

🧠 التركيز البحثي:

SHADA (خوارزمية هجينة تكيفية هرمية ذاتية الإشراف للتعلم العميق) وهي عبارة عن إطار عمل لتدريب التعلم العميق بـ مراحل متعددة يجمع بين التعلم ذاتي الإشراف والهندسة الهجينة الهرمية والتحسين متعدد المهام والتعلم المعزز لمعالجة اللغات الطبيعية والرؤية الحاسوبية.

🏗️ المعمارية:

مشفر هرمي من 4 مراحل (ConvNeXt CNN stem ← مراحل Transformer S1–S4) مع FPN neck

نموذج لغوي كبير (LLM) لفك التشفير فقط للنصوص؛ رأس كشف بنمط DETR

انتباه متعدد الرؤوس مع ترميز موضعي RoPE، وتكامل FlashAttention-2، وانتباه الاستعلام المجمع (GQA)، ودعم ذاكرة التخزين المؤقت KV

📈 خط التدريب:

1. التدريب المسبق ذاتي الإشراف (MAE + Contrastive + DINO)

2. ضبط دقيق متوسط متعدد المهام (GradNorm + تعلم المنهج)

3. ضبط دقيق تحت الإشراف (LLRD, R-Drop, GMP pruning)

4. تحسين النشر (كمية QAT/PTQ، GQA)

🎯 الميزات الرئيسية:

حقن LoRA (الرتبة 16) في جميع مصفوفات إسقاط الانتباه؛ أقل من 1% من المعلمات التي تم تدريبها

PPO (RLHF مع GAE، التحكم في KL) و DPO (تحسين التفضيل المباشر)

تقليم الحجم التدريجي (GMP)، تكميم AWQ INT4 / INT8، QAT

💻 التقنيات:

PyTorch 2.2+, FSDP + DeepSpeed ZeRO-3, FlashAttention-2, AutoAWQ, bitsandbytes, LoRA, RoPE

التقنيات المستخدمة

PythonPyTorch 2.2+FSDPDeepSpeed ZeRO-3FlashAttention-2AutoAWQbitsandbytesLoRARoPE
0xC2
0xB3
0xC2
0x3A
0xE0
0xB.
0xEC
0xCF
0xB.
0x44
0xF3
0x51
0xF1
0x60
0xC5
0xB2
>> INITIALIZING SHADA CORE
>> LOADED_LAYERS: 168
>> GPU_ACCELERATION: ACTIVE
LOSS_FUNCTION: SOFTMAX
OPTIMIZER: ADAMX
STATUS: OPTIMIZING
زيارة موقع المشروع

SHADA

Neural Core System