الهدف
بنهاية هذا الدرس، سيكون الطالب قادرًا على شرح مكونات الشبكة العصبية الاصطناعية وكيفية التعلم، وتمييز تطبيقات التعلم العميق الرئيسية.
شرح الدرس
الشبكة العصبية الاصطناعية (ANN): مستوحاة من الدماغ البشري. تتكوّن من:
- طبقة المدخلات (Input Layer): تستقبل البيانات
- طبقات خفية (Hidden Layers): تُعالج وتستخرج الميزات
- طبقة المخرجات (Output Layer): النتيجة النهائية
كل خلية (Neuron) تحمل وزنًا (Weight) يُعدَّل خلال التدريب.
Backpropagation: الخوارزمية التي تُعدّل الأوزان بناءً على الخطأ لتحسين أداء الشبكة.
التعلم العميق (Deep Learning): شبكات عصبية بطبقات خفية كثيرة (عميقة) قادرة على تعلم ميزات معقدة تلقائيًا من البيانات الخام.
أنواع شائعة:
CNN (للصور)، RNN/LSTM (للتسلسل — نصوص/صوت)، Transformer (النصوص والمهام العامة).
أسئلة تدريبية
1. كيف ‘يتعلم’ الخلية العصبية الاصطناعية؟ ما دور الأوزان ودالة التنشيط في هذه العملية؟
عرض الإجابة
كل خلية تستقبل مدخلات مُضروبة في أوزان (تُمثّل أهمية كل مدخل)، تجمعها، وتُمرّرها عبر دالة تنشيط (Activation Function) تُقرر ما إذا كانت الخلية ‘تُطلق’. دالة التنشيط تُضيف اللاخطية للشبكة مما يُمكّنها من تعلم أنماط معقدة. التعلم: يُعدّل Backpropagation الأوزان تدريجيًا لتقليل الخطأ.
2. ما CNN (Convolutional Neural Network)؟ ولماذا هي الأنسب للصور دون غيرها؟
عرض الإجابة
CNN: شبكة عصبية تستخدم عمليات الالتفاف (Convolution) لاكتشاف الميزات المكانية (حواف، أشكال، أنماط) في الصور. الأنسب للصور لأن: (1) تحافظ على العلاقات المكانية (بيكسل مجاور لبيكسل). (2) تتشارك الأوزان عبر كل الصورة (Filter يُطبَّق في كل مكان) — كفاءة عالية. (3) تدريجيًا تتعلم ميزات أبسط (حواف) للأكثر تعقيدًا (وجوه، أشياء).
3. ما RNN وLSTM؟ وما السبب الذي يجعلهما مناسبَين للبيانات التسلسلية (كالنصوص والصوت)؟
عرض الإجابة
RNN (Recurrent): شبكة تحتفظ بـ ‘ذاكرة’ من السياق السابق — مخرج كل خلية يُغذّي الخلية التالية. مناسبة للتسلسل لأن معنى الكلمة يعتمد على ما سبقها. LSTM (Long Short-Term Memory): تحل مشكلة RNN في نسيان السياق البعيد — تُخزّن معلومات طويلة الأمد بشكل انتقائي. مثال: في الترجمة، LSTM يتذكر الفاعل في بداية الجملة ليُترجم الفعل في آخرها.
4. ما الـ Transformer؟ ولماذا هو الأساس لمعظم نماذج اللغة الكبيرة (GPT, BERT)؟
عرض الإجابة
Transformer: بنية شبكة عصبية تستخدم آلية الانتباه الذاتي (Self-Attention) لمعالجة كل عناصر التسلسل في آن واحد (موازية) وتحديد أهمية كل كلمة في سياق الأخريات. هو الأساس لـ LLMs لأن: (1) يُعالج بشكل متوازٍ (أسرع من RNN في التدريب). (2) يُمسك علاقات بُعدية في النص. (3) قابل للتوسع لمليارات الأوزان. (4) يُعمّم على مهام متعددة.
5. ما الفرق بين Vanishing Gradient وExploding Gradient في تدريب الشبكات العميقة؟ وكيف تُعالجان؟
عرض الإجابة
Vanishing Gradient: أثناء Backpropagation، التدرجات تُضرب بأرقام صغيرة (<1) وتتناقص حتى تكاد تختفي في الطبقات الأولى — لا تتعلم. Exploding Gradient: العكس — تتضاعف وتنفجر. الحلول: Vanishing: استخدام دالة تنشيط ReLU بدلًا من Sigmoid، Batch Normalization، Residual Connections (ResNet). Exploding: Gradient Clipping (تحديد أقصى قيمة للتدرج).
6. ما GAN (Generative Adversarial Network)؟ وما التطبيقات التي تعتمد عليها؟
عرض الإجابة
GAN: بنيتان متنافستان: المولّد (Generator) يُنشئ بيانات مزيفة (صور، نصوص) والمُميّز (Discriminator) يُحاول كشفها. التدريب متبادل — كلما تحسّن المُميّز، تحسّن المولّد أيضًا حتى ينتج بيانات واقعية. التطبيقات: Deepfakes، توليد صور مزيفة لأشخاص غير موجودين، تحسين دقة الصور (Super-Resolution)، توليد صور فنية.
7. ما Transfer Learning في سياق Deep Learning؟ اضرب مثالًا من الرعاية الصحية.
عرض الإجابة
Transfer Learning في DL: أخذ نموذج DL مُدرَّب على ImageNet (ملايين الصور) واستخدام طبقاته الأولى (تعلمت حواف وأشكال عامة) كأساس لمهمة طبية بدلًا من البدء من صفر. المثال: نموذج ResNet مُدرَّب على ImageNet يُستخدم لتصنيف صور الجلد (حميدة/خبيثة) بـ Fine-tuning على آلاف الصور الطبية فقط — بدلًا من ملايين. الأداء يتجاوز أحيانًا الأطباء.
8. ما الفرق بين Underfitting وOverfitting في الشبكات العصبية؟ وكيف نُشخّص كلًا منهما؟
عرض الإجابة
Underfitting: النموذج بسيط جدًا لا يلتقط تعقيد البيانات — دقة منخفضة على التدريب والاختبار معًا. التشخيص: Learning curves لا تتحسن. Overfitting: النموذج معقد جدًا حفظ التدريب — دقة عالية على التدريب ومنخفضة على الاختبار. التشخيص: فجوة كبيرة بين أداء التدريب والاختبار في Learning curves. الحل للأول: زيادة التعقيد، بيانات أكثر. الحل للثاني: Regularization (Dropout)، بيانات أكثر.
9. ما Dropout في تدريب الشبكات العصبية؟ وكيف يُقلل Overfitting؟
عرض الإجابة
Dropout: خلال التدريب، تُعطَّل خلايا عصبية عشوائية بنسبة معينة (مثلًا 50%) في كل تكرار. النتيجة: الشبكة لا تستطيع الاعتماد على أي مجموعة معينة من الخلايا — تضطر لتعلم تمثيلات موزعة. يُقلل Overfitting لأنه يُجبر الشبكة على تعلم ميزات مفيدة بشكل عام وليس حفظ بيانات التدريب. عند التنبؤ: كل الخلايا تعمل.
10. كيف يختلف التعلم العميق (Deep Learning) عن التعلم الآلي التقليدي (Classical ML) في طريقة الاستخراج والمعالجة؟
عرض الإجابة
Classical ML: يتطلب Feature Engineering يدوي — خبير يُستخرج الميزات ذات الصلة ثم يُغذّيها للنموذج. Deep Learning: يتعلم الميزات تلقائيًا من البيانات الخام (البيكسلات مباشرة ← ليس ‘الحواف’ مستخرجة يدويًا). الميزة: DL يُزيل عبء Feature Engineering ويجد أنماطًا معقدة يصعب وصفها يدويًا. العيب: يحتاج بيانات وحوسبة أكثر بكثير.
11. ما Batch Size وEpoch وLearning Rate في تدريب الشبكات العصبية؟
عرض الإجابة
Batch Size: عدد الأمثلة المُستخدمة لحساب تحديث الأوزان كل مرة. كبير = استقرار، صغير = تحديثات أكثر وأسرع. Epoch: مرور كامل لكل بيانات التدريب مرة واحدة. كثير من الـ Epochs → Overfitting محتمل. Learning Rate: معدل تعديل الأوزان كل تكرار. كبير = قفز وعدم استقرار. صغير = تعلم بطيء. ضبطها توازن حساس.
12. ما مستقبل التعلم العميق؟ ما التطبيقات القادمة التي ستغيّر القطاعات في السنوات العشر القادمة؟
عرض الإجابة
التطبيقات القادمة: (1) طب شخصي: DL يُحلل الجينوم الكامل لاقتراح علاج مُخصَّص. (2) اكتشاف الأدوية: توقع تركيبات دوائية وتأثيراتها. (3) الرعاية الاجتماعية: تحليل المشاعر والحالة النفسية من الصوت والصورة. (4) اندماج الأشكال: LLMs تتكامل مع الصوت والصورة والفيديو في نظام واحد شامل. (5) العلوم المادية: توقع ثنيات البروتينات (AlphaFold) وتصميم مواد جديدة.