الهدف
بنهاية هذا الدرس، سيكون الطالب قادرًا على شرح مفهوم الانحدار الخطي وتفسير نتائجه وتقييم جودة النموذج.
شرح الدرس
الانحدار الخطي البسيط: يُنشئ علاقة خطية بين متغير تابع (Y) ومستقل (X):
y = a + bx
- a: الثابت (قيمة Y حين X=0)
- b: الميل (معدل تغير Y بتغير X وحدة واحدة)
الانحدار المتعدد: عدة متغيرات مستقلة: y = a + b₁x₁ + b₂x₂ + …
مقاييس جودة النموذج:
- R² (معامل التحديد): نسبة التباين في Y المُفسَّرة بالنموذج. R²=1 مثالي، R²=0 لا تفسير.
- RMSE (جذر متوسط مربع الخطأ): متوسط الخطأ في نفس وحدة Y — أصغر أفضل.
الإفراط في التخصيص (Overfitting): النموذج يُطابق بيانات التدريب بشكل مثالي لكنه يفشل مع بيانات جديدة.
أسئلة تدريبية
1. دراسة تجد علاقة بين مساحة الشقة (X) وسعرها (Y): y = 500 + 1200x (السعر بالجنيه، المساحة بالمتر). فسّر المعاملات.
عرض الإجابة
الثابت a=500: الحد الأدنى النظري للسعر عند مساحة صفر (تفسير نظري في هذا السياق). الميل b=1200: كل متر مربع إضافي يرفع السعر بـ 1200 جنيه في المتوسط. إذن شقة 100 م²: y = 500 + 1200×100 = 120,500 جنيه. الميل الموجب يؤكد العلاقة الطردية المنطقية.
2. نموذج انحدار يُعطي R²=0.85. ماذا يعني؟ وما يُفسّر الـ 15% الباقية؟
عرض الإجابة
R²=0.85 يعني: المتغير المستقل (المساحة مثلًا) يُفسّر 85% من التباين في السعر. الـ 15% الباقية: عوامل أخرى لم يتضمنها النموذج — الموقع، الطابق، التشطيبات، قرب المدارس، السوق الكلي. R² مرتفع جيد لكن لا يُقيّم جودة التوقع مع بيانات جديدة (لذا نحتاج التحقق على بيانات اختبار).
3. نموذج انحدار مُدرَّب يُعطي R²=0.99 على بيانات التدريب لكن R²=0.45 على بيانات الاختبار. ما المشكلة؟
عرض الإجابة
Overfitting (الإفراط في التخصيص) — النموذج حفظ البيانات بدل أن يتعلم النمط. يؤدي بشكل مذهل على ما رآه لكن يفشل مع بيانات جديدة. الأسباب: نموذج معقد جدًا (متغيرات كثيرة)، بيانات تدريب قليلة. الحل: تبسيط النموذج (Regularization)، أو المزيد من بيانات التدريب، أو Cross-Validation.
4. شركة عقارات تبني نموذجًا للتنبؤ بأسعار الشقق بمتغيرات: المساحة، الموقع، الطابق. كيف تُقيّم أداء النموذج بشكل صحيح؟
عرض الإجابة
(1) تقسيم البيانات: 70-80% تدريب، 20-30% اختبار (البيانات التي لم يرها النموذج). (2) التدريب على بيانات التدريب فقط. (3) التقييم على بيانات الاختبار بـ RMSE وR². (4) Cross-Validation إذا البيانات محدودة: تقسيم لـ k مجموعات، تدريب k مرة مع تغيير مجموعة الاختبار. (5) مقارنة التوقعات بالأسعار الفعلية في الرسم البياني.
5. ما الفرق بين الانحدار الخطي وانحدار Logistic؟ متى تستخدم كلًا منهما؟
عرض الإجابة
الخطي: يُتنبأ بقيمة مستمرة (السعر، الوزن، درجة الحرارة). Logistic: يُتنبأ بفئة (نعم/لا، مريض/سليم، سبام/غير سبام) — يُخرج احتمالية. الاستخدام: تنبؤ سعر الشقة → خطي. تنبؤ هل البريد سبام؟ → Logistic. تنبؤ هل المريض سيُشفى؟ → Logistic.
6. ما ‘متغيرات مزيفة’ (Spurious Variables) في الانحدار؟ وكيف تضرّ بالتفسير؟
عرض الإجابة
المتغيرات المزيفة: متغيرات مستقلة لها ارتباط إحصائي بـ Y لكن ليس لها علاقة سببية منطقية. مثال: إضافة ‘عدد محطات المترو في المدينة’ لنموذج سعر الشقة — قد تكون ذات ارتباط لأن المدن الكبيرة (أسعار أعلى ومترو أكثر) لكن المترو لا يُسبب ارتفاع السعر. تضرّ بالتفسير: تُعطي انطباعًا بأن عامل لا قيمة له مؤثر، وتُفسد تفسير الأسباب الحقيقية.
7. ما أهمية رسم البقايا (Residuals Plot) في تقييم نموذج الانحدار؟
عرض الإجابة
البقايا = الفرق بين القيمة الحقيقية والمتنبأ بها. رسمها مقابل المتغير المستقل يكشف: (1) هل العلاقة خطية حقًا؟ (نمط منحنٍ يعني الحاجة لنموذج أعلى درجة). (2) هل التباين ثابت (Homoscedasticity) أم يتسع مع X؟. (3) هل هناك قيم شاذة مؤثرة؟. البقايا العشوائية الموزعة حول الصفر = نموذج جيد.
8. ما Multicollinearity؟ وكيف تُؤثر على موثوقية معاملات الانحدار؟
عرض الإجابة
Multicollinearity: ارتباط عالٍ بين المتغيرات المستقلة أنفسها (مثال: المساحة ووزن المبنى مرتبطان جدًا). التأثير: يصعب على النموذج تقدير معامل كل متغير بشكل مستقل — المعاملات تصبح غير مستقرة وحساسة جدًا لإضافة أو حذف مشاهدة واحدة. التشخيص: VIF (Variance Inflation Factor). الحل: إزالة أحد المتغيرات المتداخلة أو دمجهما.
9. ما الانحدار اللوجستي متعدد الفئات (Multinomial Logistic Regression)؟ اضرب مثالًا.
عرض الإجابة
بدلًا من فئتين (نعم/لا)، يُتنبأ بأحد ثلاث فئات أو أكثر. مثال: تصنيف مراجعة عميل إلى: إيجابية / محايدة / سلبية — ثلاث فئات. أو تصنيف المرض: سرطان نوع A / B / C. الخوارزمية تُحسب احتمالية كل فئة ويُختار الأعلى.
10. ما التحقق التقاطعي (Cross-Validation) ولماذا يُعطي تقييمًا أدق من تقسيم واحد (Train/Test Split)؟
عرض الإجابة
Cross-Validation: تقسيم البيانات لـ k مجموعات. كل مرة تُختبر مجموعة واحدة والباقي للتدريب، يُكرر k مرة. المتوسط يُعطي تقييمًا أدق. أفضل من تقسيم واحد لأن: التقسيم الواحد قد يضع بيانات سهلة أو صعبة بشكل عشوائي في الاختبار — فيبدو النموذج أفضل أو أسوأ مما هو. Cross-Validation يُقيّم الأداء عبر كل البيانات.
11. شركة بنكية تبني نموذج انحدار لوجستي للتنبؤ بالتخلف عن سداد القرض. R²=0.75 على الاختبار. هل هذا كافٍ للنشر؟
عرض الإجابة
R² ليس كافيًا وحده. إضافيًا يحتاج: (1) Confusion Matrix: كم حالة تخلف حقيقية رصد النموذج (Recall)؟ — تفويت حالة تخلف أخطر من رفض عميل جيد. (2) AUC-ROC: أداء النموذج عبر عتبات مختلفة. (3) اختبار الإنصاف: هل يُميّز ضد فئات معينة؟. (4) مراجعة قانونية. (5) Back-testing: كيف كان سيؤدي تاريخيًا؟
12. ما الفرق بين الانحدار للتنبؤ (Prediction) والانحدار للاستدلال (Inference)؟
عرض الإجابة
للتنبؤ: الهدف التوقع الدقيق لقيم Y جديدة — دقة التوقع هي المقياس (RMSE). يُقبل النموذج معقد ما دام دقيقًا. للاستدلال: الهدف فهم العلاقة — هل X يؤثر على Y؟ بكم؟ تفسير المعاملات مهم، والبساطة والقابلية للتفسير مُقدَّمة. مثال: تنبؤ سعر السهم غدًا = تنبؤ. دراسة كيف يؤثر التعليم على الدخل = استدلال.