الهدف

بنهاية هذا الدرس، سيكون الطالب قادرًا على شرح مفهوم الانحدار الخطي وتفسير نتائجه وتقييم جودة النموذج.

شرح الدرس

الانحدار الخطي البسيط: يُنشئ علاقة خطية بين متغير تابع (Y) ومستقل (X):
y = a + bx

  • a: الثابت (قيمة Y حين X=0)
  • b: الميل (معدل تغير Y بتغير X وحدة واحدة)

الانحدار المتعدد: عدة متغيرات مستقلة: y = a + b₁x₁ + b₂x₂ + …

مقاييس جودة النموذج:

  • R² (معامل التحديد): نسبة التباين في Y المُفسَّرة بالنموذج. R²=1 مثالي، R²=0 لا تفسير.
  • RMSE (جذر متوسط مربع الخطأ): متوسط الخطأ في نفس وحدة Y — أصغر أفضل.

الإفراط في التخصيص (Overfitting): النموذج يُطابق بيانات التدريب بشكل مثالي لكنه يفشل مع بيانات جديدة.

أسئلة تدريبية

1. دراسة تجد علاقة بين مساحة الشقة (X) وسعرها (Y): y = 500 + 1200x (السعر بالجنيه، المساحة بالمتر). فسّر المعاملات.

عرض الإجابة

الثابت a=500: الحد الأدنى النظري للسعر عند مساحة صفر (تفسير نظري في هذا السياق). الميل b=1200: كل متر مربع إضافي يرفع السعر بـ 1200 جنيه في المتوسط. إذن شقة 100 م²: y = 500 + 1200×100 = 120,500 جنيه. الميل الموجب يؤكد العلاقة الطردية المنطقية.

2. نموذج انحدار يُعطي R²=0.85. ماذا يعني؟ وما يُفسّر الـ 15% الباقية؟

عرض الإجابة

R²=0.85 يعني: المتغير المستقل (المساحة مثلًا) يُفسّر 85% من التباين في السعر. الـ 15% الباقية: عوامل أخرى لم يتضمنها النموذج — الموقع، الطابق، التشطيبات، قرب المدارس، السوق الكلي. R² مرتفع جيد لكن لا يُقيّم جودة التوقع مع بيانات جديدة (لذا نحتاج التحقق على بيانات اختبار).

3. نموذج انحدار مُدرَّب يُعطي R²=0.99 على بيانات التدريب لكن R²=0.45 على بيانات الاختبار. ما المشكلة؟

عرض الإجابة

Overfitting (الإفراط في التخصيص) — النموذج حفظ البيانات بدل أن يتعلم النمط. يؤدي بشكل مذهل على ما رآه لكن يفشل مع بيانات جديدة. الأسباب: نموذج معقد جدًا (متغيرات كثيرة)، بيانات تدريب قليلة. الحل: تبسيط النموذج (Regularization)، أو المزيد من بيانات التدريب، أو Cross-Validation.

4. شركة عقارات تبني نموذجًا للتنبؤ بأسعار الشقق بمتغيرات: المساحة، الموقع، الطابق. كيف تُقيّم أداء النموذج بشكل صحيح؟

عرض الإجابة

(1) تقسيم البيانات: 70-80% تدريب، 20-30% اختبار (البيانات التي لم يرها النموذج). (2) التدريب على بيانات التدريب فقط. (3) التقييم على بيانات الاختبار بـ RMSE وR². (4) Cross-Validation إذا البيانات محدودة: تقسيم لـ k مجموعات، تدريب k مرة مع تغيير مجموعة الاختبار. (5) مقارنة التوقعات بالأسعار الفعلية في الرسم البياني.

5. ما الفرق بين الانحدار الخطي وانحدار Logistic؟ متى تستخدم كلًا منهما؟

عرض الإجابة

الخطي: يُتنبأ بقيمة مستمرة (السعر، الوزن، درجة الحرارة). Logistic: يُتنبأ بفئة (نعم/لا، مريض/سليم، سبام/غير سبام) — يُخرج احتمالية. الاستخدام: تنبؤ سعر الشقة → خطي. تنبؤ هل البريد سبام؟ → Logistic. تنبؤ هل المريض سيُشفى؟ → Logistic.

6. ما ‘متغيرات مزيفة’ (Spurious Variables) في الانحدار؟ وكيف تضرّ بالتفسير؟

عرض الإجابة

المتغيرات المزيفة: متغيرات مستقلة لها ارتباط إحصائي بـ Y لكن ليس لها علاقة سببية منطقية. مثال: إضافة ‘عدد محطات المترو في المدينة’ لنموذج سعر الشقة — قد تكون ذات ارتباط لأن المدن الكبيرة (أسعار أعلى ومترو أكثر) لكن المترو لا يُسبب ارتفاع السعر. تضرّ بالتفسير: تُعطي انطباعًا بأن عامل لا قيمة له مؤثر، وتُفسد تفسير الأسباب الحقيقية.

7. ما أهمية رسم البقايا (Residuals Plot) في تقييم نموذج الانحدار؟

عرض الإجابة

البقايا = الفرق بين القيمة الحقيقية والمتنبأ بها. رسمها مقابل المتغير المستقل يكشف: (1) هل العلاقة خطية حقًا؟ (نمط منحنٍ يعني الحاجة لنموذج أعلى درجة). (2) هل التباين ثابت (Homoscedasticity) أم يتسع مع X؟. (3) هل هناك قيم شاذة مؤثرة؟. البقايا العشوائية الموزعة حول الصفر = نموذج جيد.

8. ما Multicollinearity؟ وكيف تُؤثر على موثوقية معاملات الانحدار؟

عرض الإجابة

Multicollinearity: ارتباط عالٍ بين المتغيرات المستقلة أنفسها (مثال: المساحة ووزن المبنى مرتبطان جدًا). التأثير: يصعب على النموذج تقدير معامل كل متغير بشكل مستقل — المعاملات تصبح غير مستقرة وحساسة جدًا لإضافة أو حذف مشاهدة واحدة. التشخيص: VIF (Variance Inflation Factor). الحل: إزالة أحد المتغيرات المتداخلة أو دمجهما.

9. ما الانحدار اللوجستي متعدد الفئات (Multinomial Logistic Regression)؟ اضرب مثالًا.

عرض الإجابة

بدلًا من فئتين (نعم/لا)، يُتنبأ بأحد ثلاث فئات أو أكثر. مثال: تصنيف مراجعة عميل إلى: إيجابية / محايدة / سلبية — ثلاث فئات. أو تصنيف المرض: سرطان نوع A / B / C. الخوارزمية تُحسب احتمالية كل فئة ويُختار الأعلى.

10. ما التحقق التقاطعي (Cross-Validation) ولماذا يُعطي تقييمًا أدق من تقسيم واحد (Train/Test Split)؟

عرض الإجابة

Cross-Validation: تقسيم البيانات لـ k مجموعات. كل مرة تُختبر مجموعة واحدة والباقي للتدريب، يُكرر k مرة. المتوسط يُعطي تقييمًا أدق. أفضل من تقسيم واحد لأن: التقسيم الواحد قد يضع بيانات سهلة أو صعبة بشكل عشوائي في الاختبار — فيبدو النموذج أفضل أو أسوأ مما هو. Cross-Validation يُقيّم الأداء عبر كل البيانات.

11. شركة بنكية تبني نموذج انحدار لوجستي للتنبؤ بالتخلف عن سداد القرض. R²=0.75 على الاختبار. هل هذا كافٍ للنشر؟

عرض الإجابة

R² ليس كافيًا وحده. إضافيًا يحتاج: (1) Confusion Matrix: كم حالة تخلف حقيقية رصد النموذج (Recall)؟ — تفويت حالة تخلف أخطر من رفض عميل جيد. (2) AUC-ROC: أداء النموذج عبر عتبات مختلفة. (3) اختبار الإنصاف: هل يُميّز ضد فئات معينة؟. (4) مراجعة قانونية. (5) Back-testing: كيف كان سيؤدي تاريخيًا؟

12. ما الفرق بين الانحدار للتنبؤ (Prediction) والانحدار للاستدلال (Inference)؟

عرض الإجابة

للتنبؤ: الهدف التوقع الدقيق لقيم Y جديدة — دقة التوقع هي المقياس (RMSE). يُقبل النموذج معقد ما دام دقيقًا. للاستدلال: الهدف فهم العلاقة — هل X يؤثر على Y؟ بكم؟ تفسير المعاملات مهم، والبساطة والقابلية للتفسير مُقدَّمة. مثال: تنبؤ سعر السهم غدًا = تنبؤ. دراسة كيف يؤثر التعليم على الدخل = استدلال.

💬 ابدأ من هنا — افهم أولًااطلب من ChatGPT أن يشرح الدرس مرة أو مرتين أو حتى عشر مرات، بطريقة أبسط أو بأمثلة أو بمواقف من الحياة. عندما تفهم، اقرأ الدرس جيدًا ثم أجب عن الأسئلة الاثني عشر.
1
Copy lesson information
2
Open ChatGPT
Paste lesson information in the ChatGPT chat box.
Open ChatGPT
3
Press Enter / Send
Press Enter / Send, then wait for ChatGPT to get ready with your lesson.
تحميل هذا الباب / Download this Chapterنسخة كاملة للدراسة بدون إنترنت، مع الأسئلة والإجابات والصور المتاحة.