الهدف
بنهاية هذا الدرس، سيكون الطالب قادرًا على مقارنة طرق جمع البيانات الأولية والثانوية، وتقييم مدى ملاءمة كل طريقة لسياق محدد.
شرح الدرس
أنواع البيانات:
- أولية (Primary): تجمعها مباشرة — استطلاعات، مقابلات، تجارب، مستشعرات.
- ثانوية (Secondary): موجودة مسبقًا — قواعد بيانات حكومية، تقارير، بحوث منشورة.
أنواع البيانات حسب الطبيعة:
- كمية (Quantitative): أرقام قابلة للقياس — الأعمار، الأسعار، درجات الحرارة.
- نوعية (Qualitative): أوصاف ومعاني — آراء، تجارب، مشاعر.
- منظمة (Structured): في جداول (قواعد بيانات).
- غير منظمة (Unstructured): نصوص، صور، فيديو، صوت.
طرق الجمع الرئيسية: الاستطلاعات، المقابلات، الرصد/المراقبة، التجارب، Web Scraping، APIs، قواعد البيانات المفتوحة.
التحيز في جمع البيانات: عينة غير ممثّلة تُعطي نتائج مضللة حتى لو كانت التحليلات دقيقة رياضيًا.
أسئلة تدريبية
1. شركة تُريد معرفة رضا موظفيها عن بيئة العمل. تدرس بين: استطلاع رقمي مجهول الهوية، ومقابلات وجهًا لوجه مع المدير. ما مزايا وعيوب كل منهما؟
عرض الإجابة
الاستطلاع المجهول: المزايا: صراحة أكبر، وصول لجميع الموظفين، سرعة ونتائج قابلة للقياس. العيوب: لا يُفسّر ‘لماذا’، قد لا يُتمّه الجميع. المقابلة مع المدير: المزايا: فهم عميق للأسباب. العيوب: المرؤوس قد لا يكون صريحًا مع رئيسه المباشر، يستغرق وقتًا، لا تُعطي بيانات قابلة للمقارنة الكمية.
2. باحث يُجري دراسة عن عادات النوم لدى المراهقين فيسأل طلاب المدارس الخاصة فقط. ما مشكلة هذا النهج؟
عرض الإجابة
عينة غير ممثّلة (Sampling Bias) — طلاب المدارس الخاصة فئة ذات خصائص اجتماعية واقتصادية محددة تختلف عن المراهقين عمومًا. قد يكون لديهم أجهزة إلكترونية أكثر، وقت دراسة مختلف، ضغوط مختلفة. النتائج قد لا تنطبق على المراهقين بشكل عام — التعميم خطأ منهجي.
3. ما Web Scraping؟ واذكر سيناريو مشروعًا وآخر إشكاليًا لاستخدامه.
عرض الإجابة
Web Scraping: استخراج بيانات تلقائيًا من مواقع الويب ببرنامج يقرأ صفحات HTML. مشروع: جمع أسعار المنافسين من مواقعهم العامة لمقارنة السوق — نشاط تجاري مقبول. إشكالي: استخراج بيانات شخصية للمستخدمين من الشبكات الاجتماعية دون موافقتهم — ينتهك الخصوصية ويخالف شروط الاستخدام وقوانين حماية البيانات في كثير من الدول.
4. الحكومة تجمع بيانات مستشعرات درجات الحرارة من 500 محطة طوال 24 ساعة. ما نوع هذه البيانات؟ وما التحديات الخاصة بجمعها؟
عرض الإجابة
البيانات: كمية، أولية، منظمة، يُجمعها في الوقت الحقيقي (Real-time Streaming Data). التحديات: (1) حجم ضخم جدًا — 500 محطة × 24 قراءة/ساعة = 12,000 نقطة/يوم. (2) تزامن دقيق بين المحطات. (3) بعض المستشعرات تُعطي قراءات خاطئة (أعطال). (4) التخزين والمعالجة السريعة. (5) الاتصال الشبكي المستمر من مناطق بعيدة.
5. ما الفرق بين بيانات المقطع العرضي (Cross-Sectional) وبيانات السلسلة الزمنية (Time Series)؟ أيهما يناسب دراسة تأثير زيادة الأجور على الإنفاق؟
عرض الإجابة
Cross-Sectional: لقطة واحدة في وقت محدد لمجموعات مختلفة (دراسة دخل 1000 شخص الشهر الماضي). Time Series: قياسات متكررة لنفس الشيء عبر الزمن (دخل نفس الأشخاص كل شهر لسنة). لدراسة تأثير زيادة الأجور: Time Series أنسب — تتبّع الإنفاق قبل وبعد الزيادة للأشخاص أنفسهم يُعطي دليلًا على العلاقة السببية، بخلاف مقارنة مجموعات مختلفة في لقطة واحدة.
6. ما البيانات الضخمة (Big Data)؟ وما الـ 3Vs التي تُعرّفها؟
عرض الإجابة
البيانات الضخمة: مجموعات بيانات ضخمة ومعقدة تتجاوز قدرات أنظمة المعالجة التقليدية. الـ 3Vs: (1) Volume (الحجم) — تيرابايتات وبيتابايتات. (2) Velocity (السرعة) — تُولَّد وتُعالَج بسرعة كبيرة (تغريدات Twitter: 500 مليون/يوم). (3) Variety (التنوع) — منظمة وغير منظمة ونصف منظمة. أحيانًا يُضاف Veracity (الدقة/الموثوقية) و Value (القيمة).
7. مستشفى يجمع بيانات المرضى لتحسين الرعاية. ما المتطلبات الأخلاقية والقانونية التي يجب مراعاتها؟
عرض الإجابة
المتطلبات: (1) موافقة صريحة مستنيرة من المريض على جمع بياناته واستخدامها. (2) إخفاء الهوية (Anonymization) قبل الاستخدام في الأبحاث. (3) تشفير البيانات وتأمينها. (4) تحديد الغرض مسبقًا — لا تُجمع لغرض ثم تُستخدم لآخر (Purpose Limitation). (5) حق المريض في الوصول لبياناته وحذفها. (6) الالتزام بـ HIPAA (أمريكا) أو GDPR (أوروبا) أو التشريعات المحلية.
8. ما الفرق بين المتغير المستقل والمتغير التابع في جمع البيانات التجريبية؟ اضرب مثالًا.
عرض الإجابة
المستقل: العامل الذي يُغيّره الباحث عمدًا. التابع: العامل الذي يقيس الباحث تأثيره. مثال: دراسة تأثير عدد ساعات النوم (مستقل) على التحصيل الدراسي (تابع). الباحث يتحكم في وقت نوم الطلاب ويقيس درجاتهم. المبدأ: المستقل يؤثر في التابع (أو الباحث يفترض ذلك ويختبره).
9. موقع تجارة إلكترونية يجمع: سجلات المشتريات، جلسات التصفح، نقرات الإعلانات، تقييمات المنتجات. صنّف هذه البيانات حسب نوعها.
عرض الإجابة
سجلات المشتريات: كمية + منظمة (أرقام، تواريخ، مبالغ في جداول). جلسات التصفح: كمية + شبه منظمة (logs). نقرات الإعلانات: كمية + منظمة. تقييمات المنتجات: مزيج — رقم التقييم (كمي/منظم) + نص الرأي (نوعي/غير منظم). البيانات المختلطة (كمية + نوعية) الأكثر قيمةً لكن الأصعب تحليلًا.
10. ما مشكلة ‘التأكيد’ (Confirmation Bias) في جمع البيانات؟ وكيف يؤثر على نتائج البحث؟
عرض الإجابة
Confirmation Bias: الباحث يميل لجمع البيانات التي تؤيد فرضيته المسبقة وتجاهل أو تأويل ما يخالفها. التأثير: نتائج مبنية على انتقاء انتقائي وليس صورة كاملة. مثال: باحث يؤمن بفعالية علاج معين يُركّز على الحالات التي تحسّنت ويُهمل التي ساءت. الحل: تسجيل منهجي لكل البيانات قبل التحليل، وتحديد معايير جمع البيانات مسبقًا.
11. مدينة تريد تحسين حركة المرور وتدرس بين: نشر استطلاع للسكان، أو تثبيت مستشعرات ذكية في الشوارع. قارن الطريقتين.
عرض الإجابة
الاستطلاع: يُعطي المدينة توقعات ومشاعر السكان وأولوياتهم (بيانات ذاتية). غير مكلف. لكن الناس قد يُجيبون بما يعتقدون لا بما يفعلون فعلًا. المستشعرات: بيانات موضوعية حقيقية (كثافة المرور، الأوقات، الاختناقات). أدق للتخطيط الهندسي. لكن تكلفة عالية وتُثير مخاوف الخصوصية. المثالي: الاثنان معًا — المستشعرات تُحدد المشكلة، الاستطلاع يُفهّم الأولوية.
12. ما التحقق من صحة البيانات (Data Validation)؟ وما أمثلة على قواعد التحقق في نموذج تسجيل مستخدم جديد؟
عرض الإجابة
Data Validation: التحقق من أن البيانات المُدخلة صحيحة ومنطقية قبل قبولها. أمثلة في التسجيل: (1) البريد الإلكتروني يحتوي @ ونطاقًا صالحًا. (2) رقم الهاتف بالطول المحدد وبأرقام فقط. (3) تاريخ الميلاد في الماضي وليس المستقبل. (4) كلمة المرور ≥ 8 أحرف وتحتوي رقمًا. (5) لا تُسمح الحقول الفارغة للحقول الإلزامية.