SamplingShala
Evaluation methods

कार्यक्रम मूल्यांकन के लिए नमूना आकार (sample size)

कार्यक्रम मूल्यांकन का नमूना सबसे पहले सवाल पर निर्भर है. दर आँकनी है ("कितने प्रतिशत बच्चे स्तर पर पढ़ते हैं?") तो 95 प्रतिशत confidence और ±5 अंक पर लगभग 385 लोग. असर पकड़ना है ("क्या कार्यक्रम ने पढ़ाई 0.3 standard deviation बढ़ाई?") तो 80 प्रतिशत power पर हर arm में लगभग 175. दोनों संख्याएँ फिर clustering (design effect) और अपेक्षित attrition से बढ़ती हैं, और असली मूल्यांकन हर stakeholder समूह, छात्र, शिक्षक, अभिभावक, अधिकारी, को उसकी अपनी logic से size करता है.

इस क्षेत्र की सबसे आम ग़लती: impact के सवाल का जवाब descriptive सर्वे के नमूने से देना, या उलटा. दोनों formulas अलग चीज़ें मापते हैं और छोटे असर आते ही दस गुना तक अलग हो सकते हैं. नक़्शा यह रहा.

दर आँकना: descriptive सर्वे

n₀ = z² × p(1 - p) / e² 95 प्रतिशत confidence, ±5 अंक पर लगभग 385. छोटी जनसंख्या पर finite population correction, clustered fieldwork पर DEFF से गुणा. पूरी तालिका: calculator पेज.

असर पकड़ना: powered तुलनाएँ

n प्रति arm = 2 × (z₀ + z₁)² / MDES² z₀ = 1.96 (two-sided 5 प्रतिशत), z₁ = 0.84 (80 प्रतिशत power), MDES standard deviations में.
न्यूनतम पकड़ने लायक़ असरप्रति armकुल (दो arms)
0.5 SD (बड़ा)लगभग 63लगभग 126
0.3 SD (आम शिक्षा कार्यक्रम)लगभग 175लगभग 350
0.2 SD (छोटा पर सार्थक)लगभग 393लगभग 786

MDES चुनना design का ईमानदार दिल है: वह सबसे छोटा असर जिसे पकड़ना ज़रूरी है, वह नहीं जिसकी उम्मीद है. उसे आधा करने पर नमूना चौगुना, वही वर्ग-नियम जो margin of error का है.

वे समायोजन जो संख्या को असली बनाते हैं

  • Design effect. स्कूलों से नमूना लेने पर DEFF = 1 + (m - 1) × ICC से गुणा, व्यवहार में अक्सर 3 से 5. देखें: कितने स्कूल सर्वे करें?
  • Attrition (छीजन). Endline तक 15 प्रतिशत panel खोने की आशंका हो तो baseline पर n / 0.85 भर्ती करें. Longitudinal designs में यह waves के पार चक्रवृद्धि होती है.
  • Panel सहसंबंध. वही बच्चे track करने वाले baseline-endline designs को छूट मिलती है: दो स्कोरों का सहसंबंध साझा शोर हटाकर नमूना घटा देता है.
  • Matching inflation. Quasi-experimental designs premium देते हैं (अक्सर 1.1x से 1.5x), क्योंकि matched तुलना randomised से कम efficient है.
  • Finite population. छोटी जनसंख्या पर correction नमूना घटाता है; design जनसंख्या से बड़ा निकले तो वह census करने को कह रहा है.

कई stakeholder समूह, एक योजना

समूहआम विधिआम sizing logic
छात्रStatistical, clusteredमुख्य दावे को power; अक्सर binding
शिक्षकStatistical या quotaअपना formula, छोटा n
प्रधानाध्यापकचुने स्कूलों की censusहर स्कूल में एक
अभिभावक / SMCQuota या purposive FGDsप्रति FGD 6 से 10, saturation तक
अधिकारीPurposive KIIsStrata के पार saturation
Qualitative हिस्सों का आकार saturation से तय होता है, वह बिंदु जहाँ नए interviews नए विषय देना बंद कर दें, confidence formulas से नहीं. किसी भी दिशा में उलटा दिखावा दूसरी सबसे आम ग़लती है. Mixed-methods योजना दोनों logic साथ-साथ लिखती है.

अक्सर पूछे जाने वाले सवाल

Impact evaluation को कितना नमूना चाहिए?

0.3 SD असर के लिए हर arm में लगभग 175, 80 प्रतिशत power पर, clustering और attrition से पहले. स्कूल-आधारित नमूने पर DEFF से गुणा करें और retention से भाग दें. 0.2 SD के लिए हर arm में लगभग 393 की योजना बनाएँ.

Panel design को दो cross-sections से कम लोग क्यों चाहिए?

क्योंकि हर बच्चा अपनी ही तुलना बनता है. Baseline-endline सहसंबंध साझा शोर हटाता है, तो बदलाव कम बच्चों में पकड़ में आता है, बशर्ते panel attrition से बचे, जिसके लिए baseline पर ज़्यादा भर्ती करते हैं.

कुल budget कौन सा समूह तय करता है?

आम तौर पर सबसे मज़बूत दावे वाला समूह, impact अनुमान को power देते छात्र, क्योंकि clustering और power उसे बाक़ियों से कहीं आगे फुला देते हैं. Build mode हर समूह computed करके binding constraint साफ़ नाम से बताता है.

आठों designs, ईमानदारी से size करें

Descriptive, baseline-endline, longitudinal, RCT, quasi-experimental, LQAS, mixed methods और qualitative, हर मान्यता लिखी हुई और justification तैयार.

Build mode खोलें