कार्यक्रम मूल्यांकन के लिए नमूना आकार (sample size)
कार्यक्रम मूल्यांकन का नमूना सबसे पहले सवाल पर निर्भर है. दर आँकनी है ("कितने प्रतिशत बच्चे स्तर पर पढ़ते हैं?") तो 95 प्रतिशत confidence और ±5 अंक पर लगभग 385 लोग. असर पकड़ना है ("क्या कार्यक्रम ने पढ़ाई 0.3 standard deviation बढ़ाई?") तो 80 प्रतिशत power पर हर arm में लगभग 175. दोनों संख्याएँ फिर clustering (design effect) और अपेक्षित attrition से बढ़ती हैं, और असली मूल्यांकन हर stakeholder समूह, छात्र, शिक्षक, अभिभावक, अधिकारी, को उसकी अपनी logic से size करता है.
इस क्षेत्र की सबसे आम ग़लती: impact के सवाल का जवाब descriptive सर्वे के नमूने से देना, या उलटा. दोनों formulas अलग चीज़ें मापते हैं और छोटे असर आते ही दस गुना तक अलग हो सकते हैं. नक़्शा यह रहा.
दर आँकना: descriptive सर्वे
असर पकड़ना: powered तुलनाएँ
| न्यूनतम पकड़ने लायक़ असर | प्रति arm | कुल (दो arms) |
|---|---|---|
| 0.5 SD (बड़ा) | लगभग 63 | लगभग 126 |
| 0.3 SD (आम शिक्षा कार्यक्रम) | लगभग 175 | लगभग 350 |
| 0.2 SD (छोटा पर सार्थक) | लगभग 393 | लगभग 786 |
MDES चुनना design का ईमानदार दिल है: वह सबसे छोटा असर जिसे पकड़ना ज़रूरी है, वह नहीं जिसकी उम्मीद है. उसे आधा करने पर नमूना चौगुना, वही वर्ग-नियम जो margin of error का है.
वे समायोजन जो संख्या को असली बनाते हैं
- Design effect. स्कूलों से नमूना लेने पर DEFF = 1 + (m - 1) × ICC से गुणा, व्यवहार में अक्सर 3 से 5. देखें: कितने स्कूल सर्वे करें?
- Attrition (छीजन). Endline तक 15 प्रतिशत panel खोने की आशंका हो तो baseline पर n / 0.85 भर्ती करें. Longitudinal designs में यह waves के पार चक्रवृद्धि होती है.
- Panel सहसंबंध. वही बच्चे track करने वाले baseline-endline designs को छूट मिलती है: दो स्कोरों का सहसंबंध साझा शोर हटाकर नमूना घटा देता है.
- Matching inflation. Quasi-experimental designs premium देते हैं (अक्सर 1.1x से 1.5x), क्योंकि matched तुलना randomised से कम efficient है.
- Finite population. छोटी जनसंख्या पर correction नमूना घटाता है; design जनसंख्या से बड़ा निकले तो वह census करने को कह रहा है.
कई stakeholder समूह, एक योजना
| समूह | आम विधि | आम sizing logic |
|---|---|---|
| छात्र | Statistical, clustered | मुख्य दावे को power; अक्सर binding |
| शिक्षक | Statistical या quota | अपना formula, छोटा n |
| प्रधानाध्यापक | चुने स्कूलों की census | हर स्कूल में एक |
| अभिभावक / SMC | Quota या purposive FGDs | प्रति FGD 6 से 10, saturation तक |
| अधिकारी | Purposive KIIs | Strata के पार saturation |
अक्सर पूछे जाने वाले सवाल
Impact evaluation को कितना नमूना चाहिए?
0.3 SD असर के लिए हर arm में लगभग 175, 80 प्रतिशत power पर, clustering और attrition से पहले. स्कूल-आधारित नमूने पर DEFF से गुणा करें और retention से भाग दें. 0.2 SD के लिए हर arm में लगभग 393 की योजना बनाएँ.
Panel design को दो cross-sections से कम लोग क्यों चाहिए?
क्योंकि हर बच्चा अपनी ही तुलना बनता है. Baseline-endline सहसंबंध साझा शोर हटाता है, तो बदलाव कम बच्चों में पकड़ में आता है, बशर्ते panel attrition से बचे, जिसके लिए baseline पर ज़्यादा भर्ती करते हैं.
कुल budget कौन सा समूह तय करता है?
आम तौर पर सबसे मज़बूत दावे वाला समूह, impact अनुमान को power देते छात्र, क्योंकि clustering और power उसे बाक़ियों से कहीं आगे फुला देते हैं. Build mode हर समूह computed करके binding constraint साफ़ नाम से बताता है.
आठों designs, ईमानदारी से size करें
Descriptive, baseline-endline, longitudinal, RCT, quasi-experimental, LQAS, mixed methods और qualitative, हर मान्यता लिखी हुई और justification तैयार.
Build mode खोलें