बायोस्टैटिस्टिक्स
बायोस्टैटिस्टिक्स (जिसे कभी-कभी बायोमेट्री भी कहा जाता है), सांख्यिकी (statistics) की एक शाखा है जो जैविक विज्ञान (biological sciences) के एक विस्तृत क्षेत्र में सांख्यिकीय तरीकों को लागू करती है, जिसमें क्लिनिकल मेडिसिन (clinical medicine) और सार्वजनिक स्वास्थ्य (public health) के अनुप्रयोगों पर विशेष ध्यान दिया जाता है।[1] इस क्षेत्र में प्रयोगों की रूपरेखा तैयार करना, प्रायोगिक और अवलोकन संबंधी डेटा का संकलन और विश्लेषण करना, तथा परिणामों की व्याख्या करना शामिल है। यह चिकित्सा सांख्यिकी (medical statistics) से घनिष्ठ रूप से संबंधित है।
इतिहास
बायोस्टैटिस्टिक्स और आनुवंशिकी
बायोस्टैटिस्टिकल मॉडलिंग (biostatistical modeling) कई आधुनिक जैविक सिद्धांतों का एक महत्वपूर्ण हिस्सा बनाती है। आनुवंशिकी (Genetics) के अध्ययनों ने अपनी शुरुआत से ही देखे गए प्रायोगिक परिणामों को समझने के लिए सांख्यिकीय अवधारणाओं का उपयोग किया है। कुछ आनुवंशिकी वैज्ञानिकों ने तो तरीकों और उपकरणों के विकास के साथ सांख्यिकीय प्रगति में भी योगदान दिया। ग्रेगर मेंडल (Gregor Mendel) ने मटर के परिवारों में आनुवंशिकी अलगाव (segregation) के पैटर्न की जांच करके आनुवंशिकी अध्ययन शुरू किया और एकत्र किए गए डेटा को समझाने के लिए सांख्यिकी का उपयोग किया। 1900 के दशक की शुरुआत में, मेंडल के मेंडेलियन इनहेरिटेंस के काम की पुनर्खोज के बाद, आनुवंशिकी और विकासवादी डार्विनवाद (evolutionary Darwinism) को समझने में अंतराल रह गए थे। फ्रांसिस गाल्टन (Francis Galton) ने मानव डेटा के साथ मेंडल की खोजों का विस्तार करने की कोशिश की और एक अलग मॉडल प्रस्तावित किया जिसमें प्रत्येक पूर्वज से आने वाले आनुवंशिकता के अंश एक अनंत श्रृंखला बनाते हैं। उन्होंने इसे "पैतृक वंशागति के नियम" (Law of Ancestral Heredity) का सिद्धांत कहा। उनके विचारों से विलियम बेटसन (William Bateson) ने कड़ा असहमति जताई, जो मेंडल के इन निष्कर्षों का पालन करते थे कि आनुवंशिक वंशागति विशेष रूप से माता-पिता से होती है, जिनमें से प्रत्येक से आधा हिस्सा मिलता है। इससे बायोमैट्रीशियनों (biometricians), जो गाल्टन के विचारों का समर्थन करते थे जैसे कि राफेल वेल्डन, आर्थर डुपकिनफील्ड डार्बिशायर और कार्ल पियर्सन, और मेंडेलियन, जो बेटसन (और मेंडल) के विचारों का समर्थन करते थे जैसे कि चार्ल्स डेवनपोर्ट और विल्हेम जोहान्सन, के बीच एक जोरदार बहस छिड़ गई। बाद में, बायोमैट्रीशियन विभिन्न प्रयोगों में गाल्टन के निष्कर्षों को दोहरा नहीं सके, और मेंडल के विचार प्रबल हुए। 1930 के दशक तक, सांख्यिकीय तर्क पर आधारित मॉडलों ने इन अंतरों को हल करने में मदद की थी और नव-डार्विनियन आधुनिक विकासवादी संश्लेषण (modern evolutionary synthesis) का उत्पादन किया था।
इन अंतरों को हल करने से जनसंख्या आनुवंशिकी (population genetics) की अवधारणा को परिभाषित करने में भी मदद मिली और आनुवंशिकी तथा विकास को एक साथ लाया गया। जनसंख्या आनुवंशिकी (population genetics) और इस संश्लेषण की स्थापना में अग्रणी तीन हस्तियां पूरी तरह से सांख्यिकी पर निर्भर थीं और उन्होंने जीव विज्ञान में इसके उपयोग को विकसित किया।
- रोनाल्ड फिशर (Ronald Fisher) ने सांख्यिकीविद् बेटी एलन (Betty Allan) के साथ मिलकर रोथआमस्टेड रिसर्च (Rothamsted Research) में फसल प्रयोगों के अध्ययन में अपने काम का समर्थन करने के लिए कई बुनियादी सांख्यिकीय तरीकों को विकसित किया, जिन्हें फिशर की पुस्तकों Statistical Methods for Research Workers (1925) और The Genetical Theory of Natural Selection (1930) के साथ-साथ एलन के वैज्ञानिक पत्रों में प्रकाशित किया गया था।[2] फिशर ने आनुवंशिकी और सांख्यिकी में कई योगदान दिए। उनमें से कुछ में ANOVA, p-value अवधारणाएं, फिशर का सटीक परीक्षण (Fisher's exact test) और जनसंख्या गतिशीलता (population dynamics) के लिए फिशर का समीकरण (Fisher's equation) शामिल हैं। उन्हें इस वाक्य का श्रेय दिया जाता है "प्राकृतिक चयन अत्यधिक उच्च स्तर की असंभाव्यता उत्पन्न करने के लिए एक तंत्र है"।[3]
- सिवॉल जी. राइट (Sewall G. Wright) ने एफ-सांख्यिकी (F-statistics) और उनकी गणना करने के तरीकों को विकसित किया तथा अंतःप्रजनन गुणांक (inbreeding coefficient) को परिभाषित किया।
- जे. बी. एस. हाल्डेन (J. B. S. Haldane) की पुस्तक, द कॉजेज ऑफ इवोल्यूशन (The Causes of Evolution), ने मेंडेलियन आनुवंशिकी के गणितीय परिणामों के संदर्भ में समझाकर प्राकृतिक चयन को विकास के प्रमुख तंत्र के रूप में पुनः स्थापित किया। उन्होंने आदिम सूप (primordial soup) का सिद्धांत भी विकसित किया।
इन और अन्य बायोस्टैटिस्टिशियनों, गणितीय जीव वैज्ञानिकों, और सांख्यिकीय रूप से झुकाव रखने वाले आनुवंशिकीविदों ने विकासवादी जीव विज्ञान (evolutionary biology) और आनुवंशिकी (genetics) को एक सुसंगत, सुसंबद्ध समग्र रूप में लाने में मदद की, जिसे मात्रात्मक रूप से (quantitatively) मॉडल किया जा सकता था।
इस समग्र विकास के समानांतर, डार्सी थॉम्पसन (D'Arcy Thompson) के ऑन ग्रोथ एंड फॉर्म (On Growth and Form) में किए गए अग्रणी कार्य ने भी जैविक अध्ययन में मात्रात्मक अनुशासन जोड़ने में मदद की।
सांख्यिकीय तर्क के मौलिक महत्व और बार-बार होने वाली आवश्यकता के बावजूद, जीव विज्ञानियों के बीच उन परिणामों पर अविश्वास करने या उनकी उपेक्षा करने की प्रवृत्ति हो सकती है जो गुणात्मक रूप से (qualitatively) स्पष्ट नहीं हैं। एक किस्सा बताता है कि थॉमस हंट मॉर्गन (Thomas Hunt Morgan) ने कैल्टेक (Caltech) में अपने विभाग से फ्रीडन कैलकुलेटर (Friden calculator) पर प्रतिबंध लगा दिया था, यह कहते हुए कि "खैर, मैं उस व्यक्ति की तरह हूं जो 1849 में सैक्रामेंटो नदी के तट पर सोने की खोज कर रहा है। थोड़ी सी बुद्धि के साथ, मैं नीचे पहुँच सकता हूँ और सोने के बड़े ढेले उठा सकता हूँ। और जब तक मैं ऐसा कर सकता हूँ, मैं अपने विभाग के किसी भी व्यक्ति को प्लॉसर माइनिंग (placer mining) में दुर्लभ संसाधनों को बर्बाद नहीं करने दूंगा।"[4]
अनुसंधान योजना (Research planning)
जीवन विज्ञान (life sciences) में किसी भी शोध का प्रस्ताव हमारे सामने मौजूद किसी वैज्ञानिक प्रश्न (scientific question) का उत्तर देने के लिए किया जाता है। इस प्रश्न का उच्च निश्चितता के साथ उत्तर देने के लिए, हमें सटीक (accurate) परिणामों की आवश्यकता होती है। मुख्य परिकल्पना (hypothesis) और अनुसंधान योजना की सही परिभाषा किसी घटना को समझने में निर्णय लेते समय त्रुटियों को कम करेगी। अनुसंधान योजना में अनुसंधान प्रश्न, परीक्षण की जाने वाली परिकल्पना, प्रायोगिक डिज़ाइन (experimental design), डेटा संग्रह (data collection) विधियाँ, डेटा विश्लेषण (data analysis) दृष्टिकोण और शामिल लागतें शामिल हो सकती हैं। प्रायोगिक सांख्यिकी के तीन बुनियादी सिद्धांतों के आधार पर अध्ययन करना आवश्यक है: यादृच्छिकीकरण (randomization), प्रतिकृति (replication), और स्थानीय नियंत्रण (local control)।
अनुसंधान प्रश्न
अनुसंधान प्रश्न किसी अध्ययन के उद्देश्य को परिभाषित करेगा। अनुसंधान इस प्रश्न द्वारा निर्देशित होगा, इसलिए इसे संक्षिप्त होने की आवश्यकता है, साथ ही यह दिलचस्प और नवीन विषयों पर केंद्रित होना चाहिए जो विज्ञान और ज्ञान तथा उस क्षेत्र में सुधार कर सकें। वैज्ञानिक प्रश्न पूछने के तरीके को परिभाषित करने के लिए, एक विस्तृत साहित्य समीक्षा (literature review) आवश्यक हो सकती है। इसलिए अनुसंधान वैज्ञानिक समुदाय (scientific community) में मूल्य जोड़ने के लिए उपयोगी हो सकता है।[5]
परिकल्पना की परिभाषा
एक बार अध्ययन का उद्देश्य परिभाषित हो जाने के बाद, अनुसंधान प्रश्न के संभावित उत्तरों का प्रस्ताव किया जा सकता है, जो इस प्रश्न को परिकल्पना (hypothesis) में बदल देता है। मुख्य प्रस्ताव को शून्य परिकल्पना (null hypothesis) (H0) कहा जाता है और यह आमतौर पर इस विषय के बारे में एक स्थायी ज्ञान या गहरी साहित्य समीक्षा द्वारा समर्थित घटनाओं की स्पष्ट घटना पर आधारित होता है। हम कह सकते यह परीक्षण की स्थिति के तहत डेटा के लिए मानक अपेक्षित उत्तर है। सामान्य तौर पर, HO उपचारों के बीच कोई संबंध नहीं होने की मानता है। दूसरी ओर, वैैकल्पिक परिकल्पना (alternative hypothesis) HO का खंडन है। यह उपचार और परिणाम के बीच कुछ हद तक संबंध मानता है। हालांकि, परिकल्पना अनुसंधान प्रश्न और उसके अपेक्षित तथा अप्रत्याशित उत्तरों द्वारा समर्थित होती है।[5]
एक उदाहरण के रूप में, दो अलग-अलग आहार प्रणालियों के तहत समान जानवरों (उदाहरण के लिए चूहों) के समूहों पर विचार करें। अनुसंधान प्रश्न होगा: सबसे अच्छा आहार कौन सा है? इस मामले में, H0 यह होगा कि चूहों के उपापचय (metabolism) में दो आहारों के बीच कोई अंतर नहीं है (H0: μ1 = μ2) और वैैकल्पिक परिकल्पना यह होगी कि आहारों का जानवरों के चयापचय पर अलग-अलग प्रभाव पड़ता है (H1: μ1 ≠ μ2)।
परिकल्पना को मुख्य प्रश्न का उत्तर देने में उसकी/उसके हितों के अनुसार शोधकर्ता द्वारा परिभाषित किया जाता है। इसके अलावा, वैैकल्पिक परिकल्पना एक से अधिक परिकल्पना हो सकती है। यह न केवल देखे गए मापदंडों में अंतर मान सकती है, बल्कि उनके अंतर की डिग्री भी मान सकती है (यानी उच्च या कम)।
नमूनाकरण (Sampling)
आमतौर पर, एक अध्ययन का उद्देश्य किसी जनसंख्या (population) पर किसी घटना के प्रभाव को समझना होता है। जीव विज्ञान में, किसी जनसंख्या को एक विशिष्ट समय पर विशिष्ट क्षेत्र में किसी दी गई प्रजाति (species) के सभी व्यक्ति (individuals) के रूप में परिभाषित किया जाता है। बायोस्टैटिस्टिक्स में, इस अवधारणा को अध्ययन की संभावित विभिन्न प्रकार की संग्रहों तक बढ़ाया जाता है। हालांकि, बायोस्टैटिस्टिक्स में, जनसंख्या केवल व्यक्ति नहीं हैं, बल्कि उनके जीव (organisms) के एक विशिष्ट घटक का कुल योग है, जैसे कि पूरा जीनोम, या सभी शुक्राणु कोशिकाएं, जानवरों के लिए, या पौधे के लिए कुल पत्ती क्षेत्र, उदाहरण के लिए।
जनसंख्या के सभी तत्वों से माप (measurements) लेना संभव नहीं है। इस वजह से, सांख्यिकीय अनुमान (statistical inference) के लिए नमूनाकरण (sampling) की प्रक्रिया बहुत महत्वपूर्ण है। जनसंख्या के बारे में बाद में अनुमान लगाने के लिए, पूरी जनसंख्या के एक प्रतिनिधि हिस्से को यादृच्छिक रूप से प्राप्त करने के रूप में नमूनाकरण को परिभाषित किया जाता है। इसलिए, नमूना (sample) जनसंख्या में सबसे अधिक सांख्यिकीय परिवर्तनशीलता (statistical variability) को पकड़ सकता है।[6] नमूना आकार (sample size) अनुसंधान के दायरे से लेकर उपलब्ध संसाधनों तक कई चीजों द्वारा निर्धारित होता है। क्लिनिकल अनुसंधान (clinical research) में, परीक्षण का प्रकार, जैसे हीनता (inferiority), समतुल्यता (equivalence), और श्रेष्ठता (superiority), नमूना आकार (size) निर्धारित करने में एक कुंजी है।[5]
प्रायोगिक डिज़ाइन (Experimental design)
प्रायोगिक डिज़ाइन (Experimental designs) प्रायोगिक सांख्यिकी के डिज़ाइन के उन बुनियादी सिद्धांतों को बनाए रखते हैं। प्रयोग के सभी प्लॉटों (plots) में उपचारों (treatments) को यादृच्छिक रूप से आवंटित करने के लिए तीन बुनियादी प्रायोगिक डिज़ाइन हैं। वे हैं पूर्ण यादृच्छिक डिज़ाइन (completely randomized design), यादृच्छिक ब्लॉक डिज़ाइन (randomized block design), और कारकों के डिज़ाइन (factorial designs)। प्रयोग के अंदर उपचारों को कई तरीकों से व्यवस्थित किया जा सकता है। कृषि में, सही प्रायोगिक डिज़ाइन एक अच्छे अध्ययन की जड़ है और अध्ययन के भीतर उपचारों की व्यवस्था आवश्यक है क्योंकि पर्यावरण प्लॉटों (पौधों, पशुधन, सूक्ष्मजीवों) को बड़े पैमाने पर प्रभावित करता है। इन मुख्य व्यवस्थाओं को साहित्य में "जाल" (lattices), "अपूर्ण ब्लॉक", "विभाजित प्लॉट" (split plot), "संवर्धित ब्लॉक" (augmented blocks), और कई अन्य नामों के तहत पाया जा सकता है। सभी डिज़ाइनों में त्रुटि अनुमान (error estimation) प्रदान करने के लिए, शोधकर्ता द्वारा निर्धारित वैज्ञानिक नियंत्रण (scientific control) प्लॉट शामिल हो सकते हैं।
क्लिनिकल अध्ययनों में, नमूना (samples) आमतौर पर अन्य जैविक अध्ययनों की तुलना में छोटे होते हैं, और ज्यादातर मामलों में, पर्यावरण प्रभाव को नियंत्रित या मापा जा सकता है। यादृच्छिक नियंत्रित परीक्षण (randomized controlled clinical trials) का उपयोग करना आम बात है, जहाँ परिणामों की तुलना आमतौर पर अवलोकन संबंधी अध्ययन (observational study) डिज़ाइनों जैसे केस-कंट्रोल या सहहोर्ट (cohort) के साथ की जाती है।[7]
डेटा संग्रह (Data collection)
अनुसंधान योजना में डेटा संग्रह विधियों पर विचार किया जाना चाहिए, क्योंकि यह नमूना आकार और प्रायोगिक डिज़ाइन को अत्यधिक प्रभावित करता है।
डेटा का प्रकार के अनुसार डेटा संग्रह भिन्न होता है। गुणात्मक डेटा (qualitative data) के लिए, संग्रह संरचित प्रश्नावली के साथ या अवलोकन द्वारा किया जा सकता है, घटना के स्तर को वर्गीकृत करने के लिए स्कोर मानदंड का उपयोग करते हुए, बीमारी की उपस्थिति या तीव्रता पर विचार किया जा सकता है।[8] मात्रात्मक डेटा (quantitative data) के लिए, संग्रह उपकरणों का उपयोग करके संख्यात्मक जानकारी को मापकर किया जाता है।
कृषि और जीव विज्ञान अध्ययनों में, उपज डेटा और उसके घटकों को मीट्रिक माप (metric measures) द्वारा प्राप्त किया जा सकता है। हालाँकि, पौधों में कीट और बीमारी की चोटें अवलोकन द्वारा प्राप्त की जाती हैं, जिसमें क्षति के स्तर के लिए स्कोर पैमानों पर विचार किया जाता है। विशेष रूप से, आनुवंशिकी अध्ययनों में, क्षेत्र और प्रयोगशाला में डेटा संग्रह के लिए आधुनिक तरीकों पर विचार किया जाना चाहिए, जैसे फेनोटाइपिंग और जीनोटाइपिंग के लिए उच्च-थ्रूपुट प्लेटफ़ॉर्म। ये उपकरण बड़े प्रयोगों की अनुमति देते हैं, जबकि डेटा संग्रह के लिए केवल मानव-आधारित विधि की तुलना में कम समय में कई प्लॉटों का मूल्यांकन करना संभव बनाते हैं। अंत में, रुचि के सभी एकत्र किए गए डेटा को आगे के विश्लेषण के लिए एक संगठित डेटा फ्रेम में संग्रहीत किया जाना चाहिए।
विश्लेषण और डेटा व्याख्या
वर्णनात्मक उपकरण (Descriptive tools)
মূল নিবন্ধ: Descriptive statistics
डेटा को तालिकाओं (tables) या चित्रात्मक प्रतिनिधित्व के माध्यम से दर्शाया जा सकता है, जैसे लाइन चार्ट, बार चार्ट, हिस्टोग्राम, स्कैटर प्लॉट। इसके अलावा, केंद्रीय प्रवृत्ति (central tendency) और सांख्यिकीय फैलाव (variability) के उपाय डेटा का अवलोकन देने के लिए बहुत उपयोगी हो सकते हैं। कुछ उदाहरणों का पालन करें:
आवृत्ति तालिकाएँ (Frequency tables)
तालिका का एक प्रकार आवृत्ति (frequency) तालिका है, जिसमें पंक्तियों और स्तंभों में व्यवस्थित डेटा शामिल होता है, जहाँ आवृत्ति डेटा की घटनाओं या पुनरावृत्तियों की संख्या होती है। आवृत्ति हो सकती है:[9]
निरपेक्ष (Absolute): एक निर्धारित मान जितनी बार दिखाई देता है, उसकी संख्या को दर्शाता है;
सापेक्ष (Relative): निरपेक्ष आवृत्ति को कुल संख्या से विभाजित करके प्राप्त किया जाता है;
अगले उदाहरण में, हमारे पास एक ही जीव के दस ओपेरॉन (operons) में जीनों की संख्या है।
- 1=Genes = 2,3,3,4,5,3,3,3,3,4
| जीनों की संख्या | निरपेक्ष आवृत्ति | सापेक्ष आवृत्ति |
|---|---|---|
| 1 | 0 | 0 |
| 2 | 1 | 0.1 |
| 3 | 6 | 0.6 |
| 4 | 2 | 0.2 |
| 5 | 1 | 0.1 |
लाइन ग्राफ (Line graph)
लाइन ग्राफ किसी अन्य मीट्रिक, जैसे समय, पर किसी मान के परिवर्तन का प्रतिनिधित्व करते हैं। सामान्य तौर पर, मानों को ऊर्ध्वाधर अक्ष में दर्शाया जाता है, जबकि समय परिवर्तन को क्षैतिज अक्ष में दर्शाया जाता है।[11]
बार चार्ट (Bar chart)
बार चार्ट एक ऐसा ग्राफ है जो श्रेणीबद्ध डेटा को ऊंचाइयों (ऊर्ध्वाधर बार) या चौड़ाई (क्षैतिज बार) को दर्शाने वाली सलाखों के रूप में दिखाता है जो मानों के आनुपातिक होती हैं। बार चार्ट एक ऐसी छवि प्रदान करते हैं जिसे सारणीबद्ध प्रारूप में भी दर्शाया जा सकता है।[11]
बार चार्ट के उदाहरण में, हमारे पास 2010 से 2016 तक दिसंबर के महीनों के लिए ब्राजील में जन्म दर (birth rate) है।[10] दिसंबर 2016 में आई भारी गिरावट ब्राजील में जन्म दर पर जीका वायरस के प्रकोप को दर्शाती है।
हिस्टोग्राम (Histograms)
हिस्टोग्राम (या आवृत्ति वितरण) सारणीबद्ध और समान या असमान वर्गों में विभाजित डेटासेट का एक चित्रात्मक प्रतिनिधित्व है। इसे सबसे पहले कार्ल पियर्सन (Karl Pearson) ने पेश किया था।[12]
स्कैटर प्लॉट (Scatter plot)
स्कैटर प्लॉट एक गणितीय आरेख है जो डेटासेट के मानों को प्रदर्शित करने के लिए कार्टेशियन निर्देशांक (Cartesian coordinates) का उपयोग करता है। एक स्कैटर प्लॉट डेटा को बिंदुओं के एक सेट के रूप में दिखाता है, जिनमें से प्रत्येक एक चर के मान को क्षैतिज अक्ष पर अपनी स्थिति निर्धारित करता है और दूसरा चर ऊर्ध्वाधर अक्ष पर।[13] इन्हें स्कैटर ग्राफ, स्कैटर चार्ट, स्कैटरग्राम, या स्कैटर डायग्राम भी कहा जाता है।[14]
माध्य (Mean)
মূল নিবন্ধ: Mean
अंकगणितीय माध्य (arithmetic mean) मानों के एक संग्रह का योग () होता है जिसे इस संग्रह की वस्तुओं की संख्या () से विभाजित किया जाता है।
माध्यिका (Median)
মূল নিবন্ধ: Median
माध्यिका (median) डेटासेट के बीच में स्थित मान है।
बहुलक (Mode)
মূল নিবন্ধ: Mode (statistics)
बहुलक (mode) डेटा के एक सेट का वह मान है जो सबसे अधिक बार दिखाई देता है।[15]
| प्रकार | उदाहरण | परिणाम |
|---|---|---|
| माध्य (Mean) | ( 2 + 3 + 3 + 3 + 3 + 3 + 4 + 4 + 11 ) / 9 | 4 |
| माध्यिका (Median) | 2, 3, 3, 3, 3, 3, 4, 4, 11 | 3 |
| बहुलक (Mode) | 2, 3, 3, 3, 3, 3, 4, 4, 11 | 3 |
बॉक्स प्लॉट (Box plot)
बॉक्स प्लॉट संख्यात्मक डेटा के समूहों को चित्रात्मक रूप से दर्शाने की एक विधि है। अधिकतम और न्यूनतम मानों को लाइनों द्वारा दर्शाया जाता है, और अंतरचतुर्थक परिसर (interquartile range - IQR) डेटा के 25–75% भाग का प्रतिनिधित्व करता है। अतिदूरस्थ मान (Outliers) को वृत्तों के रूप में प्लॉट किया जा सकता है।
सहसंबंध गुणांक (Correlation coefficients)
यद्यपि दो अलग-अलग प्रकार के डेटा के बीच सहसंबंधों का अनुमान स्कैटर प्लॉट जैसे ग्राफ़ द्वारा लगाया जा सकता है, लेकिन संख्यात्मक जानकारी के माध्यम से इसकी पुष्टि करना आवश्यक है। इस कारण से, सहसंबंध गुणांक (correlation coefficients) की आवश्यकता होती है। वे एक संख्यात्मक मान प्रदान करते हैं जो किसी संघ की ताकत को दर्शाता है।[11]
पियर्सन सहसंबंध गुणांक (Pearson correlation coefficient)
पियर्सन सहसंबंध गुणांक (Pearson correlation coefficient) दो चर, X और Y के बीच जुड़ाव का एक माप है। यह गुणांक, जिसे आमतौर पर जनसंख्या के लिए ρ (रो) और नमूने के लिए r द्वारा दर्शाया जाता है, -1 और 1 के बीच के मानों को मानता है, जहाँ ρ = 1 एक पूर्ण सकारात्मक सहसंबंध का प्रतिनिधित्व करता है, ρ = -1 एक पूर्ण नकारात्मक सहसंबंध का प्रतिनिधित्व करता है, और ρ = 0 कोई रैखिक सहसंबंध नहीं है।[11]
अनुमानात्मक सांख्यिकी (Inferential statistics)
মূল নিবন্ধ: Statistical inference
इसका उपयोग अनुमान और/या परिकल्पना परीक्षण द्वारा किसी अज्ञात जनसंख्या के बारे में अनुमान (inferences) लगाने के लिए किया जाता है।[16] दूसरे शब्दों में, रुचि की जनसंख्या का वर्णन करने के लिए पैरामीटर प्राप्त करना वांछनीय है, लेकिन चूंकि डेटा सीमित है, इसलिए उनका अनुमान लगाने के लिए एक प्रतिनिधि नमूने का उपयोग करना आवश्यक है। इसके साथ, पहले से परिभाषित परिकल्पनाओं का परीक्षण करना और पूरी जनसंख्या पर निष्कर्षों को लागू करना संभव है। माध्य की मानक त्रुटि (standard error of the mean) परिवर्तनशीलता का एक माप है जो अनुमान लगाने के लिए महत्वपूर्ण है।[6]
- परिकल्पना परीक्षण (Hypothesis testing)
"अनुसंधान योजना" खंड में तय किए गए अनुसंधान प्रश्नों का उत्तर देने के उद्देश्य से जनसंख्या के बारे में अनुमान लगाने के लिए परिकल्पना परीक्षण आवश्यक है। लेखकों ने निर्धारित करने के लिए चार चरण परिभाषित किए:[6]
- परीक्षण की जाने वाली परिकल्पना: जैसा कि पहले कहा गया है, हमें शून्य परिकल्पना (null hypothesis) (H0) की परिभाषा के साथ काम करना होगा, जिसका परीक्षण किया जाना है, और एक वैैकल्पिक परिकल्पना (alternative hypothesis)। लेकिन उन्हें प्रयोग के कार्यान्वयन से पहले परिभाषित किया जाना चाहिए।
- महत्व स्तर और निर्णय नियम: एक निर्णय नियम महत्व के स्तर (significance level) पर निर्भर करता है, या दूसरे शब्दों में, स्वीकार्य त्रुटि दर (α) पर। यह सोचना आसान है कि हम एक महत्वपूर्ण मूल्य (critical value) परिभाषित करते हैं जो सांख्यिकीय महत्व निर्धारित करता है जब किसी परीक्षण सांख्यिकी (test statistic) की तुलना इसके साथ की जाती है। इसलिए, α को भी प्रयोग से पहले पूर्व निर्धारित करना होगा।
- प्रयोग और सांख्यिकीय विश्लेषण: यह तब होता है जब उपयुक्त प्रायोगिक डिज़ाइन का पालन करते हुए प्रयोग वास्तव में कार्यान्वित किया जाता है, डेटा एकत्र किया जाता है और अधिक उपयुक्त सांख्यिकीय परीक्षणों का मूल्यांकन किया जाता है।
- अनुमान: तब बनाया जाता है जब p-values और α की तुलना से मिलने वाले साक्ष्य के आधार पर शून्य परिकल्पना को अस्वीकार कर दिया जाता है या अस्वीकार नहीं किया जाता है। यह बताया गया है कि H0 को अस्वीकार करने में विफलता का मतलब केवल यह है कि इसके अस्वीकार का समर्थन करने के लिए पर्याप्त साक्ष्य नहीं हैं, न कि यह कि यह परिकल्पना सत्य है।
- विश्वास अंतराल (Confidence intervals)
विश्वास अंतराल मानों की एक सीमा है जिसमें एक निश्चित स्तर के विश्वास को देखते हुए वास्तविक पैरामीटर मान हो सकता है। पहला चरण जनसंख्या पैरामीटर का सबसे अच्छा-निष्पक्ष अनुमान (best-unbiased estimate) लगाना है। अंतराल का ऊपरी मान इस अनुमान के योग तथा माध्य की मानक त्रुटि और विश्वास स्तर के बीच के गुणन द्वारा प्राप्त किया जाता है। निचले मान की गणना समान है, लेकिन योग के बजाय, एक घटाव लागू किया जाना चाहिए।[6]
सांख्यिकीय विचार
शक्ति और सांख्यिकीय त्रुटि (Power and statistical error)
किसी परिकल्पना का परीक्षण करते समय, दो प्रकार की सांख्यिकीय त्रुटियां संभव हैं: टाइप I त्रुटि (Type I error) और टाइप II त्रुटि (Type II error)।
- टाइप I त्रुटि या फॉल्स पॉज़िटिव (मिथ्या सकारात्मक), सत्य शून्य परिकल्पना (null hypothesis) को गलत तरीके से अस्वीकार करना है।
- टाइप II त्रुटि या फॉल्स नेगेटिव (मिथ्या नकारात्मक), असत्य शून्य परिकल्पना को अस्वीकार करने में विफलता है।
α द्वारा दर्शाया गया सार्थकता स्तर टाइप I त्रुटि दर है और परीक्षण करने से पहले इसका चयन किया जाना चाहिए। टाइप II त्रुटि दर को β द्वारा दर्शाया जाता है और परीक्षण की सांख्यिकीय शक्ति (statistical power) 1 − β होती है।
p-मान (p-value)
p-मान इस बात की प्रायिकता (probability) है कि शून्य परिकल्पना (H0) के सत्य होने की स्थिति में, प्रेक्षित परिणामों जितने चरम या उनसे भी अधिक चरम परिणाम प्राप्त होंगे। इसे परिकलित प्रायिकता भी कहा जाता है। p-मान को सार्थकता स्तर (α) के साथ भ्रमित करना आम बात है, लेकिन α महत्वपूर्ण परिणामों को इंगित करने के लिए एक पूर्वनिर्धारित सीमा (threshold) है। यदि p, α से कम है, तो शून्य परिकल्पना (H0) को अस्वीकार कर दिया जाता है।[17]
एकाधिक परीक्षण (Multiple testing)
समान परिकल्पना के एकाधिक परीक्षणों में, फॉल्स पॉज़िटिव (मिथ्या सकारात्मक) के होने की प्रायिकता (फ़ैमिली-वाइज त्रुटि दर) बढ़ जाती है और इस घटना को ध्यान में रखने के लिए एक रणनीति की आवश्यकता होती है। यह आमतौर पर शून्य परिकल्पनाओं को अस्वीकार करने के लिए अधिक कठोर सीमा (threshold) का उपयोग करके प्राप्त किया जाता है। बोनफेरोनी सुधार (Bonferroni correction) एक स्वीकार्य वैश्विक सार्थकता स्तर को परिभाषित करता है, जिसे α* द्वारा दर्शाया जाता है और प्रत्येक परीक्षण की व्यक्तिगत रूप से α = α*/m के मान के साथ तुलना की जाती है। यह सुनिश्चित करता है कि सभी m परीक्षणों में फ़ैमिली-वाइज त्रुटि दर, α* से कम या उसके बराबर हो। जब m बड़ा होता है, तो बोनफेरोनी सुधार अत्यधिक रूढ़िवादी हो सकता है। बोनफेरोनी सुधार का एक विकल्प फॉल्स डिस्कवरी रेट (FDR) को नियंत्रित करना है। FDR अस्वीकृत शून्य परिकल्पनाओं (जिन्हें डिस्कवरी कहा जाता है) के उस अपेक्षित अनुपात को नियंत्रित करता है जो झूठे (गलत तरीके से अस्वीकृत) हैं। यह प्रक्रिया सुनिश्चित करती है कि, स्वतंत्र परीक्षणों के लिए, फॉल्स डिस्कवरी रेट अधिकतम q* हो। इस प्रकार, FDR बोनफेरोनी सुधार की तुलना में कम रूढ़िवादी है और अधिक फॉल्स पॉज़िटिव की कीमत पर अधिक शक्ति (power) रखता है।[18]
मॉडल विनिर्देशन त्रुटि और सुदृढ़ता जाँच (Mis-specification and robustness checks)
परीक्षण की जा रही मुख्य परिकल्पना (उदा. उपचारों और परिणामों के बीच कोई सहसंबंध नहीं) के साथ अक्सर अन्य तकनीकी धारणाएँ (उदा. परिणामों के प्रायिकता वितरण के रूप के बारे में) भी होती हैं जो शून्य परिकल्पना का हिस्सा होती हैं। जब व्यावहारिक रूप में तकनीकी धारणाओं का उल्लंघन होता है, तो मुख्य परिकल्पना के सत्य होने पर भी शून्य परिकल्पना को बार-बार अस्वीकार किया जा सकता है। ऐसे अस्वीकरणों को मॉडल विनिर्देशन त्रुटि (model mis-specification) के कारण हुआ माना जाता है।[19] तकनीकी मान्यताओं में थोड़ा बदलाव करने पर भी सांख्यिकीय परीक्षण का परिणाम न बदले (तथाकथित सुदृढ़ता जाँच या robustness checks), यह सत्यापित करना मॉडल विनिर्देशन त्रुटि से निपटने का मुख्य तरीका है।
मॉडल चयन मानदंड (Model selection criteria)
मॉडल चयन मानदंड उस मॉडल का चयन या निर्माण करेगा जो वास्तविक मॉडल के सबसे अधिक निकट हो। अकाइके सूचना मानदंड (AIC) और बेजियन सूचना मानदंड (BIC) स्पर्शोन्मुख रूप से कुशल (asymptotically efficient) मानदंडों के उदाहरण हैं।
विकास और बिग डेटा
December 2016
हाल के विकास ने बायोस्टैटिस्टिक्स पर बहुत बड़ा प्रभाव डाला है। दो महत्वपूर्ण परिवर्तन उच्च-थ्रूपुट पैमाने (high-throughput scale) पर डेटा एकत्र करने की क्षमता, और कम्प्यूटेशनल तकनीकों का उपयोग करके अधिक जटिल विश्लेषण करने की क्षमता रहे हैं। यह अनुक्रमण (sequencing) प्रौद्योगिकियों, बायोइन्फॉर्मेटिक्स और मशीन लर्निंग (बायोइन्फॉर्मेटिक्स में मशीन लर्निंग) जैसे क्षेत्रों में विकास से आया है।
उच्च-थ्रूपुट डेटा में उपयोग
नई बायोमेडिकल प्रौद्योगिकियाँ जैसे माइक्रोएरे, नेक्स्ट-जेनेरेशन सीक्वेंसर (जीनोमिक्स के लिए) और मास स्पेक्ट्रोमीटर (प्रोटिओमिक्स के लिए) भारी मात्रा में डेटा उत्पन्न करते हैं, जिससे कई परीक्षण एक साथ करने की अनुमति मिलती है।[20] शोर (noise) से सिग्नल को अलग करने के लिए बायोस्टैटिस्टिकल विधियों के साथ सावधानीपूर्वक विश्लेषण की आवश्यकता होती है। उदाहरण के लिए, सामान्य कोशिकाओं की तुलना में रोगग्रस्त कोशिकाओं में किन जीनों की अभिव्यक्ति (expression) भिन्न है, यह निर्धारित करने के लिए एक माइक्रोएरे का उपयोग एक साथ कई हजार जीनों को मापने के लिए किया जा सकता है। हालांकि, जीनों का केवल एक अंश ही अलग तरह से व्यक्त होगा।[21]
उच्च-थ्रूपुट बायोस्टैटिस्टिकल सेटिंग्स में बहुसहरेखता (multicollinearity) अक्सर होती है। भविष्यवक्ताओं (जैसे जीन अभिव्यक्ति स्तर) के बीच उच्च अंतःसहसंबंध (intercorrelation) के कारण, एक भविष्यवक्ता की जानकारी दूसरे में समाहित हो सकती है। ऐसा हो सकता है कि केवल 5% भविष्यवक्ता ही प्रतिक्रिया (response) की 90% परिवर्तनशीलता के लिए जिम्मेदार हों। ऐसे मामले में, कोई व्यक्ति आयाम न्यूनीकरण (dimension reduction) की बायोस्टैटिस्टिकल तकनीक लागू कर सकता है (उदाहरण के लिए मुख्य घटक विश्लेषण के माध्यम से)। रैखिक या लॉजिस्टिक रिग्रेशन और रैखिक विविक्त विश्लेषण (linear discriminant analysis) जैसी क्लासिकल सांख्यिकीय तकनीकें उच्च-आयामी डेटा (यानी जब प्रेक्षणों की संख्या n, विशेषताओं या भविष्यवक्ताओं की संख्या p से कम हो: n < p) के लिए अच्छी तरह से काम नहीं करती हैं। वास्तव में, सांख्यिकीय मॉडल की बहुत कम भविष्यवाणीय शक्ति के बावजूद काफी उच्च R2-मान प्राप्त किए जा सकते हैं। ये क्लासिकल सांख्यिकीय तकनीकें (विशेष रूप से लहर्स्ट स्क्वेयर रैखिक रिग्रेशन) कम-आयामी डेटा के लिए विकसित की गई थीं (यानी जहां प्रेक्षणों की संख्या n, भविष्यवक्ताओं की संख्या p से बहुत बड़ी है: n >> p)। उच्च आयाम के मामलों में, किसी को हमेशा एक स्वतंत्र सत्यापन परीक्षण सेट (validation test set) और उसके संगत अवशिष्ट वर्गों के योग (RSS) और सत्यापन परीक्षण सेट के R2 पर विचार करना चाहिए, न कि प्रशिक्षण सेट के।
अक्सर, कई भविष्यवक्ताओं की जानकारी को एक साथ समूहित करना उपयोगी होता है। उदाहरण के लिए, Gene Set Enrichment Analysis (GSEA) एकल जीनों के बजाय संपूर्ण (कार्यात्मक रूप से संबंधित) जीन सेटों के व्यवधान (perturbation) पर विचार करता है।[22] ये जीन सेट ज्ञात जैव रासायनिक मार्ग (biochemical pathways) या अन्यथा कार्यात्मक रूप से संबंधित जीन हो सकते हैं। इस दृष्टिकोण का लाभ यह है कि यह अधिक मजबूत (robust) है: इस बात की संभावना अधिक होती है कि किसी एकल जीन को गलती से बाधित पाया जाए, बजाय इसके कि पूरे पाथवे को गलती से बाधित पाया जाए। इसके अलावा, इस दृष्टिकोण का उपयोग करके जैव रासायनिक मार्गों (जैसे JAK-STAT सिग्नलिंग पाथवे) के बारे में संचित ज्ञान को एकीकृत किया जा सकता है।
डेटाबेस, डेटा माइनिंग और जैविक व्याख्या में बायोइन्फॉर्मेटिक्स की प्रगति
जैविक डेटाबेस का विकास दुनिया भर के उपयोगकर्ताओं के लिए पहुंच सुनिश्चित करने की संभावना के साथ जैविक डेटा के भंडारण और प्रबंधन को सक्षम बनाता है। वे शोधकर्ताओं के लिए डेटा जमा करने, अन्य प्रयोगों से उत्पन्न जानकारी और फाइलों (कच्चे या प्रसंस्कृत) को पुनः प्राप्त करने या वैज्ञानिक लेखों को अनुक्रमणित करने के लिए उपयोगी हैं, जैसे PubMed। एक अन्य संभावना वांछित शब्द (एक जीन, एक प्रोटीन, एक बीमारी, एक जीव, और इसी तरह) की खोज करना और इस खोज से संबंधित सभी परिणामों की जाँच करना है। ऐसे डेटाबेस हैं जो SNPs (dbSNP), जीन लक्षण वर्णन और उनके मार्गों पर ज्ञान (KEGG) और सेलुलर घटक, आणविक कार्य और जैविक प्रक्रिया द्वारा इसे वर्गीकृत करने वाले जीन फ़ंक्शन के विवरण (जीन ऑन्कोलॉजी) के लिए समर्पित हैं।[23] विशिष्ट आणविक जानकारी वाले डेटाबेस के अलावा, अन्य ऐसे डेटाबेस भी हैं जो इस अर्थ में व्यापक हैं कि वे किसी जीव या जीवों के समूह के बारे में जानकारी संग्रहीत करते हैं। केवल एक जीव की ओर निर्देशित डेटाबेस के उदाहरण के रूप में, लेकिन जिसमें इसके बारे में बहुत सारा डेटा है, Arabidopsis thaliana आनुवंशिक और आणविक डेटाबेस – TAIR है।[24] बदले में, Phytozome,[25] दर्जनों पौधों के जीनोम के असेंबली और एनोटेशन फ़ाइलों को संग्रहीत करता है, जिसमें विज़ुअलाइज़ेशन और विश्लेषण उपकरण भी शामिल हैं। इसके अलावा, सूचना विनिमय/साझाकरण में कुछ डेटाबेस के बीच एक अंतर्संबंध है और एक प्रमुख पहल International Nucleotide Sequence Database Collaboration (INSDC)[26] थी जो DDBJ,[27] EMBL-EBI,[28] और NCBI[29] के डेटा से संबंधित है।
आजकल, आणविक डेटासेट के आकार और जटिलता में वृद्धि से कंप्यूटर विज्ञान एल्गोरिदम द्वारा प्रदान की जाने वाली शक्तिशाली सांख्यिकीय विधियों का उपयोग होता है जिन्हें मशीन लर्निंग क्षेत्र द्वारा विकसित किया जाता है। इसलिए, डेटा माइनिंग और मशीन लर्निंग, पर्यवेक्षित और अपरवेक्षित लर्निंग, रिग्रेशन, क्लस्टर का पता लगाने और एसोसिएशन रूल माइनिंग आदि की विधियों का उपयोग करके जटिल संरचना वाले डेटा (जैसे जैविक डेटा) में पैटर्न का पता लगाने की अनुमति देते हैं।[23] उनमें से कुछ को इंगित करने के लिए, सेल्फ-ऑर्गेनाइजिंग मैप्स और k-मीन्स क्लस्टर एल्गोरिदम के उदाहरण हैं; न्यूरल नेटवर्क कार्यान्वयन और सपोर्ट वेक्टर मशीन मॉडल सामान्य मशीन लर्निंग एल्गोरिदम के उदाहरण हैं।
योजना बनाने से लेकर, डेटा जनरेशन और विश्लेषण से गुजरने, और परिणामों की जैविक व्याख्या के साथ समाप्त होने तक, एक प्रयोग को सही ढंग से करने के लिए आणविक जीवविज्ञानियों, बायोइन्फॉर्मेटिशियनों, सांख्यिकीविदों और कंप्यूटर वैज्ञानिकों के बीच सहयोगात्मक कार्य महत्वपूर्ण है।[23]
कम्प्यूटेशनल रूप से गहन विधियों का उपयोग
दूसरी ओर, आधुनिक कंप्यूटर प्रौद्योगिकी के आगमन और अपेक्षाकृत सस्ते कंप्यूटिंग संसाधनों ने बूटस्ट्रैपिंग और री-सैंपलिंग विधियों जैसी कंप्यूटर-गहन बायोस्टैटिस्टिकल विधियों को सक्षम किया है।
हाल के समय में, रैंडम फॉरेस्ट ने सांख्यिकीय वर्गीकरण करने की एक विधि के रूप में लोकप्रियता हासिल की है। रैंडम फॉरेस्ट तकनीक निर्णय वृक्षों (decision trees) का एक पैनल तैयार करती है। निर्णय वृक्षों का यह लाभ है कि आप उन्हें आकर्षित और व्याख्या कर सकते हैं (गणित और सांख्यिकी की बुनियादी समझ के साथ भी)। इसलिए रैंडम फॉरेस्ट का उपयोग नैदानिक निर्णय समर्थन प्रणालियों (clinical decision support systems) के लिए किया गया है।[30]
अनुप्रयोग
section
सार्वजनिक स्वास्थ्य (Public health)
सार्वजनिक स्वास्थ्य, जिसमें महामारी विज्ञान, स्वास्थ्य सेवा अनुसंधान, पोषण, पर्यावरण स्वास्थ्य और स्वास्थ्य देखभाल नीति और प्रबंधन शामिल हैं। इन चिकित्सा संदर्भों में, नैदानिक परीक्षणों के डिजाइन और विश्लेषण पर विचार करना महत्वपूर्ण है। एक उदाहरण के रूप में, किसी बीमारी के परिणाम के पूर्वानुमान के साथ रोगी की गंभीरता की स्थिति का आकलन करना है।
नई तकनीकों और आनुवंशिकी ज्ञान के साथ, बायोस्टैटिस्टिक्स का उपयोग अब सिस्टम्स मेडिसिन के लिए भी किया जाता है, जिसमें अधिक व्यक्तिगत चिकित्सा शामिल होती है। इसके लिए, पारंपरिक रोगी डेटा, क्लिनिको-पैथोलॉजिकल मापदंडों, आणविक और आनुवंशिक डेटा के साथ-साथ अतिरिक्त नई-ओमिक्स प्रौद्योगिकियों द्वारा उत्पन्न डेटा सहित विभिन्न स्रोतों से डेटा का एकीकरण किया जाता है।[31]
मात्रात्मक आनुवंशिकी (Quantitative genetics)
जीनोटाइप में भिन्नता को फेनोटाइप में भिन्नता के साथ जोड़ने के लिए जनसंख्या आनुवंशिकी और सांख्यिकीय आनुवंशिकी का अध्ययन। दूसरे शब्दों में, एक मापने योग्य लक्षण, एक मात्रात्मक लक्षण के आनुवंशिक आधार की खोज करना वांछनीय है, जो पॉलीजेनिक नियंत्रण के अधीन है। एक जीनोम क्षेत्र जो एक निरंतर लक्षण के लिए जिम्मेदार है, मात्रात्मक लक्षण लोकस (QTL) कहलाता है। QTLs का अध्ययन आणविक मार्करों का उपयोग करके और आबादी में लक्षणों को मापकर संभव हो जाता है, लेकिन उनके मैपिंग के लिए एक प्रायोगिक क्रॉसिंग से आबादी प्राप्त करने की आवश्यकता होती है, जैसे F2 या रिकांबिनेंट इनब्रेड स्ट्रेन/लाइन्स (RILs)। जीनोम में QTLs क्षेत्रों को स्कैन करने के लिए, लिंकेज पर आधारित जीन मैप का निर्माण करना होगा। सबसे जाने-माने QTL मैपिंग एल्गोरिदम में से कुछ इंटरवल मैपिंग, कंपोजिट इंटरवल मैपिंग और मल्टीपल इंटरवल मैपिंग हैं।[32]
हालांकि, QTL मैपिंग रिज़ॉल्यूशन परख किए गए पुनर्संयोजन (recombination) की मात्रा से बाधित होता है, जो उन प्रजातियों के लिए एक समस्या है जिनमें बड़े संतान प्राप्त करना मुश्किल है। इसके अलावा, एलील विविधता उन व्यक्तियों तक सीमित है जो विपरीत माता-पिता से उत्पन्न हुए हैं, जो एलील विविधता के अध्ययन को सीमित करती है जब हमारे पास एक प्राकृतिक आबादी का प्रतिनिधित्व करने वाला व्यक्तियों का एक पैनल होता है।[33] इस कारण से, लिंकेज असंतुलन (अर्थात लक्षणों और आणविक मार्करों के बीच गैर-यादृच्छिक सहयोग) के आधार पर QTLs की पहचान करने के लिए जीनोम-व्यापी एसोसिएशन स्टडी (GWAS) का प्रस्ताव किया गया था। इसे उच्च-थ्रूपुट एसएनपी जीनोटाइपिंग के विकास द्वारा सुगम बनाया गया था।[34]
पशु और पादप प्रजनन में, प्रजनन के उद्देश्य से चयन में मार्करों का उपयोग, मुख्य रूप से आणविक लोगों ने, मार्कर-सहायता प्राप्त चयन (marker-assisted selection) के विकास में सहयोग किया। जबकि QTL मैपिंग रिज़ॉल्यूशन के कारण सीमित है, GWAS के पास पर्याप्त शक्ति नहीं होती है जब छोटे प्रभाव के दुर्लभ वेरिएंट होते हैं जो पर्यावरण से भी प्रभावित होते हैं। इसलिए, चयन में सभी आणविक मार्करों का उपयोग करने और इस चयन में उम्मीदवारों के प्रदर्शन की भविष्यवाणी की अनुमति देने के लिए जीनोमिक चयन (Genomic Selection - GS) की अवधारणा उत्पन्न होती है। प्रस्ताव एक प्रशिक्षण आबादी को जीनोटाइप और फेनोटाइप करना है, एक ऐसा मॉडल विकसित करना है जो एक जीनोटाइप से संबंधित व्यक्तियों के जीनोमिक अनुमानित प्रजनन मूल्यों (GEBVs) को प्राप्त कर सकता है और लेकिन फेनोटाइप आबादी नहीं, जिसे परीक्षण आबादी कहा जाता है।[35] इस तरह के अध्ययन में क्रॉस-वैलिडेशन की अवधारणा को ध्यान में रखते हुए एक सत्यापन आबादी (validation population) भी शामिल हो सकती है, जिसमें इस आबादी में मापे गए वास्तविक फेनोटाइप परिणामों की भविष्यवाणी के आधार पर फेनोटाइप परिणामों के साथ तुलना की जाती है, जिसका उपयोग मॉडल की सटीकता की जाँच के लिए किया जाता है।
संक्षेप में, मात्रात्मक आनुवंशिकी के अनुप्रयोग के बारे में कुछ बिंदु हैं:
- इसका उपयोग फसलों को सुधारने (पादप प्रजनन) और पशुधन (पशु प्रजनन) के लिए कृषि में किया गया है।
- बायोमेडिकल अनुसंधान में, यह कार्य मानव आनुवंशिकी में बीमारियों का कारण बनने वाले या उनके प्रति संवेदनशीलता को प्रभावित करने वाले उम्मीदवार जीन एलील को खोजने में सहायता कर सकता है।
अभिव्यक्ति डेटा (Expression data)
RNA-Seq डेटा से जीनों की विभेदक अभिव्यक्ति (differential expression) के अध्ययन, RT-qPCR और माइक्रोएरे के लिए, स्थितियों की तुलना की मांग करते हैं। इसका लक्ष्य उन जीनों की पहचान करना है जिनमें विभिन्न स्थितियों के बीच प्रचुरता में महत्वपूर्ण परिवर्तन होता है। फिर, प्रयोगों को उचित रूप से डिज़ाइन किया जाता है, जिसमें प्रत्येक स्थिति/उपचार के लिए प्रतिकृतियों (replicates), यादृच्छिकरण (randomization) और ब्लॉकिंग (blocking) शामिल होती है, जब आवश्यक हो। RNA-Seq में, अभिव्यक्ति का मात्रा निर्धारण मैप किए गए रीड्स की जानकारी का उपयोग करता है जिन्हें कुछ आनुवंशिक इकाई में संक्षेपित किया जाता है, जैसे एक्सन जो एक जीन अनुक्रम का हिस्सा हैं। चूंकि माइक्रोएरे परिणामों को सामान्य वितरण (normal distribution) द्वारा अनुमानित किया जा सकता है, इसलिए RNA-Seq काउंट डेटा को अन्य वितरणों द्वारा बेहतर ढंग से समझाया जाता है। पहला उपयोग किया जाने वाला वितरण पॉसों वितरण था, लेकिन यह नमूना त्रुटि को कम आंकता है, जिससे फॉल्स पॉज़िटिव होते हैं। वर्तमान में, जैविक भिन्नता को उन विधियों द्वारा माना जाता है जो ऋणात्मक द्विपद वितरण (negative binomial distribution) के फैलाव पैरामीटर का अनुमान लगाते हैं। सांख्यिकीय सार्थकता के लिए परीक्षण करने के लिए सामान्यीकृत रैखिक मॉडल का उपयोग किया जाता है और चूंकि जीनों की संख्या अधिक है, इसलिए एकाधिक परीक्षण सुधार (multiple tests correction) पर विचार करना होगा।[36] जीनोमिक्स डेटा पर अन्य विश्लेषणों के कुछ उदाहरण माइक्रोएरे या प्रोटिओमिक्स प्रयोगों से आते हैं।[37][38] अक्सर बीमारियों या बीमारी के चरणों से संबंधित।[39]
अन्य अध्ययन
- पारिस्थितिकी, पारिस्थितिक पूर्वानुमान
- जैविक अनुक्रम विश्लेषण (sequence analysis)[40]
- जीन नेटवर्क अनुमान या पाथवे विश्लेषण के लिए सिस्टम्स बायोलॉजी।[41]
- नैदानिक अनुसंधान और दवा विकास
- जनसंख्या गतिशीलता, विशेष रूप से मत्स्य विज्ञान के संबंध में।
- फाइलोजेनेटिक्स और विकास (evolution)
- फार्माकोडायनामिक्स
- फार्माकोकाइनेटिक्स
- न्यूरोइमaging
उपकरण
जैविक डेटा में सांख्यिकीय विश्लेषण करने के लिए कई उपकरणों का उपयोग किया जा सकता है। उनमें से अधिकांश ज्ञान के अन्य क्षेत्रों में उपयोगी हैं, जो बड़ी संख्या में अनुप्रयोगों को कवर करते हैं (वर्णमाला के अनुसार)। उनमें से कुछ के संक्षिप्त विवरण यहाँ दिए गए हैं:
- ASReml: VSNi[42] द्वारा विकसित एक अन्य सॉफ्टवेयर जिसे एक पैकेज के रूप में R वातावरण में भी उपयोग किया जा सकता है। इसे प्रतिबंधित अधिकतम संभावना (REML) का उपयोग करके सामान्य रैखिक मिश्रित मॉडल के तहत प्रसरण घटकों का अनुमान लगाने के लिए विकसित किया गया है। निश्चित प्रभावों और यादृच्छिक प्रभावों तथा नेस्टेड या क्रॉस किए गए मॉडल की अनुमति है। यह विभिन्न प्रसरण-सहप्रसरण मैट्रिक्स संरचनाओं की जांच करने की संभावना देता है।
- CycDesigN:[43] VSNi[42] द्वारा विकसित एक कंप्यूटर पैकेज जो शोधकर्ताओं को प्रायोगिक डिज़ाइन बनाने और CycDesigN द्वारा प्रबंधित तीन श्रेणियों में से किसी एक में मौजूद डिज़ाइन से आने वाले डेटा का विश्लेषण करने में मदद करता है। ये श्रेणियां रिज़ॉलवबल (समाधान योग्य), नॉन-रिज़ॉलवबल (गैर-समाधान योग्य), आंशिक रूप से प्रतिकृति और क्रॉसओवर डिज़ाइन हैं। इसमें कम उपयोग किए जाने वाले डिज़ाइन जैसे लैटिनराइज़्ड डिज़ाइन, जैसे टी-लैटिनराइज़्ड डिज़ाइन शामिल हैं।[44]
- ऑरेंज (Orange): उच्च-स्तरीय डेटा प्रोसेसिंग, डेटा माइनिंग और डेटा विज़ुअलाइज़ेशन के लिए एक प्रोग्रामिंग इंटरफ़ेस। इसमें जीन अभिव्यक्ति और जीनोमिक्स के लिए उपकरण शामिल हैं।[23]
- R: सांख्यिकीय कंप्यूटिंग और ग्राफिक्स को समर्पित एक ओपन सोर्स वातावरण और प्रोग्रामिंग भाषा। यह CRAN द्वारा अनुरक्षित S भाषा का एक कार्यान्वयन है।[45] डेटा टेबल पढ़ने, वर्णनात्मक आँकड़े लेने, मॉडल विकसित करने और उनका मूल्यांकन करने के अपने कार्यों के अलावा, इसकी रिपॉजिटरी में दुनिया भर के शोधकर्ताओं द्वारा विकसित पैकेज शामिल हैं। यह विशिष्ट अनुप्रयोगों से आने वाले डेटा के सांख्यिकीय विश्लेषण से निपटने के लिए लिखे गए कार्यों के विकास की अनुमति देता है।[46] जैव सूचना विज्ञान के मामले में, उदाहरण के लिए, मुख्य रिपॉजिटरी (CRAN) में और अन्य में, जैसे Bioconductor में पैकेज स्थित हैं। GitHub जैसी होस्टिंग-सेवाओं में साझा किए जाने वाले विकास के अधीन पैकेजों का उपयोग करना भी संभव है।
- SAS: व्यापक रूप से उपयोग किया जाने वाला डेटा विश्लेषण सॉफ्टवेयर, जो विश्वविद्यालयों, सेवाओं और उद्योग के माध्यम से जाता है। इसी नाम की कंपनी (SAS Institute) द्वारा विकसित, यह प्रोग्रामिंग के लिए SAS language का उपयोग करता है।
- PLA 3.0:[47] विनियमित वातावरण (जैसे दवा परीक्षण) के लिए एक बायोस्टैटिस्टिकल विश्लेषण सॉफ्टवेयर है जो मात्रात्मक प्रतिक्रिया परख (पैरेलल-लाइन, पैरेलल-लॉजिस्टिक, स्लोप-रेशियो) और द्विभाजित परख (क्वांटल रिस्पॉन्सेस, बाइनरी एसेज़) का समर्थन करता है। यह संयोजन गणना के लिए भारन (वेटिंग) विधियों और स्वतंत्र परख डेटा के स्वचालित डेटा एकत्रीकरण का भी समर्थन करता है।
- वेका (Weka): विज़ुअलाइज़ेशन, क्लस्टरिंग, रिग्रेशन, एसोसिएशन रूल और वर्गीकरण के लिए उपकरण और तरीकों सहित, मशीन लर्निंग और डेटा माइनिंग के लिए एक जावा (Java) सॉफ्टवेयर। क्रॉस-वैलिडेशन, बूटस्ट्रैपिंग और एल्गोरिथ्म तुलना का एक मॉड्यूल के लिए उपकरण हैं। वेका को पर्ल (Perl) या R जैसी अन्य प्रोग्रामिंग भाषाओं में भी चलाया जा सकता है।[23]
- पायथन (Python) छवि विश्लेषण, डीप-learning, मशीन-learning
- SQL डेटाबेस
- NoSQL
- NumPy संख्यात्मक पायथन
- SciPy
- SageMath
- LAPACK रैखिक बीजगणित
- MATLAB
- Apache Hadoop
- Apache Spark
- Amazon Web Services
दायरा और प्रशिक्षण कार्यक्रम
बायोस्टैटिस्टिक्स में लगभग सभी शैक्षणिक कार्यक्रम स्नातकोत्तर स्तर पर होते हैं। वे सबसे अधिक सार्वजनिक स्वास्थ्य स्कूलों में पाए जाते हैं, जो चिकित्सा, वानिकी या कृषि के स्कूलों से जुड़े होते हैं, या सांख्यिकी विभागों में आवेदन के केंद्र के रूप में होते हैं।
संयुक्त राज्य अमेरिका में, जहाँ कई विश्वविद्यालयों में समर्पित बायोस्टैटिस्टिक्स विभाग हैं, कई अन्य शीर्ष-स्तरीय विश्वविद्यालय बायोस्टैटिस्टिक्स संकाय को सांख्यिकी या अन्य विभागों, जैसे कि महामारी विज्ञान, में एकीकृत करते हैं। इस प्रकार, "बायोस्टैटिस्टिक्स" नाम वाले विभाग काफी अलग संरचनाओं के तहत मौजूद हो सकते हैं। उदाहरण के लिए, अपेक्षाकृत नए बायोस्टैटिस्टिक्स विभागों की स्थापना जैव सूचना विज्ञान और क्यूटेशनल बायोलॉजी पर ध्यान केंद्रित करते हुए की गई है, जबकि पुराने विभाग, जो आम तौर पर सार्वजनिक स्वास्थ्य स्कूलों से जुड़े होते हैं, उनमें महामारी विज्ञान के अध्ययन और नैदानिक परीक्षणों के साथ-साथ जैव सूचना विज्ञान से जुड़े अधिक पारंपरिक अनुसंधान तौर-तरीके होंगे। दुनिया भर के बड़े विश्वविद्यालयों में, जहाँ सांख्यिकी और बायोस्टैटिस्टिक्स दोनों विभाग मौजूद हैं, दोनों विभागों के बीच एकीकरण की डिग्री न्यूनतम से लेकर बहुत करीबी सहयोग तक हो सकती है। सामान्य तौर पर, सांख्यिकी कार्यक्रम और बायोस्टैटिस्टिक्स कार्यक्रम के बीच का अंतर दो गुना है: (i) सांख्यिकी विभाग अक्सर सैद्धांतिक/विधि-संबंधी अनुसंधान की मेजबानी करेंगे जो बायोस्टैटिस्टिक्स कार्यक्रमों में कम आम हैं और (ii) सांख्यिकी विभागों में अनुसंधान की ऐसी रेखाएँ हैं जिनमें बायोमेडिकल अनुप्रयोग शामिल हो सकते हैं लेकिन उद्योग (गुणवत्ता नियंत्रण), व्यवसाय और अर्थशास्त्र जैसे अन्य क्षेत्र और चिकित्सा के अलावा जैविक क्षेत्र भी शामिल हो सकते हैं।
विशेष पत्रिकाएँ
আরও দেখুন: List of statistics journals#Biostatistics
- Biostatistics[48]
- International Journal of Biostatistics[49]
- Journal of Epidemiology and Biostatistics[50]
- Biostatistics and Public Health[51]
- Biometrics[52]
- Biometrika[53]
- Biometrical Journal[54]
- Communications in Biometry and Crop Science[55]
- Statistical Applications in Genetics and Molecular Biology[56]
- Statistical Methods in Medical Research[57]
- Pharmaceutical Statistics[58]
- Statistics in Medicine[59]
इन्हें भी देखें
- जैव सूचना विज्ञान
- महामारी विज्ञान की विधि
- महामारी विज्ञान
- समूह आकार माप
- स्वास्थ्य संकेतक
- गणितीय और सैद्धांतिक जीव विज्ञान
संदर्भ
- ↑ (2016-10-24). International Encyclopedia of Public Health. International Encyclopedia of Public Health (Second Edition). 223–232. ISBN 978-0-12-803708-9. doi:10.1016/B978-0-12-803678-5.00034-5.
- ↑ Centre for Transformative Innovation, Swinburne University of Technology. Allan, Frances Elizabeth (Betty) - Person - Encyclopedia of Australian Science and Innovation. www.eoas.info.
- ↑ (10 December 2008). "Quantitative Genetics". Nature. 456 (7223) 719. doi:10.1038/456719a.
- ↑ Charles T. Munger. (2003-10-03). Academic Economics: Strengths and Faults After Considering Interdisciplinary Needs.
- ↑ 5.0 5.1 5.2 (October 2017). "Developing a Hypothesis and Statistical Planning". Journal of Cardiothoracic and Vascular Anesthesia. 31 (5) 1878–1882. doi:10.1053/j.jvca.2017.04.020.
- ↑ 6.0 6.1 6.2 6.3 (2017). "Biostatistics Primer: Part I". Nutrition in Clinical Practice. 22 (6) 629–35. doi:10.1177/0115426507022006629.
- ↑ (4 October 2002). "Key Concepts in Biostatistics: Using Statistics to Answer the Question "Is There a Difference?"". Seminars in Dialysis. 15 (5) 347–351. doi:10.1046/j.1525-139X.2002.00085.x.
- ↑ (2000). "Combining Qualitative and Quantitative Sampling, Data Collection, and Analysis Techniques in Mixed-Method Studies". Research in Nursing & Health. 23 (3) 246–255. doi:<246::AID-NUR9>3.0.CO;2-H 10.1002/1098-240X(200006)23:3<246::AID-NUR9>3.0.CO;2-H.
- ↑ Maths, Sangaku. Absolute, relative, cumulative frequency and statistical tables – Probability and Statistics. www.sangakoo.com.
- ↑ 10.0 10.1 DATASUS: TabNet Win32 3.0: Nascidos vivos – Brasil. DATASUS: Tecnologia da Informação a Serviço du SUS.
- ↑ 11.0 11.1 11.2 11.3 (1995). "Introduction to Biostatistics. A Guide to Design, Analysis, and Discovery". Academic Press. ISBN 978-0-12-262270-0.
- ↑ Pearson, Karl. (1895-01-01). "X. Contributions to the mathematical theory of evolution.—II. Skew variation in homogeneous material". Phil. Trans. R. Soc. Lond. A. 186 343–414. doi:10.1098/rsta.1895.0010.
- ↑ Utts, Jessica M.. (2005). "Seeing through statistics". Thomson, Brooks/Cole. ISBN 978-0-534-39402-8.
- ↑ Jarrell, Stephen B.. (1994). "Basic statistics". Wm. C. Brown Pub. ISBN 978-0-697-21595-6.
- ↑ Gujarati, Damodar N.. (2006). "Econometrics". McGraw-Hill Irwin.
- ↑ (2009). "Essentials of Biostatistics in Public Health & Essentials of Biostatistics Workbook: Statistical Computing Using Excel". Australian and New Zealand Journal of Public Health. 33 (2) 196–197. doi:10.1111/j.1753-6405.2009.00372.x.
- ↑ (2016). "Statisticians issue warning over misuse of P values". Nature. 531 (7593) 151. doi:10.1038/nature.2016.19503.
- ↑ Benjamini, Y. & Hochberg, Y. Controlling the False Discovery Rate: A Practical and Powerful Approach to Multiple Testing. Journal of the Royal Statistical Society. Series B (Methodological) 57, 289–300 (1995).
- ↑ Null hypothesis. www.statlect.com.
- ↑ (8 February 2012). "Biostatistics: Revealing analysis". Nature. 482 (7384) 263–265. doi:10.1038/nj7384-263a.
- ↑ (February 2008). "Microarrays, Empirical Bayes and the Two-Groups Model". Statistical Science. 23 (1) 1–22. doi:10.1214/07-STS236.
- ↑ (30 September 2005). "Gene set enrichment analysis: A knowledge-based approach for interpreting genome-wide expression profiles". Proceedings of the National Academy of Sciences. 102 (43) 15545–15550. doi:10.1073/pnas.0506580102.
- ↑ 23.0 23.1 23.2 23.3 23.4 (2007). "Bioinformatics". Journal of Cellular Physiology. 213 (2) 365–9. doi:10.1002/jcp.21218.
- ↑ TAIR - Home Page. www.arabidopsis.org.
- ↑ Phytozome. phytozome.jgi.doe.gov.
- ↑ International Nucleotide Sequence Database Collaboration - INSDC. www.insdc.org.
- ↑ (11 January 2024). Top. www.ddbj.nig.ac.jp.
- ↑ The European Bioinformatics Institute < EMBL-EBI. www.ebi.ac.uk.
- ↑ National Center for Biotechnology Information. www.ncbi.nlm.nih.gov.
- ↑ A Privacy-Preserving Algorithm for Clinical Decision-Support Systems Using Random Forest. Tech Science Press.
- ↑ (2018). "Whither systems medicine?". Experimental & Molecular Medicine. 50 (3) e453. doi:10.1038/emm.2017.290.
- ↑ (2005). "QTL mapping and the genetic basis of adaptation: Recent developments". Genetica. 123 (1–2) 25–37. doi:10.1007/s10709-004-2705-0.
- ↑ (2013). "The advantages and limitations of trait analysis with GWAS: A review". Plant Methods. 9 (1) 29. doi:10.1186/1746-4811-9-29.
- ↑ (2008). "Status and Prospects of Association Mapping in Plants". The Plant Genome. 1 5–20. doi:10.3835/plantgenome2008.02.0089.
- ↑ (2017). Genomic Selection in Plant Breeding: Methods, Models, and Perspectives. Trends in Plant Science. 22 (11) 961–975. doi:10.1016/j.tplants.2017.08.011.
- ↑ (2010). "From RNA-seq reads to differential expression results". Genome Biology. 11 (12) 220. doi:10.1186/gb-2010-11-12-220.
- ↑ (2003). "Statistical Analysis of Gene Expression Microarray Data". Wiley-Blackwell.
- ↑ Terry Speed. (2003). "Microarray Gene Expression Data Analysis: A Beginner's Guide". Chapman & Hall/CRC.
- ↑ (2010). "Medical Biostatistics for Complex Diseases". Wiley-Blackwell. ISBN 978-3-527-32585-6.
- ↑ (2004). "Statistical Methods in Bioinformatics: An Introduction". Springer.
- ↑ (2011). "Applied Statistics for Network Biology: Methods in Systems Biology". Wiley-Blackwell. ISBN 978-3-527-32750-8.
- ↑ 42.0 42.1 Home - VSN International. www.vsni.co.uk.
- ↑ CycDesigN - VSN International. www.vsni.co.uk.
- ↑ (2015). "Beyond Latin Squares: A Brief Tour of Row-Column Designs". Agronomy Journal. 107 (6) 2263. doi:10.2134/agronj15.0144.
- ↑ The Comprehensive R Archive Network. cran.r-project.org.
- ↑ Renganathan V. (2021). "Biostatistics explored through R software: An overview". Vinaitheerthan Renganathan. ISBN 978-93-5493-658-6.
- ↑ Stegmann, Dr Ralf. (2019-07-01). PLA 3.0. PLA 3.0 – Software for Biostatistical Analysis.
- ↑ Biostatistics - Oxford Academic. OUP Academic.
- ↑ The International Journal of Biostatistics.
- ↑ (15 June 2018). PubMed Journals will be shut down.
- ↑ https://ebph.it/ Epidemiology
- ↑ Biometrics. onlinelibrary.wiley.com. doi:10.1111/(ISSN)1541-0420.
- ↑ Biometrika - Oxford Academic. OUP Academic.
- ↑ Biometrical Journal. onlinelibrary.wiley.com. doi:10.1002/(ISSN)1521-4036.
- ↑ Communications in Biometry and Crop Science. agrobiol.sggw.waw.pl.
- ↑ (1 May 2002). Statistical Applications in Genetics and Molecular Biology. www.degruyter.com.
- ↑ (12 December 2024). Statistical Methods in Medical Research. SAGE Journals.
- ↑ Pharmaceutical Statistics. onlinelibrary.wiley.com. doi:10.1002/(ISSN)1539-1612.
- ↑ Statistics in Medicine. onlinelibrary.wiley.com. doi:10.1002/(ISSN)1097-0258.
बाहरी कड़ियाँ
- द इंटरनेशनल बायोमेट्रिक सोसाइटी
- द कलेक्शन ऑफ बायोस्टैटिस्टिक्स रिसर्च आर्काइव
- गाइड टू बायोस्टैटिस्टिक्स (MedPageToday.com) সংরক্ষিত সংস্করণ
- बायोमेडिकल स्टैटिस्टिक्स
applications
स्रोत: अंग्रेज़ी विकिपीडिया के “Biostatistics” लेख का अनुवाद। मूल लेख: https://en.wikipedia.org/wiki/Biostatistics यह अनुवाद स्वचालित रूप से तैयार किया गया है।
