صورت مسئله و مفاهیم پایه
پیش از انتخاب فرمول، جامعه، واحد نمونهگیری، چارچوب و هدف برآورد را دقیق تعریف میکنیم.
نمونهگیری یعنی انتخاب بخشی از واحدهای جامعه با یک روش مشخص، بهگونهای که بتوان از اطلاعات نمونه درباره جامعه نتیجه گرفت. کیفیت نتیجه فقط به تعداد افراد وابسته نیست؛ روش انتخاب افراد نیز به همان اندازه مهم است.
یک نمونه بزرگ اما در دسترس میتواند سوگیرانهتر از یک نمونه کوچکتر و واقعاً تصادفی باشد.
جامعه هدف کسانی یا چیزهایی هستند که نتیجه باید درباره آنها بیان شود. واحد نمونهگیری چیزی است که انتخاب میشود و واحد تحلیل چیزی است که در فایل یک سطر را تشکیل میدهد؛ این دو همیشه یکسان نیستند.
- جامعه هدف: همه کارکنان رسمی شرکت در سال ۱۴۰۵
- واحد نمونهگیری: کارمند موجود در فهرست منابع انسانی
- واحد تحلیل: پاسخ هر کارمند
- دامنه تعمیم: فقط واحدهایی که شانس ورود به نمونه داشتهاند
چارچوب نمونهگیری فهرست یا سامانهای است که نمونه عملاً از آن انتخاب میشود. نبود برخی اعضای جامعه، ثبت تکراری یا اطلاعات قدیمی، خطای پوشش ایجاد میکند.
- ۱دامنه جامعه و تاریخ مرجع را بنویسید.
- ۲برای هر واحد یک شناسه یکتا بسازید.
- ۳موارد تکراری و خارج از جامعه را حذف کنید.
- ۴پوشش فهرست را با یک منبع مستقل مقایسه کنید.
- ۵نسخه نهایی فهرست و تاریخ استخراج را نگه دارید.
وقتی جامعه بسیار کوچک، دسترسی آسان و هزینه خطا بالا است، سرشماری میتواند منطقی باشد. با این حال سرشماری هم از عدم پاسخ، خطای اندازهگیری و داده گمشده مصون نیست. برای جامعه بزرگ یا پراکنده، نمونهگیری علمی معمولاً سریعتر و قابلکنترلتر است.
| وضعیت | انتخاب اولیه |
|---|---|
| جامعه کوچک و همه واحدها در دسترس | سرشماری یا دعوت از همه |
| جامعه بزرگ با فهرست کامل | نمونه احتمالی |
| جامعه پراکنده و پرهزینه | خوشهای یا چندمرحلهای |
| زیرگروههای مهم با اندازه متفاوت | طبقهای |
در نمونهگیری احتمالی، احتمال انتخاب هر واحد معلوم و بزرگتر از صفر است؛ بنابراین برآورد خطای نمونهگیری و وزندهی ممکن میشود. در نمونهگیری غیراحتمالی مانند در دسترس یا داوطلبانه، احتمال انتخاب معلوم نیست و تعمیم آماری محدودتر است.
انتخاب روش نمونهگیری
روشهای اصلی را با مثال، کاربرد و مهمترین خطر هر روش مقایسه میکنیم.
همه واحدهای چارچوب شانس برابر و مستقل برای انتخاب دارند. این روش برای جامعه نسبتاً همگن و فهرست کامل مناسب است.
- ۱به هر واحد شناسه یکتا بدهید.
- ۲تعداد موردنیاز n را تعیین کنید.
- ۳یک بذر تصادفی ثبت کنید.
- ۴n شناسه را بدون جایگذاری انتخاب کنید.
- ۵فهرست انتخاب اصلی و ذخیره را جدا نگه دارید.
پس از یک شروع تصادفی، هر kاُمین واحد انتخاب میشود. برای جامعه ۱۲۰۰ نفری و نمونه ۳۰۰ نفری، k=۴ است؛ اگر شروع تصادفی ۳ باشد، شناسههای ۳، ۷، ۱۱ و ... انتخاب میشوند.
جامعه ابتدا به طبقات غیرهمپوشان مانند استان، جنس یا نوع واحد تقسیم میشود و از هر طبقه نمونه تصادفی گرفته میشود. این روش پوشش زیرگروههای مهم را تضمین و گاهی دقت را بیشتر میکند.
- تخصیص متناسب: سهم نمونه هر طبقه متناسب با اندازه آن است.
- تخصیص نامتناسب: برای طبقات کوچک نمونه بیشتری میگیریم و در تحلیل وزن اعمال میکنیم.
- تعریف طبقه باید پیش از انتخاب نمونه ثابت باشد.
بهجای انتخاب مستقیم افراد، گروههای طبیعی مانند مدرسه، روستا یا شعبه انتخاب میشوند و سپس همه یا بخشی از اعضای خوشه بررسی میشوند. هزینه اجرا کمتر میشود، اما شباهت اعضای یک خوشه معمولاً واریانس را افزایش میدهد.
در مطالعات وسیع، انتخاب در چند سطح انجام میشود؛ برای مثال ابتدا شهرستان، سپس مدرسه، کلاس و در پایان دانشآموز. احتمال انتخاب نهایی حاصلضرب احتمالهای هر مرحله است.
نمونهگیری در دسترس، هدفمند، سهمیهای و گلولهبرفی در پژوهش اکتشافی یا دسترسی به گروههای دشوار کاربرد دارند؛ اما جدول حجم نمونه احتمالی بهتنهایی آنها را نماینده جامعه نمیکند.
| روش | کاربرد متداول | محدودیت اصلی |
|---|---|---|
| در دسترس | مطالعه مقدماتی | سوگیری انتخاب |
| هدفمند | افراد دارای تجربه خاص | تعمیم محدود |
| سهمیهای | حفظ سهم ظاهری گروهها | انتخاب غیرتصادفی در سهمها |
| گلولهبرفی | جمعیت پنهان | وابستگی شبکهای |
روش را از روی محدودیت میدانی، ساختار جامعه و هدف تعمیم انتخاب کنید، نه فقط سهولت اجرا.
| شرایط | روش پیشنهادی | نکته کلیدی |
|---|---|---|
| فهرست کامل و جامعه همگن | تصادفی ساده | انتخاب بدون جایگذاری |
| فهرست مرتب و بدون تناوب | سیستماتیک | شروع تصادفی |
| زیرگروههای مهم | طبقهای | نمونه تصادفی در هر طبقه |
| جامعه جغرافیایی پراکنده | خوشهای | اثر طرح و وزن |
| چند سطح سازمانی | چندمرحلهای | ثبت احتمال هر مرحله |
| جامعه پنهان یا اکتشافی | هدفمند/گلولهبرفی | تعمیم آماری محدود |
محاسبه حجم نمونه مناسب
فرمول پایه را میآموزیم و سپس جامعه محدود، عدم پاسخ، خوشهبندی و نوع هدف پژوهش را وارد محاسبه میکنیم.
یک عدد ثابت برای همه پژوهشها وجود ندارد. حجم نمونه به هدف اصلی، نوع شاخص، دقت موردنیاز، سطح اطمینان، تغییرپذیری، توان، روش نمونهگیری و عدم پاسخ وابسته است.
- برآورد یک نسبت: نسبت مورد انتظار p و خطای مجاز d
- برآورد یک میانگین: انحراف معیار σ و خطای مجاز d
- مقایسه گروهها: تفاوت مهم، پراکندگی، α و توان
- طرح خوشهای: اثر طرح DEFF
- جامعه محدود: اندازه واقعی N
برای نمونهگیری تصادفی ساده از جامعه بزرگ، فرمول زیر حجم نمونه اولیه را میدهد؛ این رابطه در بسیاری از منابع فارسی با عنوان فرمول کوکران شناخته میشود. در سطح اطمینان ۹۵٪، z=۱٫۹۶ است. اگر p ناشناخته باشد، p=۰٫۵ محافظهکارانهترین حجم را تولید میکند.
جدول زیر برای برآورد یک نسبت با p=۰٫۵، سطح اطمینان ۹۵٪، نمونهگیری تصادفی ساده و انتخاب بدون جایگذاری محاسبه شده است. اعداد رو به بالا گرد شدهاند.
| اندازه جامعه N | ±۱۰٪ | ±۷٪ | ±۵٪ | ±۴٪ | ±۳٪ |
|---|---|---|---|---|---|
| ۱۰۰ | ۵۰ | ۶۷ | ۸۰ | ۸۶ | ۹۲ |
| ۲۰۰ | ۶۶ | ۱۰۰ | ۱۳۲ | ۱۵۱ | ۱۶۹ |
| ۵۰۰ | ۸۱ | ۱۴۲ | ۲۱۸ | ۲۷۴ | ۳۴۱ |
| ۱٬۰۰۰ | ۸۸ | ۱۶۵ | ۲۷۸ | ۳۷۶ | ۵۱۷ |
| ۵٬۰۰۰ | ۹۵ | ۱۸۹ | ۳۵۷ | ۵۳۷ | ۸۸۰ |
| ۱۰٬۰۰۰ | ۹۶ | ۱۹۳ | ۳۷۰ | ۵۶۷ | ۹۶۵ |
| بسیار بزرگ | ۹۷ | ۱۹۶ | ۳۸۵ | ۶۰۱ | ۱٬۰۶۸ |
وقتی نمونه بدون جایگذاری از جامعه محدود انتخاب میشود، میتوان n₀ را با اندازه واقعی جامعه اصلاح کرد. هرچه نسبت نمونه به جامعه بزرگتر باشد، اثر اصلاح بیشتر است.
میخواهیم درصد رضایت را در جامعه ۱۰۰۰ نفری با اطمینان ۹۵٪ و خطای ±۵٪ برآورد کنیم. چون نسبت قبلی نداریم p=۰٫۵ میگذاریم. ابتدا n₀=۳۸۴٫۱۶ و پس از اصلاح جامعه محدود n=۲۷۷٫۷۴ به دست میآید؛ بنابراین حداقل ۲۷۸ پاسخ کامل لازم است.
- ۱z=۱٫۹۶، p=۰٫۵ و d=۰٫۰۵ را تعیین کنید.
- ۲حجم جامعه N=۱۰۰۰ را وارد کنید.
- ۳n₀ را محاسبه کنید: حدود ۳۸۵.
- ۴اصلاح جامعه محدود را اعمال کنید: حدود ۲۷۸.
- ۵در پایان عدم پاسخ و اثر طرح را جدا اضافه کنید.
اگر انتظار داریم فقط ۸۰٪ افراد پاسخ کامل بدهند، تعداد دعوتشونده باید از تقسیم حجم نمونه تحلیل بر نرخ پاسخ به دست آید. برای مثال قبل، ۲۷۸÷۰٫۸=۳۴۷٫۵؛ پس دستکم ۳۴۸ نفر باید انتخاب یا دعوت شوند.
در نمونه خوشهای، شباهت اعضای خوشه دقت را کاهش میدهد. حجم نمونه تصادفی ساده در DEFF ضرب میشود. اگر DEFF=۱٫۵ و ۲۷۸ پاسخ کامل لازم باشد، هدف به ۴۱۷ پاسخ کامل میرسد؛ با نرخ پاسخ ۸۰٪ باید حدود ۵۲۲ واحد دعوت شوند.
برای برآورد میانگین، انحراف معیار مورد انتظار جای p را میگیرد. مثلاً با σ=۱۲، خطای مجاز ۳ و اطمینان ۹۵٪، n₀=(۱٫۹۶×۱۲÷۳)²≈۶۲ است. برای مقایسه دو گروه یا مدل رگرسیون، اندازه اثر علمی مهم، α، توان، نسبت تخصیص و ریزش لازماند و جدول نسبت مناسب نیست.
در تخصیص متناسب، سهم هر طبقه برابر سهم آن از جامعه است. اگر N=۱۰۰۰ و n=۲۷۸ باشد و سه طبقه ۵۰۰، ۳۰۰ و ۲۰۰ عضو داشته باشند، تخصیص مناسب بهترتیب ۱۳۹، ۸۳ و ۵۶ نفر است.
| طبقه | اندازه Nₕ | سهم جامعه | نمونه nₕ |
|---|---|---|---|
| الف | ۵۰۰ | ۵۰٪ | ۱۳۹ |
| ب | ۳۰۰ | ۳۰٪ | ۸۳ |
| ج | ۲۰۰ | ۲۰٪ | ۵۶ |
| جمع | ۱٬۰۰۰ | ۱۰۰٪ | ۲۷۸ |
اجرای عملی و ساخت فایل نمونه
انتخاب تصادفی را در ابزارهای رایج بازتولید میکنیم و ستونهای لازم برای وزندهی و پیگیری پاسخ را میسازیم.
نمونه تصادفی ساده در Excel
[3]- ۱فهرست کامل و شناسه یکتا را در یک برگه نگه دارید.
- ۲کنار هر سطر تابع RAND() را وارد کنید.
- ۳مقادیر تصادفی را Copy و Paste Values کنید تا ثابت بمانند.
- ۴کل جدول را براساس ستون تصادفی مرتب کنید.
- ۵n سطر اول را انتخاب و بذر/نسخه فایل را بایگانی کنید.
انتخاب بازتولیدپذیر در R
[7]بذر تصادفی و نسخه فهرست را ثبت کنید. آرگومان replace=FALSE یعنی انتخاب بدون جایگذاری.
set.seed(1405)
n <- 278
selected_id <- sample(frame$id, size = n, replace = FALSE)
sample_data <- frame[frame$id %in% selected_id, ]انتخاب بازتولیدپذیر در Python
[8]Generator.choice میتواند شناسهها را بدون جایگذاری انتخاب کند. بذر ثابت، بازتولید همان انتخاب را ممکن میکند.
import numpy as np
rng = np.random.default_rng(1405)
selected_id = rng.choice(frame['id'].to_numpy(), size=278, replace=False)
sample_data = frame[frame['id'].isin(selected_id)]فایل عملیات نمونهگیری را از فایل پاسخها جدا نگه دارید و اطلاعات محرمانه را محدود کنید.
| ستون | معنا |
|---|---|
| sample_id | شناسه یکتای واحد |
| stratum | طبقه نمونهگیری |
| cluster_id | شناسه خوشه |
| selection_probability | احتمال انتخاب π |
| base_weight | وزن پایه ۱/π |
| selected | انتخاب شده/نشده |
| response_status | کامل، ناقص یا عدم پاسخ |
وزن پایه معکوس احتمال انتخاب است. اگر احتمالها نابرابر باشند یا عدم پاسخ و کالیبراسیون اصلاح شود، تحلیل بدون وزن میتواند برآورد جامعه را منحرف کند. نرمافزار باید طبقه، خوشه و وزن را همزمان بشناسد.
کنترل کیفیت و گزارش روش
خطاهای رایج را مییابیم و یک متن شفاف برای بخش روش مقاله یا پایاننامه آماده میکنیم.
- استفاده از جدول حجم نمونه بدون مشخصکردن هدف اصلی
- فرض نمایندهبودن نمونه در دسترس
- نادیدهگرفتن عدم پاسخ و ریزش
- استفاده از فرمول تصادفی ساده برای طرح خوشهای
- جایگزینی خودسرانه افراد پاسخنداده
- حذف وزن در تحلیل با احتمال انتخاب نابرابر
- گزارش نکردن چارچوب، تاریخ انتخاب و بذر تصادفی
اعداد داخل کروشه را با مشخصات واقعی پژوهش جایگزین کنید.
جامعه هدف شامل [تعریف جامعه] با اندازه N=[…] بود. چارچوب نمونهگیری از [منبع و تاریخ] تهیه شد. نمونه با روش [تصادفی ساده/طبقهای/خوشهای] انتخاب شد. برای برآورد [شاخص اصلی] با سطح اطمینان ۹۵٪، خطای مجاز […] و فرض […]، حجم نمونه پایه […] محاسبه و پس از اعمال اصلاح جامعه محدود، اثر طرح […] و نرخ پاسخ مورد انتظار […]، تعداد […] واحد انتخاب شد. انتخاب با بذر […] انجام و در تحلیل، طبقه، خوشه و وزن نمونهگیری لحاظ شد.
- جامعه هدف، جامعه در دسترس و واحد تحلیل تعریف شدهاند.
- چارچوب نمونهگیری کامل، بدون تکرار و تاریخدار است.
- روش انتخاب با محدودیتهای میدانی سازگار است.
- فرمول حجم نمونه با هدف اصلی هماهنگ است.
- فرضهای p، σ، اثر، α، توان و خطا مستندند.
- اصلاح جامعه محدود، DEFF، عدم پاسخ و ریزش بررسی شدهاند.
- تخصیص طبقات و تعداد خوشهها مشخص است.
- بذر تصادفی و فهرست انتخاب بایگانی شدهاند.
- وزن، طبقه و خوشه در فایل تحلیل وجود دارند.
- دامنه تعمیم و محدودیتهای پوشش و پاسخ در گزارش آمدهاند.
پاسخ کوتاه به ابهامهای رایج
برای جامعه بزرگ همیشه ۳۸۴ نفر کافی است؟
خیر. عدد حدود ۳۸۵ فقط برای برآورد یک نسبت با p=۰٫۵، اطمینان ۹۵٪، خطای ±۵٪ و نمونه تصادفی ساده از جامعه بزرگ است. هدف تحلیلی، خوشهبندی، عدم پاسخ و اندازه اثر میتوانند عدد را تغییر دهند.
اگر اندازه جامعه را ندانیم چه کنیم؟
ابتدا دامنه جامعه و بهترین برآورد N را از منابع اداری تعیین کنید. برای جامعه بسیار بزرگ، فرمول n₀ قابل استفاده است؛ اما نبود چارچوب نمونهگیری همچنان یک مشکل مستقل باقی میماند.
نمونه ۳۰ نفری کافی است؟
قاعده عمومی ۳۰ نفر معتبر نیست. کفایت نمونه به شاخص اصلی، تغییرپذیری، دقت، توان و طراحی بستگی دارد.
پایلوت جزو نمونه نهایی حساب میشود؟
فقط اگر طرح، جامعه، ابزار و فرایند پایلوت با مطالعه اصلی یکسان باشد و استفاده دوباره از دادهها از پیش مجاز و مستند شده باشد؛ در غیر این صورت جدا نگه داشته میشود.
برای نمونهگیری طبقهای حجم هر طبقه چقدر باشد؟
در تخصیص متناسب از nₕ=n×Nₕ/N استفاده کنید. اگر طبقات کوچک برای تحلیل جداگانه مهماند، تخصیص نامتناسب ممکن است لازم باشد و باید وزن تحلیل اعمال شود.
آیا افزایش حجم نمونه سوگیری را کم میکند؟
افزایش نمونه خطای تصادفی را کم میکند، اما سوگیری پوشش، انتخاب، عدم پاسخ یا اندازهگیری را الزاماً کاهش نمیدهد.
منابع علمی و راهنماهای رسمی
فرمولها، جدولها و توصیههای این مقاله با منابع زیر تطبیق داده شدهاند.
- ۱World Health Organization — Sample Size Determination in Health Studies: A Practical Manual
- ۲CDC Epi Info — Population Survey or Descriptive Study Sample Size
- ۳United Nations Statistics Division — Designing Household Survey Samples: Practical Guidelines
- ۴World Health Organization — Sampling and Weighting Manual
- ۵NIST/SEMATECH — Confidence Limits and Finite Population Correction
- ۶CDC Field Epidemiology Manual — Collecting Data
- ۷R Documentation — Random Samples and Permutations
- ۸NumPy Documentation — Random Generator choice
آیا این راهنما برای تحلیل شما مفید بود؟
بازخورد شما به دقیقتر شدن نسخههای بعدی این مقاله کمک میکند.

