شرکت آمار صنعت توس
شماره ثبت: ۲۶۸۹۹سال تأسیس: ۱۳۸۵۰۲۱-۷۷۶۵۹۲۳۵
دانشنامه تحلیل دادهشماره ۰۱ · راهنمای مرجعبه‌روزرسانی ۱۴ شهریور ۱۴۰۵

آموزش کاربردی آمار استنباطی

آزمون مربع کای استقلال

راهنمای جامع، ساده و گام‌به‌گام از انتخاب درست آزمون و آماده‌سازی فایل داده تا محاسبه، تفسیر اندازه اثر و نگارش نتیجه علمی

اگر دو ستون طبقه‌ای دارید و می‌خواهید بدانید میان آن‌ها ارتباط آماری وجود دارد یا نه، این مقاله مسیر کامل تحلیل را نشان می‌دهد. هر مرحله ابتدا ساده توضیح داده شده و سپس نکته فنی لازم را اضافه می‌کند؛ بنابراین هم برای نخستین تحلیل و هم برای کنترل یک گزارش پژوهشی قابل استفاده است.

فصل اول

انتخاب درست آزمون

پیش از محاسبه، مطمئن می‌شویم سؤال پژوهش و نوع داده واقعاً با مربع کای استقلال سازگار است.

۰۱

آزمون مربع کای استقلال چیست؟

[1][3]

مربع کای استقلال بررسی می‌کند آیا الگوی توزیع یک متغیر طبقه‌ای در طبقات متغیر طبقه‌ای دیگری یکسان است یا نه. به زبان ساده، می‌پرسد: «دانستن متغیر اول، درباره متغیر دوم اطلاعاتی به ما می‌دهد؟»

این آزمون فراوانی‌های مشاهده‌شده را با فراوانی‌هایی مقایسه می‌کند که اگر دو متغیر مستقل بودند انتظار داشتیم ببینیم. اختلاف بزرگ‌تر از نوسان تصادفی، علیه استقلال شواهد فراهم می‌کند.

۰۲

سؤال پژوهش را چگونه بنویسیم؟

[3]

سؤال باید رابطه میان دو متغیر طبقه‌ای را هدف بگیرد؛ نه تفاوت میانگین‌ها و نه پیش‌بینی یک عدد پیوسته.

  • درست: آیا نوع شیفت کاری با سطح حادثه ارتباط دارد؟
  • درست: آیا وضعیت رضایت در دو گروه درمانی یکسان است؟
  • نادرست: آیا میانگین فشارخون دو گروه متفاوت است؟ این سؤال به آزمون میانگین نیاز دارد.
۰۳

درخت تصمیم کوتاه انتخاب آزمون

[3]

چهار سؤال زیر را به ترتیب پاسخ دهید. اگر پاسخ همه مناسب باشد، مربع کای استقلال انتخاب اولیه شماست.

  1. ۱هدف، بررسی ارتباط است؟
  2. ۲هر دو متغیر طبقه‌ای‌اند؟
  3. ۳هر واحد فقط یک‌بار و در یک خانه جدول شمرده شده است؟
  4. ۴فراوانی‌های مورد انتظار برای تقریب مربع کای کافی‌اند؟
۰۴

چه نوع متغیرهایی پذیرفته می‌شوند؟

[1][4]

هر دو متغیر باید اسمی یا ترتیبی باشند؛ مانند جنسیت، نوع قرارداد، استان، سطح رضایت یا طبقه ریسک. اعداد ۱ و ۲ اگر فقط کد گروه باشند، عددیِ پیوسته محسوب نمی‌شوند.

اگر یک متغیر پیوسته را صرفاً برای اجرای مربع کای به چند دسته تبدیل کنید، بخشی از اطلاعات از دست می‌رود. این کار باید دلیل علمی و مرزهای ازپیش‌تعریف‌شده داشته باشد.

۰۵

چه زمان‌هایی از این آزمون استفاده نکنیم؟

[3][10][12]
  • برای مقایسه میانگین متغیر پیوسته؛ از آزمون t، آنووا یا جایگزین ناپارامتری مناسب استفاده کنید.
  • برای داده‌های قبل و بعد یا زوج‌شده؛ آزمون مک‌نمار یا روش مدل‌سازی تکرار سنجش مناسب‌تر است.
  • برای آزمون برازش یک متغیر به نسبت‌های نظری؛ آزمون مربع کای برازش به‌کار می‌رود، نه استقلال.
  • برای اثبات علت و معلول؛ معنی‌داری فقط وجود ناسازگاری با استقلال را نشان می‌دهد.
فصل دوم

ساخت و کنترل داده

در این فصل فایل خام را به جدول قابل اعتماد تبدیل می‌کنیم و مفروضه‌های اصلی را پیش از آزمون می‌سنجیم.

۰۶

فایل Excel یا CSV چگونه چیده شود؟

[3][6]

ساختار پیشنهادی «طولی» است: هر سطر یک واحد تحلیل و هر ستون یک متغیر. نام ستون‌ها کوتاه و یکتا باشد و سلول‌های ادغام‌شده، عنوان‌های چندسطری و جمع کل داخل داده خام قرار نگیرند.

شناسهگروه درمانرضایت
1001مداخلهراضی
1002کنترلناراضی
1003مداخلهراضی
۰۷

فرهنگ داده و کدگذاری

[3]

برای هر ستون، تعریف، واحد تحلیل، کدهای مجاز و معنای داده گمشده را بنویسید. اگر از کد عددی استفاده می‌کنید، مثلاً 1=کنترل و 2=مداخله، برچسب‌ها را کنار فایل نگه دارید.

  • کد خالی، صفر و ۹۹ را با هم مخلوط نکنید.
  • املای طبقات را یکسان کنید؛ «تهران» و «تهـران» دو طبقه جدا دیده می‌شوند.
  • طبقات باید یکدیگر را نپوشانند و هر مشاهده فقط یک کد داشته باشد.
۰۸

واحد تحلیل و استقلال مشاهدات

[1][3]

واحد تحلیل چیزی است که شمرده می‌شود: فرد، محصول، سفارش یا رخداد. هر واحد باید مستقل از واحدهای دیگر باشد و فقط در یک خانه جدول قرار بگیرد.

۰۹

فراوانی واقعی، نه درصد و میانگین

[1][2]

ورودی جدول توافقی باید تعداد مشاهده‌ها باشد. درصدها برای نمایش نتیجه مناسب‌اند اما اطلاعات حجم نمونه را حفظ نمی‌کنند و نباید به‌تنهایی وارد آزمون شوند.

  • درست: 42 نفر راضی و 18 نفر ناراضی.
  • نادرست: 70٪ راضی و 30٪ ناراضی بدون دانستن تعداد کل.
  • در داده تجمیعی، یک ستون وزن/فراوانی لازم است تا نرم‌افزار تعداد واقعی را بازسازی کند.
۱۰

داده‌های گمشده را پیش از جدول مدیریت کنید

[3]

ابتدا تعداد و الگوی داده‌های گمشده در هر دو متغیر را گزارش کنید. حذف کامل سطرها فقط زمانی ساده و کم‌خطر است که مقدار گمشده اندک و سازوکار آن قابل دفاع باشد.

۱۱

طبقات کم‌تعداد و ادغام گروه‌ها

[2][10]

طبقات بسیار نادر، خانه‌های مورد انتظار کوچک می‌سازند. ادغام طبقات پس از دیدن نتیجه می‌تواند تحلیل را جهت‌دار کند؛ بنابراین ادغام باید بر مبنای منطق موضوعی و ترجیحاً پیش از آزمون تعریف شود.

۱۲

شرط فراوانی مورد انتظار را درست بفهمید

[2][3][10]

شرط به فراوانی «مورد انتظار» مربوط است، نه عدد مشاهده‌شده. انتظار هر خانه از حاصل‌ضرب جمع سطر و جمع ستون، تقسیم بر جمع کل به‌دست می‌آید.

  • قاعده رایج: انتظار هیچ خانه‌ای کمتر از ۱ نباشد.
  • بیش از ۲۰٪ خانه‌ها انتظار کمتر از ۵ نداشته باشند.
  • در جدول ۲×۲ با انتظارهای کوچک، آزمون دقیق فیشر را جدی بررسی کنید.
Eᵢⱼ = (جمع سطر i × جمع ستون j) ÷ N
فصل سوم

محاسبه و تفسیر

منطق آماره، مقدار p، خانه‌های اثرگذار و شدت ارتباط را با یک مثال کوچک قدم‌به‌قدم می‌خوانیم.

۱۳

فرض صفر و فرض مقابل

[1][4]

فرض‌ها باید پیش از دیدن مقدار p نوشته شوند و درباره جامعه آماری باشند.

H₀

دو متغیر در جامعه مستقل‌اند؛ توزیع رضایت در گروه‌های درمانی یکسان است.

H₁

دو متغیر مستقل نیستند؛ دست‌کم بخشی از الگوی رضایت میان گروه‌ها تفاوت دارد.

۱۴

گام اول: جدول مشاهده‌شده

[2][4]

فرض کنید رضایت ۱۰۰ نفر در دو گروه بررسی شده است. ابتدا فقط تعدادهای واقعی را در جدول توافقی می‌نویسیم.

گروهراضیناراضیجمع
مداخله401050
کنترل302050
جمع7030100
۱۵

گام دوم: جدول مورد انتظار

[2][4]

اگر درمان و رضایت مستقل باشند، انتظار خانه «مداخله–راضی» برابر 50×70÷100 یعنی 35 است. همین قاعده برای همه خانه‌ها اجرا می‌شود.

گروهراضی Eناراضی E
مداخله3515
کنترل3515
۱۶

گام سوم: آماره χ²

[1][2]

برای هر خانه، فاصله مشاهده O از انتظار E را به توان دو می‌رسانیم و بر E تقسیم می‌کنیم؛ سپس سهم همه خانه‌ها را جمع می‌کنیم.

χ² = Σ (Oᵢⱼ − Eᵢⱼ)² ÷ Eᵢⱼ
۱۷

گام چهارم: درجه آزادی

[1][9]

در جدول r×c، درجه آزادی از تعداد سطرها و ستون‌های مستقل محاسبه می‌شود. برای جدول ۲×۲ مثال، df برابر ۱ است.

df = (r − 1) × (c − 1)
۱۸

گام پنجم: مقدار p را بدون سوءبرداشت بخوانید

[5]

مقدار p احتمال مشاهده آماره‌ای دست‌کم به این بزرگی است، به شرط آن‌که فرض صفر و مفروضه‌های مدل درست باشند. در مثال، p≈0.029 است؛ در سطح 0.05 شواهد علیه استقلال داریم.

  • p احتمال درست بودن H₀ نیست.
  • p اندازه یا اهمیت رابطه را نشان نمی‌دهد.
  • مرز 0.05 جایگزین قضاوت علمی، کیفیت داده و طراحی مطالعه نیست.
۱۹

کدام خانه‌ها نتیجه را ساخته‌اند؟

[1][4]

یک نتیجه معنادار فقط می‌گوید کل جدول با استقلال سازگار نیست. برای یافتن خانه‌های اثرگذار، سهم χ² هر خانه یا باقیمانده‌ها را بررسی کنید.

سهم هر خانه = (O − E)² ÷ E
۲۰

باقیمانده‌های استانداردشده

[1][6]

علامت باقیمانده جهت اختلاف را نشان می‌دهد: مثبت یعنی مشاهده بیشتر از انتظار و منفی یعنی کمتر از انتظار. قدرمطلق حدود ۲ یا بیشتر، خانه‌ای را برای بررسی دقیق‌تر برجسته می‌کند.

۲۱

شدت رابطه با Cramer’s V

[6][8]

معنی‌داری آماری با حجم نمونه تغییر می‌کند؛ بنابراین باید اندازه اثر را هم گزارش کرد. Cramer’s V عددی بین صفر و یک است و برای جدول‌های بزرگ‌تر از ۲×۲ نیز کاربرد دارد.

V = √[χ² ÷ (N × min(r−1, c−1))]
۲۲

ارتباط با علیت یکی نیست

[5][13]

مربع کای درباره الگوی همراهی دو متغیر است. اگر تخصیص تصادفی، تقدم زمانی و کنترل مخدوش‌گرها وجود نداشته باشد، نتیجه معنادار علت و معلول را ثابت نمی‌کند.

۲۳

وزن‌ها و طرح‌های نمونه‌گیری پیچیده

[11]

در پیمایش‌های طبقه‌بندی‌شده، خوشه‌ای یا دارای وزن، اجرای ساده روی تعدادهای وزن‌خورده ممکن است خطای استاندارد را نادرست کند. در این حالت از روش‌های survey-adjusted و اطلاعات طراحی نمونه استفاده کنید.

فصل چهارم

اجرا، جایگزین‌ها و گزارش

آزمون را در ابزارهای رایج اجرا می‌کنیم، مسیرهای جایگزین را می‌شناسیم و نتیجه‌ای قابل بازتولید می‌نویسیم.

۲۴

جدول‌های کوچک و آزمون‌های جایگزین

[7][10][12][13]

برای جدول ۲×۲ با انتظارهای کوچک، آزمون دقیق فیشر معمولاً انتخاب مطمئن‌تری است. اصلاح پیوستگی ییتس در برخی نرم‌افزارها برای ۲×۲ به‌طور پیش‌فرض اعمال می‌شود و می‌تواند محافظه‌کارانه باشد.

  • داده زوج‌شده دوحالتی: مک‌نمار.
  • چند لایه با متغیر کنترل: روش منتل–هنزل یا مدل رگرسیون.
  • پیامد چندطبقه‌ای با چند پیش‌بین: رگرسیون لجستیک چندجمله‌ای.
  • جدول بزرگ و پراکنده: روش دقیق یا p شبیه‌سازی‌شده، در صورت پشتیبانی نرم‌افزار.
۲۵

اجرای گام‌به‌گام در Excel

[9]
  1. ۱جدول فراوانی مشاهده‌شده را بسازید؛ برای داده خام از PivotTable کمک بگیرید.
  2. ۲جمع سطر، جمع ستون و N را محاسبه کنید.
  3. ۳برای هر خانه E=(جمع سطر×جمع ستون)/N را بنویسید.
  4. ۴با ‎=CHISQ.TEST(actual_range, expected_range)‎ مقدار p را بگیرید.
  5. ۵χ²، df، انتظارهای کوچک و Cramer’s V را جداگانه محاسبه و گزارش کنید.
۲۶

اجرای گام‌به‌گام در SPSS

[6]
  1. ۱Analyze ← Descriptive Statistics ← Crosstabs را باز کنید.
  2. ۲یک متغیر را در Row و دیگری را در Column بگذارید.
  3. ۳در Statistics گزینه Chi-square و Phi and Cramer’s V را فعال کنید.
  4. ۴در Cells، Observed، Expected، Row % و Standardized residuals را انتخاب کنید.
  5. ۵Pearson Chi-Square، پاورقی انتظارها، اندازه اثر و الگوی سلول‌ها را با هم بخوانید.
۲۷

اجرای بازتولیدپذیر در R

[7]

تابع پایه R هم با جدول و هم با دو عامل کار می‌کند. خروجی expected و residuals را کنار نتیجه اصلی ذخیره کنید.

tab <- table(data$treatment, data$satisfaction)
fit <- chisq.test(tab, correct = FALSE)
fit
fit$expected
fit$stdres
۲۸

اجرای بازتولیدپذیر در Python

[8]

در SciPy، تابع chi2_contingency آماره، مقدار p، درجه آزادی و جدول انتظار را بازمی‌گرداند.

from scipy.stats import contingency

table = [[40, 10], [30, 20]]
result = contingency.chi2_contingency(table, correction=False)
print(result.statistic, result.pvalue, result.dof)
print(result.expected_freq)
۲۹

الگوی ساده گزارش علمی

[5][6]

گزارش خوب فقط عبارت «معنادار بود» نیست؛ باید سؤال، حجم نمونه، آماره، درجه آزادی، مقدار p، اندازه اثر و جهت الگوی مهم را کنار هم بیاورد.

میان نوع درمان و وضعیت رضایت ارتباط آماری مشاهده شد، χ²(1, N=100)=4.76, p=.029, Cramer’s V=.218. در گروه مداخله، تعداد افراد راضی بیش از مقدار مورد انتظار تحت فرض استقلال بود. این نتیجه بیانگر ارتباط است و به‌تنهایی علیت را اثبات نمی‌کند.
۳۰

چک‌لیست نهایی پیش از انتشار

[1][5]
  • سؤال و فرض‌ها پیش از مشاهده نتیجه مشخص شده‌اند.
  • هر دو متغیر طبقه‌ای و واحدهای تحلیل مستقل‌اند.
  • ورودی‌ها فراوانی واقعی‌اند و داده گمشده مستند شده است.
  • جدول انتظار و شرط خانه‌های کم‌تعداد بررسی شده است.
  • مقدار p همراه χ²، df، N و Cramer’s V گزارش شده است.
  • باقیمانده‌ها برای توضیح جهت الگو بررسی شده‌اند.
  • محدودیت‌ها، مخدوش‌گرها و نبود ادعای علیت روشن نوشته شده‌اند.
  • فایل داده پاک، کد تحلیل و نسخه نرم‌افزار نگهداری شده است.
پرسش‌های پرتکرار

پاسخ کوتاه به ابهام‌های رایج

آیا مربع کای به نرمال بودن داده نیاز دارد؟

خیر. این آزمون بر فراوانی‌های طبقه‌ای کار می‌کند؛ اما استقلال مشاهدات و کفایت فراوانی‌های مورد انتظار باید بررسی شود.

اگر مقدار p کمتر از 0.05 باشد، رابطه قوی است؟

خیر. مقدار p شدت رابطه را نشان نمی‌دهد. برای شدت، Cramer’s V و برای جهت الگو، درصدها و باقیمانده‌ها را بررسی کنید.

آیا می‌توان درصدها را مستقیماً آزمون کرد؟

خیر. آزمون به تعداد واقعی مشاهده‌ها نیاز دارد. درصدها بدون حجم نمونه اطلاعات کافی ندارند.

برای فراوانی‌های مورد انتظار کوچک چه کنیم؟

در جدول ۲×۲ آزمون دقیق فیشر را بررسی کنید. در جدول‌های بزرگ‌تر، ادغام علمی طبقات، روش دقیق یا شبیه‌سازی‌شده ممکن است مناسب باشد.

نتیجه معنادار رابطه علّی را ثابت می‌کند؟

خیر. مربع کای ارتباط را می‌سنجد. استنباط علّی به طراحی پژوهش، ترتیب زمانی و کنترل عوامل مخدوش‌گر نیاز دارد.

کتابنامه

منابع علمی و مستندات نرم‌افزار

ارجاع‌های داخل متن با شماره‌های زیر تطبیق دارند. آخرین دسترسی: ۱۴ شهریور ۱۴۰۵.

  1. ۱NIST — Chi-Square Independence Test
  2. ۲NIST/SEMATECH — Contingency Tables
  3. ۳Penn State STAT 200 — Relationships Between Categorical Variables
  4. ۴Penn State STAT 504 — Two-Way Tables
  5. ۵American Statistical Association — Statement on p-Values
  6. ۶IBM SPSS Statistics — Crosstabs
  7. ۷R Documentation — Pearson’s Chi-squared Test
  8. ۸SciPy Documentation — Contingency Tables
  9. ۹Microsoft Support — CHISQ.TEST
  10. ۱۰BMJ — Statistics at Square One: Chi-squared Tests
  11. ۱۱R Survey Documentation — Contingency Tables for Survey Data
  12. ۱۲NIST — McNemar Test
  13. ۱۳Penn State STAT 504 — Three-Way Tables and Conditional Independence
نظر خوانندگان

آیا این راهنما برای تحلیل شما مفید بود؟

بازخورد شما به دقیق‌تر شدن نسخه‌های بعدی این مقاله کمک می‌کند.