شرکت آمار صنعت توس
شماره ثبت: ۲۶۸۹۹سال تأسیس: ۱۳۸۵۰۲۱-۷۷۶۵۹۲۳۵
دانشنامه تحلیل دادهراهنمای جامع آزمون‌های پایهبه‌روزرسانی ۱۴ شهریور ۱۴۰۵

همبستگی و رابطه

همبستگی پیرسون

سنجش جهت و شدت رابطه خطی دو متغیر کمی؛ همراه با نمودار پراکنش، فاصله اطمینان و گزارش

شدت و جهت رابطه خطی میان دو متغیر کمی را اندازه می‌گیرد. این مقاله انتخاب روش، آماده‌سازی داده، مفروضه‌ها، منطق محاسبه، اندازه اثر، اجرای نرم‌افزاری و گزارش علمی را بدون پرش و با زبان روشن آموزش می‌دهد.

فصل اول

انتخاب درست آزمون

از سؤال پژوهش شروع می‌کنیم و پیش از هر محاسبه مطمئن می‌شویم این آزمون با داده و طراحی مطالعه سازگار است.

۰۱

همبستگی پیرسون چیست؟

[1][2][3]

شدت و جهت رابطه خطی میان دو متغیر کمی را اندازه می‌گیرد.

در این راهنما، همبستگی پیرسون ابتدا با زبان ساده و سپس با جزئیات فنی، مثال، اندازه اثر و شیوه گزارش بررسی می‌شود.

۰۲

سؤال پژوهش را چگونه بنویسیم؟

[1][2][3]

سؤال مناسب باید جامعه، متغیرها و نوع مقایسه یا رابطه را روشن کند.

  • نمونه درست: آیا ساعات آموزش با نمره عملکرد رابطه خطی دارد؟
  • نمونه نامناسب: آیا افزایش آموزش باعث افزایش عملکرد می‌شود؟ همبستگی به‌تنهایی علیت را ثابت نمی‌کند.
۰۳

مسیر کوتاه تصمیم‌گیری

[1][2][3]

پیش از انتخاب آزمون این چهار تصمیم را به‌ترتیب کنترل کنید.

  1. ۱هدف پژوهش را به مقایسه، رابطه یا سنجش پایایی تبدیل کنید.
  2. ۲ساختار متغیرها را مشخص کنید: دو متغیر کمی زوج‌شده برای واحدهای یکسان.
  3. ۳مستقل یا وابسته بودن مشاهده‌ها را از طراحی مطالعه تشخیص دهید.
  4. ۴مفروضه‌ها و گزینه‌های جایگزین را پیش از دیدن مقدار p بررسی کنید.
۰۴

نوع متغیرها و واحد تحلیل

[1][2][3]

دو متغیر کمی زوج‌شده برای واحدهای یکسان.

واحد تحلیل می‌تواند فرد، محصول، شرکت یا رخداد باشد. تعریف آن باید در روش پژوهش نوشته شود و با هر سطر فایل داده تطابق داشته باشد.

۰۵

چه زمانی این آزمون مناسب است؟

[1][2][3]
  • رابطه موردنظر خطی است.
  • هر سطر یک جفت x و y دارد.
  • هدف برآورد جهت و شدت رابطه خطی است.
۰۶

چه زمانی آزمون دیگری لازم است؟

[1][2][3]
  • رابطه خمیده است.
  • داده فقط رتبه‌ای است؛ اسپیرمن مناسب‌تر است.
  • چند خوشه یا اندازه‌گیری تکراری دارید و استقلال نقض می‌شود.
فصل دوم

آماده‌سازی داده و مفروضه‌ها

فایل داده را به شکل قابل تحلیل می‌سازیم، خطاهای کدگذاری را می‌یابیم و مفروضه‌های آزمون را کنترل می‌کنیم.

۰۷

فایل Excel یا CSV چگونه باشد؟

[1][2][3]

هر سطر یک واحد تحلیل و هر ستون یک متغیر است. نام ستون‌ها کوتاه، یکتا و بدون سلول ادغام‌شده باشد.

  • x: متغیر کمی اول
  • y: متغیر کمی دوم
۰۸

کدگذاری و فرهنگ داده

[1][2][3]

برای هر ستون، تعریف، مقیاس، کدهای مجاز و شیوه نمایش داده گمشده را ثبت کنید. جهت گویه‌ها یا ترتیب گروه‌ها باید پیش از تحلیل روشن باشد.

  • شناسه‌ها باید یکتا باشند.
  • املای طبقات را یکسان کنید.
  • کدهای ویژه مانند ۹۹ را از مقدار واقعی جدا نگه دارید.
۰۹

داده‌های گمشده

[1][2][3]

تعداد و درصد داده گمشده را برای متغیرهای اصلی گزارش کنید. حذف خودکار سطرها می‌تواند حجم نمونه و ترکیب گروه‌ها را تغییر دهد.

۱۰

مفروضه‌های اختصاصی

[1][2][3]

مفروضه‌ها ویژگی طراحی و داده‌اند و با یک آزمون جانبی به‌تنهایی تأیید نمی‌شوند.

  • استقلال زوج‌ها
  • خطی بودن رابطه
  • نبود نقاط پرت دو‌متغیره اثرگذار
  • برای آزمون و فاصله اطمینان کلاسیک: نرمال‌بودن دو‌متغیره تقریبی
۱۱

نقاط پرت، توزیع و نمودار تشخیصی

[1][2][3]

نمودار پراکنش، خط برازش، نقاط پرت، الگوی خمیدگی و ناهمسانی پراکندگی.

نمودار باید قبل از نتیجه آزمون دیده شود؛ یک مقدار پرت می‌تواند هم آماره و هم تفسیر علمی را تغییر دهد.

۱۲

حجم نمونه و توان

[1][2][3]

حجم نمونه را بر اساس اندازه اثر مورد انتظار، سطح خطا، توان و طراحی مطالعه تعیین کنید. معنی‌داری آزمون روی داده نهایی جای محاسبه توان پیشینی را نمی‌گیرد.

۱۳

کنترل نهایی پیش از محاسبه

[1][2][3]
  1. ۱تعداد سطرها و شناسه‌های تکراری را کنترل کنید.
  2. ۲توصیف متغیرها و گروه‌ها را ببینید.
  3. ۳داده گمشده و نقاط پرت را بررسی کنید.
  4. ۴مفروضه‌های مرتبط را ثبت کنید.
  5. ۵آزمون اصلی و تحلیل حساسیت را پیش از نتیجه مشخص کنید.
فصل سوم

محاسبه و تفسیر نتیجه

با یک مثال، فرض‌ها، آماره، مقدار p، اندازه اثر و محدودیت‌های استنباط را مرحله‌به‌مرحله می‌خوانیم.

۱۴

فرض صفر و فرض مقابل

[1][2][3]

فرض‌ها درباره جامعه آماری نوشته می‌شوند و باید پیش از مشاهده نتیجه روشن باشند.

H₀

همبستگی خطی جامعه صفر است: ρ=۰.

H₁

همبستگی خطی جامعه صفر نیست یا جهت مشخصی دارد.

۱۵

مثال آموزشی

[1][2][3]

برای ۶۰ کارمند، ساعات آموزش و نمره عملکرد ثبت و روی نمودار پراکنش رسم می‌شود.

ابتدا آمار توصیفی، تعداد مشاهده معتبر و نمودار مناسب را تهیه کنید؛ سپس آزمون استنباطی را اجرا کنید.

۱۶

آماره آزمون چگونه ساخته می‌شود؟

[1][2][3]

r بین −۱ و +۱ است؛ علامت جهت و قدرمطلق شدت رابطه خطی را نشان می‌دهد.

r = Σ[(x−x̄)(y−ȳ)] ÷ √[Σ(x−x̄)² Σ(y−ȳ)²]
۱۷

درجه آزادی و توزیع مرجع

[1][2][3]

برای آزمون کلاسیک همبستگی پیرسون df=n−۲ است.

درجه آزادی باید همراه آماره گزارش شود، مگر روش انتخابی ذاتاً درجه آزادی کلاسیک نداشته باشد.

۱۸

مقدار p را درست تفسیر کنید

[1][2][3]

مقدار p احتمال مشاهده نتیجه‌ای دست‌کم به این شدت است، به شرط درست بودن فرض صفر و مفروضه‌های تحلیل.

  • p احتمال درست بودن فرض صفر نیست.
  • p شدت یا اهمیت عملی نتیجه نیست.
  • تصمیم علمی نباید فقط به عبور از مرز ۰٫۰۵ وابسته باشد.
۱۹

اندازه اثر

[1][2][3]

شاخص پیشنهادی برای این تحلیل: خود r اندازه اثر است؛ r² سهم تغییرپذیری خطی مشترک را خلاصه می‌کند.. اندازه اثر باید با زمینه تخصصی و فاصله اطمینان تفسیر شود.

R² = r²
۲۰

مقایسه تکمیلی و تحلیل حساسیت

[1][2][3]

در ماتریس همبستگی بزرگ، اصلاح مقایسه‌های متعدد و تعیین تحلیل اصلی لازم است.

تحلیل جایگزین یا حساسیت: Spearman برای رابطه یکنواخت/رتبه‌ای؛ رگرسیون برای پیش‌بینی و کنترل متغیرها؛ روش مقاوم برای نقاط پرت.

۲۱

مرز تفسیر و ادعای علّی

[1][2][3]

معنی‌داری آماری به‌تنهایی علت و معلول را ثابت نمی‌کند. طرح پژوهش، تقدم زمانی، انتخاب نمونه و متغیرهای مخدوش‌گر تعیین می‌کنند چه استنباطی مجاز است.

فصل چهارم

اجرا در نرم‌افزار و گزارش علمی

مسیر اجرا در ابزارهای رایج، کد بازتولیدپذیر و یک متن آماده برای گزارش نتیجه ارائه می‌شود.

۲۲

اجرای مرحله‌ای در Excel

[1][2][3]
  1. ۱دو ستون x و y را کنار هم قرار دهید.
  2. ۲نمودار Scatter بسازید.
  3. ۳از CORREL یا PEARSON برای r استفاده کنید.
  4. ۴برای p و فاصله اطمینان از ابزار آماری یا محاسبات تکمیلی استفاده کنید.
۲۳

اجرای مرحله‌ای در SPSS

[1][2][3]
  1. ۱Analyze ← Correlate ← Bivariate
  2. ۲دو متغیر را انتخاب و Pearson را فعال کنید.
  3. ۳Two-tailed/One-tailed را از پیش تعیین کنید.
  4. ۴Scatterplot، r، p، N و فاصله اطمینان را گزارش کنید.
۲۴

اجرای بازتولیدپذیر در R

[1][2][3]

نام ستون‌ها را با فایل خود تطبیق دهید و خروجی، نسخه R و تصمیم‌های پیش‌پردازش را ذخیره کنید.

fit <- cor.test(data$x, data$y, method = 'pearson')
fit
۲۵

اجرای بازتولیدپذیر در Python

[1][2][3]

پیش از اجرا، آرایه‌ها یا DataFrame را از نظر داده گمشده، نوع ستون و تعداد مشاهده کنترل کنید.

from scipy import stats
result = stats.pearsonr(x, y)
print(result.statistic, result.pvalue, result.confidence_interval())
۲۶

آزمون‌ها و مدل‌های جایگزین

[1][2][3]

Spearman برای رابطه یکنواخت/رتبه‌ای؛ رگرسیون برای پیش‌بینی و کنترل متغیرها؛ روش مقاوم برای نقاط پرت.

۲۷

متن آماده گزارش علمی

[1][2][3]

اعداد و عبارت‌های جای‌خالی را با خروجی واقعی جایگزین کنید و آمار توصیفی را کنار آزمون بیاورید.

بین ساعات آموزش و عملکرد رابطه خطی مثبت مشاهده شد، r(58)=…، p=…، 95% CI […]، R²=… . نمودار پراکنش خطی‌بودن و نبود نقاط پرت شدید را نشان داد.
۲۸

چک‌لیست پیش از انتشار

[1][2][3]
  • سؤال، جامعه و واحد تحلیل روشن است.
  • فایل داده و کدگذاری کنترل شده است.
  • مفروضه‌ها و محدودیت‌ها گزارش شده‌اند.
  • آماره، مقدار p و حجم نمونه درج شده‌اند.
  • اندازه اثر خود r اندازه اثر است؛ r² سهم تغییرپذیری خطی مشترک را خلاصه می‌کند. گزارش شده است.
  • فاصله اطمینان و آمار توصیفی آمده‌اند.
  • کد یا Syntax تحلیل نگهداری شده است.
  • نتیجه فراتر از طراحی مطالعه تفسیر نشده است.
پرسش‌های پرتکرار

پاسخ کوتاه به ابهام‌های رایج

همبستگی پیرسون چه زمانی مناسب است؟

رابطه موردنظر خطی است. هر سطر یک جفت x و y دارد. هدف برآورد جهت و شدت رابطه خطی است.

مهم‌ترین مفروضه‌های همبستگی پیرسون چیست؟

استقلال زوج‌ها؛ خطی بودن رابطه؛ نبود نقاط پرت دو‌متغیره اثرگذار؛ برای آزمون و فاصله اطمینان کلاسیک: نرمال‌بودن دو‌متغیره تقریبی

آیا مقدار p شدت نتیجه را نشان می‌دهد؟

خیر. برای شدت نتیجه از خود r اندازه اثر است؛ r² سهم تغییرپذیری خطی مشترک را خلاصه می‌کند. و فاصله اطمینان استفاده کنید.

اگر مفروضه‌ها برقرار نباشند چه کنیم؟

Spearman برای رابطه یکنواخت/رتبه‌ای؛ رگرسیون برای پیش‌بینی و کنترل متغیرها؛ روش مقاوم برای نقاط پرت.

در گزارش علمی چه بنویسیم؟

آمار توصیفی، آماره آزمون، حجم نمونه، مقدار p، اندازه اثر، فاصله اطمینان و محدودیت‌های تحلیل را کنار هم گزارش کنید.

کتابنامه

منابع علمی و مستندات نرم‌افزار

ارجاع‌های داخل متن با شماره‌های زیر تطبیق دارند.

  1. ۱R Documentation — Test for Association/Correlation
  2. ۲SciPy — Pearson Correlation
  3. ۳American Statistical Association — Statement on p-Values
نظر خوانندگان

آیا این راهنما برای تحلیل شما مفید بود؟

بازخورد شما به دقیق‌تر شدن نسخه‌های بعدی این مقاله کمک می‌کند.