در این فصل ، ما به بررسی اقدامات گرایش مرکزی می پردازیم. متوجه خواهید شد که تکنیک های آموخته شده در اینجا از فصل 2 بر روی مطالب تکمیل و گسترش می یابند و چند گزینه دیگر برای توصیف نحوه توزیع متغیرها ارائه می دهند. برای دنبال کردن در این فصل ، باید مجموعه داده های ANES20 و KATS20 را بارگیری کرده و کتابخانه ها را برای بسته های زیر وصل کنید: desctools ، descr و hmisc.
5. 2 گرایش مرکزی
در حالی که فرکانس ها در مورد توزیع متغیرها چیزهای زیادی به ما می گویند ، ما همچنین به اقدامات دقیق تر تمایل عمومی داده ها علاقه مند هستیم. آیا داده ها به یک نتیجه خاص تمایل دارند؟آیا مقدار "معمولی" وجود دارد؟مقدار "مورد انتظار" چیست؟اقدامات گرایش مرکزی این اطلاعات را ارائه می دهد. تعدادی از اقدامات مختلف از گرایش مرکزی وجود دارد ، و نقش آنها در تجزیه و تحلیل داده ها تا حدودی به اندازه گیری سطح برای متغیرهایی که مطالعه می کنید بستگی دارد.
حالت 5. 2. 1
حالت مقوله یا مقداری است که بیشتر اوقات رخ می دهد ، و برای داده های اسمی مناسب ترین است زیرا نیازی به متغیر اساسی از نظر ماهیت نیست. گفته می شود ، این حالت گاهی اوقات می تواند اطلاعات مفیدی را برای داده های معمولی و عددی فراهم کند ، به خصوص اگر این متغیرها تعداد محدودی از دسته ها را داشته باشند.
بیایید با استفاده از وابستگی مذهبی ، نمونه ای از حالت را بررسی کنیم ، یک متغیر سطح اسمی که اغلب با نتایج مهم اجتماعی و سیاسی گره خورده است. فرکانس زیر نتایج حاصل از فرقه ANES20 $ را نشان می دهد ، یک نسخه هشت طبقه بندی شده از متغیر دوازده طبقه اصلی که اندازه گیری وابستگی مذهبی (ANES20 $ V201435) را نشان می دهد.
از این جدول ، می توانیم در هر دو ستون خام و درصد درصد ببینیم که "پروتستان" دسته معین است (تشخیص اینکه این گروه شامل تعدادی از ادیان مختلف است). بیایید در مورد چگونگی نشان دادن این امر گرایش اصلی یا نتیجه مورد انتظار این متغیر فکر کنیم. با متغیرهای اسمی مانند این ، مفهوم "مرکز" معنای زیادی ندارد ، به شدت صحبت می کند. با این حال ، اگر ما کمی تحت اللفظی باشیم و "گرایش اصلی" را به معنای چیزی شبیه به نتیجه معمولی یا مورد انتظار بدانیم ، معقول تر می شود.
از نظر حدس زدن نتیجه به این موضوع فکر کنید و به اطلاعاتی نیاز دارید که خطای شما را در حدس زدن به حداقل برساند (این ایده نیز در ادامه کتاب مهم خواهد بود). فرض کنید همه 8197 پاسخ معتبر را روی نوارهای کاغذ جداگانه در یک کلاه بزرگ دارید و باید وابستگی مذهبی هر پاسخ دهنده را با استفاده از طرح کدگذاری از این متغیر حدس بزنید. بهترین حدس شما برای بیرون کشیدن هر تکه کاغذ از کلاه چیست؟به نظر می رسد که بهترین استراتژی شما حدس زدن دسته بندی معین، "پروتستان" برای همه 8197 پاسخ دهنده معتبر است. 2113 بار درست و 6084 بار اشتباه می کنید. این خطای زیادی است، اما هیچ حدس دیگری به شما خطای کمتری نمی دهد زیرا "پروتستان" محتمل ترین نتیجه است. از این نظر، حالت معیار خوبی برای نتیجه «معمولی» برای داده های اسمی است.
علاوه بر استفاده از جدول فرکانس، می توانید حالت این متغیر را با استفاده از دستور Mode در R نیز دریافت کنید:
اوه، این نتیجه کاملاً درست به نظر نمی رسد. به این دلیل که بسیاری از توابع R نمی دانند با داده های از دست رفته چه کنند و به جای اطلاعات مورد علاقه، [1] NA را گزارش می دهند. از آنجایی که 83 مورد از دست رفته برای این متغیر وجود دارد (فرکانس را ببینید)، پیام خطا را دریافت می کنیم. این در اکثر موارد با افزودن na. rm=T، که به R می گوید NA ها را از تجزیه و تحلیل حذف کند، به خط فرمان برطرف می شود.
این تأیید می کند که "پروتستان" مقوله مودال است، با 2113 پاسخ دهنده، و همچنین تمام سطوح را فهرست می کند. در بسیاری از موارد، مانند این، من ترجیح می دهم به جدول فرکانس برای حالت نگاه کنم، زیرا تصویر کامل تری از متغیر ارائه می دهد، به عنوان مثال، نشان می دهد که در حالی که پروتستان مقوله مودال است، "کاتولیک" یک دوم بسیار نزدیک است..
در حالی که حالت مناسب ترین معیار تمایل مرکزی برای داده های سطح اسمی است، می توان آن را با داده های سطح ترتیبی و فاصله ای استفاده کرد. بیایید به دو متغیری که در فصل های قبلی استفاده کرده ایم نگاه کنیم، اولویت های صرف برنامه های فقیر (anes20$V201320x)، و محدودیت های سقط جنین دولتی (stats20$abortion_laws):
در اینجا، می بینیم که نتیجه حالتی برای اولویت های خرج کردن، «همانطور حفظ شود» است، با 3213 پاسخ دهنده، و حالت برای مقررات سقط جنین 10 است که دوازده بار اتفاق افتاده است. در حالی که حالت اطلاعات دیگری را برای این متغیرها فراهم می کند، هنگام کار با داده های ترتیبی یا فاصله/نسبت، معیارهای بهتری برای تمایل مرکزی وجود دارد. با این حال، حالت معیار ترجیحی گرایش مرکزی برای داده های اسمی است.
5. 3 میانه
میانه نمونه را به نصف کاهش می دهد: این مقدار نتیجه حاصل با مشاهده در وسط توزیع است که موارد به ترتیب بزرگی ذکر شده است. از آنجا که میانگین با سفارش مشاهدات از پایین ترین تا بالاترین مقدار یافت می شود ، میانه اندازه گیری مناسبی از گرایش اصلی برای متغیرهای اسمی نیست. اگر موارد متغیر معمولی یا عددی به ترتیب بزرگی ذکر شده باشد ، می توانیم به دنبال نقطه ای باشیم که نمونه را دقیقاً به نصف کاهش دهد. مقدار مرتبط با آن مشاهده ، میانه است. به عنوان مثال ، اگر 5 مشاهده از پایین ترین تا بالاترین رتبه داشتیم ، مشاهده میانی سوم (دو بالاتر از آن و دو زیر آن) خواهد بود و میانگین ارزش نتیجه حاصل از آن مشاهده خواهد بود. فقط برای روشن شدن ، میانه در این مثال 3 نخواهد بود ، بلکه ارزش نتیجه مرتبط با مشاهده سوم است. میانه برای متغیرهای معمولی مناسب است اما می تواند اطلاعات مفیدی را در مورد متغیرهای عددی ارائه دهد.
در اینجا یک فرمول مفید برای یافتن مشاهده میانی وجود دارد:
جایی که n = تعداد موارد
اگر n یک عدد عجیب و غریب باشد ، وسط یک نقطه داده واحد است. اگر n یک عدد یکنواخت باشد ، وسط بین دو نقطه داده قرار دارد و ما از نقطه میانی بین این دو مقدار به عنوان میانه استفاده می کنیم. شکل 5. 1 با استفاده از داده های فرضی برای یک نمونه کوچک از موارد ، نحوه پیدا کردن میانه را نشان می دهد.

شکل 5. 1: پیدا کردن میانه با تعداد عجیب و غریب و حتی تعداد موارد
در ردیف اول داده ها ، مشاهده ششم به طور کامل نمونه را تقسیم می کند ، با پنج مشاهده بالاتر از آن و پنج زیر. ارزش مشاهده ششم ، 15 ساله ، متوسط است. در ردیف دوم داده ها ، تعداد حتی موارد (10) وجود دارد ، بنابراین وسط توزیع بین مشاهدات پنجم و ششم به ترتیب با ارزش های 14 و 15 است. میانه نقطه میانی بین این مقادیر ، 14. 5 است.
حال ، با استفاده از متغیر قوانین سقط جنین از مجموعه داده های ایالت 20 ، با برخی از داده های دنیای واقعی به این موضوع نگاه کنیم. 50 مشاهده وجود دارد ، بنابراین نقطه میانی بین مشاهدات 25 و 26 ((1+1)/2) است. بدیهی است ، ما می توانیم R را فقط به ما نشان دهیم که میانه را به ما نشان دهیم ، اما در این مرحله آموزنده است که آن را با "چشم زدن" داده ها پیدا کنیم. تمام پنجاه مشاهدات برای ایالت ها 20 $ affation_laws به ترتیب در زیر ذکر شده است. مقدار مرتبط با مشاهده بیست و پنجم ، همانند مقدار مرتبط با مشاهده 26 است. از آنجا که این هر دو یکسان هستند ، نتیجه متوسط 9 است.
ما همچنین می توانیم این اطلاعات را به راحتی دریافت کنیم:
برای نشان دادن اهمیت لیست نتایج به ترتیب بزرگی ، لیست نتایج مربوط به ایالت های 20 $ affation_law را در هنگام ذکر داده ها به صورت الفبایی بررسی کنید:
اگر بین مشاهدات 25 (12) و 26 (7) نقطه میانی را انجام دهید ، یک میانه 9. 5 را گزارش می کنید. در حالی که این نزدیک به 9 است ، به طور تصادفی ، نادرست است.
بیایید اکنون به یافتن ارزش متوسط برای هزینه های مربوط به برنامه های مربوط به فقرا (ANES20 $ V201320X) بپردازیم. از آنجا که بیش از 8000 مشاهده برای این متغیر وجود دارد ، ذکر کردن همه آنها به ترتیب عملی نیست ، اما ما می توانیم با استفاده از یک جدول فرکانس ، همان کار را انجام دهیم. در اینجا ، من از دستور FREQ برای تهیه یک جدول فرکانس استفاده می کنم زیرا به درصد تجمعی علاقه مندم.
کاری که اکنون می خواهیم انجام دهیم استفاده از فرکانس تجمعی برای شناسایی دسته مرتبط با صدک 50 است. در این حالت ، می بینید که فرکانس تجمعی برای گروه "کمی افزایش یافته" 50. 8 ٪ است ، به این معنی که مشاهده میانی (صدک 50) در این گروه است ، بنابراین این نتیجه متوسط است.
ما می توانیم این کار را با دستور median در R. بررسی کنیم. یک عجیب و غریب در اینجا این است که R برای محاسبه میانه به داده های عددی نیاز دارد. خوبه. تمام کاری که ما باید انجام دهیم این است که به R بگوییم که مقادیر را مانند آنها عددی رفتار کند و پنج سطح را با مقادیر 1،2،3،4 و 5 جایگزین کنیم.
ما در اینجا تأیید می کنیم که نتیجه متوسط دسته دوم است ، "کمی افزایش یافته است".
5. 4 میانگین
میانگین معمولاً به عنوان ( bar ) نشان داده می شود و همچنین به عنوان میانگین حسابی یا مقدار مورد انتظار متغیر گفته می شود و اندازه گیری خوبی از نتیجه معمولی برای داده های عددی است. اصطلاح نتیجه "معمولی" در این زمینه جالب است زیرا میانگین مقدار یک متغیر ممکن است به عنوان یک نتیجه واقعی وجود نداشته باشد. بهترین راه برای فکر کردن در مورد میانگین به عنوان اندازه گیری معمولی ، تا حدودی شبیه به بحث در مورد حالت است به عنوان بهترین حدس خود اگر می خواهید در پیش بینی نتایج در یک متغیر اسمی خطا را به حداقل برسانید. تفاوت در اینجا این است که از آنجا که میانگین با داده های عددی استفاده می شود ، ما صحت را به صورت حق و نادرست دوگانگی قضاوت نمی کنیم. درعوض ، ما می توانیم از نظر دقت در مورد میزان نزدیک بودن میانگین به هر نتیجه قضاوت کنیم. برای داده های عددی ، میانگین به طور کلی به مقادیر واقعی نزدیکتر از هر حدس دیگری است که می توانید بسازید. به این معنا ، میانگین نشان دهنده نتیجه معمولی بهتر از هر آمار دیگر است.
فرمول میانگین است
این مطلب می خواند: مجموع مقادیر تمام مشاهدات (نتایج عددی) x ، که بر اساس تعداد کل مشاهدات معتبر (مشاهدات با مقادیر واقعی) تقسیم می شود. این فرمول روش مهمی را نشان می دهد که میانگین آن با میانه و حالت متفاوت است: این مبتنی بر اطلاعات از تمام مقادیر x است ، نه فقط ارزش متوسط (میانه) یا مقداری که بیشتر اوقات رخ می دهد (حالت). این باعث می شود میانگین یک آمار فراگیر تر از میانه یا حالت باشد.
با استفاده از این فرمول ، در مورد تعداد محدودیت های سقط جنین ، می توانیم میانگین چیزی شبیه به این را محاسبه کنیم:
ما در واقع لازم نیست تمام پنجاه نتیجه را به صورت دستی اضافه کنیم تا شماره ساز را بدست آوریم. در عوض ، ما می توانیم به R بگوییم که تمام مقادیر X را خلاصه کند:
بنابراین شمارنده 394 است. ما با تعداد موارد (50) تقسیم می کنیم تا میانگین را بدست آوریم:
البته ، ساده تر ، هرچند که کاملاً آموزنده نباشد ، فقط به ما می گویند میانگین:
یک ویژگی بسیار مهم از میانگین این است که نقطه ای است که در آن وزن مقادیر از هر طرف کاملاً متعادل است. فکر کردن در مورد نتایج متغیرهای عددی توزیع شده با توجه به وزن (مقدار) آنها بر روی تخته ای که بر روی یک تکه استوار است ، مفید است و آن را در میانگین توزیع قرار می دهد ، نقطه ای که هر دو طرف کاملاً متعادل هستند. اگر فولکروم در میانگین قرار بگیرد ، تخته به هر طرف نوک نمی زند ، اما اگر در نقطه دیگری قرار گیرد ، وزن به طور مساوی توزیع نمی شود و تخته به یک طرف یا طرف دیگر نوک می زند.

شکل 5. 2: میانگین کاملاً توزیع را متعادل می کند
یک مفهوم واقعاً مهم در اینجا انحراف مشاهدات X از میانگین X است. از نظر ریاضی ، این به عنوان (x_i- bar ) نشان داده شده است. بنابراین ، به عنوان مثال ، انحراف از میانگین تعداد محدودیت های سقط جنین (7. 88) برای کشوری مانند آلاباما ، با 8 محدودیت سقط جنین روی کتاب ها . 12 واحد (8-7. 88) و برای وضعیتی مانند کلرادو ، با 2 محدودیتدر کتاب ، انحرا ف-5. 88 (2-7. 88) است. برای هر متغیر عددی ، فاصله بین میانگین و تمام مقادیر بیشتر از میانگین کاملاً با فاصله بین میانگین و تمام مقادیر پایین تر از میانگین جبران می شود. توزیع کاملاً متعادل در اطراف میانگین است.
This means that summing up all of the deviations from the mean ( (sum_^n>)) همیشه برابر با صفر است. این نکته برای درک آنچه میانگین نشان می دهد مهم است ، اما برای بسیاری از آمارهای دیگر که بر اساس میانگین نیز مهم است نیز مهم است.
ما می توانیم این خاصیت تعادل را در R. بررسی کنیم ، ابتدا هر مشاهده را به عنوان انحراف از وسایل بیان می کنیم.
همانطور که انتظار می رفت ، برخی از انحرافات از میانگین مثبت است و برخی دیگر منفی هستند. حال ، اگر جمع همه انحرافات را بگیریم ، دریافت می کنیم:
این یک شماره خنده دار استبه دلیل طول تعداد حاصل ، مجموع انحرافات از میانگین با استفاده از نماد علمی گزارش شده است. در این حالت ، نماد علمی به ما می گوید ما باید نقطه اعشاری 15 مکان را به سمت چپ منتقل کنیم و در نتیجه 00000000000000532907 حاصل شود. دقیقاً 0 نیست ، به دلیل گرد ، اما در اصل 0. 14
توجه داشته باشید که میانه این خاصیت "تعادل" را به اشتراک نمی گذارد. اگر ما یک فولکروم را در میانه قرار دهیم ، توزیع می شود زیرا انحرافات مثبت همانطور که در اینجا نشان داده شده است ، با انحرافات منفی تعادل نمی یابد:
انحرافات منفی با ارزش 56 از مثبت بالاتر است.
5. 4. 1 متغیرهای دوگانگی
در اینجا اطلاعات جالب توجه وجود دارد که در آینده مفید خواهد بود: برای متغیرهای دوگانگی با تمام مقادیر 0 یا 1 هستند ، میانگین متغیر نسبت موارد موجود در دسته 1 است. اجازه دهید از نظرسنجی ANES20 مثال بزنیم. فرض کنید شما به رفتار سیاسی افرادی که در ارتش خدمت کرده اند در مقایسه با کسانی که ندارند علاقه مند هستید. بررسی ANES 2020 سؤالی در مورد خدمت سربازی می پرسد ، و پاسخ ها در ANES20 $ V201516 است. در زیر ، من برچسب دسته دوم را کوتاه می کنم تا محتوای فرکانس با هم چاپ شود.
در اینجا می بینیم که در حال حاضر کمتر از 1 ٪ در حال انجام وظیفه فعال هستند ، حدود 10. 5 ٪ قبلاً خدمت کرده اند و اکثریت قریب به اتفاق (6 /88 ٪) هرگز خدمت نکرده اند. اگر ما به مقایسه بین کسانی که خدمت کرده اند و خدمت نکرده ایم ، باید دو دسته اول را در یک دسته واحد ترکیب کنیم. شما در حال حاضر می دانید که چگونه این کار را از مطالب موجود در فصل 4 انجام دهید ، اما اجازه دهید دیگر در اینجا به آن برویم.
اگر سعی کنیم میانگین این متغیر را بدست آوریم ، خطایی دریافت می کنیم زیرا سرویس ANES20 $ یک متغیر فاکتور است (اگر می خواهید آن را امتحان کنید). بنابراین ، ما باید این را به یک متغیر عددی تبدیل کنیم ، برای کسانی که هیچ خدمت سربازی ندارند و 1 نفر برای کسانی که در ارتش خدمت کرده اند ، 0 به ثمر رساند. به یاد بیاورید که ما هنگام ایجاد متغیرهای دوگانگی برای شاخص LGBTQ در فصل 4 ، همین کار را انجام دادیم. 1 برای نشان دادن اینکه آنها این ویژگی را دارند.
در اینجا ، ما به R می گوییم که یک شیء جدید ، Anes20 $ service. n ایجاد کند ، به عنوان یک متغیر عددی با استفاده از متغیر عامل اصلی ANES20 $ سرویس و اختصاص 1 برای همه نتایج "بله ، سرو" و (به طور پیش فرض) 0 برایتمام نتایج معتبر دیگر (در این مورد پاسخ "بدون سرویس"). ما همچنین به R می گوییم که با این متغیر جدید به عنوان یک متغیر عددی رفتار کنیم ، به همین دلیل ما از پسوند ". N" استفاده می کنیم. این مورد نیاز نیست ، اما این نوع پسوندها هنگام تلاش برای یادآوری اینکه متغیر مشابه نامگذاری شده است ، مفید هستند. اکنون ، یک فرکانس برای متغیر جدید دریافت می کنیم:
اکنون ما یک متغیر عددی دوگانگی داریم که بین کسانی که (11. 4 ٪) دارند و (6 /88 ٪) در ارتش خدمت کرده اند ، متمایز است. ما می توانیم از فرمول ارائه شده در ابتدا برای محاسبه میانگین این متغیر استفاده کنیم. از آنجا که مقدار 0 7311 بار رخ داده است ، و مقدار 1 942 بار رخ داده است ، میانگین آن برابر است
میانگین این متغیر دوگانگی که 0 و 1 به ثمر رسانده است ، نسبت در دسته 1 است. این همیشه باید با متغیرهای دوگانگی مشابه مورد باشد. این ممکن است در این مرحله برای شما بسیار شهودی به نظر نرسد ، اما درک بعداً آن بسیار مفید خواهد بود.
نکته ای که ممکن است در این مرحله از آن سؤال کنید این است که چگونه می توانیم با آنچه به نظر می رسد متغیر اسمی است - خواه مردم در ارتش خدمت نکرده اند یا به عنوان یک متغیر عددی خدمت کرده اند. روشی که من دوست دارم در مورد این موضوع فکر کنم این است که متغیر حضور (1) یا غیبت (0) یک ویژگی را اندازه گیری می کند. در مواردی از این دست ، می توانید از مقدار 0 به عنوان یک نقطه صفر اصلی فکر کنید ، یک ویژگی مهم بیشتر متغیرهای عددی است. به عبارت دیگر ، 0 به معنای هیچ یک از ویژگی های اندازه گیری نشده است. از آنجا که مقدار 1 نشانگر داشتن یک واحد از ویژگی است ، می توانیم این متغیر را به عنوان عددی رفتار کنیم. با این حال ، این مهم است که همیشه در نظر داشته باشید که متغیر چه چیزی را نشان می دهد و فقط دو نتیجه وجود دارد ، 0 و 1. این در فصل های بعدی به ویژه هنگام بحث در مورد استفاده از این نوع متغیرها در تجزیه و تحلیل رگرسیون بسیار مهم می شود.
5. 5 میانگین ، متوسط و توزیع متغیرها
به عنوان یک قاعده کلی ، میانگین برای متغیرهای سطح فاصله/نسبت مناسب ترین است و میانه برای متغیرهای معمولی مناسب ترین است. با این حال ، مواردی وجود دارد که میانه ممکن است اندازه گیری بهتری از گرایش اصلی برای داده های عددی باشد ، تقریباً همیشه به دلیل کمبود داده ها. به عنوان یک نتیجه از یکی از فضیلت های میانگین ، بخشی از آن رخ می دهد. از آنجا که میانگین مقادیر تمام مشاهدات را در نظر می گیرد ، در حالی که میانه در واقع بر "ارزش ها" تأکید نمی کند بلکه از رتبه بندی مشاهدات استفاده می کند ، میانگین می تواند تحت تأثیر ارزشهای شدید باشد که آن را از وسط توزیع دور می کند. مثال ساده داده های زیر را در نظر بگیرید ، با استفاده از پنج مشاهده از یک متغیر فرضی:
0 ، 1 ، 2 ، 2 ، 5 ( RightArrow ) میانه = 2 ، میانگین = 2. 0
در این حالت ، میانگین و میانگین یکسان هستند. حال ، مراقب آنچه اتفاق می افتد این است که ما مقدار 5 به 18 را تغییر می دهیم ، مقداری که از نظر قابل ملاحظه ای بالاتر از بقیه مقادیر است:
0 ، 1 ، 2 ، 2 ، 18 ( Rightarrow ) میانه = 2 ، میانگین = 4. 6
میانه کاملاً تحت تأثیر مقادیر شدید است اما میانگین آن است. میانه و برخی از آمارهای دیگر همان چیزی است که ما آن را آمار قوی می نامیم زیرا ارزش آنها تحت تأثیر وزن نتایج شدید نیست. در بعضی موارد ، تأثیر مقادیر شدید به حدی است که بهتر است هنگام بحث در مورد متغیرهای عددی ، از میانه به عنوان معیار گرایش اصلی استفاده شود. داده ها هنوز هم در مورد میانگین متعادل هستند ، و میانگین هنوز "بهترین حدس" شما (کوچکترین خطا در پیش بینی) است ، اما از نظر جستجوی نتیجه ای که نشانگر تمایل عمومی داده ها باشد ، ممکن است بهترین گزینه نباشددر برخی شرایط
با گفتن این مطلب ، این تجربه من بوده است که به محض اینکه دانش آموزان می شنوند که میانه ممکن است نسبت به میانگین ترجیح داده شود وقتی تفاوت معنی داری بین آنها وجود داشته باشد ، آنها تمایل دارند هر زمان که اصلاً متفاوت از میانگین باشد ، به طور پیش فرض به میانه برسد. تقریباً همیشه بین میانگین و میانگین تفاوت وجود خواهد داشت و از این رو ، برخی از چسبندگی ها به داده ها ، بنابراین شما نباید به طور خودکار به میانه پیش فرض کنید. هیچ نقطه قطع رسمی وجود ندارد ، بنابراین این یک تماس داوری است. بهترین توصیه من این است که میانگین باید اولین انتخاب شما باشد. با این حال ، اگر شواهدی وجود دارد که نشان می دهد میانگین به شدت تحت تأثیر مشاهدات شدید قرار دارد (به تصویر زیر مراجعه کنید) ، پس باید از میانه نیز استفاده کنید. البته ، ارائه هر دو آمار ضرری ندارد ، زیرا اطلاعات بیشتر معمولاً اطلاعات خوبی است.
به طور کلی ، هنگامی که میانگین به طور قابل توجهی بالاتر از میانه باشد ، این نشانه این است که توزیع مقادیر درست است (یا مثبت) به دلیل تأثیر مقادیر شدید در انتهای بالای مقیاس. این بدان معنی است که مقادیر شدید میانگین را از وسط مشاهدات دور می کنند. هنگامی که میانگین به طور قابل توجهی پایین تر از میانه باشد ، این نشان دهنده توزیع چپ (یا منفی) است ، به دلیل مقادیر شدید در انتهای پایین مقیاس. هنگامی که میانگین و میانگین یکسان هستند یا تقریباً یکسان هستند ، این می تواند توزیع زنگ شکل را نشان دهد ، اما امکانات دیگری نیز وجود دارد. هنگامی که میانگین و میانگین یکسان هستند ، هیچ گونه خلوصی وجود ندارد.
شکل 3 کاریکاتورهایی از آنچه ممکن است این الگوهای به نظر برسد ، ارائه می دهد. نمودار اول نشان می دهد که بیشتر داده ها در انتهای کم (سمت چپ) محور x متمرکز شده اند ، با چند مشاهدات بسیار شدید در انتهای بالا (راست) محور که میانگین را از وسط توزیع بیرون می کشد. این یک کمرنگ مثبت است. نمودار دوم دقیقاً الگوی مخالف را نشان می دهد: بیشتر داده ها در انتهای بالای محور x ، با چند مقادیر شدید در انتهای پایین (سمت چپ) میانگین را به سمت چپ می کشند. این یک توزیع منفی است.

شکل 5. 3: تصاویر سطوح مختلف پوستی
سرانجام ، نمودار سوم توزیع کاملاً متعادل و زنگ شکل ، با میانگین و میانه برابر با یکدیگر را نشان می دهد و درست در وسط توزیع قرار دارد. در این نمودار هیچ گونه شکافی وجود ندارد. این توزیع زنگ به شکل تنها راهی نیست که بدون هیچ گونه لکه ای 15 باشد ، بلکه یک نوع مهم توزیع است که بعداً از آن استفاده خواهیم کرد.
بیایید ببینیم که این کار هنگام استفاده از داده های دنیای واقعی ، با قوانین سقط جنین در ایالات متحده چگونه به نظر می رسد. اول ، ما نگاهی دیگر به میانگین و میانگین می اندازیم ، که در بخش قبلی این فصل تولید کردیم ، و سپس می توانیم یک طرح چگالی برای تعداد قوانین محدود کننده سقط جنین در ایالت ها مشاهده کنیم.
میانگین کمی کمتر از میانه است ، بنابراین ممکن است انتظار داشته باشیم که در طرح چگالی علائم منفی (سمت چپ) را مشاهده کنیم.

در اینجا ما تفاوت بین میانگین (خط جامد) و میانگین (خط متراکم) در زمینه توزیع کامل متغیر را داریم و نمودار توزیع با کمی لکه های منفی را نشان می دهد. پوستی شدید نیست ، اما برای چشم غیر مسلح قابل مشاهده است.
DIGRESSION کد R. نمودار چگالی فوق شامل اضافه کردن دو خط عمودی ، یکی برای میانگین و دیگری برای میانه است. برای اضافه کردن این خطوط ، من از دستور Abline استفاده کردم. این دستور به شما امکان می دهد خطوط را به نمودارهای موجود اضافه کنید. در این حالت ، من می خواهم دو خط عمودی اضافه کنم ، بنابراین من از V = برای تعیین محل قرار دادن خطوط استفاده می کنم. من می توانستم مقادیر عددی میانگین و میانه را قرار دهم (V = 7. 88 و V = 9) ، اما من تصمیم گرفتم که از R استفاده کنم که میانگین و میانگین را محاسبه کرده و نتایج را در نمودار وارد کنید (V = میانگین (حالت 20 $ affation_laws) و v = متوسط (ایالت های 20 $ affation_laws)). در هر صورت همان نتیجه را بدست می آورد. همچنین ، توجه داشته باشید که برای میانه ، من LTY = 2 را اضافه کردم تا R از "خط نوع 2" استفاده کنم ، که یک خط متراکم است. نوع خط پیش فرض یک خط جامد است که برای میانگین استفاده می شود.
حال ، بیایید نگاهی به توزیع دیگری بیندازیم ، این بار برای متغیری که قبلاً به آن نگاه نکردیم ، درصد جمعیت دولتی که متولد خارجی هستند (ایالت 20 $ FB). این یک ویژگی جمعیتی به طور فزاینده ای است و پیامدهای آن برای تعدادی از پیامدهای سیاسی و اجتماعی است.
در اینجا ، ما شواهد کمی بیشتر در مورد توزیع ناچیز مشاهده می کنیم. از نظر مطلق ، تفاوت بین میانگین و میانگین (2. 09) خیلی بیشتر از مثال اول (1. 22) نیست ، اما طرح چگالی (در زیر) تا حدودی بیشتر شبیه به توزیع کمرنگ است تا در مثال اول. در این حالت ، توزیع به صورت مثبت کمرنگ است ، با چند مقدار نسبتاً زیاد ، میانگین را از وسط توزیع بیرون می کشد.

سرانجام ، به عنوان یک نقطه مقابل این توزیع های کم نظیر ، اجازه دهید نگاهی به توزیع درصد رای دو طرفه به جو بایدن در انتخابات 2020 بیندازیم:
در اینجا ، تفاوت بسیار کمی بین میانگین و میانگین وجود دارد ، و به نظر می رسد تقریباً هیچ گونه شکوفه ای در شکل طرح چگالی (در زیر) وجود ندارد.

نکته جالب اینجاست که فاصله بین میانگین و میانگین سهم رأی بایدن (92/0) با فاصله بین میانگین و میانگین برای تعداد قوانین سقط جنین تفاوت چندانی ندارد (1. 12). با این وجود هیچ اشاره ای به کمبود آرا وجود ندارد ، در حالی که به وضوح برخی از قوانین منفی در مورد سقط جنین وجود دارد. این البته به دلیل تفاوت در مقیاس بین دو متغیر است. قوانین سقط جنین از 1 تا 13 متغیر است ، در حالی که سهم رأی بایدن از 27. 5 تا 68. 3 متغیر است ، بنابراین نسبت به مقیاس متغیر ، فاصله بین میانگین و میانگین برای قوانین سقط جنین در ایالت ها بسیار بیشتر از آن است که برای سهم بایدن از سهم بایدنرأی دو طرفه در ایالت ها. این نشان دهنده ارزش واقعی بررسی توزیع متغیر عددی با یک هیستوگرام یا طرح چگالی در کنار آماری مانند میانگین و میانگین است. نمودارهایی از این دست زمینه ای را برای آن آمار فراهم می کند
5. 6 آمار Skewness
خوشبختانه ، یک آمار چسبندگی وجود دارد که میزان شکاف مثبت یا منفی در داده ها را خلاصه می کند. چندین روش مختلف برای محاسبه پوستی وجود دارد. مورد استفاده در R بر اساس جهت و بزرگی انحراف از میانگین ، نسبت به میزان تغییر در داده ها است. 16 نکته خوب در مورد آمار Skewness این است که برخی از دستورالعمل های کلی برای ارزیابی جهت و جدی بودن پوست وجود دارد:
- مقدار 0 نشانگر هیچ گونه چسبندگی به داده ها نیست.
- هر مقدار منفی از پوستی نشانگر یک لکه منفی است و مقادیر مثبت نشانگر پوستی مثبت است.
- مقادیر پایین تر ا ز-2 و بالاتر از 2 نشانگر کمبود شدید است که می تواند برای عملیاتی که توزیع نسبتاً عادی را فرض می کنند ، ایجاد شود.
بیایید به آمار Skewness برای سه متغیر مورد بحث در بالا نگاه کنیم.
با توجه به بحث قبلی در مورد این سه متغیر ، این آمار چسبندگی حس زیادی می کند. در توزیع محدودیت های سقط جنین در ایالت ها ، کمی از شکاف منفی (-. 34) وجود دارد ، یک سطح برجسته تر از چابک (مثبت) نسبت به توزیع جمعیت متولد خارجی ، و هیچ گونه کمبود واقعی در توزیعپشتیبانی بایدن در ایالات (. 007). هیچ یک از این نتایج در هیچ کجای نقاط بر ش-2 ،+2 نیست که قبلاً مورد بحث قرار گرفت ، بنابراین این توزیع ها نباید برای هر تجزیه و تحلیل که از این متغیرها استفاده می کند ، مشکلی ایجاد کند.
اغلب اوقات ، شما از متغیرهایی استفاده خواهید کرد که توزیع آنها بسیار شبیه به سه نشان داده شده در بالا است ، شاید کمی کم رنگ باشد ، اما هیچ چیز خیلی ظالمانه نیست. با این حال ، گاهی اوقات ، شما با متغیرهایی با کمبود شدید روبرو می شوید. یکی از این متغیرهای "مشکل" از 2020 ANES ANES20 $ V201628 است که اندازه گیری می کند که تعداد پاسخ دهندگان اسلحه از مالکیت آن خبر داده اند. ما برای این متغیر در زیر میانگین و میانگین دریافت می کنیم و می بینیم که میانگین (1. 47) از میانه (0) بیشتر است. ما می توانیم چند مورد را از این مورد بدست آوریم. اول ، از آنجا که میانه 0 است ، ما می دانیم که حداقل نیمی از پاسخ دهندگان هیچ اسلحه ای ندارند (اگر به یک جدول فرکانس برای این متغیر نگاه کنید ، خواهید دید که 64. 5 ٪ اسلحه ندارند). دوم ، از آنجا که میانگین بیشتر از میانه است ، می توانیم بگوییم که میانگین توسط برخی از مشاهدات شدید در انتهای بالای محور x از وسط توزیع خارج می شود.
ما می توانیم با نگاه کردن به یک طرح چگالی برای این متغیر ، احساس بهتری از توزیع بدست آوریم.

این طرح سطح شدید کمبود مثبت را نشان می دهد. در حقیقت ، این طرح تصویر خوبی از چگونگی دستیابی شدید به آن است. آمار Skewness که در زیر (8. 33) گزارش شده است ، آنچه را که از طرح چگالی آشکار است ، سطح بسیار بالایی از چرب بودن را تأیید می کند. در حقیقت ، این متغیر چنان کمرنگ است که استفاده از آن در وضعیت فعلی خود منطقی نخواهد بود. درعوض ، ممکن است بخواهید آن را به یک متغیر معمولی (0 اسلحه ، 1 اسلحه ، 2-5 ، اسلحه ، بیش از پنج اسلحه) برگردانید ، یا شاید توزیع را در 20+ اسلحه انجام دهید. در هر صورت ، متغیری با مشکل چرب مانند این باعث ایجاد مشکلات در تعدادی از آمار خواهد شد.
در واقعیت ، بیشتر متغیرهایی که به آنها نگاه می کنید به شدت کمرنگ نخواهد بود. با این حال ، اگر شما فقط به میانگین و میانگین مالکیت اسلحه نگاه می کنید ، شاید شما هیچ تصوری از این متغیر نداشته باشید زیرا تفاوت بین میانگین و متوسط به نظر نمی رسد که عالی باشد. این نکته بسیار مهمی را به خانه می آورد: از هرچه بیشتر از اطلاعات استفاده کنید تا در مورد داده ها بیاموزید. حتی اگر هنگام ارائه نتایج از اطلاعات استفاده نکنید ، باید از آن استفاده کنید تا مطمئن شوید که با داده ها چه اتفاقی می افتد.
5. 7 اضافه کردن افسانه ها به نمودارها
توجه داشته باشید که در مثالهای ارائه شده در بالا ، من از یک خط عمودی جامد برای میانگین و یک خط عمودی متراکم برای میانه استفاده کردم. این در متن توضیح داده شد ، اما هیچ اطلاعات مشخصی در خود نمودارها ارائه نشده است. هنگام ارائه اطلاعاتی از این دست در یک تنظیم رسمی تر (به عنوان مثال ، در مورد کار ، برای یک تکلیف یا برای یک کاغذ ترم) ، معمولاً انتظار می رود که شما یک افسانه را با نمودارهای خود تهیه کنید که مشخص کند خطوط نشان می دهد (شکل 5. 3 را ببینیدبه عنوان مثال). این می تواند کمی پیچیده باشد ، به خصوص اگر چندین خط در نمودار شما وجود داشته باشد. با این حال ، برای اهداف فعلی ما ، اضافه کردن یک افسانه بسیار دشوار نیست.
ما می خواهیم خط کد زیر را به دستورات استفاده شده برای تولید طرح برای ایالت های 20 $ fb اضافه کنیم تا یک افسانه به طرح اضافه کنیم:
بیت اول ("بالا سمت راست") به R می گوید که افسانه را در کجای نمودار قرار دهد. در این مورد، من topright را مشخص کردم زیرا می دانم که جایی است که فضای خالی در نمودار وجود دارد. می توانید بالا، پایین، چپ، راست، بالا سمت راست، بالا، پایین، یا پایین چپ را مشخص کنید، بسته به جایی که افسانه بهترین جا را دارد. بخش دوم اطلاعات، legend=c("Mean"، "Median") نام دو شیئی را که ما شناسایی می کنیم ارائه می کند و قسمت آخر، lty=1:2، به R می گوید که از کدام نوع خط در افسانه استفاده کند.(همانطور که در نمودار است). بیایید این را به خطوط فرمان برای نمودار چگالی برای states20$fb اضافه کنیم و ببینیم چه می گیریم.

این اطلاعات اضافی به خوبی در نمودار قرار می گیرد و به تفسیر الگو در داده ها کمک می کند.
گاهی اوقات، سخت است که افسانه را به خوبی در یک فضای نمودار قرار دهیم. وقتی این اتفاق می افتد، باید کمی درنگ کنید تا افسانه جا بیفتد. راه های نسبتاً پیچیده ای برای رسیدن به این هدف وجود دارد، اما من ترجیح می دهم ابتدا چند چیز ساده را امتحان کنید: مکان های مختلف افسانه را امتحان کنید، تعداد کلماتی را که برای نام گذاری خطوط استفاده می کنید کاهش دهید، یا دستور cex را برای کاهش اندازه کلی اضافه کنید. از افسانههنگام استفاده از cex، ممکن است با cex=. 8 شروع کنید، که افسانه را تا 80% اندازه اصلی آن کاهش می دهد و سپس مقدار مورد نیاز را تغییر می دهد تا افسانه متناسب شود.
5. 8 مراحل بعدی
فصل بعدی با تمرکز بر چیزی که به صورت مماس در این فصل به آن پرداختیم، بحث را می سازد: اندازه گیری تنوع در داده ها. اندازه گیری های گرایش مرکزی ابزارهای توصیفی مهمی هستند، اما همچنین بلوک های ساختمانی برای بسیاری از آمارهای دیگر، از جمله معیارهای پراکندگی، که در فصل 6 بررسی می کنیم، تشکیل می دهند. پس از آن، کمی زمان را صرف موضوعات انتزاعی تر احتمال می کنیم. و استنتاج آماریاین چیزها ممکن است برای شما کمی ترسناک به نظر برسد، اما وقتی به آنجا رسیدیم برای آنها آماده خواهید بود.
5. 9 تکالیف
5. 9. 1 مفاهیم و محاسبات
طبق معمول، هنگام انجام محاسبات، روندی را که استفاده کرده اید نشان دهید.
بیایید به لیست متغیرهای مورد استفاده برای تمرینات در فصل های 1 و 3 برگردیم. به نظر شما مناسب ترین معیار گرایش مرکزی برای هر یک از این متغیرها چیست. برای هر متغیر فقط یک معیار انتخاب کنید
- نمره نامه درس
- میزان مشارکت رای دهندگان (آرای داده شده/واجدین شرایط)
- وضعیت تاهل (متاهل، مطلقه، مجرد و ...)
- شغل (استاد، آشپز، مکانیک و ...)
- وزن بدن
- تعداد کل آرای داده شده در یک انتخابات
- #سالهای تحصیل
- طبقه اجتماعی ذهنی (فقیر ، طبقه کارگر ، طبقه متوسط و غیره)
- نرخ فقر
- شناسایی گروه نژادی یا قومی
در زیر لیستی از میزان مشارکت رای دهندگان در دوازده ایالت ویسکانسین در انتخابات ریاست جمهوری 2020 قرار دارد. میانگین ، متوسط و حالت را برای میزان مشارکت رای دهندگان در این ایالت ها محاسبه کنید. کدام یک از اینها مناسب ترین اندازه گرایش اصلی برای این متغیر است؟چرا؟بر اساس اطلاعاتی که در اینجا دارید ، آیا این متغیر در هر جهت چسبیده است؟
مشکلات 5. 9. 2 R
طبق معمول ، دستورات R و خروجی را که برای پاسخ به این سؤالات استفاده کرده اید ، نشان دهید.
برای گزارش کلیه اقدامات تمایل مرکزی که برای هر یک از متغیرهای زیر مناسب است ، از R استفاده کنید: رتبه دماسنج احساس انجمن ملی تفنگ (ANES20 $ V202178) ، لاتین ها به عنوان درصد جمعیت دولتی (ایالت های 20 $ لاتین) ، شناسایی حزب (ANES20 $ V201231X) ، و منطقه ای از کشور که پاسخ دهندگان نظرسنجی ANES در آن زندگی می کنند (ANES20 $ V203003). در صورت لزوم ، در مورد چاشنی نیز بحث کنید.
با استفاده از یکی از متغیرهای عددی ذکر شده در سوال قبلی ، یک طرح چگالی ایجاد کنید که شامل خطوط عمودی است که نتایج متوسط و متوسط را نشان می دهد و یک افسانه را اضافه می کند. آنچه را که در طرح مشاهده می کنید توصیف کنید.
اگر علاقه دارید که چگونه میانگین به عنوان معیار "نمایندگی" مورد استفاده قرار گیرد ، در اینجا تاریخچه ای کوتاه از تاریخ فکری وجود دارد: https://priceonomics.com/how-the-avere-triumphed-over-the-median/
به عنوان مثال ، یک توزیع U شکل یا هر تعداد توزیع چند حالته نمی تواند هیچ گونه کمتری داشته باشد.
(skewness = frac<(x_ -x08ar)^3>>) ، جایی که n = تعداد موارد ، و s = انحراف استاندارد ↩︎
راهنمای تجارت فارکس...
ما را در سایت راهنمای تجارت فارکس دنبال می کنید
برچسب :
نویسنده : لیال حقیقی
بازدید : <-PostHit->
تاريخ : جمعه
4 فروردين
1402 ساعت: 11:19