GLM: متناسب با مدل های خطی عمومی

ساخت وبلاگ

GLM برای متناسب با مدلهای خطی عمومی استفاده می شود ، که با ارائه توضیحات نمادین از پیش بینی کننده خطی و شرح توزیع خطا مشخص شده است.

استفاده

استدلال

یک هدف از کلاس "فرمول" (یا یک مورد که می تواند به آن کلاس مجبور شود): توصیف نمادین از مدل که باید تعبیه شود. جزئیات مشخصات مدل تحت "جزئیات" آورده شده است.

شرح توزیع خطا و عملکرد پیوند که در مدل مورد استفاده قرار می گیرد. برای GLM این می تواند یک رشته کاراکتر باشد که نامگذاری عملکرد خانواده ، عملکرد خانواده یا نتیجه فراخوانی به یک عملکرد خانواده است. برای GLM. FIT فقط گزینه سوم پشتیبانی می شود.(برای جزئیات بیشتر در مورد عملکرد خانواده به خانواده مراجعه کنید.)

یک قاب داده ، لیست یا محیط اختیاری (یا اجبار شیء توسط As. data. frame به یک قاب داده) حاوی متغیرهای موجود در مدل. اگر در داده ها یافت نشد ، متغیرها از محیط (فرمول) گرفته می شوند ، به طور معمول محیطی که از آن GLM خوانده می شود.

یک بردار اختیاری از "وزن های قبلی" که در فرآیند اتصالات مورد استفاده قرار می گیرد. باید یک وکتور عددی باشد.

یک بردار اختیاری که زیر مجموعه ای از مشاهدات را که در فرآیند اتصالات مورد استفاده قرار می گیرد ، مشخص می کند.

تابعی که نشان می دهد چه اتفاقی می افتد وقتی داده ها حاوی سدیم هستند. پیش فرض توسط تنظیمات na. action از گزینه ها تنظیم شده است ، و در صورت عدم استفاده ، na. fail است. پیش فرض "کارخانه" na. omit است. مقدار احتمالی دیگر تهی است ، بدون اقدام. مقدار na. xclude می تواند مفید باشد.

مقادیر شروع پارامترها در پیش بینی کننده خطی.

مقادیر شروع برای پیش بینی کننده خطی.

شروع مقادیر برای بردار میانگین.

این می تواند برای مشخص کردن یک مؤلفه شناخته شده پیشینی که در پیش بینی خطی در هنگام اتصالات گنجانده شده است ، استفاده شود. این باید تهی یا یک بردار عددی با طول برابر با تعداد موارد باشد. به جای آن می توان یک یا چند اصطلاح جبران را در فرمول در نظر گرفت ، و اگر بیش از یک مشخص شود از مبلغ آنها استفاده می شود. به Model. Offset مراجعه کنید.

لیستی از پارامترهای کنترل فرآیند اتصالات. برای GLM. Fit این به GLM. Control منتقل می شود.

یک مقدار منطقی نشان می دهد که آیا قاب مدل باید به عنوان مؤلفه ای از مقدار برگشتی گنجانده شود.

روشی که باید در متناسب با مدل استفاده شود. روش پیش فرض "GLM. FIT" از مربعات حداقل وزنه برداری تکراری (IWLS) استفاده می کند: جایگزین "Model. frame" قاب مدل را برمی گرداند و هیچ اتصالی ندارد.

توابع اتصالی با استفاده از کاربر می تواند به عنوان یک تابع یا یک رشته کاراکتر نامگذاری یک عملکرد ، با عملکردی که همان آرگومان های GLM. FIT را در نظر می گیرد ، تهیه شود. اگر به عنوان یک رشته کاراکتر مشخص شود ، از درون فضای نام Stats جستجو می شود.

برای GLM: مقادیر منطقی نشان می دهد که آیا بردار پاسخ و ماتریس مدل مورد استفاده در فرآیند اتصالات باید به عنوان مؤلفه های مقدار برگشتی بازگردانده شوند.

برای GLM. Fit: X یک ماتریس طراحی از ابعاد n * p است ، و y بردار مشاهدات طول n است.

منطقی ؛اگر یک تناسب مفرد نادرست باشد ، یک خطا است.

یک لیست اختیاریContrasts. Arg از Model. Matrix. Default را ببینید.

منطقیآیا باید یک رهگیری در مدل تهی گنجانده شود؟

یک شیء که از کلاس "GLM" به ارث می رسد.

شخصیت ، تطبیق جزئی مجاز است. نوع وزنه ها برای استخراج از شیء مدل متناسب. می توان به طور خلاصه.

برای GLM: آرگومان هایی که برای تشکیل آرگومان کنترل پیش فرض در صورت عدم تأمین مستقیم تهیه می شوند ، استفاده می شود.

برای وزنه ها: استدلال های بیشتر به روش های دیگر یا از روش های دیگر منتقل می شود.

جزئیات

یک پیش بینی کننده معمولی پاسخ فرم دارد~اصطلاحاتی که در آن پاسخ وکتور پاسخ (عددی) است و اصطلاحات مجموعه ای از اصطلاحات است که یک پیش بینی کننده خطی برای پاسخ را مشخص می کند. برای خانواده های binomial و quasibinomial ، پاسخ همچنین می تواند به عنوان یک عامل مشخص شود (وقتی سطح اول نشانگر عدم موفقیت و موفقیت دیگران است) یا به عنوان یک ماتریس دو ستونی با ستون ها تعداد موفقیت ها و شکست ها را نشان می دهد. مشخصات اصطلاحات فرم اول + دوم ، تمام اصطلاحات را در ابتدا همراه با تمام اصطلاحات در دوم با هر کپی حذف شده نشان می دهد.

مشخصات فرم اول: دوم مجموعه ای از اصطلاحات به دست آمده با در نظر گرفتن تعامل همه اصطلاحات در ابتدا با همه شرایط در دوم را نشان می دهد. مشخصات اول*دوم صلیب اول و دوم را نشان می دهد. این همانند اول + دوم + اول است: دوم.

اصطلاحات موجود در فرمول مجدداً سفارش داده می شود تا اثرات اصلی در ابتدا به وجود بیاید ، به دنبال آن تعامل ، همه مرتبه دوم ، همه مرتبه سوم و غیره: برای جلوگیری از عبور از این اصطلاح به عنوان فرمول.

از وزنهای غیر تهی می توان استفاده کرد تا نشان دهد که مشاهدات مختلف پراکندگی های مختلفی دارند (با مقادیر وزنهای متناسب با پراکندگی). یا به طور معادل ، هنگامی که عناصر وزنه ها عدد صحیح مثبت w_i هستند ، که هر پاسخ y_i میانگین مشاهدات وزن واحد WII است. برای یک GLM دوتایی از وزن های قبلی برای ارائه تعداد آزمایشات استفاده می شود که پاسخ نسبت موفقیت ها باشد: آنها به ندرت برای Poisson GLM استفاده می شوند.

GLM. FIT عملکرد اسب بخار است: به طور معمول به طور مستقیم خوانده نمی شود اما می تواند در جایی که بردار پاسخ ، ماتریس طراحی و خانواده قبلاً محاسبه شده باشد ، کارآمدتر باشد.

اگر بیش از یکی از Etastart ، Start و Mustart مشخص شود ، از اولین لیست استفاده می شود. اغلب توصیه می شود مقادیر شروع برای یک خانواده شبه و همچنین برای خانواده هایی با پیوندهای غیرمعمول مانند گاوسی ("ورود به سیستم") تهیه شود.

تمام وزن ها ، زیر مجموعه ها ، افست ها ، Etastart و Mustart به همان روش متغیرهای موجود در فرمول ارزیابی می شوند ، که ابتدا در داده ها و سپس در محیط فرمول است.

برای پیشینه پیام های هشدار دهنده در مورد "احتمالات متناسب با عددی 0 یا 1" برای GLM های دوتایی رخ داده است ، به Venables & Ripley مراجعه کنید (2002 ، صص 197-8).

ارزش

GLM یک شیء از کلاس را از "GLM" که از کلاس "LM" به ارث می برد ، برمی گرداند. بعداً در این بخش مشاهده کنید. اگر از یک روش غیر استاندارد استفاده شود ، شیء نیز از کلاس (در صورت وجود) با آن عملکرد به ارث می برد.

خلاصه عملکرد (به عنوان مثال ، خلاصه. glm) می تواند برای به دست آوردن یا چاپ خلاصه ای از نتایج و عملکرد ANOVA (به عنوان مثال ، ANOVA. GLM) برای تولید تجزیه و تحلیل جدول واریانس استفاده شود.

ضرایب Accessor Accessor عملکرد ، اثرات ، متناسب با آن. از مقادیر و باقیمانده ها می توان برای استخراج ویژگی های مفید مختلف از مقدار برگشتی توسط GLM استفاده کرد.

وزنه ها یک بردار از وزن ها را استخراج می کند ، یکی برای هر مورد در تناسب (پس از زیرمجموعه و na. action).

یک هدف از کلاس "GLM" لیستی است که حاوی حداقل اجزای زیر است:

یک بردار نامگذاری شده از ضرایب

باقیمانده های کار ، یعنی باقیمانده در تکرار نهایی IWLS مناسب است. از آنجا که موارد با وزن صفر حذف شده است ، باقیمانده های کار آنها NA است.

مقادیر میانگین متناسب ، با تبدیل پیش بینی کننده های خطی توسط معکوس عملکرد پیوند بدست آمده است.

رتبه عددی مدل خطی متناسب.

شیء خانوادگی استفاده شده است.

خط خطی در مقیاس لینک.

تا یک ثابت ، منهای دو برابر احتمال ورود به سیستم حداکثر. در جایی که معقول باشد ، ثابت به گونه ای انتخاب می شود که یک مدل اشباع دارای انحراف صفر باشد.

نسخه ای از معیار اطلاعاتی Akaike ، منهای دو برابر احتمال ورود به سیستم حداکثر به علاوه دو برابر تعداد پارامترها ، که از طریق مؤلفه AIC خانواده محاسبه می شود. برای خانواده های دوتایی و سمی پراکندگی در یک ثابت است و تعداد پارامترها تعداد ضرایب است. برای خانواده های گاوسی ، گاما و معکوس گاوسی پراکندگی از انحراف باقیمانده تخمین زده می شود و تعداد پارامترها تعداد ضرایب به علاوه یک است. برای یک خانواده گاوسی از پراکندگی استفاده می شود ، بنابراین این یک ارزش معتبر از AIC است ، اما برای خانواده های گاما و معکوس گاوسی اینطور نیست. برای خانواده هایی که از نظر شبه و شیوه ای متناسب هستند ، ارزش سدیم است.

انحراف برای مدل تهی ، قابل مقایسه با انحراف. مدل تهی شامل افست و رهگیری در صورت وجود یک مدل در مدل خواهد بود. توجه داشته باشید که اگر عملکرد پیوند به داده های غیر از میانگین متناسب بستگی داشته باشد ، این نادرست خواهد بود: یک جبران صفر را برای مجبور کردن یک محاسبه صحیح مشخص کنید.

تعداد تکرارهای IWLS استفاده شده است.

وزنهای کار ، یعنی وزنهای موجود در تکرار نهایی IWLS مناسب است.

وزنهای در ابتدا تأمین می شد ، اگر هیچ یک بردار 1 ثانیه نبود.

درجه باقیمانده آزادی.

درجه باقیمانده آزادی برای مدل تهی.

در صورت درخواست (پیش فرض) بردار y استفاده شده است.(این یک بردار حتی برای یک مدل دوتایی است.)

در صورت درخواست ، ماتریس مدل.

در صورت درخواست (پیش فرض) ، قاب مدل.

منطقیآیا الگوریتم IWLS داوری شده است که همگرا شده است؟

منطقیآیا مقدار مناسب در مرز مقادیر قابل دستیابی است؟

تماس همسان

فرمول تهیه شده

اصطلاحات مورد استفاده

آرگومان داده

بردار افست استفاده شده است.

مقدار آرگومان کنترل مورد استفاده.

نام عملکرد Fitter مورد استفاده (هنگامی که به عنوان یک رشته کاراکتر به GLM ()) یا عملکرد Fitter (در صورت ارائه به عنوان آن) ارائه می شود.

(در صورت لزوم) تضادهای مورد استفاده.

(در صورت لزوم) سابقه ای از سطح عوامل مورد استفاده در اتصالات.

(در صورت لزوم) اطلاعاتی که توسط model. frame در مورد کار با ویژه Na s بازگردانده شده است.

علاوه بر این ، متناسب بودن غیر خالی دارای مؤلفه های QR ، R و اثرات مربوط به تناسب خطی وزن نهایی است.

اشیاء کلاس "GLM" به طور معمول از کلاس C ("GLM" ، "LM") هستند ، که از کلاس "LM" به ارث می رسد و روشهای به خوبی طراحی شده برای کلاس "LM" در مدل خطی وزنی در مدل استفاده می شودتکرار نهایی IWLS. با این حال ، مراقبت لازم است ، زیرا عملکردهای استخراج کننده برای کلاس "GLM" مانند باقیمانده و وزنه ها فقط مؤلفه تناسب را با همین نام انتخاب نمی کنند.

اگر یک مدل GLM Binomial با دادن یک پاسخ دو ستونی مشخص شود ، وزنهای برگشتی توسط وزنهای قبلی تعداد کل موارد (با استفاده از وزن موردی ارائه شده) و مؤلفه y از نتیجه ، نسبت موفقیت ها است.

توابع متناسب

روش آرگومان دو هدف را انجام می دهد. یکی این است که اجازه می دهد تا قاب مدل بدون اتصالات بازسازی شود. مورد دیگر این است که اجازه دهید عملکرد اتصالات پیش فرض GLM. FIT با تابعی جایگزین شود که همان آرگومان ها را می گیرد و از یک الگوریتم مناسب متفاوت استفاده می کند. اگر Glm. Fit به عنوان یک رشته کاراکتر تهیه شود ، از آن برای جستجوی تابعی از آن نام استفاده می شود ، و از فضای نام Stats شروع می شود.

کلاس بازگشت شیء توسط fitter (در صورت وجود) به کلاس بازگشت شده توسط GLM پیش می رود.

نویسنده (ها)

اجرای اصلی R GLM توسط سیمون دیویس که برای راس ایهاکا در دانشگاه اوکلند کار می کند ، نوشته شده است ، اما از آن زمان توسط اعضای تیم R Core به طور گسترده مجدداً نوشته شده است.

این طرح از عملکرد S با همین نام در Hastie & Pregibon (1992) الهام گرفته شده است.

منابع

Dobson ، A. J. (1990) مقدمه ای برای مدل های خطی تعمیم یافته. لندن: چاپمن و هال.

Hastie ، T. J. and Pregibon ، D. (1992) مدلهای خطی تعمیم یافته. فصل 6 مدل های آماری در S J. M. Chambers و T. J. Hastie ، Wadsworth & Brooks/Cole.

McCullagh P. and Nelder ، J. A. (1989) مدلهای خطی تعمیم یافته. لندن: چاپمن و هال.

Venables ، W. N. and Ripley ، B. D. (2002) آمار کاربردی مدرن با S. نیویورک: Springer.

همچنین ببینید

anova. glm ، summary. glm ، و غیره برای روش های GLM ، و عملکردهای عمومی ANOVA ، خلاصه ، جلوه ها ، متناسب با آنها.

LM برای مدلهای خطی غیر کلی شده (که SAS آن را GLMS می نامد ، برای مدلهای خطی "عمومی").

loglin و loglm (توده بسته) برای متناسب کردن مدل های خطی (که GLM های دوتایی و پواسون هستند) به میزهای احتمالی.

BigGlm در بسته بندی BigLM برای یک روش جایگزین برای جارو کردن GLMS در مجموعه داده های بزرگ (به ویژه مواردی که بسیاری از موارد) دارند.

آموزش فارکس برای مبتدی ها...
ما را در سایت آموزش فارکس برای مبتدی ها دنبال می کنید

برچسب : نویسنده : Mihayloo بازدید : <-PostHit-> تاريخ : چهارشنبه 24 اسفند 1401 ساعت: 17:52