شاخص های رو به جلو و عقب

ساخت وبلاگ

بعدی: 7. 5 Sarsa () UP: 7. واجد شرایط بودن قبلی: 7. 3 محتوای نمای عقب مانده

در این بخش ما نشان می دهیم که TD خارج از خط () ، همانطور که از نظر مکانیکی در بالا تعریف شده است ، به همان روزهای به روزرسانی وزن الگوریتم سوختگی خارج از خط می رسد. به این معنا ، ما دیدگاههای رو به جلو (نظری) و عقب مانده (مکانیکی) TD () را تراز می کنیم. بگذارید به روزرسانی را در زمان مطابق با الگوریت م-Retu (7. 4) مشخص کنید ، و بگذارید به روزرسانی را در زمان حالت مطابق با تعریف مکانیکی TD () مطابق با (7. 7) بیان کنید. سپس هدف ما این است که نشان دهیم که مجموع تمام به روزرسانی های یک قسمت برای دو الگوریتم یکسان است:

عملکرد نشانگر هویت ، برابر با IF و برابر با 0 در غیر این صورت است.

اول توجه داشته باشید که اثری از واجد شرایط بودن می تواند صریحاً (غیرقانونی) نوشته شودبنابراین ، سمت چپ (7. 8) می تواند نوشته شود

اکنون به سمت راست (7. 8) می رویم. یک به روزرسانی فردی از الگوریت م-Retu را در نظر بگیرید:ستون اول را در داخل براکت ها بررسی کنید-همه آنها را با عوامل وزنه برداری آنها از زمان قدرت. به نظر می رسد که تمام فاکتورهای وزنی به 1 جمع می شوند. بنابراین می توانیم ستون اول را بیرون بیاوریم و یک اصطلاح بدون وزنی بدست آوریم. یک ترفند مشابه ستون دوم را در براکت ها بیرون می کشد و از ردیف دوم شروع می شود که خلاصه آن است. تکرار این برای هر ستون ، ما دریافت می کنیمتقریب فوق در مورد به روزرسانی خارج از خط دقیق است ، در این صورت برای همه یکسان است. آخرین مرحله دقیق است (نه تقریب) زیرا تمام شرایط حذف شده به دلیل مراحل ساختگی "پس از" حالت ترمینال وارد شده است. همه این مراحل دارای پاداش صفر و مقادیر صفر هستند. بنابراین همه آنها نیز صفر هستند. بنابراین ، ما نشان داده ایم که در مورد خارج از خط ، سمت راست (7. 8) می تواند نوشته شود

در مورد به روزرسانی آنلاین ، تقریب ساخته شده در بالا تا زمانی که کوچک باشد نزدیک خواهد بود و بنابراین در طی یک قسمت کمی تغییر می کند. حتی در مورد آنلاین می توانیم انتظار داشته باشیم که به روزرسانی های TD () و الگوریت م-سوختگی مشابه باشد.

در حال حاضر فرض کنیم که این افزایش به اندازه کافی کوچک در طی یک قسمت کوچک است که TD به صورت آنلاین () در اصل همان به روزرسانی را در طول یک قسمت ارائه می دهد ، همانطور که الگوریت م-سوختگی انجام می دهد. هنوز سؤالات جالبی در مورد آنچه در طول یک قسمت اتفاق می افتد وجود دارد. به روزرسانی ارزش حالت را در MidePisode در زمان در نظر بگیرید. تحت TD () O n-Line ، اثر A در دقیقاً به نظر می رسد که ما یک به روزرسان ی-tu را انجام داده ایم که آخرین حالت مشاهده شده را به عنوان حالت ترمینال قسمت با یک مقدار ترمینال Nonzero برابر با مقدار تخمین زده شده فعلی خود انجام داده ایم. این رابطه از مرحله به قدم حفظ می شود زیرا هر حالت جدید مشاهده می شود.

مثال 7. 3: پیاده روی تصادفی با TD () زیرا TD () خارج از خط معادل الگوریتم سوختگی است ، ما در حال حاضر نتایج مربوط به TD خارج از خط () را در کار پیاده روی تصادفی 19 حالته داریم. آنها در شکل 7. 6 نشان داده شده است. نتایج قابل مقایسه برای TD On-Line () در شکل 7. 9 نشان داده شده است. توجه داشته باشید که الگوریتم آنلاین در طیف وسیعی از پارامترها بهتر عمل می کند. این اغلب به نظر می رسد که در مورد روش های آنلاین وجود دارد.

تمرین 7. 5 اگرچه TD () فقط الگوریتم سوختگی را در صورت انجام آنلاین تقریب می دهد ، شاید یک روش TD کمی متفاوت وجود داشته باشد که حتی در مورد آنلاین هم ارزی را حفظ کند. یک ایده این است که خطای TD را در عوض به عنوان و بازگش ت-مرحله به عنوان تعریف کنید. نشان می دهد که در این حالت الگوریتم اصلاح شده TD () دقیقاً به دست می آید

حتی در مورد به روزرسانی آنلاین با بزرگ. از چه روشهایی می توان این TD () اصلاح شده بهتر یا بدتر از روش معمولی که در متن شرح داده شده است؟آزمایش را برای ارزیابی شایستگی های نسبی دو الگوریتم شرح دهید.

بعدی: 7. 5 SARSA () UP: 7. واجد شرایط بودن موارد قبلی: 7. 3 محتوای نمای عقب مارک لی 2005-01-04

آموزش فارکس برای مبتدی ها...
ما را در سایت آموزش فارکس برای مبتدی ها دنبال می کنید

برچسب : نویسنده : Mihayloo بازدید : <-PostHit-> تاريخ : پنجشنبه 18 اسفند 1401 ساعت: 14:59