کتاب یادگیری تقویتی بدون مدل: اصول و الگوریتم‌ها

انتخاب پلن

انتخاب پلن برای ادامه خرید الزامی است.

پرداخت اقساطی
در صورت خرید اقساطی هر قسط: 62,488 تومان
۴ قسط ماهانه. بدون سود، چک و ضامن.
پرداخت اقساطی با دیجی‌پی پرداخت اقساطی با ترب‌پی

📚 محتوای این محصول آموزشی (پکیج کامل)

💡 این محصول یک نسخهٔ کامل و جامع است

تمامی محتوای آموزشی این کتاب در قالب یک بسته‌ی کامل و یکپارچه ارائه می‌شود و شامل تمام نسخه‌ها و فایل‌های موردنیاز برای یادگیری است.

🎁 محتویات کامل بسته دانلودی

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل کتاب‌ها، تمرین‌ها و خودآزمایی .


ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود و نسخهٔ چاپی ندارد.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های کتاب همانجا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

📚 کتاب آموزشی جامع

📚 اطلاعات کتاب

عنوان کتاب: کتاب یادگیری تقویتی بدون مدل: اصول و الگوریتم‌ها

موضوع کلی: یادگیری تقویتی چندعامله (MARL)

موضوع میانی: مدل‌های بدون مدل (Model-free RL)

📋 سرفصل‌های کتاب (100 موضوع)

  • 1. مقدمه به یادگیری تقویتی
  • 2. مقدمه به یادگیری تقویتی بدون مدل
  • 3. تفاوت یادگیری تقویتی با مدل و بدون مدل
  • 4. مزایای یادگیری تقویتی بدون مدل
  • 5. کاربردهای یادگیری تقویتی بدون مدل
  • 6. مبانی نظری یادگیری تقویتی
  • 7. فرآیند تصمیم‌گیری مارکوف (MDP)
  • 8. حالت‌ها، اعمال، پاداش‌ها، احتمالات انتقال
  • 9. تابع ارزش حالت (V-function)
  • 10. تابع ارزش عمل (Q-function)
  • 11. معادله بلمن برای V-function
  • 12. معادله بلمن برای Q-function
  • 13. بهینه‌سازی با استفاده از معادلات بلمن
  • 14. سیاست (Policy)
  • 15. سیاست بهینه
  • 16. اهمیت سیاست در یادگیری تقویتی
  • 17. چالش‌های یادگیری تقویتی
  • 18. اکتشاف در مقابل استثمار (Exploration vs. Exploitation)
  • 19. ناشناخته بودن دینامیک محیط
  • 20. پیچیدگی فضای حالت و عمل
  • 21. یادگیری تقویتی بدون مدل: رویکرد اصلی
  • 22. چرا یادگیری تقویتی بدون مدل؟
  • 23. استقلال از مدل محیط
  • 24. سادگی پیاده‌سازی
  • 25. قابلیت تعمیم به محیط‌های پیچیده
  • 26. اصول کلیدی یادگیری تقویتی بدون مدل
  • 27. یادگیری مستقیم از تجربه
  • 28. تخمین تابع ارزش یا سیاست
  • 29. عدم نیاز به پیش‌بینی احتمالات انتقال
  • 30. انواع الگوریتم‌های یادگیری تقویتی بدون مدل
  • 31. الگوریتم‌های مبتنی بر ارزش (Value-based)
  • 32. الگوریتم‌های مبتنی بر سیاست (Policy-based)
  • 33. الگوریتم‌های ترکیبی (Actor-Critic)
  • 34. الگوریتم‌های مبتنی بر ارزش: اصول
  • 35. یادگیری Q-function
  • 36. به‌روزرسانی Q-function با استفاده از تجربه
  • 37. یادگیری Q-function در عمل
  • 38. الگوریتم Q-Learning
  • 39. مراحل اجرای Q-Learning
  • 40. مثال ساده Q-Learning
  • 41. مزایای Q-Learning
  • 42. محدودیت‌های Q-Learning
  • 43. یادگیری SARSA
  • 44. مراحل اجرای SARSA
  • 45. تفاوت SARSA با Q-Learning
  • 46. مزایای SARSA
  • 47. محدودیت‌های SARSA
  • 48. الگوریتم‌های مبتنی بر سیاست: اصول
  • 49. یادگیری مستقیم سیاست (Policy Gradient)
  • 50. بهبود سیاست با گرادیان
  • 51. نحوه محاسبه گرادیان سیاست
  • 52. الگوریتم REINFORCE
  • 53. مراحل اجرای REINFORCE
  • 54. مزایای REINFORCE
  • 55. محدودیت‌های REINFORCE
  • 56. الگوریتم‌های Actor-Critic: اصول
  • 57. ترکیب یادگیری مبتنی بر ارزش و سیاست
  • 58. بازیگر (Actor): یادگیری سیاست
  • 59. منتقد (Critic): یادگیری تابع ارزش
  • 60. نحوه تعامل Actor و Critic
  • 61. الگوریتم A2C (Advantage Actor-Critic)
  • 62. مراحل اجرای A2C
  • 63. مزایای A2C
  • 64. محدودیت‌های A2C
  • 65. الگوریتم A3C (Asynchronous Advantage Actor-Critic)
  • 66. استفاده از پردازش موازی
  • 67. مزایای A3C
  • 68. محدودیت‌های A3C
  • 69. الگوریتم DDPG (Deep Deterministic Policy Gradient)
  • 70. برای فضاهای عمل پیوسته
  • 71. استفاده از شبکه‌های عصبی عمیق
  • 72. مزایای DDPG
  • 73. محدودیت‌های DDPG
  • 74. الگوریتم TD3 (Twin Delayed Deep Deterministic Policy Gradient)
  • 75. بهبود DDPG
  • 76. کاهش بیش‌برازش (Overfitting)
  • 77. مزایای TD3
  • 78. محدودیت‌های TD3
  • 79. الگوریتم SAC (Soft Actor-Critic)
  • 80. مبتنی بر آنتروپی (Entropy)
  • 81. تشویق به اکتشاف بیشتر
  • 82. مزایای SAC
  • 83. محدودیت‌های SAC
  • 84. تکنیک‌های اکتشاف در یادگیری تقویتی بدون مدل
  • 85. اپسیلون-حریصانه (Epsilon-Greedy)
  • 86. نمونه‌برداری از سیاست (Policy Sampling)
  • 87. جستجوی تصادفی (Random Search)
  • 88. نویز در اعمال (Action Noise)
  • 89. اکتشاف مبتنی بر عدم قطعیت (Uncertainty-based Exploration)
  • 90. اکتشاف مبتنی بر انگیزه (Intrinsic Motivation)
  • 91. اهمیت نمایش تجربه (Experience Replay)
  • 92. ذخیره و بازپخش تجربیات
  • 93. بهبود پایداری یادگیری
  • 94. کاهش همبستگی بین نمونه‌ها
  • 95. الگوریتم DQN (Deep Q-Network)
  • 96. استفاده از شبکه‌های عصبی عمیق برای Q-Learning
  • 97. مراحل اجرای DQN
  • 98. هدف‌گذاری دوگانه (Double DQN)
  • 99. تاریخچه تجربیات (Prioritized Experience Replay)
  • 100. مزایای DQN

📚 محتوای این محصول آموزشی (پکیج کامل)

💡 این محصول یک نسخهٔ کامل و جامع است

تمامی محتوای آموزشی این کتاب در قالب یک بسته‌ی کامل و یکپارچه ارائه می‌شود و شامل تمام نسخه‌ها و فایل‌های موردنیاز برای یادگیری است.

🎁 محتویات کامل بسته دانلودی

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل کتاب‌ها، تمرین‌ها و خودآزمایی .


ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود و نسخهٔ چاپی ندارد.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های کتاب همانجا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

نظرات

هنوز نظری ثبت نشده است.

وارد شوید تا نظر ثبت کنید.