کتاب یادگیری تقویتی: آموزش عامل‌ها برای تصمیم‌گیری بهینه

انتخاب پلن

انتخاب پلن برای ادامه خرید الزامی است.

پرداخت اقساطی
در صورت خرید اقساطی هر قسط: 62,488 تومان
۴ قسط ماهانه. بدون سود، چک و ضامن.
پرداخت اقساطی با دیجی‌پی پرداخت اقساطی با ترب‌پی

📚 محتوای این محصول آموزشی (پکیج کامل)

💡 این محصول یک نسخهٔ کامل و جامع است

تمامی محتوای آموزشی این کتاب در قالب یک بسته‌ی کامل و یکپارچه ارائه می‌شود و شامل تمام نسخه‌ها و فایل‌های موردنیاز برای یادگیری است.

🎁 محتویات کامل بسته دانلودی

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل کتاب‌ها، تمرین‌ها و خودآزمایی .


ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود و نسخهٔ چاپی ندارد.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های کتاب همانجا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

🎓 دوره آموزشی جامع

📚 اطلاعات دوره

عنوان دوره: دوره یادگیری تقویتی: آموزش عامل‌ها برای تصمیم‌گیری بهینه

موضوع کلی: برنامه‌نویسی کامپیوترهای شخصی

موضوع میانی: هوش مصنوعی و یادگیری ماشین در برنامه‌نویسی

📋 سرفصل‌های دوره

  • 1. مقدمه ای بر یادگیری تقویتی
  • 2. تعریف مسئله یادگیری تقویتی
  • 3. عامل و محیط
  • 4. حالت، عمل و پاداش
  • 5. تابع سیاست
  • 6. تابع ارزش
  • 7. معادله بلمن
  • 8. مدل‌های مسئله تصمیم‌گیری مارکوف (MDP)
  • 9. انواع MDP ها
  • 10. حل MDP ها: برنامه‌ریزی پویا
  • 11. روش های مبتنی بر مدل
  • 12. روش های بدون مدل
  • 13. یادگیری از طریق تکرار سیاست (Policy Iteration)
  • 14. یادگیری از طریق تکرار ارزش (Value Iteration)
  • 15. تقریب تابع ارزش
  • 16. اهمیت تابع ارزش
  • 17. تابع ارزش حالت-عمل
  • 18. یادگیری Q
  • 19. الگوریتم Q-learning
  • 20. آموزش Q-learning
  • 21. تجربه بازخورد
  • 22. یادگیری آفلاین در مقابل آنلاین
  • 23. حداکثرسازی پاداش تجمعی
  • 24. اکتشاف در مقابل بهره‌برداری
  • 25. معضل اکتشاف-بهره‌برداری
  • 26. روش های اکتشاف: اپسیلون-حریصانه (Epsilon-Greedy)
  • 27. اکتشاف تصادفی
  • 28. اکتشاف بر اساس عدم قطعیت
  • 29. یادگیری عمیق و یادگیری تقویتی
  • 30. شبکه‌های عصبی عمیق
  • 31. یادگیری تقویتی عمیق (DRL)
  • 32. شبکه عمیق Q (DQN)
  • 33. معماری DQN
  • 34. آموزش DQN
  • 35. حافظه بازپخش (Replay Memory)
  • 36. هدف‌گذاری شبکه (Target Network)
  • 37. مشکل ناپایداری در DQN
  • 38. بهبودهای DQN
  • 39. Double DQN
  • 40. Prioritized Experience Replay
  • 41. Dueling DQN
  • 42. Actor-Critic Methods
  • 43. روش های Actor-Critic
  • 44. بازیگر (Actor)
  • 45. منتقد (Critic)
  • 46. آموزش Actor-Critic
  • 47. A2C (Advantage Actor-Critic)
  • 48. A3C (Asynchronous Advantage Actor-Critic)
  • 49. TRPO (Trust Region Policy Optimization)
  • 50. PPO (Proximal Policy Optimization)
  • 51. مقایسه PPO و TRPO
  • 52. یادگیری سیاست گرادیان (Policy Gradient)
  • 53. آموزش سیاست گرادیان
  • 54. مشکل واریانس بالا در گرادیان سیاست
  • 55. کاهش واریانس
  • 56. روش های خطی تقریب تابع ارزش
  • 57. تابع پایه (Basis Functions)
  • 58. تقریب خطی ارزش
  • 59. روش های مبتنی بر مدل در مقابل بدون مدل (دوباره)
  • 60. مزایای روش های بدون مدل
  • 61. معایب روش های بدون مدل
  • 62. کاربرد یادگیری تقویتی
  • 63. بازی‌های کامپیوتری
  • 64. رباتیک
  • 65. سیستم‌های توصیه‌گر
  • 66. مدیریت منابع
  • 67. تنظیم پارامترها
  • 68. اتخاذ تصمیمات در زمان واقعی
  • 69. یادگیری تقویتی در کنترل
  • 70. کنترل بهینه
  • 71. کنترل تطبیقی
  • 72. ربات‌های متحرک
  • 73. ربات‌های انسان‌نما
  • 74. پایدارسازی ربات‌ها
  • 75. یادگیری تقویتی در بازی‌ها
  • 76. آتاری
  • 77. شطرنج
  • 78. بازی‌های استراتژی
  • 79. یادگیری تقویتی در سیستم‌های توصیه‌گر
  • 80. توصیه محصولات
  • 81. توصیه محتوا
  • 82. توصیه موسیقی
  • 83. یادگیری تقویتی در مالی
  • 84. معاملات الگوریتمی
  • 85. مدیریت پورتفولیو
  • 86. پیش‌بینی بازار
  • 87. یادگیری تقویتی در بهداشت و درمان
  • 88. تشخیص بیماری
  • 89. تنظیم دوز دارو
  • 90. طراحی پروتکل درمانی
  • 91. یادگیری تقویتی در آموزش
  • 92. شخصی‌سازی یادگیری
  • 93. ارزیابی دانش‌آموز
  • 94. بهینه‌سازی محتوای آموزشی
  • 95. محدودیت‌ها و چالش‌های یادگیری تقویتی
  • 96. مقیاس‌پذیری
  • 97. تفسیرپذیری
  • 98. امنیت
  • 99. اعتماد
  • 100. پیاده‌سازی در دنیای واقعی

📚 محتوای این محصول آموزشی (پکیج کامل)

💡 این محصول یک نسخهٔ کامل و جامع است

تمامی محتوای آموزشی این کتاب در قالب یک بسته‌ی کامل و یکپارچه ارائه می‌شود و شامل تمام نسخه‌ها و فایل‌های موردنیاز برای یادگیری است.

🎁 محتویات کامل بسته دانلودی

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل کتاب‌ها، تمرین‌ها و خودآزمایی .


ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود و نسخهٔ چاپی ندارد.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های کتاب همانجا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

نظرات

هنوز نظری ثبت نشده است.

وارد شوید تا نظر ثبت کنید.