کتاب بهینه‌سازی رفتار عامل‌های هوشمند با یادگیری تقویتی

انتخاب پلن

انتخاب پلن برای ادامه خرید الزامی است.

پرداخت اقساطی
در صورت خرید اقساطی هر قسط: 62,488 تومان
۴ قسط ماهانه. بدون سود، چک و ضامن.
پرداخت اقساطی با دیجی‌پی پرداخت اقساطی با ترب‌پی

📚 محتوای این محصول آموزشی (پکیج کامل)

💡 این محصول یک نسخهٔ کامل و جامع است

تمامی محتوای آموزشی این کتاب در قالب یک بسته‌ی کامل و یکپارچه ارائه می‌شود و شامل تمام نسخه‌ها و فایل‌های موردنیاز برای یادگیری است.

🎁 محتویات کامل بسته دانلودی

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل کتاب‌ها، تمرین‌ها و خودآزمایی .


ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود و نسخهٔ چاپی ندارد.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های کتاب همانجا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

🎓 دوره آموزشی جامع

📚 اطلاعات دوره

عنوان دوره: دوره بهینه‌سازی رفتار عامل‌های هوشمند با یادگیری تقویتی

موضوع کلی: هوش مصنوعی و یادگیری ماشین

موضوع میانی: یادگیری تقویتی

📋 سرفصل‌های دوره

  • 1. مقدمه‌ای بر هوش مصنوعی و یادگیری ماشین
  • 2. مبانی یادگیری تقویتی
  • 3. مفهوم عامل هوشمند
  • 4. محیط عامل هوشمند
  • 5. حالت‌ها، اعمال و پاداش‌ها
  • 6. فرآیندهای تصمیم‌گیری مارکوف (MDPs)
  • 7. معادلات بل‌من
  • 8. روش‌های مبتنی بر ارزش
  • 9. مقدار حالت (V-value)
  • 10. مقدار عمل (Q-value)
  • 11. تفاوت بین V-value و Q-value
  • 12. الگوریتم‌های یادگیری ارزش
  • 13. یادگیری Q-learning
  • 14. یادگیری SARSA
  • 15. تفاوت Q-learning و SARSA
  • 16. روش‌های مبتنی بر سیاست
  • 17. سیاست عامل
  • 18. نشان دادن سیاست
  • 19. بهینه‌سازی سیاست
  • 20. روش‌های گرادیان سیاست
  • 21. الگوریتم REINFORCE
  • 22. روش‌های Actor-Critic
  • 23. Actor-Critic ساده
  • 24. مزایای Actor-Critic
  • 25. الگوریتم A2C (Advantage Actor-Critic)
  • 26. الگوریتم A3C (Asynchronous Advantage Actor-Critic)
  • 27. یادگیری عمیق تقویتی (Deep RL)
  • 28. شبکه‌های عصبی در RL
  • 29. یادگیری عمیق Q-learning (DQN)
  • 30. شبکه‌های عصبی کانولوشنال در DQN
  • 31. شبکه‌های عصبی بازگشتی در DQN
  • 32. اتصالات متقابل (Experience Replay)
  • 33. هدف‌گذاری تاخیر (Target Networks)
  • 34. الگوریتم DQN پیشرفته
  • 35. Double DQN
  • 36. Dueling DQN
  • 37. Prioritized Experience Replay
  • 38. Policy Gradient در Deep RL
  • 39. Deep Deterministic Policy Gradient (DDPG)
  • 40. Trust Region Policy Optimization (TRPO)
  • 41. Proximal Policy Optimization (PPO)
  • 42. مقایسه PPO و TRPO
  • 43. یادگیری تقویتی چندعامله (MARL)
  • 44. مفاهیم پایه MARL
  • 45. چالش‌های MARL
  • 46. انواع هماهنگی در MARL
  • 47. مدل‌های همکاری در MARL
  • 48. مدل‌های رقابتی در MARL
  • 49. مدل‌های مختلط در MARL
  • 50. بازی‌های مجموع-صفر
  • 51. بازی‌های مجموع-غیرصفر
  • 52. تعادل نش (Nash Equilibrium)
  • 53. یادگیری تقویتی در رباتیک
  • 54. کنترل حرکتی ربات‌ها
  • 55. یادگیری تقویتی در خودروهای خودران
  • 56. ناوبری خودمختار
  • 57. یادگیری تقویتی در بازی‌ها
  • 58. مثال‌هایی از RL در بازی‌ها
  • 59. یادگیری تقویتی در امور مالی
  • 60. معاملات الگوریتمی
  • 61. یادگیری تقویتی در بهینه‌سازی منابع
  • 62. مدیریت انرژی
  • 63. یادگیری تقویتی در پردازش زبان طبیعی
  • 64. تنظیم دقیق مدل‌های زبانی
  • 65. یادگیری تقویتی در سیستم‌های توصیه‌گر
  • 66. بهبود تجربه کاربری
  • 67. یادگیری تقویتی در مراقبت‌های بهداشتی
  • 68. تشخیص بیماری
  • 69. یادگیری تقویتی برای تنظیم پارامترها
  • 70. تنظیم هایپرپارامترها
  • 71. ارزیابی عامل‌های RL
  • 72. معیارهای ارزیابی
  • 73. شبیه‌سازی در RL
  • 74. محیط‌های شبیه‌سازی استاندارد
  • 75. تکنیک‌های اکتشاف
  • 76. جستجوی تصادفی
  • 77. اکتشاف مبتنی بر آنتروپی
  • 78. اکتشاف مبتنی بر پاداش
  • 79. اکتشاف مبتنی بر عدم قطعیت
  • 80. اهمیت اکتشاف
  • 81. کاهش پاداش (Reward Shaping)
  • 82. طراحی تابع پاداش
  • 83. چالش‌های طراحی پاداش
  • 84. یادگیری از طریق تقلید (Imitation Learning)
  • 85. یادگیری مبتنی بر مشاهده
  • 86. یادگیری مبتنی بر قیاس
  • 87. یادگیری تقویتی معکوس (Inverse RL)
  • 88. استنتاج ترجیحات عامل
  • 89. مدل‌سازی رفتار عامل
  • 90. یادگیری تقویتی با دانش پیشین
  • 91. استفاده از دانش موجود
  • 92. یادگیری تقویتی در سیستم‌های توزیع‌شده
  • 93. هماهنگی بین عامل‌ها
  • 94. تکنیک‌های پیشرفته در RL
  • 95. یادگیری تقویتی مولد
  • 96. کاربرد در تولید محتوا
  • 97. یادگیری تقویتی برای ربات‌های نرم
  • 98. انعطاف‌پذیری در رباتیک
  • 99. یادگیری تقویتی در شبکه‌های ارتباطی
  • 100. بهینه‌سازی ترافیک

📚 محتوای این محصول آموزشی (پکیج کامل)

💡 این محصول یک نسخهٔ کامل و جامع است

تمامی محتوای آموزشی این کتاب در قالب یک بسته‌ی کامل و یکپارچه ارائه می‌شود و شامل تمام نسخه‌ها و فایل‌های موردنیاز برای یادگیری است.

🎁 محتویات کامل بسته دانلودی

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل کتاب‌ها، تمرین‌ها و خودآزمایی .


ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود و نسخهٔ چاپی ندارد.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های کتاب همانجا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

نظرات

هنوز نظری ثبت نشده است.

وارد شوید تا نظر ثبت کنید.