کتاب یادگیری استراتژی‌های مولد با الگوریتم‌های مبتنی بر سیاست در MARL

انتخاب پلن

انتخاب پلن برای ادامه خرید الزامی است.

پرداخت اقساطی
در صورت خرید اقساطی هر قسط: 62,488 تومان
۴ قسط ماهانه. بدون سود، چک و ضامن.
پرداخت اقساطی با دیجی‌پی پرداخت اقساطی با ترب‌پی

📚 محتوای این محصول آموزشی (پکیج کامل)

💡 این محصول یک نسخهٔ کامل و جامع است

تمامی محتوای آموزشی این کتاب در قالب یک بسته‌ی کامل و یکپارچه ارائه می‌شود و شامل تمام نسخه‌ها و فایل‌های موردنیاز برای یادگیری است.

🎁 محتویات کامل بسته دانلودی

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل کتاب‌ها، تمرین‌ها و خودآزمایی .


ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود و نسخهٔ چاپی ندارد.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های کتاب همانجا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

📚 کتاب آموزشی جامع

📚 اطلاعات کتاب

عنوان کتاب: کتاب یادگیری استراتژی‌های مولد با الگوریتم‌های مبتنی بر سیاست در MARL

موضوع کلی: یادگیری تقویتی چندعامله (MARL)

موضوع میانی: الگوریتم‌های مبتنی بر سیاست (Policy-based Algorithms)

📋 سرفصل‌های کتاب (100 موضوع)

  • 1. مقدمه ای بر یادگیری تقویتی چند عاملی
  • 2. مفاهیم اساسی یادگیری تقویتی
  • 3. تعریف عامل، محیط، حالت، عمل، پاداش
  • 4. فرایند تصمیم گیری مارکوف (MDP)
  • 5. تعریف MDP
  • 6. حالت، عمل، تابع انتقال، تابع پاداش
  • 7. فرمول بندی MDP برای مسائل MARL
  • 8. مقدمه ای بر یادگیری تقویتی چند عاملی (MARL)
  • 9. تفاوت MARL با RL تک عاملی
  • 10. چالش های MARL: عدم ایستایی، مقیاس پذیری، هماهنگی
  • 11. انواع مسائل MARL: با همکاری، رقابتی، مختلط
  • 12. مقدمه ای بر الگوریتم های مبتنی بر سیاست (Policy-Based)
  • 13. یادگیری مبتنی بر سیاست در مقابل یادگیری مبتنی بر ارزش
  • 14. مفهوم سیاست (Policy)
  • 15. انواع سیاست ها: قطعی، احتمالی
  • 16. تابع هدف سیاست (Policy Objective Function)
  • 17. گرادیان سیاست (Policy Gradient)
  • 18. مقدمه ای بر الگوریتم های گرادیان سیاست
  • 19. REINFORCE
  • 20. REINFORCE با خط مبنا (Baseline)
  • 21. مقدمه ای بر استراتژی های مولد (Actor-Critic)
  • 22. مفهوم Actor و Critic
  • 23. نقش Actor در انتخاب عمل
  • 24. نقش Critic در تخمین ارزش
  • 25. الگوریتم Actor-Critic پایه
  • 26. تفاوت Actor-Critic با REINFORCE
  • 27. مقدمه ای بر الگوریتم های Actor-Critic پیشرفته
  • 28. A2C (Advantage Actor-Critic)
  • 29. A3C (Asynchronous Advantage Actor-Critic)
  • 30. مقدمه ای بر الگوریتم های مبتنی بر سیاست در MARL
  • 31. چالش های اعمال الگوریتم های مبتنی بر سیاست در MARL
  • 32. عدم ایستایی محیط در MARL
  • 33. وابستگی متقابل سیاست های عامل ها
  • 34. مقدمه ای بر الگوریتم های DPPO (Decentralized Proximal Policy Optimization)
  • 35. DPPO برای مسائل MARL
  • 36. نحوه اعمال DPPO در محیط های چند عاملی
  • 37. مزایای DPPO در MARL
  • 38. مقدمه ای بر الگوریتم های MADDPG (Multi-Agent Deep Deterministic Policy Gradient)
  • 39. MADDPG برای مسائل MARL
  • 40. معماری MADDPG
  • 41. آموزش عامل ها در MADDPG
  • 42. مزایای MADDPG در MARL
  • 43. مقدمه ای بر الگوریتم های COMA (Counterfactual Multi-Agent Policy Gradients)
  • 44. COMA برای مسائل MARL
  • 45. نحوه محاسبه ارزش پاداش متقابل (Counterfactual Baseline)
  • 46. آموزش عامل ها در COMA
  • 47. مزایای COMA در MARL
  • 48. مقدمه ای بر الگوریتم های QMIX
  • 49. QMIX برای مسائل MARL
  • 50. معماری QMIX
  • 51. تابع ارزش ترکیبی (Joint Action-Value Function)
  • 52. آموزش عامل ها در QMIX
  • 53. مزایای QMIX در MARL
  • 54. مقدمه ای بر الگوریتم های VDN (Value Decomposition Networks)
  • 55. VDN برای مسائل MARL
  • 56. تجزیه تابع ارزش ترکیبی
  • 57. آموزش عامل ها در VDN
  • 58. مزایای VDN در MARL
  • 59. مقدمه ای بر الگوریتم های MAPPO (Multi-Agent Proximal Policy Optimization)
  • 60. MAPPO برای مسائل MARL
  • 61. تفاوت MAPPO با PPO تک عاملی
  • 62. نحوه اعمال MAPPO در محیط های چند عاملی
  • 63. مزایای MAPPO در MARL
  • 64. مقدمه ای بر الگوریتم های CTDE (Centralized Training with Decentralized Execution)
  • 65. مفهوم CTDE
  • 66. مزایای CTDE در MARL
  • 67. چالش های CTDE
  • 68. الگوریتم های مبتنی بر CTDE
  • 69. مقدمه ای بر یادگیری سیاست های مشترک (Joint Policy Learning)
  • 70. یادگیری یک سیاست واحد برای همه عامل ها
  • 71. مزایا و معایب یادگیری سیاست های مشترک
  • 72. مقدمه ای بر یادگیری سیاست های مجزا (Individual Policy Learning)
  • 73. یادگیری سیاست های مستقل برای هر عامل
  • 74. مزایا و معایب یادگیری سیاست های مجزا
  • 75. مقدمه ای بر یادگیری سیاست های سلسله مراتبی (Hierarchical Policy Learning)
  • 76. تقسیم وظایف به زیر وظایف
  • 77. طراحی سلسله مراتب سیاست ها
  • 78. مقدمه ای بر یادگیری سیاست های مبتنی بر مشاهده (Observation-Based Policy Learning)
  • 79. استفاده از مشاهدات برای هدایت سیاست
  • 80. تکنیک های پردازش مشاهدات
  • 81. مقدمه ای بر یادگیری سیاست های مبتنی بر ارتباط (Communication-Based Policy Learning)
  • 82. طراحی پروتکل های ارتباطی بین عامل ها
  • 83. یادگیری زمان و محتوای ارتباط
  • 84. مقدمه ای بر یادگیری سیاست های مبتنی بر حافظه (Memory-Based Policy Learning)
  • 85. استفاده از حافظه برای یادگیری بلندمدت
  • 86. معماری های مبتنی بر حافظه (RNN, LSTM)
  • 87. مقدمه ای بر یادگیری سیاست های مبتنی بر توجه (Attention-Based Policy Learning)
  • 88. تمرکز بر بخش های مهم مشاهدات یا ارتباطات
  • 89. مکانیزم های توجه
  • 90. مقدمه ای بر یادگیری سیاست های توزیع شده (Distributed Policy Learning)
  • 91. آموزش عامل ها به صورت موازی
  • 92. استفاده از چندین دستگاه محاسباتی
  • 93. مقدمه ای بر یادگیری سیاست های ناهمگن (Heterogeneous Policy Learning)
  • 94. عامل ها با قابلیت ها و اهداف متفاوت
  • 95. طراحی سیاست های سازگار
  • 96. مقدمه ای بر مسائل هماهنگی در MARL
  • 97. چالش های هماهنگی
  • 98. راهکارهای مبتنی بر سیاست
  • 99. مقدمه ای بر مسائل رقابت در MARL
  • 100. چالش های رقابت

📚 محتوای این محصول آموزشی (پکیج کامل)

💡 این محصول یک نسخهٔ کامل و جامع است

تمامی محتوای آموزشی این کتاب در قالب یک بسته‌ی کامل و یکپارچه ارائه می‌شود و شامل تمام نسخه‌ها و فایل‌های موردنیاز برای یادگیری است.

🎁 محتویات کامل بسته دانلودی

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل کتاب‌ها، تمرین‌ها و خودآزمایی .


ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود و نسخهٔ چاپی ندارد.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های کتاب همانجا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

نظرات

هنوز نظری ثبت نشده است.

وارد شوید تا نظر ثبت کنید.