انقلاب در یادگیری تقویتی: الگوریتم جدید «تقسیم و غلبه» بدون TD توسط برکلی
محققان برکلی الگوریتم یادگیری تقویتی (RL) جدیدی بر پایه پارادایم «تقسیم و غلبه» معرفی کردند که برخلاف روشهای سنتی، به یادگیری تفاوت زمانی (TD) متکی نیست. این روش برای مقیاسپذیری …