Hugging Face Blog·· 2022-06-30AI 評分47
使用 PyTorch 實作策略梯度
Policy Gradient with PyTorch
AI 導讀
Hugging Face 深度強化學習課程第 5 單元以 PyTorch 從零實作 REINFORCE,並在 CartPole-v1、PixelCopter 和 Pong 測試其穩健性。策略梯度以梯度上升直接最佳化策略,毋須先學習價值函數;隨機策略可促進探索,在高維及連續動作空間中亦較有效。其限制包括可能收斂至局部極值、訓練時間較長及高方差。
來源:Hugging Face Blog · huggingface.co