跳到正文
原文
Hugging Face Blog·· 2022-08-05AI 評分56

PPO(近端策略優化)原理與 PyTorch 實作教程

Proximal Policy Optimization (PPO)

AI 導讀

Hugging Face 深度強化學習課程第 8 單元講解 PPO(近端策略優化),説明其透過裁剪策略概率比限制更新幅度,以提升訓練穩定性。文章介紹裁剪替代目標函數,並以 PyTorch 從零實作 PPO,在 CartPole-v1 和 LunarLander-v2 測試;示例裁剪範圍為 [0.8,1.2](ϵ=0.2)。

來源:Hugging Face Blog · huggingface.co