OpenAIのジョン・シュルマンらが強化学習アルゴリズムProximal Policy Optimization(PPO)を論文と実装とともに公開した。従来手法と同等以上の性能を保ちながら実装と調整が大幅に簡単で、発表時点でOpenAI社内の標準アルゴリズムになっていた。その後も強化学習の定番手法として広く普及し、後にRLHFによる言語モデルの調整でも中核的な役割を果たした。
202017年7月
研究確認済み
強化学習アルゴリズムPPOを発表
関係者
タグ
- reinforcement-learning
- open-source