OpenAIがDeepMindの安全性チームとの共同研究として、論文「Deep reinforcement learning from human preferences」を発表した。人間が2つの行動のどちらが良いかを選ぶだけでエージェントが目標を推定して学習する手法で、約900回のフィードバックでバク宙を学習させるデモを示した。人間のフィードバックによる強化学習(RLHF)の初期の論文で、報酬を書き下しにくい課題を人間の選好で置き換える手法として示された。
132017年6月
研究確認済み
人間の選好から学ぶ強化学習の研究を発表
関係者
タグ
- rlhf
- reinforcement-learning
- safety