OpenAIが、人間のフィードバックによる強化学習(RLHF)でGPT-3を指示追従向けにファインチューニングした「InstructGPT」を発表し、APIのデフォルト言語モデルとして展開した。評価者は13億パラメータのInstructGPTの出力を、100倍以上大きい1750億パラメータのGPT-3の出力より好むと判定。アラインメント研究の初の大規模な実運用化であり、同年末のChatGPTの技術的土台となった。