OpenAIのアレック・ラドフォードらが、論文「Improving Language Understanding by Generative Pre-Training」で後にGPT-1と呼ばれる初代GPTを発表した。Transformerを大量のテキストで教師なし事前学習(次の単語予測)し、少量の教師ありデータでファインチューニングする2段階の手法により、含意関係認識・常識推論・読解など多様な言語理解タスクで最高水準の結果を達成した。モデルとコードも公開された。GPTという名前が付いた最初のモデルである。