OpenAIのジャレッド・カプラン、サム・マキャンドリッシュらが論文「Scaling Laws for Neural Language Models」をarXivに公開した。言語モデルの損失がモデルサイズ・データセットサイズ・計算量に対してべき乗則に従って改善することを、7桁以上に及ぶ範囲で実証。より大きなモデルほどサンプル効率が高いことも示し、「大きく作るほど良くなる」という経験則に定量的な根拠を与えた。この知見が同年のGPT-3をはじめとする大規模化路線を理論面で支えた。
OpenAIのジャレッド・カプラン、サム・マキャンドリッシュらが論文「Scaling Laws for Neural Language Models」をarXivに公開した。言語モデルの損失がモデルサイズ・データセットサイズ・計算量に対してべき乗則に従って改善することを、7桁以上に及ぶ範囲で実証。より大きなモデルほどサンプル効率が高いことも示し、「大きく作るほど良くなる」という経験則に定量的な根拠を与えた。この知見が同年のGPT-3をはじめとする大規模化路線を理論面で支えた。