画像生成モデルDALL·Eと画像認識モデルCLIPを発表
OpenAIがテキストから画像を生成するDALL·Eと、自然言語の教師信号から視覚概念を学習するCLIPを同日に発表した。DALL·EはGPT-3の120億パラメータ版をテキストと画像のペアで学習させたモデルで、「アボカド型のアームチェア」のような言語表現から画像を生成できることを示した。CLIPは分類したいカテゴリ名を与えるだけでゼロショットの画像分類ができる。言語モデルの手法を視覚の領域へ持ち込んだ2つの成果で、テキストと画像を同じ枠組みで扱えることを示している。