2021年

1月

1件

編集部の総括

文章から絵を作るDALL·E、見せるが渡さない構え

5日、OpenAIがDALL·EとCLIPを同時に発表。DALL·Eは文章から画像を作り、CLIPは画像と文章を同じ空間に置いて結びつける。「アボカドの形をした肘掛け椅子」の生成例が広く引用された。

DALL·Eはモデルを配らず、選んだ例を見せるにとどめている。GPT-3のときと同じく、作れることは示すが手渡さないという構えだった。

このブロックは編集部が書いた総括です。出典付きの記録とは分けて表示しています。

記録1件
  1. 5
    研究OpenAI / アディティア・ラメシュ / アレック・ラドフォード / イリヤ・サツケバー

    画像生成モデルDALL·Eと画像認識モデルCLIPを発表

    OpenAIがテキストから画像を生成するDALL·Eと、自然言語の教師信号から視覚概念を学習するCLIPを同日に発表した。DALL·EはGPT-3の120億パラメータ版をテキストと画像のペアで学習させたモデルで、「アボカド型のアームチェア」のような言語表現から画像を生成できることを示した。CLIPは分類したいカテゴリ名を与えるだけでゼロショットの画像分類ができる。言語モデルの手法を視覚の領域へ持ち込んだ2つの成果で、テキストと画像を同じ枠組みで扱えることを示している。