音声認識モデルWhisperをオープンソース公開
OpenAIが音声認識モデル「Whisper」をオープンソースで公開した。Webから収集した68万時間の多言語・マルチタスクの教師ありデータで学習したエンコーダ・デコーダ型Transformerで、英語音声認識で人間に近い頑健性と精度に到達。多言語の文字起こしと英語への翻訳にも対応する。商用API中心の路線を取っていた同社がモデルと推論コードを公開した点でも注目された。
2件
OpenAIがWhisperを配り、DALL·E 2の順番待ちも消える
21日、OpenAIが音声認識モデルWhisperをオープンソースで公開。ウェブから集めた68万時間の音声で学習し、多言語の書き起こしと英語への翻訳に対応する。商用APIを軸にしてきた同社が、モデルと推論コードをそのまま配った。
28日にはDALL·E 2のウェイトリストを撤廃。誰でも登録すれば使えるようになる。
8月に公開されたStable Diffusionが広がり、画像生成は自分のPCで動かすものになりつつあった。
このブロックは編集部が書いた総括です。出典付きの記録とは分けて表示しています。
OpenAIが音声認識モデル「Whisper」をオープンソースで公開した。Webから収集した68万時間の多言語・マルチタスクの教師ありデータで学習したエンコーダ・デコーダ型Transformerで、英語音声認識で人間に近い頑健性と精度に到達。多言語の文字起こしと英語への翻訳にも対応する。商用API中心の路線を取っていた同社がモデルと推論コードを公開した点でも注目された。
OpenAIがDALL·E 2のウェイトリストを撤廃し、新規ユーザーが登録後すぐ利用できるようにした。この時点で150万人超のアクティブユーザーが1日200万枚超の画像を生成し、10万人超がDiscordコミュニティで作品や意見を共有していた。段階的デプロイで安全対策を検証しながら対象を広げる同社の方針が、4月の限定プレビューから約半年で全面開放に至った。