27.03.2025
OpenAI は、ChatGPT 機能の画像を統合し、ユーザーが GPT-4o モデルの機能を通じてチャットボット内で直接画像を作成できるようにします。
OpenAIは3月26日、ChatGPTの画像の初期リリースは主に画像の作成に焦点を当てており、Plus、Pro、Team、または無料のサブスクリプションパッケージのユーザーが使用できると述べた。以前は、ChatGPT では写真の作成が可能でしたが、Dall-E モデルを使用していたため、機能が制限され、1 日あたり 3 枚の無料写真しか許可されませんでした。
ソーシャル ネットワークでは、多くの人がそれを試し、新しいツールについて驚きの声を上げました。 Facebookアカウントのホアン・ヴィさんは、「本物そっくりの画像に驚いた。これがAI写真だという注意書きがなかったら、おそらく気付かなかったでしょう。その品質は、私がこれまでに経験した画像作成ツールよりも優れています」と語った。 Cong Tamのアカウントは「近い将来、オンラインで見る画像は本物ではなくなるかもしれない」と述べ、一方The Haのアカウントは「グラフィックデザイナーや写真編集者はAIを使えるようにアップグレードする必要があるかもしれない。そうしなければ職を失うかもしれない」とコメントした。

ザ・ヴァージ OpenAIの広報担当タヤ・クリスチャンソン氏の言葉を引用すると、無料版の機能は限られているものの、それでもDall-Eを上回るパフォーマンスを発揮するとのこと。
「新機能は以前のモデルと比較して大きな進歩です」と主任研究員のガブリエル・ゴー氏は述べ、彼のチームがChatGPTのイメージング機能にOpenAIの最も強力な言語モデルの1つであるマルチモーダルプラットフォームGPT-4oを使用したと付け加えた。
Goh 氏によると、GPT-4o を使用した ChatGPT の画像生成機能の顕著な改善は「バインディング」と呼ばれています。これは、AI 画像ジェネレーターがプロパティとオブジェクト間の正確な関連付けを維持する度合いを指す用語です。たとえば、青い星と赤い三角形のプロンプトが表示された場合、位置合わせが不十分なパターンでは、三角形なしで赤い星のみが生成されます。 Goh 氏によると、ほとんどの画像モデルはこれに苦労しており、一度に複数のリクエストを受け取ると色や形が混同されることがよくあります。
「バインディングを備えた新しい視覚化エンジンは、混乱することなく 15 ~ 20 個のオブジェクトの属性を正確にバインドできるため、精度と信頼性が大幅に向上していることがわかります」と Goh 氏は述べています。
ChatGPT の画像ジェネレーターは、画像内のテキストの表示も改善し、より一貫性があり、「歪み」のないテキストを作成するのに役立ちます。 Goh 氏によると、これも大きな課題です。タイトルやテキスト要素にエラーがあると、画像全体が使用できなくなるからです。
さらに、新しいツールは、ほとんどのイメージャで使用される拡散モデリング技術の代わりに、テキストを書くのと同じように、左から右、上から下に画像を順番に作成する自動回帰手法を使用します。この技術的な違いにより、ChatGPT の画像は、画像内のテキストをより適切にレンダリングおよびリンクできるようになります。
「これは反復的なプロセスであり、完成するまでに何か月もかかります」と Goh 氏は強調しました。同氏は、完璧ではないものの、ChatGPTの画像作成機能は「作成された製品の品質が使用できるレベルに達している」と付け加えた。
新しい機能のデモで、OpenAI は、ChatGPT のシームレスなイメージング機能を示すいくつかの例を示します。たとえば、正確にラベル付けされた色成分を使用したニュートン プリズム実験の科学図などです。一貫したキャラクターと吹き出しを備えた複数コマの漫画。またはステッカー、ロゴ、レストランのメニューの透明な背景。

ただし、他のモデルと比較して、ChatGPT の画像は画像の作成に時間がかかります。 ChatGPT のマルチモーダル プロダクト マネージャーである Jackie Shannon 氏によると、これは「価値のあるトレードオフ」です。
「待ち時間は確実に改善しますが、既存の画像生成機能と、生成される画像の品質によって、余分な待ち時間を補うことができます」とシャノン氏はブログに書いた。
偽のヌード写真を作成するリスクについて…シャノン氏は、ChatGPTの画像には強力な保護機能があり、ポルノディープフェイクコンテンツを防ぎ、「不正な」リクエストを拒否すると述べたが、詳細については言及しなかった。生成された画像には、C2PA 標準メタデータも統合され、AI によって作成されたものとしてマークされ、検出ツールで検索できます。
「もちろん、完璧なシステムはありませんが、私たちは保護を継続的に改善しています」とシャノン氏は付け加えました。
バオラム (The Verge、TechCrunch による)