07.12.2023
Google Gemini は、57 の被験者からの知識を統合して問題を解決し、専門家レベルで人間を超える初の AI です。
12月6日の夜に発売されたGeminiは、Googleのこれまでで最も先進的かつ汎用的なAIモデルで、OpenAIのGPT-4と競合する。
最近人気のある他の大規模言語モデルとは異なり、Gemini はマルチモーダルな方向で構築されており、テキスト、コード、オーディオ、画像、ビデオなどのさまざまな種類の情報を一般化、操作、結合できます。
Googleは、データセンターからモバイルデバイスまで柔軟な使用ニーズに応えるため、Gemini 1.0はGemini Ultra、Gemini Pro、Gemini Nanoの3つの異なるサイズで提供されると述べた。このうち、Gemini Ultra は最大サイズで最も強力なモデルです。

Google が公開したテスト結果によると、Gemini Ultra は大規模マルチタスク言語理解 (MMLU) テストで 90% のスコアを獲得しました。このモデルは、数学、物理学、歴史、法律、医学、倫理など 57 科目を組み合わせて世界知識と問題解決能力の両方をテストするもので、「難しい質問に答える前に、より慎重に考える能力を発揮する」ことができます。
この結果により、Gemini は同じテストで 89.8% を獲得し、エキスパート レベルで人間を超えた最初の AI となりました。 GPT-4 の結果は 87%、LLAMA-2 は 68%、Anthropic の Claude 2 は 78.5% に達しました。
さらに、この最強バージョンの Gemini は、主要な言語モデリングの研究開発において 32 のベンチマークのうち 30 を上回り、熟考的な推論を必要とするさまざまなドメインにまたがるマルチモーダルなタスクをカバーする MMMU (大規模マルチモーダル学際的理解) 機能で 59.4% のスコアを獲得しました。
Google DeepMind の CEO であり、Gemini チームの代表であるデミス・ハサビス氏は、同社は世界を認識し、世界と対話する人間の方法にインスピレーションを得た新世代の AI モデルを構築したいと述べました。そのおかげで、AI は単なるスマート ソフトウェアにとどまらず、より便利で直感的な、ユーザーのパートナーのような存在になるでしょう。
「本日、Google がこれまでに開発した最も先進的で汎用的な AI モデルである Gemini を導入することで、このビジョンに一歩近づいています」とハサビス氏は述べています。
Googleによると、Gemini 1.0は優れたパフォーマンスに加えて、テキスト、画像、音声などを同時に認識するように訓練されており、微妙な情報をよりよく理解し、複雑なトピックに関連する質問に答えることができるという。このモデルは、Python、Java、C++、Golang などの今日の人気のあるプログラミング言語で解釈してコーディングすることもできます。

Google によると、これらの機能は、Gemini が数十万の文書を読み取って情報を抽出するのに役立ち、それによって科学から金融に至るまで、多くの分野で短期間に新たなブレークスルーを生み出す可能性を切り開きます。
Googleは発表会で、Gemini Ultraバージョンは最も複雑なタスクに対応したバージョンであり、正式発売前に安全性テストを完了する段階にあると述べた。 Gemini Nano は、モバイル デバイスで実行されるタスク向けのバージョンで、Pixel 8 Pro に搭載されます。その時点で、携帯電話には、録音コンテンツの要約や Gboard キーボードでのスマート リプライなどの追加機能が追加される予定です。これら 2 つの Gemini バージョンは来年市場に投入される予定です。
一方、Pro バージョンは Bard チャットボットで使用されるようになりました。ユーザーは、読解力、要約力、推論力、プログラミング力、計画力などのさまざまな要件を通じて変化を体験できます。
これは、Bard にとって発売以来最大のアップグレードでもあります。ただし、Bard は現在英語のみをサポートし、180 の国と地域で使用できる Gemini Pro を使用しています。 Googleは、近い将来Bard向けの言語を拡張すると述べた。来年、Bard はアップグレードされ、Gemini Ultra の最も強力なバージョンを使用する予定です。
ルー・クイ – VnExpress