07.12.2023
Google Gemini 综合 57 个学科的知识来解决问题,是第一个在专家水平上超越人类的人工智能。
Gemini于12月6日晚推出,是谷歌迄今为止最先进、最通用的AI模型,与OpenAI的GPT-4竞争。
与近年来其他流行的大型语言模型不同,Gemini 是朝着多模态方向构建的,这意味着它可以对文本、代码、音频、图像和视频等多种不同类型的信息进行泛化、操作和组合。
为了满足从数据中心到移动设备的灵活使用需求,谷歌表示Gemini 1.0将提供三种不同尺寸,包括:Gemini Ultra、Gemini Pro和Gemini Nano。其中,Gemini Ultra 是尺寸最大、功能最强大的型号。

根据谷歌公布的测试结果,Gemini Ultra 在大规模多任务语言理解(MMLU)测试中得分达到 90%。该模型综合运用了数学、物理、历史、法学、医学、伦理学等57门学科,既测试了世界知识,又测试了解决问题的能力,并且可以“在回答难题之前使用更仔细的思考能力”。
凭借这一结果,Gemini 成为第一个在专家级别超越人类的人工智能,在同一测试中得分为 89.8%。 GPT-4的结果为87%,LLAMA-2达到68%,Anthropic的Claude 2达到78.5%。
此外,Gemini的最强版本在主要语言模型研发的32个基准中也超过了30个,MMMU(大规模多模态跨学科理解)能力得分达到59.4%,涵盖了跨越不同领域、需要深思熟虑推理的多模态任务。
谷歌DeepMind首席执行官、Gemini团队代表Demis Hassabis表示,该公司希望以人类认知和与世界互动的方式为灵感,构建新一代人工智能模型。正因为如此,人工智能将不再只是智能软件,而是变得更加有用和直观,就像用户的合作伙伴一样。
Hassabis 表示:“今天,我们通过推出 Gemini,谷歌有史以来开发的最先进、最通用的人工智能模型,距离这一愿景又近了一步。”
谷歌表示,除了强大的性能之外,Gemini 1.0还经过训练,可以同时识别文本、图像、声音等,帮助其更好地理解微妙的信息并回答与复杂主题相关的问题。该模型也可以用当今流行的编程语言(例如Python、Java、C++和Golang)进行解释和编码。

据谷歌介绍,这些功能帮助 Gemini 从数十万份文档中读取和提取信息,从而开启了在短时间内在从科学到金融等许多领域创造新突破的能力。
发布会上,谷歌表示Gemini Ultra版本是承担最复杂任务的版本,正在完成正式发布前的安全测试。 Gemini Nano 是一个用于在移动设备上执行任务的版本,该版本将配备在 Pixel 8 Pro 上。届时,该手机将拥有一些额外的功能,例如总结录音内容和Gboard键盘上的智能回复等。这两个 Gemini 版本将于明年上市。
同时,专业版现已用于 Bard 聊天机器人。用户可以通过多项阅读理解、总结、推理、编程和规划要求来体验变化。
这也是巴德自推出以来最大的一次升级。不过,巴德使用的Gemini Pro目前仅支持英语,可在180个国家和地区使用。谷歌表示将在不久的将来扩展 Bard 的语言。明年,巴德将升级并使用最强大的Gemini Ultra版本。
Luu Quy – VnExpress