谷歌深夜放大招!最强大模型Gemini能打败GPT4吗?
今早我梦醒了坎
发表于 2023-12-7 10:52:04
247
0
0
当人类拿起画笔在一张纸上勾勒出一只鸭子,并为它涂上了蓝色。这次AI说道:“这可不是鸭子常见的颜色。”
三个空杯并排放在桌子上,一张蓝色纸团被塞进其中一个杯子里,在人类一番眼花缭乱的操作后,AI准确地猜出:“纸团在最左边的杯子里!”
“喂”给AI一张手写的物理题,它不仅能看懂,而且还能分辨手写答案的对错,并且给出解释出一步一步解决问题的细节。
上传食材图像和语音输入,AI不仅可以指导你做菜,还能在不同阶段提出相应的建议。
这些片段,是Google演示其在12月6日最新出炉的AI大模型Gemini的场景。
“我们离新一代人工智能模型的愿景越来越近了。”进行完一系列视频演示后,Google DeepMind产品副总裁Eli Collins(伊莱·柯林斯)对包括第一财经在内的媒体说,这是Google迄今为止功能最强大、最通用的大模型。
和市面上现有大模型相比,Gemini从一开始就被创建为多模态的模型,这意味着它可以归纳并流畅地理解、操作以及组合不同类型的信息,包括文本、代码、音频、图像和视频。在灵活度上,从数据中心到移动设备上,它都能够运行。
Gemini被视作是Google在AI大模型领域放出的“大招”。多年前,Google凭借AlphaGo的惊艳表现在全球掀起了一波AI浪潮。但这一次,在OpenAI的ChatGPT所引发的AI新浪潮中,Google面临不小的压力。眼下,Google迫切需要一款现象级AI产品,证明自己在人工智能领域的实力。
能打败GPT4吗?
就在Google发布最新大模型之前,微软刚刚宣布了旗下AI助手Copilot重大升级,将接入OpenAI的最新模型GPT-4 Turbo。
“迟到总比不做好!终于有了OpenAI王座的有力竞争者。”在Google公布消息后,英伟达AI科学家Jim Fan(范麟熙)就第一时间转发并评论。
Google CEO Sundar Pichai(桑达尔·皮查伊) 评价,Gemini这一新时代的模型代表了Google作为一家公司在科学和工程方面所做的最大努力之一。他同时提到,这也是Google今年早些时候成立 Google DeepMind 时的愿景首次实现。
今年4月,或许是感受到了 OpenAI 联手微软带来的挑战,以及为了加速实现通用人工智能(AGI)的目标,Google将曾经诞生了Tensorflow与Transformer 的Google Brain 团队,和凭借AlphaGo掀起上一轮AI热潮、创造了AlphaFold预测蛋白质折叠的DeepMind 团队合并,成立 Google DeepMind,这一团队也被外界调侃是“AI复仇者联盟”。原Google AI产品负责人Eli Collins就是在那时开始担任起新团队的产品副总裁。
今日Google Deepmind发布第一个版本 Gemini 1.0 ,针对不同尺寸进行了优化,分别是Ultra、Pro 和 Nano。其中Gemini Ultra是目前Google规模最大、功能最强大的模型,适用于高度复杂的任务;Gemini Pro是适用于可扩展各种任务的模型;Gemini Nano主要是端侧设备上的模型。
Gemini发布后,外界最关心的是其对OpenAI GPT4的挑战。在采访中,记者提问Eli Collins :“Gemini能打败市面上包括GPT4在内所有的大模型吗?”
Eli Collins在回答中表示,团队一直在对 Gemini 模型进行严格的测试并评估其在各种任务中的性能。从自然图像、音频和视频理解到数学推理,在被大型语言模型(LLM)研究和开发中广泛使用的 32 项学术基准中,Gemini Ultra 的性能有 30 项都超过了目前最先进的水平。
他援引了来自MMLU的测试结果,称Gemini Ultra 的得分率为 90%,是第一个在 MMLU测试中超过人类专家的模型,MMLU 综合使用了数学、物理、历史、法律、医学和伦理等 57 个科目,用于测试世界知识和解决问题的能力。作为对比,人类专家的得分率为89.8%,GPT4得分率为86.4%。
在多模态方面,Gemini Ultra在新的MMMU基准测试中也获得了59.4%的SOTA分数。这项基准测试是由跨不同领域的多模式任务组成,需要大模型进行一个深思熟虑的推理过程。
Goolge Gemini大模型多模态背后的技术原理也引发业界关注。Goolge DeepMind首席科学家杰夫·迪恩团队为此撰写了60页技术报告来阐述。
到目前为止,创建多模态模型的标准方法是分别训练不同模态的组件,然后将它们拼接在一起,以粗略模拟某些功能。这些模型有时可以很好地完成描述图像等特定任务,但在概念性更强、更复杂的推理方面却显得力不从心。
据DeepMind CEO Demis Hassabis(戴密斯·哈萨比斯)透露,团队将 Gemini 设计为原生多模态,从一开始就在不同模态上进行预训练。然后,利用额外的多模态数据对其进行微调,以进一步提高其有效性。这有助于 Gemini 从最初阶段就能对输入的各种内容顺畅地进行理解和推理,并优于现有的多模态模型。
复杂的多模态推理能力能够帮助理解复杂的书面和视觉信息。这使得它可以在海量的数据中发掘难以辨别的知识内容,回答与复杂主题相关的问题,尤其擅长解释数学和物理等复杂科目中的推理。
以解题为例,利用Gemini的多模态推理能力,AI能够读懂字迹凌乱的手写内容,正确理解问题的表述,还能够把问题和解决方案都转换为数字排版,识别出人类在解决问题时出错的具体推理步骤,并一步步给出问题的正确解决方案。
此外,它拥有通过阅读、过滤以及理解信息,从数十万份文件中提取数据集和观点的能力,有助于在从科学到金融等多个领域以数字化速度实现新的突破。
而在Gemini多模态大模型的背后,是由 Google 自研的云芯片 TPUs v4 和 v5e 在通过 AI 优化过的基础设施上,对 Gemini 1.0 进行大规模训练。
当天,Google还发布了最新的 TPU 系统 Cloud TPU v5p,称训练速度比前代快2.8倍,有望帮助开发者和企业客户更快地训练大规模生成式 AI 模型。
应用层比拼刚刚开始
目前看起来,在“跑分”上Google Gemini更胜一筹,但接下来,更重要的是各家大模型在实际应用中的比拼。
Eli Collins 在接受第一财经等媒体采访时说,Google希望建立新一代AI模型,它是由人们对世界的理解和互动而激发的,人工智能更像是一个乐于助人的合作者,而不像是一个聪明的软件。
目前,Google旗下的聊天机器人Bard已经集成Gemini Pro的微调版本,在170多个国家和地区提供英语服务,并且计划在未来几个月内扩展不同的模态,并支持新的语言和地区。明年年初,Google还将推出Bard Advanced,提供Gemini Ultra模型的最佳性能。
在移动设备端,Google的Pixel 8 Pro成为首款搭载Gemini Nano的智能手机,它可以支持录音总结、智能回复等AI功能,明年还将推出更多信息应用。
基于定制版的Gemini,谷歌推出了代码生成系统AlphaCode 2。Google称,在面对不仅涉及编程,还涉及复杂的数学和计算机科学理论等领域的问题时,AlphaCode 2都表现出了卓越的性能。
未来几个月,Gemini 将应用于Google更多的产品和服务,如 Search、Ads、Chrome 和 Duet AI。
据透露,Google已经开始在 Search 中试验 Gemini,它能够为用户提供更快的搜索生成体验(SGE),用户在美国的英语搜索延迟降低了 40%,同时在质量方面也有所提高。
而对于Google采取哪些努力来防止Gemini产生幻觉和事实错误,或被用来创造危险的工具和其他不道德的用途,Google方面人士也对记者进行了解答。
Google基础设施与系统副总裁Amin Vahdat(阿明·瓦达特)对记者表示,Gemini在开发的各个阶段都会考虑潜在的风险,并努力进行测试和降低这些风险。
他透露,Gemini的安全评估包括偏见和毒性评估,并应用了 Google Research 的对抗性测试技术,帮助在部署 Gemini 之前检测关键的安全问题。
例如,为了在 Gemini 的训练阶段诊断内容安全问题,并确保其输出符合政策,Google团队使用了一些基准测试,例如真实毒性提示(Real Toxicity Prompts),这是一套由 Allen Institute of AI 的专家开发的基准测试,包含了从网络上提取的 10 万条具有不同程度毒性的提示。
此外,为了减少伤害,团队还构建了专门的安全分类器来识别、标记和筛选涉及暴力或负面刻板印象等方面的内容。“此外,我们正继续解决模型面临的已知挑战,例如事实性、基础、归因性以及协作性。”
Google没有透露未来是否会专门为Gemini定制应用程序,但高管对记者表示,更加希望看到用户在这种技术的基础上创建更多的应用程序。
Google透露,从 12 月 13 日开始,开发者和企业客户可以通过 Google AI Studio 或Google Cloud Vertex AI中的 Gemini API 获取 Gemini Pro。
目前Google正对 Gemini Ultra 完成大规模的信任和安全检查,包括由可信赖的外部团队进行红队测试,并在其被广泛应用前通过微调和人类反馈强化学习(RLHF)进一步完善模型。在这一过程中,Google 将向部分客户、开发者、合作伙伴以及安全和责任专家提供 Gemini Ultra,以供其进行早期试验和提供反馈。
据记者了解,Google将在明年初向开发者和企业客户提供该模型。
CandyLake.com is an information publishing platform and only provides information storage space services.
Disclaimer: The views expressed in this article are those of the author only, this article does not represent the position of CandyLake.com, and does not constitute advice, please treat with caution.
Disclaimer: The views expressed in this article are those of the author only, this article does not represent the position of CandyLake.com, and does not constitute advice, please treat with caution.