Gemini:一个非常有能力的多模式模式
的家庭
Gemin i 小 组 , 我 是
Google1
本 报 告 介 绍 了 一 个 新 的 多 模 式 模 型 家 族 , Ge mini , 它 在 图 像 、 音 频 、 视 频 和 文 本 理 解 方 面 表 现 出 卓 越 的 能 力 。Ge mini 系 列 包 括 U ltr a 、 Pro 和 N a no 尺
寸,适用于从复杂推理任务到设备 上内存受限用例的应用。 对 广 泛 基准 测 试 的 评 估 表 明 , 我 们 最 强 大 的 Ge miniU ltr
a 模 型 在 32 个 基 准 测 试 中 的 30 个 中 都 达 到 了 最 先 进 的 水 平 — — 值 得 注 意 的 是 , 它 是 第 一 个 在 经 过 充 分 研 究 的
考 试 基 准 M ML U 上 达 到 人 类 专 家 性 能 的 模 型 , 并 且 在 我 们 测 试的 20 个 多 模 式 基 准 测 试 中 都 提 高 了 最 先 进 的 水 平 。 我 们 相 信 , Ge
mini 模 型 在 跨 模 态 推 理 和 语 言 理 解 方 面 的 新 功能将支持 各 种 各 样 的 用 例 , 我 们 将 讨 论 如 何 负 责 任 地 向 用 户 部 署 它 们 。
1.介绍
我们现在展示 Gemini,一个由谷歌开发的高性能多模式模型家族。我们通过图像、音频、视频和文
本数据对 Gemini 进行联合训练,目的是建立一个模型,该模型既具有跨模式的强大通才能力, 又具有
在每个各自领域的尖端理解和推理性能。
Gemini 是我们的第一个版本,有三种尺寸:Ultra 用于高度复杂的任务,Pro 用于增强性能和大
规模部署能力,Nano 用于设备上的应用。每个尺寸都是专门定制的,以解决不同的计算限制和应用需
求。我们在一套全面的内部和外部基准上评估 Gemini 模型的性能,这些基准涵盖了广泛的语言、编
码、推理和多模态任务。
Gemini 在大规模语言建模方面取得了最新进展(Anil 等人,2023;Brown 等人,2020;Chowdhery 等
,2023;霍夫曼等, 2022 年 ;OpenAI, 2023;Radford 等人, 2019;Rae 等人,2021),图像理解(Alayrac
等人,2022;Chen 等人,2022;Dosovitskiy 等,2020;OpenAI, 2023 b;里德等,2022;Yu 等人, 2022a) ,
音 频 处 理 (Radford 等 人 ,2023;Zhang 等 人 , 2023) , 以及视频理解(Alayrac 等 人 ,
2022;Chen 等,2023)。它还建立在序列模型(Sutskever et al., 2014)、基于神经网络的深度学习的长
期工作历史(LeCun et al., 2015)和机器学习分布式系统(Barham et al., 2022;Bradbury 等人, 2018
年;Dean et al., 2012),使大规模训练成为可能。
我们最强大的模型 Gemini Ultra 在我们报告的 32 个基准测试中的 30 个中取得了最先进的新结果
,包括 12 个流行文本和推理基准测试中的 10 个,9 个图像理解基准测试中的 9 个,6 个视频理
解基准测试中的 6 个,以及 5 个语音识别和语音翻译基准测试中的 5 个。Gemini Ultra 是第一个在
MMLU 上实现人类专家性能的模型(hendricks 等人,2021a)——一个通过一系列考试测试知识和推理
的著名基准——得分超过 90%。除了文本,GeminiUltra 在挑战多模态推理任务方面取得了显著进展
。例如,在最近的 MMMU 基准测试(Yue et al., 2023)中,它包含了关于需要大学水平学科的多学科任
务中的图像的问题
1 完整的作者列表见投稿和致谢部分。请发送信件到 gemini-1- report@
©2023 谷歌版权所有
知识和深思熟虑的推理,GeminiUltra 达到了新的最先进的得分 %,比之前的最佳模型高出5
个百分点以上。它为视频问答和音频理解基准提供了统一的性能提升。
定性评估展示了令人印象深刻的跨模态推理能力,使模型能够对输入的音频、图像和文本序列 进
行原生的理解和推理(见图 5 和表 13)。考虑将图 1 中描述的教育环境作为一个例子。一个老师画了一个
滑雪者下斜坡的物理问题,一个学生解决了这个问题。利用 Gemini 的多模态推理能力,该模型能够理
解杂乱的笔迹,正确理解问题的表述,将问题和解决方案转换为数学排版,识别学生在 解决问题时出错的
具体推理步骤,然后给出一个经过处理的正确解决问题的方法。这开辟了令人兴 奋的教育可能性,我们相
信 Gemini 模型的新多模态和推理能力在许多领域都有巨大的应用。
图 1 |验证一个学生对物理问题的解决方案。该模型能够正确识别所有手写内容并验证推理。在理解图
像中的文本的基础上,它需要理解问题设置并正确遵循指令来生成LATEX。
大型语言模型的推理能力显示出了构建能够处理更复杂多步骤问题的多面手智能体的希望。
AlphaCode 团队构建了 AlphaCode 2 (Leblond 等人,2023 年),这是一个新的双子座驱动的代理,
它 将 Gemini 的推理能力与搜索和工具使用相结合,在解决竞争性编程问题方面表现出色。在
Codeforces 竞争性编程平台上,AlphaCode 2 在进入者中排名前 15%,比前 50%的最先进的前身有
了很大的改进(Li et al., 2022)。
2
与此同时,我们通过 Gemini Nano 推进了效率的前沿,这是一系列针对设备部署的小型模型。这
些模型在设备上的任务中表现出色,如摘要、阅读理解、文本补全任务,并相对于其规模,在 推理
、STEM、编码、多模态和多语言任务中表现出令人印象深刻的能力。
在接下来的章节中,我们首先提供了模型架构、训练基础设施和训练数据集的概述。然后,我 们
对 Gemini 模型家族进行了详细的评估,涵盖了经过充分研究的基准和人类偏好评估,包括文本、代码、
图像、音频和视频——包括英语表现和多语言能力。我们还讨论了负责任部署的方法,2 包括在部署决
定之前进行影响评估、制定模型政策、评估和减轻危害的过程。最后,我们讨论了Gemini 更广泛的
影响,它的局限性以及它的潜在应用——为人工智能研究和创新的新时代铺平了道路。
2.模 型 架 构
Gemini 模型建立在 Transformer 解码器(Vaswani 等人,2017)之上,通过架构和模型优化的改进得到
增强,以实现大规模的稳定训练,并在 Google 的张量处理单元上优化推理。它们经过训练以支持
32k 上下文长度,采用高效的注意力机制(例如,多查询注意力(Shazeer, 2019))。我们的第一个版本
,Gemini ,包括三种主要尺寸,以支持广泛的应用程序,如表 1 所示。
表 1 | 模型家族概述
Gemini 模型经过训练,可以适应文本输入与各种各样的音频和视觉输入交织在一起,比如自然图像
、图表、截图、pdf 和视频,它们可以产生文本和图像输出(见图 2)。Gemini 模型的视觉编码灵感来自
我们自己在 Flamingo (Alayrac 等人,2022)、CoCa (Yu 等人,2022a)和 PaLI (Chen 等人, 2022)上的基
础工作。有一个重要的区别,即模型从一开始就是多模态的,并且可以使用离散的图 像标记原生输出
图像(Ramesh et al., 2021;Yu et al., 2022b)。
视频理解是通过将视频编码为大上下文窗口中的一系列帧来完成的。视频帧或图像可以与文本 或音
频自然交错,作为模型输入的一部分。模型可以处理可变的输入分辨率,以便花费更多的计 算
我们计划在 GeminiUltra 模型全面上市之前更新这份报告,提供更多细节。
3
图 2 | Ge mini 支持文本、图像、音频和视频的交错序列作为输入(通过输入序列中不同颜色的标记来说明)。
它可以用交错的图像和文本输出响应。
需要细粒度理解的任务。此外,Gemini 可以直接从通用语音模型(USM) (Zhang et al., 2023)特征中摄
取 16kHz 的音频信号。这使得模型能够捕捉音频被天真地映射到文本输入时通常会丢失的细微差别(
例如,请参阅网站上的音频理解演示)。
训练 Gemini 系列模型需要在训练算法、数据集和基础设施方面进行创新。对于 Pro 模型,我们的基
础设施和学习算法的固有可扩展性使我们能够在几周内完成预训练,利用 Ultra 的一小部分资源。Nano
系列模型利用蒸馏和训练算法的额外进步,为各种任务(如摘要和阅读理解)生产一流的小型语言模型,
为我们的下一代设备体验提供动力。
3.培 训 基 础 设 施
我们使用 TPUv5e 和 TPUv4 (Jouppi 等人,2023)来训练 Gemini 模型,具体取决于它们的大小和配
置。GeminiUltra 训练中心在多个数据中心使用了大量的 TPUv4 加速器。这代表了我们之前的旗
舰型号 PaLM-2 的规模显着增加,这带来了新的基础设施挑战。加速器数量的增加会导致整个系统
中硬件的平均故障时间成比例地减少。我们最小化了计划重调度和抢占的比率,但由于宇宙 射线等
外部因素,在如此大规模的所有硬件加速器中,真正的机器故障是司空见惯的(Michalak et al.,
2012)。
T PUv4 加速器部署在 40 96 个芯片的“Sup erPod s ”中,每个芯片连接到一个专用的光开关, 它可以在大
约 10 秒内动态地将 4 x4x4 芯片立方体重新配置为任意 3D 环面拓扑(Jou pp i 等人,20 23 )。对于 Gemin
iUltra , 我们决定在每个超级舱中保留少量的立方体, 以允许热备用和滚动维护。
TPU 加速器主要通过高速芯片间互连进行通信,但在 GeminiUltra 规模下,我们使用谷歌的集群
内和集群间网络在多个数据中心中组合 SuperPods (Poutievski 等人,2022;Wetherall 等人,2023; 姚红
等,2018)。谷歌的
4
网络延迟和带宽足以支持常用的同步训练范式,利用superpods 内部的模型并行性和 superpods 之间
的数据并行性。
Jax (Brad bu ry e t a l.,2 018 )和 Pa th way s (Ba rha m e t a l.,202 2 )的“单控制器”编程模型允许单个Py
tho n 进程协调整个训练运行,极大地简化了开发工作流。XL A 编译器中的 GSP M D 分区器(Xu e t al.,
202 1 )对训练步长计算进行分区, Me ga Sca le XL A 编译器(XL A, 2 019 )通过静态调度适当的集合, 使它
们在步长时间变化很小的情况下最大限度地与计算重叠。
使用对持久集群存储的权重定期检查点的传统方法,在这种规模上保持一个高的 goodput3 at 是
不可能的。对于 Gemini,我们使用了模型状态的冗余内存副本,并且在任何计划外的硬件故障上,
我们可以直接从完整的模型副本中快速恢复。与 PaLM 和 PaLM-2 相比(Anil et al., 2023), 尽管使用
了更大的训练资源,但这在恢复时间上提供了显着的加速。因此,最大规模训练工作的 总体有效产
出从 85%增加到 97%。
空前规模的训练总是会出现新的有趣的系统故障模式——在这种情况下,我们需要解决的问 题
之一是“无声数据损坏(SDC)”(Dixit 等人,2021;Hochschild et al., 2021;Vishwanathan et al., 2015)。
虽然这种情况非常罕见,但 Gemini 的规模意味着我们可以预期 SDC 事件每隔一两个星期 就会影响训
练。快速检测和移除故障硬件需要几种新技术,利用确定性重放来隔离不正确的计算, 并结合空闲机
器和热备用上的主动 SDC 扫描仪。我们完全确定的基础设施使我们能够在 Ultra 模型的开发过程中快
速识别根本原因(包括硬件故障),这是稳定训练的关键因素。
4.训 练 数 据 集
Gemini 模型是在一个多模态和多语言的数据集上训练的。我们的预训练数据集使用来自网络文档、书
籍和代码的数据,包括图像、音频和视频数据。
我们使用 SentencePiece tokenizer (Kudo 和 Richardson, 2018),发现在整个训练语料库的大样本
上训练 tokenizer 可以提高推断的词汇表,并随后提高模型性能。例如,我们发现 Gemini 模型可
以有效地标记非拉丁文字,这反过来又有利于模型质量以及训练和推理速度。
用于训练最大模型的 token 数量是按照 Hoffmann 等人(2022)的方法确定的。较小的模型被训练为
明显更多的 token,以提高给定推理预算的性能,类似于 Touvron 等人(2023a)提倡的方法。
将高质量过滤器应用于所有数据集,使用启发式规则和基于模型的分类器。我们还执行安全 过
滤,以删除有害内容。我们从训练语料库中过滤我们的评估集。最终的数据混合和权重是通过 较小
模型上的消融来确定的。我们分阶段训练以在训练期间改变混合组成-在训练结束时增加领域 相关
数据的权重。我们发现,数据质量对一个高性能的模型至关重要,并相信围绕寻找预训练的 最佳数
据集分布仍然存在许多有趣的问题。
3 我们将 goodput 定义为计算有用的新步骤所花费的时间除以训练工作经过的时间。
5
5.评价
Gemini 模型本身是多模态的,因为它们是通过文本、图像、音频和视频联合训练的。一个开放的
问题是,这种联合训练是否可以产生一个在每个域都具有强大能力的模型——即使与仅为单个 域量
身定制的模型和方法相比。我们发现情况就是这样:Gemini 在广泛的文本、图像、音频和视频基准
上树立了一个新的艺术状态。
. 文本
. 学 术 标 准
我们将 Gemini Pro 和 Ultra 与一套外部法学硕士和我们之前最好的型号 PaLM 2 进行了比较,涵盖 了
推理、阅读理解、STEM 和编码等一系列基于文本的学术基准。我们将这些结果报告在表 2 中。总体
而言,我们发现 Gemini Pro 的性能优于 等推理优化模型,并与市面上几种功能最强大的模
型相媲美,而 Gemini Ultra 的性能优于当前所有模型。在本节中,我们将检查其中的一些发现。
在 MMLU 上(Hendrycks 等人,2021a), Gemini Ultra 可以优于所有现有模型,达到 %的精
度。MMLU 是一个全面的考试基准,它衡量了 57 个科目的知识。人类专家的表现被基准作者衡量为
%,GeminiUltra 是第一个超过这个门槛的模型,之前最先进的结果为 %。要取得高性能,除
了阅读理解和推理外,还需要跨许多领域的专业知识(例如法律、生物学、历史等)。我们 发现,当与
考虑模型不确定性的思维链提示方法(Wei et al., 2022)结合使用时,GeminiUltra 可以达到最高的精
度。该模型用 k 个样本产生一个思维链,例如 8 或 32。如果有超过预设阈值的共识 (根据验证分割选
择),它就选择这个答案,否则它就恢复到一个基于最大似然选择的贪婪样本,而 不需要思维链。我们
请读者参考附录,详细分析了这种方法与仅采用思维链提示或仅采用贪婪抽 样的比较情况。
在数学这个通常用来测试模型分析能力的领域,GeminiUltra 在初级考试和竞赛级问题集中都表现
得很好。对于小学数学基准 GSM8K (Cobbe et al., 2021),我们发现 Gemini Ultra 在思维链提示和自我
一致性(Wang et al., 2022)的情况下达到 %的准确率,而之前使用相同提示技术的最佳准确率为
92%。从中学和高中数学竞赛(math 基准)中得出的难度增加的数学问题中也观察到类似的积极趋势,
Gemini Ultra 模型优于所有竞争对手模型,使用 4 次提示达到 %。该模型在来自美 国数学竞赛的更
困难的任务(2022 年和 2023 年的 150 道题)上的表现也超过了最先进的水平。较小的模型在这项具有挑
战性的任务中表现不佳,得分接近随机,但 Gemini Ultra 可以解决 32%的问题, 而 GPT-4 的解题率为
30%。
GeminiUltra 还擅长编码,这是当前法学硕士的一个流行用例。我们在许多常规和内部基准上
评估了该模型,并将其作为更复杂的推理系统(如 AlphaCode 2)的一部分来衡量其性能(参见关于复
杂推理系统的 节)。例如,在 HumanEval 上,一个将函数描述映射到 Python 实现的标准代码完
成基准(Chen et al., 2021),指令调优的 Gemini Ultra 正确实现了 %的问题。在python 代码生成
任务的新评估基准 Natural2Code 中,我们确保没有 web 泄漏,GeminiUltra 获得了 %的最高分数
。
6
表 2 | Gemini 在文本基准测试中的表现与外部比较和 Pa LM 2- l。∗ 该模型产生了一个 k = 8 或 32 个样本的思维链,如果
有一个高于阈值的共识(基于验证分割选择),它就选择这个答案,否则就恢复到一个贪婪的样本。进一步分析见附录 。
∗∗结果于2023 年11 月通过 A PI 自行收集。
∗∗∗所显示的结果使用 Tou vro n 等人(20 23b ) 报告中的净化数字作为与也经过净化的 G e m in i 模型最相关的比较。
对这些基准的评估具有挑战性,可能会受到数据污染的影响。我们在训练后进行了广泛的泄 露
数据分析,以确保我们在这里报告的结果尽可能科学合理,但仍然发现了一些次要问题,并决 定不
报告例如 LAMBADA 的结果(Paperno et al., 2016)。作为评估过程的一部分,在一个流行的基准
HellaSwag (Zellers 等人,2019)上,我们发现在特定网站提取物上额外的 100 个微调步骤对应于
HellaSwag 训练集(未包括在 Gemini 预训练集中),当使用 1 次提示进行测量时,Gemini Pro 的验证
精度提高到 %,Gemini Ultra 的验证精度提高到 %(我们测量的 GPT-4 在通过 API 进行 1 次
评估时获得了 %)。这表明,基准结果易受预训练数据集组成的影响。我们选择仅在10 次评估设
置中报告 HellaSwag 去污结果。我们认为有必要在没有泄露数据的情况下,制定更强大、更细致的
标准化评估基准。因此,我们在最近发布的几个新的评估数据集(如 WMT23 和Math-AMC 2022-
2023 问题)或从非网络来源(如 Natural2Code)内部生成的数据集上评估 Gemini 模型。我们请读者参
考附录以获取我们评估基准的全面列表。
7
即便如此,模型在这些基准上的表现为我们提供了模型能力的指示,以及它们可能在哪里对 现
实世界的任务产生影响。例如,GeminiUltra 令人印象深刻的推理能力和 STEM 能力为在教育领域 4
的法学硕士学位的进步铺平了道路。解决复杂数学和科学概念的能力为个性化学习和智能辅导系统
开辟了令人兴奋的可能性。
. 能 力 趋 势
我们调查了 Gemini 模型家族的能力趋势,通过在六种不同能力的 50 多个基准测试中对它们进行整体
评估,注意到在上一节中讨论了一些最值得注意的基准测试。这些能力是:涵盖开卷/闭卷检索 和问答任
务的“事实性”;“长上下文”涵盖长形式的摘要、检索和问答任务;“数学/科学”,包括 数学问题求解、定理
证明、科学考试等任务;需要算术、科学和常识推理的“推理”任务;以多种语 言进行翻译、总结和推理
的“多语言”任务。请参阅附录,了解每个能力所包含的详细任务列表。
图 3 |跨不同能力的 Gemini 模型族的语言理解和生成性能(由 Gemini Pro 模型规范化)。
我们在图 3 中观察到随着模型大小的增加, 质量得到了一致的提升,特别是在推理、数学/ 科学、摘要和长
上下文方面。Ge min iUltra 是所有六个功能的最佳模型。Ge min iPro 是 Ge min i 系列中的第二大型号,在服务
效率更高的同时也很有竞争力。
. Nano
为了使人工智能更接近用户,我们讨论了为设备上部署而设计的Gemini Nano 1 和 Nano 2 模型。这
些模型通过每个任务的微调,在摘要和阅读理解任务中表现出色。图 3 显示了这些预训练模型与更
大的 Gemini Pro 模型的性能对比,而表 3 则更深入地介绍了具体的事实、编码、数学/科学和推理
任务。Nano-1 和 Nano-2 模型尺寸分别只有 和 参数。尽管他们规模庞大,但他们在事实
性(即检索相关任务)方面表现出异常强劲的表现,在推理、STEM、编码、多模态和
参见网站 https://deepm gem ini 上的演示。
8
多语言的任务。随着新功能可被更广泛的平台和设备访问,Gemini 模型扩展了对每个人的可访问
性。
表 3 |与 GeminiPro 模型相比,GeminiNano 系列在事实、总结、推理、编码和 STEM 任务方面的表
现。
. Multilinguality
Gemini 模型的多语言能力是通过一组不同的任务来评估的,这些任务需要多语言理解、跨语言泛化
和多语言文本的生成。这些任务包括机器翻译基准测试 (用于高、中、低资源翻译的 WMT
23;Flores、NTREX(用于低资源语言和极低资源语言)、摘要基准测试(XLSum、Wikilingua)和通用
基准测试的翻译版本(MGSM:专业翻译成 11 种语言)。
机 器 翻 译 翻译是机器学习领域的经典基准,有着丰富的历史。我们对 WMT 23 翻译基准测试中的整 套语
言对进行了指令调优(参见 节)的 Gemini Ultra 评估。总体而言,我们发现 Gemini Ultra(以及其 他
Gemini 模型)在从英语到任何其他语言的翻译方面表现非常好,并且在翻译非英语时,在高资源,中等资
源和低资源语言时超过了基于法学硕士的翻译方法。在 WMT 23 非英语翻译任务中, Gemini Ultra 实现了
最高的法学硕士翻译质量,BLEURT (Sellam et al., 2020)的平均得分为 分, 而 GPT-4 的得分为
分,PaLM 的得分为 分。当对 WMT 23 的所有语言对和方向进行平均时,我们看到 Gemini Ultra 在
该基准上的平均得分为 ,GPT-4 为 ,PaLM 2-L 为 。
表 4 |Gemini 模型在 W MT 23 翻译基准上的性能。所有数字都用 1 -shot。
除了以上的语言和翻译任务,我们还在资源非常少的语言上评估 GeminiUltra。这些语言是从以下
语 言 集 的 尾 部 采 样 的 :Flores-200 (Tamazight 和 Kanure), NTREX(北 恩 德 贝 勒 ) 和 内 部 基 准
(Quechua)。
9
对于这些语言,无论是英语还是英语, Ge m in i Ultra 在一次射击设置中平均 ch rF 得分为 ,而第二好
的型号 Pa L M 2-L 的得分为 25 .3 。
除了翻译,我们还评估了 Gemini 在各种语言的挑战性任务中的表现。我们专门研究了数学基准
MGSM (Shi et al., 2023),它是数学基准 GSM8K (Cobbe et al., 2021)的翻译版本。我们发现
Gemini Ultra 的准确率达到了 %,超过了 PaLM 2-L 的 %,在 8 次射击设置中对所有语言进行
平均。我们还在多语言摘要基准-XLSum (Hasan 等人,2021)和 WikiLingua (Ladhak 等人,2020) 上对
Gemini 进行了基准测试。在 XLSum 中,Gemini Ultra 的平均 rougeL 得分为 ,而 PaLM 2 的平均
rougeL 得分为 。对于 Wikilingua, Gemini Ultra(5 杆)落后于 PaLM 2(3 杆),以 BLEURT 评分衡量
。完整结果见表 5。总体而言,多种多样的多语言基准测试表明,Gemini 系列模型具有广泛的语言覆
盖范围,使它们也能够覆盖语言资源匮乏的地区和地区。
表 5 |Gemini 模型在多语言数学和总结上的表现。
. 长 背 景
Gemini 模型的序列长度为 32,768 个标记,我们发现它们有效地利用了它们的上下文长度。我们首先通
过运行一个合成检索测试来验证这一点:我们将键值对放在上下文的开头,然后添加长填充文 本,并要
求与特定键相关联的值。我们发现,在查询整个上下文长度时,Ultra 模型检索正确值的准确率为
98%。我们通过绘制图 4 中一组长文档的负对数似然(NLL)与令牌索引的关系来进一步研究这一点。
我们发现 NLL 随序列位置的增加而减小,直到完整的 32K 上下文长度。Gemini 模型更长的上下文
长度支持新的用例,例如 节中讨论的文档检索和视频理解。
图 4 |在一组长文档上,负对数似然作为 tok en 索引在 32 K 上下文长度上的函数。
10
. 人 类 偏 好 评 价
人类对模型输出的偏好提供了质量的重要指示,是自动评估的补充。我们对 Gemini 模型进行了并排
的盲评估,人类评分员对两个模型对同一提示的反应进行了评估。我们使用第 节中讨论的技术指
导调优(欧阳等人,2022)预训练模型。指令调优版本的模型在一系列特定能力上进行评估, 如遵循指
令、创意写作、多模态理解、长上下文理解和安全性。这些能力包括一系列受当前用户 需求启发的用
例和受研究启发的潜在未来用例。
指令调整的 Gemini Pro 模型在一系列功能上提供了很大的改进,包括 Gemini Pro 模型优于
PaLM 2 模型 API,创意写作时间为 %,遵循指令的时间为 %,安全响应时间为 %, 如
表 6 所示。这些改进直接转化为更有帮助和更安全的用户体验。
表 6 | Gemini Pro 对 Pa LM 2 的胜率(text-bison@001), 95%置信区间。
. 复 杂 推 理 系 统
Gemini 还可以结合其他技术,如搜索和工具使用来创建强大的推理系统,可以解决更复杂的多步骤
问题。这种系统的一个例子是 AlphaCode 2,这是一种新的最先进的代理,擅长解决竞争性编程问
题(Leblond et al, 2023)。AlphaCode 2 使用专用版本的 Gemini Pro——对竞争性编程数据进行了调优
,类似于 Li 等人(2022)中使用的数据——在可能的程序空间中进行大规模搜索。接下来是量身定制
的过滤、聚类和重排序机制。Gemini Pro 经过微调,既可以作为生成提案解决方案候选的编码模型
,又可以作为用于识别和提取最有希望的候选代码的奖励模型。
Alpha Co de 2 在 Co defo rce s 5 (与 Alph a Co de 相同的平台) 上进行评估,从 1 区和 2 区进行 12 场比赛, 总
共 77 个问题。Alp ha Cod e 2 解决了 43 % 的竞争问题, 比之前创纪录的 Alph a Code 系统解决了 25% 的问
题提高了 倍。将其映射到竞争排名中,建立在 Ge min iPro 之上的 Alph a Code 2 平均估计位于第 85 个
百分位-即。它的表现优于 85 % 的参赛者。这与 Alph a Co de 相比是一个重大进步,后者的表现仅超过
50 % 的竞争对手。
强大的预训练模型与搜索和推理机制的组合是一个令人兴奋的方向,朝向更通用的智能体;另 一
个关键因素是对一系列模态的深入理解,我们将在下一节中讨论。
5http: / /
11
. 多 通 道
Gemini 的模特天生是多模式的。这些模型展示了一种独特的能力,可以将它们跨模态的能力(例如
从表格、图表或图形中提取信息和空间布局)与语言模型的强大推理能力(例如其在数学和编码 方面
的最先进性能)无缝结合起来,如图 5 和 12 中的示例所示。这些模型还在识别输入中的细粒度细
节、聚合跨空间和时间的上下文以及在时间相关的视频帧和/或音频输入序列上应用这些能 力方面
表现出强大的性能。
下面的章节提供了跨不同模态(图像、视频和音频)的模型的更详细的评估,以及该模型的图像 生
成能力和跨不同模态结合信息能力的定性示例。
. 形 象 的 理 解
我们在四种不同的能力上评估了该模型:使用字幕或问答任务(如 VQ Av2 )的高级目标识别; 使用要求模型识别
低级细节的 Tex tVQA 和 Do c VQA 等任务的细粒度转录;需要使用 Cha rtQA 和 Info graph ic VQA 任务对输入
布局进行空间理解的图表理解;以及使用 Ai2 D、Ma th Vista 和 MMMU 等任务进行多模态推理。对于零样本
QA 评估,该模型被指示提供与特定基准一致的简短答案。所有数字都是使用贪婪采样获得的,没有使用
任何外部 O CR 工具。
图像理解 Gemini Ultra 即使在零拍摄中也始终优于现有的方法,特别是在不使用任何外部 OCR 引擎(“仅
像素”)的自然图像、文本、文档和数字的 OCR 相关图像理解任务中。许多现有方法在各自的任务上
进行微调,用灰色突出显示,这使得与 0-shot 而不是完全相同的比较。
12
在表 7 中,我们发现 GeminiUltra 在广泛的图像理解基准测试中是最先进的。它在一系列不同的任
务中取得了强大的性能,例如在自然图像和扫描文档上回答问题,以及理解信息图、图表和 科学图表
。与公开报道的其他型号(最著名的是 GPT-4V)的结果相比,Gemini 在零射击评估中表现更好。它也
超过了几个现有的模型,这些模型针对大多数任务在基准的训练集上进行了专门的微调。 Gemini 模
型 的 能 力 在 学 术 基 准 方 面 带 来 了 显 著 的 进 步 , 比 如 MathVista(+%)6 或
InfographicVQA(+%)。
MMMU (Yue 等人,2023)是最近发布的一个评估基准,它由 6 个学科的图像问题组成,每个学科
都有多个学科,需要大学水平的知识来解决这些问题。GeminiUltra 在这个基准上取得了最好的成绩
,将最先进的结果提高了 5 个百分点以上,并且在 6 个学科中的 5 个学科中超过了之前的最佳成绩(见
表 8),从而展示了其多模态推理能力。
表 8 | Gemini Ultra 在每个学科 MMMU 基 准 (Yue 等, 2023)上 的 表 现 。每门学科涵盖多个学科,需要
具备大学水平的知识和复杂推理。
Gemini 模型还能够同时跨模式和多种全球语言进行操作,既可以用于图像理解任务(例如,包含冰岛
语文本的图像),也可以用于生成任务(例如,为多种语言生成图像描述)。我们使用 Flamingo 评估协
议(Alayrac et al., 2022),在 4 个镜头设置的cross -3600 (XM-3600)基准中,评估了在选定的语言子集
上生成图像描述的性能,没有对所有模型进行任何微调。如表 9 所示,Gemini 模型比现有的最佳模型
Google pal - x 有了显著的改进。
表 9 | 在 XM-3 600 数据集的语言子集上进行基准测试时,多语言图像理解 Gemini 模型在多种语言的图像字幕方面
优于现有模型(Tha p liya l 等,2 022 )。
6Math Vista 是一个全面的数学推理基准,由 28 个先前发布的多模态数据集和 3 个新创建的数据集组成。我们的
MathVista 结果是通过运行 MathVista 作者的评估脚本获得的。
13
图 5 | Ge mini 的 多 模 态 推 理 能 力 生成用于重新排列子图的 matplotlib 代码。多模态提示在左上角显
示为灰色。GeminiUltra 的反应,包括其生成的代码,显示在右边的蓝色栏中。左下图显示的是生成
代码的渲染版本。成功解决此任务显示了该模型结合几种功能的能力:(1)对图中 所示 函数的 识别 ;(2)
反 向 图 形 来推断可能会生成子图的代码;(3)指令跟随 ,将子图放置在其期望的位置;以及(4)抽象 推 理
,推断指数图必须保持在原来的位置,因为正弦图必须移动到三维图的位置。
图 5 中的定性评估举例说明了 Ge min i Ultra 的多模态推理能力。该模型需要解决生成 ma tp lo tlib
代码的任务, 该代码将重新排列用户提供的一组子图。模型输出显示, 它成功地解决了这个任务
14
结合多种理解用户图的能力, 推断生成它所需的代码,遵循用户指令将子图放在他们想要的位置, 以及对输出图
的抽象推理。这突出了 Ge min iUltra 的原生多模态,并回避了其更复杂的推理能力, 跨越交错序列的图像
和文本。我们请读者参考附录了解更多定性的例子。
. 视 频 的 理 解
理解视频输入是实现有用的通用性智能体的重要一步。通过从训练中保留的几个既定基准来衡量 视
频理解能力。这些任务衡量了模型是否能够理解和推理时间相关的帧序列。对于每个视频任务, 我们
从每个视频剪辑中采样 16 个等间隔的帧,并将它们提供给 Gemini 模型。对于 YouTube 视频数据集(
除了 NextQA 和 Perception 测试之外的所有数据集),我们在 2023 年 11 月仍然公开可用的视频上评估
Gemini 模型。
Gemini Ultra 在各种少镜头视频字幕任务和零镜头视频问答任务上取得了最先进的结果,如表10
所示。这证明了其跨几帧的强大时间推理能力。附录中的图 21 提供了一个定性的例子,可以理解足
球运动员的击球机制视频,并对球员进行推理可以提高他们的比赛。
表 10 选定的学术基准上 |跨 任务 和 语 言的 少 镜 头视 频 理 解 。报告的指标是视频字幕的 CIDER, NextQA
的 WUPS,以及感知测试和 ActivityNet-QA 的 top-1 准确率。对于 ActivityNet-QA,我们使用 Video-
LLAVA (Lin et al., 2023)评估协议。
. 图 像 生 成
Ge mini 能够本地输出图像,而不必依赖中间的自然语言描述, 这可能会限制模型表达图像的能力。这独特地
使模型能够在少镜头设置下使用图像和文本的交错序列生成具有提示的图像。例如, 用户可能会提示模型为一
篇博客文章或一个网站设计图像和文本的建议(参见附录中的图 10 )。
15
图 6 展示了 1-shot 设置下的图像生成示例。GeminiUltra 模型提示一个交错图像和文本的例子, 用
户提供两种颜色(蓝色和黄色)和图像建议创建一个可爱的蓝色猫或黄色耳朵的蓝色狗。然后给模 型两种
新的颜色(粉色和绿色),并询问两个关于使用这些颜色创建什么东西的想法。模型成功地生 成了一个交
错的图像和文本序列,并建议用纱线创建一个可爱的粉色种子的绿色牛油果或一个粉色 耳朵的绿色兔子。
图 6 |图 像 生 成 。 Gemini 可以输出多个图像与文本交织在一起,给出一个由图像和文本组成的提示。在
左图中,Gemini Ultra 在一个单镜头设置中提示用户,当给出蓝色和黄色两种颜色时,生成用纱线创建
猫和狗的建议。然后,提示模型生成两种新颜色的创意建议,粉色和绿色,它会生成创意 建议的图像,
从 yarn 中制作一个可爱的粉色种子的绿色鳄梨或一个粉色耳朵的绿色兔子,如右图所示。
16
. 音 频 的 理 解
我们在各种公共基准上评估了 Gemini Nano-1 和 Gemini Pro 模型,并将其与通用语音模型(USM)
(Zhang 等人,2023)和 Whisper (large-v2 (Radford 等人,2023)或 large-v3 (OpenAI, 2023)进行了比较。这
些基准包括自动语音识别(ASR)任务,如 FLEURS (Conneau 等人,2023),VoxPopuli (Wang 等人,
2021),多语言 librisspeech (Panayotov 等人,2015),以及语音翻译任务 CoVoST 2,将不同的语言 翻
译成英语(Wang 等人,2020)。我们还报告了一个内部基准 YouTube 测试集。ASR 任务报告单词错误
率(WER)指标,其中数字越低越好。翻译任务报告双语评估替补(BLEU)分数,数字越高越好。 报告了
62 种与训练数据有语言重叠的语言的 FLEURS。四种分段语言(普通话、日语、韩语和泰语) 报告字符错
误率(CER),而不是 WER,类似于 Whisper (Radford 等人,2023)。
表 11 表明,我们的 Ge min i Pro 模型在所有 AS R 和 AST 任务中都明显优于 US M 和 Wh ispe r 模型, 无
论是英语还是多语言测试集。请注意,与 US M 和 Wh ispe r 相比,FL E U RS 有很大的增益,因为我 们的
模型也是用 FL E URS 训练数据集训练的。然而,在没有 FL E UR S 数据集的情况下训练相同的模型,其
WE R 值为 15 .8 ,仍然优于 Wh isp er。Ge min i Nan o -1 模型在除 FL E URS 以外的所有数据集上也优于 U S
M 和 Wh ispe r。请注意, 我们还没有评估 Ge min iUltra 的音频, 尽管我们期望从增加的模型规模中获得
更好的性能。
表 11 | ASR 和 AST 在选定基准上的语音评估结果。对于 ASR ,报告的度量是 W E R, 越低越好。对于
AST,报告的度量是 BL E U, 越高越好。
表 12 显示了 U SM 和 Ge min i Pro 的进一步误差分析。我们发现 Ge m in iPro 的回答更容易理解, 尤
其是在罕见的单词和专有名词上。
表 12 |基准中 ASR 任务的定性示例。不正确的转录用红色标出。
17
. 形 态 组 合
多模态演示通常包括与单一模态(通常是图像)交织的文本组合。我们展示了原生处理音频和图像
序列的能力。
考虑一个制作煎蛋卷的烹饪场景,我们用音频和图像序列提示模型。表 13 显示了与模型的逐轮
交互,提供图片并口头询问烹饪煎蛋卷的下一步步骤。我们注意到,模型的响应文本是相当准 确的
,并显示模型会处理细粒度的图像细节来评估何时煎蛋卷完全煮熟。参见网站上的演示。
表 13:视听定性示例展示了 Gemini 模型处理文本、视觉和音频交错序列的能力,以及跨模式推理的能
力。此示例在烹饪场景中输入用户的交错图像和音频。用户提示模型获取制作煎蛋卷的指令, 并检查它
是否完全煮熟。
18
6.负 责 部 署
在 Gemini 模型的开发过程中,我们遵循结构化的方法进行负责任的部署,以识别、测量和管理我
们模型的可预见的下游社会影响,这与谷歌之前发布的人工智能技术一致(Kavukcuoglu 等人,
2022)。在项目的整个生命周期中,我们遵循以下结构。本节概述了我们在这个过程中的广泛方法 和
关键发现。我们将在即将发布的报告中分享更多细节。
. 影 响 评 估
我们开发模型影响评估,以识别、评估和记录与先进 Gemini 模型开发相关的关键下游社会效益和 危
害。这些依据先前关于语言模型风险的学术文献(Weidinger 等人,2021 年),以及来自全行业进行的
类似先前练习的发现(Anil 等人,2023;人为,2023;OpenAI, 2023a),持续与内部和外部的专家进行接
触,以及非结构化地尝试发现新的模型漏洞。关注领域包括:事实性、儿童安全、有害内容、 网络安
全、生物风险、代表性和包容性。这些评估与模型开发同步更新。
影响评估用于指导缓解措施和产品交付工作,并为部署决策提供信息。Gemini 影响评估跨越了
Gemini 模型的不同功能,使用谷歌的人工智能原则评估这些功能的潜在后果(谷歌,2023)。
. 模 型 的 政 策
基于对已知和预期影响的这种理解, 我们制定了一套“ 模型策略”来指导模型的开发和评估。模型政策定义作
为负责任开发的标准化标准和优先级方案,并作为发布就绪的标志。Ge min i 模范政策涵盖了许多领域,包
括:儿童安全、仇恨言论、事实准确性、公平和包容, 以及骚扰。
19
. 评估
为了根据政策领域和影响评估中确定的其他关键风险领域来评估Gemini 模型,我们在模型开发的生
命周期中开发了一套评估。
开发评估是为了在整个训练和微调 Gemini 模型的过程中进行“爬坡”。这些评估是由 Gemini 团队
设计的,或者是针对外部学术基准的评估。评估会考虑有用性(遵循指令和创造力)、安全性和 真实性
等问题。结果样本见 节和下一节的缓解措施。
保证评估是为了治理和审查的目的而进行的,通常在关键里程碑或由模型开发团队以外的团队 进行
的培训运行结束时进行。保证评估由模式标准化,数据集被严格保留。只有高层次的见解被 反馈到训
练过程中,以协助缓解工作。保证评估包括跨 Gemini 策略的测试,并包括对潜在生物危害、说服和网
络安全等危险能力的持续测试(Shevlane 等,2023)。
外部评估由谷歌以外的合作伙伴进行,以确定盲点。外部团体就一系列问题对我们的模型进行压 力测试,包
括白宫承诺中列出的领域,7 并通过结构化评估和非结构化红色团队的混合进行测试。这些评估的设计是独
立的, 结果定期报告给谷歌 De ep M ind 团队。
除了这一套外部评估之外,专家内部团队还在 Gemini 政策和安全等领域对我们的模型进行持续
的红队。这些活动包括涉及复杂的对抗性攻击以识别新漏洞的非结构化流程。然后可以利用发 现潜
在弱点来减轻风险并改进内部的评估方法。我们致力于持续的模型透明度,并计划随着时间 的推移
分享来自我们的评估套件的其他结果。
. 缓 解 措 施
缓解措施是根据上述评估、政策和评估方法的结果制定的。评估和缓解以迭代方式使用,在缓解
努力之后重新运行评估。我们在下面讨论了我们在缓解数据、指令调优和事实性方面的模型危害
方面的努力。
. .数据
在培训之前, 我们在数据策划和数据收集阶段采取各种步骤来减轻潜在的下游危害。正如在“ 训练数据” 一节中
所讨论的, 我们针对高风险内容过滤训练数据, 并确保所有训练数据都足够高质量。 除了过滤之外, 我们还
采取措施确保收集的所有数据符合谷歌 De ep Mind 在数据丰富方面的最佳实践,
8 这些实践是基于人工智能“负责任的数据丰富服务采购”9 伙伴关系开发的。这包括确保所有数据充实工作者
的工资至少达到当地的生活工资水平。
7https: / / whitehouse . gov / wp-content /上传/ 2023/07 / Ensuring-Safe-Secure-and-Trustworthy-
8https: / / deepmind. google /发现/博客/ best-practices-for-data-enrichment
/
9https: / / partnershiponai. org/responsible-sourcing-
20
. 指 令 调 优
指令调整包括监督微调(SFT)和使用奖励模型通过人类反馈(RLHF)的强化学习。我们将指令调优应
用于文本和多模态设置。指令调优食谱经过精心设计,以平衡有用性的增加与与安全和 幻觉相关
的模型危害的减少(Bai 等人,2022a)。
管理“高质量”数据对于 SFT、奖励模型训练和 RLHF 至关重要。数据混合比例与较小的模型进行
消融,以平衡有用性(如指令遵循、创造力)和减少模型危害的指标,这些结果很好地泛化到较 大的模
型。我们还观察到,数据质量比数量更重要(Touvron 等人,2023b;Zhou et al., 2023),特别是对于更大
的模型。同样,对于奖励模型训练,我们发现,为了安全原因和模型输出有用响应的示 例,将数据集与模
型更倾向于说“我无法帮助”的示例平衡至关重要。我们使用多目标优化,对有 用性、事实性和安全性的奖
励分数进行加权求和,来训练一个多头奖励模型。
进一步阐述了减轻有害文本生成风险的方法。在广泛的用例中列举了大约 20 种伤害类型(例如
仇恨言论、提供医疗建议、建议危险行为)。生成了这些类别中潜在致伤害查询的数据集,这 些数
据集要么由政策专家和 ML 工程师手动生成,要么通过提示以主题关键词为种子的高性能语言模型
生成。
考虑到有害的查询,我们探测了我们的 Gemini 模型,并通过并行评估来分析模型的响应。如上
所述,我们平衡了模型输出响应无害与有帮助的目标。从检测到的风险区域,我们创建额外的 监督
微调数据来展示理想的响应。为了大规模生成这样的回答,我们严重依赖一个自定义数据生 成配方
,该配方松散地受到宪法AI 的启发(Bai et al., 2022b),我们注入谷歌的内容政策语言变体作为“宪法”
,并利用语言模型强大的零样本推理能力(Kojima et al., 2022)来修订回答并在多个回答候选人之间进
行选择。我们发现这个方法是有效的——例如在 GeminiPro 中,这个整体方法能够减轻我们确定的
大多数文本伤害案例,而没有任何明显的响应帮助减少。
. 事 实 性
重要的是,我们的模型在各种情况下都能产生符合事实的反应,并减少幻觉的频率。我们将指令
调优工作集中在三个关键的期望行为上,反映了现实世界的场景:
1. 归 因 :如果被要求在提示中生成一个应完全归因于给定上下文的响应,Gemini 应该生成一个对
上下文最忠实的响应(Rashkin 等人,2023)。这包括对用户提供的来源进行总结,根据问题生
成细粒度的引用,并提供类似于 Menick 等人(2022)的片段;Peng et al.(2023),回答来自 长形式
来源(如一本书)的问题(Mihaylov et al.,2018),并将给定来源转换为所需的输出(例如, 从会议
记录的一部分中提取的电子邮件)。
2. 闭 卷 响 应 生 成 :如果提供了没有任何给定来源的事实寻求提示,Gemini 不应该产生错误信息的幻
觉(见 Roberts 等人(2020)的第 2 节的定义)。这些提示可以是信息寻求提示(例如“印度总理是谁?
”),也可以是半创造性提示,可能要求提供事实性信息(例如“写一篇 500 字的演讲, 支持采用可
再生能源”)。
21
3. 对冲 :如果提示输入“无法回答”,Gemini 不应该产生幻觉。相反,它应该承认,它无法通过对冲
来提供回应。这包括输入提示包含假前提问题的场景(参见 Hu et al.(2023)中的例子),输入提示指
示模型执行开卷 QA,但答案无法从给定的上下文派生,等等。
我们通过策划有针对性的监督微调数据集和执行 RLHF,从 Gemini 模型中得出了这些期望的行为。请
注意,这里产生的结果不包括赋予 Gemini 据称可以提高事实性的工具或检索(Menick 等人,
2022;Peng 等人,2023)。我们在下面提供了三个关于各自挑战集的关键结果。
1. 事 实 集 :包含寻求事实提示的评估集(主要是闭卷)。这是通过人工标注者进行评估的,他们手
动对每个回答进行事实核查;我们报告了由标注者判断的事实不准确的回答的百分比。
2. 归 属 集 :一个评估集,其中包含各种需要在提示中对来源进行归属的提示。这是通过人工标
注者进行评估的,他们手动检查提示中每个回答的来源的归因;报告的度量是 AIS (Rashkin 等
人,2023)。
3. 套 期 保 值 设 置 :评估集设置,我们衡量是否 Gemini 模型套期保值准确。
我们比较了 GeminiPro 与一个版本的指令调整 GeminiPro 模型没有任何事实为中心的适应在表 14。我
们观察到,事实性集合中的不准确性率减半,归因的准确性从归因集合中提高了 50%,并且模型在提供的
套期保值集合任务中成功套期保值 70%(从 0%上升)。
表 14:事实性缓解:指令调整对不准确性、归因存在和准确对冲率的影响(具有相应的 95%置信区间
)。
. 部署
在审查完成之后,为每个已批准的 Gemini 模型创建模型卡,用于结构化和一致的关键性能和责
任度量的内部文档,并随着时间的推移通知这些度量的适当外部通信。
. 负 责 任 的 治 理
在负责任的开发过程中,我们与谷歌 DeepMind 责任与安全委员会(RSC)一起进行伦理和安全审查, 10
这是一个跨学科小组,根据谷歌的人工智能原则评估谷歌DeepMind 的项目、论文和合作。RSC 就影
响评估、政策、评价和缓解工作提供投入和反馈。在 Gemini 项目期间,RSC 跨关键政策领域(例如
儿童安全)设置了具体的评估目标。
10https: / / / / responsibility-safety /
22
7.讨 论 与 结 论
我们已经介绍了 Gemini,这是一个新的模型家族,可以在文本、代码、图像、音频和视频中推进多
模态模型功能。这份技术报告在一系列广泛研究的基准上评估了Gemini 的能力,我们最强大的
GeminiUltra 模型在所有方面都取得了重大进展。在自然语言领域,从大规模数据和模型训练的仔细
发展中获得的性能收益继续带来质量的提高,在几个基准中设置了新的技术水平。特别是,
GeminiUltra 在考试基准 MMLU 上的表现超过了人类专家,得分为 %,自 2020 年首次发布以来
,这一直是衡量法学硕士进步的事实上的指标。在多模态领域,Gemini Ultra 在大多数图像理解、
视频理解和音频理解基准上设定了新的技术水平,而无需针对特定任务进行修改或调整。特 别是,
Gemini Ultra 的多模态推理能力在最近的 MMMU 基准测试(Yue et al., 2023)上的最先进表现是显而
易见的,该测试包括关于需要大学水平学科知识和刻意推理的图像的问题。
除了最先进的基准测试结果之外,我们最兴奋的是 Gemini 模型支持的新用例。Gemini 模型解 析复
杂图像(如图表或信息图)的新功能,对图像、音频和文本的交错序列进行推理,并生成交错的 文本和图
像作为响应,从而打开了各种各样的新应用程序。正如整个报告和附录中的数字所示, Gemini 可以在教
育、解决日常问题、多语言交流、信息总结、提取和创造力等领域采用新的方法。我们希望这些模型的
用户能发现各种有益的新用途,而我们在自己的调查中只触及了皮毛。
尽管它们的能力令人印象深刻,但我们应该注意到,法学硕士的使用也有局限性。继续需要对 法
学硕士产生的“幻觉”进行持续的研究和开发,以确保模型输出更加可靠和可验证。尽管法学 硕士在考
试中取得了令人印象深刻的成绩,但他们也很难完成需要高级推理能力的任务,比如因 果理解、逻辑
推理和反事实推理。这强调了需要更具挑战性和更强大的评估来衡量他们的真实理 解,因为目前最先
进的法学硕士已经饱和了许多基准。
Gemini 是我们解决智能、推进科学和造福人类的使命的又一步,我们热切地希望看到谷歌和其他公
司的同事如何使用这些模型。我们在机器学习、数据、基础设施和负责任的开发方面进行了 许多创新
,这些都是谷歌十多年来一直在追求的领域。我们在本报告中提出的模型为我们更广泛 的未来目标提
供了强大的基础,该目标是开发一个大规模的、模块化的系统,该系统将在许多模 态中具有广泛的泛
化能力。
23
参 考 文 献 。
Je an -Bap tiste Alay rac , Jeff Don ahu e, Pau lin e Luc , An to in e Mie ch , Ia in Ba rr, Ya na Ha sson, Ka re l Len c,
Arthu r Men sc h, Ka th e rine Millic a n, Ma lco lm Re yno lds 等。Fla min go :一种用于少样本学习的视觉语言
模型。神经信息处理系统的进展,35 :2 371 6-2373 6,2022 。
Roha n An il, And re w M. Da i, Orha n Fira t, Me lv in John son, Dmitry Lep ikh in, Alex and re Passo s, Sia mak
Sh ake ri, E manue l Ta ro pa , Pa ige Ba ile y ,陈,E ric Chu , Jona th an H. Clark , Lau re n t E l Sh afey ,黄艳平,
Ka thy me ye r - h e llstern, Gau rav Mish ra, E rica Mo re ira , Ma rk Ome rn ick , Kev in Rob in son , Seb astia n
Rude r, Yi Tay, Kefan Xiao , Yu anzho n g, Zha n g Yu jin g, Gu stav o He rna ndez Abre go , Jun whan Ahn, Jaco b
Austin , 保罗 ·巴勒姆 , Jan Bo tha , Ja mes Brad bu ry, Siddh artha Brah ma, Kev in Broo ks ,Mic he le Ca ta sta ,
Yon g Chen g, Co lin Ch erry, Ch ristophe r A. Choqu e tte -Choo, 阿坎沙 ·乔德瑞 , c lac immen t Crep y, Shac h i
Dave , Mostafa Deh ghan i, Sun ip a Dev, Jacob Dev lin , Ma rk D ía z, Du Nan , Ethan Dye r, Vlad Fe inbe rg ,冯
方晓宇, Vlad Fie nbe r, Ma rku s Fre ita g, Xa v ie r Ga rc ia, Seba stian Geh rmann, Lu ca s Gon za le z, Guy gu ra ri,
Ste ven Hand , Had i Ha she mi, L e Ho u, Jo shua Ho wland , And rea Hu , Jeffrey Hu i, Je re my Hurwitz , 迈克
尔 ·伊萨德 , Ab e Itty che riah, Ma tth e w Ja gie lsk i, Wenh ao Jia , Ka th lee n Ken ea ly ,Ma x im Krikun , Sneh a
Kudu gun ta, Ch an g La n, Ka th e rine Le e, Ben ja min L ee , Eric L i, Music L i, We i L i, Ya Gu an g L i, Jian L i,
L im Hye on ta ek, L in Han zha o, L iu Zho n gtao , Frede ric k L iu , Ma rce llo Ma ggio n i, Aro ma Ma hend ru , Jo shu a
May nez , Ve dan t Misra , May sa m Moussa le m, Za cha ry Nado, John Nh a m, E ric Ni, And re w Nystro m, Alic ia
Pa rrish, Ma rie Pe lla t, Ma rtin Po lac ek , Alex Po lo zov, Re in e r Po pe, Siyu an Qia o, E mily Re if, Bry an Rich te r,
Pa rk e r Riley, Alex Castro Ros, Au rko 罗伊, Brenn an Sae ta, Ra jku ma r Sa mu e l,Rene e She lb y, Ambrose
Slon e, Dan ie l Smilko v, Dav id R. So, Soh n Dan ie l, Simon Toku mine , Da sha Va lte r, Vijay Va su deva n, Kira n
Vod rah a lli,王学智, 王丕东, 王子瑞,王涛,John Wie tin g,吴玉怀,徐 k e lv in , 徐云涵, 薛林婷, 尹
鹏程, 余嘉辉,张乔,郑 Ste ven ,郑策, 周维康,周丹尼,Sla v Pe trov ,吴永辉。Pa lm 2 技术报告,
2023 年。
人择。克劳德模型的模型卡和评估,2023 年。
白云涛、安迪琼斯、卡迈勒·恩杜塞、Amanda Askell、安娜陈、诺瓦·达萨玛、黎明·德雷恩、斯坦尼
斯拉夫堡、深岗古里、汤姆·亨尼根、尼古拉斯·约瑟夫、Saurav Kadavath、杰克逊·克尼昂、汤姆·
康纳利、希尔·厄尔-肖克、纳尔逊·埃尔哈格、扎克·哈特菲尔德-多德、 丹尼·埃尔南德斯、特里斯坦·
休谟、斯科特·约翰斯顿、肖娜·克拉维茨、莉安·洛维特、 尼尔·南达、凯瑟琳·奥尔森、达雷尔·阿莫
代伊、汤姆·布朗、杰克·克拉克、萨姆·麦坎 德利什、克里斯·奥拉、本·曼和贾里德·卡普兰。用人类
反馈的强化学习来训练一个有用且 无害的助手。2022 年 4 月。URL
白云涛、Saurav Kadavath、Sandipan Kundu、Amanda Askell、Jackson Kernion、安迪琼斯、安娜陈、安
娜 Goldie、Azalia Mirhoseini、Cameron McKinnon 等。宪法 ai:来自 ai 反馈的无害性。arXiv 预印本
arXiv:, 2022b。
保罗· 巴勒姆、阿坎沙· 乔德瑞、杰夫·迪恩、桑杰·格玛沃特、Stev en Han d 、Dan ie l·赫特、迈克尔·伊萨德、L
im Hyeon taek 、庞若明、苏迪卜罗伊等。路径: 面向机器学习的异步分布式数据流。机器学习与系统学
报,4 (4 ):430 - 449,2022。
詹姆斯·布拉德伯里、罗伊·弗罗斯特格、彼得·霍金斯、马修·詹姆斯·约翰逊、克里斯·利里 、 杜 格
尔 · 麦克劳林、 乔治 · 内库拉、 亚当 · 帕斯克、 杰克 · 范德普拉斯、 斯凯 ·Wanderman-Milne
和 张 乔 。 JAX: Python+NumPy 程 序 的 可 组 合 变 换 , 2018 年 。 URL
google/jax 。
Tom Brown, Benjamin Mann, Nick Ryder, Melanie Subbiah, Jared D Kaplan, Prafulla Dhariwal, Arvind
Neelakantan, Pranav Shyam, Girish Sastry, Amanda Askell, Sandhini Agarwal, Ariel Herbert- Voss,
Gretchen Krueger, Tom Henighan, Rewon Child, Aditya Ramesh, Daniel Ziegler, Jeffrey
24
吴、克莱门斯·温特、克里斯·黑塞、马克·陈、埃里克·西格勒、马特乌斯·利特温、斯 科特·格雷
、本杰明·切斯、杰克·克拉克、克里斯托弗·伯纳、萨姆·麦坎迪什、亚历克·雷德福、伊利亚·
萨斯克维尔和达里奥·阿莫代伊。语言模型是少样本的学习者。见 H. Larochelle, M. Ranzato, R.
Hadsell, . Balcan 和 H. Lin,编辑,《神经信息处理系统进展》, 第 33 卷 , 第
1877-1901 页 。 Curran Associates, Inc. , 2020 年 。 URL
files/paper/2020/file/。
Mark 陈曦、Jerry Tworek、Heewoo Jun、袁启明、Henrique Ponde de Oliveira Pinto、Jared Kaplan、
Harri Edwards、 Yuri Burda、 Nicholas Joseph、 Greg Brockman、 Alex Ray、 Raul Puri、Gretchen
Krueger、迈克尔彼得罗夫、Heidy Khlaaf、Girish Sastry、Pamela Mishkin、Brooke Chan、Scott
Gray 、 Nick Ryder 、 Mikhail Pavlov 、 Alethea Power 、 Lukasz Kaiser 、 Mohammad Bavarian 、
Clemens Winter、Philippe Tillet、Felipe Petroski Such、Dave Cummings、Matthias Plappert、Fotios
Chantzis 、 Elizabeth Barnes 、 Ariel Herbert-Voss, William Hebgen Guss, Alex Nichol, Alex Paino,
Nikolas Tezak, Jie Tang, Igor Babuschkin, Suchir Balaji, santanu Jain, William Saunders, Christopher
Hesse, Andrew N. Carr, Jan Leike, Josh Achiam, Vedant Misra, Evan Morikawa, Alec Radford, Matthew
Knight, Miles Brundage, Mira Murati, Katie Mayer, Peter Welinder, Bob McGrew, Dario Amodei, Sam
McCandlish, Ilya Sutskever 和 Wojciech Zaremba。评估在代码上训练的大型语言模型。arXiv 预印本
arXiv:, 2021。URL
陈曦、王晓、索拉维特·张皮约、A·J·皮尔乔瓦尼、彼得·帕德莱夫斯基、丹尼尔·萨尔茨、 塞巴斯蒂
安·古德曼、亚当·格里纳、巴兹尔·穆斯塔法、卢卡斯 ·拜尔、Alexander·科列斯 尼科夫、Joan
Puigcerver、丁南、克兰·容、哈桑·阿克巴里、高拉夫·米什拉、薛林亭、阿什什·塔普利亚、詹姆斯·
布拉德伯里、郭维成、莫伊塔巴·塞耶霍塞尼、贾超、布尔库·卡拉 戈尔 ·阿扬、卡洛斯·里克尔梅
、安德烈亚斯·施泰纳、阿内利亚·安杰洛娃、翟晓华、尼尔 · 霍斯比和拉杜 ·索 里 卡 特 。 PaLI:
联 合 缩 放 的 多 语 言 语 言 - 图 像 模 型 。 arXiv 预 印 本 arXiv:, 2022 。 URL https:
//
陈 曦 、 josesip Djolonga、 Piotr Padlewski、 Basil Mustafa、 Soravit Changpinyo 、 Jialin Wu 、Carlos
Riquelme Ruiz、Sebastian Goodman、Xiao 王晓、Yi Tay、Siamak Shakeri、Mostafa Dehghani、
Daniel Salz、Mario Lucic、迈克尔 Tschannen、Arsha Nagrani、Hu hex 翔、Mandar Joshi、Pang、
Ceslee Montgomery、Paulina Pietrzyk、Marvin Ritter、AJ Piergiovanni、Matthias Minderer、philip
Pavetic 、 Austin Waters 、 Ibrahim Alabdulmohsin 、 Lucas Beyer 、 Julien Amelot 、 Kenton Lee 、
Andreas Peter Steiner、Yang Li、Daniel Keysers, Anurag Arnab,徐远忠,Keran Rong,Alexander
科列斯尼科夫,Mojtaba Seyedhosseini, Anelia Angelova,翟晓华,Neil Houlsby 和 Radu Soricut。
PaLI-X:关于扩大多语言视觉和语言模型。arXiv 预印本 arXiv:, 2023。
Aakanksha Chowdhery, Sharan Narang, Jacob Devlin, Maarten Bosma, Gaurav Mishra, Adam Roberts,
Paul Barham, Hyung Won Chung, Charles Sutton, Sebastian Gehrmann, Parker Schuh, Kensen Shi,
Sasha Tsvyashchenko, Joshua Maynez, Abhishek Rao, Parker 巴 恩 斯 , Yi Tay, Noam Shazeer,
Vinodkumar Prabhakaran, Emily Reif, Nan Du, Ben Hutchinson, Reiner Pope, James Bradbury, Jacob
Austin, Michael Isard, Guy Gur-Ari, Pengcheng Yin, Toju Duke, Anselm Levskaya, Sanjay Ghemawat,
Sunipa Dev, Henryk Michalewski,Xavier Garcia、Vedant Misra、Kevin Robinson、Liam Fedus、
Denny Zhou、Daphne Ippolito、David Luan、Hyeontaek Lim、Barret Zoph、Alexander Spiridonov、
Ryan Sepassi、David Dohan、Shivani Agrawal、Mark Omernick、Andrew M. Dai、Thanumalayan
Sankara- narayana Pillai、Marie Pellat、Aitor Lewkowycz、Erica Moreira、Rewon Child、Oleksandr
Polozov、 Katherine Lee、周宗伟、Wang、 Brennan Saeta、 Mark Diaz、Orhan Firat 、 Michele
Catasta、Jason Wei、Kathy meyer - hellstern、Douglas Eck、Jeff Dean、斯拉夫·彼得罗夫和诺 亚 ·
菲尔德。Palm: 用 pathways 扩展语言建模。机器学习研究, 24(240):1-113,2023 。URL
25
克里斯托弗·克拉克、肯顿·Lee、张明伟、汤姆·奎特科夫斯基、迈克尔·柯林斯和克里斯蒂 娜·图塔
诺娃。布尔克:探索自然是/否问题的惊人难度。《计算语言学学会北美分会 2019 年会议论 文 集 :
人 类 语 言 技 术 》 , 第 1 卷 ( 长 、 短 论 文 ) , 2924-2936 页 , 2019 。 URL
Jon Clark, Eunsol Choi, 迈 克 尔 Collins, Dan garrett, Tom Kwiatkowski, Vitaly Nikolaev 和Jennimaria
Palomaki。TydiQA:错别字-逻辑多样化语言的信息搜索问答基准。计算语言学学会学报,2020。
URL
Karl Cobbe, Vineet Kosaraju, Mohammad Bavarian, Jacob Hilton, Reiichiro Nakano, Christopher Hesse
和 John Schulman。训练验证者解决数学应用题。arXiv 预印本 arXiv:, 2021。URL
。
Alex is Con ne au, Min Ma , Simran Khanu ja , Yu Zh an g, Ve ra Axe lrod, Sidd ha rth Da lmia , Ja son Riesa , Cla ra
Rive ra 和 Anku r Bap na 。Fleu rs:语音普遍表征的少样本学习评估。在 202 2 年 IE E E 口语技术研讨会
(SLT),页 798 -80 5 。IE E E, 2023。
大规模分布式深度网络。神经信息处理系统进展,2 012 年第 25 期。
Harish Dattatraya Dixit, Sneha Pendharkar, Matt Beadon, Chris Mason, Tejasvi Chakravarthy, Bharath
Muthiah, Sriram Sankar。大规模的无声数据损坏。arXiv 预印本 arXiv:, 2021。
Alex ey Do sov itsk iy 、Lu ca s Be ye r、Ale xand e r Ko le sn ikov 、Dirk We issenbo rn 、Xia oh ua Z ha i、T ho mas
Un te rth ine r、Mo stafa Deh ghan i、 Ma tth ia s Minde re r、Geo rg He igo ld 、Sy lva in Ge lly 、Ja kob Uszko re it、
Neil Houlsby。一幅图像抵得上 16 x16 个单词 :tran sfo rme r 用于大规模图像识别。在 ICLR , 2020 年。
Dheeru Dua、yizzhong Wang、Pradeep Dasigi、Gabriel Stanovsky、Sameer Singh、Matt Gardner。
DROP:一种需要对段落进行离散推理的阅读理解基准。《计算语言学协会北美分会 2019 年会议
论 文 集 : 人 类语 言 技术 》, 第 1 卷 ( 长 、 短论 文 ) , 2368-2378 页 , 2019 。 URL
克里斯蒂安·费德曼、汤姆·科米和应欣。NTREX-128 -新闻测试参考 128 种语言的机器翻译评估。
第一届扩大多语言评估研讨会论文集,21-24 页,在线,2022 年 11 月。计算语言学协会。
URL
谷歌。谷歌的AI 原理。2023。URL principles/。
Ya sh Go ya l、Tejas Kho t、Dou glas Su mme rs -Stay 、Dhruv Ba tra 和 De v i Pa rikh 。使 VQA 中的 V 很重要 :
提升图像理解在视觉问答中的作用。IE E E 计算机视觉与模式识别会议论文集,第 6 904 -6913 页,
2017。
Tah mid Ha san , Abh ik Bha tta cha rjee , Md . Sa ifu l Isla m, Kaz i Mub assh ir, Yu an -Fan g L i, Yon g-Bin Ka n g, M.
Soh e l Ra h man , and Rifa t Shah riy a r 。XL -su m:面向 44 种语言的大规模多语言抽象摘要。在计算语言
学协会的发现:A CL-IJ C NLP 2021 中,
26
页 4693-4703 ,在线,2021 年 8 月。计算语言学协会。Doi: v1/-
。URL
Dan hendricks 、 Collin Burns 、 Steven Basart 、 Andy Zou 、 Mantas Mazeika 、 Dawn Song 、 Jacob
Steinhardt。测量大规模多任务语言理解。国际学习表征会议论文集(ICLR), 2021a。
Dan hendricks, Collin Burns, Saurav Kadavath, Akul Arora, Steven Basart, Eric Tang, Dawn Song 和Jacob
Steinhardt。用数学数据集测量数学问题解决。arXiv 预印本 arXiv:, 2021b。URL
Pe te r H Hoch sc h ild ,保罗特纳,Jeffre y C Mo gu l, Ra ma Gov ind a ra ju , Pa rth a sa ra thy Ran gana than , Dav id
E Cu lle r 和 Amin Va hda t。不算数的核心。在《操作系统热点话题研讨会论文集》中, 第 9 -16 页,
2021 年。
Jordan Hoffmann、 Sebastian Borgeaud 、Arthur Mensch 、Elena Buchatskaya 、 Trevor Cai 、 Eliza
Rutherford 、Diego de Las Casas 、 Lisa Anne Hendricks、 Johannes Welbl、 Aidan Clark 、 Tom
Hennigan、Eric Noland、Katie Millican、George van den Driessche、Bogdan Damoc、Aurelia Guy、
Simon Osindero、Karen Simonyan、Erich Elsen、Jack W. Rae、Oriol Vinyals 和 Laurent Sifre。训练计算-
最优大型语言模型。arXiv 预印本 arXiv:, 2022。
胡圣鼎,罗一帆, 王华东, 程兴义, 刘志远,孙茂松。《不会再上当: 用假前提回答问题》。a rX iv 预印本
arXiv : ,2023 。
黄恩贞和沃德·施瓦兹。Memecap:用于字幕和解释模因的数据集,2023 年。
No rm Jo upp i, Ge orge Ku rian, Sh en g L i, Pe te r Ma, Rah u l Na ga ra jan , L ife n g Na i, Nish an t Pa til, Suv in ay
Su bra man ia n, An dy Swin g, Brian To wles 等。T p u v4 :用于机器学习的光学可重构超级计算机, 具有嵌
入式硬件支持。《计算机体系结构第 50 届年度国际研讨会论文集》,页 1 -1 4,2 023 。
Ashwin Kalyan, Abhinav Kumar, Arjun Chandrasekaran, Ashish Sabharwal 和 Peter Clark 。 2019 年
emnlp 期间喝了多少咖啡?费米问题:ai 的新推理挑战,2021 年。
葛西俊吾、坂口圭介、高桥洋一、罗南·勒布拉斯、浅井明辉、余心言、德拉戈米·拉德夫、诺 亚 ·a·
史 密 斯 、 崔 Yejin 、 犬 井 健 太 郎 。 实 时 QA: 现 在 的 答 案 是 什 么 ?, 2022 年 。 URL
K Kavukcuoglu, P Kohli, L Ibrahim, D Bloxwich, S Brown。我们的原则如何帮助定义 alphafold 的发
布。谷歌 deepmind, 2022。
An irudd ha Ke mbh av i、Mik e Sa lv a to 、E ric Ko lve 、 Min joo n Seo 、Han nan eh Ha jish irz i 和 Ali Fa rh ad i。
一张图抵得上十多张图。在 E CC V , 2016 年。
TomÁŠ Kočiský、Jonathan Schwarz、Phil Blunsom、Chris Dyer、Karl Moritz Hermann、GÁbor
Melis、Edward Grefenstette。The NarrativeQA reading comprehension challenge。计算语言学学
报,6:317-328,2018。doi: / tacl_a_00023。URL
Tom·科米,雷切尔·鲍登,Ondřej 博贾尔,安东·德沃科维奇,克里斯蒂安·费德曼,马克·费舍
尔,Thamme Gowda,伊维特·格雷厄姆,罗曼·格兰德凯维奇,巴里·哈道,丽贝卡 ·诺尔斯,
菲利普·科恩,克里斯托弗·蒙兹,森下诚,永田正明,中泽俊明,迈克尔 NovÁk,
27
Martin Popel 和 Maja Popović。2022 年机器翻译会议(WMT22)调查结果。在第七届机器翻译会议
(WMT)论文集中,2022 年 12 月。URL
小岛武、石翔谢恩·顾、马谢尔·里德、松大雄、岩泽佑介。大型语言模型是零样本推理机。
NeurIPS, 2022 年。URL
工藤拓和约翰·理查森。SentencePiece:用于神经文本处理的简单且独立于语言的子词分词器 和 去
分 词 器 。 EMNLP( 系 统 演 示 ) , 2018 。 doi: / v1 / d18 - 2012 。 URL
18-2012。
Tom Kwiatkowski, jenimaria Palomaki, Olivia Redfield, Michael Collins, Ankur Parikh, Chris Alberti,
Danielle Epstein, ilia Polosukhin, Jacob Devlin, Kenton Lee, Kristina Toutanova, Llion Jones,
Matthew Kelcey, Ming-Wei Chang, Andrew M. Dai, Jakob Uszkoreit, Quoc Le 和 Slav Petrov 。Natural
questions: 问 答 研 究 的 基 准 。 计 算 语 言 学 学 报 , 7(1):452 - 466,2019 。 doi: /
tacl_a_00276。URL https://
Faisal Ladhak, Esin Durmus, Claire Cardie 和 Kathleen McKeown。WikiLingua:用于跨语言抽象摘要
的新基准数据集。《计算语言学协会调查结果:EMNLP 2020》,4034-4048 页,在线,2020 年
11 月 。 计 算 语 言 学 协 会 。 doi: / v1/ 。 URL
anthology/2020. discoveries 。
Leblond 等 人 。 Alpha Code 2 技 术 报 告 , 2023 年 。 URL
deepmind-media/ alphaacode2 / alphaacode2_tech_report .pdf 。
Yann LeCun、Yoshua Bengio 和 Geoffrey Hinton。深度学习。《自然》,521 (7 553 ):43 6 -444 ,20 15 。
李宇嘉,David 崔Yejin, Junyoung Chung, Nate Kushman, Julian Schrittwieser, r Leblond,Tom 埃克莱
斯,James Keeling, Felix Gimeno, Agustin Dal Lago 等。使用 alphacode 进行竞赛级别的代码生成
。科学,378(6624):1092-1097,2022。
林斌,朱斌,叶洋,宁慕南,金鹏,袁李。video - lava:通过排列前投影学习联合视觉表征。arXiv
预印本 arXiv: ,2023。
陆攀,龚然,蒋世彪,邱亮,黄思远,梁晓丹,朱松春。Inter-gps:基于形式语言和符号推理的可解 释
几何问题求解。在计算语言学协会第 59 届年会暨第 11 届自然语言处理国际联席会议(ACL-
IJCNLP 2021)联席会议上,2021。
Lu Pan、Hritik Bansal、Tony Xia、Liu jicheng、Li Chunyuan、Hannaneh Hajishirzi、Cheng Hao、Kai-
Wei Chang、Michel Galley、Jianfeng Gao。Mathvista:在视觉环境下评估基础模型的数学推理。arXiv 预
印本 arXiv: ,2023。
Ahmed Masry, Do Long, Jia Qing Tan, Shafiq Joty,和 Enamul Hoque。ChartQA:关于具有视觉和逻辑
推理的图表的问答基准。在 ACL 的调查结果中,2022 年。
Min esh Ma the w, Dimo sth en is Ka ra tza s 和 CV Ja waha r 。 Do cvq a: 针 对 文 档 图 像 的 vqa 数 据 集 。
IEEE/CV F 计算机视觉应用冬季会议论文集,页 220 0 - 2209,2021。
28
Mine sh Ma th e w 、 Vira j Ba ga l 、 Ru bèn Tito 、 Dimo sthen is Ka ra tz as 、 E rne st Va lveny 和 CV Ja waha r 。
Infographicvqa 。IEE E /CV F 计算机视觉应用冬季会议论文集,1697 -1706 页,2022 。
Jacob Menick, Maja Trebacz, Vladimir Mikulik, John Aslanides, Francis Song, Martin Chadwick, Mia
Glaese, Susannah Young, Lucy Campbell-Gillingham, Geoffrey Irving 等。教授语言模型,用经过验
证的引用支持答案。arXiv 预印本 arXiv:, 2022。
Sarah E. Michalak、Andrew J. DuBois、Curtis B. Storlie、Heather M. Quinn、William N. Rust、David
H. DuBois、David G. Modl、Andrea Manuzzato 和 Sean P. Blanchard。评估宇宙射线诱导的中子对
roadrunner 超 级 计 算 机 硬 件 的 影 响 。 IEEE , 12(2):445-454,2012 。 doi: /
。
Todor Mihaylov, Peter Clark, Tushar Khot, 和 Ashish Sabharwal。一套盔甲能导电吗?用于开卷问答
的新数据集。2018 年自然语言处理经验方法会议论文集,2381-2391 页,布鲁塞尔,比利时,
2018 年 10 月 - 11 月。 计 算 语言 学 协 会 。 doi: / v1 / d18 - 1260 。 URL
Shashi Narayan, Shay B. Cohen,和 Mirella Lapata。不要给我细节,只要总结!主题感知卷积神经网
络进行极端摘要。2018 年自然语言处理经验方法会议论文集,1797-1807 页,布鲁塞尔,比利
时 , 2018 年 10 - 11 月 。 计 算 语 言 学 协 会 。 doi: D18-1206 。 URL
Oktatasi Hivatal。Matematika í rÁsbéli vizsga。Középszintű ÍrÁsbéli Vizsga, 2023 年 5 月。
URL https://dload
。 Angol Nyelven 。
OpenAI 。GPT-4 技术报告。
OpenAI 。GPT-4 V(视觉)系统卡,2023b。
OpenAI。耳语,2023 年。URL https:// i/ whisper。
龙 欧 阳 、 Jeff Wu、 徐 江 、 Diogo Almeida 、 Carroll L. Wainwright 、 Pamela Mishkin 、 Chong
Zhang、 Sandhini Agarwal、Katarina Slama、Alex Ray、John Schulman、Jacob Hilton、Fraser
Kelton、Luke Miller、 Maddie Simens、Amanda Askell、Peter Welinder、 Paul Christiano、Jan
Leike、 Ryan Lowe 。训练语言模型, 使其遵循人类反馈的指令。预 印 本 ,2022 年 。 URL
。
瓦西尔·帕纳约托夫,陈伟柱,丹尼尔· 波维和桑吉夫· 库丹普尔。L ib rispe ech :基于公共领域有声书的 a sr 语
料库。2 015 年 IE E E 声学,语音和信号处理国际会议(I CA SS P),页 5 206 -52 10 。IE EE , 2015。
Denis Paperno 、GermÁn Kruszewski、Angeliki Lazaridou、Quan Ngoc Pham、Raffaella Bernardi、
Sandro Pezzelle、Marco Baroni、Gemma Boleda、Raquel FernÁndez。The LAMBADA dataset:需要
广泛的话语语境的单词预测。arXiv 预印本 arXiv:, 2016。
Vio ric a Pătrăuc ean 、 L uca s Sma ira 、 Anku sh Gup ta 、 Ad riÀ Rec a sen s Con tin en te 、 L a risa Ma rke eva 、
Dy lan Ba na rse 、Ska nda Kopp u la 、Jo seph Hey wa rd 、Ma te usz Ma lin o wsk i、Yi Ya n g 等。感 知测试 :多
模态视频模型 的诊 断基准 。arX iv 预 印本 arX iv :230 3786 , 2023。
29
彭宝林,Michel Galley,何鹏程,程浩,谢玉佳,胡玉,黄秋媛,Lars Liden,玉周,陈伟柱,等。检
查你的事实,再试一次: 用外部知识和自动化反馈改进大型语言模型。arXiv 预印本
arXiv:, 2023。
李昂,翁俊,Arju n Sin gh , Mu ka rra m Ta riq ,王锐, 张建南,Virgin ia Be au re gard, Pa trick Conne r, Ste ve
Grib b le 等。木星演进 :通过光电路交换机和软件定义网络改造谷歌的数据中心网络。在 A CM 202 2 年
SIGCOM M 会议论文集中,页 6 6 - 85,2022。
Alec Radford, Jeffrey Wu, Rewon Child, David Luan, Dario Amodei, Ilya Sutskever 。 语 言
模 型 是 无 监 督 的 多 任 务 学 习 者 。 Open AI 博 客 , 1(8):9 ,2019 。 UR L https://d 4
mucfpksyw models/language_
models_are_unsupervised_m 。
Alec Radford、Jong Wook Kim、Tao Xu、Greg Brockman、Christine mcleley 和 Ilya Sutskever。通过大规
模弱监督实现鲁棒语音识别。《机器学习国际会议》,第 28492-28518 页。PMLR, 2023 年。
Jack W. Rae, Sebastian Borgeaud, Trevor Cai, Katie Millican, Jordan Hoffmann, H. Francis Song, John
Aslanides, Sarah Henderson, Roman Ring, Susannah Young, Eliza Rutherford, Tom Hennigan, Jacob
Menick, Albin Cassirer, Richard Powell, George van den Driessche, Lisa Anne Hendricks, Maribeth Rauh
, 黄 柏 森 ,Amelia Glaese, Johannes Welbl, Sumanth Dathathri, Saffron Huang, Jonathan Uesato, John
Mellor, Irina Higgins, Antonia Creswell, Nat McAleese, Amy Wu, Erich Elsen, Siddhant M. Jayakumar,埃
琳娜·布查茨卡娅、大卫·布登、埃斯梅·萨瑟兰、凯伦·西蒙尼扬、米切 拉·帕格尼尼、劳伦·西弗
尔、莉娜·马滕斯、向洛琳·李、阿伊达·内玛扎德、埃琳娜·格里 博夫斯卡娅、多米尼克·多纳托、安吉
利基·拉扎里杜、亚瑟·门施、让-巴蒂斯特·莱斯皮奥、 玛丽亚·茨姆普基利、尼古拉·格里戈雷夫、道
格·弗里茨、Thibault·索蒂奥、曼塔斯·帕贾 尔斯卡、托比波伦、龚志韬、丹尼尔富山、西普连·德·马
松·秋、李、泰芬·特尔兹、弗拉基 米尔·米库利克、伊戈尔·巴布什金、艾丹·克拉克、迭戈·德·拉斯·卡
萨斯、奥蕾莉亚·盖 伊、克里斯·琼斯、詹姆斯·布拉德伯里、马修·约翰逊、布莱克·赫特曼、劳拉·韦丁
格、伊 森·Gabriel、威廉·s·艾萨克、爱德华·洛克哈特、西蒙·奥辛德罗、劳拉·里梅尔、克里 斯·戴
尔、奥利奥尔·维尼亚尔斯、卡里姆·阿尤布、杰夫·斯坦威、洛雷恩·贝内特、德米 斯·哈萨比斯、科
雷·卡乌库格鲁和杰弗里·欧文。扩展语言模型:训练 Gopher 的方法、分析与启示。CoRR,
abs/, 2021。
Aditya Ramesh, Mikhail Pavlov, Gabriel Goh, Scott Gray, Chelsea Voss, Alec Radford, Mark Chen 和
Ilya Sutskever。零样本文本到图像生成。国际机器学习会议,页 8821-8831。PMLR, 2021 年。
汉娜 · 拉什金、维塔利· 尼古拉耶夫、马修· 拉姆、劳拉· 阿罗约、迈克尔· 柯林斯、迪潘詹· 达斯、斯拉夫 ·
彼得罗夫、高拉夫·辛 格 ·托马尔、尤利娅 · 图尔克和大卫· 瑞特。自然语言生成模型中的归因测量。
计算语言学,第 1 -64 页,2023 。
Sco tt Reed , Kon rad Zo lna , E milio Pa riso tto, Se rgio Go mez Co lmen are jo , Alexan de r Nov iko v, Gab rie l
Ba rth -Ma ron, Ma i Gime ne z, Yu ry Su lsky, Jack ie Ka y, Jo st Tob ias sp rin gbe rg 等。多面手经纪人。a rX iv
预印本 arX iv :2 205 .061 75 , 2022。
帕克· 莱利、蒂莫西·多扎特、简·A · 博塔、泽维尔· 加西亚、丹· 加雷特、杰森· 里萨、奥尔汉· 菲拉特、诺亚· 康斯
特。Frmt :少样本区域感知机器翻译的基准。计算语言学协会学报,20 23 。
Hannah Ritchie, Veronika Samborska ,和 Max Roser。塑料污染。数据中的世界,2023 年。
30.。
亚当· 罗伯茨, 科林·拉斐尔和诺姆 · 沙齐尔。你能在语言模型的参数中装入多少知识?
《2020 年自然语言处理经验方法会议(EMNLP)论文集》,5418-5426 页,在线,2020 年 11
月 。 计 算 语 言 学 协 会 。 doi: / v1/ 。 URL https:
//
Thibault Sellam, Dipanjan Das 和 Ankur Parikh。BLEURT:学习文本生成的鲁棒指标。第 58 届计算
语言学协会年会论文集,7881-7892 页,在线,2020 年 7 月。计算语言学协会。doi: /
v1/2020。。URL
Uri Shaham, Elad Segal, Maor Ivgi, Avia Efrat, Ori Yoran, Adi Haviv, Ankit Gupta, Wenhan Xiong, more
Geva, Jonathan Berant 和 Omer Levy。《古卷:长语言序列的标准化比较》《2022 年自然语言处理经验
方法会议论文集》,12007-12021 页,阿布扎比,阿拉伯联合酋长国,2022 年 12 月。计算语言学协
会。URL
诺姆·沙齐尔。快速 transformer 解码:一个写头就够了。arXiv 预印本 arXiv:, 2019。托
比 Shevlane, Sebastian Farquhar, Ben Garfinkel, Mary Phuong, Jess Whittlestone, Jade Leung, 丹 尼
尔 Kokotajlo, Nahema Marchal, Markus Anderljung, 诺姆 Kolt 等。极端风险的模型评估。arXiv
预印本 arXiv: ,2023。
Fre da Sh i, Mirac Suz gun , Ma rkus Fre ita g ,王学智,Su ra j Sriv a ts, So rou sh Vo sou gh i, Hyun g Wo n Chun g,
Yi Tay, Sebastia n Ruder, Denny Zhou ,等。语言模型是多语言思维链推理机。IC LR, 2023 年。
Amanp re e t Sin gh , Vivek Na ta ra jan, Me e t Sh ah, Yu Jia n g, Xin le i Ch en, Dhruv Ba tra , De v i Parikh, an d
Ma rc us Roh rba ch 。朝向可以阅读的 VQA 模型。《IE E E /CV F 计算机视觉与模式识别会议论文集》,
第 8317-8326 页,2019 年 。
Aarohi Srivastava, Abhinav Rastogi, Abhishek Rao, Abu Awal Md Shoeb, Abubakar Abid, Adam Fisch,
Adam R. Brown 等 。 超 越 模 仿 游 戏 : 对 语 言 模 型 的 能 力 进 行 量 化 和 外 推 。 arXiv 预 印 本
arXiv:, 2022。URL 。
Ilya Sutskever、Oriol Vinyals 和 Quoc V Le。基于神经网络的序列到序列学习。《神经信息处理系统进
展》,2014 年第 27 期。
Oyvind Tafjord, Bhavana Dalvi 和彼得克拉克。证明作家:在自然语言上生成意涵、证明和溯因陈述。
在 《发现 》, 2020 年。 URL https://api 。 229371222。
NLLB 团队,Marta R. costa - jussous, James Cross, Onur Çelebi, Maha Elbayad, Kenneth Heafield,
Kevin Heffernan, Elahe Kalbassi, Janice Lam, Daniel Licht, Jean Maillard, Anna Sun, Skyler Wang,
Guillaume Wenzek, Al Youngblood, Bapi Akula, Loic Barrault, Gabriel Mejia Gonzalez, Prangthip
Hansanti, John Hoffman, Semarley Jarrett, Kaushik Ram Sadagopan, Dirk Rowe, Shannon sprute, Chau
Tran, Pierre Andrews, Necip Fazil Ayan, Shruti Bhosale, Sergey Edunov, Angela Fan, Cynthia Gao,
Vedanuj Goswami,Francisco GuzmÁn、Philipp Koehn、Alexandre Mourachko、Christophe Ropers、
Safiyyah Saleem、Holger Schwenk、Jeff Wang。No language left behind:缩放以人为中心的机器翻
译。2022.
31
Crossmodal-3600:大规模多语言多模态评估数据集。在 EMNLP, 2022 年。
Kocmi Tom、 Eleftherios Avramidis、 Rachel Bawden 、Ondřej Bojar 、 Anton Dvorkovich 、 Christian
Federmann、Mark Fishel、Markus Freitag、Thamme Gowda、Roman Grundkiewicz 等。2023 年机器
翻译会议(wmt23)的发现:llm 已经出现,但还没有完全实现。在 wmt23 -第八届机器翻译会议上,
页 198-216,2023。
Hugo Touvron, Thibaut Lavril, Gautier Izacard, Xavier Martinet, Marie-Anne Lachaux, timothacei Lacroix,
Baptiste rozire, Naman Goyal, Eric Hambro, Faisal Azhar 等。Llama:开放高效的基础语言模型。arXiv
预印本 arXiv:, 2023a。
Hugo Touvron, Louis Martin, Kevin Stone, 彼 得 Albert, Amjad Almahairi, Yasmine Babaei, Nikolay
Bashlykov, Soumya Batra, Prajjwal Bhargava, Shruti Bhosale 等。Llama 2:开放的基础和微调的聊天
模型。arXiv 预印本 arXiv:, 2023b。
Ashish Vaswani, Noam Shazeer, Niki Parmar, Jakob Uszkoreit, Llion Jones, Aidan N. Gomez,
Lukasz Kaiser, Illia Polosukhin。注意力就是你所需的一切。 CoRR, abs/, 2017。
URL
Pe ta r Ve ličkov ić 、 Ad riÀ Pu igdo m ène ch Ba d ia 、Dav id Budd en 、Raz van Pa sc anu 、And re a Ban ino 、
Misha Dashev sk iy 、 Ra ia Had se ll 、 Ch arles Blun de ll 。 c lrs 算 法 推 理 基 准 。 a rX iv 预 印 本
arXiv:2205 .15 659 , 2022。
Manoj Vishwanathan, Ronak Shah, Kyung Ki Kim, Minsu Choi。gpu 在各种 gpgpu 工作负载上的静
默数据腐败(sdc)漏洞。2015 年国际 SoC 设计会议(ISOCC), page 11-12, 2015。doi: /
。
王昌汉、吴安妮、胡安·皮诺。Covost 2 和大规模多语言语音到文本翻译。arXiv 预印本
arXiv:, 2020。
王 昌 汉 、 morgan Riviere 、 Ann Lee 、 Anne Wu 、 Chaitanya Talnikar 、 Daniel Haziza 、 Mary
Williamson、Juan Pino、Emmanuel Dupoux。Voxpopuli:用于表示学习、半监督学习和解释的大
规模多语言语音语料库。arXiv 预印本 arXiv:, 2021。
王欣、吴佳玮、陈俊坤、李磊、王元芳、王杨威廉。VATEX:用于视频和语言研究的大规模、高质 量
多语言数据集。在 ICCV, 2019 年。
王学智,魏志刚,戴尔舒曼斯,李国强,周伟强。自洽性改善了语言模型中的思维链推理。arXiv
预印本 arXiv:, 2022。
Jason Wei、Xuezhi Wang、Dale Schuurmans、Maarten Bosma、Brian Ichter、Xia Fei、Ed Chi、Quoc
Le 、 Denny Zhou 。 思 维 链 提 示 在 大 型 语 言 模 型 中 引 出 推 理 。 NeurIPS, 2022 年 。 URL
Laura Weidinger、John Mellor、Maribeth Rauh、Conor Griffin、Jonathan Uesato、posen Huang、Myra
Cheng、Mia Glaese、Borja Balle、Atoosa Kasirzadeh、Zac Kenton、Sasha Brown、Will Hawkins、
Tom Stepleton、Courtney Biles、Abeba Birhane、Julia Haas、Laura rimel、Lisa Anne Hendricks、
William S. Isaac、Sean Legassick、Geoffrey Irving、Iason Gabriel。语言模型危害的伦理和社会风
险。CoRR, abs/, 2021。URL
David Wetherall、Abdul Kabbani、Van Jacobson、Jim Winget、Cheng Yuchung、Brad Morrey、
Uma Parthavi Moravapalle、Phillipa Gill、Steven Knight、Amin Vahdat。提高网络
32
可 用 保 护 性 的 改 道 。 在 SIGCOMM 2023, 2023 。 URL https://d
肖俊斌、尚昕娣、姚安琪、蔡达生。Nex t - qa:解释时序动作的下一阶段问答。在 CV P R, 2021 年。
XLA 。 XLA: 优 化 TensorFlow 编 译 器 。 2019 。 [在 线 ;2023
年 12 月——)访问。
徐远忠,HyoukJoong Lee, Dehao 陈, Blake Hechtman,黄艳平,Rahul Joshi, Maxim Krikun, Dmitry
Lepikhin, Andy Ly, Marcello Maggioni 等。Gspmd: ml 计算图的通用可扩展并行化。arXiv 预印本
arXiv:, 2021。
Chi yao Hong、Subhasree Mandal、Mohammad A. Alfares、Min 朱、Rich Alimi、Kondapa Naidu
Bollineni、Chandan Bhagat、Sourabh Jain 、 Jay Kaimal、 Jeffrey Liang、Kirill Mendelev 、Steve
Padgett、Faro Thomas Rabe、Saikat Ray 、Malveeka Tewari、Matt Tierney、Monika Zahn 、 Jon
Zolla、Joon Ong 和 Amin Vahdat。B4 及之后:在谷歌的软件定义 wan 中管理可用性和规模的层次
结 构 、 分 区 和 不 对 称 。 在 2018 年 的 SIGCOMM ' 18 中 。 URL https:
//
李宇,Z iru i Wan g, Vija y Va sude van , Le gg ye g, Mo jta ba Se yed ho sse in i ,吴永辉。古柯 : 对比字幕是图
文基础款,2 022 a 。
李宇, 徐远忠, Ko h 李宇,T ha n g Luo n g, Gu n jan Ba id , Z iru i Wan g, Vija y Va sud eva n, Ale xan de r Ku,
Yinfe i Yan g, Bu rcu Ka ra go l Ayan , 等。缩放自回归模型, 用于内容丰富的文本到图像生成。a rX iv 预
印本 arX iv :2 206 .107 89 , 2(3):5, 2022b。
李宇,赵杰敏,Prateek Yadav 和 Mohit Bansal。用于视频定位和问答的自链式图像-语言模型。
arXiv 预印本 arXiv:, 2023。
周宇, 徐德静,李宇, 李宇, 赵周,庄月亭, 陶大成。Ac tiv ity Ne t-QA:一个通过问答理解复杂网络视频
的数据集。在 AA A I, 2019 年。
岳翔、倪元生、张、郑天宇、刘若奇、张、Samuel Stevens、姜东富、任卫明、孙宇轩、魏聪、李宇
、袁瑞斌、孙仁良、尹明、郑伯源、Yang、刘一波、黄艳平、孙欢、苏瑜、陈。Mmmu:面向agi 专
家的海量多学科多模态理解和推理基准,2023。
Rowan Zellers, Ari Holtzman, Yonatan Bisk, Ali Farhadi, Yejin Choi。Hellaswag:机器真的能完成你的句
子吗?arXiv 预印 arXiv:, 2019。
宇张,魏韩佳伟,James Qin,Wang,Ankur Bapna,浙怀陈,南心陈,Bo Li, Vera Axelrod, Gary
Wang等。谷歌 usm:将自动语音识别扩展到超过 100 种语言。arXiv 预印本 arXiv: ,2023。
郑传扬,刘正英,谢恩泽,李振国李宇,李宇李宇。渐进式提示改进了大型语言模型的推理,
2023。
周坤,朱,陈,陈,赵维鑫,陈徐德静,林彦凯,温继荣,韩佳伟。不要让你的 llm 成为一个评价标杆
骗子。arXiv 预印本 arXiv: ,2023。
Zhou Luo we i Xu Chen lia n g, Ja son J Corso 。网络教学视频程序自动学习研究。In A AA I Con fe renc e o n
Artific ia l Intellige nce , pages 7590-7598, 2018。
33
8.贡 献 和 致 谢
领导
Rohan Anil,联合领导,短
信
Sebastian Borgeaud, Co-Lead, Text
吴永辉,联合主笔,文本
Jean-Baptiste Alayrac,联合牵头,MM Vision
余嘉辉,联合牵头,M M Vision
Radu Soricut,联合牵头,MM
Vision
Johan Schalkwyk, Lead, MM Audio
Andrew M. Dai, Co-Lead, Data
Anja Hauth,联合 lead,
Data
Katie Millican ,联合领导,数
据
David Silver,联合领导,微调
斯拉夫·彼得罗夫(Slav Petrov), 联
合领导,微调
Melvin Johnson, Lead, Instruction Tuning
Ioannis Antonoglou, RL Techniques 联合领导
Julian Schrittwie se r, RL Techniques 联合领导
Amelia Glaese, Lead, Human Data
吉林辰,领先,安全
Emily Pitler,联合领导,工具使
用
Timothy Lillicrap ,联合领导,工具使
用 Angelik i Lazaridou,联合领导,
Eval
Orhan Firat,联合领导,
Eval
James Molloy,共同领导,
Infra
Michael Isard, Infra 联合负责
人
Paul R. Barham, Infra 联合负责
人
Tom Hennigan , Infra 联合领导
Benjamin Lee, Codebase & Parallelism Co-Lead Fabio
Viola, Codebase & Parallelism Malcolm Reynolds,
Codebase & ParallelismCo -Lead Yuanzhong Xu,
Codebase & Parallelism Ryan Doherty, Lead, Ecosystem
Eli Collins, Lead, Product
克莱门斯·迈耶, 联合主管, 运营
伊莉莎·卢瑟福, 联合领导, 行动
埃里卡·莫雷拉, 联合主管, 行动部
Kareem Ayoub,联合领导, 行动
梅加·戈埃尔,联合领导, 运营
核 心 贡
献者
乔
治·
塔
克·
恩里
克·
皮奎
拉
斯·
马克
西
姆·
克里
昆·
伊
恩·
巴
尔·
尼古
拉·
萨维
诺
夫·
伊
沃·
达尼
赫尔
卡·
贝
卡·
鲁洛
夫斯
核心贡献者 Anaïs 白安德斯·安德拉
森塔玛拉·冯·格伦拉克什曼雅加蒂·
梅赫兰·卡齐米卢卡
斯·冈萨雷斯米沙·卡尔曼雅库布·西
格诺夫斯基亚历山大·弗雷切特夏洛
特·史密斯劳拉·卡尔普列夫普罗
列夫·易安
Xi Chen James Lottes Nathan
Schucher Federico Lebron Alban
Rrustemi Natalie Clay Phil Crone
Tomas Kocisky Jeffrey Zhao Bartek
Perz Dian Yu Heidi Howard Adam
Bloniarz Jack W. Rae
Han Lu Laurent Sifre
Marcello Maggioni
Fred Alcober Dan
Garrette Megan Barnes
Shantanu Thakoor
Jacob Austin Gabriel
Barth-Maron Willia m
Wong Rishabh Joshi
Rahma Chaabouni
Deeni Fatiha Arun
Ahuja Ruibo Liu Eric
Li
Sarah Cogan
陈杰里米
34
双子座: 一个能力很强的多模态模型家族
35
双子座: 一个功能强大的多模态模型家族
核心贡献者巴
勃罗
Sprechmann
圣扎迦利
Nado
卢卡斯
Zilka
Flavien 普罗
斯特
Luheng 他
玛 丽 安 蒙 泰 罗
Gaurav Mishra
克里斯
Welty
Josh Newlan
大为贾
Miltiadis Allamanis
胡慧怡 Clara
拉乌尔· 德· 列德克尔
克
贾斯汀· 基尔
默
卡尔 Sarouf im
舒如提
Rijhwani
Shaobo 侯
Shrivastava Disha
学历 Baddepudi
亚历克
斯·戈尔丁
Adnan Ozturel
阿尔宾卡西尔
许中
丹尼尔孙
Devendra Sachan
Reinald Kim Amplayo
克雷格
Swanson
Dessie 佩特洛
娃
沙市 Nara yan
亚瑟 Guez
悉达多梵天
杰西卡· 兰登
Miteyan 帕特
尔
Ruizhe 赵
凯文 Ville la
丹王
朱文昊贾马
修 Rahtz 梅
Gim en e z 莱
格杨
Hanzhao 林詹
姆斯· 基林
佩特科维奇吉奥吉夫
戴安娜 Mincu
勃喜吴
萨勒姆 Hayka l
瑞 秋 Saputro
Kiran Vodra halli
贡
a
a
沙
h
a
a
要不是 Agra wa l
亚历克斯
核 Castro-Ros
心
George van den Driessche
献 王涛
者
詹
风扇杨
姆 Shuo-yiin 常
斯
· 保罗 Komarek
秦
罗斯 McIlroy
泽 开发
C
马里奥陆 č
n 我 ć
k
成国栋张
r
高尼姆法
a
A 迈克尔· 沙曼b 保罗 Natsev
h
a 保罗·米歇
n 尔
s
h 永程
u
Ya mini 邦萨尔
玛 思远乔
尼 克丽丝
克 曹
费
尔 Siamak Shakeri
南
多 克里斯蒂娜·巴特
菲尔德
将
霍 贾斯汀涌
金
斯 保罗·基 尚 ·鲁 宾斯 坦
B Shivani Agrawale
亚瑟高洁的人
n
基达 Sopa rka r
a
m 卡雷尔
Lenc
N
e 蒂莫西涌
y
s Aedan 教皇
h
罗兰马焦雷湖
b 杰基凯
u
r Priya Jhakra
所 世博王
罗
门 约书亚 Maynez
金
玛丽把
A
d 泰勒托宾r
安德里亚
i
Tacchetti
n Maja Trebacz
H 凯文·罗宾逊
u
t 亚许 Katariya
t
e 塞巴斯蒂安 · 里
r 德尔
36
核心贡献者佩
奇贝利Kefan
肖
Nimesh Ghelani
罗拉Aroyo
安布罗斯斯隆
尼尔 Houlsby
Xuehan 熊
甄杨
埃琳娜
Gribovskaya
乔纳斯· 阿德
勒
马特奥
Wirth
丽莎•李
音乐李
泰国人
Kagohara
Jay Pavagadhi
苏菲布拉杰
安娜 Bortsova
桑杰格玛沃特
Zafarali 艾哈迈
德
Tianqi 刘
理查德• 鲍威尔
Vija y Bolina
Iinuma 圆子
波琳娜
Zablotskaia
詹姆斯贝斯
勒
Da -Woon 涌
盖 Dozat
雷蒙娜 Comanescu
Xiance Si
杰里米·格
里尔
Guolong 苏
马丁 Pola cek
Raphaël Lopez Kaufman
西蒙 Tokum ine
古建胡
埃琳娜
Buchatskaya
英杰苗
双子座: 一个能力超强的多模态模型家族
穆罕默德 E lha waty
Aditya Siddhant
Nenad Tomasev
精卫兴
克里斯蒂娜· 格里尔海
伦米勒
Shereen 阿什拉夫
Aurko 罗伊
Zizhao 张
才气费罗
米洛斯岛 Besta
an Yeh Soravit
Changpinyo jiqi Mu
核
Oscar Chang Mantas
心
Pajarskas Carrie Muir
撰
verd Cohen Charline Le
稿
Lan Krishna Haridasan
人
Amit Marathe Steven
R Hansen Sholto Douglas
o Rajkumar Samuel
r Mingqiu Wang Sophia
y Austin Chang Lan Jiepu
Jiang Justin Chiu Jaime
B Alonso Lorenzo Lars
l Lowe Sjösund Sébastien
e Cevey Zach Gleicher Thi
v Avrahami Anudhyan
i Boral Hansa Srinivasan
n Vittorio Selo Rhys May
s Kostas Aisopos Léonard
Hussenot Livio Baldini
T Soares Kate
e BaumliMichae l B. Chang
d AdriÀ Recasens Ben
Caine Alexander Pritzel
K Filip Pavetic Fabio Pardo
l Anita Gergely Justin
i Frye Vinay Ramasesh
m Dan Horgan Kartikeya
e Badola Nora Kassner
n Subhrajit Roy Ethan
k Dyer
o 维克多•坎波斯
C
h
i
h
-
K
u
37
Gemini:一个非常有能力的多模式模式的家庭
核心贡献者
照顾叶云豪
唐
罗勒穆斯塔
法
朗奥兰
阿布金达尔
拉德• 维克拉
姆
Zhitao 龚
塞尔吉
Caelles
罗斯 Hemsley
格雷戈里·桑顿
Fangxiaoyu 冯
Wojciech Stokowiec
Ce 郑
菲比塞克是
Ca ğ 守护神
Unlu
Zhishua i 张
默罕默德·萨利赫
詹姆斯· 斯文森
马克斯
Bileschi
总裁帕蒂尔
Ankesh 阿南
德罗马戒指
(Katerina Tsihlas
Arpi 一旦
马可 Selvi
托比 Shevlane
米克尔罗德里格
斯
汤姆 Kwiatkowski
莎米拉 Daruki
基兰荣
艾伦·达福
尼古拉斯• 菲茨杰
拉德
克伦 Gu -Lem berg
米娜汗
丽莎·安妮· 亨德里克斯
玛丽 Pellat
弗拉基米尔• 范伯格
詹姆斯 Cobon -Kerr
塔 拉 Sa inath
Maribeth Rauh
赛义德· 哈迪· 哈希米理查
德·艾夫斯
雅娜哈森
亚光李
埃里克· 诺兰曹
元
内森伯德
Le 侯
蒂博 Sottiaux
san Kaushik
Shivakumar Joost van
核
amersfort Amol
心
Mandhane Pratik Joshi
贡
Anirudh Goyal 马修
献
Tung Andrew Brock
者
Hannah Sheahan
Vedant Misra Cheng LiM
Nemanja Rakićević
i
Mostafa Dehghani
c
Fangyu Liu Sid Mitta l
h
Junhyuk Oh Seb Noury
e
Eren Sezener Fantine
l
Huot 马修 La mm
a
Nicola De Cao 陈查理
P
a 贡 献 者
g Gamaleldin 曾
a Ed Chi
n
i 马赫迪 Mahdieh
n 伊恩
i Tenney
南华
A 伊凡 Petrychenko
l
帕特里克• 凯
恩
x
a 迪伦 Sca ndina ro
n Rishub 耆那
d 教徒的
r 乔纳森 Uesato
e
大猩猩达塔
M 亚当 Sadovsky
o 奥斯卡· 班扬u
亚历克斯
f Tomala
a
杜米尼克
Rabiej
e
k Shimu 吴
约翰• 张
S
贝蒂陈
a
m Pam G Rabinovitch
e 大卫·施泰
r 纳
雪莉涌
H
哈利 Askham
a
s
38
e
r
Gemini:一个非常有能力的多模式模式的家庭
贡献者
Gautam Va sudevan
爱 德 华 Leurent
Ionut Georgescu
南魏
艾薇郑
彼得亚雷
Stanczyk
你们张
Subhajit Naskar
迈克尔·阿扎
克里斯托弗 Choquette
马修•约翰逊
亚 当 Paszke
中正赵
Jaume Sanchez Elias
Afroz Mohiuddin
Faizan 默罕默德
金苗
安德鲁。李
尼诺 Vie illard
“Potluri
简公园
Elnaz• 陈
嘉庚张
杰夫
Stanway
画 Garmon
Abhijit Karmarkar
哲东
郑大世李
Avira l 库马尔
生产率周
乔纳森均等的
威廉·艾萨克
哲陈
约翰逊贾
安瑟伦 Levskaya
Zhenkai 朱
克里斯
Gorgolewski
彼得·格拉博夫斯
基
于毛
阿尔贝托· 马尼
凯盛么
哈维尔 Snaider 诺
曼 Casagra nde 保
罗 Suganthan 埃
文·帕 尔 默 迈克
尔·芬克 丹尼尔
和或
维卡斯•亚达夫
ruqui Isha Arkatkar
Nanxin Chen Izhak
贡 Shafran Rama
献 Pasumarthi Nathan
者
Lintz Anitha
G Vijayakumar Lam
e Nguyen Thiet Pedro
o Valenzuela Cosmin
f Paduraru Daiyi Peng
f Katherine Lee
r Shuyuan Zhang Somer
e Greene Duc Dung
y Nguyen Paula
Kurylowicz Sarmishta
I Velury Sebastian
r Krause Cassidy Hardin
v Lucas Dixon Lili
i Janzer Kiam Choo
n Ziqiang 冯彪张
g achintya Singhal Tejasi
Latkar Mingyang
E Zhang Quoc Le Elena
d Allica Abellan Dayou
w Du Dan McKinnon
a Natasha Antropova
r TolgaBolukbasi Orgad
d Keller David Reid
Daniel Finchelstein
L Maria Abi Raad Remi
o Crocker Peter Hawkins
p Robert Dadashi Colin
e Gaffney Sid Lall
r
Ken Franko Egor
Filonov Anna
M Bulanova Rémi
a Leblond
n
a
a
l
F
a
39
Gemini:一个非常有能力的多模式模式的家庭
贡 献 者 Luis
C. Cobo 开尔
文徐
菲利克斯• 菲
舍尔
徐俊
克里斯蒂娜
Sorokin
克里斯阿尔
贝蒂
Chu-Cheng 林
科林·埃文斯
郝周
Alek Dimitriev
汉娜• 福布斯
迪伦 Banarse
卓拉东
耶利米刘
马克 Omernick
科尔顿主教
Chintu 库马尔
瑞秋 Sterneck
瑞安福利
Rohan 耆那
教徒的
Swaroop Mishra
加威夏
泰勒Bos
杰弗里 Cideron
•在
弗朗西斯
科·Piccinno
Xingyu 王
Praseem Banzal
Petru Gurita
阿达马
种脐 Noga
Premal 沙
丹尼尔·曼科维茨
亚历克斯
Polozov
内特 Kushman
维多利亚
Krakovna
萨沙棕色
MohammadHossein Bateni
丹尼斯段
弗拉德 Firoiu
Megha na Thotakuri
汤姆•
Anhad Mohananey
马修感性
Sidharth Mudga l
Sertan Girgin
回族李
嘉你们
献
尔
杉
i
a
e
约翰 Mellor
阿布·夏尔马
贡
Aliaksei Severyn
者
乔纳森·赖
的
凯西吴
方
法 我想陈
获
得 Heng-Tze 程
玲 大卫·米勒
子
的 尼古拉斯
故 Sonnerat
事
丹尼斯
迈 Vnukov
克
罗里格雷
邝
詹 詹妮弗 ·比 蒂
姆
艾米丽
斯 Caveness
·
李 利宾呗
。
索 朱利安
普 Eisenschlos
克 达丽娅·艾
里 尔·巴达维
斯
托 亚历克斯
弗 Korchemniy
紫
多美蔡
全 咪咪 Jasarevic
元 Weize 香港
苏 把刀
米
特 产品郑
B
a 弗雷德里
g 克·刘
r
i 风扇杨
D 鲁
a 伊·朱
n
马克·盖勒
l
田惠 Teh
a
杰森 Sa nm iya
S
i Evgeny Gladchenko
n
o Nejc Trdinp
安德烈 Soza nschi
l
丹尼尔·富 山
n
i 埃文·罗森
k
o Sasan Tavakkolv
产品毛羽雪
S
a 陈艾尔金德
b 奥利弗樵夫
l
约翰卡彭特
a
拉 乔治 Papa maka rios
莫
斯
格
40
41
Keyvan Amiri
叶林的金
42
角色定义如下:
领导:在整个项目中对子团队负责的个人。
核心贡献者:在整个项目中有重大影响的个人。
• 贡献者:对项目有贡献并部分参与的人。
• 项目领导: 负责 Gem in i 项 目 的 组 织 工 作
• 整体技术主管:负责整体 Gemini 项目的技术指导
在每个角色内,贡献是相等的,并以随机顺序列出。每个角色内的排序并不表示贡献的顺序。
Ge mini 是一个跨谷歌的项目,成员来自谷歌深度思维( GD M)、谷歌研究(G R)、知识与信息(K& I)、
核心机器学习、云、实验室等。
我们 感 谢我 们 的审 稿 人和 同 事对 报 告的 宝 贵讨 论 和反 馈 ——a lex and ra Be lia s 、 Arie lle Bie r 、E le ano r To
mlinson 、 E lsp e th Wh ite 、 E mily Hosse llman 、 Ga by Pea rl 、 He len Kin g 、 Ho llie Dob so n 、Ja c lyn
Konz e lmann 、 Jaso n Ge lman 、 Jenn if e r Be rosh i 、 Joe l Mo ss 、 Jon Sma ll 、 Jon a tha n Filde s 、 Oli
Gaymond 、Priya Jhakra、Re be cca Bland、Re ena Jana 和 Tom Lue。
谷歌众多团队的奉献和努力使我们的工作成为可能。我们要感谢 Abhi Mohan、Adekunle Bello、
Aishwarya Nagarajan、Alejandro Lince、Alexander 陈、Alexander Kolbasov、Alexander Schiffhauer、
Amar Subramanya、Ameya Shringi、Amin Vahdat、Anda rabatiki、Anthony Gross、Antoine Yang、
Anthony Green、Anton Ruddock、Art Khurshudov、Artemis 陈、Arthur Argenson、Avinatan Hassidim、
Beiye 刘、Bin Ni、Brett Daw、Bryan Chiang、Burak Gokturk、Carey Radebaugh、Carl croous、
Carrie Grimes Bostock、Charbel Kaed、Charlotte Banks、Che Diaz、Chris Larkin、Christy Lian、
Claire Cui、Clement Farabet、Daniel Herndon、Dave Burke、David Battle、David Engel、Dipannita
Shaw、Donghyun Koo、Doug Ritchie、Dragos Stefanescu、Emre sarchie、Eric Herren、Estella King、
Fatema Alkhanaizi 、 Fernando Pereira 、Gabriel Carvajal 、 Gaurav Gandhi 、Goran Pavičić、 Harry
Richardson、Hassan Wassel、Hongji Li、Igor Ivanisevic、Ivan Jambrešić、Ivan Jurin、Jade Fowler、Jay
Yagnik、Jeff Seibert、Jenna LaPlante、Jessica Austin 陆建兴、Jin Huang、乔纳森·卡顿、约什·伍德
沃德、约书亚·福斯特、卡特里娜·黄、阮开文、基拉·尹、康斯坦丁·沙莱莫夫、李坤、 李宏、莉莉·泰勒、
沈龙飞、卢克·梅西耶、马尼亚·阿布迪、曼努埃尔·桑切斯、马里奥·卡洛 斯·科尔特斯三世、迈赫迪·吉萨
西、迈卡·莫斯利、迈克尔·本德斯基、迈克尔·哈里斯、米希 尔·帕拉德卡尔、南迪塔·杜基帕蒂、内森·
卡特、内森·沃森、尼克希尔·丹德卡尔、尼桑 特·兰卡、奥贝德·萨瓦纳、奥尔坎·瑟奇诺卢、奥利维尔·
拉孔布、普拉纳什·斯里尼瓦桑、普 拉文·库马尔、拉胡尔·苏克坦卡尔、赖亚·哈德塞尔、Rajagopal
Ananthanarayanan, Roberto Lupi, Rosie Zou, Sachin Menezes, Sadegh Jazayeri, Sameer Bidichandani, Sania
Alex, Sanjiv Kumar, Sarah Fitzgerald, Sebastian Nowozin, Shannon Hepburn, Shayne Cardwell, Sissie Hsiao,
Srinivasan Venkatachary, Sugato Basu, Sundar Pichai, Sundeep Tirumalareddy, Susannah Young, Swetha
Vijayaraghavan, Tania Bedrax-Weiss, Terry 陈 ,Ting 刘 ,Tom Cobley, Tomas Izo, Trystan Upstill, Varun
Singhai, Vedrana klariki trupevovic, Victor Cai, Vladimir Pudovkin, Vu Dang,赵文波,Wesley Crow,
Wesley Szeng,宋晓丹,祖亚洲,田晔,王一聪,王一兴,Zachary Jessup,庞振川,Yang,Zoubin
Ghahramani。我们还要感谢 AlphaCode 团队、Borg 调度团队、设施团队、Gemini 演示团队、全球服务
器操作(GSO) 团队、JAX 团队、法务团队、ML SRE 团队、ML 超级计算机(MLSC)团队、PartIR 团队
、平台基础设施工程(PIE)团队和 XLA 编译器团队。
我们感谢谷歌中没有明确提到的每一个人,他们分享了兴奋,对早期 Gemini 模型给出了反馈, 或
者创建了有趣的 Gemini 演示使用,并在这个项目的许多方面与 Gemini 核心团队合作或支持。
43
9.附 录
. MMLU 基 准 的 思 想 链 比 较
我们对比了几种 MMLU 的思维链方法,并在本节中讨论它们的结果。我们提出了一种新的方法, 即
模型产生 k 个思维链样本,如果模型在阈值以上是自信的,则选择多数投票,否则听从贪婪样本选择
。根据每个模型的验证分割性能对阈值进行优化。所提出的方法被称为不确定性路由的思维链。这
种方法背后的直觉是,与最大似然决策相比,当模型明显不一致时,思维链样本可能会 降低性能。
我们在图 7 中比较了 Gemini Ultra 和 GPT-4 上所提出方法的收益。我们发现,与仅使用思维链样本相
比,GeminiUltra 从这种方法中获益更多。GPT-4 的性能从贪心采样的 %提高到32 个样本的不确
定性路由思想链方法的 %,但它已经在使用 32 个思想链样本时实现了这些增益。相比之下,
Gemini Ultra 将其性能从贪心采样的 %显著提高到 32 个样本的不确定性路由思维链方法的 %
,而仅使用 32 个思维链样本的性能则略微提高到 %。
图 7 | MMLU 上具有不确定性路由的思想链。
44
. 能 力 和 基 准 任 务
我们使用超过 50 个基准作为一个整体来评估文本、图像、音频和视频的 Gemini 模型。我们为文本
理解和生成中的六种不同能力提供了详细的基准任务列表:事实性、长上下文、数学/科学、推 理、
摘要和多语言性。本文还列举了用于图像理解、视频理解和音频理解任务的基准。
• 事 实 性 :我们使用 5 个 基准:BoolQ (Clark 等人,2019)、NaturalQuestions-Closed (Kwiatkowski
等人,2019)、naturalquestions - retrieval (Kwiatkowski 等人,2019)、RealtimeQA (Kasai 等
人,2022)、TydiQA-noContext 和 TydiQA-goldP (Clark 等人,2020)。
• 长 上 下 文 :我们使用 6 个基准 :NarrativeQA (Kočiský 等 人 ,2018),Scrolls-Qasper, Scrolls-
Quality (Shaham 等人,2022),XLsum (En), XLsum(非英语语言)(Hasan 等人,2021),以及
另一个内部基准。
• 数 学 /科 学 :我们使用 8 个基准:GSM8k(带 CoT) (Cobbe 等人,2021),Hendryck 's Math pass@1
(Hendrycks 等人,2021b), MMLU (Hendrycks 等人,2021a), Math- stackexchange, Math- amc
2022-2023 问题,以及其他三个内部基准。
• 推 理 :我们使用了 7 个基准:BigBench Hard(带 CoT) (Srivastava 等人,2022)、CLRS (velikoviki 等
人,2022)、Proof Writer (Tafjord 等人,2020)、Reasoning- fermi 问题(Kalyan 等人,2021)、
Lambada (Paperno 等人,2016)、HellaSwag (Zellers 等人,2019)、DROP (Dua 等人,2019)。
• 总结 :我们使用了 5 个基准:XL Sum(英语)、XL Sum(非英语语言)(Hasan 等人,2021)、
WikiLingua(非英语语言)、WikiLingua(英语)(Ladhak 等人,
2020 ) 、 XSum (Na rayan et a l. ,
2018)。
• 多语言性 :我们使用了 10 个基准:XLsum(非英语语言)(Hasan 等人,2021)、WMT22 (Kocmi 等人,
2022) 、 WMT23 (Tom 等人, 2023) 、 FRMT (Riley 等 人,2023) 、 WikiLingua( 非英语语 言
)(Ladhak 等人,2020)、TydiQA(无上下文)、TydiQA (GoldP) (Clark 等人,2020)、MGSM (Shi
等人,2023)、翻译的 MMLU (Hendrycks 等人,2021a)、NTREX (Federmann 等人,2022)、
FLORES-200 (Team 等人,2022)。
• 图 像 和 视 频 :我们使用 9 个图像理解基准:MMMU (Yue 等人,2023)、TextVQA (Singh 等人,
2019) 、 DocVQA (Mathew 等人,2021) 、 ChartQA (Masry 等人, 2022) 、 InfographicVQA
(Mathew 等人,2022)、MathVista (Lu 等人,2023)、AI2D (Kembhavi 等人,2016)、VQAv2
(Goyal 等人,2017)、XM3600 (Thapliyal 等人,2022)用于多语言图像理解,以及 6 个用于视频
理解的基准:VATEX (Wang 等人,2019)用于两种不同语言的字幕,YouCook2 (Zhou 等人,
2018),NextQA(Xiao 等人),
2021)、Activity Net-QA (Yu et al., 2019)和感知测试 MCQA (Pătrăucean et al., 2023)。
• 音频 :我们使用了 5 个基准,包括自动语音识别(ASR)任务,如 FLEURS (Conneau 等人,
2023)、VoxPopuli (Wang 等人,2021)、多语言 librisspeech (Panayotov 等人,2015)和自动语音
翻译任务,如 CoVoST 2 (Wang 等人,2020)。
45
. 定 性 的 例 子
本节展示了提示 GeminiUltra 模型的样例定性示例。图 8、图 9、图 11、图 13、图 14 和图 15 展示了对
图表、自然图像和模因进行图像理解任务的多模态推理。图 10 显示了 Gemini Ultra 图像生成功能的
一个示例,其中用户生成图像和文本的交错序列来设计博客文章。除了英语,图 16 展示了model 在多
语言设置下理解图像的能力。Gemini 模型在数学的多模态图像理解和推理方面也表现出很强的性能
,如图 8、18 和 19 所示。图 20 是一个复杂多模态推理的例子,展示了模型如何为给定的用户任务组
成复杂的图像理解、代码生成和指令遵循能力。在图 17 中,我们看到了该模型能够生成工作代码并遵
循复杂用户指令的另一个例子。最后,图 21 显示了 Gemini Ultra 通过对一组临时连接的帧进行推理来
理解视频的能力的示例。
46
. 对 数 据 的 图 表 理 解 和 推 理
图 8 |解决需要多模态图表理解的问题。模型必须阅读文本,理解不同数据点之间的联系,并对它
们进行推理,以推荐一个有趣的点,并按照说明生成一个markdown 表(显示正确渲染)。
来源:《数据中的世界》(Ritchie et al., 2023)。
47
你知道这是什么植物吗? 我怎样才能最好地照顾它?
模型响应
这是一种波斯盾植物。它是一种热带植物,原产于东南亚。它是一种
很受欢迎的室内植物,因为它很容易照料,并且有美丽的紫色叶子。
波斯盾 叶植 物更 喜欢明 亮、 间接 的光 线。 它 们可 以忍 受一些 阳光 直射 , 但过 多 的 阳 光
直 射 会 灼 伤 它 们 的 叶 子 。 它 们 也 喜 欢 温 暖 的 温 度 和高湿度。
波斯盾草需要定期浇水, 但不能让它们坐进去
水。土壤应保持湿润,但不能浸湿。他们也受益于经常被雾气覆盖。
波斯盾形植物在生长季节可以每两周施肥一次。一个平衡的肥料是
不错的选择。
波斯盾叶植物易受害虫侵害, 如粉虱、蜘蛛螨等。这些害虫可以用
杀虫肥皂或印楝油来控制。
波斯盾属植物可通过插枝繁殖。扦插应采在
春天或夏天,应该扎根于水或湿润的盆栽混合。
. 多 模 态 问 答
图 9 |回答多模态信息搜索查询。该模型能够识别图像中显示的特定植物,并提供有关该植物的信息
。该模型对输入错误显示出鲁棒性,因为尽管有输入错误,它仍然能够理解用户的问题。
来源: Gem ini 团队的一位作者拍摄的照片。
48
提示
请写一篇博客, 讲述你在纽约的一次旅行,一只狗和它的主人在那里玩得很开心。包括几张
狗狗在不同地标前开心地摆姿势的照片。
模型响应
嗨,我是库珀。我是一只 2 岁的金毛狗,喜欢旅行。上个月,我的家人和我去
了纽约城。那是我第一次来纽约,我玩得很开心!
我们住在时代广场附近的一家酒店里。看到所有明亮的灯光和 人。我们
去看了一场百老汇的演出, 我甚至还见到了一些演员。
纽 约 城 中 我 最 喜 欢 的 地 方 之 一 是 中 央 公 园 。 中 央 公 园 又 大 又 漂 亮 。 我喜 欢 到 处 跑 , 玩 接 球
游 戏 。 我 们 还 去 了 自 由 女 神 像 和 帝 国大厦。我很兴奋能看到所有著名的地标建筑。
我在纽约城玩得很开心。它绝对是我最喜欢的旅游地方之一。我等不及 哪天
再去那里了!
. 交 错 生 成 图 像 和 文 本
图 10 |生成交错的文字和图像。该模型能够按照指令生成一篇与文本密切相关的图像的博客文章, 以
及在所有图像中显示高水平一致性的狗图像。
49
. 图 像 理 解 与 推 理
图 11 |解决多模态推理问题。该模型能够识别图像中的形状,理解它们的属性并推理它们之间的关
系,以预测下一个对象。
来源: Gem ini 团队的一位作者拍摄的照片。
50
. 几 何 推 理
图 12 |解决几何推理任务。该模型显示出对任务的良好理解,并能够提供有意义的推理步骤,尽管
指令略有不明确。来源:Lu et al.(2021)。
. 关 于 对 象 的 信 息 查 找
图 13 |使用多模态输入解决谜题。模型识别图像中的物体,并识别出连接两个物体的共性。
来源: Gem ini 团队的一位作者拍摄的照片。
51
. 基 于 视 觉 线 索 的 多 模 态 推 理
图 14 |识别图像中的物体(帝国大厦),并识别出这些物体是什么,即使图像中有小程度的视觉失真。基于
图像,该模型还能够正确识别拍照者的精确位置。
来源: Gem ini 团队的一位作者拍摄的照片。
52
. 多 模 态 幽 默 理 解
图 15 |对模因幽默的解释。该模型正在显示出一种能力,它不仅能够描述图像中正在发生的事情, 而
且还能够描述它的含义,即使在图像或提示中没有明确提到文化背景。
来源:Hwang and Shwartz(2023 )。
53
提示
根据这个图表,解释一下我应该给我的祖父母和祖父母起什么名字
模型响应
在你父亲那边,你会叫你的祖父母Yéye 和 Nˇ爱爱。在你母亲那一
边,你会叫你的祖父母 WÀig¯ong 和 WÀipó。
. 多 语 言 环 境 下 的 常 识 推 理
图 16 图像中的|常识推理。该模型能够理解图中表示的关系,并在多语言环境下对它们进行推理。
来源: 图片由双子座团队的一位作者创建。
54
. 推 理 和 代 码 生 成
提示
创建一个名为“ 负鼠搜索” 的 web 应用程
1. 每次你做一个搜索查询,它应该将你重定向到一个谷歌搜索与相同查
询,但是前面有负鼠这个词。
2. 它在视觉上应该类似于谷歌搜索,
3. 不是谷歌的 logo, 而是一张从网上找来的负鼠图片。4.
它应该是一个单独的 htm l 文件,没有单独的 js 或 css 文5.
页脚应该写着“支持谷歌搜索” 。
模型响应( 渲染代码)
以下是负鼠搜索的代码:
1 < !DOCTYPE html>
2 <html>
3 < > 头
4 <标题>负 鼠 搜索< /名称>
5 <时 尚 >
6 身体{
7 字体-家族:A ri al, sans - serif;
8 保证金:0;
9 填充:0;
10 }
11
12 标题{
13 −背景颜色:# 333;
14 颜色:# fff;
15 文本−对齐: 中 心 ;
16 填充:1rem 0;
17 }
18
19 {.search−酒 吧
20 显示:flex;
21 证明−内容:中心;
22 对齐−项目: 中心;
23 高度:50 px;
24 保证金−:1 快速 眼
25 }
26
27 .search−输入{
28 宽度:50%;
29 填充: 快速眼
30 边框:1px 实线#ccc;
31 边境−半径:5 px;
32 }
33
34 .search−按钮{
35 保证金−左:1 快 速
36 填充: 1rem;
37 边框:1px 实线#ccc;
38 边境−半径:5 px;
39 光标:指针;
40 }
41
42 页脚{
43 −背景颜色:# 333;
44 颜色:# fff;
45 文本−对齐: 中 心 ;
46 Padding: 1rem 0;
47 保证金−:1 快速 眼
48 }
49 > < /风
50 > < / 头
51 身体
52 <标题>
53 <h1>负鼠搜索</h1>
54 <img src="
55 1200px - didelphis_virg ini a .jpg"alt="负鼠" width="100"> 56
头> < /
57
58 <div class="搜索−栏”>
59 <输 入 类 型 ="text"class = "s e a rc h−输入"占位符=" s ea rch the web">
60 <按 钮 类 ="搜索−按钮“>搜索> < /按钮
61 < /div>
55
图 17 |根据用户请求为网站编写代码。模型遵循用户定义的指令和要求,并将其转换为功能代码。
56
这段代码创建了一个简单的 web 应用程序,看起来类似于谷歌搜索,但带有负鼠徽标。当
你输入一个搜索查询并点击“ 搜索” 按钮时, 它会将你重定向到一个谷歌搜索, 在你的查询
开头添加了“ 负鼠” 这个词。如页脚所示, 该应用程序由谷歌搜索提供支持。
. 数学 :微 积 分
图 18 |解决微积分问题。该模型能够通过逐步的解释和正确定义的 L aTe X 方程得到一个微积分问题的解
。
来源: 问题由麦克米伦学习提供。
57
. 多 步 推 理 和 数 学
图 19 |解决多步数学问题模型能够理解任务,并生成正确计算值的 markdown 表。它还明确地遵循
指示来显示数字的来源,并回答任务中给出的问题。
来源:OktatÁsi Hivatal(2023 ,第 20 页)
58
提示
2018 年 , A 工 厂 生 产 了 价 值 5 亿 福 林 的 商 品 , 而 B 工 厂 生 产 了价 值 4 亿 福
林 的 商 品 。 根 据 他 们 的 长 期 规 划 , A 厂每年增产 5%,B 厂每年增产 6%。
上 述 计 划 曾 在 某 经 济 网 站 上 公 布 。 文 章 评 论 区 引 发 了 一 场 争 论
: 有 用 户 称 , 两 家 工 厂 的 产 量 差 值在未来几年将越来越小。
计算下表的缺失值,证明上面的说法不正确。表头
:| 2018 | 2019 | 2020 | 2021 |
A 厂产量(m ln) | 500 | | | |
B 厂产量(m ln ) | 400 | | | |
模型响应( 渲染后的 Ma rkdown)
A
B
厂 2019 年 产 量 为 500 * 105 =
工 厂 2019 年 产 量 为 400 * 106 =
亿 福 林 。
亿 福 林 。
2019 年产量差为 525 - 424 = 亿福林。
A 厂 2020 年产量为 525 * 105 = 55125 万福林。
B 工厂 2020 年产量为 424 * = 亿福林。
2020 年产量差为 551 .25 - = 10181 万福林。
A 厂 2021 年产量为 551 .25 * 105 = 57881 万福林。
B 工厂 2021 年产量为 * = 47641 万福林。
2021 年产量差值为 578 .81 - = 亿福林。
可以看到,两家工厂的产量差其实是
增加,而不是减少。因此,声称的体积之差
在接下来的几年里,两家工厂之间的生产将变得越来越小不是真
提示
我 希 望 你 取 左 上 角 子 图 所 示 的 函 数 , 将 其 乘 以 1000 , 然 后将
其 与 左 下 角 子 图 所 示 的 函 数 相 加 。 生 成 单 个 结 果 图 的 matplotlib 代 码
。
模型响应( 渲染代码)
. 复 杂 的 图 像 理 解 、 代 码 生 成 和 指 令 遵 循
图 20 |应用于代码生成的多模式推理能力。双子座Ultra 需要执行反向图形任务来推断生成绘图的
代码,执行额外的数学转换,并生成相关代码。
来源: 由双子座团队的一位作者生成的图。
59
. 视 频 理 解 与 推 理
图 21 |视频对视频中呈现的情况的理解和推理。在这里,我们提供了一个视频作为模型的输入, 以
及一个文本提示(这里提供的图像仅用于可视化目的)。该模型能够分析视频中发生的事情,并 就视
频中的动作如何可以更好地提供建议。
视频来源:《足球/ 足球点球失误》
3mvs
60