【谷歌】【中文版】Gemma技术报告_16页_905kb
报告摘要
Gemma: 基于Gemini的开放模型研究与技术总结
核心内容
Gemma 是一个基于 Google 的 Gemini 模型构建的开放模型系列,旨在提供轻量级、高性能的模型,适用于各种应用场景。该模型分为两个版本:20 亿参数(Gemma 2B)和 70 亿参数(Gemma 7B),分别针对不同的计算环境和使用需求。
主要观点
- 模型性能:Gemma 在多个学术基准测试中表现优异,尤其在数学和代码生成任务中显著优于其他开放模型。
- 训练与部署:模型使用 TPUv5e 进行训练,采用分布式训练技术与优化方法,确保高效的训练过程。同时,模型在 GPU、TPU 和 CPU 上均可部署,满足不同开发环境的需求。
- 安全与责任:Gemma 的开发强调安全性,通过过滤预训练数据、使用安全评估基准、以及负责任的部署方法,确保模型在实际应用中的安全性。
- 开源与社区:Gemma 提供预训练和微调检查点,以及开源代码库,鼓励社区参与模型的进一步研究和开发。
- 模型改进:Gemma 基于多种改进技术,如多查询注意力、RoPE 嵌入、GeGLU 激活函数和 RMSNorm 标准化器,提升模型性能和效率。
关键信息
模型架构
- 架构:基于 Transformer 解码器,使用 8192 个令牌的上下文长度。
- 参数:
- Gemma 2B:
d_model=2048,层数=18,前馈隐藏层=49152,头数=8,KV头数=16,词汇大小=256k。 - Gemma 7B:
d_model=3072,层数=28,前馈隐藏层=32768,头数=16,KV头数=16,词汇大小=256k。
- Gemma 2B:
- 参数计数:
- Gemma 2B: 嵌入参数 524,550,144,非嵌入参数 1,981,884,416。
- Gemma 7B: 嵌入参数 786,825,216,非嵌入参数 7,751,248,896。
训练基础设施
- 训练设备:使用 TPUv5e 集群,256 个芯片,配置为 16x16 的 2D 环面。
- 训练规模:
- Gemma 7B: 4096 个 TPUv5e,16 个 pod。
- Gemma 2B: 512 个 TPUv5e,2 个 pod。
- 训练方法:使用 Jax 编程范例和 GSPMD 分区器,进行高效的分布式训练。
碳足迹
- 预训练碳排放:约 1312 吨 CO₂,基于 TPU 数据中心的能源使用情况和碳排放数据计算得出。
- 碳中和:谷歌数据中心为碳中性,通过能源效率、可再生能源和碳抵消实现。
训练数据
- 数据来源:主要使用英文文本数据,包括网络文档、数学和代码。
- 数据过滤:采用启发式方法和基于模型的分类器,过滤有害、低质量内容和敏感数据。
指令调优
- 监督微调 (SFT):使用纯文本、纯英语合成和人类生成的提示响应对进行训练。
- 强化学习 (RLHF):基于人类偏好数据训练奖励模型,优化模型输出以符合人类偏好。
- 自动评估:使用高容量模型作为自动评估者,进行并排比较,以减少人工评估的负担。
安全与责任
- 记忆评估:测试模型对训练数据的记忆能力,防止隐私泄露。
- 安全过滤:使用 Google Cloud DLP 工具识别并过滤敏感数据。
- 安全基准:模型在 6 个安全基准和人类偏好评估中表现优异,优于竞争对手。
评估结果
- 学术基准:在多个任务中表现突出,如 MMLU、MBPP、GSM8K、HumanEval 等。
- 胜率:Gemma 7B 在遵循安全说明任务中胜率高达 58%,在人类偏好评估中胜率 51.7%。
- 对比模型:与 Mistral 7B v0.2 Instruct 相比,Gemma 在多个基准上表现更好。
风险与缓解措施
- 风险:开放模型可能被滥用,用于生成虚假信息、Deepfake 等。
- 缓解措施:采用过滤方法、安全评估和道德审查,确保模型的安全性。
社区与未来方向
- 开源社区:鼓励社区参与模型研究和开发,推动 AI 技术进步。
- 未来挑战:需要进一步研究模型的鲁棒性、一致性、复杂推理能力,以及更全面的评估框架。
- 跨平台支持:Gemma 在多个平台上提供支持,包括 Kaggle、Keras 等。
结论
Gemma 是一个基于 Gemini 的开放模型系列,具有出色的性能、安全性和可部署性。其在多个学术基准测试中表现优异,特别是在数学和代码生成任务中。通过严格的训练和评估流程,Gemma 为 AI 社区提供了高质量、负责任的模型,有助于推动 AI 技术的持续发展。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载