空白演示
Lorem ipsum dolor sit amet, consectetur adipisicing elit.
腾讯AngelPTM大模型训练框架优化与实践
支撑混元大模型训练的训练框架
3
1 大模型发展趋势和训练面临的挑战
大模型成为人工智能发展的重要方向
模型参数规模
指数级增长
• 生成式大模型突飞猛进,5年时间,模型参数规模增长100万倍,达到万亿量级
• Scaling Law[1]:数据越多、模型越大,模型学习能力越强,模型效果越好
[1OpenAI“ScaingLawsforNeuralLanguageModes,htps//arxvorg/abs/200108361,..i:t”ll] 2020
大模型发展趋势-模态变化
文生文 文生图 文生视频 多模态 全模态
ChatGP
T
Llama3
Stable Diffusion
DiT
Sora
STDi
T
GPT4V
Gemini GPT5
大模型发展趋势-MOE以及更长Context Window
1 GLaM: Efficient Scaling of Language Models with Mixture-of-Experts
2 Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity
3 Lifelong Language Pretraining with Distribution-Specialized Experts
4
Expert 1 Expert 2 … Expert 16
门控模块FFN 层
120层
Self-Attention 层(共享参数)
Decoder-Only
总参量:~
训练数据:~13T Tokens
激活2个Expert (111B 参数/Expert)
Self-Attention层是55B的共享参数
Context Window,最初是8K,逐步精调至32K
模型容量/效果
模型参数量越大效果越好
相同激活参数量,M oE更好
训练/推理成本
成本低,., GLaM[1]训练成本相当于GPT-3的1/3,
推理成本相当于GPT-3的1/2,但效果超过GPT-3
终身学习
各类数据,知识和特征分布不同,容易出现知识干扰和
遗忘
D ense模型数据的配比挑战很大,配比小的数据很难表
现较好
大模型训练的挑战
显存需求大 算力规模大 网络通信量大
模型结
构
参数
规模
模型状态
显存需求
激活值显存
需求
(Bs=1,Seq=
4
k)
预估模型状
态存储最少
卡数
(A100-
40G)
Bert 1张
LLaMA 70B 1260G 5G 32张
GPT3 176B 3168G 80张
GPT4 1800B 32400G 810张
模型结构 参数规模 通信量(梯度) TP通信
BS=64/Seq
= 4K
BERT -
LLAMA 70B 140G
GPT3 176B 352G
GPT4 1800B 3600G
8
2 大模型训练框架A ngelP TM
ç
ç
çç
9
参数多计算量大大模型训练推理
面临双重挑战
万亿ç参数
Flops
GPU算力受限
产出混元万亿参数模型,训练性能是业界开源框架的倍,推理性能是业界倍高性能
单个训练任务突破万卡规模,达到9 9 % 线ç性加速比,并实现万卡长稳训练
G P U利用率M F U指标突破6 2 %,业界领先(字节55%),训练成本下降6 0 %,推理成本下降7 0 %
2023年中国电子学会科技进步
一等奖,腾讯首次
VLDB、SIGMOD、EMNLP3篇
国际顶会论文,VLDB最佳论文
12项发明专利,多篇媒体报道
训练产出混元
万亿MoE模型
400+业务精调,服务调用量亿
云上输出
云帆 文生图
框架协同多个Oteam
AI大模型基础
设施
业
务
应
用
影
响
力
A 1 0 0
H 1 0 0
H 200
A 8 0 0
H 8 0 0
H 2 0
突破低端卡限制,性能达到业界领先
ç
腾讯Angel机器学习平台
开源框架为高端G P U卡设计
大规模
低成本
AngelPTM大模型概述
AngelPTM大模型训练框架图
AngelPTM:ZeROCache存储优化技术提高模型容量90%
模型存储容量提升90%,同时,使得24G /40G低配G P U卡也可
训练大模型,突破了高端算力限制,目前已基于4 0 G显存低配
卡训练出腾讯混元千亿大模型、2 4 G低配卡实现模型精调;
G P U 显 存 与 系 统 内
存 统 一 编 址 , 统 一
视 角 管 理 , 扩 大 了
显 存 可 存 储 模 型 的
容量
基于定长内存C hunk段的内存管理,定长申
请复用,避免频繁申请释放
效果:1T内存+40G显存可训练60B模型;2T内存+80G显存最大可训练120B模型
AngelPTM:多维并行加速训练效率
1D并行 2D并行 3D并行
(数据并行) (数据并行+张量并行) (数据并行+张量并行+流水并行)
数据并行度:12 数据并行度:4 数据并行度:2
张量并行度:3 张量并行度:3
流水并行度:2
AllReduce
AllGather /
R educeS catter
Send / Recv
数据并行:提高数据吞吐
张量并行:引入通信,多卡分担显存压力
流水并行:流水线提高并行效率,P2P低通信量
w0,0 w0,1 w0,2 w0,3 w1,0 w1,1 w1,2 w1,3
w0 w1 w2 w3 w0 w1 w2 w3
+Allreduce
w0,0 w0,1 w1,2 w1,3
w 0 w 1 w 2 w 3 w 0 w 1 w 2 w 3
Allgather/ReduceScatter
Tensor + Sequence Parallel
序列并行:LayerN orm 和D ropout的计算和激活值
被平摊到各个设备,减少冗余计算和显存开销
AngelPTM:大规模之计算通信流水线与低精度量化技术
计算通信O verlap,多流异步解决机间通信效率
B F16通信量 FP8通信量
降低一倍
挑战:在多维并行策略中,需避免计算、通信操作串行,以及采用低精度更少字节数,进一步降低网络通信量
计算与通信异步流水线
FP8低精度量化通信
MOE:Expert并行+Expert TP+Expert DP实现万亿MOE模型的高效训练
• Router 选择
• Expert Choice
• Top-1,2
• M o E并行策略
• Expert Parallel +Data Parallel(EP+DP)
• 支持Dense部分采用Tensor Parallel +Sequence Parallel(TP+SP)
• 支持Expert部分采用Tensor Parallel +Sequence Parallel(TP+SP)
• 支持Pipeline Parallel(PP)
• M o E通信优化
• 通过Expert Sequence Parallel减少Expert Tensor Parallel 带来的冗余通信
• All2all通信计算overlap
AngelPTM:Context并行实现100M Context Window训练
精度无损,增加G P U卡量,
context windows理论上支持无
限大
固定G P U的情况下,如果要继续
增大context windows,需要降
低单卡的显存压力,可以通过激
活值offload优化显存
可增加卡的情况下,通信压力会
上升,可对通信计算overlap进行
优化
AngelPTM:Context并行实现100M Context Window训练
精度无损,context windows
长度受限于G P U卡数量,支持
窗口长度和Ring Attention一致。
针对decoder-only模型优化计
算负载不均衡。
AngelPTM:负载均衡的流水并行+特定重计算
FIRST S T A G E S T A G E 2 LAST S T A G ES T A G E 3 …
显存占用大 显存占用大
计算量大
FIRST S T A G E S T A G E 2 LAST S T A G ES T A G E 3 …
E M B E D D I N G S T A G E M O D E L
PARALLEL
Stage 均衡化划分+计算换显存
部分layer重计算
AngelPTM:整体训练性能是业界开源框架的倍
大模型训练效率对比
腾讯自研大模型
训练框架A ngelTP M
业界传统大模型
B enchm ark训练方案
天
40天
1
9
3 大模型超大规模集群训练优化和实践
大模型大规模训练挑战
训练性能能否线性扩展?实现大规模训练
性能的Scale law,即随着卡数增加训练性
能线性增加
大规模训练通信压力大有效带宽低、
带宽利用不均衡带宽利用率低
大模型训练BatchSize扩大是否有特定
的Scale law,即BatchSize的增大不影
响模型效果
大规模训练故障频繁,持续长时间稳定训
练如何保障?
GPU卡硬件故障导致训练中断
训练速度异常
训练卡顿
GPU卡精度异常
突破N L P 4 M BatchSize限制,持续提高算力利用率
大规模大BatchSize训练,平衡训练效率和模型效
果
简单的B atchSize增大会导致模型效果变
差
利用BatchSize和Lr的Scaling L a w突破大BatchSize影响模型效果的挑战,提
高大模型训练G P U利用率[1]
[1]
大规模训练通信优化: GPU通信拓扑感知,软硬件协同亲和性优化提高通信效率
G P U拓扑感知路由,全链路零丢包
负载均衡技术和通讯库优化,带宽利用率提升3倍
优选前通信路径
优选后通信路径
3D并行机制网络亲和性优化,TP以及D P走最优网络路径,P P通信次之,
保证通信效率,通信带宽达到有效带宽8 0 %
大规模训练网络通信挑战:
1. 网络通信随着卡数增加通信带宽衰减
2. 单个集群多个任务同时运行,每个任务分配G P U不全满足集群亲和性
3. 随着模型增大,通信量增加,通信耗时增加
大规模训练稳定性优化
360 全方位监控
自动续训机制保障任务快速恢复,减少中断耗时多团队保障提前预警故障,问题机器实时提出,快速恢复训练
大规模训练优化成果
万卡加速比99% ,线性扩展 任务稳定性%
支撑腾讯混元训练以及司内600+个业务的训练