#AI

2

混合精度训练

  • bf16:参数、激活值和梯度
  • fp32:优化器状态

3 架构

400 右图是现在用的pre-norm,把LN移出残差流(主干道)

400 RMSNorm去掉了均值和偏置,仅仅是缩放

去掉偏置以减少内存受限情景

激活

是维度,是维度

大约每层宽100

4

训练时

推理时

Nemotron 3

Qwen 3.5

routing

少数共享专家

负载平衡损失:和都将收敛到

5

burst:按物理内存地址连续读取

这里是把1个矩阵分为4个tile,比如以为左上角的tile,以为左上角的tile

flash attention

online softmax

6

200 数据并行

200 张量并行

7

naive DP

  • 传输数据量只计算发送或接受的单向数据量,因为硬件是全双工的
  • 传输2x参数量 = 发送本地的梯度+接受全局汇总后的梯度,梯度和参数的矩阵形状相同

16bytes/param

ZeRO

步骤2传输梯度,步骤4传输权重

FSDP, Fully Sharded Data Parallel 两行表示两个GPU

通信和计算重叠

PP: Pipeline Parallel

的是流水线阶段stage、是微批次编号micro,是微批次数

TP: Tensor Parallel

EP: Expert Parallel

CP: Context Parallel

Q块留本地,KV块做环传,边传边算Attention,算完直接接本地FFN。

图中的MP特指TP

9

基于扩展定律的过程: 训练一堆较小的模型,将这些线拟合到log-log图来建立某种扩展定律。如果拟合得足够好,有信心这个差距会持续,就将它部署到大规模训练运行。

Chinchilla

10 推理

ref

推测性采样

  • 以q/p概率接受:重要性采样比率,目标/草稿
  • 以q-p概率重采

PagedAttention

11

WSD学习率调度: Warmup (1%-5%),Stable,Decay (10%-20%)

muP: Maximal Update Parameterization

14

去重高度相似内容

minHash

LSH:局部敏感哈希

通过分band构造出S型曲线

sim为

400 S型曲线

15

RLHF

胜者, 败者, sigma函数

16

RLVR

对一个prompt采样多个回答,将这些回答的组内z-score作为优势函数

Dr.GRPO是修复版GRPO

17 多模态

编码图像

CLIP

600 600

SigLIP