CANN GroupNorm 使用指南:分组标准化一步讲清原理与用法
【免费下载链接】BabelDOCYet Another Document Translator项目地址: https://gitcode.com/GitHub_Trending/ba/BabelDOC
CANN GroupNorm 是昇腾 AI Core 提供的分组标准化算子:它沿通道维度把特征图分组做标准化,再做缩放和平移。本文用 3 分钟讲清它的适用场景、和其他 Norm 算子的差异、以及调用流程。
一、什么时候需要它(场景切入)
先给个画面:一桌 8 个通道的特征,装进 2 个杯子里,每杯 4 个通道,每个杯子各自归一——这就是 GroupNorm 在做的事。
落到实现上:对 shape 为 [N, C, H, W] 的输入,它把 C 维切分成 groupNum 组,组内各自做标准化,最后再按通道做 γ、β 仿射。
两类典型场景:
- batch 很小(检测、跟踪、少样本学习),BatchNorm 的统计量不稳。GroupNorm 的统计逐样本逐组计算,不依赖 batch 大小。
- 想要比 BatchNorm 更强的归一,但 LayerNorm 又太重。GroupNorm 给你两档之间可调的强度。
💡 groupNum = C 时它退化成 InstanceNorm,groupNum = 1 时退化成 LayerNorm。分组就是那个旋钮。
二、它和 BatchNorm / LayerNorm / InstanceNorm 到底差在哪
核心一句话:不同 Norm 的差异只在「均值和方差在哪些维度上计算」。
以输入 [N, C, H, W] 为例:
| 算子 | 统计范围 | 等价分组 |
|---|---|---|
| BatchNorm | 每通道在 [N, H, W] 上 | 每通道一组 |
| InstanceNorm | 每个 (N, C) 在 [H, W] 上 | 每通道独立,groupNum = C |
| GroupNorm | C 切组后,每组在 [H, W] 上 | C 切成 groupNum 组 |
| LayerNorm | 每个 N 在 [C, H, W] 上 | 全部通道一组,groupNum = 1 |
可以看到 GroupNorm 站在 BatchNorm 和 LayerNorm 之间:组数越多越像 BN,组数越少越像 LN。
三、计算过程(公式 + 走一遍例子)
标准化公式是通用的:
μ = (1/m)·Σxᵢ,σ² = (1/m)·Σ(xᵢ−μ)²,x̂ᵢ = (xᵢ−μ)/√(σ²+ε),yᵢ = γ·x̂ᵢ + β
其中 m 是组内元素个数,ε 是防除 0 的小常数,γ、β 是按通道可训练的参数(shape [C])。GroupNorm 独有的规则只有一条:把 [N, C, H, W] 的 C 维切 groupNum 组,μ、σ² 只在各自组内统计。
走一遍数字:设 N=1、C=2、H×W=2,groupNum=2(每组 1 通道),ε≈0:
- 组 1 通道 [1, 3]:μ=2,σ²=1 → 标准化为 [-1, 1]
- 组 2 通道 [2, 6]:μ=4,σ²=4 → 标准化为 [-1, 1]
再用 γ=[1.5, 2]、β=[0.5, -0.5] 做仿射,最终输出组 1 为 [-1.0, 2.0],组 2 为 [-2.5, 1.5]。注意标准化的值相同,输出却不同,因为 γ、β 是按通道生效的。
四、接口长什么样
主原型(内部自动申请临时空间):
template <typename T, bool isReuseSource = false> __aicore__ inline void GroupNorm(const LocalTensor<T>& output, const LocalTensor<T>& outputMean, const LocalTensor<T>& outputVariance, const LocalTensor<T>& inputX, const LocalTensor<T>& gamma, const LocalTensor<T>& beta, const T epsilon, GroupNormTiling& tiling)
还有一个重载多一个const LocalTensor<uint8_t>& sharedTmpBuffer参数:中间临时空间不再从栈自动分配,改由你传入,大小从 Tiling 文档获取。
参数逐个看:
output—— 标准化后做缩放、平移的结果,shape [N, C, H, W],输出。
outputMean / outputVariance—— 每组的均值和方差,shape 都是 [N, groupNum],输出,反传和调试时常用。
inputX—— 源特征,shape [N, C, H, W]。若开了 isReuseSource,它的内存会被改写,后面还要用原始数据的话要小心。
gamma / beta—— 缩放与平移参数,shape 都是 [C],建议取值范围 [-100, 100]。
sharedTmpBuffer—— 仅第二个重载有。存中间变量,按字节计的 tensor,大小见 Tiling 文档。
epsilon—— 防除 0 小常数,数据类型必须和 inputX/output 一致。
tiling—— 切分信息,用 shape、栈空间大小、groupNum 调 GetGroupNormNDTillingInfo 得到。
五、约束与注意事项
- 仅支持 ND 格式输入,NHWC 等其他格式不支持。
- Ascend 950PR/950DT、Atlas A3 训练/推理系列、Atlas A2 训练/推理系列均可用,数据类型支持 half 和 float。
- isReuseSource 复用 inputX 的内存以省空间,但只对 float 输入可开启,half 不支持。
- γ、β 取值范围 [-100, 100];epsilon 类型必须和 inputX/output 一致。
- 操作数地址要满足通用地址对齐约束。
⚠️ 易混点:γ、β 是按通道生效,均值方差是按组统计的——参数按通道,统计按组。
六、调用示例走读
一个最精简的调用模板:
template <typename T> __aicore__ inline void GroupNormDemo(GM_ADDR xGm, GM_ADDR gGm, GM_ADDR bGm, GM_ADDR yGm, uint32_t n, uint32_t c, uint32_t h, uint32_t w, uint32_t g) { T epsilon = 0.001f; uint32_t total = n * c * h * w; GlobalTensor<T> xGlobal, gGlobal, bGlobal, yGlobal; xGlobal.SetGlobalBuffer(reinterpret_cast<__gm__ T*>(xGm), total); gGlobal.SetGlobalBuffer(reinterpret_cast<__gm__ T*>(gGm), c); bGlobal.SetGlobalBuffer(reinterpret_cast<__gm__ T*>(bGm), c); yGlobal.SetGlobalBuffer(reinterpret_cast<__gm__ T*>(yGm), total); TPipe pipe; TQue<TPosition::VECIN, 1> xQue, gQue, bQue; TQue<TPosition::VECOUT, 1> yQue; TBuf<TPosition::VECCALC> meanBuf, varBuf; uint32_t hwAlign = (sizeof(T) * h * w + ONE_BLK_SIZE - 1) / ONE_BLK_SIZE * ONE_BLK_SIZE / sizeof(T); pipe.InitBuffer(xQue, 1, sizeof(T) * n * c * hwAlign); pipe.InitBuffer(gQue, 1, (sizeof(T) * c + 31) / 32 * 32); pipe.InitBuffer(bQue, 1, (sizeof(T) * c + 31) / 32 * 32); pipe.InitBuffer(yQue, 1, sizeof(T) * n * c * hwAlign); pipe.InitBuffer(meanBuf, (sizeof(T) * n * g + 31) / 32 * 32); pipe.InitBuffer(varBuf, (sizeof(T) * n * g + 31) / 32 * 32); LocalTensor<T> xLocal = xQue.AllocTensor<T>(); LocalTensor<T> gLocal = gQue.AllocTensor<T>(); LocalTensor<T> bLocal = bQue.AllocTensor<T>(); LocalTensor<T> yLocal = yQue.AllocTensor<T>(); LocalTensor<T> meanLocal = meanBuf.Get<T>(); LocalTensor<T> varLocal = varBuf.Get<T>(); DataCopyParams copyX{static_cast<uint16_t>(n * c), static_cast<uint16_t>(h * w * sizeof(T)), 0, 0}; DataCopyPadParams padX{true, 0, static_cast<uint8_t>(hwAlign - h * w), 0}; DataCopyPad(xLocal, xGlobal, copyX, padX); DataCopyParams copyG{1, static_cast<uint16_t>(c * sizeof(T)), 0, 0}; DataCopyPadParams padG{false, 0, 0, 0}; DataCopyPad(gLocal, gGlobal, copyG, padG); DataCopyPad(bLocal, bGlobal, copyG, padG); PipeBarrier<PIPE_ALL>(); uint32_t stackSize = 0; { LocalTensor<float> stack; PopStackBuffer<float, TPosition::LCM>(stack); stackSize = stack.GetSize(); } GroupNormTiling tiling; uint32_t shape[4] = {n, c, h, w}; ShapeInfo shapeInfo{(uint8_t)4, shape, (uint8_t)4, shape, DataFormat::ND}; GetGroupNormNDTillingInfo(shapeInfo, stackSize, sizeof(T), false, g, tiling); GroupNorm<T>(yLocal, meanLocal, varLocal, xLocal, gLocal, bLocal, epsilon, tiling); PipeBarrier<PIPE_ALL>(); DataCopyPad(yGlobal, yLocal, copyX); xQue.FreeTensor(xLocal); gQue.FreeTensor(gLocal); bQue.FreeTensor(bLocal); yQue.FreeTensor(yLocal); }逐段走读:
- 用 TPipe 申请输入/输出队列和均值、方差缓冲;注意给 inputX 分配空间时,H×W 要按块大小对齐补 pad。
- DataCopyPad 把 x、gamma、beta 拷进 VECIN 队列,行末补齐量就是 pad 到 hwAlign 的差。
- PopStackBuffer 查栈空间大小,再用 GetGroupNormNDTillingInfo 按 shape、栈大小、groupNum 生成 tiling。
- GroupNorm 一次完成标准化加仿射,均值、方差结果写进你传入的两个缓冲。
- 结果拷回 GM、释放 tensor,PipeBarrier 分段隔离各阶段。
七、相关文档
- GroupNorm Tiling 文档:算 sharedTmpBuffer 大小、填 tiling 信息的方法。
- LocalTensor 文档:VECIN/VECCALC/VECOUT 三种 tensor 位置与队列、缓冲的用法。
- 通用说明和约束:地址对齐、数据格式等通用约束。
【免费下载链接】BabelDOCYet Another Document Translator项目地址: https://gitcode.com/GitHub_Trending/ba/BabelDOC
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考