news 2026/9/19 2:48:17

CANN GroupNorm 使用指南:分组标准化一步讲清原理与用法

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
CANN GroupNorm 使用指南:分组标准化一步讲清原理与用法

CANN GroupNorm 使用指南:分组标准化一步讲清原理与用法

【免费下载链接】BabelDOCYet Another Document Translator项目地址: https://gitcode.com/GitHub_Trending/ba/BabelDOC

CANN GroupNorm 是昇腾 AI Core 提供的分组标准化算子:它沿通道维度把特征图分组做标准化,再做缩放和平移。本文用 3 分钟讲清它的适用场景、和其他 Norm 算子的差异、以及调用流程。

一、什么时候需要它(场景切入)

先给个画面:一桌 8 个通道的特征,装进 2 个杯子里,每杯 4 个通道,每个杯子各自归一——这就是 GroupNorm 在做的事。

落到实现上:对 shape 为 [N, C, H, W] 的输入,它把 C 维切分成 groupNum 组,组内各自做标准化,最后再按通道做 γ、β 仿射。

两类典型场景:

  • batch 很小(检测、跟踪、少样本学习),BatchNorm 的统计量不稳。GroupNorm 的统计逐样本逐组计算,不依赖 batch 大小。
  • 想要比 BatchNorm 更强的归一,但 LayerNorm 又太重。GroupNorm 给你两档之间可调的强度。

💡 groupNum = C 时它退化成 InstanceNorm,groupNum = 1 时退化成 LayerNorm。分组就是那个旋钮。

二、它和 BatchNorm / LayerNorm / InstanceNorm 到底差在哪

核心一句话:不同 Norm 的差异只在「均值和方差在哪些维度上计算」。

以输入 [N, C, H, W] 为例:

算子统计范围等价分组
BatchNorm每通道在 [N, H, W] 上每通道一组
InstanceNorm每个 (N, C) 在 [H, W] 上每通道独立,groupNum = C
GroupNormC 切组后,每组在 [H, W] 上C 切成 groupNum 组
LayerNorm每个 N 在 [C, H, W] 上全部通道一组,groupNum = 1

可以看到 GroupNorm 站在 BatchNorm 和 LayerNorm 之间:组数越多越像 BN,组数越少越像 LN。

三、计算过程(公式 + 走一遍例子)

标准化公式是通用的:

μ = (1/m)·Σxᵢ,σ² = (1/m)·Σ(xᵢ−μ)²,x̂ᵢ = (xᵢ−μ)/√(σ²+ε),yᵢ = γ·x̂ᵢ + β

其中 m 是组内元素个数,ε 是防除 0 的小常数,γ、β 是按通道可训练的参数(shape [C])。GroupNorm 独有的规则只有一条:把 [N, C, H, W] 的 C 维切 groupNum 组,μ、σ² 只在各自组内统计。

走一遍数字:设 N=1、C=2、H×W=2,groupNum=2(每组 1 通道),ε≈0:

  • 组 1 通道 [1, 3]:μ=2,σ²=1 → 标准化为 [-1, 1]
  • 组 2 通道 [2, 6]:μ=4,σ²=4 → 标准化为 [-1, 1]

再用 γ=[1.5, 2]、β=[0.5, -0.5] 做仿射,最终输出组 1 为 [-1.0, 2.0],组 2 为 [-2.5, 1.5]。注意标准化的值相同,输出却不同,因为 γ、β 是按通道生效的。

四、接口长什么样

主原型(内部自动申请临时空间):

template <typename T, bool isReuseSource = false> __aicore__ inline void GroupNorm(const LocalTensor<T>& output, const LocalTensor<T>& outputMean, const LocalTensor<T>& outputVariance, const LocalTensor<T>& inputX, const LocalTensor<T>& gamma, const LocalTensor<T>& beta, const T epsilon, GroupNormTiling& tiling)

还有一个重载多一个const LocalTensor<uint8_t>& sharedTmpBuffer参数:中间临时空间不再从栈自动分配,改由你传入,大小从 Tiling 文档获取。

参数逐个看:

output—— 标准化后做缩放、平移的结果,shape [N, C, H, W],输出。

outputMean / outputVariance—— 每组的均值和方差,shape 都是 [N, groupNum],输出,反传和调试时常用。

inputX—— 源特征,shape [N, C, H, W]。若开了 isReuseSource,它的内存会被改写,后面还要用原始数据的话要小心。

gamma / beta—— 缩放与平移参数,shape 都是 [C],建议取值范围 [-100, 100]。

sharedTmpBuffer—— 仅第二个重载有。存中间变量,按字节计的 tensor,大小见 Tiling 文档。

epsilon—— 防除 0 小常数,数据类型必须和 inputX/output 一致。

tiling—— 切分信息,用 shape、栈空间大小、groupNum 调 GetGroupNormNDTillingInfo 得到。

五、约束与注意事项

  • 仅支持 ND 格式输入,NHWC 等其他格式不支持。
  • Ascend 950PR/950DT、Atlas A3 训练/推理系列、Atlas A2 训练/推理系列均可用,数据类型支持 half 和 float。
  • isReuseSource 复用 inputX 的内存以省空间,但只对 float 输入可开启,half 不支持。
  • γ、β 取值范围 [-100, 100];epsilon 类型必须和 inputX/output 一致。
  • 操作数地址要满足通用地址对齐约束。

⚠️ 易混点:γ、β 是按通道生效,均值方差是按组统计的——参数按通道,统计按组。

六、调用示例走读

一个最精简的调用模板:

template <typename T> __aicore__ inline void GroupNormDemo(GM_ADDR xGm, GM_ADDR gGm, GM_ADDR bGm, GM_ADDR yGm, uint32_t n, uint32_t c, uint32_t h, uint32_t w, uint32_t g) { T epsilon = 0.001f; uint32_t total = n * c * h * w; GlobalTensor<T> xGlobal, gGlobal, bGlobal, yGlobal; xGlobal.SetGlobalBuffer(reinterpret_cast<__gm__ T*>(xGm), total); gGlobal.SetGlobalBuffer(reinterpret_cast<__gm__ T*>(gGm), c); bGlobal.SetGlobalBuffer(reinterpret_cast<__gm__ T*>(bGm), c); yGlobal.SetGlobalBuffer(reinterpret_cast<__gm__ T*>(yGm), total); TPipe pipe; TQue<TPosition::VECIN, 1> xQue, gQue, bQue; TQue<TPosition::VECOUT, 1> yQue; TBuf<TPosition::VECCALC> meanBuf, varBuf; uint32_t hwAlign = (sizeof(T) * h * w + ONE_BLK_SIZE - 1) / ONE_BLK_SIZE * ONE_BLK_SIZE / sizeof(T); pipe.InitBuffer(xQue, 1, sizeof(T) * n * c * hwAlign); pipe.InitBuffer(gQue, 1, (sizeof(T) * c + 31) / 32 * 32); pipe.InitBuffer(bQue, 1, (sizeof(T) * c + 31) / 32 * 32); pipe.InitBuffer(yQue, 1, sizeof(T) * n * c * hwAlign); pipe.InitBuffer(meanBuf, (sizeof(T) * n * g + 31) / 32 * 32); pipe.InitBuffer(varBuf, (sizeof(T) * n * g + 31) / 32 * 32); LocalTensor<T> xLocal = xQue.AllocTensor<T>(); LocalTensor<T> gLocal = gQue.AllocTensor<T>(); LocalTensor<T> bLocal = bQue.AllocTensor<T>(); LocalTensor<T> yLocal = yQue.AllocTensor<T>(); LocalTensor<T> meanLocal = meanBuf.Get<T>(); LocalTensor<T> varLocal = varBuf.Get<T>(); DataCopyParams copyX{static_cast<uint16_t>(n * c), static_cast<uint16_t>(h * w * sizeof(T)), 0, 0}; DataCopyPadParams padX{true, 0, static_cast<uint8_t>(hwAlign - h * w), 0}; DataCopyPad(xLocal, xGlobal, copyX, padX); DataCopyParams copyG{1, static_cast<uint16_t>(c * sizeof(T)), 0, 0}; DataCopyPadParams padG{false, 0, 0, 0}; DataCopyPad(gLocal, gGlobal, copyG, padG); DataCopyPad(bLocal, bGlobal, copyG, padG); PipeBarrier<PIPE_ALL>(); uint32_t stackSize = 0; { LocalTensor<float> stack; PopStackBuffer<float, TPosition::LCM>(stack); stackSize = stack.GetSize(); } GroupNormTiling tiling; uint32_t shape[4] = {n, c, h, w}; ShapeInfo shapeInfo{(uint8_t)4, shape, (uint8_t)4, shape, DataFormat::ND}; GetGroupNormNDTillingInfo(shapeInfo, stackSize, sizeof(T), false, g, tiling); GroupNorm<T>(yLocal, meanLocal, varLocal, xLocal, gLocal, bLocal, epsilon, tiling); PipeBarrier<PIPE_ALL>(); DataCopyPad(yGlobal, yLocal, copyX); xQue.FreeTensor(xLocal); gQue.FreeTensor(gLocal); bQue.FreeTensor(bLocal); yQue.FreeTensor(yLocal); }

逐段走读:

  1. 用 TPipe 申请输入/输出队列和均值、方差缓冲;注意给 inputX 分配空间时,H×W 要按块大小对齐补 pad。
  2. DataCopyPad 把 x、gamma、beta 拷进 VECIN 队列,行末补齐量就是 pad 到 hwAlign 的差。
  3. PopStackBuffer 查栈空间大小,再用 GetGroupNormNDTillingInfo 按 shape、栈大小、groupNum 生成 tiling。
  4. GroupNorm 一次完成标准化加仿射,均值、方差结果写进你传入的两个缓冲。
  5. 结果拷回 GM、释放 tensor,PipeBarrier 分段隔离各阶段。

七、相关文档

  • GroupNorm Tiling 文档:算 sharedTmpBuffer 大小、填 tiling 信息的方法。
  • LocalTensor 文档:VECIN/VECCALC/VECOUT 三种 tensor 位置与队列、缓冲的用法。
  • 通用说明和约束:地址对齐、数据格式等通用约束。

【免费下载链接】BabelDOCYet Another Document Translator项目地址: https://gitcode.com/GitHub_Trending/ba/BabelDOC

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/19 2:47:39

灰狼优化算法结合GRU:时序预测超参数自动搜索实战

做时间序列预测的人&#xff0c;应该都有过这种体验&#xff1a;明明GRU模型结构不复杂&#xff0c;可换一组数据、改一个窗口长度&#xff0c;效果就天差地别。更气人的是&#xff0c;GRU的超参数之间并不是独立起作用的&#xff0c;学习率、隐藏层节点数、层数、时间步长、正…

作者头像 李华
网站建设 2026/9/19 2:45:42

基于二手分析仪器改造的PMT荧光检测电路设计与信号链路实现

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华
网站建设 2026/9/19 2:43:42

AI写作工具的正确用法:从代写到教练,掌握写作方法论

写作这行当&#xff0c;说穿了就两条路&#xff1a;要么替人写&#xff0c;要么教人写。替人写是体力活&#xff0c;写一篇没一篇&#xff0c;读者拿走了鱼&#xff0c;下次饿了还得来找你&#xff1b;教人写是手艺活&#xff0c;把拆解、构思、打磨的门道交到对方手里&#xf…

作者头像 李华
网站建设 2026/9/19 2:43:28

FusionCompute从零到生产:CNA/VRM部署与网络存储避坑指南

第一次接触FusionCompute的人&#xff0c;十有八九会把它当成普通虚拟机软件&#xff1a;下载ISO、装完、开虚拟机、完事。真到了生产环境&#xff0c;你会发现面对的是三台及以上物理服务器、一台共享存储和一套完整网络设备&#xff0c;任何一个环节没规划好&#xff0c;后面…

作者头像 李华