指数移动平均(EMA)以指数递减的权重平滑时间序列,只需一个状态变量,是动量、Adam 矩估计、Model EMA 共用的数学内核。

定义与展开

历史保留比例 ,新样本注入比例 。反复展开得到显式求和:

步之前的样本,贡献被乘上 ——离得越远,权重指数式缩小,且全部历史权重和为 1。名字里的 “Exponential” 指的就是这个权重核:越老的记忆按指数遗忘,而不是像简单移动平均那样在窗口边界一刀切掉。

有效窗口与时间常数

衰减到 约需 步:

有效平均窗口(步)
0.9~10
0.99~100
0.999~1000
0.9999~10000

等于选”平均多远的历史”;衰减 所需的步数即时间常数 步。 时的直觉可以靠几个锚点建立:100 步前的扰动几乎全保留(),6931 步前恰好衰减一半,10000 步前剩 ,50000 步前只剩 ,基本遗忘。

滤波器视角

把递推式看成线性时不变系统,上一节的指数权重核换上信号系统的名字就是脉冲响应 ,传递函数

唯一极点 落在单位圆内,系统稳定;脉冲响应无限长——EMA 是 IIR,SMA 的矩形窗是它的 FIR 对照。权重和为 1 即直流增益 :常数输入原样通过,平滑不改变信号的静态水平。

频响幅度

低频增益为 1, 处压到 ,中间单调滚降——标准低通滤波器。-3dB 截止频率

对应截止周期约 。以 为例:周期上万步的慢漂移基本通过,周期几百步的震荡只剩约十分之一,相邻步的高频抖动几乎全灭。

三个频域指标都有闭式解, 一个旋钮同时拧动:

指标闭式
截止周期≈ 63000 步
白噪声方差压缩比(标准差 ×1/141)
直流群延迟≈ 10000 步

方差压缩等价于平均 个独立样本;群延迟与”有效窗口”同量级——滞后约一个窗口。大 由此显出两面:降噪狠,但对真实变化的响应同样慢,动量”惯性大、转弯慢”、Model EMA 影子权重落后训练进度,都是这同一件事。还有一个精确的对齐:与降噪能力相同的 SMA(窗口 )相比,EMA 的直流滞后恰为 ,与 SMA 打平——不赢在频域指标,赢在 状态与无窗口截断。

零初始化 在滤波器语言里是起始暂态:阶跃响应从 0 爬向稳态值,爬升系数正是 ——下一节的偏差修正消的就是它。

连续时间对应物是 RC 一阶低通 ,步长 1 的欧拉离散化恰好回到 EMA 递推,“时间常数”这个词就是从电路借来的。优化里的用法至此一句话说清:mini-batch 梯度是低频信号叠高频采样噪声,动量与 Adam 的矩估计、Model EMA 的影子权重,都是同一只一阶低通,区别只在接在梯度上还是权重上。

偏差修正

初始 会把训练初期的估计往零拖:设输入恒为 ,归纳可得

时第一步 ,低估两个数量级。除掉系数即可还原真实量级:

,修正自动失效——它只影响前几十步。Adam 的 正是这一修正。

与简单移动平均对比

特性SMAEMA
状态量需存窗口内 N 个值1 个值
权重窗口内等权 ,窗口外截断为 0(矩形窗)全部历史保留,按 指数衰减(指数窗),无硬截断
频域形状sinc 频响,旁瓣泄漏一阶低通,单调滚降无旁瓣
对突变响应窗口内无差别新样本立即生效

存储 是 EMA 在优化器中胜出的工程原因:Adam 每个参数只需额外维护 两个状态。

在优化器与时间序列中

优化器里 EMA 出现在三个位置:动量法 的速度 是梯度的 EMA, 等价于对最近约 10 步梯度加权平均;Adam 的一阶矩 (方向)与二阶矩 (尺度)分别是梯度、梯度平方的 EMA,见Adam算法全解:从数学原理到工业界最佳实践;偏差修正负责冷启动。时间序列与监控是另一个主场:金融 EMA 均线做低通,MACD 用长短两条 EMA 之差拼出带通,服务指标平滑同款递推换参数。

Model EMA:对权重本身做平滑

把 EMA 的对象从梯度换成模型权重:训练全程额外维护一份影子权重,每步凸组合递推、不建图不反传;训练指标看 raw 权重,交付采样用影子权重。思想上这是 Polyak averaging 的指数折扣版,频域上就是给权重轨迹接一只一阶低通。GLM4V 的具体配置、ckpt 判别方法与最小实现见Model EMA

相关