Mean, Var and Typical Scale
1 min
标准差衡量了一个变量的典型大小(数量级)
Transformer 中,在计算 Attention 时,对于 除了一个 ,这是为了将点积结果的典型大小拉回 ,避免 softmax 的梯度消失问题。
这个 就是每个向量的标准差。不过你有没有想过为什么是除以 ?而不是 ?
因为 是方差,如果我们设一个随机变量的均值为 0,那么可以求出 ,可以看到,方差和样本平方值的大小相关,所以我们需要标准差而不是方差。
本质上,这个问题和随机游走以及中心极限定理是相同的。
在人类如此复杂的作品中,概率论就这么默默的参与其中,一个小小的 联系起了 Transformer 与随机游走,这种感觉还是很奇妙的。