GloVe: Global Vectors for Word Representation http://www.fanyeong.com/2018/02/19/glove-in-detail/
正如论文的标题而言,GloVe的全称叫Global Vectors for Word Representation,它是一个基于全局词频统计(count-based & overall statistics)的词表征(word representation)工具,它可以把一个单词表达成一个由实数组成的向量,这些向量捕捉到了单词之间一些语义特性,比如相似性(similarity)、类比性(analogy)等。我们通过对向量的运算,比如欧几里得距离或者cosine相似度,可以计算出两个单词之间的语义相似性。
GloVe的实现分为以下三步:

其中,$w_i^T$ 和 $\tilde {w_j}$ 是我们最终要求解的词向量;$b_i$ 和 $\tilde{b_j}$ 分别是两个词向量的bias term。
有了公式1之后我们就可以构造它的loss function了:这个loss function的基本形式就是最简单的mean square loss,只不过在此基础上加了一个权重函数 $f(X_{ij})$,那么这个函数起了什么作用,为什么要添加这个函数呢?我们知道在一个语料库中,肯定存在很多单词他们在一起出现的次数是很多的(frequent co-occurrences),那么我们希望:

这些单词的权重要大于那些很少在一起出现的单词(rare co-occurrences),所以这个函数要是非递减函数(non-decreasing);
但我们也不希望这个权重过大(overweighted),当到达一定程度之后应该不再增加;
如果两个单词没有在一起出现,也就是 ,那么他们应该不参与到 loss function 的计算当中去,也就是 要满足 f(0) = 0。满足以上两个条件的函数有很多,作者采用了如下形式的分段函数:这个函数图像如下所示:这篇论文中的所有实验,\alpha 的取值都是0.75,而 x_max 取值都是100。


虽然很多人声称GloVe是一种无监督(unsupervised learing)的学习方式(因为它确实不需要人工标注label),但其实它还是有label的,这个label就是公式2中的 $log(X_{ij})$,而公式2中的向量 $w$ 和 $\tilde{w}$ 就是要不断更新/学习的参数,所以本质上它的训练方式跟监督学习的训练方法没什么不一样,都是基于梯度下降的。具体地,这篇论文里的实验是这么做的:
采用了AdaGrad的梯度下降算法,对矩阵 X 中的所有非零元素进行随机采样,学习曲率(learning rate)设为0.05,在vector size小于300的情况下迭代了50次,其他大小的vectors上迭代了100次,直至收敛。最终学习得到的是两个vector是 $w$ 和$\tilde{w}$ ,因为是对称的(symmetric),所以从原理上讲 $w$ 和 $\tilde{w}$ 是也是对称的,他们唯一的区别是初始化的值不一样,而导致最终的值不一样。所以这两者其实是等价的,都可以当成最终的结果来使用。
但是为了提高鲁棒性,我们最终会选择两者之和 $w + \tilde{w}$ 作为最终的vector(两者的初始化不同相当于加了不同的随机噪声,所以能提高鲁棒性)。在训练了400亿个token组成的语料后,得到的实验结果如下图所示:

这个图一共采用了三个指标:语义准确度,语法准确度以及总体准确度。那么我们不难发现Vector Dimension在300时能达到最佳,而context Windows size大致在6到10之间。