语义类比任务依赖的核心性质:向量空间的线性结构
词嵌入能完成king - man + woman ≈ queen这类类比任务,依赖的是词向量空间中存在的线性平移不变性(linear translation invariance),具体表现为以下几个层面:
1. 向量差编码语义关系
两个词的向量差v(king) - v(man)编码了"男性→君主"这一语义变换方向。如果这个方向在向量空间中具有一致性,那么将其施加到另一个起点woman上:
v(king) - v(man) + v(woman) ≈ v(queen)等价于:
v(king) - v(man) ≈ v(queen) - v(woman)即"男性君主与普通男性"的关系 ≈ "女性君主与普通女性"的关系。
这要求向量空间中,同类语义关系对应近似相同的位移向量。
2. 分布式假设是前提
词嵌入的线性结构并非人为设计,而是从语料中自然涌现的。其理论基础是分布式假设:
“You shall know a word by the company it keeps.” (Firth, 1957)
语义相近的词出现在相似的上下文中 → 训练后向量相近 → 语义关系(如性别、时态、地理)在上下文分布中呈现规律性模式 → 向量空间中表现为平行位移。
3. 线性结构的三个具体表现
| 性质 | 含义 | 类比示例 |
|---|---|---|
| 方向一致性 | 同类关系对应近似平行的向量差 | Paris - France ≈ Tokyo - Japan(首都方向) |
| 可加性 | 语义关系可叠加 | king - man(性别)+woman(新起点)= 目标词 |
| 平移不变性 | 位移向量不依赖具体起点 | walked - walk ≈ swam - swim(过去时方向,与具体动词无关) |
4. 为什么线性结构会涌现?
以 GloVe 为例,其目标函数直接拟合共现矩阵的对数:
w_i · w_k ≈ log X_ik向量内积w_i · w_k编码了共现强度。当两个词对(i, k)和(j, l)的共现模式相似时:
w_i · w_k ≈ w_j · w_l → w_i - w_j ≈ w_l - w_k (向量差近似相等)这就自然产生了线性结构。Word2Vec 虽然目标函数不同,但通过预测上下文,同样隐式地编码了共现统计,因此也涌现出类似的线性性质。
5. 线性结构的局限性
线性类比并非完美成立,存在以下限制:
- 仅对部分关系有效:性别、首都、时态等结构化关系效果较好;情感、因果等复杂关系往往不满足线性假设
- 依赖训练质量:语料规模不足或训练不充分时,线性结构不明显
- 方向并非严格平行:实际是近似平行,类比准确率通常在 50%-90% 之间,远非 100%
- 高维空间中的巧合:部分类比成功可能是高维空间中向量运算的统计巧合,而非真正的语义理解
总结
语义类比任务依赖词向量空间的线性平移不变性:相同语义关系对应近似相同的向量位移。这一性质不是人为注入的,而是从语料的共现统计中自然涌现的——分布式假设保证了语义相近的词上下文相似,而上下文分布的规律性使得语义关系在向量空间中呈现为可叠加、可平移的线性结构。