词嵌入中“语义类比“任务(如 king - man + woman ≈ queen)依赖的是什么性质?
语义类比任务依赖的核心性质向量空间的线性结构词嵌入能完成king - man woman ≈ queen这类类比任务依赖的是词向量空间中存在的线性平移不变性linear translation invariance具体表现为以下几个层面1. 向量差编码语义关系两个词的向量差v(king) - v(man)编码了男性→君主这一语义变换方向。如果这个方向在向量空间中具有一致性那么将其施加到另一个起点woman上v(king) - v(man) v(woman) ≈ v(queen)等价于v(king) - v(man) ≈ v(queen) - v(woman)即男性君主与普通男性的关系 ≈ 女性君主与普通女性的关系。这要求向量空间中同类语义关系对应近似相同的位移向量。2. 分布式假设是前提词嵌入的线性结构并非人为设计而是从语料中自然涌现的。其理论基础是分布式假设“You shall know a word by the company it keeps.” (Firth, 1957)语义相近的词出现在相似的上下文中 → 训练后向量相近 → 语义关系如性别、时态、地理在上下文分布中呈现规律性模式 → 向量空间中表现为平行位移。3. 线性结构的三个具体表现性质含义类比示例方向一致性同类关系对应近似平行的向量差Paris - France ≈ Tokyo - Japan首都方向可加性语义关系可叠加king - man性别woman新起点 目标词平移不变性位移向量不依赖具体起点walked - walk ≈ swam - swim过去时方向与具体动词无关4. 为什么线性结构会涌现以 GloVe 为例其目标函数直接拟合共现矩阵的对数w_i · w_k ≈ log X_ik向量内积w_i · w_k编码了共现强度。当两个词对(i, k)和(j, l)的共现模式相似时w_i · w_k ≈ w_j · w_l → w_i - w_j ≈ w_l - w_k 向量差近似相等这就自然产生了线性结构。Word2Vec 虽然目标函数不同但通过预测上下文同样隐式地编码了共现统计因此也涌现出类似的线性性质。5. 线性结构的局限性线性类比并非完美成立存在以下限制仅对部分关系有效性别、首都、时态等结构化关系效果较好情感、因果等复杂关系往往不满足线性假设依赖训练质量语料规模不足或训练不充分时线性结构不明显方向并非严格平行实际是近似平行类比准确率通常在 50%-90% 之间远非 100%高维空间中的巧合部分类比成功可能是高维空间中向量运算的统计巧合而非真正的语义理解总结语义类比任务依赖词向量空间的线性平移不变性相同语义关系对应近似相同的向量位移。这一性质不是人为注入的而是从语料的共现统计中自然涌现的——分布式假设保证了语义相近的词上下文相似而上下文分布的规律性使得语义关系在向量空间中呈现为可叠加、可平移的线性结构。