BERT 为什么要随机掩盖 15% 的 token 并拆分为 80%/10%/10% 三种处理?

📅 发布时间:2026/8/9 3:15:00
BERT 为什么要随机掩盖 15% 的 token 并拆分为 80%/10%/10% 三种处理?
BERT 的 15% 掩盖策略与 80/10/10 拆分设计动机详解一、整体策略回顾BERT 在预训练时对输入序列随机选择15%的 token 位置进行掩盖然后对这 15% 的位置做如下拆分处理被选中的 15% token ├── 80% → 替换为 [MASK] ├── 10% → 替换为一个随机 token └── 10% → 保持原 token 不变这个看似复杂的策略并非随意设计每一部分都解决了特定的训练问题。二、为什么是 15%平衡训练信号与上下文质量掩盖比例问题太低如 5%训练信号太少模型从每条样本中学到的信息不足预训练效率低太高如 50%上下文被严重破坏模型难以推断被遮盖的词且输入与真实文本差异过大15%经验性平衡点足够多的预测目标同时保留足够的上下文信息15% 是 BERT 原论文通过实验确定的经验值并非理论最优。后续研究如 RoBERTa、SpanBERT也探索了动态掩盖、连续 span 掩盖等改进但 15% 作为基线比例被广泛沿用。三、80/10/10 拆分的逐项解析1. 80% 替换为[MASK]— 主力训练信号输入: The man went to the [MASK] to buy coffee 目标: 预测 [MASK] → store作用这是 MLM 的核心任务——根据双向上下文预测被遮盖的词迫使模型学习语言的深层表示。为什么不是 100%关键问题在于预训练与微调的不一致预训练阶段: The man went to the [MASK] to buy coffee ← 含 [MASK] 微调阶段: The man went to the store to buy coffee ← 不含 [MASK]如果 100% 都用[MASK]模型会过度依赖[MASK]这个特殊标记的存在。而下游任务分类、NER、QA 等的输入中永远不会出现[MASK]导致预训练学到的表示在微调时存在分布偏移。2. 10% 替换为随机 token — 强迫模型保持怀疑输入: The man went to the pineapple to buy coffee 目标: 预测 pineapple 位置 → store作用模型不能盲目信任输入中的每个词必须学会判断这个词可能是错的并利用上下文来纠正。解决的问题如果只有[MASK]和保持原词两种情况模型可能学到一种捷径看到[MASK]就认真预测看到正常词就直接复制。引入随机词后模型无法确定哪些位置被篡改过因此必须对所有位置都建立高质量的上下文表示而不能偷懒。模型心理活动: 这个位置是 pineapple但上下文是 went to the ___ to buy coffee 语义上不合理应该是 store。 → 学会了基于上下文的语义判断而非机械信任输入3. 10% 保持原词不变 — 学习自我校准表示输入: The man went to the store to buy coffee 目标: 预测 store 位置 → store即原词本身作用让模型对未被修改的真实 token也产生预测梯度学习这个位置的信息是正确的的表示。解决的问题如果被选中的 15% 位置要么变成[MASK]、要么变成随机词模型会形成一种偏见被选中的位置总是有问题的。保留 10% 原词让模型也处理这个位置其实是对的的情况使表示更加均衡。四、三者协同的整体效果┌─────────────────────────────────────────────────────────────┐ │ 15% 被选中的位置 │ │ │ │ 80% [MASK] → 上下文推理能力核心任务 │ │ 10% 随机词 → 输入不可全信的鲁棒性 │ │ 10% 原词保留 → 输入也可能正确的校准能力 │ │ │ │ 协同效果: 模型对每个位置都建立高质量的、不依赖特殊标记的 │ │ 上下文表示 → 缩小预训练与微调的分布差距 │ └─────────────────────────────────────────────────────────────┘设计选择解决的问题如果不做会怎样80%[MASK]提供主要的完形填空训练信号—10% 随机词防止模型只对[MASK]认真对其他词偷懒模型在非[MASK]位置表示质量下降10% 原词让模型也学习正确输入的表示模型对被选中位置产生总是有问题的偏见整体 80/10/10缩小预训练含噪声与微调无噪声的分布差距微调性能下降迁移效果变差五、一句话总结80% 的[MASK]提供核心训练信号10% 的随机词迫使模型不盲信输入10% 的原词保留让模型也学习正确表示——三者共同作用让 BERT 对每个位置都生成不依赖[MASK]标记的高质量双向上下文表示从而缩小预训练与微调之间的分布差距。这一设计体现了 BERT 论文对预训练-微调一致性的深刻思考也是其能在下游任务上取得优异迁移效果的重要细节之一。