Masked Language Modeling

Task di pre-training dove token random sono masked e il modello li predice dal contesto.

In English: Masked Language Modeling

15% token masked: 80% [MASK], 10% random, 10% invariati. Obiettivo pre-training di BERT. Permette contesto bidirezionale.

Esempi

  • Pre-training BERT
  • Cloze task
  • Comprensione linguaggio bidirezionale